Younggyo Seo
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RPL: 複雑地形におけるロバストな人型知覚移動の学習歩行2026/2/1
2段階の学習フレームワークにより、複数の深度カメラを用いて複雑な地形を多方向に歩行し、荷物を積んでもロバストな人型ロボットの移動を実現した。
- 15分でヒューマノイドのsim-to-real歩行を学習sim2real2025/12/1
オフポリシーRL(FastSAC/FastTD3)と大規模並列環境を組み合わせ、Unitree G1やBooster T1の歩行制御を単一GPUで15分で学習し実機転移を実現した。
- 視覚言語行動モデルのための対照表現正則化VLA2025/10/1
VLAモデルの表現をロボットの固有感覚状態と対照学習で整合させ、実機マニピュレーションの成功率を向上させた研究。
- HAMLET: 視覚言語行動モデルを履歴認識ポリシーに切り替えるVLA2025/10/1
各時刻の知覚情報を圧縮したモーメントトークンと軽量メモリモジュールで過去の文脈を統合し、VLAモデルを履歴依存タスクに適応させるフレームワークを提案。
- ContextVLA:マルチフレーム文脈を効率的に活用する視覚-言語-行動モデルVLA2025/10/1
過去の観測を1つの文脈トークンに圧縮することで、計算コストを抑えつつマルチフレームの時間的文脈を活用してロボットタスクの成功率を高めるVLAモデルを提案。
- DEAS: 行動系列を用いた分離価値学習によるスケーラブルなオフライン強化学習オフライン強化学習2025/10/1
行動系列を価値学習に活用し、価値の過大評価を分離学習で抑えることで、長期的タスクのオフライン強化学習や大規模VLAモデルの性能を向上させる手法を提案。
- Robot-R1: ロボティクスにおける身体性推論を強化する強化学習VLA2025/6/1
強化学習を用いてロボット制御のための身体性推論を改善するフレームワークを提案し、SFTを上回る性能を達成した。
- FastTD3:ヒューマノイド制御のためのシンプルで高速かつ高性能な強化学習歩行2025/5/1
並列シミュレーションや大バッチ更新、分布型クリティックなどの改良を加えたTD3エージェントにより、ヒューマノイドロボットの強化学習を単一GPUで3時間未満に高速化した手法を提案。
- 行動系列を用いた粗から細へのQネットワークによるデータ効率的強化学習強化学習2024/11/1
行動系列を入力としてQ値を予測するクリティックを学習する強化学習手法CQN-ASを提案し、疎な報酬のヒューマノイド制御や卓上操作タスクでデータ効率と性能を向上させた。
- BiGym: デモ駆動型モバイル双腕マニピュレーションのベンチマークマニピュレーション2024/7/1
家庭環境での40種類のモバイル双腕ロボット操作タスクを集めたベンチマークと学習環境を構築し、人間のデモやRGB・深度などの観測を提供して模倣学習・強化学習手法を評価した。
- 粗から細への強化学習による連続制御マニピュレーション2024/7/1
連続行動空間を段階的に離散化してQ値を最大化する区間を選ぶことで、安定かつサンプル効率の良い価値ベース強化学習を実現し、ロボットマニピュレーションタスクで有効性を示した。
- 確率的フレーム予測による視覚表現学習表現学習2024/6/1
将来フレーム予測の不確実性を確率的にモデル化し、マスク画像モデリングと組み合わせて動画やロボット学習に有効な視覚表現を学習する手法を提案した。
- 描画して拡散:拡散ベースの行動クローニングのための画像空間と行動空間の整合模倣学習2024/5/1
ロボットの3Dモデルを仮想描画することで、RGB画像と低レベル行動を画像空間上で統合し、拡散プロセスで行動を生成する手法を提案。サンプル効率と空間汎化性能を実世界6タスクで実証した。
- The Power of the Senses: Generalizable Manipulation from Vision and Touch through Masked Multimodal Learning2023/11/1
- Guide Your Agent with Adaptive Multimodal Rewards2023/9/1
- Multi-View Masked World Models for Visual Robotic Manipulation2023/2/1
- Masked World Models for Visual Control2022/6/1
- Offline-to-Online Reinforcement Learning via Balanced Replay and Pessimistic Q-Ensemble2021/7/1