Yitao Liang
収録論文 8本 ・ フィジカルAI/ロボット学習
システム設計VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 長時間ロボット卓上ゲームにおける内部状態整合性を維持するシステム設計システム設計2026/3/1
ロボットによる長時間の卓上ゲーム(麻雀)で、知覚や実行の小さな誤りが状態を破壊する問題に対し、状態を明示的に分離・監視し、触覚トリガーによる回復機構を備えた統合アーキテクチャを提案・実証した。
- 視覚運動エージェントの汎化可能な空間知能のためのスケーラブルなマルチタスク強化学習VLA2025/7/1
Minecraft環境で大規模マルチタスク強化学習を行い、視覚運動エージェントが未見の世界や実世界設定へゼロショット汎化できることを示した。
- 視覚-言語-行動モデルサーベイ:行動トークン化の観点からVLA2025/7/1
視覚と言語の入力を行動トークンに変換して実行するVLAモデルを、行動トークンの種類(言語記述・コード・アフォーダンス・軌道など)で分類し、各手法の長所と課題を整理したサーベイ。
- ROCKET-2: クロスビュー目標整合による視覚運動ポリシーの操作VLA2025/3/1
ユーザーのカメラ視点からセグメンテーションマスクで目標を指定し、エージェントの視点と整合させることで、Minecraftで訓練したエージェントが他の3D環境にもゼロショットで汎化できる手法を提案。
- DexGraspVLA:汎用器用把持に向けた視覚-言語-行動フレームワークVLA2025/2/1
事前学習済み視覚言語モデルを高レベル計画に、拡散ベースの行動制御器を低レベルに用いた階層型フレームワークで、多様な未見の乱雑シーンでも90%以上の器用把持を実現した。
- GROOT-2: 弱教師ありマルチモーダル指示追従エージェントVLA2024/12/1
ラベルなしデモで多様な行動を学びつつ、少数のラベル付きデモで人間の意図に合わせる半教師あり学習手法を提案し、マルチモーダル指示追従性能を向上させた。
- OmniJARVIS:統合視覚言語行動トークン化によるオープンワールド指示追従エージェントVLA2024/6/27
Minecraftのオープンワールドで、行動軌跡を自己教師あり学習で離散トークン化し、推論・計画・行動を単一のVLAモデルで統合的に実行できるようにした研究。
- SAM: Squeeze-and-Mimic Networks for Conditional Visual Driving Policy Learning2019/12/1