Shenyuan Gao
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DreamAvoid: 臨界期テストタイムドリーミングによるVLAポリシーの失敗回避VLA/操作2026/5/1
VLAモデルが微細な操作中に失敗する問題に対し、実行が臨界期に入ったかを検出し、複数の候補行動を評価して最適な行動を選択する「テストタイムドリーミング」フレームワークを提案した。
- DreamDojo: 大規模人間動画から学ぶ汎用ロボット世界モデル世界モデル2026/2/1
44,000時間の一人称視点人間動画から汎用的なロボット世界モデルを学習し、連続潜在行動を代理ラベルとして活用することで、巧みな操作の物理理解と精密な行動制御を実現した研究。
- より遠く、より賢く見る:VLM政策最適化のための価値誘導マルチパス反射VLA2026/2/1
VLMを用いたロボット操作において、状態評価と行動生成を分離し、ビーム探索で複数の将来経路を探索するテスト時計算フレームワークを提案。信頼度に基づく早期終了で推論遅延を削減し、多段階操作タスクでの性能を向上させた。
- 世界行動モデルはゼロショット方策であるVLA2026/2/1
動画拡散モデルを基盤に未来の世界状態と行動を予測するWorld Action Model「DreamZero」を提案し、実機でVLAを上回る汎化性能と7Hzのリアルタイム閉ループ制御を実現した。
- StaMo: コンパクトな状態表現による汎化可能なロボット動作の教師なし学習VLA2025/10/1
軽量エンコーダと事前学習済みDiTデコーダで2トークンの圧縮状態表現を教師なし学習し、その差分が潜在行動として機能することを発見。VLAモデルに統合してLIBEROで14.3%、実世界で30%の性能向上を達成。
- 3D・4D世界モデリングのサーベイ世界モデル2025/9/1
RGB-D画像や占有グリッド、LiDAR点群といったネイティブな3D/4D表現を用いた世界モデリング研究を初めて体系的に整理し、定義・分類・データセット・評価指標をまとめたサーベイ。
- ReSim: 自動運転のための信頼性の高い世界シミュレーションsim2real2025/6/1
実世界の運転データにシミュレータ由来の非専門家データを加え、危険な行動も含む多様な運転シナリオを制御可能に生成する世界モデルを構築し、報酬推定モジュールと組み合わせて政策評価性能を向上させた。
- UniVLA:タスク中心の潜在行動でどこでも行動を学習するVLA2025/5/1
動画からタスク中心の潜在行動表現を学習し、異なるロボットや環境に展開可能な汎用視覚言語行動ポリシーを実現した研究。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- AdaWorld: 潜在行動で適応可能な世界モデルを学習する世界モデル2025/3/1
動画から自己教師ありで潜在行動を抽出し、それに条件づけた自己回帰的世界モデルを事前学習することで、新しい環境や行動への適応を効率化する手法を提案。