Guocai Yao
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboCoach: 世界モデルを能動的コーチとして用いた構成可能なロボットスキルの改善マニピュレーション2026/9/30
世界モデル内で想像した失敗を診断し、次に教えるべきサブタスクと更新すべき専門家を選ぶことで、少ない実演データで長期的なロボット操作スキルの組み合わせを効率的に改善するフレームワークを提案。
- LiMA: 非同期拡散による長期想像からリアルタイム巧みな操作への橋渡しマニピュレーション2026/9/23
低速な長期意図生成と高速な動作精緻化を非同期に分離した二重システム拡散フレームワークで、両腕巧みな操作をリアルタイムに実行する。
- LPA-CWM:反事実世界モデルによる運動推論のための学習型物理判定器運動推論/世界モデル2026/9/12
動画予測モデルから反事実的な介入で運動を抽出する際、複数の候補応答を軽量な学習型判定器で重み付け統合し、信頼性の高い運動推定を実現した研究。
- DeCAL: 接触認識型潜在共想像による物理基盤の巧みな視覚-言語-行動モデル巧みな操作/VLA/触覚2026/9/8
接触の多い巧みな操作のための、触覚を適応的に統合し視覚と触覚のダイナミクスを共同で想像する新しいVLAモデルを提案し、高い成功率と汎化性能を達成した。
- HiTac-WAM: 接触を伴うロボット操作のための階層的触覚ワールドアクションモデル触覚/操作2026/8/20
触覚状態を接触状態、3D変形場、滑りリスクの階層として予測するワールドアクションモデルを提案し、予測と実測のずれに基づく再計画で操作性能を向上させた。
- VERDI: 継続的な世界モデル最適化における検索は転移ではない世界モデル最適化2026/8/10
事前学習済み世界モデルをユーザー指定の目的に最適化する際、過去の成功戦略をそのまま再利用するのではなく、対象モデルでの実験検証を経て初めて転移可能な知識とする継続的フレームワークVERDIを提案。最適化指紋と検証機構により探索コストと負の転移を大幅に削減した。
- Open-AoE: 身体化学習のためのオープンな自己中心視操作データセットとツールチェーンデータセット2026/7/1
スマートフォンで撮影した自己中心視の操作動画約2000時間と、それをロボット学習用に加工するツールチェーンを公開した論文。
- FeelWorld: 階層的接触予測と計画のための視触覚ワールドモデル触覚2026/7/1
視覚と触覚を統合した階層的ワールドモデルを提案し、将来の視覚特徴と接触・滑り状態を予測することで、接触を伴う操作タスクの計画を改善する。
- Orca:世界は心の中にある世界モデル2026/6/29
Orcaは、マルチモーダルな世界信号から統一された世界潜在空間を学習し、テキスト生成・画像予測・身体動作生成などの下流タスクを軽量デコーダで実現する世界基盤モデルである。
- LIBERO-Safety: 視覚言語行動モデルにおける物理的・意味的安全性の包括的ベンチマークVLA/安全性評価2026/6/1
VLAモデルの安全性を評価するため、パラメトリックな安全ベンチマークと大規模データセットを構築し、8つのVLAモデルと2つの基盤モデルの系統的評価を行った。
- ATOM-Bench: 操作ポリシーにおける原子スキルと構成的一般化のための実世界ベンチマークマニピュレーション2026/6/1
実世界の操作ポリシーを評価するためのベンチマークATOM-Benchを提案し、原子スキルと構成的一般化を分離して評価する。
- Dexora: 高自由度両腕巧緻操作のためのオープンソースVLAVLA/操作2026/5/1
両腕・両手の高自由度操作を対象とした初のオープンソースVLAシステムDexoraを提案し、ハイブリッド遠隔操作とデータ品質を考慮した学習手法により、巧緻操作の成功率を大幅に向上させた。
- OmniUMI:人間に合わせたマルチモーダルインタラクションによる物理的基盤を持つロボット学習マニピュレーション2026/4/1
UMI型インターフェースに触覚・把持力・外力などの物理的接触信号を統合し、拡散ポリシーで学習するシステムを提案。力に敏感な操作タスクで有効性を示した。
- FG-CLTP: ロボット操作のための細粒度対比言語触覚事前学習触覚2026/3/1
触覚センサデータを言語と対比学習で結びつけ、力の大きさや接触形状などの定量的な接触状態を捉える細粒度表現を獲得し、操作タスクの性能を向上させるフレームワークを提案した。
- 階層的マニピュレーション政策のための世界モデルのスケーリングVLA2026/2/1
大規模事前学習済み世界モデルを高レベルプランナーとして用い、VLAを低レベル実行者とする階層的フレームワークを提案。未知物体や新規状況での汎化性能を大幅に向上させた。
- DECO: 触覚アダプタを備えた双腕巧み操作のための分離型マルチモーダル拡散トランスフォーママニピュレーション2026/2/1
視覚・固有感覚・触覚を分離した条件付け経路で統合する拡散トランスフォーマDECOを提案し、双腕巧み操作の触覚データセットDECO-50を公開。実機実験で成功率72.25%を達成し、触覚アダプタが複雑な接触タスクで20%向上。
- AnyTouch 2: 動的触覚知覚のための汎用光学触覚表現学習触覚2026/2/1
大規模階層型触覚データセットToucHDを構築し、物体理解と力覚を伴う微細な動的知覚を統合する汎用触覚表現学習フレームワークAnyTouch 2を提案した。
- アフォーダンスグラフによるタスク世界:スケーラブルな身体性学習のための自己進化型タスク生成sim2real2026/2/1
実世界観察からアフォーダンスグラフでタスクを階層分解し、VLM推論と幾何検証を組み合わせた自己進化機構でロボット方策を自動生成・改善するフレームワークを提案。
- AoE: 身体性AIのための常時オンの一人称視点人間動画収集システムデータ収集2026/2/1
スマホと首掛けホルダーを使い、誰でもどこでも一人称視点の実世界インタラクション動画を低コストで収集し、身体性基盤モデルの学習データ不足を解消するシステムを提案。
- RoboBrain 2.5:奥行きを見据え、時間を心に刻むVLA2026/1/1
深度認識に基づく3D空間推論と、時間的な進捗予測を統合した次世代の身体性AI基盤モデルを提案し、複雑なマニピュレーションの精度と実行認識を向上させた。
- MOVE: ロボットマニピュレーションの空間汎化のための運動ベースデータ収集パラダイムマニピュレーション2025/12/1
デモ中に環境内の物体を動かすことで、単一軌道から多様な空間配置データを生成し、模倣学習の空間汎化性能を向上させる手法を提案。
- Robo-Dopamine: 高精度ロボットマニピュレーションのための汎用プロセス報酬モデリングマニピュレーション2025/12/1
多視点入力から段階的な進捗を理解する汎用報酬モデルを3400時間超のデータで学習し、理論的に整合した報酬整形で強化学習によるロボット操作を高精度化した。
- SWITCH: 長期的身体環境における実体インターフェースのモデリングと操作のベンチマーク身体性ベンチマーク2025/11/1
家電パネルやエレベーターなどの実体操作インターフェースを対象に、言語指示から行動・状態変化の追跡・結果検証・エラー回復までの閉ループ推論を評価するベンチマークSWITCHを提案。
- METIS: 多源自己中心データによる統合型巧みな視覚-言語-行動モデルの事前学習VLA2025/11/1
人間とロボットの自己中心視点データを統合した大規模データセットEgoAtlasと動作表現を用いて、巧みな操作のための視覚-言語-行動モデルを事前学習し、実世界タスクでの成功率と汎化性能を向上させた。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- RoboBench:マルチモーダル大規模言語モデルを身体化脳として評価する包括的ベンチマークVLA2025/10/1
マニピュレーションの意思決定を担う「身体化脳」としてのマルチモーダルLLMを、指示理解・知覚推論・汎化計画・アフォーダンス予測・失敗分析の5次元で評価するベンチマークを提案した。