Maoqing Yao
収録論文 30本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- BEE: 視覚言語行動モデルを用いた介入適応型実世界強化学習VLA2026/9/23
凍結したVLAモデルに対し、人間の修正を行動次元ごとの信頼度に応じた制約として扱うことで、実機でのオンライン強化学習を効率化する手法を提案。
- MEgoVista: 実環境におけるメートル単位の4D手・頭部動作推定のための多視点自己中心運動推定動作推定2026/9/15
未準備の自己中心視点録画から、キャリブレーション済みステレオを用いてメートル単位の両手と頭部の動作を重力整合した世界座標系で再構成するオフラインパイプラインを提案。
- GE-Act 2.0: ロボット操作のためのワールドアクションモデルの事前学習とスケーリングVLA2026/9/4
操作データのみで生成・行動コンポーネントをゼロから学習するワールドアクションモデルを提案し、大規模データでの事前学習とスケーリングの効果を検証した。
- CIDER: 身体化強化学習のための継続的対話蒸留継続学習2026/8/22
実世界の継続的強化学習において、過去のポリシーを教師として凍結し、蒸留による保持とタスク学習を交互に行うことで、破滅的忘却を防ぎながら新しいスキルを獲得するフレームワークを提案した。
- Genie Sim PanoWorld: パノラマシーン生成とシミュレーションによる無限屋内3Dワールド生成パイプライン3Dシーン生成2026/7/29
単一の360度パノラマ画像から、自由に移動可能な高忠実度3Dシーンを再構築する2段階のフィードフォワードパイプラインを提案。軌道制御可能なパノラマ動画を生成し、それを3Dガウシアンシーンに変換することで、シミュレーション用アセットとして利用可能にする。
- VINE: 強化学習のための生成制御ポリシーの調整強化学習2026/7/1
フローマッチングポリシーを強化学習で安定して学習するための新しいサンプリング手法VINEを提案。各デノイズステップで補間状態を再構築し、価値勾配の伝播を安定化させる。
- GE-Sim 2.0: ロボット操作のための包括的クローズドループ映像世界シミュレータへのロードマップシミュレーション2026/5/1
ロボット操作のためのクローズドループ映像世界シミュレータGE-Sim 2.0を提案。実ロボットデータで再学習し、状態デコーダ、世界判定器、高速化モジュールを追加して、映像シミュレーションからポリシー学習へのループを閉じる。
- Genie Sim PanoRecon: 単一視点パノラマからの高速没入型シーン生成3D再構成/シミュレーション2026/4/1
パノラマ画像からロボット操作シミュレーション用の高品質3Dシーンを数秒で再構成するガウススプラッティング手法を提案。深度情報を活用した融合戦略で視点間の幾何学的整合性を確保し、LLM駆動のシミュレーションプラットフォームGenie Simに統合した。
- Libra-VLA: 非同期の粗密デュアルシステムによる学習均衡の実現VLA2026/4/1
VLAモデルを粗い意図予測と細かい動作生成の2段階に分離し、学習負荷の均衡と非同期実行を実現する新しいアーキテクチャを提案した。
- RoboClaw: 長期的ロボットタスクのためのスケーラブルなエージェント型フレームワークVLA/長期的タスク2026/3/1
RoboClawは、データ収集・ポリシー学習・タスク実行を単一のVLM駆動コントローラで統合し、自己リセット機構により人間の介入を最小限に抑えつつ長期的タスクを自律的に実行するロボットフレームワークを提案する。
- ALOE: 視覚言語行動モデルの事後学習のための行動レベルオフポリシー評価VLA2026/2/1
実世界の人間参加型強化学習でVLAモデルを改善するため、現在のポリシーを直接評価するオフポリシー評価フレームワークALOEを提案し、4つの実世界マニピュレーションタスクで検証した。
- Genie Sim 3.0:ヒューマノイドロボット向け高忠実度統合シミュレーションプラットフォームsim2real2026/1/1
LLMで自然言語から高忠実度シーンを生成し、VLMによる自動評価を可能にするロボットマニピュレーション用シミュレーションプラットフォームを提案。1万時間超の合成データセットを公開し、ゼロショットのsim-to-real転移を実証した。
- ACoT-VLA: 視覚言語行動モデルのための行動連鎖推論VLA2026/1/1
行動空間で直接推論する「行動連鎖推論(ACoT)」を提案し、粗い行動意図を明示的・暗黙的に生成して最終方策を導くVLAアーキテクチャを実現した。
- 自己回帰離散事前学習による身体性VLM推論とロボット行動の統合VLA2025/12/1
身体性推論を評価するベンチマークERIQと、連続制御を離散化するFACTトークナイザを提案し、推論と行動を統合したGenieReasonerで実世界マニピュレーション性能を向上させた。
- 進化し続けるスキル知識を持つ視覚言語行動モデルVLA2025/11/1
VLAモデルにパラメータを増やさずに継続的模倣学習を導入し、知識誘導型エキスパートルーティングでタスク特化を実現するフレームワークStellar VLAを提案。
- FieldGen: 遠隔操作の前操作軌道からフィールド誘導データ生成へデータ生成2025/10/1
操作を前操作段階と精密操作段階に分け、人間の実演から引力場を構築して多様な軌道を自動生成することで、少ない人手で高品質な実世界データを収集する枠組みを提案。
- EO-1: 汎用ロボット制御のためのオープンな統合身体性基盤モデルVLA2025/8/1
視覚・言語・行動を統合的に扱う基盤モデルEO-1と150万件のデータセットEO-Data1.5Mを提案し、多様なロボットでの長期的な器用マニピュレーションを実現した。
- Genie Envisioner:ロボット操作のための統合ワールド基盤プラットフォームVLA2025/8/1
指示条件付き動画拡散モデルを核に、方策学習・評価・シミュレーションを一つの動画生成フレームワークへ統合した基盤を提案し、軽量デコーダで行動軌跡を生成、専用ベンチマークも整備した。
- スケーラブルなロボットマニピュレーションに多様性は本当に必要か?マニピュレーション2025/7/1
ロボット学習におけるデータ多様性の役割をタスク・身体・専門家の3次元で検証し、タスク多様性が重要である一方、専門家の速度多様性は学習を妨げることを示し、その偏りを補正する手法を提案した。
- UniVLA:タスク中心の潜在行動でどこでも行動を学習するVLA2025/5/1
動画からタスク中心の潜在行動表現を学習し、異なるロボットや環境に展開可能な汎用視覚言語行動ポリシーを実現した研究。
- EnerVerse-AC: 行動条件付きで身体性環境を想像する世界モデル世界モデル2025/5/1
エージェントの予測行動から将来の視覚観測を生成する行動条件付き世界モデルを提案し、実機や複雑なシミュレーションなしでロボット模倣学習のデータ拡張と評価を可能にした。
- Genie Centurion:人間による巻き戻し・修正ガイダンスで実世界ロボット訓練を加速VLA2025/5/1
失敗時に状態を巻き戻して人間が修正デモを行い、1人の操作者が複数ロボットを監督できるデータ収集手法を提案し、従来法より成功率を最大40%向上させた。
- Hume:視覚-言語-行動モデルにシステム2思考を導入VLA2025/5/1
価値誘導型の熟考(システム2)と軽量な反応型ポリシー(システム1)を組み合わせた二重システムVLAモデルを提案し、器用なロボット制御を実現した。
- Raw2Drive: 世界モデル整合による強化学習ベースのEnd-to-End自動運転End-to-End自動運転2025/5/1
特権情報で訓練した世界モデルを生センサー世界モデルに蒸留し、強化学習でEnd-to-End自動運転を実現してCARLA v2で最高性能を達成した。
- EWMBench:身体性世界モデルのシーン・動作・意味品質を評価するベンチマーク身体性世界モデル評価2025/5/1
言語指示から物理的に妥当なシーンを生成する身体性世界モデル(EWM)を、視覚的一貫性・動作正確性・意味整合性の3軸で評価するベンチマークを提案した論文。
- 敵対的データ収集:効率的でロバストなロボット模倣学習のための人間協調型摂動模倣学習2025/3/1
人間がリアルタイムで環境や指示を攪乱するHiL型データ収集法を提案し、少ないデモ数で模倣学習の汎化・ロバスト性・回復能力を大幅に向上させた。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- EnerVerse: ロボットマニピュレーションのための身体化未来空間の想像VLA2025/1/1
指示から未来の身体化空間を予測する生成ロボティクス基盤モデルを提案し、4Dガウススプラッティングと組み合わせてシミュレーションと実世界のギャップを縮め、高性能な操作を実現した。
- ロボット操作のための相乗的・汎用的・効率的なデュアルシステムに向けてマニピュレーション2024/10/1
汎用ポリシーと専門ポリシーを組み合わせたデュアルシステムRoboDualを提案し、少ない学習データで高精度・高効率なロボット操作を実現した。
- Multi-Class 3D Object Detection with Single-Class Supervision2022/5/1