Yao Mu
Shanghai AI Laboratory
収録論文 105本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SocialHumanoid: ワンステップ発話同期動作生成による表情豊かなヒューマノイド行動発話同期動作生成2026/9/27
発話に同期した感情表現豊かな全身動作をワンステップで生成し、ヒューマノイドロボット上でリアルタイムに実行するシステムを提案。
- RoboFoundry:自己学習型身体性エージェントのためのシステム・アズ・ポリシー進化VLA2026/9/26
エージェントの支援システム全体を一つのポリシーとして捉え、実行経験を検証済みのシステム更新に変換して自己進化させる身体性エージェントフレームワークを提案し、EmbodiedBenchで最先端性能を達成した。
- InternW0: 効率的な実世界インタラクションのための基盤的物理世界モデル世界モデル2026/9/23
上海AI Labが、視覚予測とロボット制御を非対称なvideo-actionアーキテクチャで統合した物理世界モデルInternW0を提案。約7,200時間のデータで学習し、化学合成やピペッティングなどの実世界タスクで評価した。
- M²Tok: 視覚言語行動モデルのためのマルチヘッド・マルチコードブック離散行動トークン化VLA2026/9/16
連続的な行動信号を複数のヘッドと独立したコードブックで離散トークン化し、再構成誤差を抑えつつVLAモデルの性能を向上させる手法を提案。
- 空中把持のための事前進化とタスク整合空中マニピュレーション2026/9/16
空中把持の軌道最適化において、最適化済み動作から軌道事前分布を学習しCEMで進化させ、実行結果を学習するCriticで評価・コスト設計することで、最適化の信頼性と把持性能を向上させた。
- GaussianWAM: 3Dガウス場から世界行動モデルへの幾何学と意味の蒸留VLA2026/8/25
多視点観測から3Dガウス場を介して幾何・意味情報を世界行動モデルに蒸留し、ロボット操作の視覚予測と行動生成を強化する手法を提案。
- PRM-as-a-Judge 1.5: ロボットプロセス評価のためのツールキット評価指標2026/8/14
ロボットの動作動画から詳細な進捗曲線を生成し、失敗側の進捗や回復能力、成功側の実行品質など複数の細かい指標を導出する評価ツールキットを提案した。
- H2R-Bench: ワールドモデルにおける人間からロボットへの操作ビデオ生成のベンチマークビデオ生成/ベンチマーク2026/8/1
人間の操作ビデオをロボットの操作ビデオに変換するクロスエンボディメント生成の性能を評価するベンチマークを提案し、既存モデルの限界を明らかにした。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- DenseReward: 失敗合成によるロボット操作のための高密度報酬学習操作2026/7/1
ロボット操作の強化学習を改善するため、シミュレーションで物理的に現実的な失敗軌道を自動生成し、視覚と言語からフレーム単位の高密度報酬を予測する報酬モデルDenseRewardを提案した。
- RxBrain:言語と視覚の推論・想像を統合した身体化認知基盤モデルVLA2026/7/1
身体化認知のための基盤モデルRxBrainを提案。言語による計画構造と視覚による世界状態予測を統合し、単一の計画シーケンスで表現する。
- Enfold: 世界モデルの想像力を予測表現に折り畳み、超効率的な身体制御を実現VLA2026/7/1
生成モデルが未来を構築する過程で得られる中間計算を、現在の視覚と言語指示のみから予測される表現に転移させる手法を提案。推論時に生成器を実行せずに行動予測が可能となり、遅延を大幅削減。
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- 探索・対話・展開可能:オープンワールド移動操作のための視覚駆動型具現化エージェント移動操作2026/7/1
実世界展開可能な移動操作エージェントのためのフレームワークREALを提案し、シミュレーションと実機のギャップを埋める環境とベンチマークを構築、物理ロボットで高い成功率を達成した。
- RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマークベンチマーク2026/7/1
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
- 信頼できる具現化知能に向けて:システムフレームワークと段階的信頼度レベル信頼性評価2026/7/1
具現化知能の信頼性を「持続的な安全な成功」と定義し、モデル・システム・エビデンス・展開の4層からなるフレームワークと段階的信頼度を提案する論文。
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- Orca:世界は心の中にある世界モデル2026/6/29
Orcaは、マルチモーダルな世界信号から統一された世界潜在空間を学習し、テキスト生成・画像予測・身体動作生成などの下流タスクを軽量デコーダで実現する世界基盤モデルである。
- EventVLA: イベント駆動型視覚証拠メモリによる長期的視覚言語行動ポリシーVLA2026/6/18
長期的なロボット操作タスクで、視覚情報が隠れたり見えなくなったりする問題に対処するため、重要な視覚イベントを予測して記憶する新しいフレームワークEventVLAを提案した。シミュレーションと実機タスクで既存手法より成功率が大幅に向上した。
- V2P-Manip: 単眼人間ビデオからの器用操作学習器用操作2026/6/15
単眼の人間デモビデオから、視覚的忠実度と物理的妥当性を両立した軌道を抽出し、器用な操作ポリシーを直接学習するフレームワークを提案。3Dアセット取得、軌道推定、ポリシー学習を統合し、二段階の精緻化で空間整合性と物理一貫性を確保する。
- ROVE: 強化学習によるヒューマノイド操作のための人間介入の活用ヒューマノイド操作/VLA/強化学習2026/6/15
不完全な人間介入データを用いてヒューマノイドVLAモデルを強化学習で訓練するフレームワークROVEを提案。楽観的価値推定とクロスエンボディ映像を活用し、高価値な行動を優先学習することで実世界の接触を伴う操作タスクで性能を向上させた。
- AHA-WAM:非同期・地平線適応型ワールドアクションモデルと観測誘導コンテキストルーティング操作学習2026/6/8
世界予測と行動実行を異なる時間解像度で行う非同期ワールドアクションモデルを提案し、ロボット操作タスクで性能を向上させた。
- LIBERO-Safety: 視覚言語行動モデルにおける物理的・意味的安全性の包括的ベンチマークVLA/安全性評価2026/6/1
VLAモデルの安全性を評価するため、パラメトリックな安全ベンチマークと大規模データセットを構築し、8つのVLAモデルと2つの基盤モデルの系統的評価を行った。
- DeformGen: 変形操作ポリシー学習のための動力学に基づくトポロジー拡張変形操作2026/6/1
変形物体の操作学習において、物理的に妥当な状態と軌道を生成する動力学ベースのデータ拡張フレームワークを提案した。
- 暗黙的ドリフト方策:条件付き専門家幾何による一段階行動生成模倣学習/行動生成2026/6/1
拡散やフローマッチングに基づく生成行動ポリシーは反復サンプリングが遅いため、一段階生成を提案。訓練時のドリフト補正を明示的なベクトル場推定なしで取り込む暗黙的ドリフト方策(IDP)を導入し、2D・3D・実世界操作タスクで有効性を実証した。
- EBench: 汎用モバイル操作ポリシーの要素診断ベンチマーク/モバイル操作2026/6/1
単一の成功率スコアを超えて、汎用モバイル操作ポリシーの能力と汎化を多次元で診断するシミュレーションベンチマークを提案し、最新モデルの特性を明らかにした。
- Q-VGM: フローマッチングVLAのオフポリシー強化学習のためのQ値勾配マッチングVLA/強化学習2026/6/1
フローマッチング型VLAポリシーの微調整において、Q関数の勾配を利用して価値改善を効率的に行う新しいオフポリシー強化学習手法Q-VGMを提案した。
- ImageWAM: 世界行動モデルは本当にビデオ生成が必要か、それとも画像編集だけで十分か?VLA2026/6/1
ビデオ生成に依存する世界行動モデル(WAM)の課題を指摘し、代わりに画像編集モデルを利用したImageWAMを提案。推論時に画像編集のKVキャッシュを行動予測に活用し、計算コストを大幅削減しつつ性能を向上させた。
- dVLA-RL: 離散拡散ビジョン・ランゲージ・アクションモデルに対する軌跡上の強化学習VLA/強化学習2026/6/1
離散拡散型VLAモデルの強化学習を可能にするため、生成過程をマルコフ決定過程とみなし、軌跡の結合確率を目的関数とする手法を提案した。
- 敵対的姿勢正則化による人間らしいキネマティクスの巧みなピアノ演奏への適用強化学習2026/6/1
強化学習でピアノを弾く高自由度ロボットハンドの不自然な姿勢を、少量の人間の演奏データを使った敵対的学習で人間らしく矯正する手法を提案した。
- SA-VLA: 状態認識トークナイザによる視覚言語行動モデルの性能向上VLA2026/6/1
ロボットの現在状態を考慮して離散アクショントークンを連続値に復号する状態認識アクショントークナイザを提案し、操作タスクの成功率を大幅に向上させた。
- RoboProcessBench: 視覚言語ロボット操作におけるプロセス認識理解のベンチマークVLA/ベンチマーク2026/6/1
ロボット操作の実行過程を静的監視と動的推論の2次元で評価するベンチマークを構築し、12種類の診断質問群と約58kのQAペアを含むデータセットを提供した。既存のVLMがプロセス理解に乏しいことを示し、教師あり微調整による改善効果も検証した。
- SynManDex: 合成人間プレグラスプからの人間らしい器用な把持の合成器用な把持/シミュレーション2026/6/1
人間のプレグラスプを生成し、それをロボットハンドにリターゲットして力閉ループ接触を最適化することで、人間らしく安定した器用な把持を合成するパイプラインを提案。
- PhysForge: 物理に基づくインタラクティブな仮想世界向け3Dアセット生成3Dアセット生成2026/5/6
物理的に正しい3Dアセットを生成するための2段階フレームワークを提案。VLMが物理設計図を作成し、拡散モデルが形状と運動学パラメータを生成する。
- π0-EqM: 閉ループ視覚言語行動制御のための平衡マッチングVLA/操作制御2026/5/1
VLAモデルの行動デコーダを平衡マッチングに置き換え、計算資源を状態に応じて適応的に配分し、ロボット操作の成功率を向上させた。
- BORA: オフライン強化学習とオンライン残差適応を橋渡しする実世界巧緻操作VLAモデルVLA/強化学習/巧緻操作2026/5/1
実世界の巧緻操作向けに、オフライン学習で価値関数を構築し、オンラインで人間介入による残差適応を行うVLAモデルの後訓練フレームワークを提案した。
- DexJoCo: MuJoCo上でのタスク指向巧みな操作のためのベンチマークとツールキット巧みな操作2026/5/1
巧みなロボットハンドの操作能力を評価するための、11の機能ベースのタスクとデータ収集システムを含むベンチマークとツールキットを提案し、現代のモデルの性能を分析した。
- Dexora: 高自由度両腕巧緻操作のためのオープンソースVLAVLA/操作2026/5/1
両腕・両手の高自由度操作を対象とした初のオープンソースVLAシステムDexoraを提案し、ハイブリッド遠隔操作とデータ品質を考慮した学習手法により、巧緻操作の成功率を大幅に向上させた。
- HyperSim: ロバストなロボット操作のための包括的シミュレーションから実世界へのフレームワークsim2real2026/5/1
シミュレーションから実世界への転移を改善するため、高忠実度環境合成、敵対的軌道生成、シミュレーションと実世界の共学習を組み合わせた包括的フレームワークHyperSimを提案し、実世界タスクで高い成功率を達成した。
- Rein3D: パノラマビデオ拡散モデルによる強化学習型3D屋内シーン生成3Dシーン生成2026/4/12
3Dガウススプラッティングとビデオ拡散モデルを組み合わせ、疎な入力から360度の一貫した3D屋内シーンを復元・生成するフレームワークを提案した。
- HiVLA: 視覚基盤中心の階層型身体化操作システムVLA/操作2026/4/1
高レベルの意味的計画と低レベルの運動制御を分離した階層型VLAシステムを提案し、VLMの推論能力を保ちつつ、拡散トランスフォーマーによる行動生成で長期的なスキル合成と細かい操作を向上させた。
- JailWAM: ロボット制御におけるワールドアクションモデルの脱獄安全性評価2026/4/1
ワールドアクションモデル(WAM)の安全性リスクを評価する初の脱獄フレームワークJailWAMを提案。視覚軌跡マッピングとリスク判別器、二重経路検証により、悪意ある指示による不安全なロボット動作を効率的に検出する。
- RMBench:記憶依存型ロボットマニピュレーションのベンチマークと政策設計への洞察マニピュレーション2026/3/1
記憶を必要とするロボット操作タスクを体系的に評価する9タスクのシミュレーションベンチマークRMBenchと、明示的記憶モジュールを持つ操作政策Mem-0を提案し、既存政策の記憶限界と設計指針を明らかにした。
- R3DP: 実時間3D認識ポリシーによる身体的操作マニピュレーション2026/3/1
大規模3D視覚モデルの強力な事前知識を、非同期の高速・低速協調モジュールと軽量な時間特徴予測ネットワークで統合し、実時間性能を保ちながら操作ポリシーの成功率を向上させる手法を提案した。
- 受動的観察者から能動的批評家へ:強化学習がロボット操作のプロセス推論を引き出すマニピュレーション2026/3/1
ビデオMLLMを受動的な観察者から能動的な批評家へと変えるため、結果ベースの強化学習を用いてプロセス推論を誘発する7BフレームワークPRIMO R1を提案し、長期的ロボット操作の進捗監視性能を大幅に向上させた。
- DexHiL:巧みな操作のための視覚-言語-行動モデル事後学習における人間参加型フレームワークマニピュレーション2026/3/1
腕と多指ハンドの協調操作を可能にする人間参加型フレームワークを提案し、実行中の人間による修正を活用した事後学習で成功率を平均25%向上させた。
- ACE-Brain-0: 空間知能を共通の足場とする普遍的身体性知能基盤モデル2026/3/1
多様な身体(自動運転、ロボット、ドローン)を統合する基盤モデルを提案し、空間知能を共通の足場として、専門化と融合を経て高い性能を達成した。
- ManiTwin: データ生成対応デジタルオブジェクトデータセットを10万点に拡張データセット/シミュレーション2026/3/1
単一画像からシミュレーション対応の3Dアセットを自動生成するパイプラインを構築し、10万点の高品質アセットデータセットを提供する論文。
- SldprtNet: 言語駆動3D設計におけるCAD生成のための大規模マルチモーダルデータセットCAD生成/データセット2026/3/1
産業部品24万点以上を含む、CADモデル生成用の大規模マルチモーダルデータセットを構築し、画像とテキストを組み合わせた入力がCAD生成に有効であることを示した。
- RoboClaw: 長期的ロボットタスクのためのスケーラブルなエージェント型フレームワークVLA/長期的タスク2026/3/1
RoboClawは、データ収集・ポリシー学習・タスク実行を単一のVLM駆動コントローラで統合し、自己リセット機構により人間の介入を最小限に抑えつつ長期的タスクを自律的に実行するロボットフレームワークを提案する。
- CLOT: 全身ヒューマノイド遠隔操作のための閉ループ大域モーショントラッキング遠隔操作2026/2/1
高頻度の自己位置推定フィードバックにより、全身ヒューマノイド遠隔操作における大域的な姿勢ドリフトを解消する閉ループ追従システムを提案し、実機で高精度・高ロバストな動作を実現した。
- UniVTAC: 視触覚マニピュレーションのデータ生成・学習・評価を統合するシミュレーションプラットフォーム視触覚/マニピュレーション2026/2/1
3種類の視触覚センサに対応したシミュレーション基盤で接触データを大量生成し、視触覚エンコーダと8タスクのベンチマークを提供して、触覚駆動型マニピュレーションの学習と評価を可能にした。
- マルチエージェントロボットシステム(MARS)チャレンジの進歩と革新マルチエージェント2026/1/1
NeurIPS 2025ワークショップで開催されたMARSチャレンジを紹介し、VLMを用いたマルチエージェントの計画とロボットマニピュレーションの制御という2領域での取り組みを概説した論文。
- MM-ACT: マルチモーダル並列生成から行動を学習する統合VLAモデルVLA2025/12/1
テキスト・画像・行動を共有トークン空間で統合し、並列デコードで生成するVLAモデルを提案。LIBEROや実機Franka、RoboTwin2.0で高い成功率を達成した。
- FieldGen: 遠隔操作の前操作軌道からフィールド誘導データ生成へデータ生成2025/10/1
操作を前操作段階と精密操作段階に分け、人間の実演から引力場を構築して多様な軌道を自動生成することで、少ない人手で高品質な実世界データを収集する枠組みを提案。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- 専門性は独占する必要なし:視覚-言語-行動学習のための行動特化型Mixture of ExpertsVLA2025/10/1
事前学習済みVLAモデルの重みを継承し、フィードフォワード層をスパースなMoE層に置き換えて拡張するAdaMoEを提案。専門家選択と重み付けを分離することで協調的な専門家利用を実現し、計算効率を保ちつつ性能を向上させた。
- SimpleVLA-RL:強化学習によるVLAモデル訓練のスケーリングVLA2025/9/1
VLAモデル向けの効率的な強化学習フレームワークを提案し、大規模データへの依存を減らしつつLIBEROやRoboTwinで高性能を達成した。
- PASG:ロボットマニピュレーションにおける幾何プリミティブの自動抽出と意味的アンカリングのための閉ループフレームワークマニピュレーション2025/8/1
物体の幾何プリミティブを自動抽出し、VLMで機能的アフォーダンスと結びつける閉ループ手法を提案。多様なマニピュレーションタスクで手動アノテーションに匹敵する性能を実現した。
- 離散拡散VLA:視覚言語行動ポリシーの行動デコーディングに離散拡散を導入VLA2025/8/1
行動チャンクを離散化し、統合トランスフォーマー内で離散拡散により並列デコーディングするVLAを提案。適応的なデコーディング順序と再マスキングで誤り訂正を行い、LIBEROやSimplerEnvで高い成功率と事前学習能力の保持を実現した。
- HyCodePolicy:身体性エージェントにおけるマルチモーダル監視と意思決定のためのハイブリッド言語コントローラVLA2025/8/1
自然言語指示からコードを生成し、視覚言語モデルによる実行監視とコード修復を組み合わせて、ロボット操作タスクを自己修正しながら遂行するハイブリッド制御フレームワークを提案。
- ArtGS: 3Dガウシアンスプラッティングによる関節物体の視覚・物理モデリングと操作マニピュレーション2025/7/1
3Dガウシアンスプラッティングに視覚言語モデルと微分可能レンダリングを組み合わせ、関節物体の構造を推定して操作方策を最適化するフレームワークを提案。
- V2X協調自動運転のエンドツーエンド競技会:研究課題と進展V2X協調自動運転2025/7/1
V2X通信を活用した協調自動運転のエンドツーエンド競技会を開催し、帯域制約下での知覚・計画の課題と上位解法の傾向を分析した。
- FMimic: 基盤モデルによる人間動画からの細粒度行動学習模倣学習2025/7/1
少数の人間動画から基盤モデルを用いてロボットの細かい行動スキルを直接学習する手法を提案し、RLBenchや実世界タスクで大幅な性能向上を達成した。
- 汎化可能な両腕マニピュレーションのベンチマーク:CVPR 2025 MEISワークショップにおけるRoboTwin両腕協調チャレンジマニピュレーション2025/6/1
RoboTwinシミュレーションと実機ロボットを用いた両腕マニピュレーションの国際コンペを開催し、17タスクで64チームが競い、汎化可能な協調方策の知見をまとめた。
- RoboTwin 2.0:強力なドメインランダム化を備えた両腕ロボット操作のためのスケーラブルなデータ生成器とベンチマークsim2real2025/6/1
両腕ロボット操作のための大規模データ生成フレームワークを提案し、マルチモーダル言語モデルによるタスク生成と5軸のドメインランダム化で実世界への転移性能を大幅に向上させた。
- OWMM-Agent:マルチモーダルなエージェントデータ合成によるオープンワールド移動マニピュレーション移動マニピュレーション2025/6/1
オープンワールド移動マニピュレーションのためのマルチモーダルエージェントアーキテクチャと、VLMをファインチューニングするデータ合成パイプラインを提案し、実世界でSOTA性能と汎化を実現した。
- RADE: マルチエージェント条件付き拡散によるリスク調整可能な運転環境の学習自動運転シミュレーション2025/5/1
マルチエージェント拡散モデルで交通参加者全員の挙動をリスク指標に条件付けて生成し、現実的な統計特性を保ちながら危険度を調整できる自動運転テスト用シミュレーションを提案した。
- AutoBio:デジタル生物学実験室におけるロボット自動化のためのシミュレーションとベンチマークsim2real2025/5/1
生物学実験室でのロボット自動化を評価するためのシミュレーションフレームワークとベンチマークAutoBioを提案し、言語誘導型マニピュレーションの課題を明らかにした。
- SwarmDiff: 拡散トランスフォーマによる混雑環境下の群ロボット軌道計画群制御2025/5/1
群ロボットのマクロ状態を確率密度関数で表し、条件付き拡散モデルとDiffusion Transformerでリスクを考慮した軌道を生成する階層的フレームワークを提案。
- RoboTwin: 生成デジタルツインによる双腕ロボットベンチマーク双腕マニピュレーション2025/4/1
3D生成基盤モデルと大規模言語モデルを活用し、多様な専門家データセットと実世界に即した評価プラットフォームを提供する双腕ロボットタスク向けの生成デジタルツインフレームワークを提案。
- 模倣学習による巧みなマニピュレーション:サーベイマニピュレーション2025/4/1
ロボットハンドの巧みな操作を模倣学習で実現する手法を体系的にまとめ、課題と今後の研究方向を論じたサーベイ論文。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- AINav: 大規模言語モデルを用いた適応的インタラクティブナビゲーションナビゲーション2025/3/1
LLMによるタスク計画と強化学習によるスキルライブラリを組み合わせ、環境と能動的に相互作用して経路を切り開く適応的ナビゲーション手法を提案。
- AVR: 視点と焦点距離の最適化による能動視覚駆動型精密ロボットマニピュレーションマニピュレーション2025/3/1
頭部追跡による視点制御と電動ズームを組み合わせた両腕遠隔操作・学習フレームワークAVRを提案し、シミュレーションと実機で成功率を大幅に向上させた。
- RoboBrain:抽象的から具体的へと至るロボット操作のための統合脳モデルVLA2025/2/1
ロボット操作に必要な計画・アフォーダンス知覚・軌道予測を統合したMLLMベースの脳モデルRoboBrainを提案し、多次元情報を付与した大規模データセットShareRobotで訓練して最先端性能を達成した。
- SafeDrive: 大規模言語モデルを用いた自動運転車の知識・データ駆動型リスク感受意思決定自動運転/LLM意思決定2024/12/1
リスク評価・記憶・LLM推論・反省の4モジュールを組み合わせ、動的で高リスクな環境でも安全な自動運転の意思決定を実現するフレームワークを提案し、実世界データセットで100%の安全率と85%超の人間らしい判断一致を達成した。
- M³PC:事前学習済みマスク付き軌道モデルのためのテスト時モデル予測制御オフライン強化学習2024/12/1
マスク付き自己符号化で事前学習した軌道モデルを、推論時にモデル予測制御(MPC)で活用し、追加学習なしで意思決定性能を向上させる手法を提案。
- DexHandDiff: 適応的巧みな操作のための相互作用を考慮した拡散計画マニピュレーション2024/11/1
接触を伴う巧みな操作のための拡散計画フレームワーク。接触前後の二段階拡散とLLMによるガイダンス生成で、訓練分布外の目標にも適応できる。
- G3Flow: 姿勢を考慮した汎化可能な物体操作のための生成的3Dセマンティックフローマニピュレーション2024/11/1
基盤モデルを活用して物体中心の動的な3Dセマンティック表現をリアルタイムに構築し、拡散ポリシーに組み込むことで、遮蔽下でも意味理解を可能にし、操作と物体間汎化を改善した。
- EMOS: 身体性を考慮した異種マルチロボットOSとLLMエージェント群制御2024/10/1
異種ロボット群がURDFから自身の身体能力を理解し、LLMエージェントが協調して操作・知覚・ナビゲーション・物体再配置を行うフレームワークとベンチマークを提案。
- VLMimic: 視覚言語モデルによる細粒度動作の視覚的模倣学習模倣学習2024/10/1
少数の人間動画から、視覚言語モデルを用いて細かい動作レベルまで直接学習し、ロボットの模倣学習を効率化する手法を提案。
- SAM2ベースのトラッキングとオンライン軸推定による関節物体マニピュレーションマニピュレーション2024/9/1
SAM2で動的部分を追跡しながら3D点群から関節軸をオンライン推定し、関節物体を閉ループで操作する手法を提案した論文。
- RoboTwin: 生成的デジタルツインによる双腕ロボットベンチマーク双腕マニピュレーション2024/9/1
3D生成モデルと大規模言語モデルを活用し、単一の2D画像から多様な物体のデジタルツインを生成して双腕ロボットの専門家データセットと実世界に即した評価ベンチマークを提供するフレームワークを提案。
- Cog-GA: 大規模言語モデルによる連続環境での視覚言語ナビゲーション生成エージェントVLA2024/9/1
大規模言語モデルを基盤に、認知マップ構築・ウェイポイント予測・二チャネル場面記述・反省機構を組み合わせ、連続3D環境での視覚言語ナビゲーションを人間らしく効率的に行う生成エージェントを提案した。
- HiAgent: 大規模言語モデルによる長期タスク解決のための階層的ワーキングメモリ管理LLMエージェント2024/8/1
サブゴールを記憶のチャンクとして用い、LLMエージェントのワーキングメモリを階層的に管理することで、長期タスクの成功率を2倍に向上させた。
- CAMON: LLM対話による協調型マルチエージェント物体探索ナビゲーションマルチエージェントナビゲーション2024/7/1
複数ロボットがLLMを用いた対話で役割分担とリーダー交代を行い、家庭内で複数の物体を効率的に探索・ナビゲーションする分散型フレームワークを提案。
- DAG-Plan: 双腕協調プランニングのための有向非巡回依存グラフ生成双腕マニピュレーション2024/6/1
自然言語指示をLLMで有向非巡回グラフ(DAG)に変換し、双腕ロボットの並列実行と適応的なタスク割り当てを実現するプランニング手法を提案した。
- 自己整合による大規模言語モデルを用いたロボットスキルの報酬学習報酬学習2024/5/1
LLMが提案した報酬関数を、実行フィードバックに基づく自己整合プロセスで反復的に調整し、人間なしで効率的にロボットスキルの報酬を学習する手法を提案した。
- ManiPose: 姿勢を考慮した物体操作のための包括的ベンチマークマニピュレーション2024/3/1
物体の6D姿勢に応じて把持や操作を適応させる「姿勢考慮型物体操作」の研究を進めるため、シミュレーション環境・大規模データセット・LLM活用ベースラインを提供するベンチマークを構築した。
- RoboScript: 実機とシミュレーションをまたぐ自由形式マニピュレーションのためのコード生成マニピュレーション2024/2/1
ROS抽象化に基づく統一インターフェースで、コード生成による実機・シミュレーション両対応のロボットマニピュレーションパイプラインと自由記述タスクのベンチマークを提案。
- DOZE: 動的環境におけるオープン語彙ゼロショット物体ナビゲーションのためのデータセットナビゲーション2024/2/1
動く障害物や多様な物体、テキスト手がかりを含む高忠実度3Dシーンと18k以上のタスクからなるゼロショット物体ナビゲーション用データセットを提案し、既存手法の課題を明らかにした。
- RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis2024/2/1
- VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model2024/1/1
- SkillDiffuser: Interpretable Hierarchical Planning via Skill Abstractions in Diffusion-Based Task Execution2023/12/1
- Tree-Planner: Efficient Close-loop Task Planning with Large Language Models2023/10/1
- Human-oriented Representation Learning for Robotic Manipulation2023/10/1
- LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving2023/10/1
- EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought2023/5/1
- AdaptDiffuser: Diffusion Models as Adaptive Self-evolving Planners2023/2/3
- EUCLID: Towards Efficient Unsupervised Reinforcement Learning with Multi-choice Dynamics Model2022/10/1
- CO^3: Cooperative Unsupervised 3D Representation Learning for Autonomous Driving2022/6/1
- Model-based Chance-Constrained Reinforcement Learning via Separated Proportional-Integral Lagrangian2021/8/1
- Steadily Learn to Drive with Virtual Memory2021/2/1
- Mixed Reinforcement Learning with Additive Stochastic Uncertainty2020/3/1