Jiangmiao Pang
Shanghai Artificial Intelligence Laboratory
収録論文 100本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VCN-Bench:事前視覚経験に基づく空間推論のためのビデオ文脈化ナビゲーションベンチマークナビゲーション2026/9/28
事前に撮影された動画を手がかりに、指示された目的地を推論してナビゲーションする新ベンチマークVCN-Benchを提案し、MLLMの閉ループ空間推論能力を評価した。
- Skel-WAM: 人間からロボットへの操作スキル転移を実現する手骨格条件付きワールドアクションモデル模倣学習/人間からロボットへの転移2026/9/18
人間とロボットの手の骨格を共通インターフェースとして用い、人間の動画とロボットの実演を統合学習することで、実機の双腕操作タスクの成功率を大幅に向上させた研究。
- 適応的動作計画と追従による人型ロボットのプロテニススタイル実現ヒューマノイド/模倣学習/sim2real2026/8/20
放送映像からプロのテニス動作を学習し、適応機構でシミュレーションと実機のギャップを埋めることで、人型ロボットにプロ級のサーブとラリーを実現するフレームワークを提案した。
- RoboStriker: 自律型ヒューマノイドボクシングのための潜在空間戦略ゲーム強化学習/ヒューマノイド2026/8/17
ヒューマノイドボクシングを2プレイヤーの潜在空間ゼロサムマルコフゲームとして定式化し、戦略的探索と物理的実現性の矛盾を解決する階層的フレームワークを提案した。
- GAUGE: 物理的忠実性を測定するための実世界基盤ベンチマーク物理シミュレーション/ベンチマーク2026/8/1
シミュレーションエンジンと生成ビデオワールドモデルの物理的忠実性を、実世界の軌跡に基づいて診断するベンチマークを提案した。22のタスクファミリーで剛体・柔軟物・布・変形物体の物理過程を評価し、既存の物理エンジンやビデオモデルの不一致を明らかにした。
- X-NavDP: グループQスコア再重み付けマッチングによる新規行動と異種エンボディメントへのナビゲーション拡散ポリシーの一般化ナビゲーション2026/7/1
ナビゲーション拡散ポリシーを強化学習で事後訓練し、多様なロボット形態や困難なシナリオへの一般化を向上させるフレームワークGQRMを提案。シミュレーションと実世界で成功率を大幅に改善した。
- Cortex: 長期的操作のための双方向整合型具現化エージェントフレームワークVLA/操作2026/7/1
高レベルVLMと低レベルVLAの間の計画ギャップを埋めるため、32の標準スキルプリミティブと実行可能性原則を導入し、4k時間以上のビデオデータと30時間のシミュレーションデータを自動生成して、長期的操作タスクを改善するフレームワークを提案した。
- 探索・対話・展開可能:オープンワールド移動操作のための視覚駆動型具現化エージェント移動操作2026/7/1
実世界展開可能な移動操作エージェントのためのフレームワークREALを提案し、シミュレーションと実機のギャップを埋める環境とベンチマークを構築、物理ロボットで高い成功率を達成した。
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- 人型ロボットのためのスケーリング行動基盤モデル人型ロボット制御2026/7/1
人型ロボットの制御を大規模行動データで学習する行動基盤モデル(BFM)のスケーリング手法を提案し、学習パラダイム、データ、モデル構造の協調により性能が向上することを示した。
- RoboInter1.5: 身体性世界モデリングとロボット操作のための包括的中間表現スイート操作/データセット/世界モデル2026/7/1
ロボット操作と身体性世界モデリングのための、多様な中間表現(サブタスク、プリミティブスキル、物体・グリッパー接地、セグメンテーション、アフォーダンス、把持姿勢、接触点、動作軌跡など)を備えた大規模データセット、ベンチマーク、モデル群を構築した。
- KAI: データ効率的な関節物体操作のための運動学的認識インターフェースマニピュレーション2026/7/1
関節物体の運動学的構造を捉えた中間表現KAIを導入し、ポリシー学習に組み込むことで、少ないデモデータでも高い成功率を達成する手法を提案した。
- EBench: 汎用モバイル操作ポリシーの要素診断ベンチマーク/モバイル操作2026/6/1
単一の成功率スコアを超えて、汎用モバイル操作ポリシーの能力と汎化を多次元で診断するシミュレーションベンチマークを提案し、最新モデルの特性を明らかにした。
- ReactiveBFM: 汎用ヒューマノイド全身制御に向けたリアクティブ閉ループ動作計画ヒューマノイド制御2026/6/1
既存の行動基盤モデルは事前定義された動作しか実行できず環境変化に弱いため、生成型プランナーと追跡制御を閉ループで統合し、曝露バイアスを軽減するリアクティブな全身制御フレームワークを提案した。
- MemoryWAM: 持続的メモリによる効率的な世界行動モデリングマニピュレーション2026/6/1
ロボット操作のための世界行動モデルに、最近のフレーム、イベント境界アンカーフレーム、長期履歴を要約するコンパクトなgistトークンを組み合わせたハイブリッドメモリ設計を導入し、長期的な記憶依存タスクを効率的に処理する手法を提案した。
- STABLE: セマンティクスと物理の二重システムによるシミュレーション対応テーブルトップレイアウト生成シーン生成2026/5/1
タスク指示からシミュレーション可能なテーブルトップシーンを生成するため、意味推論と物理補正を交互に行う二重システムを提案した。
- Imagine2Real: ビデオ生成事前知識によるヒューマノイドと物体のゼロショット対話の実現ヒューマノイド操作2026/5/1
3Dデータ不足を補うため、ビデオ生成モデルから得た4D点軌跡と少数の重要点追跡を用いて、幾何モデル不要でヒューマノイドと物体の対話動作をゼロショットで生成するフレームワークを提案した。
- SIM1: 物理整合シミュレータによる変形物体世界でのゼロショットデータ拡張シミュレーション/変形物体操作2026/4/1
変形物体操作のための物理整合型シミュレータを提案し、少数の実デモから合成データを生成してポリシー学習を効率化する。実機で90%のゼロショット成功率を達成した。
- EgoSim: 身体化インタラクション生成のための自己中心的世界シミュレータシミュレーション/自己中心視点2026/4/1
自己中心視点の動画から3Dシーン状態を更新しながら、空間的に一貫したインタラクション動画を生成する閉ループ型シミュレータを提案。大規模単眼動画からのデータパイプラインと低コスト収集システムも導入。
- HiVLA: 視覚基盤中心の階層型身体化操作システムVLA/操作2026/4/1
高レベルの意味的計画と低レベルの運動制御を分離した階層型VLAシステムを提案し、VLMの推論能力を保ちつつ、拡散トランスフォーマーによる行動生成で長期的なスキル合成と細かい操作を向上させた。
- Tac2Real: オンライン強化学習とゼロショット実機展開のための信頼性の高いGPU視触覚シミュレーション触覚シミュレーション2026/3/1
接触を伴う操作タスク向けに、物理精度と計算効率を両立した軽量な視触覚シミュレーションフレームワークTac2Realを提案し、実機へのゼロショット転移を高成功率で実現した。
- FutureVLA: 視覚言語行動モデルのための統合視覚運動予測VLA2026/3/1
ロボットの行動予測において、視覚と運動の相互作用を捉える新しいアーキテクチャFutureVLAを提案。視覚情報と運動情報を分離しつつ、時間的連続性を保った統合予測を実現する。
- RL強化テレオペレーションと巧みな専門家混合VLAによる人間らしい操作の実現VLA/巧緻操作/触覚2026/3/1
高自由度の両手巧緻操作を可能にするため、RLで訓練した原子スキルによるデータ収集支援と、触覚・力覚を統合したVLAアーキテクチャを提案し、接触を伴う複雑タスクで成功率を2倍に向上させた。
- ロボットの触覚を感じる:器用な操作のための触覚フィードバックアレイグローブ遠隔操作/触覚2026/3/1
高精度な磁気式モーションキャプチャと指先の触覚アクチュエータアレイを組み合わせた低コストグローブを開発し、触覚を活用した遠隔操作による器用なマニピュレーションを実現した。
- ForceVLA2: 力認識によるハイブリッド力-位置制御で接触を伴う操作を実現VLA/操作2026/3/1
接触を伴う操作のための視覚言語行動モデルに、力認識とハイブリッド力-位置制御を導入し、成功率を大幅に向上させた。
- 万能ポリシー:幾何学を考慮した行動潜在表現による異種ロボット間操作マニピュレーション2026/3/1
異なるロボット間で共有可能な行動潜在表現を学習し、単一のポリシーで複数のロボットを操作するフレームワークを提案。
- UltraDexGrasp: 合成データによる双腕ロボットの汎用器用把持の学習把持2026/3/1
双腕ロボットのための多戦略・器用な把持を実現するフレームワークを提案し、大規模合成データセットと単純なポリシーでゼロショットの実機転送に成功した。
- DexImit: 単眼人間動画からの両手巧みなマニピュレーション学習マニピュレーション2026/2/1
単眼の人間の操作動画を物理的に妥当なロボットデータへ自動変換する4段階パイプラインを提案し、両手巧みなマニピュレーションの学習を可能にした。
- ST4VLA: 視覚言語行動モデルのための空間誘導訓練VLA2026/2/1
VLMに空間的な事前知識を組み込む二段階訓練でロボットの行動生成を改善し、SimplerEnvで新たなSOTAを達成した研究。
- 異なるヒューマノイド間で汎用化する全身制御フレームワークXHugWBC全身制御/sim2real2026/2/1
形態をランダム化した多数のヒューマノイドで一度学習させることで、未知の機体にもゼロショットで転移できる汎用全身制御ポリシーを実現した。
- EAGLE: 具現化を考慮した汎用・特化蒸留による統合ヒューマノイド全身制御全身制御2026/2/1
汎用ポリシーとロボット特化ポリシーを反復的に蒸留し合うことで、複数の異なるヒューマノイドを単一のポリシーで制御できる全身制御手法を提案した。
- ロボットマニピュレーション方策のための行動空間設計の謎を解くマニピュレーション2026/2/1
双腕ロボットでの大規模実験により、模倣学習における行動空間の設計(絶対vs差分、関節空間vsタスク空間)が方策の学習性と制御安定性に与える影響を体系的に分析した。
- SoMA: ロボットによる柔軟物体操作のための実世界-シミュレーション間ニューラルシミュレータsim2real2026/2/1
3Dガウススプラッティングを用いて、柔軟物体の変形・環境力・ロボット関節動作を統合的な潜在ニューラル空間でモデル化し、実世界のロボット操作を高精度に再現・汎化する実世界-シミュレーション間シミュレータを提案。
- HumanX: 人間の動画からヒューマノイドの俊敏で汎用的なインタラクションスキルを獲得模倣学習2026/2/1
人間の動画から物理的に妥当なロボット動作データを生成し、模倣学習でUnitree G1にゼロショット転移するフレームワーク。バスケやサッカーなど5領域10スキルを獲得。
- Robo3R: 高精度フィードフォワード3D再構成によるロボットマニピュレーションの強化マニピュレーション2026/2/1
RGB画像とロボット状態から実時間でメートルスケールの3Dシーンを再構成するフィードフォワードモデルを提案し、模倣学習や把持生成などの操作タスクで性能を向上させた。
- RoboInter:ロボットマニピュレーションのための包括的中間表現スイートマニピュレーション2026/2/1
ロボット操作のためのデータ・ベンチマーク・モデルを統合した中間表現スイートを提案し、大規模データセットとVQAベンチマーク、計画実行フレームワークを提供する。
- Nimbus: 具現化知能向け統合合成データ生成フレームワーク合成データ生成2026/1/1
ナビゲーションとマニピュレーションの合成データ生成パイプラインを統合し、非同期実行と動的スケジューリングでスループットを2〜3倍向上させるフレームワークを提案。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- RoboVIP: 視覚的アイデンティティプロンプティングによる多視点動画生成でロボットマニピュレーションを強化マニピュレーション2026/1/1
ロボット操作データを拡張するため、見本画像を条件に多視点で時間的に一貫した動画を生成する手法を提案し、模擬環境と実機で方策性能を向上させた。
- UniCon:異種ロボット間の効率的な学習転送を実現する統合システムsim2real2026/1/1
ロボットの状態・制御・計測を標準化し、実行グラフでワークフローを分解する軽量フレームワークUniConを提案。ROSより高効率な推論とsim-to-real転送を実現し、7社12機種以上で実証。
- RoboStriker: 自律ヒューマノイドボクシングのための階層的意思決定ヒューマノイド制御2026/1/1
人間のモーションキャプチャからボクシングスキルを学習し、潜在空間での自己対戦強化学習により、シミュレーションと実機で競技可能なヒューマノイドボクシングを実現した。
- VLNVerse:多様・身体性・リアルなシミュレーションと評価を備えた視覚言語ナビゲーションのベンチマークVLN2025/12/1
視覚言語ナビゲーション(VLN)の既存ベンチマークの限界を克服するため、多様なタスクを統合し、物理エンジンによる身体性とリアルなシミュレーションを実現した大規模ベンチマークVLNVerseを提案し、既存手法の評価と統合マルチタスクモデルを提示した。
- LoGoPlanner: メートル法に基づく視覚幾何と自己位置推定を統合したナビゲーション方策ナビゲーション2025/12/1
絶対スケールの視覚幾何バックボーンを微調整し、周囲形状の再構成と暗黙的状態推定を組み合わせることで、外部キャリブレーション不要のエンドツーエンド移動ロボットナビゲーションを実現した。
- MM-ACT: マルチモーダル並列生成から行動を学習する統合VLAモデルVLA2025/12/1
テキスト・画像・行動を共有トークン空間で統合し、並列デコードで生成するVLAモデルを提案。LIBEROや実機Franka、RoboTwin2.0で高い成功率を達成した。
- VL-LN Bench:能動的対話による長期的目標指向ナビゲーションに向けてナビゲーション2025/12/1
対話を通じて曖昧な指示を解決しながら特定物体を探索する新しいナビゲーションタスクIIGNと、そのための大規模ベンチマークVL-LN Benchを提案した。
- ゆっくり理解し、素早く動く:汎用視覚言語ナビゲーションのための二重システム基盤モデルVLA2025/12/1
VLMによる高レベル計画と拡散トランスフォーマによる低レベル行動生成を組み合わせ、動的環境でもリアルタイムに適応できる視覚言語ナビゲーション基盤モデルを提案した。
- H-Zero: ヒューマノイド横断歩行事前学習による少数ショット新規身体転移歩行2025/12/1
複数のヒューマノイドで歩行方策を事前学習し、未知のヒューマノイドや直立四足歩行ロボットへ30分の微調整で転移できることを示した研究。
- InternData-A1:汎用ポリシー事前学習のための高忠実度合成データVLA2025/11/1
大規模シミュレーションで生成した63万軌道超の合成データセットInternData-A1を構築し、合成データのみでVLAモデルを事前学習しても実データと同等の性能が得られることを示した。
- Gallant: ボクセルグリッドによる3次元制約地形でのヒューマノイド歩行と局所ナビゲーション歩行2025/11/1
LiDARをボクセル化してzグループ化2D CNNで制御方策に写像し、3D制約地形でのヒューマノイド歩行・局所ナビゲーションを単一方策で実現した研究。
- 適応的な動作追従による柔軟なヒューマノイド制御ヒューマノイド制御2025/10/1
単一の参照動作からキーフレームを抽出・編集してデータを拡張し、追従速度を調整するアダプタを学習することで、ヒューマノイドが多様な実環境条件に動作パターンを保ちながら適応できる手法を提案。
- X-VLA:ソフトプロンプト付きTransformerによるスケーラブルなクロスエンボディメント視覚言語行動モデルVLA2025/10/1
多様なロボットのデータ源ごとに学習可能なソフトプロンプトを割り当てることで、異なる機体を横断して学習できる汎用VLAモデルX-VLAを提案し、6つのシミュレーションと3体の実機でSOTA性能を示した。
- ヒューマノイドゴールキーパー:位置条件付きタスク運動制約からの学習ヒューマノイド2025/10/1
人間の運動事前分布を敵対的学習で取り込み、ヒューマノイドが高速で飛来するボールを自律的に自然な全身動作で阻止する強化学習フレームワークを実現した。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- 専門性は独占する必要なし:視覚-言語-行動学習のための行動特化型Mixture of ExpertsVLA2025/10/1
事前学習済みVLAモデルの重みを継承し、フィードフォワード層をスパースなMoE層に置き換えて拡張するAdaMoEを提案。専門家選択と重み付けを分離することで協調的な専門家利用を実現し、計算効率を保ちつつ性能を向上させた。
- PhysHSI:実世界で汎化可能な自然なヒューマノイド・シーンインタラクションシステムヒューマノイド2025/10/1
シミュレーションでの敵対的動作事前分布に基づく方策学習と、LiDARとカメラを組み合わせた粗から細への物体位置推定により、ヒューマノイドが実世界で物体運搬や着座などの多様なインタラクションを自然に自律実行できるシステムを構築した。
- ロボット実世界強化学習のための視覚-言語-行動-批評家モデルVLA2025/9/1
大規模データで学習したVLAベースのプロセス報酬モデルVLACを提案し、報酬設計を不要にするとともに、実世界のマニピュレーション4タスクで成功率を約30%から約90%へ向上させた。
- SimpleVLA-RL:強化学習によるVLAモデル訓練のスケーリングVLA2025/9/1
VLAモデル向けの効率的な強化学習フレームワークを提案し、大規模データへの依存を減らしつつLIBEROやRoboTwinで高性能を達成した。
- InternScenes: 現実的なレイアウトを持つ大規模シミュレーション可能屋内シーンデータセットsim2real2025/9/1
実世界スキャン・手続き生成・デザイナー作成の3ソースを統合し、約4万シーン・196万物体を含む大規模でシミュレーション可能な屋内3Dシーンデータセットを構築した。
- MesaTask: 3D空間推論によるタスク駆動型卓上シーン生成シーン生成2025/9/1
タスク指示から物理的に妥当な卓上シーンを生成するため、空間推論チェーンとDPOで強化したLLMフレームワークMesaTaskを提案し、大規模データセットMesaTask-10Kを構築した。
- ヒューマノイドロボットのための行動基盤モデル全身制御2025/9/1
大規模な行動データセットで事前学習した生成モデルにより、ヒューマノイドの全身制御を多様なタスクに汎化させ、新しい行動へ迅速に適応できるようにした研究。
- F1: 理解と生成を行動に橋渡しする視覚-言語-行動モデルVLA2025/9/1
将来の視覚状態を予測する「視覚的先見」を意思決定に組み込み、それを目標として逆動力学で行動を生成するVLAフレームワークF1を提案し、実世界タスクとシミュレーションで成功率と汎化性能を大幅に向上させた。
- 離散拡散VLA:視覚言語行動ポリシーの行動デコーディングに離散拡散を導入VLA2025/8/1
行動チャンクを離散化し、統合トランスフォーマー内で離散拡散により並列デコーディングするVLAを提案。適応的なデコーディング順序と再マスキングで誤り訂正を行い、LIBEROやSimplerEnvで高い成功率と事前学習能力の保持を実現した。
- UniTracker: ヒューマノイドロボットのための汎用全身運動トラッカー学習全身運動制御2025/7/1
3段階の学習フレームワークで、多様な人間の動きをヒューマノイドロボットが追従できる汎用全身運動トラッカーを実現し、実機でも高い性能を示した。
- StreamVLN:スローファスト文脈モデリングによるストリーミング視覚言語ナビゲーションVLA2025/7/1
視覚と言語の入力からリアルタイムに行動を生成するVLN向けに、高速な対話文脈と低速更新の記憶文脈を組み合わせたストリーミングフレームワークを提案し、低遅延で最先端性能を達成した。
- InstructVLA: 理解から操作へと導く視覚-言語-行動インストラクションチューニングVLA2025/7/1
大規模視覚言語モデルの推論能力を保ちつつ、身体性推論を活用して操作性能を高める新しいVLAモデルと学習法を提案し、汎化ベンチマークで大幅な改善を示した。
- 視覚言語ナビゲーションにおける身体性ギャップの再考:物理的・視覚的格差の包括的研究VLA2025/7/1
人型・四足・車輪ロボットに対応した物理的に現実的なVLN評価プラットフォームVLN-PEを提案し、既存のVLN手法が実機環境で性能劣化する要因を体系的に分析した。
- GenManip: LLM駆動シミュレーションによる汎化可能な指示追従マニピュレーションマニピュレーション2025/6/1
LLM駆動のシーングラフで多様なタスクを自動生成する卓上シミュレーション環境GenManipと、200シナリオのベンチマークGenManip-Benchを提案し、モジュール型とエンドツーエンド方策の汎化性能を比較評価した。
- CronusVLA: マルチフレーム視覚-言語-行動モデリングによる効率的で堅牢なマニピュレーションVLA2025/6/1
単一フレームのVLAモデルをマルチフレームに拡張し、特徴チャンキングで履歴情報を集約することで、計算負荷を抑えつつ操作性能と観測の堅牢性を向上させた。
- GLEAM: 複雑な3D屋内環境における能動的マッピングのための汎化可能な探索方策の学習能動的マッピング/探索2025/5/1
合成・実スキャンの1,152シーンからなる大規模ベンチマークGLEAM-Benchを構築し、意味表現と長期目標・ランダム化戦略で未知の複雑シーンでも高被覆・高精度に探索する汎化可能な能動的マッピング方策を提案した。
- NavDP:特権情報ガイダンスを用いたSim-to-Realナビゲーション拡散ポリシーの学習ナビゲーション2025/5/1
シミュレーションのみで学習し、RGB-D観測から軌道生成と評価を統合的に行う拡散ポリシーにより、多様な環境とロボット形態へのゼロショットsim-to-real転移を実現した。
- TeleOpBench:双腕巧みなテレオペレーションのためのシミュレータ中心ベンチマークテレオペレーション2025/5/1
双腕巧みなテレオペレーションの4つの方式(モーションキャプチャ、VR、外骨格、単眼視覚追跡)を30の高忠実度タスクで公平に比較評価するシミュレータベンチマークを提案し、実機実験との相関を確認した。
- LabUtopia:科学実験エージェントのための高忠実度シミュレーションと階層的ベンチマークsim2real2025/5/1
実験室での科学作業を自動化する身体性エージェントの研究を進めるため、物理・化学反応を扱える高忠実度シミュレータ、多様な実験シーンの自動生成器、5段階の難易度を持つ階層的ベンチマークを統合したスイートを提案。
- 両手ロボット操作のためのインターフェースとしてのグリッパーキーポーズと物体点流マニピュレーション2025/4/1
グリッパーの目標姿勢と物体の点流を予測するインターフェースを連続行動推定と統合し、両手操作の精度と柔軟性を高めるフレームワークPPIを提案した。
- 自動運転のための遅延を考慮した3Dストリーミング知覚に向けて3D知覚2025/4/1
実行時遅延を考慮したオンライン評価ベンチマークを提案し、遅延を考慮した履歴統合と予測検出により、Jetson AGX Orin上でオフライン性能の80%を達成する3Dストリーミング知覚フレームワークを構築した。
- ガウススプラッティングによる新規デモ生成で実現するロバストなワンショットマニピュレーションマニピュレーション2025/4/1
3Dガウススプラッティングで再構成したシーンを直接編集し、多様で視覚的にリアルなデモを生成することで、ワンショット設定での視覚運動政策の汎化性能を大幅に向上させる手法RoboSplatを提案。
- RoboGround: 接地視覚言語事前知識を用いたロボットマニピュレーションマニピュレーション2025/4/1
視覚言語モデルによるグラウンディングマスクを中間表現として用い、対象物の位置・形状情報を政策ネットワークに与えることで汎化性能を高めるロボット操作システムを提案。大規模シミュレーションデータ生成パイプラインも構築した。
- Aether: 幾何学認識を統合した統一的世界モデリング世界モデル2025/3/1
4D動的再構成・行動条件付き動画予測・目標条件付き視覚計画を同時に学習する世界モデルを提案し、実世界データなしでもゼロショットで汎化できることを示した。
- ロボット学習のための事前学習済み視覚モデルのデータ中心再検討VLA2025/3/1
ロボット学習用の視覚モデルにおいて、非物体中心データでも物体中心表現を獲得できるSlotMIMを提案し、認識・シーン理解・ロボットタスクで性能を向上させた。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- HOMIE: 同型外骨格コックピットによるヒューマノイドの移動・操作遠隔操作2025/2/1
ペダル・同型外骨格アーム・モーションセンシンググローブを統合した半自律遠隔操作システムで、ヒューマノイドの全身移動と器用な物体操作を低コストかつ効率的に実現する。
- BeamDojo: 疎な足場上での俊敏なヒューマノイド歩行の学習歩行2025/2/1
多角形の足に適したサンプリングベースの足場報酬と二重クリティック、2段階強化学習を組み合わせ、疎な足場を正確に踏み分けるヒューマノイド歩行を実現した。LiDARによるオンボード標高マップで実機展開も可能。
- Re$^3$Sim: 3DフォトリアルなReal-to-Simによる高忠実度シミュレーションデータ生成sim2real2025/2/1
実世界の3D再構成とニューラルレンダリングでフォトリアルなシミュレーション環境を構築し、模倣学習でロボット操作方策を訓練、ゼロショットで実機転移を実現した研究。
- 多様な移動を実現する統合型ヒューマノイド全身コントローラ歩行2025/2/1
歩行・跳躍・ホッピングなど多様な歩容をパラメータ調整可能に生成し、上半身操作との統合も可能にするヒューマノイド全身制御ポリシーHugWBCを提案した。
- VB-Com: 知覚欠損下でも歩行可能な視覚・盲複合ヒューマノイド制御歩行2025/2/1
視覚ポリシーと盲ポリシーを状況に応じて切り替える複合フレームワークVB-Comを提案し、知覚が不十分な動的環境でもヒューマノイドが安定して歩行できることを示した。
- 多様な姿勢からのヒューマノイド起立制御の学習sim2real2025/2/1
強化学習により、多様な姿勢から実機ヒューマノイドが滑らかに起立できる制御則を学習し、シミュレーションから実世界への転移を実現した。
- 予測的逆動力学モデルによるロボットマニピュレーションのスケーラブル学習マニピュレーション2024/12/1
ロボットの予測視覚状態に基づく逆動力学モデルで行動を予測するPIDMを提案し、大規模データで事前学習したSeerがシミュレーションと実世界で大幅な性能向上を達成した。
- 知覚的内部モデルによるヒューマノイドの歩行学習歩行2024/11/1
機体周辺の高さマップを内部モデルとして用い、ノイズに強く低計算コストでヒューマノイドの階段昇降を含む不整地歩行を実現した研究。
- VLM-Grounder: ゼロショット3D視覚グラウンディングのためのVLMエージェント3D視覚グラウンディング2024/10/1
2D画像のみを用いた視覚言語モデルにより、3D点群や物体事前情報なしで自然言語指示に基づく3D物体の位置推定をゼロショットで実現したフレームワーク。
- GRUtopia:大規模都市で汎用ロボットを夢見るsim2real2024/7/1
10万の対話可能なシーンからなる都市規模のシミュレーション環境と、LLM駆動のNPCによる社会シミュレーション、脚式ロボット向けベンチマークを提供し、Embodied AIのSim2Real研究を加速するプロジェクト。
- Dense CLIPによるセマンティックマップの汎化で実現するオープンボキャブラリ物体ゴールナビゲーション物体ゴールナビゲーション2024/7/1
テキストのみの学習でセマンティックマップ予測ネットワークを訓練し、Dense CLIP特徴を活用して未知環境・未知物体へのオープンボキャブラリ物体ナビゲーションを効率よく実現するフレームワークOVExpを提案。
- CooHOI: 操作物体の動力学を活用した協調的人間-物体インタラクションの学習マニピュレーション2024/6/1
単一ヒューマノイドの模倣学習とマルチエージェント強化学習を組み合わせ、複数体で協調して物体を運ぶスキルを獲得するフレームワークを提案。
- MMScan: 階層的接地言語アノテーション付きマルチモーダル3Dシーンデータセット3Dシーン理解2024/6/1
領域から物体レベルまでの階層的な言語アノテーションを備えた大規模マルチモーダル3Dシーンデータセットを構築し、3D視覚接地と質問応答のベンチマークを提供した。
- H∞ロコモーション制御の学習歩行2024/4/1
四足歩行ロボットの頑健な歩行制御を、状態に依存した学習可能な外乱との敵対的相互作用として定式化し、H∞制約で安定に最適化する手法を提案した。
- RoboDuet:四足ロボットの全身協調移動操作のための協調ポリシー学習移動操作2024/3/1
四足ロボットとアームの全身制御を、移動と操作の2つの協調ポリシーで実現し、類似形態のロボットへのゼロショット転移も可能にしたフレームワーク。
- RoboKeyGen: 拡散モデルによる3Dキーポイント生成を用いたロボット姿勢と関節角度の推定姿勢推定2024/3/1
2Dキーポイント検出と拡散モデルによる3Dキーポイント生成に分けてロボットの姿勢と関節角度を推定し、従来法より高精度・高速に実現するフレームワークを提案。
- GenNBV: 能動的3D再構成のための汎化可能な次善視点ポリシー能動的3D再構成2024/2/1
強化学習を用いて、任意の視点から撮影できるドローンの次善視点ポリシーを学習し、未知の大規模物体でも高い被覆率で3D再構成を自動化した。
- Hybrid Internal Model: Learning Agile Legged Locomotion with Simulated Robot Response2023/12/1
- EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI2023/12/1
- Monocular 3D Object Detection with Depth from Motion2022/7/1
- FCOS3D: Fully Convolutional One-Stage Monocular 3D Object Detection2021/4/1