Shanghang Zhang
Beijing Academy of Artificial Intelligence
収録論文 107本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Token-World: 視覚言語モデルのトークン空間におけるロボット操作のための世界モデリングVLA2026/9/30
VLAモデルの視覚トークンを圧縮した状態空間で未来のダイナミクスを予測する世界モデルを提案し、操作ベンチマークで予測精度と方策整合性を向上させた。
- RoboFL: 世界行動モデルのための連合エキスパートアセンブリVLA/連合学習2026/9/28
各クライアントが訓練したLoRAアダプタをサーバー側MoEのエキスパートとして組み込み、ルーティングとエキスパートを協調学習する連合学習フレームワークを提案。実機Frankaで集中学習を12.23%上回り、通信量を最大86.81%削減した。
- DexRoam: 一人称全身人間デモンストレーションからの移動型両腕巧緻マニピュレーション学習VLA2026/9/28
VRヘッドセットと頭部搭載ステレオカメラだけで全身の人間デモを収集し、身体・動作意味・時間の3段階アライメントでロボット動作空間に変換することで、移動しながらの両腕巧緻操作をVLAポリシーで学習可能にした。
- LiMA: 非同期拡散による長期想像からリアルタイム巧みな操作への橋渡しマニピュレーション2026/9/23
低速な長期意図生成と高速な動作精緻化を非同期に分離した二重システム拡散フレームワークで、両腕巧みな操作をリアルタイムに実行する。
- ActiveArena:ロボットマニピュレーションにおける能動的知覚のベンチマークと理解VLA2026/9/21
能動的知覚と操作を評価するためのシミュレータと35タスクのベンチマーク、および13種のVLA構成を提案し、記憶管理やOOD汎化の要因を分析した。
- DeCAL: 接触認識型潜在共想像による物理基盤の巧みな視覚-言語-行動モデル巧みな操作/VLA/触覚2026/9/8
接触の多い巧みな操作のための、触覚を適応的に統合し視覚と触覚のダイナミクスを共同で想像する新しいVLAモデルを提案し、高い成功率と汎化性能を達成した。
- RoboDreamer: 予測状態空間モデルによる先読み型ヒューマノイド歩行歩行2026/9/7
観測マスキングと蒸留を用いた2段階教師-学生フレームワークで、不完全なセンシング下でも安定したヒューマノイド歩行を実現する。
- OpenWAM: 体系的な世界行動モデル事前学習に向けたオープンでモジュール型の探求VLA2026/9/7
世界行動モデルの設計空間をモジュール化し、制御実験を通じて設計原則を抽出・検証するオープンな研究基盤を構築した。
- ロボットの世界モデルは本当に行動に従うのか?行動条件付き生成の診断とポリシー学習のための整合世界モデル/行動条件付き生成2026/8/25
ロボットの世界モデルが任意の行動に正しく従うかを評価するベンチマークWorldEchoを導入し、既存モデルが専門家の行動は再現できるが多様な非専門家軌道では失敗することを示した。さらに、行動追従を強化するWorldSyncを提案し、シミュレーションと実機タスクでポリシー改善の信頼性を向上させた。
- HAF: 階層的アクションフローとスペクトル潜在RLによる汎用VLAのヒューマノイド全身移動操作への適応ヒューマノイド/VLA/強化学習2026/8/17
汎用VLA基盤モデルをヒューマノイドの全身移動操作に適応させるための2部構成フレームワークHAFを提案。階層的なアクション生成とオンラインRLによるポリシー改善を実現する。
- ロボ・ドーパミン2.0:ロボット操作のための履歴条件付き・OOD認識プロセス報酬モデリングマニピュレーション2026/8/16
VLAモデルのロボット操作における報酬設計を改善するため、履歴とOOD(分布外)を考慮したプロセス報酬モデルを提案し、ペアワイズ予測インターフェースとSigned-Hopカリキュラムで学習精度を向上させた。
- ω-0: 人間型ロボットの同時移動操作のための潜在予測世界行動モデルヒューマノイド2026/8/1
言語指示と視覚・状態入力から、移動と操作を同時に行う全身行動を直接予測する世界行動モデルを提案し、実機で11種類の家庭タスクを達成した。
- WorldSimProbe: 身体的操作のための行動条件付きワールドモデルにおけるシミュレータ忠実度の診断シミュレーション評価2026/8/1
行動条件付きワールドモデル(ACWM)が物理シミュレータとして忠実に機能するかを検証するための評価手法「WorldSimProbe」を提案し、複数のベンチマークで既存モデルの欠陥を明らかにした。
- 多段階視覚推論のための階層的デノイジングビデオ生成/推論2026/7/16
因果的ビデオ生成に階層的潜在変数を統合し、粗い推論から細かい推論へと段階的に進めることで、複雑な多段階視覚推論タスクを効率的に解決するフレームワークを提案した。
- TACO: 触覚を考慮した世界モデルによるスケーラブルなVLAポストトレーニングの自己修正VLA/触覚/操作2026/7/1
接触を伴う操作タスクで失敗するVLAモデルに対し、触覚を考慮した世界モデルを用いて失敗状態を認識し、修正動作を想像・ラベル付けすることで、人間の介入なしにポリシーを改善するフレームワークを提案した。
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- FBFM: ワールドアクションモデル実行のための訓練不要な非同期フィードバック機構VLA2026/7/1
フローマッチングに基づくワールドアクションモデルにおいて、チャンク境界を待たずに実観測を内部フィードバックとして注入し、長期タスクでのドリフトを抑制する訓練不要の推論機構を提案した。
- Lift3D-VLA: 3次元幾何と動力学を考慮した操作のためのVLAモデルのリフティングVLA/操作2026/7/1
VLAモデルに明示的な3次元点群推論と時間的に一貫した行動生成を組み込む統一フレームワークを提案。2Dモデルを3Dに持ち上げる戦略と自己教師あり学習で幾何と物理ダイナミクスを内部化し、LLMの多層で行動チャンクを予測する。
- WAM-RL: 再構成報酬とオンラインビデオSFTを用いたワールド・アクションモデル強化学習強化学習2026/6/1
ワールドモデルとアクションモデルをオンライン環境相互作用で共同最適化する強化学習フレームワークを提案し、長期的タスクでの性能向上を実証した。
- SafeDojo: インタラクティブワールドモデルによるVLAのための安全強化学習安全強化学習/VLA2026/6/1
視覚言語行動(VLA)ポリシー向けに、ワールドモデルベースの想像を通じて安全な行動を学習する初のモデルベース安全強化学習フレームワークを提案。
- MV-WAM: 多様体を考慮した価値拡張付き世界行動モデル操作2026/6/1
視覚と行動のモダリティ間の構造的不整合を解消するため、多様体認識最適化と価値誘導ロールバックを備えた世界行動モデルMV-WAMを提案し、ロボット操作の汎化性能を向上させた。
- Dream-Tac: 接触を伴うロボット操作のための統合触覚世界行動モデル触覚/操作2026/6/1
視覚と触覚を統合した世界行動モデルを提案し、接触を伴う操作タスクでの行動予測精度を向上させた。
- FORCE: 価値校正ウォームアップと自己蒸留による効率的なVLA強化学習ファインチューニングVLA/強化学習2026/6/1
VLAモデルの強化学習ファインチューニングを安定化・高速化する3段階フレームワークFORCEを提案。価値校正ウォームアップと自己蒸留でサンプル効率を改善し、シミュレーションと実機で成功率を大幅に向上させた。
- IOI: インタラクティブ世界モデルのための運動学と物理の分離世界モデル2026/6/1
解析的な運動学の事前知識と学習された物理ダイナミクスを組み合わせたハイブリッドなインタラクティブ世界モデルを提案し、正確な制御と物理的に妥当な視覚フィードバックを実現する。
- Efficient-WAM: 低コストな未来想像を備えた10億パラメータの世界行動モデルVLA2026/6/1
未来の視覚予測を圧縮し、推論コストを大幅に削減した世界行動モデルを提案。実機で約100msの低遅延を実現しつつ、制御性能を維持する。
- LaST-HD: スケーラブルな人間データからロボット操作の物理的推論を学習する操作学習2026/6/1
人間の手のデモンストレーションとロボットのデモンストレーションを共有の潜在推論空間で整列させ、物理ダイナミクスを内部化することで、ロボット操作の学習を改善する新しい手法を提案した論文。
- WAM4D: 空間レジスタトークンによる高速4DワールドアクションモデルVLA2026/6/1
ロボットの行動予測と未来観測を同時に行うワールドアクションモデルにおいて、軽量な空間レジスタトークンを用いて事前学習済みの幾何学的特徴を因果的なビデオ・アクショントランスフォーマーに転送し、高コストな幾何学的デコードを避けつつ4D空間整合性を向上させる手法を提案した。
- HarmoWAM: 適応的世界行動モデルによる汎用性と精密操作の調和ロボット制御2026/5/1
世界行動モデル(WAM)の2つのパラダイム間のトレードオフを解消するため、予測と反応の2つの専門家を世界モデルで統合し、適応的ゲーティングで切り替えるエンドツーエンドのWAMを提案した。
- Dexora: 高自由度両腕巧緻操作のためのオープンソースVLAVLA/操作2026/5/1
両腕・両手の高自由度操作を対象とした初のオープンソースVLAシステムDexoraを提案し、ハイブリッド遠隔操作とデータ品質を考慮した学習手法により、巧緻操作の成功率を大幅に向上させた。
- Demo-JEPA: ワンショット異種エンボディメント模倣のための共同埋め込み予測アーキテクチャ模倣学習2026/5/1
デモンストレーションを動作ではなく将来の目標状態として捉え、JEPAベースの世界モデルで視覚デモを目標エージェントの潜在軌跡に変換し、自己の学習済みダイナミクスで計画・実行する異種エンボディメント模倣フレームワークを提案。
- ハイブリッド身体性タスクにおける長期的進化のためのワールド・エゴモデリング世界モデル2026/5/1
本論文は、長期的なハイブリッド身体性タスク(ナビゲーションと操作の組み合わせ)において、世界と自己の進化を分離してモデル化する新しいパラダイム「ワールド・エゴモデリング」を提案し、その実装としてWEMモデルとベンチマークHTEWorldを構築した。
- VEGA: 空間認識型視覚言語行動モデルのための視覚エンコーダ接地整列VLA2026/5/1
VLAモデルの視覚エンコーダ出力を、3D空間認識を持つDINOv2-FiT3Dの特徴に直接整列させることで、空間認識能力を向上させる軽量なフレームワークを提案。推論時には追加コストなしで性能が向上する。
- マスク世界モデル:ロバストなロボット政策学習のための重要要素予測VLA2026/4/1
動画生成事前学習に基づく世界モデルがロボット政策学習に有望だが、RGB予測は背景や照明などの無関係な要素に過適合しがち。本論文では、ピクセルではなくセマンティックマスクの進化を予測するマスク世界モデル(MWM)を提案し、幾何学的情報ボトルネックにより物理ダイナミクスと接触関係を捉えつつ視覚ノイズを除去。拡散ベースの政策ヘッドと統合し、LIBEROやRLBenchでSOTAを達成し、実世界実験でもロバスト性を示した。
- Hi-WM: 人間参加型ワールドモデルによるロボットポストトレーニングのスケーラブル化VLA/ポストトレーニング2026/4/1
実世界での介入を必要とせず、学習したワールドモデル内で人間が修正行動を提供することで、失敗箇所に集中したポリシー改善を実現するポストトレーニング手法を提案。実機操作タスクで成功率を大幅に向上させた。
- HEX: 人間型アライメント専門家によるクロスエンボディ全身操作全身操作/VLA2026/4/1
全身協調操作を実現するため、人間型ロボットに特化した状態中心フレームワークHEXを提案。多様な身体構造に適用可能な状態表現と、全身協調と時間的運動ダイナミクスをモデル化する専門家混合機構を導入し、実機での操作成功率と汎化性能を向上させた。
- LaST-R1: 適応的物理潜在推論によるロボット操作の強化学習強化操作学習2026/4/1
ロボット操作の基盤モデルに対し、潜在推論と行動生成を共同最適化する強化学習フレームワークを提案し、LIBEROベンチマークで99.9%の成功率を達成した。
- URDF-Anything+: シミュレーション可能な関節物体を単一画像からエンドツーエンド生成sim2real2026/3/1
単一のRGB画像から、関節パラメータを含むシミュレーション実行可能なURDFモデルを自己回帰拡散モデルで直接生成する手法を提案。
- SaPaVe: ロボットの視覚言語行動モデルにおける能動的知覚と操作の実現VLA/能動的知覚/操作2026/3/1
能動的知覚と操作を統合するエンドツーエンドフレームワークSaPaVeを提案し、カメラと操作の行動を分離しつつ協調学習することで、動的視点下でのロバストな能動的操作を実現した。
- PRM-as-a-Judge:ロボットの細粒度監査のための高密度評価パラダイムロボット評価2026/3/1
ロボットの実行品質をバイナリ成功率ではなく、プロセス報酬モデル(PRM)を用いて軌道ビデオから密に評価する新しいパラダイムを提案し、OPD指標体系と診断ベンチマークRoboPulseで検証した。
- 潜在推論VLA:視覚-言語-行動モデルのための潜在思考と予測VLA2026/2/1
Chain-of-Thought推論を連続潜在表現に内部化し、推論時の明示的生成を不要にすることで、最大90%の遅延削減を実現したVLAフレームワーク。
- 信頼できる視覚-言語-行動モデルのための行動誤差分布の再形成VLA2026/2/1
連続行動VLAモデルの学習に最小誤差エントロピー(MEE)目的関数を導入し、MSEと組み合わせることで成功率とロバスト性を向上させた研究。
- TwinRL: デジタルツイン駆動強化学習による実世界ロボットマニピュレーションVLA2026/2/1
スマホ撮影から高忠実度デジタルツインを構築し、SFT・ツインRL・実世界RLの3段階でVLAモデルの探索空間を拡張・誘導する協調ポストトレーニング手法を提案。
- AoE: 身体性AIのための常時オンの一人称視点人間動画収集システムデータ収集2026/2/1
スマホと首掛けホルダーを使い、誰でもどこでも一人称視点の実世界インタラクション動画を低コストで収集し、身体性基盤モデルの学習データ不足を解消するシステムを提案。
- デジタルからフィジカルへ:物理知能のための自律型コーチとしてのデジタルエージェントVLA2026/1/1
LLMエージェントが強化学習や模倣学習のタスク設計・デバッグ・最適化を自律的に行うベンチマークEmboCoach-Benchを提案し、人間設計を上回る性能を実証した。
- Wow, wo, val! 具現化世界モデル評価のためのチューリングテスト世界モデル評価2026/1/1
ロボット操作データ609件を用い、動画基盤モデルを世界モデルとして評価する5能力・22指標のベンチマークを提案し、人間の選好との相関0.93超を達成した。
- TC-IDM: 実行可能なゼロショットロボット動作のための動画生成の接地VLA2026/1/1
生成された動画から道具の3D軌道を抽出し、それを6自由度のエンドエフェクタ動作に変換する逆動力学モデルを提案。ゼロショットで変形物体操作を含むタスクを実現した。
- LaST₀:ロボット視覚言語行動モデルのための潜在時空間チェーン・オブ・ソートVLA2026/1/1
言語ではなく潜在空間で未来の視覚・3D・固有感覚を推論する時空間Chain-of-Thoughtを導入し、低頻度推論と高頻度行動生成を分離した二重システムVLAフレームワークを提案。
- Action-Sketcher: 視覚スケッチを介した長期的ロボット操作のための推論から行動へVLA2026/1/1
ロボットの視界に点・箱・矢印・関係を描く「視覚スケッチ」を中間表現として導入し、See-Think-Sketch-Actのサイクルで長期的な操作を実現するVLAフレームワークを提案。
- RoboBrain 2.5:奥行きを見据え、時間を心に刻むVLA2026/1/1
深度認識に基づく3D空間推論と、時間的な進捗予測を統合した次世代の身体性AI基盤モデルを提案し、複雑なマニピュレーションの精度と実行認識を向上させた。
- Robo-Dopamine: 高精度ロボットマニピュレーションのための汎用プロセス報酬モデリングマニピュレーション2025/12/1
多視点入力から段階的な進捗を理解する汎用報酬モデルを3400時間超のデータで学習し、理論的に整合した報酬整形で強化学習によるロボット操作を高精度化した。
- ロボティクスのための視覚言語モデルにおける推論を伴う空間トレースに向けてVLA2025/12/1
3D空間の参照と計測を統合したVLM「RoboTracer」を提案し、強化学習による多段階の空間推論を実現。大規模データセットとベンチマークも構築し、ロボットの長期的タスク実行に応用した。
- フリースタイルはできる?音声制御による表現豊かなヒューマノイド歩行歩行2025/12/1
音声から直接ヒューマノイドのダンスや身振りを生成する統一フレームワークRoboPerformを提案し、低遅延で高忠実な音声同期動作を実現した。
- RoboMIND 2.0:汎用身体知能のためのマルチモーダル両腕移動マニピュレーションデータセットマニピュレーション2025/12/1
6種類のロボットで集めた31万件超の両腕操作・移動マニピュレーション軌道(触覚・シミュレーション含む)を公開し、階層型VLM+VLAシステムMIND-2を提案した論文。
- 基盤モデル時代の身体性ロボットマニピュレーション:計画と学習の視点マニピュレーション2025/12/1
ロボットマニピュレーションの学習ベース手法を、高レベル計画と低レベル制御の統一的な枠組みで整理したサーベイ。言語・コード・動作・アフォーダンス・3D表現の推論や、入力モデリング・潜在表現学習・方策学習の分類を提示し、課題と展望を論じる。
- Video2Act: ロボットの時空間運動モデリングを備えた二重システム動画拡散ポリシーVLA2025/12/1
動画拡散モデルから前景境界とフレーム間運動を抽出して行動生成の条件に使い、低速なSystem 2と高速なSystem 1の非同期二重構成でロボット操作を高精度化した研究。
- RoboMirror: 模倣の前に理解する、動画からヒューマノイド歩行への変換VLA2025/12/1
VLMを用いて動画から視覚的な運動意図を抽出し、拡散ポリシーを条件付けることで、ポーズ再構成やリターゲティングなしにヒューマノイドの歩行を生成するフレームワークを提案。
- ManualVLA:思考連鎖による手順書生成とロボット操作を統合したVLAモデルVLA2025/12/1
目標状態から実行手順を推論する「Manual Chain-of-Thought」を導入し、手順書生成と操作実行をMixture-of-Transformersで統合したVLAモデルを提案。3D Gaussian Splattingによるデジタルツインで訓練データを自動生成する。
- DualVLA: 推論と行動の部分的デカップリングによる汎用身体性エージェントの構築VLA2025/11/1
ロボット実演で訓練したVLAモデルにマルチモーダル推論を追加すると行動性能が劣化する「行動退化」を解決するため、二層データ選別と二重教師適応蒸留を提案し、推論能力を保ちつつ行動精度を向上させた。
- XR-1: 統合視覚運動表現の学習による汎用視覚-言語-行動モデルVLA2025/11/1
視覚ダイナミクスとロボット運動を統合した離散潜在表現UVMCを二枝VQ-VAEで学習し、異種ロボットデータを横断する汎用VLAモデルXR-1を三段階学習で構築した研究。
- URDF-Anything: 3Dマルチモーダル言語モデルによる関節物体の構築sim2real2025/11/1
点群とテキストを入力とする3Dマルチモーダル大規模言語モデルで、関節物体の幾何分割と運動学パラメータをエンドツーエンドに予測し、ロボットシミュレーション用デジタルツインを自動生成する手法を提案。
- METIS: 多源自己中心データによる統合型巧みな視覚-言語-行動モデルの事前学習VLA2025/11/1
人間とロボットの自己中心視点データを統合した大規模データセットEgoAtlasと動作表現を用いて、巧みな操作のための視覚-言語-行動モデルを事前学習し、実世界タスクでの成功率と汎化性能を向上させた。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- RoboArmGS: ベジェ曲線補正による高品質なロボットアームのスプラッティングロボットアーム/3D再構成2025/11/1
URDFに基づく理想的な関節運動を学習可能なベジェ曲線で補正し、実世界の動きに即した高品質な3Dガウシアン表現を実現した研究。
- PIGEON: VLM駆動の関心点選択による物体ナビゲーション物体ナビゲーション2025/11/1
VLMを関心点(PoI)の選択に用いることで、未見屋内環境での物体ナビゲーションを効率的かつ検証可能にし、ゼロショットで最先端性能を達成した研究。
- RoboOS-NeXT:生涯学習・スケーラブル・堅牢なマルチロボット協調のための統合メモリフレームワーク群制御2025/10/1
空間・時間・身体性を統合した共有メモリSTEMを中核に、脳-小脳型の階層構造で異種ロボット群の生涯学習・動的タスク割当・障害復旧を実現するフレームワークを提案。
- OmniSAT: コンパクトな行動トークンによる高速自己回帰VLAVLA2025/10/1
行動をBスプライン符号化と多段残差量子化で圧縮トークン化し、自己回帰型VLAの系列長を6.8倍短縮して学習効率を高める手法を提案。
- TIGeR: ロボティクス向け視覚言語モデルにおけるツール統合幾何推論VLA2025/10/1
視覚言語モデルに外部ツールで正確な幾何計算を生成・実行させる枠組みを提案し、ロボット操作に必要なセンチメートル精度を実現した。
- RoboBench:マルチモーダル大規模言語モデルを身体化脳として評価する包括的ベンチマークVLA2025/10/1
マニピュレーションの意思決定を担う「身体化脳」としてのマルチモーダルLLMを、指示理解・知覚推論・汎化計画・アフォーダンス予測・失敗分析の5次元で評価するベンチマークを提案した。
- WristWorld: 4D世界モデルによるロボットマニピュレーションのための手首視点映像生成VLA2025/10/1
アンカー視点の映像から手首視点の映像を生成する4D世界モデルを提案し、VLAモデルのマニピュレーション性能を向上させた。
- 言語から運動へ:動作潜在ガイダンスによるリターゲティング不要なヒューマノイド制御VLA2025/10/1
言語指示から直接ヒューマノイドの動作を生成するフレームワークRoboGhostを提案し、従来の動作デコード・リターゲティングを省略して低遅延かつ高精度な制御を実現した。
- ロボットマニピュレーションの統合的理解に向けて:包括的サーベイマニピュレーション2025/10/1
ロボットマニピュレーション研究を、タスク別ベンチマーク・データセット・手法の統一的分類・ボトルネック・実応用まで幅広く整理した包括的サーベイ。
- SimpleVLA-RL:強化学習によるVLAモデル訓練のスケーリングVLA2025/9/1
VLAモデル向けの効率的な強化学習フレームワークを提案し、大規模データへの依存を減らしつつLIBEROやRoboTwinで高性能を達成した。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。
- MLA: ロボットマニピュレーションにおけるマルチモーダル理解と予測のためのマルチセンサリー言語行動モデルVLA2025/9/1
2D画像・3D点群・触覚を位置対応で統合し、将来のマルチセンサリー情報を予測する言語行動モデルを提案。接触の多い実世界タスクで従来の2D/3D VLAを大きく上回る。
- dVLA: マルチモーダル連鎖推論を備えた拡散型視覚-言語-行動モデルVLA2025/9/1
視覚・言語・行動を単一の拡散目的関数で統合し、マルチモーダル連鎖推論を活用したVLAモデルdVLAを提案。LIBEROで96.4%の成功率を達成し、実機Frankaでも多段階計画を要するタスクに成功。
- MotionTrans: 人間のVRデータでロボットマニピュレーション方策の動作レベル学習を実現マニピュレーション2025/9/1
VRで収集した人間の動作データを変換し、ロボットデータと重み付き共訓練することで、13タスクの動作をエンドツーエンド方策へ直接転移。9タスクはゼロショットで成功し、事前学習・微調整性能も40%向上。
- PoseDiff: ロボット姿勢推定と動画から行動への制御を橋渡しする統合拡散モデルVLA2025/9/1
単一のRGB画像からロボットの3Dキーポイントや関節角度を推定し、さらに動画のキーフレームから長期行動列を生成する拡散モデルを提案。姿勢推定と逆動力学を一つの枠組みで統合した。
- ManipDreamer3D:占有マップを考慮した3D軌道によるロボットマニピュレーション動画の生成マニピュレーション2025/9/1
入力画像から3D占有マップを再構成し、衝突を避けた3Dエンドエフェクタ軌道を計画して、その軌道を条件に拡散モデルでロボットのピックアンドプレース動画を生成する手法を提案した。
- LHM-Humanoid: 雑然とした環境での連続物体運搬のための長期的ヒューマンモーション制御マニピュレーション2025/8/1
物理シミュレーション上のヒューマノイドが、リセットなしで繰り返し物体を運ぶ長期的動作を実現するため、サイクル間の遷移を「回復可能性」として学習する手法を提案。
- NavA³: あらゆる指示を理解し、どこへでも移動し、何でも見つけるナビゲーション2025/8/1
高レベルな人間の指示を理解し、実環境で空間認識を伴う物体ナビゲーションを行う階層型フレームワークNavA³を提案。大規模データで訓練したモデルにより、オープンボキャブラリな物体特定と精密な移動を実現した。
- RoboBrain 2.0 技術報告VLA2025/7/1
視覚と言語を統合し、実環境での知覚・推論・計画を担う具現化基盤モデルRoboBrain 2.0を提案。7Bと32Bの2種類で、空間理解や時系列意思決定タスクで高い性能を示す。
- V2X協調自動運転のエンドツーエンド競技会:研究課題と進展V2X協調自動運転2025/7/1
V2X通信を活用した協調自動運転のエンドツーエンド競技会を開催し、帯域制約下での知覚・計画の課題と上位解法の傾向を分析した。
- RwoR: ロボットなしで方策学習するための人間の手の収集からのロボットデモンストレーション生成模倣学習2025/7/1
手首に装着したGoProで人間の手のデモを収集し、生成モデルでロボットグリッパのデモに変換することで、実機ロボットなしに操作方策を学習できる手法を提案。
- AC-DiT: 移動マニピュレーションのための適応協調拡散トランスフォーマ移動マニピュレーション2025/7/1
移動ベースとマニピュレータの協調を改善するため、ベース運動を事前情報として全身動作を予測する機構と、2D画像と3D点群の融合重みを動的に調整する知覚戦略を備えた拡散トランスフォーマを提案した。
- SpikePingpong:スパイク視覚を用いた高速・低速卓球ロボットシステムマニピュレーション2025/6/1
スパイク視覚と模倣学習を組み合わせ、高速な球検出と軌道予測を行うファスト・スローシステムで高精度なロボット卓球を実現した。
- Fast-in-Slow:高速操作と低速推論を統合するデュアルシステム基盤モデルVLA2025/6/1
VLMベースの推論システムに実行モジュールを部分的にパラメータ共有して組み込み、高速かつ精密なロボット操作を実現する統合型VLAモデルを提案。
- MinD: リアルタイム計画と暗黙的リスク分析のためのデュアルシステム世界モデルの学習VLA2025/6/1
低頻度の映像生成と高頻度の拡散ポリシーを非同期に組み合わせ、単一ステップの潜在特徴でリアルタイムに行動計画とリスク予測を行う世界モデルを提案。
- RoboRefer: ロボティクス向け視覚言語モデルにおける推論を伴う空間指示VLA2025/6/1
3D空間理解と多段階推論を可能にする視覚言語モデルRoboReferを提案し、大規模データセットRefSpatialとベンチマークRefSpatial-Benchを導入して、空間指示タスクで最先端性能を達成した。
- RoboOS: クロスエンボディメントとマルチエージェント協調のための階層型具現化フレームワークマルチエージェント協調2025/5/1
脳と小脳の階層アーキテクチャに基づき、異なる身体を持つロボット間の協調と長期タスクの計画・実行を可能にするオープンソースの具現化システムを提案。
- H2R: 動画からのロボット事前学習のための人間からロボットへのデータ拡張sim2real2025/5/1
一人称視点の人間動画をロボット視点の映像に変換するデータ拡張パイプラインH2Rを提案し、人間とロボットの見た目のギャップを埋めることで、シミュレーションと実機の両方で下流タスクの成功率を向上させた。
- CrayonRobo: 物体中心のプロンプト駆動型視覚-言語-行動モデルによるロボットマニピュレーションVLA2025/5/1
RGB画像に手書き風の2D視覚プロンプトを重ね、低レベル動作と高レベル計画を同時に指示する視覚-言語-行動モデルを提案。キーフレームごとに接触姿勢と移動方向をSE(3)空間で予測し、長期タスクを実行する。
- GeoDrive: 3D幾何情報を活用した精密な行動制御可能な運転世界モデル世界モデル2025/5/1
入力画像から3D表現を抽出し、指定した自車軌道に基づく2Dレンダリングを条件として与えることで、3D幾何的一貫性と行動制御性を高めた自動運転向け世界モデルを提案した。
- OmniIndoor3D:包括的な屋内3D再構成3D再構成2025/5/1
RGB-Dカメラで撮影した屋内シーンを、ガウス表現を用いて見た目・形状・パノプティックに高精度で再構成するフレームワークを提案。
- ManipDreamer: 行動木と視覚ガイダンスによるロボットマニピュレーション世界モデルの強化マニピュレーション2025/4/1
指示を行動木として表現し、深度と意味の視覚ガイダンスを組み合わせることで、ロボット操作の動画生成における指示追従性と視覚品質を向上させた世界モデルを提案。
- HybridVLA:拡散と自己回帰を統合した視覚-言語-行動モデルVLA2025/3/1
拡散モデルによる連続的な行動生成と自己回帰による文脈推論を単一の大規模言語モデル内で統合し、両者を協調的に学習・アンサンブルするロボット操作フレームワークを提案。
- MoLe-VLA: レイヤ混合による動的レイヤスキップ型視覚言語行動モデルVLA2025/3/1
LLMの各層をエキスパートとみなし、ロボットの状態に応じて必要な層だけを動的に活性化する視覚言語行動モデルを提案し、計算コストを抑えつつ操作タスクの性能を維持した。
- AffordGrasp: 雑然環境におけるオープンボキャブラリなタスク指向把持のための文脈内アフォーダンス推論把持2025/3/1
視覚言語モデル(VLM)の推論能力を活用し、暗黙の指示からタスクを推論して対象物体とその部位レベルのアフォーダンスを特定し、機能を考慮した把持姿勢を生成するオープンボキャブラリな把持フレームワークを提案。
- RoboBrain:抽象的から具体的へと至るロボット操作のための統合脳モデルVLA2025/2/1
ロボット操作に必要な計画・アフォーダンス知覚・軌道予測を統合したMLLMベースの脳モデルRoboBrainを提案し、多次元情報を付与した大規模データセットShareRobotで訓練して最先端性能を達成した。
- CordViP: 実世界での巧みな操作のための対応関係に基づく視覚運動ポリシーマニピュレーション2025/2/1
物体の6D姿勢推定とロボット固有感覚を活用し、物体と手の対応関係を捉えるインタラクション認識点群を構築することで、実世界の巧みな操作を高精度に実現する視覚運動ポリシーを提案した。
- MapNav: 注釈付きセマンティックマップによる視覚言語ナビゲーションの新たな記憶表現VLA2025/2/1
視覚言語ナビゲーションにおいて、過去の観測フレームの代わりに注釈付きセマンティックマップを構築・更新して用いることで、記憶と計算の負荷を抑えつつ最先端性能を達成した研究。
- RoboMIND:ロボットマニピュレーションのためのマルチエンボディメント知能規範データセットマニピュレーション2024/12/1
4種類のロボットによる10.7万件の模倣学習用デモンストレーション軌道と失敗例、デジタルツイン環境を提供する大規模データセットを構築し、VLAモデルの性能を評価した。
- GPD-1: 自動運転のための生成的事前学習自動運転2024/12/1
自車・エージェント・地図をトークン化し、自己回帰トランスフォーマで統一的に生成することで、追加学習なしにシーン生成・交通シミュレーション・地図予測・運動計画など多様な運転タスクをこなすモデルを提案。
- GaussianAD: 3Dガウシアン中心のエンドツーエンド自動運転自動運転2024/12/1
3Dセマンティックガウシアンで周囲シーンを表現し、視覚入力から知覚・予測・軌道計画をエンドツーエンドで行う自動運転フレームワークを提案。
- EVA: 未来映像予測のための身体性世界モデル世界モデル2024/10/1
視覚言語モデルと映像生成モデルを組み合わせ、身体性シナリオでの多段階未来予測を可能にする世界モデルEVAとその評価ベンチマークEVA-Benchを提案した。
- DAG-Plan: 双腕協調プランニングのための有向非巡回依存グラフ生成双腕マニピュレーション2024/6/1
自然言語指示をLLMで有向非巡回グラフ(DAG)に変換し、双腕ロボットの並列実行と適応的なタスク割り当てを実現するプランニング手法を提案した。
- DOZE: A Dataset for Open-Vocabulary Zero-Shot Object Navigation in Dynamic Environments2024/2/1
- VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model2024/1/1