Jiaming Liu
Peking University
収録論文 35本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EgoWild2Dex: 野生の人間体験から器用なロボットマニピュレーションを学習マニピュレーション2026/9/20
家庭や工場など実環境で頭部カメラにより収集した一人称視点の人間行動データを、視点のずれと身体差を補正して双腕ロボットの器用な操作に転移する手法を提案。
- ロボットの世界モデルは本当に行動に従うのか?行動条件付き生成の診断とポリシー学習のための整合世界モデル/行動条件付き生成2026/8/25
ロボットの世界モデルが任意の行動に正しく従うかを評価するベンチマークWorldEchoを導入し、既存モデルが専門家の行動は再現できるが多様な非専門家軌道では失敗することを示した。さらに、行動追従を強化するWorldSyncを提案し、シミュレーションと実機タスクでポリシー改善の信頼性を向上させた。
- GeoWAM: 自動運転のための視覚幾何学ワールドアクションモデル自動運転2026/8/24
自動運転におけるワールドアクションモデルを、ピクセルではなく点群の幾何学的表現で学習し、将来のシーン幾何学を予測することで運転ポリシーの性能を向上させた。
- HAF: 階層的アクションフローとスペクトル潜在RLによる汎用VLAのヒューマノイド全身移動操作への適応ヒューマノイド/VLA/強化学習2026/8/17
汎用VLA基盤モデルをヒューマノイドの全身移動操作に適応させるための2部構成フレームワークHAFを提案。階層的なアクション生成とオンラインRLによるポリシー改善を実現する。
- AVA-Encoder: エージェントネイティブな映像表現学習に向けて映像表現学習2026/8/12
映像生成エージェントが映画品質の映像を学習できるように、映像をフィルム知識グラフに変換して再構成する自己進化型オートエンコーダを提案し、エージェントが扱いやすい映像表現を獲得する。
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- Lift3D-VLA: 3次元幾何と動力学を考慮した操作のためのVLAモデルのリフティングVLA/操作2026/7/1
VLAモデルに明示的な3次元点群推論と時間的に一貫した行動生成を組み込む統一フレームワークを提案。2Dモデルを3Dに持ち上げる戦略と自己教師あり学習で幾何と物理ダイナミクスを内部化し、LLMの多層で行動チャンクを予測する。
- TACO: 触覚を考慮した世界モデルによるスケーラブルなVLAポストトレーニングの自己修正VLA/触覚/操作2026/7/1
接触を伴う操作タスクで失敗するVLAモデルに対し、触覚を考慮した世界モデルを用いて失敗状態を認識し、修正動作を想像・ラベル付けすることで、人間の介入なしにポリシーを改善するフレームワークを提案した。
- LaST-HD: スケーラブルな人間データからロボット操作の物理的推論を学習する操作学習2026/6/1
人間の手のデモンストレーションとロボットのデモンストレーションを共有の潜在推論空間で整列させ、物理ダイナミクスを内部化することで、ロボット操作の学習を改善する新しい手法を提案した論文。
- MV-WAM: 多様体を考慮した価値拡張付き世界行動モデル操作2026/6/1
視覚と行動のモダリティ間の構造的不整合を解消するため、多様体認識最適化と価値誘導ロールバックを備えた世界行動モデルMV-WAMを提案し、ロボット操作の汎化性能を向上させた。
- HarmoWAM: 適応的世界行動モデルによる汎用性と精密操作の調和ロボット制御2026/5/1
世界行動モデル(WAM)の2つのパラダイム間のトレードオフを解消するため、予測と反応の2つの専門家を世界モデルで統合し、適応的ゲーティングで切り替えるエンドツーエンドのWAMを提案した。
- Hi-WM: 人間参加型ワールドモデルによるロボットポストトレーニングのスケーラブル化VLA/ポストトレーニング2026/4/1
実世界での介入を必要とせず、学習したワールドモデル内で人間が修正行動を提供することで、失敗箇所に集中したポリシー改善を実現するポストトレーニング手法を提案。実機操作タスクで成功率を大幅に向上させた。
- LaST-R1: 適応的物理潜在推論によるロボット操作の強化学習強化操作学習2026/4/1
ロボット操作の基盤モデルに対し、潜在推論と行動生成を共同最適化する強化学習フレームワークを提案し、LIBEROベンチマークで99.9%の成功率を達成した。
- TwinRL: デジタルツイン駆動強化学習による実世界ロボットマニピュレーションVLA2026/2/1
スマホ撮影から高忠実度デジタルツインを構築し、SFT・ツインRL・実世界RLの3段階でVLAモデルの探索空間を拡張・誘導する協調ポストトレーニング手法を提案。
- LaST₀:ロボット視覚言語行動モデルのための潜在時空間チェーン・オブ・ソートVLA2026/1/1
言語ではなく潜在空間で未来の視覚・3D・固有感覚を推論する時空間Chain-of-Thoughtを導入し、低頻度推論と高頻度行動生成を分離した二重システムVLAフレームワークを提案。
- RoboMIND 2.0:汎用身体知能のためのマルチモーダル両腕移動マニピュレーションデータセットマニピュレーション2025/12/1
6種類のロボットで集めた31万件超の両腕操作・移動マニピュレーション軌道(触覚・シミュレーション含む)を公開し、階層型VLM+VLAシステムMIND-2を提案した論文。
- ManualVLA:思考連鎖による手順書生成とロボット操作を統合したVLAモデルVLA2025/12/1
目標状態から実行手順を推論する「Manual Chain-of-Thought」を導入し、手順書生成と操作実行をMixture-of-Transformersで統合したVLAモデルを提案。3D Gaussian Splattingによるデジタルツインで訓練データを自動生成する。
- Video2Act: ロボットの時空間運動モデリングを備えた二重システム動画拡散ポリシーVLA2025/12/1
動画拡散モデルから前景境界とフレーム間運動を抽出して行動生成の条件に使い、低速なSystem 2と高速なSystem 1の非同期二重構成でロボット操作を高精度化した研究。
- DualVLA: 推論と行動の部分的デカップリングによる汎用身体性エージェントの構築VLA2025/11/1
ロボット実演で訓練したVLAモデルにマルチモーダル推論を追加すると行動性能が劣化する「行動退化」を解決するため、二層データ選別と二重教師適応蒸留を提案し、推論能力を保ちつつ行動精度を向上させた。
- RoboBench:マルチモーダル大規模言語モデルを身体化脳として評価する包括的ベンチマークVLA2025/10/1
マニピュレーションの意思決定を担う「身体化脳」としてのマルチモーダルLLMを、指示理解・知覚推論・汎化計画・アフォーダンス予測・失敗分析の5次元で評価するベンチマークを提案した。
- dVLA: マルチモーダル連鎖推論を備えた拡散型視覚-言語-行動モデルVLA2025/9/1
視覚・言語・行動を単一の拡散目的関数で統合し、マルチモーダル連鎖推論を活用したVLAモデルdVLAを提案。LIBEROで96.4%の成功率を達成し、実機Frankaでも多段階計画を要するタスクに成功。
- MLA: ロボットマニピュレーションにおけるマルチモーダル理解と予測のためのマルチセンサリー言語行動モデルVLA2025/9/1
2D画像・3D点群・触覚を位置対応で統合し、将来のマルチセンサリー情報を予測する言語行動モデルを提案。接触の多い実世界タスクで従来の2D/3D VLAを大きく上回る。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。
- RwoR: ロボットなしで方策学習するための人間の手の収集からのロボットデモンストレーション生成模倣学習2025/7/1
手首に装着したGoProで人間の手のデモを収集し、生成モデルでロボットグリッパのデモに変換することで、実機ロボットなしに操作方策を学習できる手法を提案。
- AC-DiT: 移動マニピュレーションのための適応協調拡散トランスフォーマ移動マニピュレーション2025/7/1
移動ベースとマニピュレータの協調を改善するため、ベース運動を事前情報として全身動作を予測する機構と、2D画像と3D点群の融合重みを動的に調整する知覚戦略を備えた拡散トランスフォーマを提案した。
- SpikePingpong:スパイク視覚を用いた高速・低速卓球ロボットシステムマニピュレーション2025/6/1
スパイク視覚と模倣学習を組み合わせ、高速な球検出と軌道予測を行うファスト・スローシステムで高精度なロボット卓球を実現した。
- MinD: リアルタイム計画と暗黙的リスク分析のためのデュアルシステム世界モデルの学習VLA2025/6/1
低頻度の映像生成と高頻度の拡散ポリシーを非同期に組み合わせ、単一ステップの潜在特徴でリアルタイムに行動計画とリスク予測を行う世界モデルを提案。
- Fast-in-Slow:高速操作と低速推論を統合するデュアルシステム基盤モデルVLA2025/6/1
VLMベースの推論システムに実行モジュールを部分的にパラメータ共有して組み込み、高速かつ精密なロボット操作を実現する統合型VLAモデルを提案。
- CrayonRobo: 物体中心のプロンプト駆動型視覚-言語-行動モデルによるロボットマニピュレーションVLA2025/5/1
RGB画像に手書き風の2D視覚プロンプトを重ね、低レベル動作と高レベル計画を同時に指示する視覚-言語-行動モデルを提案。キーフレームごとに接触姿勢と移動方向をSE(3)空間で予測し、長期タスクを実行する。
- HybridVLA:拡散と自己回帰を統合した視覚-言語-行動モデルVLA2025/3/1
拡散モデルによる連続的な行動生成と自己回帰による文脈推論を単一の大規模言語モデル内で統合し、両者を協調的に学習・アンサンブルするロボット操作フレームワークを提案。
- CordViP: 実世界での巧みな操作のための対応関係に基づく視覚運動ポリシーマニピュレーション2025/2/1
物体の6D姿勢推定とロボット固有感覚を活用し、物体と手の対応関係を捉えるインタラクション認識点群を構築することで、実世界の巧みな操作を高精度に実現する視覚運動ポリシーを提案した。
- RoboBrain:抽象的から具体的へと至るロボット操作のための統合脳モデルVLA2025/2/1
ロボット操作に必要な計画・アフォーダンス知覚・軌道予測を統合したMLLMベースの脳モデルRoboBrainを提案し、多次元情報を付与した大規模データセットShareRobotで訓練して最先端性能を達成した。
- RoboMIND:ロボットマニピュレーションのためのマルチエンボディメント知能規範データセットマニピュレーション2024/12/1
4種類のロボットによる10.7万件の模倣学習用デモンストレーション軌道と失敗例、デジタルツイン環境を提供する大規模データセットを構築し、VLAモデルの性能を評価した。
- ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic Manipulation2023/12/1
- ImageManip: Image-based Robotic Manipulation with Affordance-guided Next View Selection2023/10/1