論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/サーベイロボティクス
人間のビデオからロボット操作へ:人間中心データを用いたスケーラブルな視覚言語行動学習に関するサーベイ
ロボットのデモデータに頼らず、豊富な人間のビデオをVLAモデルの学習に活用する手法を4つのカテゴリに分類して整理し、未解決の課題と今後の研究方向を提示したサーベイ論文。
原題: From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data / Zhiyuan Feng, Qixiu Li, Huizhi Liang 他
日本語で読む → - 論文VLAロボティクス
汎用ロボット操作のための身体化チェーン・オブ・ソートの再考
大規模な身体化CoTデータセットを構築し、VLAモデルにおける効果的なCoTの形式と統合方法を検証。推論をテスト時に使わず表現整形の教師信号として用いるERVLAを提案し、高い汎化性能を達成した。
原題: Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation / Nan Sun, Yuan Zhang, Yongkun Yang 他
日本語で読む → - 論文VLA/具身知能ロボティクス
EWAM: 具身知能における閉ループオンライン適応のための拡張世界行動モデル
事前学習済みの凍結Cosmos3バックボーン上に、推論時に挿入する4つの軽量ニューラル層(記憶・異常検知・ポリシールーティング・行動修正)を組み合わせた閉ループオンライン適応アーキテクチャEWAMを提案。ゼロショット評価で追加データなしに新タスクレイアウトへ適応する。
原題: EWAM: An Enhanced World Action Model for Closed-Loop Online Adaptation in Embodied Intelligence / Xin Zhou, Cong Miao
日本語で読む → - 論文VLAロボティクス
TTT-VLA: テスト時潜在プロンプト最適化による視覚言語行動モデルの適応
視覚言語行動モデル(VLA)のテスト時分布シフトに対処するため、環境からの相互作用データを用いて潜在プロンプトのみを最適化するテスト時訓練フレームワークを提案した。
原題: TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models / Wenbo Zhang, Jianxiong Li, Shuai Yang 他
日本語で読む → - 論文VLAロボティクス
WALL-WM: イベント接合部での世界行動モデリングの彫刻
WALL-WMは、ビデオ行動学習をチャンク中心の最適化からイベント基盤の視覚言語行動事前学習へと移行させ、意味的に一貫した行動イベントを学習の原子単位として使用する世界行動モデルです。
原題: WALL-WM: Carving World Action Modeling at the Event Joints / Shalfun Li, Victor Yao, Charles Yang 他
日本語で読む → - 論文VLAロボティクス
LaWAM: 効率的なダイナミクス認識ロボットポリシーのための潜在世界行動モデル
ロボットの行動がシーンをどう変えるかを予測する潜在空間の世界モデルを導入し、ピクセル単位の動画生成を避けつつ、高成功率と低遅延を実現した。
原題: LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies / Jialei Chen, Kai Wang, Kang Chen 他
日本語で読む → - 論文VLA/ロボットアーム/オープンソースロボティクス
OpenEAI-Platform: オープンソースの具現化人工知能ハードウェア・ソフトウェア統合プラットフォーム
低コストの6+1自由度ロボットアームと再現可能なVLAモデルを統合した完全オープンソースのプラットフォームを提案し、実世界の操作タスクで商用アームや大規模事前学習モデルと同等以上の性能を示した。
原題: OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform / Jinyuan Zhang, Luoyi Fan, Leiyu Wang 他
日本語で読む → - 論文VLAロボティクス
ACE-Ego-0: 自己中心視点の人間とロボットデータを統合したVLA事前学習
ロボットの軌跡データ収集のコストを抑えるため、大規模な自己中心視点の人間ビデオを擬似行動ラベルに変換し、ロボットデータと統合してVLAモデルを事前学習するフレームワークを提案した。
原題: ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining / Hao Li, Ganlong Zhao, Yufei Liu 他
日本語で読む → - 論文VLA/失敗回復ロボティクス
馴染みのある未来への回帰:事前生成マイルストーン選択によるVLAポリシーの失敗回復
VLAポリシーが操作中に軌道から逸脱した際、事前に生成した未来状態のマイルストーンを選択して固定目標とすることで、微調整なしに失敗から回復させる手法を提案した。
原題: Back to the Familiar Future: Failure Recovery for VLA Policies via Pre-Imagined Milestone Selection / Suyeon Shin, Juwon Kim, Hyeonbin Park 他
日本語で読む → - 論文社会的ナビゲーション/VLAロボティクス
見たものに基づいて行動する:視覚言語行動モデルにおける安全な社会的ナビゲーションの実現
事前学習済みの視覚言語行動(VLA)モデルが歩行者と障害物の区別や衝突予測信号を内部表現に持つことを利用し、注釈不要の2段階ポストトレーニング手法SALSAを提案。反事実的なシーンと将来リスクの教師信号で行動生成と潜在表現を整合させ、近接衝突を86.4%削減した。
原題: Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models / Qingzi Wang, Xiyang Wu, Guangyao Shi 他
日本語で読む → - 論文ナビゲーション/VLA/強化学習ロボティクス
専門家ガイドGRPOによる意図に正確に沿ったVLA空中ナビゲーション
VLAモデルを用いたUAVナビゲーションにおいて、専門家データで強化した強化学習フレームワークEG-GRPOを提案し、複雑な指示への意図整合性と成功率を大幅に向上させた。
原題: Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO / Tianyang Chen, Wenjun Li, Xin zhou 他
日本語で読む → - 論文VLAロボティクス
Hy-Embodied-0.5-VLA:視覚言語行動モデルから実世界ロボット学習スタックへ
データ収集からモデル設計、事前学習、微調整、強化学習、実機展開までを含むロボット学習の全スタックを備えたエンドツーエンドシステムを提案した論文。
原題: Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack / He Zhang, Lingzhu Xiang, Haitao Lin 他
日本語で読む → - 論文双腕操作/VLAロボティクス
Co-VLA: 双腕ビジョン・ランゲージ・アクションシステムのための協調認識型構造化アクションモデリング
双腕ロボット操作において、明示的な協調構造をVLAモデルに導入し、共有・残差潜在変数と制御器により信頼性と解釈可能性を向上させるフレームワークを提案した。
原題: Co-VLA: Coordination-Aware Structured Action Modeling for Dual-Arm Vision-Language-Action Systems / Yandong Wang, Jiaqian Yu, Xiongfeng Peng 他
日本語で読む → - 論文VLA画像認識
Event-VLA: アクション条件付きイベント融合によるロバストな視覚言語行動モデル
照明変化に弱い既存のVLAモデルに対し、イベントカメラのストリームをアクションクエリ経由で融合するEvent-VLAを提案し、低照度下での操作成功率を向上させた。
原題: Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model / Jiaxin Liu, Xun Xu, Zhenhao Zhang 他
日本語で読む → - 論文VLAロボティクス
DREAM-Chunk: 潜在世界モデルによるリアクティブなアクションチャンキング
アクションチャンキング方式のポリシーに軽量な潜在世界モデルを追加し、テスト時に複数の候補チャンクの未来を予測して最適なものを選択することで、確率的な環境下でのロバスト性を向上させる手法を提案した。
原題: DREAM-Chunk: Reactive Action Chunking with Latent World Model / Wenxi Chen, Kaidi Zhang, Chi Lin 他
日本語で読む → - 論文VLAロボティクス
構造化された段階とキーフレーム監視による視覚言語行動モデルのファインチューニング改善
ロボット操作のVLAモデルにおいて、グリッパーイベント遷移に失敗が集中する問題を解決するため、デモのグリッパー状態から自動的に段階分類器とキーフレーム予測器を補助ヘッドとして学習し、ベースポリシーを変えずに性能を向上させるStaKeフレームワークを提案した。
原題: Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision / Yuan Xu, Yixiang Chen, Kai Wang 他
日本語で読む → - 論文VLA/強化学習ロボティクス
dVLA-RL: 離散拡散ビジョン・ランゲージ・アクションモデルに対する軌跡上の強化学習
離散拡散型VLAモデルの強化学習を可能にするため、生成過程をマルコフ決定過程とみなし、軌跡の結合確率を目的関数とする手法を提案した。
原題: dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models / Yuhao Wu, Yitian Liu, Weijie Shen 他
日本語で読む → - 論文VLAロボティクス
MPCoT: 報酬誘導型マルチパス潜在推論によるテスト時スケーラブルな視覚言語行動モデル
視覚言語行動(VLA)モデルの推論時に、複数の潜在的な行動仮説を並列に洗練して統合する報酬誘導型フレームワークを提案し、長期的タスクの成功率を向上させた。
原題: MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action / Boyang Zhang, Lianlei Shan
日本語で読む → - 論文VLAロボティクス
視覚言語行動のための連続推論
自然言語はタスクレベルの粒度であり連続制御には不向きなため、VLAポリシーに適した連続思考を導入し、共有ガウス潜在変数として自己検証目的で学習する手法を提案した。
原題: Continuous Reasoning for Vision-Language-Action / Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota
日本語で読む → - 論文VLA/強化学習ロボティクス
FlowPRO: フローマッチングVLAの報酬なし強化学習による微調整 - 近接化選好最適化を用いて
フローマッチング型VLAモデルを実ロボットに展開可能なポリシーへと微調整する、報酬なしのオフライン強化学習フレームワークFlowPROを提案。選好最適化に近接正則化を導入し、介入・ロールバックデータから高品質なポリシーを学習する。
原題: FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization / Yihao Wu, He Zhang, Junbo Tan 他
日本語で読む → - 論文VLA/強化学習ロボティクス
弾性クエリ強化学習:VLAモデルの自己認識型ポリシー実行
VLAモデルの推論・再計画スケジュールを固定せず、状態の難易度に応じてクエリの入力・ノイズ除去予算・アクション長を動的に調整する枠組みEQRLを提案。軽量な適応器と批評家の不一致による難易度信号で計算資源を効率的に配分し、シミュレーションと実機で推論コストを削減しつつ成功率を維持・向上させた。
原題: Elastic Queries Reinforcement Learning: Self-Aware Policy Execution for VLA Models / Ge Wang, Xinyu Tan, Xiang Li 他
日本語で読む → - 論文VLAロボティクス
理解しながら行動する:リアルタイム視覚言語行動モデルのための非同期意味・行動分離
既存のVLAモデルを改造せず、意味理解と行動生成を非同期に分離し、低頻度で意味条件を更新しつつ高頻度で行動を出力することで、低遅延な閉ループ制御を実現する枠組みを提案した。
原題: Acting While Understanding: Asynchronous Semantic-Action Decoupling for Real-Time Vision-Language-Action Models / Shenhao Yan, Ge Wang, Qi Liu 他
日本語で読む → - 論文VLA/計画AI
トークン予測は計画ではない:物理に基づく因果推論エージェントの構築
身体性を持つ視覚言語計画の評価では、言語的な次トークン予測が重視されがちですが、本研究では物理的な因果推論を促すベンチマークと大規模データセットを構築し、因果推論を学習したモデルが計画性能を向上させることを示しました。
原題: Token Predictors Are Not Planners: Building Physically Grounded Causal Reasoners / Zheng Lu, Mingqi Gao, Qinlei Xie 他
日本語で読む → - 論文VLA/強化学習ロボティクス
Z-1: 視覚言語行動モデルのための効率的強化学習
フローベースのVLAモデルに強化学習を適用し、公開データセットのみで24タスクの成功率を大幅に向上させた。
原題: Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models / Lang Cao, Renhong Chen, Luyi Li 他
日本語で読む → - 論文安全強化学習/VLAロボティクス
SafeDojo: インタラクティブワールドモデルによるVLAのための安全強化学習
視覚言語行動(VLA)ポリシー向けに、ワールドモデルベースの想像を通じて安全な行動を学習する初のモデルベース安全強化学習フレームワークを提案。
原題: SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model / Kai Tang, Peidong Jia, Zhong Chu 他
日本語で読む → - 論文VLAロボティクス
MuseVLA: ロボット操作のための適応型マルチモーダルセンシング視覚言語行動モデル
RGBカメラだけでは捉えられない温度や音、レーダーなどの多様なセンサ情報を、タスクに応じてツールのように選択・統合できる視覚言語行動モデルを提案した。
原題: MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation / Xingyuming Liu, Ruichun Ma, Heyu Guo 他
日本語で読む → - 論文VLAロボティクス
出力レベル正則化が単一GPU VLAファインチューニングにおけるシード抽選問題を解消する
VLAモデルのファインチューニングで、ランダムシードによって成功率が大きく低下する「シード抽選」問題を発見し、出力レベルの正則化(VICReg、Dropout、学習率減衰)がこの問題を完全に解消することを示した論文。
原題: Output-Level Regularization Eliminates the Seed Lottery in Single-GPU VLA Fine-Tuning / Jeffrin Sam, Dzmitry Tsetserukou
日本語で読む → - 論文VLA/移動マニピュレーションロボティクス
グループ別誤差が重要:11自由度移動マニピュレーションのための視覚言語行動モデルのファインチューニング
異種の関節グループを持つ移動マニピュレータ向けにVLAモデルをファインチューニングする際、総MSEが低いチェックポイントが実機で最良とは限らないことを示し、グループ別誤差がより信頼できる選択指標であると主張する論文。
原題: Per-Group Error, Not Total MSE: Fine-Tuning Vision-Language-Action Models for 11-DoF Mobile Manipulation / Pau Montagut Bofi, Mario García Blasco, Tessa Pulli 他
日本語で読む → - 論文VLA画像認識
X-Tokenizer: 視覚・言語・行動事前学習のためのマルチモーダル行動トークナイザー
ロボットの行動を離散コードに変換する際、単なる再構成ではなく意味的なインターフェースとして学習する新しいトークナイザーを提案。マスク行動モデリングと対照学習により、行動コードが視覚言語の意味と整合するようにした。
原題: X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining / Miracle Kang, Lights Shi, Lucy Liang 他
日本語で読む → - 論文VLAロボティクス
屋内環境向けモジュール型視覚言語行動ロボティクスフレームワーク
自然言語指示に基づき自律エージェントが複雑なタスクを実行するための、環境マッピング・質問処理・ナビゲーションを統合したモジュール型フレームワークを提案した論文。
原題: A Modular Vision-Language-Action Robotics Framework for Indoor Environments / Anindya Jana, Snehasis Banerjee, Arup Sadhu 他
日本語で読む →