論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
視覚言語行動モデルは物理的推論を行うと検証できない
VLAシステムの性能向上が物理的汎化によるものか、意味的マッチングによるものかを区別できない評価プロトコルの問題を指摘し、分離評価の必要性を提案するポジションペーパー。
原題: Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning / Taozhao Chen, Ian Manchester, Huaming Chen
日本語で読む → - 論文VLA/操作ロボティクス
EquiVLA: 回転同変ビジョン・言語・行動モデルのための汎用フレームワーク
凍結した視覚言語バックボーンとフローマッチング拡散トランスフォーマー行動ヘッドを組み合わせた任意のアーキテクチャに適用可能な、エンドツーエンドのSO(2)同変VLAモデルの最初の汎用フレームワークを提案。回転に対する幾何学的帰納バイアスを導入し、データ効率と汎化性能を大幅に向上させた。
原題: EquiVLA: A General Framework for Rotationally Equivariant Vision-Language-Action Models / Thien-Loc Ha, Quang-Tan Nguyen, Trong-Bao Ho 他
日本語で読む → - 論文VLAロボティクス
ドロップ・ザン・リカバリー:視覚言語行動モデルはどの程度冗長か?
VLAモデルの冗長性を調べるため、トランスフォーマーブロックを除去して再学習する手法を提案し、言語バックボーンが操作タスクに冗長である一方、視覚・行動経路は重要であることを示した。
原題: Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models? / Guoheng Sun, Kaixi Feng, Shwai He 他
日本語で読む → - 論文VLA/ベンチマークロボティクス
RoboProcessBench: 視覚言語ロボット操作におけるプロセス認識理解のベンチマーク
ロボット操作の実行過程を静的監視と動的推論の2次元で評価するベンチマークを構築し、12種類の診断質問群と約58kのQAペアを含むデータセットを提供した。既存のVLMがプロセス理解に乏しいことを示し、教師あり微調整による改善効果も検証した。
原題: RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation / Dayu Xia, Yue Shi, Yao Mu 他
日本語で読む → - 論文VLA/操作ロボティクス
PhysReflect-VLA: 物理的実現可能性と自己反映的調整による信頼性の高い視覚-言語-行動ポリシー
VLAモデルに物理的実現可能性の評価と自己反映による修正を組み込んだ実行時信頼性フレームワークを提案し、実世界の多段階操作タスクで成功率を向上させた。
原題: PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies / Jiayu Yang, Tao Yang, Weijun Li 他
日本語で読む → - 論文VLA/記憶/ベンチマークロボティクス
RoboMME-Interference:干渉下でのロボット記憶のベンチマーク
ロボットの長期記憶性能を評価するため、無関係なセッションを干渉として加えたクロスセッションベンチマークを構築し、既存のVLAモデルが干渉に弱いことを示した。
原題: RoboMME-Interference: Benchmarking Robot Memory Under Interference / Soumil Rathi
日本語で読む → - 論文VLAロボティクス
ω-EVA: 潜在的な対話型世界モデルによる想像・検証・行動
ロボットの行動生成に、行動の結果を潜在空間で想像・検証してから最終行動を決定する3段階フレームワークを導入した論文。
原題: $\omega$-EVA: Envision, Verify, and Act with Latent Interactive World Models / Zhenguo Sun, Yu Sun, Hande Huang 他
日本語で読む → - 論文VLA/異機種間転移ロボティクス
Cloak: エンドエフェクタをVLAからマスクすることで実現するゼロショット異機種間操作
手首カメラ画像からエンドエフェクタをマスクする訓練手法Cloakを提案し、単一グリッパのデータのみで訓練したVLAが、未見の異なるロボット構成へゼロショットで転移できることを示した。
原題: Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA / Michael Piseno, Guy Tevet, C. Karen Liu
日本語で読む → - 論文VLA/操作ロボティクス
接地された3D点のアクションヘッド直接注入による空間・タスク汎化の実現
VLAモデルの空間・タスク汎化を改善するため、3D点ベースの接地信号をアクションヘッドに直接注入する軽量モジュールを提案し、LIBERO-PROで成功率を大幅に向上させた。
原題: Direct Action-Head Injection of A Grounded 3D Point Unlocks Spatial and Task Generalization / Shiang-Feng Tsai, Jin-Cheng Jhang, Yen-Ling Tai 他
日本語で読む → - 論文VLA/データ生成ロボティクス
Wh0: 生成的世界モデルによるスケーラブルな自己中心視点の人間手操作データ生成
生成ビデオ世界モデルを用いて、ロボット学習に使える自己中心視点の人間手操作ビデオデータを大量生成し、実ロボットデータと組み合わせて器用な操作VLAモデルの性能を大幅に向上させる手法を提案した。
原題: Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data / Yangtao Chen, Zixuan Chen, Peiyang Wang 他
日本語で読む → - 論文VLA/計画AI
トークン予測は計画ではない:物理に基づく因果推論エージェントの構築
身体性を持つ視覚言語計画の評価では、言語的な次トークン予測が重視されがちですが、本研究では物理的な因果推論を促すベンチマークと大規模データセットを構築し、因果推論を学習したモデルが計画性能を向上させることを示しました。
原題: Token Predictors Are Not Planners: Building Physically Grounded Causal Reasoners / Zheng Lu, Mingqi Gao, Qinlei Xie 他
日本語で読む → - 論文VLA/モバイル操作ロボティクス
追加データなしでVLAを堅牢化:動作計画とのインターリーブ手法
長期的なモバイル操作タスクで性能が低下するVLAモデルに対し、モデルベースの動作計画をインターリーブするフレームワークMPVIを提案し、追加学習なしでタスク成功率を大幅に向上させた。
原題: Make Your VLA More Robust Without More Data By Interleaving Motion Planning / Dan BW Choe, Sundhar Vinodh Sangeetha, Samuel Coogan 他
日本語で読む → - 論文VLAロボティクス
VISTA: UMIデータの視覚基盤と物理検証によるVLAトレーニング適応
UMIデータをVLAモデルの訓練に使う際の視覚的・物理的な不整合を解消するため、魚眼カメラ用VQAデータセットと物理検証パイプラインを導入し、実ロボット成功率を向上させた。
原題: VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training / Siyuan Yang, Linzheng Guo, Ouyang Lu 他
日本語で読む → - 論文VLA/安全性評価ロボティクス
ForesightSafety-VLA: 視覚・言語・行動モデルのための統合診断安全ベンチマーク
VLAモデルの安全性を評価するための診断ベンチマークを提案し、物理的相互作用・指示・視覚の3側面から13カテゴリの安全分類を定義して、シーン構造・言語コマンド・視覚観察の変動下でプロセスレベルのリスクを測定する。
原題: ForesightSafety-VLA: A Unified Diagnostic Safety Benchmark for Vision-Language-Action Models / Mingyang Lyu, Yinqian Sun, Yiyang Jia 他
日本語で読む → - 論文VLA画像認識
X-Tokenizer: 視覚・言語・行動事前学習のためのマルチモーダル行動トークナイザー
ロボットの行動を離散コードに変換する際、単なる再構成ではなく意味的なインターフェースとして学習する新しいトークナイザーを提案。マスク行動モデリングと対照学習により、行動コードが視覚言語の意味と整合するようにした。
原題: X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining / Miracle Kang, Lights Shi, Lucy Liang 他
日本語で読む → - 論文VLAロボティクス
汎用ロボット操作のための身体化チェーン・オブ・ソートの再考
大規模な身体化CoTデータセットを構築し、VLAモデルにおける効果的なCoTの形式と統合方法を検証。推論をテスト時に使わず表現整形の教師信号として用いるERVLAを提案し、高い汎化性能を達成した。
原題: Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation / Nan Sun, Yuan Zhang, Yongkun Yang 他
日本語で読む → - 論文VLA/操作ロボティクス
Action ControlNet: 視覚言語行動モデルにおけるスムーズな非同期制御のための軽量遅延対応アダプタ
VLAモデルの推論遅延による動作の不連続性を解決するため、実行済み動作の接尾辞を条件として用いる軽量アダプタを提案し、遅延下でのロバスト性と軌道の滑らかさを向上させた。
原題: Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models / Tiecheng Guo, Meng Guo
日本語で読む → - 論文VLA/強化学習ロボティクス
本能を信じよ:視覚言語行動モデルのための信頼度駆動型テスト時強化学習
視覚言語行動モデル(VLA)が内部の評価能力を持ち、高信頼度の軌道が成功しやすいことを利用し、外部報酬なしで自己改善するテスト時強化学習フレームワークT^2VLAを提案した。
原題: Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models / Siyao Chen, Jiakang Yuan, Jiaxin Wang 他
日本語で読む → - 論文VLAロボティクス
TTT-VLA: テスト時潜在プロンプト最適化による視覚言語行動モデルの適応
視覚言語行動モデル(VLA)のテスト時分布シフトに対処するため、環境からの相互作用データを用いて潜在プロンプトのみを最適化するテスト時訓練フレームワークを提案した。
原題: TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models / Wenbo Zhang, Jianxiong Li, Shuai Yang 他
日本語で読む → - 論文両腕操作/VLAロボティクス
選択的に見て適応的に動く:両腕ロボット操作のための二重レベル構造分解
両腕ロボット操作において、視覚情報の重要度と腕の協調パターンが状況に応じて変化する問題に対し、視覚ルータと行動MoEによる二重レベルの構造分解を導入したVLAフレームワークを提案し、シミュレーションと実機で性能を向上させた。
原題: See Selectively, Act Adaptively: Dual-Level Structural Decomposition for Bimanual Robot Manipulation / Yoon-Ji Choi, Young-Chae Son, Soo-Chul Lim
日本語で読む → - 論文VLA/失敗回復ロボティクス
馴染みのある未来への回帰:事前生成マイルストーン選択によるVLAポリシーの失敗回復
VLAポリシーが操作中に軌道から逸脱した際、事前に生成した未来状態のマイルストーンを選択して固定目標とすることで、微調整なしに失敗から回復させる手法を提案した。
原題: Back to the Familiar Future: Failure Recovery for VLA Policies via Pre-Imagined Milestone Selection / Suyeon Shin, Juwon Kim, Hyeonbin Park 他
日本語で読む → - 論文VLAロボティクス
粗から精密へ:視覚言語行動モデルのためのアクショントークン計画
VLAモデルに、将来の軌道を要約する粗いアクショントークンの計画を導入し、その計画に基づいて実行用のアクショントークンを生成する方式を提案。長期的なタスクでの性能が向上した。
原題: Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models / Jinhao Wu, Shiduo Zhang, Yicheng Liu 他
日本語で読む → - 論文VLA/モデル圧縮ロボティクス
視覚言語行動モデルにおけるパラメータ冗長性の再考:VLMからVLAへの適応からの洞察
VLAモデルのパラメータ削減時に性能劣化が不可避とされる従来の見解に疑問を呈し、適応時のパラメータ変化の空間分布を解析し、モジュールごとの重要度に基づくマルチモジュール同時刈り込み手法を提案した。
原題: Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation / Fengnian Zhang, Tao Huang, Siyu Xu 他
日本語で読む → - 論文VLAロボティクス
Hy-Embodied-0.5-VLA:視覚言語行動モデルから実世界ロボット学習スタックへ
データ収集からモデル設計、事前学習、微調整、強化学習、実機展開までを含むロボット学習の全スタックを備えたエンドツーエンドシステムを提案した論文。
原題: Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack / He Zhang, Lingzhu Xiang, Haitao Lin 他
日本語で読む → - 論文双腕操作/VLAロボティクス
Co-VLA: 双腕ビジョン・ランゲージ・アクションシステムのための協調認識型構造化アクションモデリング
双腕ロボット操作において、明示的な協調構造をVLAモデルに導入し、共有・残差潜在変数と制御器により信頼性と解釈可能性を向上させるフレームワークを提案した。
原題: Co-VLA: Coordination-Aware Structured Action Modeling for Dual-Arm Vision-Language-Action Systems / Yandong Wang, Jiaqian Yu, Xiongfeng Peng 他
日本語で読む → - 論文VLA/モデル圧縮ロボティクス
視覚言語行動モデルのファインチューニングには、思っているより少ない層で十分である
大規模な視覚言語行動(VLA)モデルには層ごとの冗長性があることを発見し、学習不要の構造圧縮パイプラインを提案。冗長な層を除去してモデルを最大50%圧縮し、ファインチューニング時間を40-50%、推論時間を最大30%削減しつつ、性能はフルモデルと同等以上を達成した。
原題: Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think / Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha 他
日本語で読む → - 論文VLAロボティクス
必要なときに夢を見る:適応的マルチモーダル推論による世界行動モデルの進化
世界行動モデル(WAM)の性能を高めるため、タスクの切り替え時にはテキスト推論、細かい操作時には視覚推論を動的に切り替える軽量ルータを導入したAdaWAMを提案した。シミュレーションと実世界のタスクで効率と性能が向上した。
原題: Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning / Yinzhou Tang, Jingbo Xu, Yu Shang 他
日本語で読む → - 論文VLA/テスト生成cs.SE
MANGO: 視覚言語行動モデルのための自動マルチエージェントテストオラクル生成
VLAロボットのテスト用に、自然言語のタスク記述から細粒度のオラクルを自動生成するマルチエージェントフレームワークを提案。
原題: MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models / Pablo Valle, Shaukat Ali, Aitor Arrieta 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動のための連続推論
自然言語はタスクレベルの粒度であり連続制御には不向きなため、VLAポリシーに適した連続思考を導入し、共有ガウス潜在変数として自己検証目的で学習する手法を提案した。
原題: Continuous Reasoning for Vision-Language-Action / Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota
日本語で読む → - 論文VLAロボティクス
クロスエンボディメントロボット操作のための行動事前学習
視覚言語行動モデルにおいて、行動モジュールに事前に運動の事前知識を学習させる2段階トレーニング手法を提案し、クロスエンボディメント設定での性能を向上させた。
原題: Learning Action Priors for Cross-embodiment Robot Manipulation / Dong Jing, Tianqi Zhang, Jiaqi Liu 他
日本語で読む →