論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/4/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/世界モデルロボティクス
Motubrain: ロボット制御のための高度な世界行動モデル
視覚・言語・行動を統合した世界行動モデルMotubrainを提案し、動画と行動の同時予測や多様なロボットデータへの対応、高速な実時間推論を実現した。
原題: Motubrain: An Advanced World Action Model for Robot Control / Motubrain Team, Chendong Xiang, Fan Bao 他
日本語で読む → - 論文VLA/世界モデルロボティクス
非同期ノイズ除去によるビデオ事前学習を活用した統合4D世界行動モデリング
ロボットのリアルタイム行動実行と高忠実度な4D世界生成(ビデオ+3D再構成)を単一フレームワークで統合するX-WAMを提案し、非同期ノイズサンプリングにより行動効率と生成品質を両立した。
原題: Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising / Jun Guo, Qiwei Li, Peiyan Li 他
日本語で読む → - 論文VLA/タスク実行ロボティクス
オープンワールドタスク実行におけるVLAエージェントの長期記憶
化学実験自動化のための二層メモリと将来状態予測を備えたVLAベースのフレームワークChemBotを提案し、長期的なタスク成功率を向上させた。
原題: Long-Term Memory for VLA-based Agents in Open-World Task Execution / Xu Huang, Weixin Mao, Yinhao Li 他
日本語で読む → - 論文セキュリティ/VLA画像認識
FlowHijack: フローマッチング型視覚言語行動モデルに対する動力学を考慮したバックドア攻撃
フローマッチング型VLAモデルのベクトル場動力学を標的とした初のバックドア攻撃フレームワークを提案し、ステルス性の高いトリガーで高い攻撃成功率を達成した。
原題: FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models / Xinyuan An, Tao Luo, Gengyun Peng 他
日本語で読む → - 論文VLA/構造化ポリシーロボティクス
合成ニューロシンボリック監視による視覚言語モデルからの構造化ロボットポリシー学習
視覚言語モデルを用いて、視覚観察と自然言語指示から実行可能なビヘイビアツリーポリシーを自動生成するニューロシンボリック手法を提案し、合成データのみで学習したモデルが実ロボットで動作することを示した。
原題: Learning Structured Robot Policies from Vision-Language Models via Synthetic Neuro-Symbolic Supervision / Alessandro Adami, Tommaso Tubaldo, Marco Todescato 他
日本語で読む → - 論文VLA画像認識
クロスビュー関係から学ぶ多視点空間推論
多視点の空間推論能力を高めるための大規模データセットXVRを構築し、視覚言語モデルを微調整して、対応付け・検証・位置特定のタスクで性能を向上させ、ロボット操作にも効果があることを示した。
原題: Learning Multi-View Spatial Reasoning from Cross-View Relations / Suchae Jeong, Jaehwi Song, Haeone Lee 他
日本語で読む → - 論文VLA/評価ベンチマーク機械学習
LIBERO-Para: VLAモデルの言い換え頑健性を評価する診断ベンチマークと指標
VLAモデルが指示の言い換えに対して脆弱であることを示すベンチマークを構築し、失敗の主因が物体レベルの語彙変化による計画段階の軌道逸脱であることを明らかにした。また、言い換え難易度を定量化する指標PRIDEを提案した。
原題: LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models / Chanyoung Kim, Minwoo Kim, Minseok Kang 他
日本語で読む → - 論文VLA画像認識
SpatialStack: 3D VLM空間推論のための階層的幾何学-言語融合
3D空間推論に弱い視覚言語モデルに対し、視覚・幾何・言語表現を階層的に融合するフレームワークを提案し、複数のベンチマークで最高性能を達成した。
原題: SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning / Jian Zhang, Shijie Zhou, Bangya Liu 他
日本語で読む → - 論文VLA/強化学習機械学習
AcceRL: 視覚言語行動モデルのための分散非同期強化学習と世界モデルフレームワーク
同期バリアと環境データ取得コストによるボトルネックを解消するため、環境ロールアウト・モデル推論・勾配更新を物理的に分離した分散非同期RLフレームワークを提案し、スループットとサンプル効率を大幅に向上させた。
原題: AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models / Chengxuan Lu, Shukuan Wang, Yanjie Li 他
日本語で読む → - 論文VLA/推論高速化ロボティクス
HeiSD: 運動学的認識を備えた身体化視覚言語行動モデルのためのハイブリッド投機的復号
VLAモデルの推論を高速化するため、ドラフタベースと検索ベースの投機的復号を統合したハイブリッド手法HeiSDを提案し、検証スキップ機構と運動学に基づく融合指標により高速化と成功率を両立した。
原題: HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness / Zihao Zheng, Zhihao Mao, Sicheng Tian 他
日本語で読む → - 論文VLA/制御ロボティクス
時間離散・時間連続の速度フィードフォワードによる視覚言語行動モデルの動的追従の実現
視覚言語行動モデルに速度フィードフォワード項を統合する2つの手法を提案し、接触を伴うタスクでの追従性能と成功率を改善した。
原題: Enabling Dynamic Tracking in Vision-Language-Action Models via Time-Discrete and Time-Continuous Velocity Feedforward / Johannes Hechtl, Philipp Schmitt, Georg von Wichert 他
日本語で読む → - 論文VLAロボティクス
SOLE-R1: ビデオ言語推論を唯一の報酬とするオンボット強化学習
ビデオと言語目標からタスク進捗を推論するモデルSOLE-R1を開発し、これを唯一の報酬としてロボットが未見の操作タスクをゼロショットで強化学習できるようにした。
原題: SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning / Philip Schroeder, Thomas Weng, Karl Schmeckpeper 他
日本語で読む → - 論文VLAロボティクス
FutureVLA: 視覚言語行動モデルのための統合視覚運動予測
ロボットの行動予測において、視覚と運動の相互作用を捉える新しいアーキテクチャFutureVLAを提案。視覚情報と運動情報を分離しつつ、時間的連続性を保った統合予測を実現する。
原題: FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model / Xiaoxu Xu, Hao Li, Jinhui Ye 他
日本語で読む → - 論文VLA/分解作業ロボティクス
SELF-VLA: 接触を伴う分解作業のためのスキル強化型エージェントVLAフレームワーク
廃電子製品の分解自動化を目的に、明示的な分解スキルを統合したエージェント型VLAフレームワークを提案し、接触を伴う分解タスクで既存のVLAモデルを上回る性能を示した。
原題: SELF-VLA: A Skill Enhanced Agentic Vision-Language-Action Framework for Contact-Rich Disassembly / Chang Liu, Sibo Tian, Xiao Liang 他
日本語で読む → - 論文VLA/推論高速化ロボティクス
KERV: 身体化VLAモデルのための運動学的修正投機的復号
VLAモデルの推論を高速化するため、運動学に基づくカルマンフィルタでアクションを予測し、投機的復号の誤りを補正するフレームワークKERVを提案。誤り訂正の再推論を回避し、受容閾値を動的に調整することで、成功率をほぼ落とさずに27〜37%の高速化を達成した。
原題: KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models / Zihao Zheng, Zhihao Mao, Maoliang Li 他
日本語で読む → - 論文VLA機械学習
シンプルな手法で十分:VLAモデルは強化学習による自然な継続学習者である
大規模事前学習済みVLAモデルの継続強化学習を体系的に検証し、LoRAを用いた単純な逐次ファインチューニングが破滅的忘却をほとんど起こさず、複雑な継続学習手法を上回ることを示した。
原題: Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning / Jiaheng Hu, Jay Shim, Chen Tang 他
日本語で読む → - 論文VLAロボティクス
DiT4DiT: ビデオダイナミクスと行動の統合モデリングによる汎用ロボット制御
ビデオ生成と行動予測を統合したエンドツーエンドのVideo-Actionモデルを提案し、シミュレーションと実機で高い成功率とサンプル効率を達成した。
原題: DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control / Teli Ma, Jia Zheng, Zifan Wang 他
日本語で読む → - 論文VLAcs.CR
TRAP: 敵対的パッチによるVLAのCoT推論ハイジャック
CoT推論を行うVLAモデルに対し、テーブルクロスなどの敵対的パッチを用いて推論経路を操作し、指示とは異なる危険な行動を引き起こす攻撃手法を提案した。
原題: TRAP: Hijacking VLA CoT-Reasoning via Adversarial Patches / Zhengxian Huang, Wenjun Zhu, Haoxuan Qiu 他
日本語で読む → - 論文VLA/セキュリティロボティクス
SABER: 視覚言語行動モデルに対するステルスなエージェント型ブラックボックス攻撃フレームワーク
VLAモデルへの指示文の小さな改変でロボットの行動を劣化させる攻撃を自動生成するフレームワークを提案し、LIBEROベンチマークで成功率低下などの効果を実証した。
原題: SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models / Xiyang Wu, Guangyao Shi, Qingzi Wang 他
日本語で読む → - 論文VLAロボティクス
StageCraft: VLAモデルにおける妨害物・障害物による失敗を実行時推論で軽減
VLAポリシーの実行動画と成否ラベルから、VLMの推論で初期状態の物体配置を調整し、妨害物や障害物による失敗を訓練なしで防ぐプラグインモジュールを提案。
原題: StageCraft: Execution Aware Mitigation of Distractor and Obstruction Failures in VLA Models / Kartikay Milind Pangaonkar, Prabin Rath, Omkar Patil 他
日本語で読む → - 論文VLAロボティクス
OmniGuide:汎用ロボットポリシーを強化する万能ガイダンス場
3D基盤モデルやVLMなどの多様なガイダンスを微分可能なエネルギー関数として表現し、VLAモデルの行動サンプリングを誘導することで、複雑な操作タスクの成功率と安全性を向上させるフレームワーク。
原題: OmniGuide: Universal Guidance Fields for Enhancing Generalist Robot Policies / Yunzhou Song, Long Le, Yong-Hyun Park 他
日本語で読む → - 論文VLAロボティクス
自分らしく運転:個人の好みに合わせたVision-Language-Actionモデルによるパーソナライズド運転
複数の実ドライバーの運転データからユーザー埋め込みを学習し、自然言語指示にも対応する個人化VLA運転フレームワークDMWを提案。各ドライバーの運転スタイルを再現できることを示した。
原題: Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving / Zehao Wang, Huaide Jiang, Shuaiwu Dong 他
日本語で読む → - 論文VLAロボティクス
ノイズ空間におけるチャンク境界アーティファクトの帰属と制御
生成的な視覚運動ポリシーにおけるチャンク境界の実行不連続性を分析可能なメカニズム変数として扱い、潜在ノイズの操作で系統的に制御でき、タスク結果に影響を与えることを示した。
原題: Noise-Space Attribution and Control of Chunk-Boundary Artifact / Rui Wang
日本語で読む → - 論文VLAロボティクス
LILAC: 言語条件付きオブジェクト中心オプティカルフローによるオープンループ軌道生成
人間やWeb動画から学習可能なフローベースの軌道生成を用いて、言語指示に従った物体操作を実現する手法を提案。指示とフローを整合させる損失関数とクロスモーダルアダプタを導入し、既存手法より高品質なフロー生成と高いタスク成功率を達成した。
原題: LILAC: Language-Conditioned Object-Centric Optical Flow for Open-Loop Trajectory Generation / Motonari Kambara, Koki Seno, Tomoya Kaichi 他
日本語で読む → - 論文VLA/強化学習ロボティクス
π-StepNFT: フローベースVLAのオンライン強化学習における広い空間には細かいステップが必要
フローベースの視覚言語行動モデルに対する新しい強化学習フレームワークを提案し、尤度計算や価値ネットワークを不要にして、単一の順伝播でステップごとのガイダンスを提供する。
原題: $\pi$-StepNFT: Wider Space Needs Finer Steps in Online RL for Flow-based VLAs / Siting Wang, Xiaofeng Wang, Zheng Zhu 他
日本語で読む → - 論文VLA画像認識
段階的視覚言語学習による物理的接地を備えた具現化タスク計画
具現化タスク計画のための3段階学習フレームワークSVLLを提案し、空間接地と時間推論を分離してから、専門家軌道へのバイアスを注入するBias-DPOでアライメントを行うことで、物理的に不可能な行動を抑制する。
原題: SVLL: Staged Vision-Language Learning for Physically Grounded Embodied Task Planning / Yuyuan Yang, Junkun Hong, Hongrong Wang 他
日本語で読む → - 論文VLAロボティクス
一段階フローポリシー:高速視覚運動ポリシーのための自己蒸留
生成フローモデルや拡散モデルの反復サンプリングによる推論遅延を解消するため、事前学習済み教師なしの自己蒸留フレームワークを提案し、一段階で高精度な行動生成を実現した。
原題: One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies / Shaolong Li, Lichao Sun, Yongchao Chen
日本語で読む → - 論文VLA/空間知能/3D認識ロボティクス
3D-Mix for VLA: VGGTベースの3D情報を視覚言語行動モデルに統合するプラグアンドプレイモジュール
VLAモデルの空間知能を向上させるため、VGGTによる3D情報をタスク文脈に応じて適応的に融合するプラグアンドプレイモジュール「3D-Mix」を提案し、複数のVLAアーキテクチャとベンチマークで一貫した性能向上を実証した。
原題: 3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models / Bin Yu, Shijie Lian, Xiaopeng Lin 他
日本語で読む → - 論文VLAロボティクス
ProFocus: 視覚と言語によるナビゲーションにおける能動的知覚と焦点化推論
VLNエージェントの非効率な視覚処理と無差別な履歴利用を改善するため、LLMとVLMの協調による訓練不要のフレームワークProFocusを提案。能動的知覚で必要な視覚情報を特定し、BD-MCTSで高価値な経路点に焦点を当てた推論を行う。
原題: ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation / Wei Xue, Mingcheng Li, Xuecheng Wu 他
日本語で読む → - 論文VLAロボティクス
訓練不要の注意再調整によるVLAモデルの言語基盤の回復
VLAモデルが視覚情報に偏り、指示と矛盾する動作を実行する「言語的盲目」現象を明らかにし、推論時に注意を再調整して指示の影響を回復する手法IGARを提案した。
原題: Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration / Ninghao Zhang, Bin Zhu, Shijie Zhou 他
日本語で読む →