論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/10/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
Nav-EE: 自動運転向け効率的な視覚言語モデルのためのナビゲーション誘導型早期終了
ナビゲーション情報を活用して視覚言語モデルの推論を途中で打ち切ることで、精度を保ちつつ最大63.9%の遅延削減を実現した。
原題: Nav-EE: Navigation-Guided Early Exiting for Efficient Vision-Language Models in Autonomous Driving / Haibo Hu, Lianming Huang, Xinyu Wang 他
日本語で読む → - 論文VLA機械学習
意味論的ワールドモデル
未来のピクセルを再構成する代わりに、タスクに関連する意味情報を視覚的質問応答として予測するワールドモデルを提案し、VLMを活用してロボット制御の汎化性能を向上させた。
原題: Semantic World Models / Jacob Berg, Chuning Zhu, Yanda Bao 他
日本語で読む → - 論文VLAロボティクス
身体性マニピュレーションのための効率的な視覚-言語-行動モデル:系統的サーベイ
視覚-言語-行動(VLA)モデルの計算・メモリ効率を改善する手法を、モデルアーキテクチャ、知覚特徴、行動生成、訓練・推論戦略の4次元で分類し、系統的にレビューしたサーベイ論文。
原題: Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey / Weifan Guan, Qinghao Hu, Aosheng Li 他
日本語で読む → - 論文VLAAI
BLM₁:デジタルと物理を横断する汎用大規模モデル
デジタル空間と物理空間、異なるタスクやロボット身体をまたいで動作する統合型マルチモーダル基盤モデルBLM₁を提案し、2段階学習で身体性知識と制御を両立させた。
原題: BLM$_1$: A Boundless Large Model for Cross-Space, Cross-Task, and Cross-Embodiment Learning / Wentao Tan, Bowen Wang, Heng Zhi 他
日本語で読む → - 論文VLAロボティクス
NanoVLA:軽量汎用ロボットポリシーのための視覚言語理解を分離したルーティング
視覚と言語の融合を後段に分離し、長短アクションチャンキングと動的ルーティングを組み合わせることで、エッジデバイス上で最大52倍高速かつ98%少ないパラメータで動作する軽量VLAモデルを提案した。
原題: NanoVLA: Routing Decoupled Vision-Language Understanding for Nano-sized Generalist Robotic Policies / Jiahong Chen, Jing Wang, Long Chen 他
日本語で読む → - 論文VLA画像認識
RobustVLA: マルチモーダル摂動に対する視覚-言語-行動モデルのロバスト性
VLAモデルの17種類の摂動に対するロバスト性を評価し、行動が最も脆弱であることを発見。出力と入力の両方に対するロバスト化手法を提案し、LIBEROで大幅な性能向上を達成。
原題: RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations / Jianing Guo, Zhenhong Wu, Chang Tu 他
日本語で読む → - 論文VLA機械学習
VLAモデルの視覚表現を劣化させない:OOD汎化のためのアラインメント
VLAモデルのファインチューニングで視覚表現が劣化する問題を分析し、視覚表現をアラインメントする簡便な手法でOOD汎化を改善した。
原題: Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization / Nikita Kachaev, Mikhail Kolosov, Daniil Zelezetsky 他
日本語で読む → - 論文VLAロボティクス
検証器不要のテスト時サンプリングによる視覚-言語-行動モデル
VLAモデルが追加学習や外部検証器なしに、内部のマスキング分布を利用してテスト時に複数候補から最適な行動を選択する手法を提案。
原題: Verifier-free Test-Time Sampling for Vision-Language-Action Models / Suhyeok Jang, Dongyoung Kim, Changyeon Kim 他
日本語で読む → - 論文VLA画像認識
効率的な視覚-言語-行動モデルのサーベイ
視覚-言語-行動モデル(VLA)の効率化に関する初の包括的サーベイであり、モデル設計・学習・データ収集の3つの柱で既存研究を整理し、課題と今後の方向性を示す。
原題: A Survey on Efficient Vision-Language-Action Models / Zhaoshu Yu, Bo Wang, Pengpeng Zeng 他
日本語で読む → - 論文VLAAI
MetaVLA:効率的な身体性適応のための統合メタ共訓練
多様なタスクを1段階の微調整に統合し、軽量なメタ学習で補助タスクを活用することで、VLAモデルの適応を高速化・低コスト化するフレームワークを提案。
原題: MetaVLA: Unified Meta Co-training For Efficient Embodied Adaption / Chen Li, Zhantao Yang, Han Zhang 他
日本語で読む → - 論文VLAロボティクス
UrbanVLA:都市マイクロモビリティのための視覚-言語-行動モデル
都市環境での配達ロボットなどのナビゲーションに向け、経路指示と視覚情報を統合して行動を計画するVLAフレームワークを提案し、シミュレーションと実世界データで二段階学習することで大規模都市ナビゲーションを実現した。
原題: UrbanVLA: A Vision-Language-Action Model for Urban Micromobility / Anqi Li, Zhiyong Wang, Jiazhao Zhang 他
日本語で読む → - 論文VLA機械学習
フローマッチング方策の強化学習ファインチューニングによる視覚言語行動モデルの改善
フローマッチングベースのVLAモデルに対し、重要度サンプリングを条件付きフローマッチング目的の変化で再定式化したFPOを提案し、オンライン強化学習による安定したファインチューニングを実現した。
原題: Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models / Mingyang Lyu, Yinqian Sun, Erliang Lin 他
日本語で読む → - 論文VLA画像認識
マルチモーダル言語モデルの身体性能力をスキル単位で評価・診断するベンチマークBEAR
身体性タスクを14の原子スキルに分解してMLLMを細粒度評価するベンチマークBEARを提案し、知覚と時空間モデリングがボトルネックであることを示すとともに、視覚・空間推論ツールを組み込んだBEAR-Agentで性能を改善した。
原題: Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis / Yu Qi, Haibo Zhao, Ziyu Guo 他
日本語で読む → - 論文VLAAI
その場で考えるドローン:身体性AIによる緊急着陸判断
大規模視覚言語モデルを活用した身体性AIにより、ドローンが周囲の状況を解釈し、緊急時の安全な着陸判断を自律的に行えることを都市シミュレーションで示した研究。
原題: Drones that Think on their Feet: Sudden Landing Decisions with Embodied AI / Diego Ortiz Barbosa, Mohit Agrawal, Yash Malegaonkar 他
日本語で読む → - 論文VLAロボティクス
VLA-RFT: 世界シミュレータにおける検証済み報酬を用いた視覚-言語-行動モデルの強化学習ファインチューニング
実データから学習した世界モデルをシミュレータとして使い、VLAモデルを強化学習でファインチューニングする手法を提案。400ステップ未満で教師あり学習を上回り、外乱下でも安定したタスク実行を実現した。
原題: VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators / Hengtao Li, Pengxiang Ding, Runze Suo 他
日本語で読む → - 論文VLAロボティクス
MM-Nav: マルチビューVLAモデルによるマルチエキスパート学習を用いた堅牢な視覚ナビゲーション
360度視野のマルチビューVLAモデルを強化学習エキスパートのデータから教師あり学習し、到達・すり抜け・回避の能力を統合して実世界でも汎化する視覚ナビゲーションを実現した。
原題: MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning / Tianyu Xu, Jiawei Chen, Jiazhao Zhang 他
日本語で読む → - 論文VLAロボティクス
Dexbotic: オープンソース視覚-言語-行動ツールボックス
複数のVLAモデルを単一環境で再現・開発できるPyTorchベースのオープンソースツールボックスを提供し、高性能な事前学習済みモデルも公開した。
原題: Dexbotic: Open-Source Vision-Language-Action Toolbox / Bin Xie, Erjin Zhou, Fan Jia 他
日本語で読む → - 論文VLAロボティクス
PFEA: 人間中心AIのためのLLMベース高レベル自然言語計画・フィードバック具現化エージェント
視覚言語モデルを活用し、音声対話・タスク計画・フィードバック評価を統合したロボット操作用エージェントを提案。シミュレーションと実環境で従来手法より28%高いタスク成功率を達成した。
原題: PFEA: An LLM-based High-Level Natural Language Planning and Feedback Embodied Agent for Human-Centered AI / Wenbin Ding, Jun Chen, Mingjia Chen 他
日本語で読む → - 論文VLAcs.MA
CGoT:合成可能な思考グラフを用いた身体性マルチエージェントシステムのための新規推論機構
自動運転車がサービスロボットを目的地まで運び、ロボットがタスクを行う協調システムにおいて、LLMを活用した合成可能な思考グラフ(CGoT)による推論機構を提案し、その性能を実験的に検証した。
原題: CGoT: A Novel Inference Mechanism for Embodied Multi-Agent Systems Using Composable Graphs of Thoughts / Yixiao Nie, Yang Zhang, Yingjie Jin 他
日本語で読む → - 論文VLAロボティクス
EBT-Policy:エネルギーが創発的な物理推論能力を解き放つ
拡散ポリシーに代わるエネルギー・ベースのポリシーEBT-Policyを提案し、少ない計算で高精度・高ロバストなロボット制御を実現、失敗からのゼロショット回復などの創発能力を示した。
原題: EBT-Policy: Energy Unlocks Emergent Physical Reasoning Capabilities / Travis Davies, Yiqi Huang, Alexi Gladstone 他
日本語で読む → - 論文VLAロボティクス
UNCAP: 不確実性誘導型ニューロシンボリック計画と自然言語通信による協調自動運転
自動運転車同士が自然言語メッセージで通信し、知覚の不確実性を明示的に考慮して協調計画を行う視覚言語モデルベースの手法を提案。通信帯域を削減しつつ安全性を向上させる。
原題: UNCAP: Uncertainty-Guided Neurosymbolic Planning Using Natural Language Communication for Cooperative Autonomous Vehicles / Neel P. Bhatt, Po-han Li, Kushagra Gupta 他
日本語で読む → - 論文VLAロボティクス
RoboBench:マルチモーダル大規模言語モデルを身体化脳として評価する包括的ベンチマーク
マニピュレーションの意思決定を担う「身体化脳」としてのマルチモーダルLLMを、指示理解・知覚推論・汎化計画・アフォーダンス予測・失敗分析の5次元で評価するベンチマークを提案した。
原題: Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain / Yulin Luo, Chun-Kai Fan, Menghang Dong 他
日本語で読む → - 論文VLA画像認識
VLA-R1:視覚-言語-行動モデルにおける推論能力の強化
検証可能な報酬による強化学習とGRPOを組み合わせ、アフォーダンスや軌道に沿った思考連鎖を学習させることで、VLAモデルの推論と実行精度を高めた研究。
原題: VLA-R1: Enhancing Reasoning in Vision-Language-Action Models / Angen Ye, Zeyu Zhang, Boyuan Wang 他
日本語で読む → - 論文VLAロボティクス
MoS-VLA: ワンショットスキル適応を可能にする視覚-言語-行動モデル
ロボット操作方策を学習済み基底関数の線形結合として表現し、新しいタスクには1回の実演だけで勾配更新なしに適応できるVLAフレームワークを提案。
原題: MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation / Ruihan Zhao, Tyler Ingebrand, Sandeep Chinchali 他
日本語で読む → - 論文VLAロボティクス
VER: 基盤モデル蒸留と動的ルーティングによるロボット学習のための視覚エキスパートトランスフォーマー
複数の視覚基盤モデルを蒸留してエキスパートライブラリを構築し、軽量なルーティングネットワークでタスクに応じた専門家を動的に選択することで、17種類のロボットタスクで最先端性能を達成した。
原題: VER: Vision Expert Transformer for Robot Learning via Foundation Distillation and Dynamic Routing / Yixiao Wang, Mingxiao Huo, Zhixuan Liang 他
日本語で読む → - 論文VLAロボティクス
FailSafe: VLAモデルの失敗推論と回復
VLAモデルが実行中に遭遇する失敗を検出し、回復動作を生成できるようにする失敗生成・回復システムFailSafeを提案し、LLaVA-OV-7Bを微調整してロボットアームの失敗検出・回復性能を向上させた。
原題: FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models / Zijun Lin, Jiafei Duan, Haoquan Fang 他
日本語で読む → - 論文VLAロボティクス
言語から運動へ:動作潜在ガイダンスによるリターゲティング不要なヒューマノイド制御
言語指示から直接ヒューマノイドの動作を生成するフレームワークRoboGhostを提案し、従来の動作デコード・リターゲティングを省略して低遅延かつ高精度な制御を実現した。
原題: From Language to Locomotion: Retargeting-free Humanoid Control via Motion Latent Guidance / Zhe Li, Cheng Chi, Yangyang Wei 他
日本語で読む → - 論文VLAロボティクス
MoTVLA: 高速・低速推論を統合した視覚-言語-行動モデル
事前学習済みVLMとドメイン専門家トランスフォーマーを組み合わせ、高速・低速の推論を統合してロボットの行動方策を学習するVLAモデルを提案。
原題: MoTVLA: A Vision-Language-Action Model with Unified Fast-Slow Reasoning / Wenhui Huang, Changhe Chen, Han Qi 他
日本語で読む → - 論文VLAAI
EmboMatrix: 身体性意思決定のためのスケーラブルな訓練基盤
大規模言語モデルに身体性意思決定能力を獲得させるため、タスク・シーン生成、分散シミュレーション、精密報酬を統合した訓練基盤EmboMatrixを構築し、7Bモデルが671Bモデルを上回る性能を達成した。
原題: EmboMatrix: A Scalable Training-Ground for Embodied Decision-Making / Zixing Lei, Sheng Yin, Yichen Xiong 他
日本語で読む → - 論文VLA自然言語
LLMは人間の指示を強化学習エージェントの創発的シンボル表現に翻訳できるか
階層型強化学習で創発する内部シンボル表現へ、GPTやClaudeなどのLLMが人間の自然言語指示を翻訳できるかをAnt Maze環境で評価し、粒度や複雑さへの感度と表現整合の限界を示した。
原題: Can LLMs Translate Human Instructions into a Reinforcement Learning Agent's Internal Emergent Symbolic Representation? / Ziqi Ma, Sao Mai Nguyen, Philippe Xu
日本語で読む →