論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/10/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
MoTVLA: 高速・低速推論を統合した視覚-言語-行動モデル
事前学習済みVLMとドメイン専門家トランスフォーマーを組み合わせ、高速・低速の推論を統合してロボットの行動方策を学習するVLAモデルを提案。
原題: MoTVLA: A Vision-Language-Action Model with Unified Fast-Slow Reasoning / Wenhui Huang, Changhe Chen, Han Qi 他
日本語で読む → - 論文VLAロボティクス
MatterDoor: 生成モデルによるゼロショット時空間意味論的事前分布のサンプリング
事前学習済み生成視覚モデルを用いて、ドア越しに隠れた部屋の3D点群仮説を生成し、ロボットのナビゲーションや目標指向行動のための時空間意味論的事前分布をゼロショットで導出する手法を提案。
原題: MatterDoor: Sampling Zero-shot Spatio-semantic Priors using Generative Models / Subhransu S. Bhattacharjee, Hao Lu, Dylan Campbell 他
日本語で読む → - 論文VLAcs.CR
DropVLA: 視覚言語行動モデルに対する行動レベルバックドア攻撃
VLAモデルの微調整時に視覚トリガーを混ぜ、攻撃者が指定したタイミングで特定の行動(例:グリッパを開く)を実行させる行動レベルバックドア攻撃を提案し、実機でも検証した。
原題: DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models / Zonghuan Xu, Jiayu Li, Yunhan Zhao 他
日本語で読む → - 論文VLAロボティクス
VLA-RFT: 世界シミュレータにおける検証済み報酬を用いた視覚-言語-行動モデルの強化学習ファインチューニング
実データから学習した世界モデルをシミュレータとして使い、VLAモデルを強化学習でファインチューニングする手法を提案。400ステップ未満で教師あり学習を上回り、外乱下でも安定したタスク実行を実現した。
原題: VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators / Hengtao Li, Pengxiang Ding, Runze Suo 他
日本語で読む → - 論文VLAAI
EmboMatrix: 身体性意思決定のためのスケーラブルな訓練基盤
大規模言語モデルに身体性意思決定能力を獲得させるため、タスク・シーン生成、分散シミュレーション、精密報酬を統合した訓練基盤EmboMatrixを構築し、7Bモデルが671Bモデルを上回る性能を達成した。
原題: EmboMatrix: A Scalable Training-Ground for Embodied Decision-Making / Zixing Lei, Sheng Yin, Yichen Xiong 他
日本語で読む → - 論文VLA画像認識
WristWorld: 4D世界モデルによるロボットマニピュレーションのための手首視点映像生成
アンカー視点の映像から手首視点の映像を生成する4D世界モデルを提案し、VLAモデルのマニピュレーション性能を向上させた。
原題: WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation / Zezhong Qian, Xiaowei Chi, Yuming Li 他
日本語で読む → - 論文VLA画像認識
VLA-R1:視覚-言語-行動モデルにおける推論能力の強化
検証可能な報酬による強化学習とGRPOを組み合わせ、アフォーダンスや軌道に沿った思考連鎖を学習させることで、VLAモデルの推論と実行精度を高めた研究。
原題: VLA-R1: Enhancing Reasoning in Vision-Language-Action Models / Angen Ye, Zeyu Zhang, Boyuan Wang 他
日本語で読む → - 論文VLAロボティクス
UrbanVLA:都市マイクロモビリティのための視覚-言語-行動モデル
都市環境での配達ロボットなどのナビゲーションに向け、経路指示と視覚情報を統合して行動を計画するVLAフレームワークを提案し、シミュレーションと実世界データで二段階学習することで大規模都市ナビゲーションを実現した。
原題: UrbanVLA: A Vision-Language-Action Model for Urban Micromobility / Anqi Li, Zhiyong Wang, Jiazhao Zhang 他
日本語で読む → - 論文VLA機械学習
フローマッチング方策の強化学習ファインチューニングによる視覚言語行動モデルの改善
フローマッチングベースのVLAモデルに対し、重要度サンプリングを条件付きフローマッチング目的の変化で再定式化したFPOを提案し、オンライン強化学習による安定したファインチューニングを実現した。
原題: Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models / Mingyang Lyu, Yinqian Sun, Erliang Lin 他
日本語で読む → - 論文VLAロボティクス
推論時経験からアフォーダンスを学ぶ視覚-言語-行動モデル
VLAモデルの低レベル方策を高レベルVLMと接続し、実行時の失敗経験を文脈に取り込んで反省・再計画することで、長期的タスクを遂行できるようにする手法LITENを提案。
原題: Learning Affordances at Inference-Time for Vision-Language-Action Models / Ameesh Shah, William Chen, Adwait Godbole 他
日本語で読む → - 論文VLAロボティクス
空間から行動へ:空間基盤事前分布に基づく視覚-言語-行動モデル
RGB画像から空間基盤モデルで3D幾何事前分布を抽出し、行動ヘッドに注入することで、追加センサーなしにVLAモデルの空間推論能力を高めるFALCONを提案。
原題: From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors / Zhengshen Zhang, Hao Li, Yalun Dai 他
日本語で読む → - 論文VLAロボティクス
IntentionVLA: 人間とロボットのインタラクションのための汎用かつ効率的な意図推論
意図推論・空間グラウンディング・簡潔な身体性推論を組み合わせたカリキュラム学習と効率的推論機構により、間接的な指示から人間の意図を推論して行動生成するVLAフレームワークを提案。
原題: IntentionVLA: Generalizable and Efficient Embodied Intention Reasoning for Human-Robot Interaction / Yandu Chen, Kefan Gu, Yuqing Wen 他
日本語で読む → - 論文VLAロボティクス
検証器不要のテスト時サンプリングによる視覚-言語-行動モデル
VLAモデルが追加学習や外部検証器なしに、内部のマスキング分布を利用してテスト時に複数候補から最適な行動を選択する手法を提案。
原題: Verifier-free Test-Time Sampling for Vision-Language-Action Models / Suhyeok Jang, Dongyoung Kim, Changyeon Kim 他
日本語で読む → - 論文VLA画像認識
OmniSAT: コンパクトな行動トークンによる高速自己回帰VLA
行動をBスプライン符号化と多段残差量子化で圧縮トークン化し、自己回帰型VLAの系列長を6.8倍短縮して学習効率を高める手法を提案。
原題: OmniSAT: Compact Action Token, Faster Auto Regression / Huaihai Lyu, Chaofan Chen, Senwei Xie 他
日本語で読む → - 論文VLAAI
BLM₁:デジタルと物理を横断する汎用大規模モデル
デジタル空間と物理空間、異なるタスクやロボット身体をまたいで動作する統合型マルチモーダル基盤モデルBLM₁を提案し、2段階学習で身体性知識と制御を両立させた。
原題: BLM$_1$: A Boundless Large Model for Cross-Space, Cross-Task, and Cross-Embodiment Learning / Wentao Tan, Bowen Wang, Heng Zhi 他
日本語で読む → - 論文VLAAI
D2E: デスクトップデータによる視覚-行動事前学習のスケーリングと身体性AIへの転移
デスクトップのゲーム操作データを大規模に収集・圧縮し、汎用逆動力学モデルで疑似ラベル付けして事前学習することで、ロボットの操作・ナビゲーションタスクへ転移可能な基盤モデルを構築した。
原題: D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI / Suhwan Choi, Jaeyoon Jung, Haebin Seong 他
日本語で読む → - 論文VLAロボティクス
VER: 基盤モデル蒸留と動的ルーティングによるロボット学習のための視覚エキスパートトランスフォーマー
複数の視覚基盤モデルを蒸留してエキスパートライブラリを構築し、軽量なルーティングネットワークでタスクに応じた専門家を動的に選択することで、17種類のロボットタスクで最先端性能を達成した。
原題: VER: Vision Expert Transformer for Robot Learning via Foundation Distillation and Dynamic Routing / Yixiao Wang, Mingxiao Huo, Zhixuan Liang 他
日本語で読む → - 論文VLAロボティクス
NoTVLA: 物語的行動インターフェースによる意味を保つロボット適応
VLAモデルの破滅的忘却を防ぐため、ロボットエンドエフェクタの軌跡を時間圧縮・空間推論で疎にし、その疎軌跡でファインチューニングするNoTVLAを提案。pi0より大幅に少ない計算量で高性能・高汎化を実現。
原題: NoTVLA: Semantics-Preserving Robot Adaptation via Narrative Action Interfaces / Zheng Huang, Mingyu Liu, Xiaoyi Lin 他
日本語で読む → - 論文VLAAI
目に見える以上のもの?視覚言語運転モデルにおける推論と計画の乖離の解明
運転用VLMエージェントの計画が自然言語推論に因果的に依存するかを検証し、実際には推論ではなく事前情報に依存していることを示した研究。
原題: More Than Meets the Eye? Uncovering the Reasoning-Planning Disconnect in Training Vision-Language Driving Models / Xurui Song, Shuo Huai, JingJing Jiang 他
日本語で読む → - 論文VLAロボティクス
MoS-VLA: ワンショットスキル適応を可能にする視覚-言語-行動モデル
ロボット操作方策を学習済み基底関数の線形結合として表現し、新しいタスクには1回の実演だけで勾配更新なしに適応できるVLAフレームワークを提案。
原題: MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation / Ruihan Zhao, Tyler Ingebrand, Sandeep Chinchali 他
日本語で読む → - 論文VLAロボティクス
自己改善VLAのための反省ベースタスク適応
VLMの因果推論で失敗から報酬を自動生成し強化学習を加速、成功軌道の模倣で報酬ハッキングを防ぐ二経路フレームワークを提案。
原題: Reflection-Based Task Adaptation for Self-Improving VLA / Baicheng Li, Dong Wu, Zike Yan 他
日本語で読む → - 論文VLAロボティクス
不確実性推定の統合による信頼性の高いLLMベースのロボットプランニング
LLMによるロボットプランニングの不確実性を認識論的不確実性と内在的不確実性に分解し、さらにタスクの明確さと馴染み深さに細分して推定する手法CUREを提案し、キッチン操作と卓上整理の実験で実行結果との整合性が向上することを示した。
原題: Towards Reliable LLM-based Robot Planning via Combined Uncertainty Estimation / Shiyuan Yin, Chenjia Bai, Zihao Zhang 他
日本語で読む → - 論文VLA画像認識
Less is More: 自動運転のための軽量かつ強力な視覚言語モデル
自動運転を言語問題として捉え、視覚言語モデルを用いて前視カメラ入力から直接軌道を予測する一段階エンドツーエンドフレームワークMax-V1を提案。nuScenesで30%以上の性能向上を達成。
原題: Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving / Sheng Yang, Tong Zhan, Guancheng Chen 他
日本語で読む → - 論文VLA機械学習
OpenVLAに創発する世界表現
OpenVLAの内部表現を線形・非線形プローブで解析し、状態遷移を予測できる世界モデルが暗黙的に学習されていることを示した研究。
原題: Emergent World Representations in OpenVLA / Marco Molinari, Leonardo Nevali, Saharsha Navani 他
日本語で読む → - 論文VLAロボティクス
ConEQsA: 並行・非同期な身体性質問のスケジューリングと応答
複数の質問が非同期に届く実環境向けに、緊急度を考慮して並行処理する身体性質問応答フレームワークとベンチマークを提案した。
原題: ConEQsA: Concurrent and Asynchronous Embodied Questions Scheduling and Answering / Haisheng Wang, Dong Liu, Weiming Zhi
日本語で読む → - 論文VLAロボティクス
GalaxeaオープンワールドデータセットとG0デュアルシステムVLAモデル
実環境で収集した大規模ロボット行動データセットを構築し、VLMによる計画とVLAによる実行を組み合わせた二重システムモデルG0を3段階学習で訓練した。
原題: Galaxea Open-World Dataset and G0 Dual-System VLA Model / Tao Jiang, Tianyuan Yuan, Yicheng Liu 他
日本語で読む → - 論文VLAロボティクス
RoboChemist: 長期的・安全基準準拠のロボット化学実験システム
VLMとVLAを組み合わせた二重ループ構成で、危険物や変形物を扱う多段階の化学実験を、安全規範を守りながら実行するロボットシステムを提案した。
原題: RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation / Zongzheng Zhang, Chenghao Yue, Haobo Xu 他
日本語で読む → - 論文VLA画像認識
JanusVLN: 二重暗黙メモリで意味と空間を分離する視覚言語ナビゲーション
人間の左右脳のように意味理解と空間認知を別々の固定サイズの暗黙的ニューラルメモリで表現し、冗長な計算を抑えつつ効率的に視覚言語ナビゲーションを行うフレームワークを提案した。
原題: JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation / Shuang Zeng, Dekang Qi, Xinyuan Chang 他
日本語で読む → - 論文VLAロボティクス
視覚言語モデルによる自律移動ロボットの危険回避
視覚言語モデルと大規模言語モデルを組み合わせ、都市環境の異常や危険をリアルタイムで検知・報告し、可能な場合は自動で回避行動をとるシステムを提案した。
原題: Embodied Hazard Mitigation using Vision-Language Models for Autonomous Mobile Robots / Oluwadamilola Sotomi, Devika Kodi, Kiruthiga Chandra Shekar 他
日本語で読む → - 論文VLAロボティクス
LLMによるタスク・アフォーダンスレベル探索を用いた強化学習
大規模言語モデルの計画をタスクとアフォーダンスの両レベルで活用し、強化学習の探索を効率化するフレームワークLLM-TALEを提案。把持・配置タスクで成功率とサンプル効率が向上し、実機へのゼロショット転移も示した。
原題: LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning / Jelle Luijkx, Runyu Ma, Zlatan Ajanović 他
日本語で読む →