論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/9/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
dVLA: マルチモーダル連鎖推論を備えた拡散型視覚-言語-行動モデル
視覚・言語・行動を単一の拡散目的関数で統合し、マルチモーダル連鎖推論を活用したVLAモデルdVLAを提案。LIBEROで96.4%の成功率を達成し、実機Frankaでも多段階計画を要するタスクに成功。
原題: dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought / Junjie Wen, Minjie Zhu, Jiaming Liu 他
日本語で読む → - 論文VLAロボティクス
コードから行動へ:拡散VLMポリシーの階層的学習
コード生成VLMと低レベル拡散ポリシーを組み合わせ、タスクをサブルーチンに分解して模倣・汎化する階層的枠組みを提案。
原題: From Code to Action: Hierarchical Learning of Diffusion-VLM Policies / Markus Peschl, Pietro Mazzaglia, Daniel Dijkman
日本語で読む → - 論文VLAロボティクス
VLMを身体性空間へと点火する:WALL-OSSによる具現化基盤モデル
大規模マルチモーダル事前学習を活用し、身体性を理解した視覚言語理解・言語と行動の連携・ロバストなマニピュレーションを統合したエンドツーエンドの具現化基盤モデルWALL-OSSを提案。
原題: Igniting VLMs toward the Embodied Space / Andy Zhai, Brae Liu, Bruno Fang 他
日本語で読む → - 論文VLAAI
Robix: ロボットの対話・推論・計画を統合する統一モデル
視覚言語モデル1つでロボットの高レベル推論・タスク計画・自然言語対話を担い、低レベル制御への指令生成と人間との対話を統合的に実現するモデルを提案。
原題: Robix: A Unified Model for Robot Interaction, Reasoning and Planning / Huang Fang, Mengxi Zhang, Heng Dong 他
日本語で読む → - 論文VLAロボティクス
Omni-LIVO: 測光マイグレーションとESIKF融合による堅牢なRGBカラー多カメラ視覚慣性LiDARオドメトリ
多カメラの視覚・慣性・LiDARを密結合し、非重複視野間の測光一貫性を保つ直接位置合わせとESIKFの多視点更新により、広範囲で高精度な自己位置推定と色付き地図生成を実現した研究。
原題: Omni-LIVO: Robust RGB-Colored Multi-Camera Visual-Inertial-LiDAR Odometry via Photometric Migration and ESIKF Fusion / Yinong Cao, Chenyang Zhang, Xin He 他
日本語で読む → - 論文VLAロボティクス
AdaNav: 不確実性に基づく適応的推論による視覚言語ナビゲーション
視覚言語ナビゲーションにおいて、不確実性に応じて推論を動的に発動する軽量プラグインを提案し、少ない学習データで大幅な性能向上を実現した。
原題: AdaNav: Adaptive Reasoning with Uncertainty for Vision-Language Navigation / Xin Ding, Jianyu Wei, Yifan Yang 他
日本語で読む → - 論文VLAロボティクス
視覚言語モデルによるバイオニックハンド制御:物体認識と把持推論の評価
8つの視覚言語モデルを対象に、静止画像から物体の名前・形状・向き・寸法を認識し、把持タイプや手首回転・開口幅などの把持パラメータを推論する統一ベンチマークを構築し、その性能と限界を評価した。
原題: Using Visual Language Models to Control Bionic Hands: Assessment of Object Perception and Grasp Inference / Ozan Karaali, Hossam Farag, Strahinja Dosen 他
日本語で読む → - 論文VLAcs.NI
相乗的強化:無線通信と身体性知能の融合
無線通信と身体性知能が相互に強化し合う共進化の枠組みを、知覚・認知・実行ループの観点から整理し、今後の課題を提示した展望論文。
原題: Synergetic Empowerment: Wireless Communications Meets Embodied Intelligence / Hongtao Liang, Yihe Diao, YuHang Wu 他
日本語で読む → - 論文VLAロボティクス
Video-to-BT: 人間の実演動画からロボット組立用の反応型ビヘイビアツリーを生成
人間の組立作業を撮影した動画をVLMでサブタスクに分解し、ビヘイビアツリーを自動生成してロボットに実行させる枠組みを提案。実行時の失敗に応じて再計画も行い、長期的な組立作業での汎化性能を実機で示した。
原題: Video-to-BT: Generating Reactive Behavior Trees from Human Demonstration Videos for Robotic Assembly / Xiwei Zhao, Yiwei Wang, Yansong Wu 他
日本語で読む → - 論文VLAロボティクス
見るために動き、動くために見る:拡散駆動の知覚-行動相互作用による適応的方策
拡散方策のノイズ予測勾配を行動誘導SDEに組み込み、知覚と行動を循環的に学習させるDP-AGを提案。シミュレーションと実機UR5で既存手法を上回った。
原題: Act to See, See to Act: Diffusion-Driven Perception-Action Interplay for Adaptive Policies / Jing Wang, Weiting Peng, Jing Tang 他
日本語で読む → - 論文VLAロボティクス
LAD-VF: LLM自動微分による形式手法フィードバックを用いたファインチューニング不要のロボットプランニング
形式検証のフィードバックをプロンプト改善に活用し、モデルの再学習なしでLLMのロボット計画の安全性・仕様遵守を高めるフレームワークを提案。
原題: LAD-VF: LLM-Automatic Differentiation Enables Fine-Tuning-Free Robot Planning from Formal Methods Feedback / Yunhao Yang, Junyuan Hong, Gabriel Jacob Perin 他
日本語で読む → - 論文VLAロボティクス
DynaMIC: 動的マルチモーダル・インコンテキスト学習によるロボットの反事実的指示への耐性
人間の誤解を招く指示(指示的反事実)を検出し、ロボットがタスク実行中にフィードバックを返すことで安全性を高めるフレームワークDynaMICを提案した。
原題: DynaMIC: Dynamic Multimodal In-Context Learning Enabled Embodied Robot Counterfactual Resistance Ability / Tianqiang Yan, Ziqiao Lin, Sicheng Wang 他
日本語で読む → - 論文VLAロボティクス
V2V-GoT: マルチモーダル大規模言語モデルと思考グラフによる車車間協調自動運転
車車間通信とマルチモーダル大規模言語モデルを組み合わせ、思考グラフ推論を用いて遮蔽物がある状況でも協調的な知覚・予測・計画を行う手法を提案した。
原題: V2V-GoT: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models and Graph-of-Thoughts / Hsu-kuang Chiu, Ryo Hachiuma, Chien-Yi Wang 他
日本語で読む → - 論文VLAロボティクス
動作認識型動的プルーニングによる効率的なVision-Language-Actionマニピュレーション
ロボット操作の段階に応じて視覚トークンの冗長性が異なる点に着目し、動作軌跡に基づいてトークン保持率を適応的に調整するプルーニング手法を提案。計算量と遅延を削減しつつ成功率を維持する。
原題: Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation / Xiaohuan Pei, Yuxing Chen, Siyu Xu 他
日本語で読む → - 論文VLA画像認識
SpecPrune-VLA: 行動認識型自己投機的プルーニングによる視覚言語行動モデルの高速化
VLAモデルの推論を高速化するため、時空間的一貫性を利用して視覚トークンを行動レベルと層レベルで動的に枝刈りする学習不要の手法を提案し、成功率を維持しつつ最大1.7倍の高速化を実現した。
原題: SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning / Hanzhen Wang, Jiaming Xu, Yushun Xiang 他
日本語で読む → - 論文VLAロボティクス
M3ET:マルチモーダルMamba強化Transformerによるロボティクス向け効率的視覚言語学習
Mambaモジュールと意味論的適応注意機構を組み合わせた軽量モデルM3ETを提案し、ロボットの視覚言語タスクで推論速度を2.3倍向上させつつパラメータ数を削減した。
原題: M3ET: Efficient Vision-Language Learning for Robotics based on Multimodal Mamba-Enhanced Transformer / Yanxin Zhang, Liang He, Zeyi Kang 他
日本語で読む → - 論文VLAロボティクス
AutoDrive-R²: 自動運転VLAモデルの推論と自己反省能力を強化
自動運転向けVLAモデルに思考連鎖と強化学習を導入し、推論と自己反省を促すことで軌道計画の精度と解釈性を向上させた研究。
原題: AutoDrive-R$^2$: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving / Zhenlong Yuan, Chengxuan Qian, Jing Tang 他
日本語で読む → - 論文VLA画像認識
基盤モデルは段階的な身体性推論においてどれほど優れているか?
身体性環境での段階的推論能力を評価するFoMERベンチマークを提案し、主要な大規模マルチモーダルモデルの性能と限界を分析した。
原題: How Good are Foundation Models in Step-by-Step Embodied Reasoning? / Dinura Dissanayake, Ahmed Heakl, Omkar Thawakar 他
日本語で読む → - 論文VLAロボティクス
クロスモーダル指示によるロボット動作生成
自由記述テキストなどの粗い注釈を指示として使い、視覚言語モデルと微調整モデルを組み合わせて3D動作軌道を生成するCrossInstructを提案し、強化学習と組み合わせて実機・シミュレーションで検証した。
原題: Cross-Modal Instructions for Robot Motion Generation / William Barron, Xiaoxiang Dong, Matthew Johnson-Roberson 他
日本語で読む → - 論文VLAロボティクス
GalaxeaオープンワールドデータセットとG0デュアルシステムVLAモデル
実環境で収集した大規模ロボット行動データセットを構築し、VLMによる計画とVLAによる実行を組み合わせた二重システムモデルG0を3段階学習で訓練した。
原題: Galaxea Open-World Dataset and G0 Dual-System VLA Model / Tao Jiang, Tianyuan Yuan, Yicheng Liu 他
日本語で読む → - 論文VLAロボティクス
CLAW: 重量を考慮したロボット把持のための視覚-言語-行動フレームワーク
重量計の数値をCLIPで監視して閾値に応じた指示を生成し、VLAポリシーと組み合わせて重量を考慮した把持を実現するフレームワークを提案。
原題: CLAW: A Vision-Language-Action Framework for Weight-Aware Robotic Grasping / Zijian An, Ran Yang, Yiming Feng 他
日本語で読む → - 論文VLAロボティクス
SimpleVLA-RL:強化学習によるVLAモデル訓練のスケーリング
VLAモデル向けの効率的な強化学習フレームワークを提案し、大規模データへの依存を減らしつつLIBEROやRoboTwinで高性能を達成した。
原題: SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning / Haozhan Li, Yuxin Zuo, Jiale Yu 他
日本語で読む → - 論文VLAロボティクス
CollabVLA: 人間と共に夢を見る自己内省型視覚-言語-行動モデル
VLMによる内省的推論と拡散ベースの行動生成を専門家混合設計で統合し、不確実な状況では人間に助言を求める協調的な視覚-言語-行動エージェントを実現した。
原題: CollabVLA: Self-Reflective Vision-Language-Action Model Dreaming Together with Human / Nan Sun, Yongchang Li, Chenxu Wang 他
日本語で読む → - 論文VLAロボティクス
正規化フローによる双腕視覚運動ポリシー
双腕操作のための条件付き正規化フローベースの視覚運動ポリシーNF-Pを提案し、尤度計算を活かした推論時最適化で高成功率・低遅延を実現した。
原題: Normalizing Flows are Capable Models for Bi-manual Visuomotor Policy / Jialong Li, Simon Kristoffersson Lind, Wenrui Xie 他
日本語で読む → - 論文VLAロボティクス
PhysicalAgent:基盤世界モデルによる汎用認知ロボティクスの実現
テキスト指示から拡散モデルで動画デモを生成し、ロボットで実行・失敗時に再計画する反復ループで、多様なロボットのマニピュレーション成功率を最大80%まで高めた。
原題: PhysicalAgent: Towards General Cognitive Robotics with Foundation World Models / Artem Lykov, Jeffrin Sam, Hung Khang Nguyen 他
日本語で読む → - 論文VLA画像認識
LLM-RG: 大規模言語モデルを用いた屋外シーンにおける参照表現のグラウンディング
屋外運転シーンで自然言語の参照表現(例:「右側の黒い車」)が指す物体を特定するため、視覚言語モデルで属性を抽出し、大規模言語モデルで推論するハイブリッド手法を提案。Talk2Carベンチマークで大幅な精度向上を達成。
原題: LLM-RG: Referential Grounding in Outdoor Scenarios using Large Language Models / Pranav Saxena, Avigyan Bhattacharya, Ji Zhang 他
日本語で読む → - 論文VLAロボティクス
マルチアームロボット操作における方策推論のためのグラフ融合視覚-言語-行動
人間のRGB-D動画からタスクレベルの推論と実行を可能にするGF-VLAを提案し、シーングラフと言語条件付きトランスフォーマで二腕ロボットの動作を生成する。
原題: Graph-Fused Vision-Language-Action for Policy Reasoning in Multi-Arm Robotic Manipulation / Shunlei Li, Longsen Gao, Jiuwen Cao 他
日本語で読む → - 論文VLAロボティクス
OmniVLA:ロボットナビゲーションのためのオムニモーダル視覚言語行動モデル
2D姿勢・自己中心画像・自然言語などの複数のゴール指定をランダムに融合して学習し、未知環境への汎化や新しい言語指示への追従を可能にしたナビゲーション用VLAモデルを提案。
原題: OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation / Noriaki Hirose, Catherine Glossop, Dhruv Shah 他
日本語で読む → - 論文VLAロボティクス
World-Env: ワールドモデルを仮想環境として活用するVLAポストトレーニング
物理的に整合性のあるワールドモデルを仮想シミュレータとして使い、VLAモデルを強化学習でポストトレーニングする枠組みを提案。タスクごとに5件の実演データだけで複雑なマニピュレーション性能を向上させる。
原題: World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training / Junjin Xiao, Yandan Yang, Xinyuan Chang 他
日本語で読む → - 論文VLAロボティクス
トルク対応VLAモデルの設計空間の解明
トルク信号をVLAモデルに統合する設計空間を体系的に検討し、デコーダへのトルクアダプタ導入と補助出力としてのトルク予測が有効であることを示した。
原題: TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models / Zongzheng Zhang, Haobo Xu, Zhuo Yang 他
日本語で読む →