論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/11/23 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAAI
タスク特化型視覚言語制御のための弱教師あり潜在モデル
目標状態の教師信号のみから共有潜在空間における行動による状態変化を学習するタスク特化型潜在ダイナミクスモデルを提案し、ドローンの空間的グラウンディングタスクで成功率を58%から71%に改善した。
原題: Weakly-supervised Latent Models for Task-specific Visual-Language Control / Xian Yeow Lee, Lasitha Vidyaratne, Gregory Sin 他
日本語で読む → - 論文VLA画像認識
空間超感覚なしで空間超感覚を解く
動画世界モデルの空間超感覚ベンチマークを批判的に検証し、単純なbag-of-wordsモデルがほぼ完全に解けること、既存の推論手法がショートカットを利用していることを示した。
原題: Solving Spatial Supersensing Without Spatial Supersensing / Vishaal Udandarao, Shyamgopal Karthik, Surabhi S. Nath 他
日本語で読む → - 論文VLAAI
IPR-1: 対話型物理推論器
1000以上の多様なゲームで物理法則と因果関係を学習し、世界モデルの予測とVLMの推論を統合して未知のゲームにもゼロショットで対応するエージェントを提案。
原題: IPR-1: Interactive Physical Reasoner / Mingyu Zhang, Lifeng Zhuo, Tianxi Tan 他
日本語で読む → - 論文VLA機械学習
環境との対話によるLLMエージェントのテスト時適応
LLMエージェントが未知の環境に適応するため、オンライン構文整合と展開時の動力学接地という2つの手法を提案し、関数呼び出しやWebナビゲーションで有効性を示した。
原題: Test-Time Adaptation for LLM Agents via Environment Interaction / Arthur Chen, Zuxin Liu, Jianguo Zhang 他
日本語で読む → - 論文自動運転VLA画像認識
DeeAD: 自動運転のための視覚言語行動モデルにおける動的早期終了
自動運転向けVLAモデルの推論を、中間軌道の物理的妥当性に基づいて早期終了させることで、再学習なしに最大29%の遅延削減を実現した。
原題: DeeAD: Dynamic Early Exit of Vision-Language Action for Efficient Autonomous Driving / Haibo HU, Lianming Huang, Nan Guan 他
日本語で読む → - 論文VLAロボティクス
道路状況検出とC-ITSメッセージ生成のためのマルチエージェントAIフレームワーク
マルチモーダル大規模言語モデルと視覚ベース知覚を組み合わせたマルチエージェントAIで、道路状況の検出と協調型ITSメッセージ生成を行う。
原題: Multi-Agent AI Framework for Road Situation Detection and C-ITS Message Generation / Kailin Tong, Selim Solmaz, Kenan Mujkic 他
日本語で読む → - 論文自動運転/VLAロボティクス
CoC-VLA: 因果連鎖型視覚言語行動モデルによる説明可能な自動運転のための敵対的ドメイン転移
シミュレーションで得た長尾ケース対応能力を実世界へ転移するため、因果連鎖推論を行う視覚言語モデルを教師・生徒・識別器で構成した敵対的転移フレームワークを提案した論文。
原題: CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model / Dapeng Zhang, Fei Shen, Rui Zhao 他
日本語で読む → - 論文VLAロボティクス
TRACE: アフォーダンス座標抽出のためのテキスト推論
視覚言語モデルにテキスト形式の推論連鎖を組み込み、指示からロボット操作に必要な空間アフォーダンス座標を高精度に予測する手法を提案。
原題: TRACE: Textual Reasoning for Affordance Coordinate Extraction / Sangyun Park, Jin Kim, Yuchen Cui 他
日本語で読む → - 論文自動運転VLA画像認識
Percept-WAM: 知覚強化型世界認識行動モデルによる堅牢なエンドツーエンド自動運転
2D/3D知覚を単一の視覚言語モデルに統合し、World-PV/World-BEVトークンとグリッド条件付き予測で長尾・遠距離・小物体に強い自動運転モデルを提案。
原題: Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving / Jianhua Han, Meng Tian, Jiangtong Zhu 他
日本語で読む → - 論文VLAロボティクス
ロボットマニピュレーションにおける記憶状態の進展を再考する:オブジェクト中心の視点
視覚的に類似した物体との連続的な相互作用を要する非マルコフ的タスクにおいて、物体ごとの履歴を保持するスロット中心のVLAフレームワークを提案し、LIBERO-Memベンチマークで評価した。
原題: Rethinking Progression of Memory State in Robotic Manipulation: An Object-Centric Perspective / Nhat Chung, Taisei Hanyu, Toan Nguyen 他
日本語で読む → - 論文自動運転/VLAロボティクス
Alpamayo-R1: 長尾シナリオにおける汎化可能な自動運転のための推論と行動予測の橋渡し
視覚言語行動モデルに因果連鎖推論を組み込み、拡散ベースの軌道デコーダと強化学習を組み合わせることで、長尾の安全臨界シナリオでの自動運転計画精度と推論品質を向上させた研究。
原題: Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail / NVIDIA, :, Yan Wang 他
日本語で読む → - 論文VLAロボティクス
VLAはVLMからいかに効果的に継承するのか?
絵文字を使った卓上操作タスクでVLAがVLMの事前知識を継承する条件を診断し、パラメータ効率微調整やVLM凍結などの手法を比較した。
原題: How Do VLAs Effectively Inherit from VLMs? / Chuheng Zhang, Rushuai Yang, Xiaoyu Chen 他
日本語で読む → - 論文VLA画像認識
SemanticVLA: 効率的なロボット操作のための意味論的整合スパース化と強化
視覚言語行動モデルの知覚冗長性と指示-視覚の浅い整合を解決するため、意味論に基づく視覚プルーニングと階層的融合、行動結合を導入し、LIBEROでOpenVLAを21.1%上回る性能と効率を実現した。
原題: SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation / Wei Li, Renshan Zhang, Rui Shao 他
日本語で読む → - 論文VLAロボティクス
RobustVLA: 視覚言語行動モデルのためのロバスト性を考慮した強化学習ポストトレーニング
事前学習済みVLAモデルに対し、ヤコビアン正則化と平滑化正則化を組み込んだオンライン強化学習ポストトレーニングを行い、観測ノイズや行動摂動に対するロバスト性を高める手法を提案した。
原題: RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models / Hongyin Zhang, Shuo Zhang, Junxi Jin 他
日本語で読む → - 論文VLAロボティクス
SVBRD-LLM: 自動運転車識別のための自己検証型行動ルール発見フレームワーク
交通動画からLLMのゼロショット推論で自動運転車と人間運転車の行動差を表す解釈可能なルールを自動抽出し、識別タスクで検証・洗練するフレームワークを提案。
原題: SVBRD-LLM: Self-Verifying Behavioral Rule Discovery for Autonomous Vehicle Identification / Xiangyu Li, Tianyi Wang, Junfeng Jiao 他
日本語で読む → - 論文VLAロボティクス
自動運転における視覚言語モデルの幻覚を低ランク分解で軽減する手法
複数の視覚言語モデルが生成したキャプションを、文埋め込み行列の低ランク分解で得られるスパース残差の大きさでランク付けし、幻覚の少ないキャプションを選別する手法を提案。
原題: A Low-Rank Method for Vision Language Model Hallucination Mitigation in Autonomous Driving / Keke Long, Jiacheng Guo, Tianyun Zhang 他
日本語で読む → - 論文VLAロボティクス
DIPOLE: 視覚と幾何を融合したロバストな視覚運動汎化
視覚と言語・幾何の相補的なモダリティを訓練時のドロップアウトとクロスアテンションで融合し、照明や視点変化に強い拡散ポリシーを実現した。
原題: DIPOLE: Fusing Vision and Geometry for Robust Visuomotor Generalization / Yikai Tang, Haoran Geng, Jindou Jia 他
日本語で読む → - 論文VLAロボティクス
FT-NCFM:効率的なVLAモデルのための影響力考慮型データ蒸留フレームワーク
VLAモデルの学習データを因果帰属と敵対的生成で蒸留し、5%のデータで85-90%の成功率を達成しつつ学習時間を80%以上削減するデータ中心の手法を提案。
原題: FT-NCFM: An Influence-Aware Data Distillation Framework for Efficient VLA Models / Kewei Chen, Yayu Long, Shuai Li 他
日本語で読む → - 論文VLAロボティクス
XR-1: 統合視覚運動表現の学習による汎用視覚-言語-行動モデル
視覚ダイナミクスとロボット運動を統合した離散潜在表現UVMCを二枝VQ-VAEで学習し、異種ロボットデータを横断する汎用VLAモデルXR-1を三段階学習で構築した研究。
原題: XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations / Shichao Fan, Kun Wu, Zhengping Che 他
日本語で読む → - 論文VLAロボティクス
LAVQA: 自動運転車の共有自律のための遅延認識型視覚質問応答フレームワーク
無線遅延と人間の応答時間を考慮した衝突リスクマップを視覚質問応答に組み込み、遠隔操作者が安全に自動運転車を支援できる枠組みを提案し、CARLAシミュレーションで衝突率を8倍以上削減した。
原題: LAVQA: A Latency-Aware Visual Question Answering Framework for Shared Autonomy in Self-Driving Vehicles / Shuangyu Xie, Kaiyuan Chen, Wenjing Chen 他
日本語で読む → - 論文VLAロボティクス
RoboTidy:3Dガウススプラッティングによる家庭内片付けの身体性ナビゲーション・行動ベンチマーク
言語指示に基づく家庭内片付けタスクのための、3Dガウススプラッティングで構築した500シーンのフォトリアルなベンチマークを提案し、VLA・VLNの学習と評価を可能にした。
原題: RoboTidy : A 3D Gaussian Splatting Household Tidying Benchmark for Embodied Navigation and Action / Xiaoquan Sun, Ruijian Zhang, Kang Pang 他
日本語で読む → - 論文VLAロボティクス
自由形式の言語でヒューマノイドを操作する:統一動作語彙を持つ大規模言語行動モデル
自然言語コマンドをヒューマノイドの全身動作に直接変換する大規模言語行動モデルHumanoid-LLAを提案し、人間とヒューマノイドの動作語彙を統合して物理的安定性を確保した。
原題: Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary / Zhirui Liu, Kaiyang Ji, Ke Yang 他
日本語で読む → - 論文VLA画像認識
マルチモーダル基盤モデルによる空間知能のスケーリング
800万件の多様な空間データでマルチモーダル基盤モデルを訓練し、空間知能ベンチマークで大幅な性能向上を達成するとともに、データスケーリングや創発的汎化の兆候を分析した。
原題: Scaling Spatial Intelligence with Multimodal Foundation Models / Zhongang Cai, Ruisi Wang, Chenyang Gu 他
日本語で読む → - 論文VLAロボティクス
Skypilot: 物理的接地を取り入れたLLM微調整によるAAVカバレッジ探索
モンテカルロ木探索と物理に基づく報酬を組み合わせてLLMを物理世界に接地させ、Qwen3-4Bを微調整することで、自律飛行体のカバレッジ探索を効率化した二段階フレームワーク。
原題: Skypilot: Fine-Tuning LLM with Physical Grounding for AAV Coverage Search / Zhongkai Chen, Yihao Sun, Chao Yan 他
日本語で読む → - 論文VLAロボティクス
SENTINEL: ヒューマノイド全身制御のための完全エンドツーエンド言語行動モデル
言語指示と固有感覚入力から低レベル行動を直接生成するエンドツーエンドモデルを構築し、シミュレーションと実機でヒューマノイドの全身制御を実現した。
原題: SENTINEL: A Fully End-to-End Language-Action Model for Humanoid Whole Body Control / Yuxuan Wang, Haobin Jiang, Shiqing Yao 他
日本語で読む → - 論文VLAロボティクス
NORA-1.5:世界モデルと行動に基づく選好報酬で訓練された視覚-言語-行動モデル
事前学習済みNORAにフローマッチング行動エキスパートを追加し、世界モデルと正解からの逸脱を報酬とするDPOで事後学習することで、シミュレーションと実機の両方で信頼性と汎化性能を向上させたVLAモデル。
原題: NORA-1.5: A Vision-Language-Action Model Trained using World Model- and Action-based Preference Rewards / Chia-Yu Hung, Navonil Majumder, Haoyuan Deng 他
日本語で読む → - 論文VLAロボティクス
EchoVLA: 宣言的記憶を統合した移動マニピュレーション向け視覚-言語-行動モデル
人間の脳に着想を得たシーン記憶とエピソード記憶を組み合わせ、移動と操作を協調させるメモリ対応VLAモデルを提案し、大規模学習用ベンチマークMoManiも構築した。
原題: EchoVLA: Robotic Vision-Language-Action Model with Synergistic Declarative Memory for Mobile Manipulation / Min Lin, Xiwen Liang, Bingqian Lin 他
日本語で読む → - 論文VLAロボティクス
WMPO:世界モデルに基づく視覚-言語-行動モデルの方策最適化
実環境と相互作用せずにピクセルベースの世界モデル上でVLAモデルを強化学習し、自己修正などの創発行動やサンプル効率の向上を実現した。
原題: WMPO: World Model-based Policy Optimization for Vision-Language-Action Models / Fangqi Zhu, Zhengyang Yan, Zicong Hong 他
日本語で読む → - 論文VLA機械学習
DeepThinkVLA:視覚言語行動モデルの推論能力を高める
CoTがVLAモデルに有効となる2つの条件(デコーディング整合性と因果整合性)を特定し、それに基づくハイブリッドアテンションとSFT→RLパイプラインでLIBEROやRoboTwinでの成功率を大幅に向上させた論文。
原題: DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models / Cheng Yin, Yankai Lin, Wang Xu 他
日本語で読む → - 論文VLAロボティクス
アクションチャンキングにおける地平線の混合
VLAモデルで問題となる行動チャンク長(地平線)のトレードオフを解消するため、異なる地平線のセグメントを並列処理して統合するMixture of Horizons戦略を提案し、性能と汎化性を向上させた。
原題: Mixture of Horizons in Action Chunking / Dong Jing, Gang Wang, Jiaqi Liu 他
日本語で読む →