論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/16 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA画像認識
FIVE-VLA: 再帰的行動メモリによる高速で効果的な自動運転
高解像度画像をわずか98トークンに圧縮する効率的な視覚エンコーダと、過去の行動トークンを条件に用いる再帰的行動メモリ(RAM)を組み合わせ、641Mパラメータで従来のVLAより高速・高精度に軌道予測を行う自動運転モデル。
原題: FIVE-VLA: Fast and EffectIVE Autonomous Driving with Recurrent Action Memory / Kemal Oksuz, Alexandru Buburuzan, Yuhan Yao 他
日本語で読む → - 論文VLAロボティクス
視覚・言語・行動を分離した効率的なマルチタスクロボット方策
VLMを使わず視覚エンコーダ・言語エンコーダ・行動ヘッドを分離した方策を構築し、同等の成功率を保ちつつ推論速度と省エネ性を大幅に改善した。
原題: Decoupling Vision, Language, and Action for Efficient Multi-Task Robot Policies / Xiatao Sun, Chen Liang, Ziyao Zeng 他
日本語で読む → - 論文VLA画像認識
Finder: 身体性グラウンディングのためのエージェント型閉ループ物体探索
言語で指定された物体を部分的に観測された3Dシーンから見つけるため、計画・証拠収集・検証・制御を閉ループで回すエージェント型手法を提案し、物体検索や質問応答で精度を向上させた。
原題: Finder: Agentic Closed-Loop Object Finding for Embodied Grounding / Shixiong Xu, Zhiyuan Chen, Song Ding 他
日本語で読む → - 論文VLAロボティクス
AdaGeoVLN: 視覚言語ナビゲーションのための表現深度とナビゲーション時間にわたる選択的幾何情報
視覚言語ナビゲーションにおいて、幾何基盤モデルの階層的特徴をポリシーの各段階に融合し、指示関連性・幾何信頼度・遷移新規性に基づいて履歴KV状態を選択的に保持するストリーミングフレームワークを提案。
原題: AdaGeoVLN: Selective Geometry Across Representation Depth and Navigation Time for Vision-Language Navigation / Quan-Dung Pham, Anh Dao, Danh Vinh Le 他
日本語で読む → - 論文VLAロボティクス
VLA-ULAP: クラウドVLA呼び出しと超軽量ローカル行動予測をエッジで交互実行
クラウド上の大規模VLAモデルの呼び出しと、エッジ上の超軽量ローカル行動予測器(ULAP)を交互に実行することで、成功率をほぼ維持しながら推論時間と消費電力を大幅に削減する手法を提案。
原題: VLA-ULAP: Interleaving Cloud VLA Calls with Ultra-Lightweight Local Action Prediction at the Edge / Deyu Cao, Ryuji Oi, Kosuke Matsushima 他
日本語で読む → - 論文VLAロボティクス
GroundingVLN: 視覚言語ナビゲーションのためのグラウンディングに基づく推論と行動
視覚的グラウンディングを推論と行動の共通インターフェースとして用い、推論を画像位置に紐付け、画素ゴールを予測して動作に変換する視覚言語ナビゲーション手法を提案。R2R-CEで69.9%の成功率を達成。
原題: GroundingVLN: Reasoning and Acting with Grounding for Vision-Language Navigation / Kailing Li, Yu Han, Tianwen Qian 他
日本語で読む → - 論文VLAロボティクス
ForceDelta-VLA: 接触の多いマニピュレーションのための力条件付き行動補正の蒸留
力覚対応VLAポリシーを、参照行動と力補正に分解して蒸留するフレームワークを提案し、接触の多いタスクで成功率を54.4%から82.2%に向上させた。
原題: ForceDelta-VLA: Distilling Force-Conditioned ActionCorrections for Contact-Rich Manipulation / Ju Dong, Yu Fu, Jian Chen 他
日本語で読む → - 論文VLA画像認識
sensVLA: ホイールローダー自律制御のための空間接地型視覚-言語-行動モデル
LiDARから得た鳥瞰図特徴を専用のクロスアテンション経路で行動エキスパートに直接入力し、RGB画像による言語推論と分離することで、ホイールローダーの積載作業精度とカメラ故障時の耐性を向上させたVLAモデル。
原題: sensVLA: Spatially-Grounded Vision-Language-Action Model for Autonomous Wheel Loader / Gopi Krishna Erabati, Bjarne Johannsen, Angus Stewart 他
日本語で読む → - 論文VLAロボティクス
内在的ロボット報酬:VLA表現を再利用した自律評価と方策改善
VLAモデルの視覚表現と成功デモを再利用し、追加の評価器なしでロボット自身の成果を評価して方策改善に役立てる報酬機構IRRを提案。
原題: Intrinsic Robot Rewarding: Reusing VLA Representations for Autonomous Evaluation and Policy Improvement / Tobias Schaffer, Mohab Elkhayat, Daniela Nicklas 他
日本語で読む → - 論文VLAロボティクス
XPACE: 異種経験からの世界モデルと行動モデルの統合学習
人間とロボットの多様な経験を動画予測で結びつけ、行動予測と世界シミュレーションを同時に行う統合モデルを提案し、ヒューマノイドロボットで人間の技能をロボット未経験タスクへ転移できることを示した。
原題: XPACE: Joint World and Action Modeling from Heterogeneous Experience / Jiacheng Wei, Jerry Bai, Xiaoyu Yue 他
日本語で読む → - 論文VLAロボティクス
SAVLA: ロボットマニピュレーションのための対称性を考慮した視覚-言語-行動モデル
事前学習済みの視覚言語モデルを固定し、同変フローマッチング行動ヘッドと正規化器を組み合わせることで、データ効率が高く回転に頑健なロボット操作ポリシーを実現した。
原題: SAVLA: Symmetry-Aware Vision-Language-Action Models for Robotic Manipulation / Junle Li, Weixian Waylon Li, Fuxiang Wu 他
日本語で読む → - 論文VLAロボティクス
視覚運動ポリシーにおける視覚的身体依存性の再考
視覚運動ポリシーがロボットの見た目に依存しすぎる問題(VED)に対し、3D点群で身体を正規化する手法を提案し、人間からロボットへの転移性能を向上させた。
原題: Rethinking Visual Embodiment Dependence in Visuomotor Policies / Hongjie Fang, Yuxuan Lu, Chenxi Wang 他
日本語で読む → - 論文VLAAI
学習された視覚知覚と記号的信念空間プランニングの橋渡し
VLMによる述語のグラウンディングの不確かさを確率分布として扱い、信念空間でプランニングすることで不確実性下でも頑健な計画を生成する手法を提案した。
原題: Bridging Learned Visual Perception and Symbolic Belief-Space Planning / Guy Azran, Michael Navat, Sarah Keren
日本語で読む → - 論文VLAロボティクス
RAF-VLA: 未来表現との整合によるエンドツーエンド自動運転
将来フレームの表現を直接教師信号として方策の内部表現を整列させることで、未来生成を伴わずに自動運転VLAの計画性能を高める手法を提案。
原題: RAF-VLA: Representation Alignment with the Future for End-to-End Autonomous Driving / Dogun Kim, Yongjae Lee, Joonhee Lim 他
日本語で読む → - 論文VLAロボティクス
モダリティ自己回帰型ワールドアクションモデル
将来の観測と行動を複数の視覚モダリティ(点追跡・DINO特徴・深度)で自己回帰的に予測するModARを提案し、RGB予測より効率的で成功率も高いことを示した。
原題: Modality-Autoregressive World-Action Models / Adam Hung, Bardienus P. Duisterhof, Deva Ramanan 他
日本語で読む → - 論文VLA画像認識
SlotDiT: 物体中心表現を用いた拡散トランスフォーマー
シーンを物体ごとのスロットに分解し、その潜在空間でテキスト条件付き拡散トランスフォーマーを動作させることで、動画生成品質を保ちつつロボットタスクの成功率を向上させた研究。
原題: SlotDiT: Object-Centric Representations for Diffusion Transformers / Gjergj Plepi, Sven Behnke
日本語で読む → - 論文VLA画像認識
GeoLAM: ラベルなし人間動画から幾何学的潜在行動を学習
人間の動画から幾何学的な手がかりを活用して潜在行動を学習し、ロボット操作タスクに転移するフレームワークを提案。
原題: GeoLAM: Learning Geometry-Grounded Latent Actions from Unlabeled Human Videos / Yifan Xie, Hekun Tian, Jinkun Liu 他
日本語で読む → - 論文VLA画像認識
EgoPathBench:視覚言語モデルのゼロショット一人称視点ウェイポイント意思決定の評価
一人称視点の画像と目標から経路を選ぶ能力を測る5タスクのベンチマークを提案し、既存の視覚言語モデルが完全な経路計画を苦手とすることを示した。
原題: EgoPathBench: Evaluating Zero-Shot Egocentric Waypoint Decision-Making in Vision-Language Models / Yang Zhao, Zhuo Chen, Xubo Yang
日本語で読む → - 論文VLAロボティクス
FluxVLAエンジン:具現化知能のためのワンストップVLAエンジニアリングプラットフォーム
VLAモデルや世界行動モデル、オフライン強化学習を実ロボットに展開するための、データ形式・学習・評価・推論・ロボットインターフェースを統一するオープンな設定駆動型プラットフォームを提案。
原題: FluxVLA Engine: A One-Stop VLA Engineering Platform for Embodied Intelligence / Yinhao Li, Weixin Mao, Zihan Lan 他
日本語で読む → - 論文VLAロボティクス
TEMPO: 動的ロボットマニピュレーションのための時間的文脈学習
事前学習済みVLAモデルに動きの要約と固有受容感覚の履歴を追加し、動的マニピュレーションにおける運動の曖昧さと状態のエイリアシングを解決する手法を提案。
原題: TEMPO: Learning Temporal Context for Dynamic Robot Manipulation / Zhenyang Feng, Jimin Heo, Erik B. Sudderth 他
日本語で読む → - 論文VLA機械学習
ENCP: 視覚言語ナビゲーションのためのエピソード正規化共形予測
視覚言語ナビゲーション(VLN)において、エピソード単位で正規化した共形予測を提案し、可変長で依存関係のあるナビゲーション系列でも各ステップで信頼できる不確実性推定を可能にした。
原題: ENCP: Episode-Normalized Conformal Prediction for Vision-and-Language Navigation / Vicky Feliren, A. Taufiq Asyhari, Muhamad Risqi U. Saputra
日本語で読む → - 論文VLAロボティクス
密なVLAポリシーをMoE化して軽量化する適応手法
VLAポリシーのFFN層をMoEに変換し、ルータ統計に基づく動的なエキスパート無効化でLLMパラメータを40%削減しつつ性能を維持する手法を提案。
原題: Dense to MoE Adaptation for Compact Vision Language Action Policies / Muchun Niu, Shuang Chen, Yuzhou Wu 他
日本語で読む → - 論文VLAロボティクス
WholeBodyWAM:世界行動事前分布を全身制御に接地させたヒューマノイド移動操作
視覚予測と行動を同時に学習する世界行動モデルを、全身制御器の意味づけと協調に接地させることで、ヒューマノイドの移動を伴う操作へ汎化させる手法を提案した。
原題: WholeBodyWAM: Generalizing Pre-trained World-Action Priors to Humanoid Loco-Manipulation via WBC-Grounded Coordination / Zhuo Li, Yiming Yao, Jim Tan 他
日本語で読む → - 論文VLAロボティクス
WLA³: 意味・動力学・運動学のための世界潜在行動モデリング
世界状態の変化から潜在行動を学習し、意味・動力学・運動学を統合した汎用ポリシーモデルを構築するフレームワークを提案。
原題: WLA$^3$: World Latent Action Modeling for Semantics, Dynamics, and Kinematics / Peidong Liu, Zhiyuan Xiang, Mingyang Li 他
日本語で読む → - 論文VLAロボティクス
物理AIのためのゴール指向通信:設計とテストベッド
5G網とロボットアームを接続した実機テストベッドを構築し、生画像ではなく3D境界ボックスやシーングラフなどの意味表現を送る3種のゴール指向通信フレームワークを実装、タスク完了時間と成功率の改善を実証した。
原題: Goal-Oriented Communications for Physical AI: Design and Testbed / Shutong Chen, Wenkai Zhang, Adnan Aijaz 他
日本語で読む → - 論文VLA画像認識
PhysBrain 1.5:視覚言語モデルから物理基盤モデルへ
人間のインタラクション動画から身体動作を学習し、行動生成と未来状態予測を統合した8Bの物理基盤モデルを構築、28の身体理解ベンチマークでオープンソース最高性能を達成した。
原題: PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models / DeepCybo Team, Yu Bin, Haipeng Cao 他
日本語で読む → - 論文VLA画像認識
画像生成による推論
マルチモーダルLLMの推論に画像生成モデルを柔軟な視覚操作ツールとして組み込み、多視点空間推論や衝突予測など6タスクで最大25%の性能向上を達成した。
原題: Reasoning with Image Generation / Nishad Singhi, Hector Garcia Rodriguez, Aditya Arora 他
日本語で読む → - 論文VLAcs.CR
世界モデルが嘘をつくとき:下流制御に対するバックドア攻撃
事前学習済み世界モデルの再利用に潜むサプライチェーン型バックドアを提示し、汚染済みチェックポイントがクリーンな学習・評価下でも下流の制御器を乗っ取り、トリガー提示時のみ攻撃者の目標行動を再発見させることを示した。
原題: When the World Lies: Backdoor Attacks on Latent World Models for Downstream Control / Roberto Riaño, Gorka Abad, Stjepan Picek 他
日本語で読む → - 論文VLAロボティクス
UDAV: 不確実性駆動型適応VLMウェイポイントプランナー
VLMの確率的予測から不確実性を見積もり、必要に応じて再検討することで、UAV誘導UGVのオフロード経路計画の精度を向上させる手法を提案。
原題: UDAV: Uncertainty-Driven Adaptive VLM Waypoint Planner / Ghazal Farhani, Shabnam Shabani
日本語で読む → - 論文VLA画像認識
LG-VLN: LangGraph状態オーケストレーションによるゼロショット視覚言語ナビゲーション
単眼カメラのみで未知環境をナビゲートするゼロショットVLNフレームワークを提案し、LangGraphで状態遷移を管理することでR2R-CEで21.3%の成功率を達成した。
原題: LG-VLN: A Zero-Shot Vision-and-Language Navigation Framework with LangGraph State Orchestration / Jianhe Zhao, Yanhua Qiu, Zhiyu Zhang 他
日本語で読む →