論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/14 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA画像認識
LG-VLN: LangGraph状態オーケストレーションによるゼロショット視覚言語ナビゲーション
単眼カメラのみで未知環境をナビゲートするゼロショットVLNフレームワークを提案し、LangGraphで状態遷移を管理することでR2R-CEで21.3%の成功率を達成した。
原題: LG-VLN: A Zero-Shot Vision-and-Language Navigation Framework with LangGraph State Orchestration / Jianhe Zhao, Yanhua Qiu, Zhiyu Zhang 他
日本語で読む → - 論文VLAロボティクス
DIDO: インタラクション中心のダイナミクスを1ステップ拡散に蒸留するワールドアクションモデル
動画生成ベースのロボット操作モデルを1ステップ拡散に蒸留し、把持器と対象物のインタラクションを保ちつつ推論遅延を削減した手法。
原題: DIDO: Distilling Interaction-Centric Dynamics into One-Step Denoising for World Action Models / Jing Lyu, Shuanghao Bai, Runze Xiao 他
日本語で読む → - 論文VLAロボティクス
P-POSEMEM: ポーズグラフ再構築下で一貫した言語接地を実現する射影的意味記憶
SLAMのポーズグラフが最適化・ループ閉じ込め・圧縮されても、言語指示が同じ物体を指し続けるよう、観測を誕生キーフレームの不変イベントとして保持しベイズ木の消去条件付きを統合する意味記憶手法を提案。
原題: P-POSEMEM: Projective Semantic Memory for Consistent Language Grounding under Pose-Graph Rewrites / Ha Sier, Ali Salmasi, Mengya Xu 他
日本語で読む → - 論文VLAロボティクス
UDAV: 不確実性駆動型適応VLMウェイポイントプランナー
VLMの確率的予測から不確実性を見積もり、必要に応じて再検討することで、UAV誘導UGVのオフロード経路計画の精度を向上させる手法を提案。
原題: UDAV: Uncertainty-Driven Adaptive VLM Waypoint Planner / Ghazal Farhani, Shabnam Shabani
日本語で読む → - 論文VLAロボティクス
バックボーン内計画:運転VLMによるネイティブ連続軌道生成のためのDiffAdapterVLA
運転用VLMの後段層に軌道トークンを注入し、軽量なDiffAdapterで再帰的に軌道を洗練させることで、追加のプランナーなしに連続軌道計画を実現した手法。
原題: Planning in the Backbone: DiffAdapterVLA for Native Continuous Trajectory Generation with Driving VLMs / Changxin Lu, Xiaoliang Meng, Yu Wu 他
日本語で読む → - 論文VLAロボティクス
物理AIのためのゴール指向通信:設計とテストベッド
5G網とロボットアームを接続した実機テストベッドを構築し、生画像ではなく3D境界ボックスやシーングラフなどの意味表現を送る3種のゴール指向通信フレームワークを実装、タスク完了時間と成功率の改善を実証した。
原題: Goal-Oriented Communications for Physical AI: Design and Testbed / Shutong Chen, Wenkai Zhang, Adnan Aijaz 他
日本語で読む → - 論文VLAロボティクス
言語で操作可能かつ力に応答するマニピュレーションのための原子運動座標
言語指示と順運動学から13種の運動原子を定義し、視覚に依存せずVLA方策の動作を言語で操舵可能にするとともに、接触履歴に応じて力を適応させる手法を提案した。
原題: Atomic Motion Coordinate for Language-Steerable and Force-Responsive Manipulation / Jiaqi Zhai, Jingkai Zhao, Chen Yang 他
日本語で読む → - 論文VLAロボティクス
WLA³: 意味・動力学・運動学のための世界潜在行動モデリング
世界状態の変化から潜在行動を学習し、意味・動力学・運動学を統合した汎用ポリシーモデルを構築するフレームワークを提案。
原題: WLA$^3$: World Latent Action Modeling for Semantics, Dynamics, and Kinematics / Peidong Liu, Zhiyuan Xiang, Mingyang Li 他
日本語で読む → - 論文VLA画像認識
画像生成による推論
マルチモーダルLLMの推論に画像生成モデルを柔軟な視覚操作ツールとして組み込み、多視点空間推論や衝突予測など6タスクで最大25%の性能向上を達成した。
原題: Reasoning with Image Generation / Nishad Singhi, Hector Garcia Rodriguez, Aditya Arora 他
日本語で読む → - 論文VLAロボティクス
辞書式選好による生成ロボット方策の誘導
凍結した拡散・フローマッチング方策を推論時に誘導し、優先順位付きの制約と選好を守らせる手法を提案。ナビゲーションとLIBERO操作で成功率を維持しつつ遵守率を改善。
原題: Steering Generative Robot Policies with Lexicographic Preferences / Yixuan Jia, Jonathan P. How
日本語で読む → - 論文VLAロボティクス
法的推論による世界モデルベース計画の法制化
欠陥義務論理と学習済み世界モデルを組み合わせ、ロボットの行動前に法的制約を課す計画スタックを提案し、グリッド上のロボットアーム実験で遵守率の向上と実行時効率を確認した。
原題: Legislating World-Model-Based Planning with Legal Reasoning / Dylan Waldner, Yiannis Kantaros, Guido Governatori 他
日本語で読む → - 論文VLA画像認識
PuzzleMate: 一人称視点のパズル支援に向けたMLLMベンチマーク
ジグソーパズルを題材に、MLLMが一人称視点で現在のパズル状態を認識し次の手順を指示できるかを評価するベンチマークを提案し、既存モデルの限界を明らかにした。
原題: PuzzleMate: Benchmarking MLLMs for Egocentric Puzzle Assistance / Avijit Dasgupta, Shayon Dasgupta, Zakaria Laskar 他
日本語で読む → - 論文VLA画像認識
Open-UniMo: オープンワールドにおける動作と言語の統合的理解と生成に向けて
動作と言語を同一のトークン空間で扱う大規模動作言語モデルを提案し、CoT推論と強化学習で双方向の生成・理解精度を高めた。
原題: Open-UniMo: Towards Unified Motion-Language Understanding and Generation in the Open World / Guocun Wang, Kenkun Liu, Guorui Song 他
日本語で読む → - 論文VLAロボティクス
ロボット学習と制御のための世界行動モデル:サーベイ
未来の世界予測と実行可能な行動生成を統合したWorld-Action Models(WAMs)について、ロボティクス視点で分類・応用・評価・課題を整理したサーベイ。
原題: World-Action Models for Robot Learning and Control: A Survey / Zuxing Lu, Hongjia Zhai, Guanzhi Wang 他
日本語で読む → - 論文VLA/計測検査ロボティクス
タスク指定型アクティブ計測検査:計測誘導VLAマニピュレーションと決定論的証拠ゲーティング
多品種少量生産向けに、検査指示と仕様から検証可能な適合証拠を生成する階層型双腕フレームワークFRAMEを提案し、学習マニピュレーションと校正済みレーザープロフィロメトリを組み合わせて信頼性向上と誤合格削減を実現した。
原題: Task-Specified Active Metrological Inspection with Measurement-Steered VLA Manipulation and Deterministic Evidence Gating / Zhiling Chen, Jingzhan Ge, Ruimin Chen 他
日本語で読む → - 論文VLAロボティクス
VLA展開の高速化が閉ループ挙動を変える:PyTorchとONNX変種におけるSmolVLAのタスク成功率-遅延分析
SmolVLAをPyTorchとONNXで展開し、遅延とタスク成功率を比較。ONNXは高速だが空間タスク成功率が低下し、言語コンテキスト幅が影響することを示した。
原題: When Faster VLA Deployment Changes Closed-Loop Behavior: Task Success-Latency Analysis of SmolVLA Across PyTorch and ONNX Variants / Rafiqul Islam
日本語で読む → - 論文VLAロボティクス
VLAモデルをより良く訓練する方法:ICRA 2026 REAL-Iチャレンジからの教訓
ICRA 2026の実世界 embodied AI 学習チャレンジREAL-Iの結果を報告し、NUS-CLEAR、RCL-Lab、Deeptouch.aiの3チームのVLAと模倣学習を組み合わせたアプローチを比較して、固定データからのロボット学習の教訓をまとめた論文。
原題: How to Better Train VLAs: Lessons Learned From the REAL-I Challenge at ICRA 2026 / Jiaming Wang, Jizhuo Chen, Diwen Liu 他
日本語で読む → - 論文VLAロボティクス
ReWeight: 実演検索とサンプル重み付けによる人間データを活用したVLAポストトレーニング
一人称視点の人間実演をロボット実演と行動類似度で照合し、重み付けしてVLAモデルの追加学習に活用することで、実機タスクの成功率を大幅に向上させた研究。
原題: ReWeight: Leveraging Human Data for VLA Post-Training via Demonstration Retrieval and Sample Weighting / Chenwei Wang, Dianye Huang, Match W. L. Ko 他
日本語で読む → - 論文VLAロボティクス
GeomVLA: 3D空間でシーン・運動・行動を統合するVLAモデル
深度とカメラキャリブレーションでVLM特徴を3Dシーントークンに持ち上げ、シーン点の将来運動を潜在表現として予測し、それを条件に3Dフロー型行動生成を行うVLAモデルを提案。CALVINなどで高性能を示した。
原題: GeomVLA: Unifying Scene, Motion, and Action in 3D / Ziyin Xiong, Nikos Gkanatsios, Moritz Reuss 他
日本語で読む → - 論文VLAロボティクス
GROOVE: 幾何学誘導によるVLA実行時の操作空間ジャーク低減
VLAポリシーのチャンク実行時に生じるジャークを、再学習なしでオンライン補正する手法を提案。LIBEROベンチマークとUR5eで動作の滑らかさとタスク成功率を改善。
原題: GROOVE: Geometry-Guided Reduction of Operational-Space Jerk in VLA Execution / Sangho Yun, Minsoo Kim, Minwoo Cho 他
日本語で読む → - 論文VLAロボティクス
学習済み事前分布は視覚慣性推定にいつ役立つか?事前分布統合・キャリブレーション・初期化・バックエンド整合性の制御実験
学習済み運動事前分布を視覚慣性推定に組み込む際、性能向上が事前分布の有用性によるものか、バックエンドやキャリブレーションの変更によるものかを切り分ける制御フレームワークを提案し、KITTIで評価した。
原題: When Do Learned Priors Help Visual Inertial Estimation? A Controlled Study of Prior Integration, Calibration, Initialization, and Backend Consistency / Jinchang Zhang, Guoyu Lu
日本語で読む → - 論文VLAロボティクス
効率的なVLAを決めるもの:アクションヘッド設計・スケーリング・レイテンシの探求
VLAモデルにおいて、アクションヘッドの性能はデコーダ構造よりも言語バックボーンの最終層を初期化に使うことが最大の要因であり、アラインメント後はスケーリングが有効になることを実験的に示した研究。
原題: What Makes an Efficient VLA? Navigating Action-Head Design, Scaling, and Latency / Luoyang Sun, Guoyang Xia, Fengfa Li 他
日本語で読む → - 論文VLAロボティクス
視覚から収穫へ:マルチアームロボット果実収穫のための視覚言語モデルベンチマーク
実世界の果樹園画像を用いて、事前学習済み視覚言語モデルがゼロショットでマルチアーム収穫計画を生成できるかを評価する初のベンチマークを提案し、従来手法と比較した。
原題: From Vision to Harvest: Benchmarking Vision-Language Models for Multi-Arm Robotic Fruit Harvesting / Vrishan Inukollu, Adyan Zaman, Anvi Kudaraya 他
日本語で読む → - 論文VLAロボティクス
DATAFARM: 事前学習分布に整合させたタスク・動作計画によるVLAモデルのファインチューニング
TAMPが生成する軌道をVLAの事前学習データの分布(関節配置・動作スタイル・時間的プロファイル)に合わせることで、生のTAMP軌道ではほぼ効果がなかったファインチューニングを大幅に改善した手法。
原題: DATAFARM: Distribution-Aligned Task and Motion Planning for Fine-Tuning Vision-Language-Action Models / Samrat Sahoo, Yixuan Huang, Tom Silver
日本語で読む → - 論文VLAロボティクス
思考と行動の橋渡し:MetaTool拡張ROSフレームワークによるオープンソースLLMエージェントの長期的不安定さの克服
オープンソースLLMを使ったロボットエージェントに、行動前に疑似コード計画を生成させるMetaToolを導入し、長期的なタスクの安定性と実行効率を改善した研究。
原題: Bridging Thought and Action: Taming Long-Horizon Instability in Open-Source LLM Agents with a MetaTool-Enhanced ROS Framework / Kazi Abrar Mahmud, Nilotpaul Kundu Dhurubo, Tamal Kirttonia 他
日本語で読む → - 論文VLAロボティクス
Dynin-Robotics: オムニモーダル統合拡散視覚言語行動モデル
言語・視覚・目標・行動を離散トークンで統合したマスク拡散モデルにより、行動予測と未来状態予測を同時に学習し、テスト時スケーリングでロボット政策の性能を向上させる。
原題: Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model / Hoeun Lee, Jaeik Kim, Jusang Oh 他
日本語で読む → - 論文VLAロボティクス
視覚と行動のショートカットを断ち切る:汎化可能なロボット基盤モデルのための潜在インターフェース訓練
視覚入力と行動の相関を過学習する「視覚-行動ショートカット」を防ぐため、画像なしで目標指向の行動を学習させた後、姿勢監督付きの潜在インターフェースで視覚条件付けを制約する2段階訓練法を提案。
原題: Breaking the Vision-Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models / Jianman Lin, Shailesh Shailesh, Zhongyi Luo 他
日本語で読む → - 論文VLAロボティクス
STAGE: 身体性エージェントにおける接地実行時の意味転送を診断する
指示の意味が復元できても行動に反映されない「意味-行動ギャップ」を測定するベンチマークSAT-Benchを提案し、実行時インターフェースVISAで無効指示の盲実行を大幅に削減する。
原題: STAGE: Diagnosing Semantic Transfer at Grounded Execution in Embodied Agents / Baosheng Jin, Yushen Liang, Hua Shen
日本語で読む → - 論文VLAロボティクス
ノイズ操作を超えて:生成ロボットポリシーのためのデュアル潜在空間強化学習
生成ロボットポリシーの強化学習において、初期ノイズだけでなく中間行動表現も制御する二重潜在空間フレームワークを提案し、オンライン適応を高速化した。
原題: Beyond Noise Steering: Dual-Latent Space Reinforcement Learning for Generative Robot Policy / Pengfei Zhang, Teng Sun, Xianchao Xiu
日本語で読む → - 論文VLAcs.DC
ロボット工場向けの効率的なVision-Language-Action管理・提供システム
複数ロボット・複数モデルのVLA推論をマルチGPUエッジサーバでSLOを満たしながら提供する初の管理・提供システムRobionを提案。
原題: Efficient Vision-Language-Action Management and Serving for Robot Factories / Dionysios Adamopoulos, Nattapol Chanpaisit, Basel Fakhri 他
日本語で読む →