論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/17 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
捕まえられるものなら捕まえてみろ:応答性の高いVLAのためのリアルタイムフィードバックデノイジング
拡散型VLAの最終デノイジング段を軽量なフィードバック界面として残し、最新の観測で各行動を実行直前に補正する二時間スケール構成を提案し、動的環境での成功率を大幅に改善した。
原題: Catch Me If You Can: Real-Time Feedback Denoising for Responsive VLAs / Yiheng Ji, Xingru Zhou, Luis Sentis 他
日本語で読む → - 論文VLAロボティクス
Navi-Agent: 位置推定不要の単眼ナビゲーションエージェント
座標や幾何学的な自己位置推定を使わず、視覚観測と移動履歴からナビゲーション用トポロジーを構築し、ゼロショットで長期的な視覚言語ナビゲーションを実現するエージェントを提案した。
原題: Navi-Agent: Unlocalized Monocular Navigation Agent / Wenyuan Xie, Mengyang Hong, Yongzhong Wang 他
日本語で読む → - 論文VLAロボティクス
HIL-UMI: ユニバーサルマニピュレーションインターフェースへのVLAモデルのヒューマン・イン・ザ・ループ事後学習の導入
ロボットを使わずにハンドヘルドUMIデモ中に方策を照会し、Energy Scoreで分布外状態を検出してデータ収集を促し、アドバンテージ推定器を更新してVLAモデルを事後学習する枠組みを提案。
原題: HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface / Zimu Han, Yiming Zeng, Jiyao Zhang 他
日本語で読む → - 論文VLAロボティクス
MoWAM: 効率的なワールドアクションモデルのための明示的な将来運動予測
将来の動画生成をロボット運動の予測に置き換えることで、推論時の計算コストを抑えつつ分布シフトへの頑健性を高めたワールドアクションモデルを提案。
原題: MoWAM: Explicit Future Motion Prediction for Efficient World Action Models / Jiayu Wang, Bin Zhu, Yue Yu 他
日本語で読む → - 論文VLAロボティクス
VLMベースの目標探索における空間・意味的不確かさ:探索と識別のバランス
VLMを用いた目標探索で、位置の空間的不確かさと目標同一性の意味的不確かさを分離して扱い、情報利得に基づく計画で探索と識別のトレードオフを最適化する手法を提案した。
原題: Spatial-Semantic Uncertainty in VLM-Based Target Search: Balancing Exploration and Identification / Alkesh K. Srivastava, Jonathan Diller, Vijay Kumar 他
日本語で読む → - 論文VLAロボティクス
EmbodiedMind: 効率的な身体性知能のための適応的データキュレーションとプレフィックス木強化学習
身体性基盤モデルの学習において、低情報サンプルの除去、タスク間のバランス調整、長期的計画におけるクレジット割り当て問題を解決するため、RSFT、IR-GRPO、Trie-GRPOを組み合わせた効率的な訓練パラダイムを提案。
原題: EmbodiedMind: Adaptive Data Curation and Prefix-Tree Reinforcement Learning for Efficient Embodied Intelligence / Feifan Wang, Zongbing Zhang, Yu Zhang 他
日本語で読む → - 論文VLAロボティクス
VA-Bench:視覚実演・能動的知覚・メートル制御による身体性空間知能の評価
RGB実演から手順を学び、カメラ視点を能動的に選び、メートル単位の動作指令を出してフィードバックで修正する「観察-推論-行動-修正」ループを評価するベンチマークVA-Benchを提案。最良モデルでもタスク成功率は約54%にとどまることを示した。
原題: VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control / Zhongbo Zhang, Jiayi Jin, Yifan Wang 他
日本語で読む → - 論文VLAロボティクス
サンプリングベースMPCによる視覚ポリシー学習の加速
サンプリングベースのモデル予測制御と一次勾配ポリシー最適化を組み合わせ、深度画像から歩行・操作ポリシーを効率的に学習し、実機ロボットへゼロショット転移する手法を提案。
原題: Accelerating Visual Policy Learning with Sampling-Based Model Predictive Control / Yilang Liu, Haoxiang You, Qian Wang 他
日本語で読む → - 論文VLAロボティクス
StageGuard: エージェント蒸留による長期的ロボットタスクの段階遷移学習
大規模VLMの推論を蒸留した軽量モデルで、長期ロボットタスクにおけるサブタスク完了判定とスキル切替を高精度かつ低遅延で行うフレームワークを提案。
原題: StageGuard: Learning Stage Transitions for Long-Horizon Robot Tasks via Agentic Distillation / Jinbang Huang, Yuanzhao Hu, Zhiyuan Li 他
日本語で読む → - 論文VLAAI
意図から行動へ:車両音声コマンド認可におけるLLM安全性のベンチマーク
車載音声アシスタントにおけるLLMの実行前認可判断を評価する202シナリオのベンチマークを提案し、7クラス分類での意思決定整合性と安全性エラーを測定した。
原題: From Intent to Action: Benchmarking LLM Safety in Vehicle Voice Command Authorization / Diba Afroze, Xingli Zhang, Yazhou Tu 他
日本語で読む → - 論文VLAロボティクス
TraceFlow: 成功・失敗トレースで凍結フローマッチング方策を導く
ロボットの成功・失敗ロールアウトの行動密度を進捗整合ガイダンス場に変換し、重みを更新せずに凍結フローマッチングVLA方策の行動生成を補正する手法。実機梱包タスクで成功率が21/50から39/50に向上。
原題: TraceFlow: Guiding Frozen Flow-Matching Robot Policies with Success and Failure Traces / Jiaxuan Zhang, Ruizhe Liu, Yu Zhang 他
日本語で読む → - 論文VLA機械学習
Uni-LaDiR:潜在拡散がマルチモーダル推論を統合する
異なるモダリティの推論過程を共有潜在空間のトークンに変換し、拡散モデルで次の思考ブロックを予測する統合推論フレームワークを提案。視覚言語タスクとロボット操作タスクで性能を向上させた。
原題: Uni-LaDiR: Latent Diffusion Unifies Multimodal Reasoning / Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang 他
日本語で読む → - 論文VLAロボティクス
M²Tok: 視覚言語行動モデルのためのマルチヘッド・マルチコードブック離散行動トークン化
連続的な行動信号を複数のヘッドと独立したコードブックで離散トークン化し、再構成誤差を抑えつつVLAモデルの性能を向上させる手法を提案。
原題: ${M}^2$Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models / Chunpu Xu, Zhixuan Liang, Yuhao Zhang 他
日本語で読む → - 論文VLAロボティクス
VLA-ULAP: クラウドVLA呼び出しと超軽量ローカル行動予測をエッジで交互実行
クラウド上の大規模VLAモデルの呼び出しと、エッジ上の超軽量ローカル行動予測器(ULAP)を交互に実行することで、成功率をほぼ維持しながら推論時間と消費電力を大幅に削減する手法を提案。
原題: VLA-ULAP: Interleaving Cloud VLA Calls with Ultra-Lightweight Local Action Prediction at the Edge / Deyu Cao, Ryuji Oi, Kosuke Matsushima 他
日本語で読む → - 論文VLAロボティクス
ForceDelta-VLA: 接触の多いマニピュレーションのための力条件付き行動補正の蒸留
力覚対応VLAポリシーを、参照行動と力補正に分解して蒸留するフレームワークを提案し、接触の多いタスクで成功率を54.4%から82.2%に向上させた。
原題: ForceDelta-VLA: Distilling Force-Conditioned ActionCorrections for Contact-Rich Manipulation / Ju Dong, Yu Fu, Jian Chen 他
日本語で読む → - 論文VLAロボティクス
VLM-MPPI: 自然言語を多様な飛行行動に接地する空中ナビゲーション
自然言語の指示を6つの行動条件付きMPPIプランナで生成した多様な軌道候補に結びつけ、VLMがFPV画像から候補を選ぶ階層型UAVナビゲーションを実機とシミュレーションで実証した。
原題: VLM-MPPI: Grounding Natural Language in Behaviorally Diverse Trajectories for Aerial Navigation / Hanbing Zhang, Fangguo Zhao, Zerui Li 他
日本語で読む → - 論文VLAロボティクス
rMuscle: 効率的な視覚-言語-行動モデル推論のためのロボット筋肉記憶
反復作業における実行間の類似性を利用した二段階キャッシュでVLAモデルの推論を高速化し、1.29〜1.42倍の速度向上を実現した。
原題: rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference / Kaijun Zhou, Zhiyang Li, Le Chen 他
日本語で読む → - 論文VLA画像認識
CSWAM: 世界行動モデルの分布外汎化のための因果意味表現の改善
V-JEPA 2.1をベースにした因果意味エキスパートをFastWAMに追加し、見たことのない環境や物体でもロボット行動を汎化させる手法を提案。
原題: CSWAM: Better Causal Semantic Representations for Out-of-Distribution Generalization in World Action Models / Tianbin Liu, Jian Zhu, Taiyi Su 他
日本語で読む → - 論文VLAロボティクス
ゲームプレイから方策へ:ゲーム化されたロボット不要のインタラクションによるスケーラブルなロボットデータ収集
VRゲームで人間の操作データを収集し、ロボットに転移する枠組みを提案。ゲームから実機へのギャップを埋めるGame2Policyにより、少数の実機デモで成功率が向上することを示した。
原題: From Gameplay to Policy: Towards Scalable Robot Data Collection via Gamified Robot-Free Interaction / Zheng Li, Liang Zhu, Junzhe Wang 他
日本語で読む → - 論文VLAロボティクス
ActiveScale:モデル・データ・ハードウェアを横断したロボットの能動的知覚のスケーリング
視点変更を伴う操作タスクのための能動的知覚フレームワークを提案し、カメラ姿勢を考慮したVLAモデル、1000時間の一人称視点データによる中間学習、単一操作者で遠隔操作可能な移動マニピュレーションプラットフォームを統合した。
原題: ActiveScale: Scaling Active Perception for Robots across Model, Data, and Hardware / Shuai Zhou, Kaisheng Pang, Wenxuan Song 他
日本語で読む → - 論文VLAロボティクス
すべての層を微調整する必要はない:視覚言語行動モデルにおける適応の診断と誘導
VLAモデルの領域ごとの適応コストを診断し、可変ランクLoRAを配分して効率的に微調整する手法を提案。
原題: Not All Layers Need Tuning: Diagnosing and Directing Adaptation in Vision-Language-Action Models / Shahram Najam Syed, Arthur Jakobsson, Prayuj Sachdev 他
日本語で読む → - 論文VLA画像認識
FIVE-VLA: 再帰的行動メモリによる高速で効果的な自動運転
高解像度画像をわずか98トークンに圧縮する効率的な視覚エンコーダと、過去の行動トークンを条件に用いる再帰的行動メモリ(RAM)を組み合わせ、641Mパラメータで従来のVLAより高速・高精度に軌道予測を行う自動運転モデル。
原題: FIVE-VLA: Fast and EffectIVE Autonomous Driving with Recurrent Action Memory / Kemal Oksuz, Alexandru Buburuzan, Yuhan Yao 他
日本語で読む → - 論文VLAロボティクス
AffordanceWAM: アフォーダンス認識型の世界行動統合モデリングによるロボットマニピュレーション
人間とロボットの動画から物体中心のアフォーダンスを予測し、将来の映像とロボット行動を統合的に生成するモデルを提案。人間動画を活用してロボット操作の汎化性能を向上させた。
原題: AffordanceWAM: Affordance-Aware Joint World-Action Modeling for Robot Manipulation / Jiadi You, Qize Yu, Yue Chen 他
日本語で読む → - 論文VLAロボティクス
AdaGeoVLN: 視覚言語ナビゲーションのための表現深度とナビゲーション時間にわたる選択的幾何情報
視覚言語ナビゲーションにおいて、幾何基盤モデルの階層的特徴をポリシーの各段階に融合し、指示関連性・幾何信頼度・遷移新規性に基づいて履歴KV状態を選択的に保持するストリーミングフレームワークを提案。
原題: AdaGeoVLN: Selective Geometry Across Representation Depth and Navigation Time for Vision-Language Navigation / Quan-Dung Pham, Anh Dao, Danh Vinh Le 他
日本語で読む → - 論文VLAロボティクス
GroundingVLN: 視覚言語ナビゲーションのためのグラウンディングに基づく推論と行動
視覚的グラウンディングを推論と行動の共通インターフェースとして用い、推論を画像位置に紐付け、画素ゴールを予測して動作に変換する視覚言語ナビゲーション手法を提案。R2R-CEで69.9%の成功率を達成。
原題: GroundingVLN: Reasoning and Acting with Grounding for Vision-Language Navigation / Kailing Li, Yu Han, Tianwen Qian 他
日本語で読む → - 論文VLAロボティクス
FASA: フィードバック認識型サンプリング適応による効率的な拡散ベースVLAモデル
拡散ベースVLAモデルの推論を、視覚とグリッパ力のフィードバックを制御信号として使う学習不要のランタイム適応で高速化する手法を提案。
原題: FASA: Feedback-Aware Sampling Adaptation for Efficient Diffusion-Based VLA Models / Yuchen Han, Jianhan Wu, Xiaoyang Qu 他
日本語で読む → - 論文VLAロボティクス
TAO-Force: 接触の多いマニピュレーションのための力認識知覚と高速・低速制御の統合
力フィードバックを視覚言語モデルに注入し、接触時のみ高速なアドミタンス制御に切り替える枠組みを提案し、接触の多い操作タスクでの有効性を示した。
原題: TAO-Force: Unifying Force-Aware Perception and Fast-Slow Control for Contact-Rich Manipulation / Bohan Gan, Xuanzhang Wen, Yongsheng Zhao 他
日本語で読む → - 論文VLAロボティクス
UAVと身体性知能の融合:物理デジタルAIエージェントによる人間意図と飛行力学の橋渡し
UAVの身体性知能(UAV EI)を5つの能力次元と5つのアーキテクチャ層からなる枠組みで整理し、基盤モデルや世界モデル、AIエージェントによる最近の進展を体系的にレビューしたサーベイ論文。
原題: UAVs Meet Embodied Intelligence: Bridging Human Intents and Flying Dynamics Via Harnessing Physical-Digital AI Agents / Yonglin Tian, Weiyi Wang, Houhua Lu 他
日本語で読む → - 論文VLAロボティクス
生成的物理人工知能の包括的レビュー
大規模基盤モデルと物理的身体を統合した生成的物理AI(GPAI)について、5つのアプローチの分類と応用・課題を体系的に整理したサーベイ論文。
原題: A Comprehensive Review of Generative Physical Artificial Intelligence / Satyam Gaba, Krutiksinh Rana, Siva Sai 他
日本語で読む → - 論文VLA画像認識
VLMエージェントによる文脈内ロボット学習
商用VLMを活用し、デモやフィードバックから勾配更新なしでロボット行動を生成するGPT-Policyを提案。実機実験で人間のビデオデモがタスク完了率を向上させることを示した。
原題: In-Context Robot Learning with VLM Agents / Dongzhou Cheng, Taoran Yi, Ye Fang 他
日本語で読む →