論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
KineVLA: 運動学を考慮した視覚言語行動モデルと二段階行動分解
言語指示に運動学的属性(方向、軌道、姿勢、相対変位など)を細かく組み込んだ新しいVLAタスクを提案し、目標の不変性と運動学的可変性を分離する二段階行動表現と推論トークンを持つKineVLAフレームワークを導入した。シミュレーションと実機で精度・制御性・汎化性が向上することを示した。
原題: KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition / Gaoge Han, Zhengqing Gao, Ziwen Li 他
日本語で読む → - 論文VLAロボティクス
MEM: 視覚言語行動モデルのためのマルチスケール具現化メモリ
ロボットの長期タスク遂行のために、ビデオベースの短期記憶とテキストベースの長期記憶を組み合わせたマルチスケールメモリアーキテクチャを提案し、15分に及ぶ複雑なタスクを可能にした。
原題: MEM: Multi-Scale Embodied Memory for Vision Language Action Models / Marcel Torne, Karl Pertsch, Homer Walke 他
日本語で読む → - 論文VLA/行動生成/推論高速化ロボティクス
ProbeFlow: 学習不要の適応型フローマッチングによる視覚言語行動モデルの高速化
VLAモデルの行動生成に用いるフローマッチングの推論遅延を、軌道の複雑さに応じて積分ステップ数を動的に調整する学習不要のフレームワークで削減し、実機でも安定した高速動作を実現した。
原題: ProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action Models / Zhou Fang, Jiaqi Wang, Yi Zhou 他
日本語で読む → - 論文VLA/自動運転ロボティクス
ETA-VLA: 時間融合とLLM内スパース化による視覚言語行動モデルの効率的トークン適応
自動運転向けVLAモデルの計算負荷を減らすため、過去フレームの冗長な視覚トークンをテキストガイドと時間的一貫性で間引くフレームワークを提案し、精度を保ちつつ推論FLOPsを大幅削減した。
原題: ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models / Yiru Wang, Anqing Jiang, Shuo Wang 他
日本語で読む → - 論文VLA/強化学習ロボティクス
SmoothVLA: 内在的滑らかさ最適化による物理的制約へのVLAモデル整合
ロボット操作のためのVLAモデルに対し、軌道の滑らかさを内在報酬として組み込んだ強化学習フレームワークを提案し、タスク性能と物理的実現性を両立させた。
原題: SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization / Jiashun Li, Xiaoyu Shi, Hong Xie 他
日本語で読む → - 論文VLA/ナビゲーション/マニピュレーションロボティクス
DiffusionAnything: 統一ナビゲーションと把持前動作のためのエンドツーエンド・インコンテキスト拡散学習
RGB画像のみから、メートル規模のナビゲーションとセンチメートル規模のマニピュレーションを単一モデルで計画する拡散ポリシーを提案。タスクごとに5分の自己教師ありデータで学習し、未知シーンへのゼロショット汎化を実現する。
原題: DiffusionAnything: End-to-End In-context Diffusion Learning for Unified Navigation and Pre-Grasp Motion / Iana Zhura, Yara Mahmoud, Jeffrin Sam 他
日本語で読む → - 論文VLA画像認識
アクション草案と検証:視覚言語行動モデルのための自己検証フレームワーク
拡散アクション専門家が複数のアクション候補を生成し、VLMが一回のフォワードパスでスコアリングして最適なものを選択する自己検証フレームワークを提案。シミュレーションと実世界で成功率を向上させた。
原題: Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model / Chen Zhao, Zhuoran Wang, Haoyang Li 他
日本語で読む → - 論文VLAロボティクス
AR-VLA: 視覚言語行動モデルのための真の自己回帰型アクションエキスパート
観測ごとに時間的文脈をリセットする従来のVLAや拡散ポリシーと異なり、長期記憶で履歴を保持し連続的な因果系列として行動を生成する自己回帰型アクションエキスパートを提案。再アンカリング機構で非同期な視覚・言語・行動を同期させ、滑らかで文脈認識型の行動生成を実現した。
原題: AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models / Yutong Hu, Jan-Nico Zaech, Nikolay Nikolov 他
日本語で読む → - 論文VLA/ロバスト性/メモリロボティクス
RoboHarness:メモリ拡張型ポリシーハーネスによる視覚言語行動モデルの文脈内適応ロバスト性向上
凍結したVLAモデルを微調整なしでロバスト化するため、デュアルメモリRAGとマルチモーダルLLMによる帰属駆動オーケストレータ、MCP介入を備えたオンラインパイプラインと、オフラインのメモリ統合を提案し、平均成功率を56.6%向上させた。
原題: RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation / Zhuoran Li, Zhiyang Li, Kaijun Zhou 他
日本語で読む → - 論文ヒューマノイド制御/VLAロボティクス
PhysiFlow: 物理認識型ヒューマノイド全身VLA - マルチブレイン潜在フローマッチングとロバスト追従による実現
ヒューマノイドの全身制御に視覚言語行動(VLA)を統合し、物理認識型のマルチブレインVLAフレームワークを提案。動的で四肢協調を要するタスクでの安定性を向上させた。
原題: PhysiFlow: Physics-Aware Humanoid Whole-Body VLA via Multi-Brain Latent Flow Matching and Robust Tracking / Weikai Qin, Sichen Wu, Ci Chen 他
日本語で読む → - 論文VLAロボティクス
DecoVLN: 観察・推論・修正を分離した視覚言語ナビゲーション
長期的な指示に従う視覚言語ナビゲーションの性能を高めるため、記憶構築の最適化と誤差補正のための微調整戦略を導入したフレームワークを提案した。
原題: DecoVLN: Decoupling Observation, Reasoning, and Correction for Vision-and-Language Navigation / Zihao Xin, Wentong Li, Yixuan Jiang 他
日本語で読む → - 論文VLA/エッジ推論/姿勢補正ロボティクス
Agile-VLA: 暗黙的アフォーダンスアンカリングによる少数ショット産業用姿勢補正
エッジデバイス上でVLAモデルを動かす際の高遅延と高周波制御の矛盾を解決するため、幾何学的視覚手がかりをパラメトリック動作プリミティブに直接マッピングする階層的フレームワークを提案し、5ショットのデモで複雑なワークの姿勢補正を実現した。
原題: Agile-VLA: Few-Shot Industrial Pose Rectification via Implicit Affordance Anchoring / Teng Yan, Zhengyang Pei, Chengyu Shi 他
日本語で読む → - 論文VLA画像認識
DualCoT-VLA: 視覚と言語の連鎖的推論を並列化した視覚言語行動モデル
複雑なタスクで苦戦するVLAモデルに対し、視覚的CoTと言語的CoTを並列に統合し、推論遅延を減らして高性能を実現した。
原題: DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models / Zhide Zhong, Junfeng Li, Junjie He 他
日本語で読む → - 論文VLAロボティクス
ROI駆動フォビエーション注意による視覚-言語-行動システムの統一エゴセントリック表現
エンドエフェクタの姿勢を前方運動学で外部カメラに投影し、手中心の関心領域(ROI)を切り出すことで、手首カメラなしに高解像度の局所情報と全体文脈を両立するデータ表現を提案した。
原題: ROI-Driven Foveated Attention for Unified Egocentric Representations in Vision-Language-Action Systems / Xinhai Sun, Xiang Shi, Menglin Zou 他
日本語で読む → - 論文VLAロボティクス
FocusVLA: 視覚言語行動モデルにおける視覚情報の焦点化
VLAモデルの性能が視覚表現の質ではなく視覚情報の活用方法に制限されることを示し、注意をタスク関連領域に集中させるFocusVLAを提案した。
原題: FocusVLA: Focused Visual Utilization for Vision-Language-Action Models / Yichi Zhang, Weihao Yuan, Yizhuo Zhang 他
日本語で読む → - 論文VLA/計画AI
3Dマスクへの視覚・言語の接地による長期的ボックス再配置
RGB-D観測と自然言語指示から、3Dセグメンテーションマスクを逐次的に予測して長期的なピックアンドプレース動作を生成するRAMP-3Dを提案し、倉庫環境でのボックス再配置タスクで高い成功率を達成した。
原題: Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement / Ashish Malik, Caleb Lowe, Aayam Shrestha 他
日本語で読む → - 論文VLA/器用操作ロボティクス
視覚言語行動モデルのためのクロスハンド潜在表現
多様な器用なロボットハンド間で共有可能な統一潜在行動空間を導入し、標準的なVLAアーキテクチャに組み込むことで、クロスエンボディメント学習を可能にするXL-VLAを提案した。
原題: Cross-Hand Latent Representation for Vision-Language-Action Models / Guangqi Jiang, Yutong Liang, Jianglong Ye 他
日本語で読む → - 論文VLA/収穫ロボットロボティクス
HarvestFlex: 実環境での視覚言語行動ポリシー適応によるイチゴ収穫
実温室のイチゴ収穫にVLAポリシーを適用し、VR遠隔操作データで微調整して高い成功率を達成した。
原題: HarvestFlex: Strawberry Harvesting via Vision-Language-Action Policy Adaptation in the Wild / Ziyang Zhao, Shuheng Wang, Zhonghua Miao 他
日本語で読む → - 論文VLAロボティクス
VAMPO: ビデオ行動モデルの視覚ダイナミクスを改善するポリシー最適化
ビデオ行動モデルのノイズ除去を逐次決定過程とみなし、専門家の視覚ダイナミクスに基づく報酬でポリシー最適化を行うことで、操作に重要な視覚ダイナミクスを直接改善するフレームワークを提案。
原題: VAMPO: Policy Optimization for Improving Visual Dynamics in Video Action Models / Zirui Ge, Pengxiang Ding, Baohua Yin 他
日本語で読む → - 論文VLAロボティクス
StreamingVLA: アクションフローマッチングと適応的早期観察によるストリーミング型視覚言語行動モデル
VLAモデルの推論遅延を、アクション生成と実行、観察を非同期に並列化するストリーミング方式で削減し、実行の流暢性を向上させた。
原題: StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation / Yiran Shi, Dongqi Guo, Tianchen Zhao 他
日本語で読む → - 論文自動運転/VLAロボティクス
Uni-World VLA: 自動運転のための世界モデリングと計画の交互実行
自動運転向けに、将来フレーム予測と軌道計画を交互に行う統合VLAモデルを提案し、閉ループな意思決定を実現した。
原題: Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving / Qiqi Liu, Huan Xu, Jingyu Li 他
日本語で読む → - 論文VLA/強化学習/蒸留ロボティクス
VLA-OPD: オフラインSFTとオンラインRLを架橋する、オンポリシー蒸留による視覚言語行動モデル
視覚言語行動モデルの事後学習において、オフラインSFTの分布ずれや破滅的忘却と、オンラインRLのスパース報酬や非効率性を解決するため、専門家教師による密なトークンレベル監督を学生の自己生成軌道に適用し、Reverse-KL目的で安定した学習を実現するフレームワークを提案した。
原題: VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation / Zhide Zhong, Haodong Yan, Junfeng Li 他
日本語で読む → - 論文VLA/操作ロボティクス
ForceVLA2: 力認識によるハイブリッド力-位置制御で接触を伴う操作を実現
接触を伴う操作のための視覚言語行動モデルに、力認識とハイブリッド力-位置制御を導入し、成功率を大幅に向上させた。
原題: ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulation / Yang Li, Zhaxizhuoma, Hongru Jiang 他
日本語で読む → - 論文VLA/操作ロボティクス
AnchorVLA4D: ロボット操作のためのアンカーベース時空間視覚言語行動モデル
視覚アンカーを用いて、操作中の空間認識と時間的文脈を強化する新しいVLAモデルを提案。初期シーンのアンカー画像と軽量な空間エンコーダを追加し、追加センサなしで性能を向上させた。
原題: AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation / Juan Zhu, Zhanying Shao, Xiaoqi Li 他
日本語で読む → - 論文VLAロボティクス
ロボット操作における視覚言語モデルのための混乱認識型インコンテキスト学習
視覚言語モデルがロボット操作で混乱しやすい物体を誤認識する問題を、混乱要因を特定してプロンプトに反映する手法CAICLを提案し、VIMA-Benchで85.5%の成功率を達成した。
原題: Confusion-Aware In-Context-Learning for Vision-Language Models in Robotic Manipulation / Yayun He, Zuheng Kang, Botao Zhao 他
日本語で読む → - 論文自動運転/VLAロボティクス
失敗から学ぶ:テイクオーバーデータを用いた運転VLAのポストトレーニング
自動運転のVLAモデルに対し、テイクオーバー(人間介入)データを活用した新しいポストトレーニング手法TakeVLAを提案。介入前の言語指示とシナリオ再構築による強化学習で安全マージンを拡大し、ベンチマークで最高性能を達成した。
原題: Learning from Mistakes: Post-Training for Driving VLA with Takeover Data / Yinfeng Gao, Deqing Liu, Qichao Zhang 他
日本語で読む → - 論文自動運転/VLAロボティクス
AutoDrive-P^3: 強化学習による認識・予測・計画の統合チェーン思考
自動運転向けVLMに、認識・予測・計画を段階的に推論するチェーン思考と階層的強化学習を導入し、安全性と解釈性を向上させるフレームワークを提案した。
原題: $AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning / Yuqi Ye, Zijian Zhang, Junhong Lin 他
日本語で読む → - 論文VLA/自動運転/強化学習画像認識
狭い方策に潜む悪魔:運転VLAモデルの探索を解き放つ
自動運転の模倣学習が探索を狭め、強化学習の性能を制限する問題を特定し、軌道拡張と多様性重視の報酬設計で解決するCurious-VLAを提案した。
原題: Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models / Canyu Chen, Yuguang Yang, Zhewen Tan 他
日本語で読む → - 論文VLA画像認識
AutoMoT: 非同期Mixture-of-Transformersによる統合型Vision-Language-Actionモデルを用いたエンドツーエンド自動運転
推論と行動生成を単一のVLAモデルに統合し、Mixture-of-Transformersと非同期実行で高速・高精度な自動運転を実現した研究。
原題: AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving / Wenhui Huang, Songyan Zhang, Qihang Huang 他
日本語で読む → - 論文VLA/長期操作ロボティクス
TempoFit: 長期的視覚言語行動操作のためのプラグアンドプレイ層別時間KVメモリ
事前学習済みの視覚言語行動(VLA)ポリシーに、追加学習なしで時間的記憶を注入するTempoFitを提案。層ごとのKVキャッシュと再帰バイアスにより、長期的な操作タスクの成功率を向上させる。
原題: TempoFit: Plug-and-Play Layer-Wise Temporal KV Memory for Long-Horizon Vision-Language-Action Manipulation / Jun Sun, Boyu Yang, Jiahao Zhang 他
日本語で読む →