論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文自動運転/VLAロボティクス
AnchorVLA: 離散的な意思決定と連続的な軌道を橋渡しする視覚言語行動計画
自動運転の計画において、高レベルの意思決定を表すアンカートークンと、その残差空間での連続軌道生成を組み合わせたVLA計画フレームワークを提案した。
原題: AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning / Qi Liu, Yabei Li, Hongsong Wang 他
日本語で読む → - 論文VLA/世界モデルロボティクス
DREAMSTEER: 潜在世界モデルによるVLAポリシーの展開時誘導(微調整不要)
事前学習済みの視覚言語行動(VLA)ポリシーを、微調整なしで展開時に潜在世界モデルと価値モデルを用いて誘導し、分布シフト下での成功率と指示追従精度を大幅に向上させるフレームワークを提案した。
原題: DREAMSTEER: Latent World Models Can Steer VLA Policies During Deployment Without Any Finetuning / Hanchen Cui, Sergio Arnaud, Arjun Majumdar 他
日本語で読む → - 論文VLA/データ拡張ロボティクス
VLAモデルのための行動合成訓練による行動範囲の拡大
既存のデモデータから新しい物理的に有効なデモを自動合成し、VLAモデルの過学習を防いで行動の汎化を向上させるオフライン拡張手法を提案した。
原題: Unleashing More Actions via Action Compositional Training for VLA Models / Kai Peng, Jie Lu, Xiaojiang Peng
日本語で読む → - 論文VLAロボティクス
視覚運動ポリシー学習のための順序付きアクショントークン
ロボットの連続的なアクションを離散トークンに変換する際、高圧縮・完全復号可能・順序性を満たす新しいトークナイザーOATを提案し、複数のベンチマークで有効性を示した。
原題: Ordered Action Tokens for Visuomotor Policy Learning / Chaoqi Liu, Yue Zhao, Haonan Chen 他
日本語で読む → - 論文VLAロボティクス
小型VLAモデルに「どこを見るか」と「どう動くか」を教える
小型の視覚言語行動モデルに、空間的接地と行動生成の能力を効率的に教えるフレームワークXS-VLAを提案。蒸留とフローマッチングにより、実時間制御に適した小型モデルの性能を大幅に向上させた。
原題: Teaching Tiny VLA Models Where to Look and How to Move / Iok Tong Lei, Ying Jie Yap, Wei Huang 他
日本語で読む → - 論文VLAロボティクス
言葉は長く語る:言語によるロボットポリシー合成のガイド
この論文では、ロボットのポリシー獲得を対話的なプログラム合成タスクとして扱うフレームワーク「ARCHITECT」を提案し、人間の自然言語による修正をコードに反映し、再利用可能なスキルライブラリを構築することで、長期的なタスクでの性能向上と人間の介入削減を実現しています。
原題: A Few Words Go a Long Way: Language Guided Robot Policy Synthesis / Daphne Chen, Archit Ritesh Jain, Eric Goossen 他
日本語で読む → - 論文VLA/移動操作画像認識
ABot-M0.5: 移動と操作を統合した世界行動モデル
移動操作ロボットのための世界行動モデルを提案し、時間粒度・行動空間・学習と推論の整合性を揃えることで、長期的なタスク実行の精度とロバスト性を向上させた。
原題: ABot-M0.5: Unified Mobility-and-Manipulation World Action Model / Ronghan Chen, Yandan Yang, Zuojin Tang 他
日本語で読む → - 論文VLA/クロスエンボディメント転移ロボティクス
行動整合表現によるクロスエンボディメント転移
ロボット操作の大規模模倣学習において、行動整合表現(物体のバウンディングボックスや言語動作、エンドエフェクタの軌跡など)がVLAモデルのクロスエンボディメント転移を促進するかを検証し、シミュレーションベンチマークで評価。エンドエフェクタ軌跡が特に有効で、シミュレーションから実機への転移成功率を28%向上させた。
原題: Cross-Embodiment Transfer via Behavior-Aligned Representations / Ajay Sridhar, Jensen Gao, Jonathan Yang 他
日本語で読む → - 論文VLAロボティクス
RoboTALES: タスク整合的なシミュレート未来による推論誘導型ロボットポリシーの学習
事前学習済みビデオ生成モデルをロボット制御に活用する際、想像した未来がタスク意図からずれたり、行動条件付けが不確実になる問題を解決するため、階層的LLMプランナーとVLM批評家を用いてタスク整合的な未来を生成し、ロボットポリシーを学習する単一フレームワークを提案した。
原題: RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures / Hanan Gani, Tejal Kulkarni, Madhoolika Chodavarapu 他
日本語で読む → - 論文VLA画像認識
VLAFlow: 共学習と未来潜在整合による視覚-言語-行動モデルの統合学習フレームワーク
ロボット操作のための視覚-言語-行動モデル(VLA)の学習手法を統一フレームワークで比較し、言語教師あり学習と未来潜在整合を組み合わせることで、異種データに対する転移性能が最も安定することを示した論文。
原題: VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment / Guoyang Xia, Fengfa Li, Hongjin Ji 他
日本語で読む → - 論文VLA/評価AI
空中MLLMエージェントのゼロショットミッションレベル評価
空中3D環境での長期的なタスクを評価するベンチマークMissionBenchを提案し、22のMLLMモデルが人間の84.4%に対し35%未満の成功率であることを示した。
原題: Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents / Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt 他
日本語で読む → - 論文VLA/長期メモリ/操作ロボティクス
NativeMEM: 長期ホライズンのロボット操作のためのネイティブメモリ圧縮
事前学習済みVLAモデルが高頻度更新で長い視覚履歴を保持できるように、VLA自身の視覚エンコーダを再利用して各フレームを単一トークンに圧縮するメモリ圧縮方式を提案。外部メモリや新規モジュール不要で、シミュレーション成功率を32.4%から84.0%に向上させた。
原題: NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation / Ziye Wang, Modi Shi, Chaojun Ni 他
日本語で読む → - 論文VLAロボティクス
InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
原題: InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization / Haoxiang Ma, Junhao Cai, Xiaoxu Xu 他
日本語で読む → - 論文安全性/VLAロボティクス
制約付きフローマッチングによる視覚言語行動モデルのための神経記号的安全性ガイダンス
フローマッチングに基づくVLAモデルに対し、予測軌道のノイズ除去過程で安全制約を最適化問題として適用し、衝突を予測的に回避する手法を提案した。
原題: Neuro-Symbolic Safety Guidance for Vision-Language-Action Models via Constrained Flow Matching / William English, Hao Zheng, Rickard Ewetz
日本語で読む → - 論文VLA/操作ロボティクス
SAM3Dガイドによる物体中心表現アライメントを用いた視覚言語行動モデル
VLAモデルにSAM3Dを教師として物体中心の3D表現を学習させ、推論時はRGBのみで高精度な操作を実現する手法を提案。
原題: SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models / Zonghe Liu, Shanyuan Jie, Xiaoquan Sun 他
日本語で読む → - 論文VLA/ヒューマノイドロボティクス
ラボから店舗へのギャップを埋める:小売ヒューマノイド向けデータ効率的なポストトレーニングと経験駆動学習VLAフレームワーク
スーパーマーケットの棚補充タスクにおいて、データ効率的なポストトレーニングと経験駆動の学習を組み合わせたVLAフレームワークを提案し、単一GPUで実世界運用可能な性能を達成した。
原題: Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids / Roger Sala Sisó, Tiago Silvério, Jakob Sand 他
日本語で読む → - 論文VLA/エッジ推論ロボティクス
Jetson-PI: 先読み整合非同期推論による搭載リアルタイムロボット制御の実現
低消費電力の搭載デバイス上でVLAモデルを高速に動作させるため、非同期推論の課題を解決する先読み整合補正と信頼度ベースのスケジューリングを提案した論文。
原題: Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference / Zebin Yang, Qi Wang, Yunhe Wang 他
日本語で読む → - 論文器用操作/VLAロボティクス
EgoSteer: 自己中心視点ビデオからの操縦可能な器用操作を実現するフルスタックシステム
自己中心視点の人間ビデオから大規模な事前学習データを構築し、言語指示に従う器用なロボット操作ポリシーを学習するフルスタックシステムを提案。実ロボットへの適応も効率的で、多様なタスクで高い成功率を達成した。
原題: EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos / Yifan Zhong, Zhang Chen, Tianrui Guan 他
日本語で読む → - 論文VLA/操作ロボティクス
ハーネスVLA:メモリ誘導エージェントによる凍結VLAの信頼性ある操作プリミティブへの変換
凍結したVLAモデルを再試行可能な接触豊富なプリミティブとして活用し、解析的プリミティブと組み合わせることで、微調整なしに分布外の操作タスクでの成功率を大幅に向上させるフレームワークを提案した。
原題: Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents / Yixian Zhang, Huanming Zhang, Feng Gao 他
日本語で読む → - 論文VLAロボティクス
ACE-Brain-0.5:物理的エージェントAIのための統合具現化基盤モデル
ロボット知能を空間知覚、意思決定、身体的行動、自己監視、自己改善の5機能に統合した、単一の8Bバックボーンによる閉ループ基盤モデルを提案する。
原題: ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI / Brain Team, Ziyang Gong, Haoming Gu 他
日本語で読む → - 論文VLAロボティクス
解析的概念による明示的運動学的ガイダンスを用いた視覚言語行動モデル
VLAモデルに3D構造情報を組み込むため、物体を明示的なプログラム的設計図として表現する解析的概念を構築し、密な報酬と空間的ガイダンスで微調整を支援する手法を提案した。
原題: Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models / Mingyang Sun, Jiude Wei, Xiujian Liang 他
日本語で読む → - 論文VLA/航法ロボティクス
Exp2VLA: 専門家デモからのドローン航法のための視覚言語行動モデル
強化学習や遠隔操作などの専門家の行動を蒸留して、言語指示に従うドローン航法用のコンパクトなVLAモデルを微調整するパイプラインを提案した。
原題: Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations / Van Huyen Dang, Kabilesh Rajendran, Erdi Sayar 他
日本語で読む → - 論文自動運転/VLAロボティクス
S-squared-VLA: 自動運転のための視覚言語行動モデルにおける意味ストリームと空間ストリームの分離
自動運転向けの視覚言語行動モデルにおいて、意味情報と空間情報のストリームを分離し、空間表現の崩壊を防ぐことで、高精度な制御を実現する新しいアーキテクチャを提案した。
原題: S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving / Jianguo Yu, Rukang Wang, Duanfeng Chu 他
日本語で読む → - 論文VLA/触覚/操作ロボティクス
TACO: 触覚を考慮した世界モデルによるスケーラブルなVLAポストトレーニングの自己修正
接触を伴う操作タスクで失敗するVLAモデルに対し、触覚を考慮した世界モデルを用いて失敗状態を認識し、修正動作を想像・ラベル付けすることで、人間の介入なしにポリシーを改善するフレームワークを提案した。
原題: TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training / Shengbang Liu, Yueru Jia, Yuyang Yan 他
日本語で読む → - 論文VLA/計画AI
ワールドアクションプランナー:行動条件付きワールドモデルによる汎用意思決定
視覚言語モデルとマルチタスクのポーズ画像条件付きワールドモデルを組み合わせ、初期行動計画を提案し、想像上のロールアウトを最適化・探索で反復改良するロボット計画システムを提案。構成タスクや新規レイアウト、ゼロショット汎化で既存のVLAやWAMを上回る性能を示した。
原題: World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models / Xiangcheng Zhang, Yilun Du
日本語で読む → - 論文VLAロボティクス
SEAM: 視覚言語行動ポリシーにおけるアクションチャンク動作の滑らかな実行
アクションチャンク方式のVLAポリシーで生じるチャンク境界の不連続を、学習不要の推論時補正で滑らかにする手法を提案した。
原題: SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies / Dijia Zhan, Xuemiao Xu, Jinyi Li 他
日本語で読む → - 論文VLAロボティクス
CAC-VLA: 視覚言語行動モデルのための文脈ゲート型行動条件付け
VLAモデル内に軽量な潜在行動インターフェースを導入し、文脈ゲートで行動エキスパートへの影響を調整することで、ロボット操作の成功率を向上させた。
原題: CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models / Yifu Xiong, Wenhao Yu, Jiaxuan Lin 他
日本語で読む → - 論文データ選択/模倣学習/VLAロボティクス
SIEVE: VLAモデルを用いた模倣学習のための構造認識データ選択
ロボットのデモデータから再利用可能なプリミティブと遷移構造を抽出し、構造的な被覆率を最大化するようにデータを選択することで、少ないデータと学習ステップで高性能なVLAポリシーを学習する手法を提案した。
原題: SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models / Changti Wu, Bin Yu, Zhaolong Shen 他
日本語で読む → - 論文VLA/行動生成ロボティクス
ChunkFlow: 連続性を保つチャンク型ポリシー学習に向けて
VLAモデルのチャンク型アクション出力で生じる境界の不整合(ジッタ)を、チャンク構造と実行を整合させる学習・実行フレームワークChunkFlowを提案し、CALVINやLIBERO、実ロボットで成功率と安定性を改善した。
原題: ChunkFlow: Towards Continuity-Consistent Chunked Policy Learning / Zhao Yang, Yinan Shi, Mingyuan Yao 他
日本語で読む → - 論文VLA/操作画像認識
DynaWM: ベースVLA誘導による移動物体操作のための世界基盤モデル
移動物体操作のための世界モデルを提案。ベースVLAの性能を保ちつつ、Mamba-3とV-JEPA 2.1を用いて動作軌道を生成し、新ベンチマークDynaGrasp-32で評価した。
原題: DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation / Chongkei Chang, Zhidong Deng
日本語で読む →