論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/31 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/自動運転ロボティクス
言語の役割を再考する:自動運転のための効率的VLAへ向けて
自動運転におけるVLAモデルで、推論時の言語使用を4段階に分類し、効率性と信頼性の観点から手法を整理・分析したサーベイ論文。
原題: Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving / Tongfei Guo, Lili Su
日本語で読む → - 論文VLA/ベンチマークロボティクス
Behavior-Skill: 長期的タスクにおける視覚-言語-行動ポリシー評価のための細粒度ベンチマーク
長期的なモバイル操作タスクを構成するスキル単位で学習・評価するベンチマークを提案し、VLAポリシーの失敗箇所を詳細に分析できるようにした。
原題: Behavior-Skill: A Fine-Grained Benchmark for Evaluating Vision-Language-Action Policies in Long-Horizon Tasks / Chunyun Ma, Lun Luo, Xingjian Luo 他
日本語で読む → - 論文VLA/自動運転画像認識
VLA運転のためのマルチ軌道教師信号とポリシー最適化の整合
VLA運転モデルにおいて、マルチ軌道模倣学習とGRPOを整合させる新しいフレームワークを提案し、非実行可能な軌道による勾配バイアスをパレート最適性と動的蒸留で解消する。
原題: Aligning Multi-Trajectory Supervision with Policy Optimization for VLA Driving / Tian Zhang, Zhuo Huang, Hongrui Ye 他
日本語で読む → - 論文VLAロボティクス
CometVLA: 身体性データピラミッドの共学習による物理理解の獲得
ロボット操作タスクにおける物理常識の欠如を補うため、身体性に整合した物理VQAデータとベンチマークを構築し、VLAモデルを共学習させる手法を提案。実世界とシミュレーションで性能向上を確認した。
原題: CometVLA: Co-Training on an Embodied Data Pyramid towards Physical Understanding / Hanwen Wan, Dafeng Chi, Linbo Zhai 他
日本語で読む → - 論文VLAロボティクス
時間的強制:視覚・言語・行動モデルのための4D表現アライメント
VLAモデルに履歴パスを導入し、4D基盤モデルの幾何特徴と整列させることで、時間情報を活用した操作性能を向上させた。
原題: Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models / Xingyu Ding, Yuzhong Zhao, Chunhai Zhao 他
日本語で読む → - 論文VLAロボティクス
PAVE: 世界行動ポリシーのための予測的アライメントと価値誘導進化
視覚言語行動ポリシーに、複数時間スケールの遷移予測と価値ベースの条件付けを導入し、軌道の質を考慮した学習を可能にする手法を提案した。
原題: PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies / Botong Zhao, Fang Yu, Tim 他
日本語で読む → - 論文VLA/社会的相互作用自然言語
私たちが見抜ける嘘:身体的社会的相互作用におけるVLMエージェントによる言語・非言語連携欺瞞
3Dマルチモーダル環境『MineAmongUs』を構築し、VLMエージェントが言語と非言語行動を組み合わせて欺瞞を行う様子を分析。非言語チャネルが勝利に重要であることを示した。
原題: Lies We Can See: Joint Verbal and Non-Verbal Deception by VLM Agents in Embodied Social Interactions / Jaewoo Ahn, Junseo Kim, Hyunseo Kim 他
日本語で読む → - 論文VLA/蒸留/操作制御
対称性を活用した視覚言語行動蒸留によるロボット操作
大規模VLAモデルの知識を、操作タスクの幾何学的対称性を利用して小型の学生ポリシーに蒸留するフレームワークを提案し、サンプル効率と汎化性を向上させた。
原題: SymVD: Symmetric Vision Language Action Distillation for Robot Manipulation / Hyewon Choi, Donggyu Kim, Soojean Han
日本語で読む → - 論文VLAロボティクス
EMERGE-Policy: ロボットの心は単一ポリシーを超えて出現する
複数の専門エージェントが協調して知覚・推論・検証・記憶を行うグラフ構造のエージェントフレームワークを提案し、追加のファインチューニングなしでベンチマークと実ロボット実験で高い性能を達成した。
原題: EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy / Zhirui Fang, Qingchi Yu, Ziyang Chen 他
日本語で読む → - 論文VLA/操作ロボティクス
凍結VLAポリシーのための達成基盤メモリによる閉ループエージェント
凍結された視覚-言語-行動(VLA)ポリシーに、物理的証拠で検証されたサブゴール進行ポインタを持つ軽量メモリを追加し、開ループ実行を閉ループ化するフレームワークを提案。
原題: AGM: Achievement-Grounded Memory for Closed-Loop Agents with Frozen VLA Policies / Hongbo Gao, Zeyu Ni, Xin Wen 他
日本語で読む → - 論文VLAロボティクス
DriftingVLA: 次元別時間ドリフトによるネイティブ一段階視覚言語行動生成
フローベースのVLAモデルの多段階推論による遅延を解消するため、分布ドリフト目的関数を用いてノイズから行動チャンクへの直接マッピングを学習する一段階VLAモデルを提案した。行動次元ごとに時間的ドリフトを適用することで、制御性能を保ちつつ3.36倍の高速化を実現した。
原題: DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting / Yuxuan Gao, Shiqi Zhang, Yedong Shen 他
日本語で読む → - 論文VLAロボティクス
言語フィードバックによるVLAモデル失敗の訓練不要な行動補正
VLAモデルの実行時失敗を、再訓練なしにタスクレベルの自然言語補正で行動の大きさを調整して修正するフレームワークCorrectVLAを提案。シミュレーションと実ロボットで有効性を示し、修正可能な失敗の境界を明らかにした。
原題: Training-Free Action Correction for VLA Model Failures via Language Feedback / Owen Kwon, Pablo Ortega-Kral, Arthur Bucker 他
日本語で読む → - 論文VLAロボティクス
DREAM: 実世界からシミュレーションへの変換による展開時デモ生成でスケーラブルなポリシー適応を実現
新しい作業環境でVLAモデルを微調整するためのデモデータを、人間の遠隔操作なしに自動生成するフレームワークDREAMを提案。実環境を再構築し、言語指示からタスク目標を自動翻訳して軌道を計画し、シミュレーションでデータを増強してVLAを微調整する。
原題: DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation / Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo 他
日本語で読む → - 論文VLAロボティクス
AdaVLA: 適応的ステップフローマッチングによる視覚言語行動モデルの学習不要高速化
フローマッチングに基づく視覚言語行動モデルの推論を、学習なしで適応的に高速化するフレームワークを提案。軌道曲率から生成信頼度を測り、ステップ数削減とMLP枝刈りを動的に調整する。
原題: AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models / Sunghwan Han, Youngtae Han, Youngmin Yi
日本語で読む → - 論文VLA/動作生成ロボティクス
SMILE: 長期的VLA実行のための滑らかな動作生成
VLAモデルの長期的な動作実行精度を向上させるため、Bスプライン係数を予測して滑らかな動作列を生成する手法SMILEを提案。複数のベースラインに適用し、精度と推論効率を改善。
原題: SMILE: Smooth Motion for Improved Long-Horizon VLA Execution / Jongwoo Park, E-Ro Nguyen, Kanchana Ranasinghe 他
日本語で読む → - 論文VLAロボティクス
視覚エンコーダから言語モデルを解放する:小型言語モデルのための知覚インターフェースとしての意味直列化
視覚情報を言語モデルに入れず、知覚スタックの出力を決定に沿ったテキストに変換してテキスト専用LLMに回答させる手法を提案し、同規模のVLMより高い性能を示した。
原題: Free the Language Model From the Vision Encoder: Semantic Serialization as a Perception Interface for Small Language Models / Cong Xu, Ravi Sankar
日本語で読む → - 論文VLAAI
CEDAR: 言語誘導型身体的行動のための検証可能なインターフェースとしてのオートマトン
自然言語の指示を正規言語として表現し、決定性有限オートマトンに変換することで、制約を検証可能な実行可能なオブジェクトとして扱うフレームワークを提案。Minecraftで時間的・空間的制約を維持し、LLMクエリを削減できることを示した。
原題: CEDAR: Automata as Verifiable Interfaces for Language-Guided Embodied Action / Lekai Chen, Alvaro Velasquez, Ashutosh Trivedi
日本語で読む → - 論文VLA画像認識
Iron: 意図整合と回顧的双方向学習による汎用仮想エージェントの性能向上フレームワーク
GUIエージェントの訓練において、低レベル行動と高レベル意図の細粒度な整合を実現するステップワイズ循環整合報酬と、失敗軌跡を再利用する回顧的再現メカニズムを導入し、データ効率と性能を向上させた。
原題: Iron: Intent-Aligned and Retrospective Dual Learning Framework for Enhancing Generalist Virtual Agents / Jiahe Ying, Wendong Bu, Kaihang Pan 他
日本語で読む → - 論文VLAロボティクス
DeicticVLA: 言語と指示ジェスチャに基づく指示モードを単一のVLAで統合する
言語指示、視覚言語指示、視覚指示の3つの指示モードをテキストプロンプトと指示マスクに正規化し、単一の事前学習済みVLAで扱えるようにした。シミュレーションと実世界タスクで、未見の表現や物体に対する汎化性能を評価し、視覚指示が言語指示より優れていることを示した。
原題: DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA / Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa 他
日本語で読む → - 論文VLA/操作ロボティクス
GRAFT: 微細なロボット操作のための接地された効率的なオンライン強化学習適応
事前学習済みの視覚言語行動ポリシーをオンラインで適応させる際、タスクに重要な視覚的手がかりを学習するための枠組みを提案し、計算コストを削減しつつ成功率を向上させた。
原題: GRAFT: Grounded and Efficient Online Reinforcement Adaptation for Fine-Grained Robot Manipulation / Yibo Qiu, Haoliang Ye, Shu'ang Sun 他
日本語で読む → - 論文VLAAI
指示可能なエージェントのための計画と制御の分離
VLMプランナーが生成する高レベルな指示を、高速なワールドモデルコントローラが実行するシステムを提案し、複数の環境で性能を検証した。
原題: Decoupling Planning and Control for Instructable Agents / Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste 他
日本語で読む → - 論文VLAロボティクス
FlashVLA: 高速かつ非同期なVLA推論のためのストリーミング行動デコード
VLAモデルの推論遅延と非同期実行の不安定さを解決するため、ストリーミング行動バッファとチャンク単位の因果注意を用いたフレームワークを提案し、単一GPUで30Hz以上の制御周波数を実現した。
原題: FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference / Zekai Li, Jiaming Tang, Zhijian Liu
日本語で読む → - 論文セキュリティ/VLAロボティクス
TrapVLA: 設定された失敗モードへのVLAモデルのトラッピング
視覚言語行動モデルに対するバックドア攻撃の新タスクを提案し、テキストトリガーで特定の失敗パターンを誘発する手法を開発した。
原題: TrapVLA: Trapping Vision-Language-Action Models in Configured Failure Modes / Jun-Hui Liu, Kun-Yu Lin, Yi-Lin Wei 他
日本語で読む → - 論文VLAロボティクス
Riemann-1.0: 物理AIのための具現化世界行動モデル
ロボットの行動と世界の変化を統一的な因果系列としてモデル化し、単一モデルでポリシー実行と世界シミュレーションを実現する世界行動モデルを提案。大規模データで事前学習し、シミュレーションと実世界の操作タスクで最高性能を達成。
原題: Riemann-1.0: An Embodied World Action Model for Physical AI / Haofeng Sun, Jiangbo Pei, Fei Kang 他
日本語で読む → - 論文VLAロボティクス
データスケーリングを超えて:視覚言語行動モデルのための表現中心の継続事前学習
ロボットデータの不足を補うため、多様なロボットデータでVLMバックボーンを継続事前学習し、下流タスクの性能を向上させるVLActを提案した。
原題: Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models / Senqiao Yang, Chengyao Wang, Yuxin Chen 他
日本語で読む → - 論文VLA/操作ロボティクス
TemporalFlow-VLA: 物理的に基づいた実行履歴を学習する長期的ロボット操作
視覚言語行動モデルに物理的な時間的監督を導入し、多段階操作の実行履歴をコンパクトに学習する手法を提案。LIBEROやRoboTwinで高い成功率を達成し、長期的な操作で優位性を示した。
原題: TemporalFlow-VLA: Learning Physically Grounded Execution History for Long-Horizon Robot Manipulation / Jiarui Yang, Yehao Lu, Yuning Su 他
日本語で読む → - 論文VLA機械学習
潜在進化を明示する:ワールドアクションモデルのための演算子構造化遷移
ロボット政策のためのワールドアクションモデルにおいて、潜在空間の遷移を演算子ベースで構造化するLEONを提案し、閉ループ性能と頑健性を向上させた。
原題: Making Latent Evolution Explicit: Operator-Structured Transitions for World Action Models / Xiaoxiao Lu, Yunlong Dong, Jiahao Shi 他
日本語で読む → - 論文VLAロボティクス
PHR-VLA: 視覚言語行動モデルのための計画地平推論
将来の観測から得た潜在ダイナミクスをVLAの内部表現に整列させる補助ヘッドを導入し、接触を伴う細かい操作タスクの成功率を向上させた。
原題: PHR-VLA: Planning Horizon Reasoning for Vision-Language-Action Models / Davood Soleymanzadeh, Kaidi Zhang, Zhiyuan Zhang 他
日本語で読む → - 論文VLA画像認識
V-Link: アクションDiTにおける失われた視覚表現の回復による視覚-言語-行動モデルの強化
VLAモデルのアクション専門家が視覚特徴を十分に活用できない問題を解決するため、VLM内に空間・意味クエリを学習し、非対称経路でAction DiTに注入するV-Linkを提案。ベンチマークで成功率を大幅に向上させた。
原題: V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models / Yehao Lu, Jiarui Yang, Yuning Su 他
日本語で読む → - 論文VLAロボティクス
MA-VLA: 協調と構成的汎化のためのマルチアーム視覚言語行動モデル
複数アームの協調動作をアトミックな行動割り当てで分解し、訓練時にアームの役割をシャッフルすることで、未見の協調パターンへの汎化を実現するVLAモデルを提案した。
原題: MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization / Zaibin Zhang, Junlan Xiao, Zhongbo Zhang 他
日本語で読む →