論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/3 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/操作ロボティクス
ChainVLA: 統一実行状態による長期的操作のためのビジョン・言語・行動クエリの連鎖
長期的な操作タスクにおいて、過去の行動の結果と現在の動作を連鎖させる新しいVLAポリシーを提案。進行状況コンテキストとモーションテールを統合し、高い成功率を達成。
原題: ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation / Yuzhi Huang, Weijue Bu, Ziyi Xiong 他
日本語で読む → - 論文VLAロボティクス
接地された意味的再結合による視覚言語行動モデルの指示一般化の堅牢化
VLAモデルが言い換え指示で性能低下する原因を、アーキテクチャ上の問題として特定し、タスク意味と視覚特徴を明示的に融合する介入(GSR)を提案して、パラフレーズ不変性を大幅に改善した。
原題: Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models / Zhaokai Yin, Zhipeng Zhang
日本語で読む → - 論文VLA画像認識
SpatioLM: 視覚言語モデルにおける汎用物理空間知能の実現
視覚言語モデルに追加の3D入力や外部エンコーダを使わず、パラメータ効率的なモジュールと擬似深度・カメラ情報の教師信号で空間推論能力を強化し、汎用性能の低下を抑えつつ空間知能を向上させた。
原題: SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models / Jing Wu, Jianhua Wu, Jiayi Guan 他
日本語で読む → - 論文VLAロボティクス
重要な場所を見る:視覚言語行動モデルのための適応的視覚精緻化
VLAモデルの視覚エンコーダに生じる注意アーティファクトを修正し、不確実性に基づいて高解像度の局所精緻化を行うフレームワークAtVLAを提案した。
原題: Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models / Jin Cui, Yanbin Hu, Xinyue Long 他
日本語で読む → - 論文VLAロボティクス
ValueFormer: ステージ認識ラベルを備えた半自律VLAポリシーのための因果トランスフォーマー価値関数
行動クローニングによるVLAポリシーは失敗を検出できないため、密で連続的な価値ラベルを生成するコンパクトな因果トランスフォーマーを提案し、実ロボットのサンドイッチ組み立てタスクで成功率を70%から85%に向上させた。
原題: ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies / Inkyu Sa, Konstantin Stulov, Rajat Bhageria
日本語で読む → - 論文VLA画像認識
STAR-VLM: 自動車レーダー監視による動きと速度推定のための時空間接地視覚言語モデル
自動車レーダーのドップラー計測を教師信号として用い、視覚言語モデルの時空間推論とメートル単位の速度推定能力を向上させるフレームワークを提案した。
原題: STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision / Pou-Chun Kung, Aryaman Rao, Utkrisht Sahai 他
日本語で読む → - 論文VLA/ロバスト性ロボティクス
VLAGuard: ワイヤレスセンサネットワークにおける視覚言語行動ロボットの物理的注意ハイジャック評価・緩和フレームワーク
VLAロボットの注意機構を妨害する物理的攻撃を評価し、注意保護ファインチューニングにより攻撃耐性を大幅に向上させるフレームワークを提案した。
原題: VLAGuard: A Framework for Evaluating and Mitigating Physical Attention Hijacking in Vision-Language-Action Robots within Wireless Sensor Networks / Dongfu Yin, Jinquan Zhang
日本語で読む → - 論文VLAロボティクス
BridgeVLA++: 3次元操作のためのデータ効率的で汎化可能なメモリ拡張型視覚言語行動フレームワーク
事前学習済み視覚言語モデルを活用した3次元ロボット操作フレームワークBridgeVLAを拡張し、空間的・時間的メモリを統合することで、データ効率と汎化性能を保ちつつ、記憶依存の操作タスクで最先端の性能を達成した。
原題: BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation / Peiyan Li, Yuze Zhu, Yixiang Chen 他
日本語で読む → - 論文データ選択/器用操作/VLAロボティクス
SiMDex: 類似する自己中心視点動画のマイニングによるクロスエンボディ器用操作
ロボットの器用操作のためのVLAモデル訓練に有効な人間の自己中心視点動画を、類似性に基づくデータマイニングで選別するフレームワークを提案。約3200万サンプルから1.49百万件を選び、成功率を47.7%から61.1%に向上させた。
原題: SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation / Nie Lin, Takehiko Ohkawa, Sijin Chen 他
日本語で読む → - 論文VLAロボティクス
SG-WAM: 幾何認識ポリシー空間における自己誘導型ワールドモデリング
ポリシー由来の表現空間で幾何認識の行動条件付きダイナミクスを学習し、将来状態予測と行動生成を統合する自己誘導型フレームワークを提案。
原題: SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space / Ruiteng Zhao, Zhengshen Zhang, Yue Su 他
日本語で読む → - 論文VLAロボティクス
GWM-VLA:視覚言語行動学習のための幾何認識潜在世界モデリング
視覚言語行動モデルの堅牢性を向上させるため、幾何情報を考慮した多視点状態符号化と潜在世界モデルを導入し、手首視点の予測と共有潜在行動表現によりロボット操作性能を高めた。
原題: GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning / Yanping Zhao, Hang Yu, Yiwei Wang 他
日本語で読む → - 論文VLA/推論最適化ロボティクス
ニューラル内省ゲーティングによる視覚言語行動モデルの適応的KVキャッシュ再利用
視覚言語行動モデル(VLA)の推論コスト削減のため、視覚的類似性に基づくKVキャッシュ再利用に、モデル自身の不確実性(ロジットマージン)を監視してキャッシュを無効化する軽量なトレーニング不要の手法を提案した。
原題: Neural Introspection Gating for Adaptive KV-Cache Reuse in Vision-Language-Action Models / Zhijie Wu, Kento Kawaharazuka, Kei Okada
日本語で読む → - 論文VLAロボティクス
SG-WAM: テキスト接地と空間認識を備えた意味的ガイダンスによるワールドアクションモデル
ロボット操作のためのワールドアクションモデルに、VLMを意味プランナーとして用いてテキスト指示に基づく意味的先見を注入し、将来ビデオ生成と行動予測の指示追従精度を向上させる手法を提案した。
原題: SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models / Junjie He, Junfeng Li, Zhide Zhong 他
日本語で読む → - 論文VLAロボティクス
G0.5: ロボットの推論と行動のための単一自己回帰ストリーム
単一のトランスフォーマーデコーダが推論トークンと行動トークンを同一の目的で生成する、事前学習済み自己回帰VLAモデルG0.5を提案。異なるロボットの行動を共有語彙に変換するトークナイザーや、チェーン・オブ・ソート、視覚メモリを導入し、複数のベンチマークでSOTAを達成。
原題: G0.5: One Autoregressive Stream for Robot Reasoning and Action / Yicheng Liu, Zibin Dong, Baijun Ye 他
日本語で読む → - 論文VLAロボティクス
Mind-VLA: 指示認識型空間表現アライメントによる視覚言語行動モデル
言語指示で指定された対象物体の3D幾何に焦点を当て、VLAモデルの表現をアライメントする手法を提案。LIBEROやCALVINで高精度を達成し、実ロボットの遮蔽タスクでも大幅な性能向上を示した。
原題: Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models / Xingyu Ding, Yuzhong Zhao, Yang Wu 他
日本語で読む → - 論文VLA/クロス身体操作ロボティクス
DyPES-VLA: 共有ダイナミクス事前知識と身体固有制御の学習によるクロス身体操作
異なるロボット身体間で共有できるダイナミクス事前知識を学習し、身体固有の行動空間で直接制御を出力するVLAモデルを提案。シミュレーションと実機で最高性能を達成した。
原題: DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation / Junfeng Li, Junjie He, Zhide Zhong 他
日本語で読む → - 論文VLA/故障検出ロボティクス
SAFECAST: コントラストセット学習とキャリブレーションによるVLAポリシーの堅牢な故障検出
VLAポリシーの展開時分布シフトによる失敗を検出するため、コントラストセット摂動を用いて隠れ状態プローブの訓練とキャリブレーションを改善する手法を提案。実世界とシミュレーションで故障検出のROC-AUCを向上させた。
原題: SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration / Harshitha Rajaprakash, Aditeya Prajapati, Rong Xue 他
日本語で読む → - 論文VLA/ナビゲーションロボティクス
HumanoidVLN:多様な人型ロボットのための物理基盤シミュレータと視覚言語ナビゲーションベンチマーク
二足歩行の物理制約や人型ロボットの形態差を考慮した、視覚言語ナビゲーションのための物理シミュレータとベンチマークを構築した。4種類の人型ロボットと複数のVLNモデルを統合し、933の衝突考慮エピソードを提供する。
原題: HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments / Quan-Dung Pham, Anh Dao, The-Anh Nguyen 他
日本語で読む → - 論文VLAロボティクス
遅延耐性を持つクラウド・エッジ協調型視覚言語行動モデル:創発的表現特化による実現
クラウド上の大規模VLAモデルとエッジの軽量ヘッドを組み合わせ、通信遅延があってもロボット制御を維持する手法を提案。遅延フレームと現在フレームを同じ行動目標で学習させ、クラウド表現にタスク情報を、エッジに状態補正を担わせる。
原題: Latency-Tolerant Cloud-Edge Collaborative Vision-Language-Action Models via Emergent Representational Specialization / Daojie Peng, Fulong Ma, Bingtao Wang 他
日本語で読む → - 論文自動運転/VLAロボティクス
FactorDrive: 計画重要因子に基づく適応的多段階推論によるエンドツーエンド自動運転
エンドツーエンド自動運転のためのVLMベースの推論フレームワークを提案。計画に重要な空間物理的証拠を推論に組み込み、シーンに応じた推論経路を適応的に生成し、強化学習で推論経路を最適化する。
原題: FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving / Guolei Huang, Tengfei She, Yuxuan Lu 他
日本語で読む → - 論文VLAロボティクス
実行前に再考せよ:ワールドアクションモデルのための適応的実行
ワールドアクションモデル(WAM)の固定実行ホライズンを、進捗モニタと適応プロトコルで動的に調整するTempoWAMを提案し、成功率と効率のトレードオフを改善した。
原題: Rethink Before You Execute: Adaptive Execution for World Action Models / Feng Ye, Yiming Zhao, Yong Yu 他
日本語で読む → - 論文VLA/RLポストトレーニングロボティクス
TEMPO: 視覚-言語-行動モデルのための意味-行動分離型RLポストトレーニング
VLAモデルのRLポストトレーニングにおいて、視覚-言語バックボーンを凍結し、意味投影層と行動エキスパートを異なる頻度で更新する二段階学習を提案。CALVINベンチマークと実機タスクで既存手法を上回る性能を達成した。
原題: TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models / Ziheng Liu, Quantao Yang
日本語で読む → - 論文VLA/強化学習ロボティクス
新規ロボット形態に対するOpenVLA-OFTのRLブートストラッピング
事前学習済みのVLAポリシーを、デモデータなしでケーブル駆動パラレルロボットに適応させるため、シミュレーション内でPPOとGRPOを用いた強化学習を行い、指示成功率を向上させた。
原題: RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment / Damir Nurtdinov, Alexei Kornaev, Alexander Maloletov
日本語で読む → - 論文VLAロボティクス
高速かつ正確:環境認識型モデル選択による適応的VLA推論フレームワーク
大規模な熟考システムと軽量な反応システムを環境に応じて切り替える適応的VLA推論フレームワークを提案し、タスク成功率と推論速度のバランスを実現した。
原題: Fast and Accurate: An Adaptive VLA Inference Framework through Environment-aware Model Selection / Yuewei Sun, Lang Qin, Zechuan Tian 他
日本語で読む → - 論文VLAロボティクス
FACT: 失敗を考慮した因果的ワールドアクションモデル訓練
ワールドアクションモデルに失敗データを組み込み、行動の結果を予測させることで、将来予測の偏りを減らし、操作タスクの性能を向上させる手法を提案した。
原題: FACT: Failure-Aware Causal Training for World-Action Models / Quanquan Peng, Yutong Liang, Rui Yan 他
日本語で読む → - 論文VLAロボティクス
動作と言語条件付きビデオ評価による身体化制御の進捗推定
視覚ベースの身体化エージェントが多段階の自然言語指示を実行する際、軌跡全体の進捗を評価する新しい手法ALVAを提案。事前学習済みVLMを用いて、観察・動作系列・指示に基づき離散的な進捗スコアを出力し、閉ループ最適化のフィードバックとして有効性を示した。
原題: Action- and Language-Conditioned Video Assessment for Embodied Control / Hwanhee Kim, Jaehyun Jang, Seungmin Cha 他
日本語で読む → - 論文VLA/アフォーダンス/操作学習ロボティクス
VLAff: 視覚・言語・アフォーダンスモデルによる統合的な実行可能アフォーダンスの獲得
人間のビデオからロボット操作スキルを学習するため、物体中心の実行可能アフォーダンス(視覚・把持・軌道)を抽出し、大規模言語モデルベースの統一基盤モデルVLAffを提案。実ロボットへのゼロショット適用も実証。
原題: VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances / Jihoon Oh, Kento Kawaharazuka, Kei Okada
日本語で読む → - 論文VLA画像認識
ルートからステップへ:視覚言語ナビゲーションにおける意味的進捗と局所実行の分離
視覚言語ナビゲーションにおいて、ルート全体の指示と局所的な行動生成を分離するフレームワークRoute2Stepを提案し、進捗追跡の誤りと実行の誤りを区別して学習する。
原題: From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation / Xiangyun Huang, Xiangchen Wang, Runfeng Lin 他
日本語で読む → - 論文VLAロボティクス
意図と軌道の分離:世界行動モデルのための表現演繹フレームワーク
世界行動モデルにおける高レベルの状態遷移と低レベルの軌道生成の表現が絡み合う問題を解決するため、思考連鎖ガイダンスを用いた表現演繹フレームワークPILOTを提案し、複雑なロボット操作タスクでの成功率と物理的解釈性を向上させた。
原題: Decoupling Intention from Trajectory: A Representational Deduction Framework for World Action Models / Xiangkai Ma, Yue Ma, Junjie Wang 他
日本語で読む → - 論文自動運転/VLAロボティクス
FIRE-VLA: 自動運転における視覚言語行動モデルの失敗情報に基づく自己進化
自動運転のVLAモデルに対し、失敗した軌道サンプルを教師信号として活用する自己進化フレームワークを提案し、計画精度と失敗率を改善した。
原題: FIRE-VLA: Failure-Informed Self-Evolution for Vision-Language-Action Models in Autonomous Driving / Hao Dou
日本語で読む →