論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
運転用視覚言語行動モデルにおける計画トークンの深さ方向の探索と刈り込み
運転用VLAモデルで、計画トークンが各デコーダ層でどの程度の情報を持つかを調べ、初期層で意味情報が線形分離可能であることを示し、性能を保ちながら層を刈り込む手法を提案した。
原題: Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model / Harisankar Babu, Benjamin Coors, Christopher Lang 他
日本語で読む → - 論文データ選択/器用操作/VLAロボティクス
SiMDex: 類似する自己中心視点動画のマイニングによるクロスエンボディ器用操作
ロボットの器用操作のためのVLAモデル訓練に有効な人間の自己中心視点動画を、類似性に基づくデータマイニングで選別するフレームワークを提案。約3200万サンプルから1.49百万件を選び、成功率を47.7%から61.1%に向上させた。
原題: SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation / Nie Lin, Takehiko Ohkawa, Sijin Chen 他
日本語で読む → - 論文VLAロボティクス
BridgeVLA++: 3次元操作のためのデータ効率的で汎化可能なメモリ拡張型視覚言語行動フレームワーク
事前学習済み視覚言語モデルを活用した3次元ロボット操作フレームワークBridgeVLAを拡張し、空間的・時間的メモリを統合することで、データ効率と汎化性能を保ちつつ、記憶依存の操作タスクで最先端の性能を達成した。
原題: BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation / Peiyan Li, Yuze Zhu, Yixiang Chen 他
日本語で読む → - 論文VLAロボティクス
G0.5: ロボットの推論と行動のための単一自己回帰ストリーム
単一のトランスフォーマーデコーダが推論トークンと行動トークンを同一の目的で生成する、事前学習済み自己回帰VLAモデルG0.5を提案。異なるロボットの行動を共有語彙に変換するトークナイザーや、チェーン・オブ・ソート、視覚メモリを導入し、複数のベンチマークでSOTAを達成。
原題: G0.5: One Autoregressive Stream for Robot Reasoning and Action / Yicheng Liu, Zibin Dong, Baijun Ye 他
日本語で読む → - 論文VLAロボティクス
遅延耐性を持つクラウド・エッジ協調型視覚言語行動モデル:創発的表現特化による実現
クラウド上の大規模VLAモデルとエッジの軽量ヘッドを組み合わせ、通信遅延があってもロボット制御を維持する手法を提案。遅延フレームと現在フレームを同じ行動目標で学習させ、クラウド表現にタスク情報を、エッジに状態補正を担わせる。
原題: Latency-Tolerant Cloud-Edge Collaborative Vision-Language-Action Models via Emergent Representational Specialization / Daojie Peng, Fulong Ma, Bingtao Wang 他
日本語で読む → - 論文VLAロボティクス
SG-WAM: 幾何認識ポリシー空間における自己誘導型ワールドモデリング
ポリシー由来の表現空間で幾何認識の行動条件付きダイナミクスを学習し、将来状態予測と行動生成を統合する自己誘導型フレームワークを提案。
原題: SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space / Ruiteng Zhao, Zhengshen Zhang, Yue Su 他
日本語で読む → - 論文VLAロボティクス
ゲートはキャッシュではない:ゲートの由来が訓練不要のVLAトークンスキップの閉ループ信頼性を決める
VLAモデルのトークンスキップ高速化において、前ステップの加速された順伝播からゲートを取るとスキップが累積して性能が崩壊することを示し、ロボット実行中に密な順伝播を1回行う「アクチュエーションスラックリフレッシュ」を提案して性能を回復させた。
原題: The Gate, Not the Cache: Gate Provenance Bounds the Closed-Loop Reliability of Training-Free VLA Token Skipping / Qi Luo, Shuaijun Liu, Hao Zhao 他
日本語で読む → - 論文移動操作/VLAロボティクス
DreamTrajectory: ワールドモデル整合による軌道誘導型行動生成による移動操作
移動操作ロボットのための軌道誘導型フレームワークを提案し、意図レベルの軌道予測と全身行動生成を統合、テスト時探索で計画軌道との整合性を高め成功率を向上させた。
原題: DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation / Zheng Yang, Wenjie Zhang, Xiangyu Chen 他
日本語で読む → - 論文VLAロボティクス
長期的計画のための明示的言語メモリを備えた視覚言語行動モデル
長期的なタスクにおけるVLAモデルの課題を解決するため、高レベルVLMと低レベルVLAを分離し、明示的な言語メモリモジュールを導入して時間的一貫性とエラー修正を実現する階層的アーキテクチャを提案した。
原題: Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models / Houze Xu, Jizhong Li, Ziyi Ye
日本語で読む → - 論文VLAロボティクス
4D-WAM: 軌跡フィールドによる世界行動モデルへの時空間認識の注入
ロボットの行動生成と動画予測を統合する世界行動モデルに対し、3D軌跡フィールドからの時空間知識を表現整合で注入する訓練戦略を提案し、空間理解と実行精度を向上させた。
原題: 4D-WAM: Infusing Spatiotemporal Awareness into World Action Models through Trajectory Fields / Lishan Yang, Wenxuan Song, Xi Wang 他
日本語で読む → - 論文VLA/ナビゲーションロボティクス
HumanoidVLN:多様な人型ロボットのための物理基盤シミュレータと視覚言語ナビゲーションベンチマーク
二足歩行の物理制約や人型ロボットの形態差を考慮した、視覚言語ナビゲーションのための物理シミュレータとベンチマークを構築した。4種類の人型ロボットと複数のVLNモデルを統合し、933の衝突考慮エピソードを提供する。
原題: HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments / Quan-Dung Pham, Anh Dao, The-Anh Nguyen 他
日本語で読む → - 論文VLAロボティクス
文脈内VLA:文脈内ポストトレーニングとエージェント的ツール使用による視覚言語行動モデルへの言語能力の付与
視覚言語行動(VLA)モデルに、自由形式の思考連鎖ではなく、構造化された文脈情報とツール使用を通じて接地された言語を消費する能力を与えるフレームワークを提案し、シミュレーション環境でその有効性を示した。
原題: In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use / Jiarui Yang, Wen Huang, Jiale Zhang 他
日本語で読む → - 論文VLAロボティクス
ゼロショット視覚言語制御における視覚的接地の検証
視覚言語モデルをゼロショット制御に使う際、成功軌道が実際に視覚入力に基づいているかを入力削除テストで検証し、多くのモデルが視覚に依存せず動作することを示した。また、対称性を利用したガーディアン機構で視覚接地を改善する手法を提案した。
原題: Visual Grounding in Zero-Shot Vision-Language Control / J. de Curtò, Dayani Plasencia, Diego Sánchez 他
日本語で読む → - 論文VLAロボティクス
GWM-VLA:視覚言語行動学習のための幾何認識潜在世界モデリング
視覚言語行動モデルの堅牢性を向上させるため、幾何情報を考慮した多視点状態符号化と潜在世界モデルを導入し、手首視点の予測と共有潜在行動表現によりロボット操作性能を高めた。
原題: GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning / Yanping Zhao, Hang Yu, Yiwei Wang 他
日本語で読む → - 論文VLA/アフォーダンス/操作学習ロボティクス
VLAff: 視覚・言語・アフォーダンスモデルによる統合的な実行可能アフォーダンスの獲得
人間のビデオからロボット操作スキルを学習するため、物体中心の実行可能アフォーダンス(視覚・把持・軌道)を抽出し、大規模言語モデルベースの統一基盤モデルVLAffを提案。実ロボットへのゼロショット適用も実証。
原題: VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances / Jihoon Oh, Kento Kawaharazuka, Kei Okada
日本語で読む → - 論文VLAロボティクス
SG-WAM: テキスト接地と空間認識を備えた意味的ガイダンスによるワールドアクションモデル
ロボット操作のためのワールドアクションモデルに、VLMを意味プランナーとして用いてテキスト指示に基づく意味的先見を注入し、将来ビデオ生成と行動予測の指示追従精度を向上させる手法を提案した。
原題: SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models / Junjie He, Junfeng Li, Zhide Zhong 他
日本語で読む → - 論文VLAロボティクス
ARGUS: 大規模3Dビジョンモデルによる視点変化下でのロボットシーン幾何学の位置合わせ
視点に依存しない観測前処理パイプラインARGUSを提案し、任意のカメラ視点からの画像を大規模3Dビジョンモデルで正準視点に変換することで、視点多様なデータセットからの学習効率と汎化性能を向上させた。
原題: ARGUS: Aligning Robot Scene Geometry Under Shifting Views with Large 3D Vision Models / Rishik Sathua, Haonan Chen, Katherine Driggs-Campbell
日本語で読む → - 論文VLAロボティクス
VANE: 将来の視覚表現予測による視覚-言語-行動モデルの信頼性の高いテスト時訓練
VLAポリシーのテスト時訓練を信頼性高く行うため、現在の文脈に基づいて適応を条件付け、実行した行動の将来の視覚的結果から学習し、将来の証拠に基づいて更新を選択的かつ可逆的に行うフレームワークを提案した。
原題: VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction / Hongjin Ji, Guoyang Xia, Luoyang Sun 他
日本語で読む → - 論文自動運転/VLAロボティクス
FactorDrive: 計画重要因子に基づく適応的多段階推論によるエンドツーエンド自動運転
エンドツーエンド自動運転のためのVLMベースの推論フレームワークを提案。計画に重要な空間物理的証拠を推論に組み込み、シーンに応じた推論経路を適応的に生成し、強化学習で推論経路を最適化する。
原題: FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving / Guolei Huang, Tengfei She, Yuxuan Lu 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルにおける位置依存の盲点の発見と緩和
視覚言語行動モデルが作業空間内の特定領域で失敗しやすい「位置盲点」を発見し、その領域のデモデータで微調整することで性能を改善する手法を提案した。
原題: Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models / Dongdong An, Pengjie Zhao, Yihao Huang 他
日本語で読む → - 論文VLAロボティクス
動作と言語条件付きビデオ評価による身体化制御の進捗推定
視覚ベースの身体化エージェントが多段階の自然言語指示を実行する際、軌跡全体の進捗を評価する新しい手法ALVAを提案。事前学習済みVLMを用いて、観察・動作系列・指示に基づき離散的な進捗スコアを出力し、閉ループ最適化のフィードバックとして有効性を示した。
原題: Action- and Language-Conditioned Video Assessment for Embodied Control / Hwanhee Kim, Jaehyun Jang, Seungmin Cha 他
日本語で読む → - 論文VLAロボティクス
高速かつ正確:環境認識型モデル選択による適応的VLA推論フレームワーク
大規模な熟考システムと軽量な反応システムを環境に応じて切り替える適応的VLA推論フレームワークを提案し、タスク成功率と推論速度のバランスを実現した。
原題: Fast and Accurate: An Adaptive VLA Inference Framework through Environment-aware Model Selection / Yuewei Sun, Lang Qin, Zechuan Tian 他
日本語で読む → - 論文VLAロボティクス
実行前に再考せよ:ワールドアクションモデルのための適応的実行
ワールドアクションモデル(WAM)の固定実行ホライズンを、進捗モニタと適応プロトコルで動的に調整するTempoWAMを提案し、成功率と効率のトレードオフを改善した。
原題: Rethink Before You Execute: Adaptive Execution for World Action Models / Feng Ye, Yiming Zhao, Yong Yu 他
日本語で読む → - 論文VLA/RLポストトレーニングロボティクス
TEMPO: 視覚-言語-行動モデルのための意味-行動分離型RLポストトレーニング
VLAモデルのRLポストトレーニングにおいて、視覚-言語バックボーンを凍結し、意味投影層と行動エキスパートを異なる頻度で更新する二段階学習を提案。CALVINベンチマークと実機タスクで既存手法を上回る性能を達成した。
原題: TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models / Ziheng Liu, Quantao Yang
日本語で読む → - 論文VLA/クロス身体操作ロボティクス
DyPES-VLA: 共有ダイナミクス事前知識と身体固有制御の学習によるクロス身体操作
異なるロボット身体間で共有できるダイナミクス事前知識を学習し、身体固有の行動空間で直接制御を出力するVLAモデルを提案。シミュレーションと実機で最高性能を達成した。
原題: DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation / Junfeng Li, Junjie He, Zhide Zhong 他
日本語で読む → - 論文VLA画像認識
DreamX-Phi 1.0: ロボット操作のための行動条件付きビデオワールドモデル
観測フレームと言語指示、行動系列から将来の観測を予測するビデオワールドモデルを提案。アームの軌道忠実性と物体一貫性を保つため、幾何エンコーディングと深度・マスク情報を活用し、蒸留で高速化した。
原題: DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation / DreamX Team, Rui Chen, Xiangxiang Chu 他
日本語で読む → - 論文VLAロボティクス
FACT: 失敗を考慮した因果的ワールドアクションモデル訓練
ワールドアクションモデルに失敗データを組み込み、行動の結果を予測させることで、将来予測の偏りを減らし、操作タスクの性能を向上させる手法を提案した。
原題: FACT: Failure-Aware Causal Training for World-Action Models / Quanquan Peng, Yutong Liang, Rui Yan 他
日本語で読む → - 論文VLA/世界モデルロボティクス
JEPA-WAM: 共同埋め込み世界モデリングによる視覚-言語-行動ポリシーの学習
事前学習済みV-JEPA空間に基づく潜在世界モデルを構築し、遷移予測と行動生成を共有予測器で結合することで、効率的かつ高精度なロボット制御を実現した。
原題: JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling / Yihan Lin, Jiawei He, Shifeng Bao 他
日本語で読む → - 論文VLA/強化学習ロボティクス
新規ロボット形態に対するOpenVLA-OFTのRLブートストラッピング
事前学習済みのVLAポリシーを、デモデータなしでケーブル駆動パラレルロボットに適応させるため、シミュレーション内でPPOとGRPOを用いた強化学習を行い、指示成功率を向上させた。
原題: RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment / Damir Nurtdinov, Alexei Kornaev, Alexander Maloletov
日本語で読む → - 論文VLA/故障検出ロボティクス
SAFECAST: コントラストセット学習とキャリブレーションによるVLAポリシーの堅牢な故障検出
VLAポリシーの展開時分布シフトによる失敗を検出するため、コントラストセット摂動を用いて隠れ状態プローブの訓練とキャリブレーションを改善する手法を提案。実世界とシミュレーションで故障検出のROC-AUCを向上させた。
原題: SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration / Harshitha Rajaprakash, Aditeya Prajapati, Rong Xue 他
日本語で読む →