論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/推論最適化ロボティクス
ニューラル内省ゲーティングによる視覚言語行動モデルの適応的KVキャッシュ再利用
視覚言語行動モデル(VLA)の推論コスト削減のため、視覚的類似性に基づくKVキャッシュ再利用に、モデル自身の不確実性(ロジットマージン)を監視してキャッシュを無効化する軽量なトレーニング不要の手法を提案した。
原題: Neural Introspection Gating for Adaptive KV-Cache Reuse in Vision-Language-Action Models / Zhijie Wu, Kento Kawaharazuka, Kei Okada
日本語で読む → - 論文VLAロボティクス
GWM-VLA:視覚言語行動学習のための幾何認識潜在世界モデリング
視覚言語行動モデルの堅牢性を向上させるため、幾何情報を考慮した多視点状態符号化と潜在世界モデルを導入し、手首視点の予測と共有潜在行動表現によりロボット操作性能を高めた。
原題: GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning / Yanping Zhao, Hang Yu, Yiwei Wang 他
日本語で読む → - 論文VLAロボティクス
SG-WAM: テキスト接地と空間認識を備えた意味的ガイダンスによるワールドアクションモデル
ロボット操作のためのワールドアクションモデルに、VLMを意味プランナーとして用いてテキスト指示に基づく意味的先見を注入し、将来ビデオ生成と行動予測の指示追従精度を向上させる手法を提案した。
原題: SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models / Junjie He, Junfeng Li, Zhide Zhong 他
日本語で読む → - 論文VLAロボティクス
ARGUS: 大規模3Dビジョンモデルによる視点変化下でのロボットシーン幾何学の位置合わせ
視点に依存しない観測前処理パイプラインARGUSを提案し、任意のカメラ視点からの画像を大規模3Dビジョンモデルで正準視点に変換することで、視点多様なデータセットからの学習効率と汎化性能を向上させた。
原題: ARGUS: Aligning Robot Scene Geometry Under Shifting Views with Large 3D Vision Models / Rishik Sathua, Haonan Chen, Katherine Driggs-Campbell
日本語で読む → - 論文VLA/クロス身体操作ロボティクス
DyPES-VLA: 共有ダイナミクス事前知識と身体固有制御の学習によるクロス身体操作
異なるロボット身体間で共有できるダイナミクス事前知識を学習し、身体固有の行動空間で直接制御を出力するVLAモデルを提案。シミュレーションと実機で最高性能を達成した。
原題: DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation / Junfeng Li, Junjie He, Zhide Zhong 他
日本語で読む → - 論文VLAロボティクス
動作と言語条件付きビデオ評価による身体化制御の進捗推定
視覚ベースの身体化エージェントが多段階の自然言語指示を実行する際、軌跡全体の進捗を評価する新しい手法ALVAを提案。事前学習済みVLMを用いて、観察・動作系列・指示に基づき離散的な進捗スコアを出力し、閉ループ最適化のフィードバックとして有効性を示した。
原題: Action- and Language-Conditioned Video Assessment for Embodied Control / Hwanhee Kim, Jaehyun Jang, Seungmin Cha 他
日本語で読む → - 論文VLAロボティクス
実行前に再考せよ:ワールドアクションモデルのための適応的実行
ワールドアクションモデル(WAM)の固定実行ホライズンを、進捗モニタと適応プロトコルで動的に調整するTempoWAMを提案し、成功率と効率のトレードオフを改善した。
原題: Rethink Before You Execute: Adaptive Execution for World Action Models / Feng Ye, Yiming Zhao, Yong Yu 他
日本語で読む → - 論文VLA/移動操作ロボティクス
意味的3Dガウススプラッティングによるオープンボキャブラリ移動操作のための身体化マルチモーダル基盤付け
家庭環境でのオープンボキャブラリ物体操作を実現するため、能動的マルチビュー意味的3Dガウススプラッティングと拡散型VLAポリシーを統合した身体化マルチモーダル基盤付けフレームワークを提案し、実ロボット評価で高い成功率を示した。
原題: Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting / Huosen Ou, Dongni Song, Yuncong Wang 他
日本語で読む → - 論文VLAロボティクス
BridgeVLA++: 3次元操作のためのデータ効率的で汎化可能なメモリ拡張型視覚言語行動フレームワーク
事前学習済み視覚言語モデルを活用した3次元ロボット操作フレームワークBridgeVLAを拡張し、空間的・時間的メモリを統合することで、データ効率と汎化性能を保ちつつ、記憶依存の操作タスクで最先端の性能を達成した。
原題: BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation / Peiyan Li, Yuze Zhu, Yixiang Chen 他
日本語で読む → - 論文自動運転/VLAロボティクス
FactorDrive: 計画重要因子に基づく適応的多段階推論によるエンドツーエンド自動運転
エンドツーエンド自動運転のためのVLMベースの推論フレームワークを提案。計画に重要な空間物理的証拠を推論に組み込み、シーンに応じた推論経路を適応的に生成し、強化学習で推論経路を最適化する。
原題: FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving / Guolei Huang, Tengfei She, Yuxuan Lu 他
日本語で読む → - 論文VLAロボティクス
FACT: 失敗を考慮した因果的ワールドアクションモデル訓練
ワールドアクションモデルに失敗データを組み込み、行動の結果を予測させることで、将来予測の偏りを減らし、操作タスクの性能を向上させる手法を提案した。
原題: FACT: Failure-Aware Causal Training for World-Action Models / Quanquan Peng, Yutong Liang, Rui Yan 他
日本語で読む → - 論文VLA/強化学習ロボティクス
新規ロボット形態に対するOpenVLA-OFTのRLブートストラッピング
事前学習済みのVLAポリシーを、デモデータなしでケーブル駆動パラレルロボットに適応させるため、シミュレーション内でPPOとGRPOを用いた強化学習を行い、指示成功率を向上させた。
原題: RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment / Damir Nurtdinov, Alexei Kornaev, Alexander Maloletov
日本語で読む → - 論文VLA/アフォーダンス/操作学習ロボティクス
VLAff: 視覚・言語・アフォーダンスモデルによる統合的な実行可能アフォーダンスの獲得
人間のビデオからロボット操作スキルを学習するため、物体中心の実行可能アフォーダンス(視覚・把持・軌道)を抽出し、大規模言語モデルベースの統一基盤モデルVLAffを提案。実ロボットへのゼロショット適用も実証。
原題: VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances / Jihoon Oh, Kento Kawaharazuka, Kei Okada
日本語で読む → - 論文VLAロボティクス
SC$^{2}$-WM: 連続環境における視覚・言語ナビゲーションのための閉ループフィードバックを備えた自己修正ワールドモデル
VLN-CEタスクにおいて、内部フィードバックを用いた閉ループ意思決定を行う自己修正ワールドモデルを提案し、状態ドリフトを検出・修正してナビゲーションの堅牢性を向上させた。
原題: SC$^{2}$-WM: A Self-Correcting World Model with Closed-Loop Feedback for Vision-and-Language Navigation in Continuous Environments / Xuan Yao, Yuze Zhu, Junyu Gao 他
日本語で読む → - 論文VLAロボティクス
高速かつ正確:環境認識型モデル選択による適応的VLA推論フレームワーク
大規模な熟考システムと軽量な反応システムを環境に応じて切り替える適応的VLA推論フレームワークを提案し、タスク成功率と推論速度のバランスを実現した。
原題: Fast and Accurate: An Adaptive VLA Inference Framework through Environment-aware Model Selection / Yuewei Sun, Lang Qin, Zechuan Tian 他
日本語で読む → - 論文VLA画像認識
DreamX-Phi 1.0: ロボット操作のための行動条件付きビデオワールドモデル
観測フレームと言語指示、行動系列から将来の観測を予測するビデオワールドモデルを提案。アームの軌道忠実性と物体一貫性を保つため、幾何エンコーディングと深度・マスク情報を活用し、蒸留で高速化した。
原題: DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation / DreamX Team, Rui Chen, Xiangxiang Chu 他
日本語で読む → - 論文VLA/RLポストトレーニングロボティクス
TEMPO: 視覚-言語-行動モデルのための意味-行動分離型RLポストトレーニング
VLAモデルのRLポストトレーニングにおいて、視覚-言語バックボーンを凍結し、意味投影層と行動エキスパートを異なる頻度で更新する二段階学習を提案。CALVINベンチマークと実機タスクで既存手法を上回る性能を達成した。
原題: TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models / Ziheng Liu, Quantao Yang
日本語で読む → - 論文VLAロボティクス
パノラマ認識型VLAによる全身遠隔操作を用いた移動操作の学習
全身遠隔操作システムとパノラマ認識型VLAポリシーを開発し、移動操作タスクの成功率を大幅に向上させた。
原題: Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation / Donglin Yang, Haoran Chen, Xingyu Chen 他
日本語で読む → - 論文自動運転/VLAロボティクス
FIRE-VLA: 自動運転における視覚言語行動モデルの失敗情報に基づく自己進化
自動運転のVLAモデルに対し、失敗した軌道サンプルを教師信号として活用する自己進化フレームワークを提案し、計画精度と失敗率を改善した。
原題: FIRE-VLA: Failure-Informed Self-Evolution for Vision-Language-Action Models in Autonomous Driving / Hao Dou
日本語で読む → - 論文VLAロボティクス
LiLa-WAM: ロボット操作のための軽量潜在推論ワールドアクションモデル
将来の状態をコンパクトな潜在空間で推論する軽量なワールドアクションモデルを提案し、単一GPUで学習可能にした。視覚遷移トークンという言語不要のタスク表現も導入し、シミュレーションと実機で高い成功率を達成した。
原題: LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation / Fan Yang, Yuting Su, Xiaobo Wang 他
日本語で読む → - 論文VLAロボティクス
Flex-π: 計算柔軟性を備えたマルチストリーム世界行動モデル
既存の世界行動モデルはRGBのみを予測するが、Flex-πは凍結したビデオ生成VAEが3D点群も符号化できることを発見し、3D幾何学とオブジェクト中心のセマンティクスを追加で学習。ストリームごとのドロップアウトにより、単一のチェックポイントで高速な行動のみから完全な共同生成まで柔軟に動作し、実世界の両腕操作タスクで高い性能を達成。
原題: Flex-$\pi$: A Multi-Stream World-Action Model with Compute Flexibility / Ge Yan, Jinghao Liu, Yuzhi Fan 他
日本語で読む → - 論文VLA/失敗検出ロボティクス
GUARD: 拡散型VLAのための不確実性とアブレーションに基づくリスク検出
拡散型視覚言語行動ポリシーが視覚・言語の証拠に弱く基づく予測を行う際の失敗を、テスト時に検出する手法GUARDを提案。事前学習済みポリシーを変更せず、KVキャッシュのアブレーションとデノイジング応答の比較から診断ストリームを導出し、軽量な時間分類器で失敗を検出する。
原題: GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs / Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta
日本語で読む → - 論文VLAロボティクス
StellaVLA: 汎用視覚言語行動モデルのための文脈内構造化デモンストレーション
StellaVLAは、テスト時に単一の構造化デモンストレーションを条件付けすることで、分布外の状況でも適応できる視覚言語行動モデルを提案する。
原題: StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models / Siyu Xu, Yunke Wang, Zijian Wang 他
日本語で読む → - 論文強化学習/VLAロボティクス
時間的GRPO:視覚言語行動強化学習における軌跡レベルの信用割当を超えて
軌跡全体に同じ報酬を割り当てる従来のGRPOの問題を解決するため、タスクを段階に分割し、同じ段階に到達した軌跡同士を比較して段階ごとの利点を計算する新しい手法を提案した。
原題: Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning / Yao Zhou, Hang Gao, Fengge Wu 他
日本語で読む → - 論文VLAAI
フローマッチング不確実性の幾何学:コスト不要の不確実性プロキシとフローベースVLA故障検出への応用
フローマッチング生成モデルの不確実性を速度場の幾何学的性質から捉え、追加コストなしで計算できる不確実性プロキシ(denoising acceleration)を提案し、オンライン故障検出に応用した。
原題: The Geometry of Flow-Matching Uncertainty: A Cost-free Uncertainty Proxy and Its Application in Flow-based VLA Failure Detection / Ziyang Rao, Yiren Zhao, Weiyu Guo 他
日本語で読む → - 論文VLA画像認識
EgoGenesis: オンライン固定投影メモリとAction-3D RoPEによる自己中心的世界行動モデリング
自己中心視点の操作ビデオを合成する世界行動シミュレータを提案し、生成データで実ロボットの汎化性能を向上させた。
原題: EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE / Zexuan Yan, Yuzhou Wu, Yue Ma 他
日本語で読む → - 論文VLA画像認識
FaithEyes: マルチエージェントによるプロセス画像検証を用いた忠実なツール使用に向けて
エージェント型視覚言語モデルがツールを不誠実に使う問題を解決するため、プロセス画像の有用性を自己判定するマルチエージェントフレームワークを提案した。
原題: FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification / Haoqing Wang, Xingrun Xing, Wei Xia 他
日本語で読む → - 論文VLAAI
SpatialCLI: 空間ツールで推論し、その後ツールなしで推論する学習
視覚言語モデルに空間ツールを使った推論を教え、徐々にその能力を内部化させる3段階フレームワークを提案。ベンチマークで大幅な性能向上を実証した。
原題: SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them / Yang Zhou, Zixuan Huang, Sunzhu Li 他
日本語で読む → - 論文VLAAI
CoTinyVLA: サブ10億パラメータの視覚言語行動モデルへの連鎖思考蒸留
0.9Bパラメータの小型VLAモデルを提案し、35B教師からの階層的CoT蒸留とパラフレーズ拡張により、LIBERO-Plusベンチマークで7Bモデルを上回るロバスト性を達成した。
原題: CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model / Minhyeok Lee, Chiyoung Kim, Chanhoe Gu 他
日本語で読む → - 論文VLA/推論高速化AI
動作認識型ベクトル量子化と重心再利用による効率的なVLA推論フレームワーク
VLAモデルの推論を高速化するため、ロボットの動作状態に応じて量子化精度を動的に調整し、コードブックの重心を再利用するGEMM計算を導入したアルゴリズム・ハードウェア協調設計を提案。
原題: A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference / Zhuoran Song, Haozhe Jiang, Chunyu Qi 他
日本語で読む →