論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/制御ロボティクス
機構的解釈可能性と最適制御によるワールドアクションモデルの堅牢性向上
機構的解釈可能性を用いてワールドアクションモデルの堅牢性を解析し、対比的活性化方向による学習不要のステアリングと、モデルベース最適制御によるフィードバック制御を提案して堅牢性を向上させた。
原題: Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control / Jihoon Hong, Julian Skifstad, Qiyue Dai 他
日本語で読む → - 論文VLAロボティクス
汎用ロボット制御のためのネイティブなビデオ・アクション事前学習
ロボット制御に特化したビデオ・アクション基盤モデルLingBot-VA 2.0を提案。意味的視覚・行動トークナイザ、因果事前学習、スパースMoE、非同期推論により、複雑な操作タスクでの数ショット汎化を実現した。
原題: Native Video-Action Pretraining for Generalizable Robot Control / Qihang Zhang, Lin Li, Luyao Zhang 他
日本語で読む → - 論文VLAロボティクス
言葉は長く語る:言語によるロボットポリシー合成のガイド
この論文では、ロボットのポリシー獲得を対話的なプログラム合成タスクとして扱うフレームワーク「ARCHITECT」を提案し、人間の自然言語による修正をコードに反映し、再利用可能なスキルライブラリを構築することで、長期的なタスクでの性能向上と人間の介入削減を実現しています。
原題: A Few Words Go a Long Way: Language Guided Robot Policy Synthesis / Daphne Chen, Archit Ritesh Jain, Eric Goossen 他
日本語で読む → - 論文VLAロボティクス
解析的概念による明示的運動学的ガイダンスを用いた視覚言語行動モデル
VLAモデルに3D構造情報を組み込むため、物体を明示的なプログラム的設計図として表現する解析的概念を構築し、密な報酬と空間的ガイダンスで微調整を支援する手法を提案した。
原題: Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models / Mingyang Sun, Jiude Wei, Xiujian Liang 他
日本語で読む → - 論文VLAロボティクス
FibVLA: フィボナッチサンプリングによる効率的な時間的視覚言語行動モデル
長文脈の履歴を効率的に捉えるため、フィボナッチサンプリングを用いた時間的VLAモデルを提案し、行動の滑らかさと成功率を向上させた。
原題: FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling / Li Lin, Wujun Xu, Weiwei Meng 他
日本語で読む → - 論文VLAロボティクス
VLAモデルのテスト時モダリティ適応のための因果性を考慮した推論-診断-精緻化フレームワーク
視覚と言語と行動を統合するVLAモデルにおいて、テスト時に視覚情報の重要度を因果効果として推定し、行動予測を動的に調整するフレームワークを提案した。
原題: A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models / Haoyu Zhang, Yuwei Wu, Jin Chen 他
日本語で読む → - 論文VLAロボティクス
予測的で整合性のあるスケーラブルなロボット学習に向けて
潜在世界モデルと行動生成を統合したLumo-2を提案し、潜在空間での予測的推論とモダリティ整合により、ロボット学習の性能と汎化を向上させる。
原題: Towards Predictive, Aligned, and Scalable Robot Learning / Peijun Tang, Shangjin Xie, Baifu Huang 他
日本語で読む → - 論文VLA/操作ロボティクス
SAM3Dガイドによる物体中心表現アライメントを用いた視覚言語行動モデル
VLAモデルにSAM3Dを教師として物体中心の3D表現を学習させ、推論時はRGBのみで高精度な操作を実現する手法を提案。
原題: SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models / Zonghe Liu, Shanyuan Jie, Xiaoquan Sun 他
日本語で読む → - 論文VLA画像認識
大規模視覚言語モデルを用いたトークンベースのアフォーダンス接地
大規模視覚言語モデルの出力トークンの注意マップを活用し、外部教師なしで行動関連領域を特定するゼロショットのアフォーダンス接地フレームワークを提案した。
原題: Token-Based Affordance Grounding with Large Vision-Language Models / Seung Il Lee, Qinqian Lei, Daguang Xu 他
日本語で読む → - 論文自動運転/VLAロボティクス
S-squared-VLA: 自動運転のための視覚言語行動モデルにおける意味ストリームと空間ストリームの分離
自動運転向けの視覚言語行動モデルにおいて、意味情報と空間情報のストリームを分離し、空間表現の崩壊を防ぐことで、高精度な制御を実現する新しいアーキテクチャを提案した。
原題: S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving / Jianguo Yu, Rukang Wang, Duanfeng Chu 他
日本語で読む → - 論文VLAロボティクス
GigaWorld-Policy-0.5: AutoResearchによる高速・高精度なWAMの実現
将来の視覚予測を訓練時のみに用い、推論時は行動生成のみで高速化した行動中心のWorld Action Modelを提案し、AutoResearchで最適設定を探索して性能を向上させた。
原題: GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch / GigaWorld Team, Angen Ye, Angyuan Ma 他
日本語で読む → - 論文VLA/エッジ推論ロボティクス
Jetson-PI: 先読み整合非同期推論による搭載リアルタイムロボット制御の実現
低消費電力の搭載デバイス上でVLAモデルを高速に動作させるため、非同期推論の課題を解決する先読み整合補正と信頼度ベースのスケジューリングを提案した論文。
原題: Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference / Zebin Yang, Qi Wang, Yunhe Wang 他
日本語で読む → - 論文VLAロボティクス
Bridge-WA: ロボット行動のための世界の変化箇所と変化方法の予測
ロボット操作のための軽量な世界行動モデルを提案し、将来の変化を教師モデルから蒸留した3つの事前知識で行動生成を条件付け、外乱に強い汎化を実現した。
原題: Bridge-WA: Predicting Where and How the World Changes for Robotic Action / Yongjie Bai, Hanting Wang, Mingtong Dai 他
日本語で読む → - 論文VLA機械学習
WorldDiT: 世界モデルと行動生成を統合する拡散アーキテクチャ
大規模な事前学習済みVLMを使わずに、単一の拡散トランスフォーマーが行動生成と未来フレームの視覚予測を同時に行うロボットポリシーを提案し、LIBEROベンチマークでパラメータ数と成功率のトレードオフが良好であることを示した。
原題: WorldDiT: A Unified Diffusion Architecture for World and Action Modeling / Sen Wang, R. Gnana Praveen, Bidhan Roy 他
日本語で読む → - 論文VLAロボティクス
CAC-VLA: 視覚言語行動モデルのための文脈ゲート型行動条件付け
VLAモデル内に軽量な潜在行動インターフェースを導入し、文脈ゲートで行動エキスパートへの影響を調整することで、ロボット操作の成功率を向上させた。
原題: CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models / Yifu Xiong, Wenhao Yu, Jiaxuan Lin 他
日本語で読む → - 論文VLAロボティクス
Enfold: 世界モデルの想像力を予測表現に折り畳み、超効率的な身体制御を実現
生成モデルが未来を構築する過程で得られる中間計算を、現在の視覚と言語指示のみから予測される表現に転移させる手法を提案。推論時に生成器を実行せずに行動予測が可能となり、遅延を大幅削減。
原題: Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control / Weili Zeng, Yitong Xing, Fulong Liu 他
日本語で読む → - 論文VLAロボティクス
FlowWAM: オプティカルフローを世界行動モデルの統一アクション表現として用いる
事前学習済みビデオ生成モデルを活用する世界行動モデル(WAM)において、アクション表現としてオプティカルフローを用いることで、制御精度と世界モデリング性能を向上させる手法を提案した。
原題: FlowWAM: Optical Flow as a Unified Action Representation for World Action Models / Yixiang Chen, Peiyan Li, Yuan Xu 他
日本語で読む → - 論文VLAロボティクス
ロボット操作のための視覚言語行動モデルにおける二重潜在記憶
視覚言語行動モデルに、過去の経験を潜在記憶トークンとして統合するフレームワークを導入し、長期依存タスクの性能を向上させた。
原題: Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation / Hongyu Qu, Jianzhe Gao, Xiaobin Hu 他
日本語で読む → - 論文VLAロボティクス
WAM-TTT: テスト時に人間のプレイを見てワールドアクションモデルを操縦する
人間の動画を模倣するのではなく、自己教師あり動画予測で凍結したワールドアクションモデルに軽量な適応メモリとして吸収し、テスト時に未ラベルの人間動画だけでロボットの行動を操縦するフレームワークを提案した。
原題: WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time / Yusen Feng, Bingchen Han, Jiangran Lyu 他
日本語で読む → - 論文VLAロボティクス
CoRE-VLA:条件付きエキスパートルーティングによるスケーラブルで堅牢な視覚言語行動モデリング
センサ欠落や多様な構成に頑健なVLAモデルを提案し、センサ可用性とタスク意図に基づく条件付きスパース計算でエキスパートをルーティングする。
原題: CoRE-VLA: Towards Scalable and Robust Vision-Language-Action Modeling via Conditional Routing of Experts / Haozhe Zhang, Sixian Li, Yifei Zhang 他
日本語で読む → - 論文VLA画像認識
Traj-VLN: 自己回帰軌道生成によるピクセル空間でのインタラクション学習
連続環境における視覚言語ナビゲーション(VLN-CE)において、大規模言語モデルを微調整し、言語指示と過去の観測から2Dピクセル座標の軌道を自己回帰的に生成することで、深度情報を使わずにナビゲーション行動を学習する手法を提案した。
原題: Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation / Changfei Fu, Guangcheng Chen, Aoxiang Gu 他
日本語で読む → - 論文VLAロボティクス
領域到達からインスタンスレベルの接地へ:視覚と言語によるナビゲーションの改善
VLNエージェントの最終位置の精度と対象物の可視性を評価する指標を導入し、最終段階のナビゲーションを改善するモジュールREALMを提案した。
原題: From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation / Xiangyu Shi, Ruoxi Yang, Wei Tao 他
日本語で読む → - 論文VLAロボティクス
再帰補正・周波数一貫性・対比的フローマッチングによる高忠実度ワンステップ生成型視覚運動ポリシー
拡散モデルやフローマッチングによる生成型ロボットポリシーの多段サンプリングによる推論遅延を解消するため、再帰補正、周波数一貫性、対比的フローマッチングを組み合わせた高忠実度のワンステップ生成フレームワークを提案した。
原題: High-Fidelity One-Step Generative Visuomotor Policy via Recursive Correction, Frequency Consistency, and Contrastive Flow Matching / Yuran Chen, Xinye Cai, Zhonglin Gong 他
日本語で読む → - 論文VLA/オフラインRLロボティクス
RedFlow: 失敗をアクションレベルの修正へと変換するフローマッチングVLAポリシー
フローマッチングVLAポリシー向けに、失敗データをアクションレベルの修正信号に変換するオフライン強化学習フレームワークRedFlowを提案。実世界成功率を56.7%から74.7%に向上させた。
原題: RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy / Zhengyang Yan, Junhao Li, Fangqi Zhu 他
日本語で読む → - 論文VLA/力覚/接触操作ロボティクス
力の注入に遅すぎることはない:反応的力注入によるVLAポストトレーニングの加速
事前学習済みの視覚言語行動(VLA)ポリシーに、接触反応性を追加するフレームワークLIFTを提案。力覚メモリとゼロ初期化クロスアテンションで反応的アクション専門家を移植し、オンラインDAggerループで分布シフトに対処。タオル折り、本挿入、ハノイの輪配置で性能向上を実証。
原題: Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection / Yi Wang, Wendi Chen, Zimo Wen 他
日本語で読む → - 論文VLAロボティクス
RL^2-VLA: テスト時スケーリングによる適応的RL潜在構成ステアリングと視覚言語行動モデル
視覚言語行動モデルの性能低下を改善するため、オフラインRLで学習した軽量ポリシーをVLAの潜在表現に基づいて構成し、失敗が予測される時のみ介入する適応的推論時ステアリング手法を提案した。
原題: RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models / Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer 他
日本語で読む → - 論文VLA/世界モデルロボティクス
DREAMSTEER: 潜在世界モデルによるVLAポリシーの展開時誘導(微調整不要)
事前学習済みの視覚言語行動(VLA)ポリシーを、微調整なしで展開時に潜在世界モデルと価値モデルを用いて誘導し、分布シフト下での成功率と指示追従精度を大幅に向上させるフレームワークを提案した。
原題: DREAMSTEER: Latent World Models Can Steer VLA Policies During Deployment Without Any Finetuning / Hanchen Cui, Sergio Arnaud, Arjun Majumdar 他
日本語で読む → - 論文VLA/不確実性/操作ロボティクス
FabriVLA: 軽量視覚言語行動モデルと共形アクションチャンク不確実性
軽量なVLAモデルFabriVLAを提案し、Meta-World MT50で90%の成功率を達成。さらに、共形予測を用いてアクションの不確実性を定量化するJCAC法を導入し、実行前のリスク評価を可能にした。
原題: FabriVLA: A Lightweight Vision-Language-Action Model with Conformal Action Chunk Uncertainty / Shiyuan Yang, Borong Zhang, Jizheng Zhang 他
日本語で読む → - 論文VLA/レビューロボティクス
視覚言語行動(VLA)モデルによる無人航空ロボティクスと双腕マニピュレーションのレビュー
視覚と言語と行動を統合したVLAモデルについて、双腕マニピュレーションと無人航空機への応用を7つの観点からレビューし、両分野間の技術移転可能性と14の研究課題を提示した論文。
原題: Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review / Inkyu Sa, Chanoh Park, Hea-Min Lee 他
日本語で読む → - 論文VLAロボティクス
HiMe: 長期的視覚言語行動制御のための階層的具現化メモリ
長期的なタスクで苦戦するVLAモデルに対し、実行・作業記憶・計画を分離した階層メモリフレームワークを提案し、成功率を向上させた。
原題: HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control / Li Ji, Siyin Wang, Pengfang Qian 他
日本語で読む →