論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/16 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
GigaBrain-0.7:三系統アーキテクチャによる創発的能力へのスケーリング
視覚言語行動モデルのスケーリングとアーキテクチャ改善により、多様なロボットへの汎化を大幅に向上させた基盤モデルを提案。
原題: GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture / GigaBrain Team, Angen Ye, Axiang Sun 他
日本語で読む → - 論文VLA/推論最適化ロボティクス
投機的推論と検証による効率的なVLA推論のためのアルゴリズム・アーキテクチャ協調設計
ロボット環境の能動/非能動状態に応じて投機的予測と選択的検証を切り替えることで、VLAモデルの推論効率と行動長を改善する協調設計フレームワークを提案した。
原題: Algorithm-Architecture Co-Design for Efficient VLA Inference via Speculative Inference and Verification / Chunyu Qi, Zhuoran Song, Jian Weng 他
日本語で読む → - 論文VLAロボティクス
ForceU-VLA: 力覚を考慮した身体化超音波スキャンのための視覚・言語・行動モデル
超音波スキャン中に力信号と超音波画像を融合し、スキャン段階に応じて適応的に特徴を調整する新しいVLAモデルを提案し、実世界の力覚対応データセットも構築した。
原題: ForceU-VLA: A Force-Aware Vision-Language-Action Model for Embodied Ultrasound Scanning / Xingzheng Wu, Cheng Zhang, Guihao Yan 他
日本語で読む → - 論文VLA/パラメータ効率的ファインチューニングロボティクス
PhaseLoRA: 制御フェーズ条件付き低ランク適応による連続動作VLAポリシー
連続動作の操作タスクにおいて、制御フェーズ(接近、接触、把持など)に応じて適応を変化させる軽量なLoRAパラメータ化を提案し、LIBEROベンチマークで成功率を大幅に向上させた。
原題: PhaseLoRA: Control-Regime-Conditioned Low-Rank Adaptation for Continuous-Action Vision-Language-Action Policies / Yufei Guo, Yinan Wu, Haoran Duan 他
日本語で読む → - 論文VLA/記憶ロボティクス
賢く記憶する:ロボット記憶のための視覚履歴圧縮と双曲経験空間
長期的なロボットポリシーのために、視覚履歴を圧縮し、経験を双曲空間で階層的に保存・活用するプラグインモジュールを提案。pi0に適用し、LIBERO-Plusで成功率を向上させた。
原題: Remember Smarter: Visual History Compressor and Hyperbolic Experience Space for Robotic Memory / Dai Zhou, Jiexi Yan, Tong Li 他
日本語で読む → - 論文VLA/強化学習ロボティクス
StructRL: フローベースVLAのための構造化アクション空間探索
フローベースの視覚言語行動モデル(VLA)のオンライン強化学習において、ノイズをアクション空間に直接注入する構造化探索手法StructRLを提案し、シミュレーションと実世界タスクで性能を向上させた。
原題: StructRL: Structured Action-Space Exploration for Flow-Based VLAs / Jiarui Yang, Bin Zhu, Jingjing Chen 他
日本語で読む → - 論文VLAロボティクス
VTInstructor: 連続環境におけるナビゲーション指示生成のための視覚的軌跡プロンプティング
連続環境でのRGB映像からナビゲーション指示を生成する初のフレームワークを提案し、軌跡の幾何学を視覚的プロンプトに変換して指示生成の精度を大幅に向上させた。
原題: VTInstructor: Visual Trajectory Prompting for Navigation Instruction Generation in Continuous Environments / Haolin Yang, Yuxing Long, Zihan Yang 他
日本語で読む → - 論文VLA/ベンチマーク画像認識
NumerosityVLM: 視覚言語モデルにおける数量表現の解釈のための認知に着想を得たベンチマーク
視覚言語モデルの数量知覚能力を評価するため、物体の大きさや配置などの視覚的要因を独立に操作した合成画像ベンチマークを構築し、モデル性能の要因分析と層別プロービングを行った。
原題: NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models / Yiming Fu, Fangjun Li, Xiujin Liu 他
日本語で読む → - 論文VLA画像認識
AWM-VLA: 効率的で説明可能な視覚-言語-行動ポリシーのための整合された世界モデリング
拡散トランスフォーマーポリシー内に未来の視覚-言語埋め込みと整合する未来トークンを組み込み、物体中心の予測も加えることで、長期的な結果を先読みしつつ説明可能なロボット操作を実現した。
原題: AWM-VLA: AlignedWorld Modeling for Efficient and Explainable Vision-Language-Action Policies / An Lanji, Dawei Liu, Jin Li 他
日本語で読む → - 論文VLAロボティクス
SkillComposer: 自然言語によるロボットプログラミングのための再利用可能なスキル学習
自然言語でロボットに複雑なタスクを指示する際、LLMが多段階の指示を分解したり過去の解決策を再利用したりするのが難しい問題に対し、生成とテストを繰り返すアーキテクチャと、成功したプログラムから再利用可能なマクロスキルを自動学習する手法を提案した。
原題: SkillComposer: Learning Reusable Skills for Natural-Language Robot Programming / John Woods, Hasti Seifi
日本語で読む → - 論文VLAロボティクス
反射:反応が重要な操作のための高速で予測的な視覚言語行動モデル
動的操作における反応速度を重視したベンチマークReflexBenchを新設し、低遅延で予測的なVLAモデルReflexVLAを提案した。
原題: Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation / Yuxuan Chen, Wanruo Zhang, Xiao Li
日本語で読む → - 論文VLA/ロボットマニピュレーションロボティクス
想像による回復:推論時カウンターファクチュアル再調整による視覚言語行動モデルの復旧
視覚言語行動モデルがオンラインの外乱(目標変更や物理的摂動)に直面した際、失敗データや再学習なしに、推論時に「もしも」の継続を想像してロボットと環境を最小限に再調整する訓練不要の回復フレームワークを提案した。
原題: Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models / Yanyan Zhang, Disheng Liu, Kai Ye 他
日本語で読む → - 論文VLA/ツール使用ロボティクス
視覚言語行動モデルをオンザフライツール使用エージェントへ進化させる
VLAモデルにツール注入フレームワークを統合し、低次視覚・高次アフォーダンス・身体性を強化するエージェントARTを提案。ツール使用により行動解空間を縮小し、汎用性向上とデータ依存低減を実現。
原題: Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use / Yi Ding, Yanzhao Yu, Xili Dai 他
日本語で読む → - 論文VLAロボティクス
BICPO-VLA: 行動識別による継続選好最適化を用いた滑らかな非同期視覚言語行動制御
ロボットの動作生成中に生じる要求から引き継ぎまでのギャップを、行動意図の識別、Haar部分空間による動作チャンク分解、参照相対Flow-DPOによる適応の3段階で解消する手法を提案した。
原題: BICPO-VLA: Behavior-Identified Continuation Preference Optimization for Smooth Asynchronous Vision-Language-Action Control / Ming Shang, Yuchen Huang, Jiaoyang Chen 他
日本語で読む → - 論文巧みな操作/VLA/身体間転移ロボティクス
AdvDex: 関節整合アクションと敵対的学習による人間のデモからの巧みな操作学習
人間とロボットのデモを統合したVLAフレームワークを提案し、関節整合アクション空間と敵対的学習により異なる身体間の汎化を実現した。
原題: AdvDex: Learning Dexterous Manipulation from Human Demonstrations via Joint-Aligned Actions and Adversarial Learning / Zhiyue Zhao, Jingyi Wu, Hairuo Liu 他
日本語で読む → - 論文VLA画像認識
社会的音声・視覚質問応答における推論:現状はどこにあるのか?
社会的音声・視覚理解のためのMLLMの推論手法を検証し、既存ベンチマークのノイズを除去したIntentBench-Primeを公開。単純なVanilla SFTが高コストな推論手法と同等以上の性能を示すことを発見した。
原題: Reasoning for Social Audio-Visual Question Answering: Where Do We Stand? / Koen P. de Vries, Xavier Alameda-Pineda, Estefanía Talavera 他
日本語で読む → - 論文VLAAI
見ずして先を見通す:ワールドアクションモデルのための潜在的未来
未来のビデオを生成せずに、潜在的な未来の状態をアクション生成に活用する新しいワールドアクションモデル「ForeWAM」を提案し、LIBEROベンチマークで高い成功率を達成した。
原題: Foresight Without Seeing: Latent Futures for World Action Models / Jiakai Huang, Zhongbo Wu, Zheng Zhang 他
日本語で読む → - 論文VLA/プランニングAI
HUGIN: 自律物流仕分けのための視覚言語プランニングの強化
自律物流仕分けシステムにおける複数カメラ視点を統合した計画問題を新たに定義し、視覚言語モデルの性能を高める訓練フレームワークHUGINを提案。データ拡張と文脈ランキングにより精度を大幅に向上させた。
原題: HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting / Xikai Sun, Cangtian Zhou, Kebin Liu 他
日本語で読む → - 論文VLA画像認識
視覚言語モデルの空間推論のための多視点関係蒸留
視覚言語モデルの空間推論能力を向上させるため、幾何学的に基盤づけられた視覚モデルから、特徴量そのものではなく視点間のパッチ類似度を蒸留する手法を提案した。
原題: Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models / Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim 他
日本語で読む → - 論文VLA/空間推論画像認識
空間思考の連鎖:視覚言語モデルのためのモダリティ非依存の空間接地
追加の推論時モジュールを必要とせず、連続的な空間トークンを導入して視覚言語モデルの空間推論能力を向上させる軽量フレームワークを提案した。
原題: Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models / Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian 他
日本語で読む → - 論文VLAロボティクス
Mambaベースの選択的状態空間モデリングがSmolVLA視覚言語行動エキスパートの精度-計算量トレードオフを改善
VLAモデルの精度と計算量のトレードオフを改善するため、SmolVLAの行動エキスパートにMambaの選択的状態空間モデリングを適用し、LIBEROベンチマークで長い実行ホライズンでの成功率向上を実証した。
原題: Mamba-based Selective State Space Modeling Improves the Accuracy-Complexity Tradeoff of SmolVLA Vision-Language-Action Experts / Farida Mohsen, Thowayba Elkaffash, Mohammad Reza Chalak Qazani 他
日本語で読む → - 論文VLA/空間理解画像認識
回復から低下へ:アクション事後学習がVLMの後層深度デコード可能性を減少させる仕組み
VLA構築のためのアクション事後学習が、VLMの空間理解(特に深度知覚)をどのように劣化させるかを、層ごとのプローブで分析した論文。後層のMLP干渉が主因であることを特定した。
原題: From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability / Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou
日本語で読む → - 論文VLAロボティクス
オンザフライVLN:空中ロボット向けオンボード視覚言語ナビゲーションスタック
視覚言語モデルによる指示の接地、深度による3D目標生成、Bスプライン計画、強化学習制御を分離したオンボードスタックを構築し、屋内飛行で目標到達を実証した。
原題: VLN on the Fly: An Onboard Vision-Language Navigation Stack for Aerial Robots / Marco S. Tayar, Felipe Tommaselli, Gianluca Capezutto 他
日本語で読む → - 論文VLAAI
Capek 0.5: 実行中心の視覚言語モデルによる具現化知能
ロボットの実行プロセスに着目し、空間推論・時間理解・行動誘導・状態検証の4つの能力を専門家モデルで学習し、統合する視覚言語モデルCapek 0.5を提案した。
原題: Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence / Ying Chen, Weizhen Li, Zhe Hu 他
日本語で読む → - 論文VLAロボティクス
StepTrigger:VLM搭載脚ロボットに対する接触状態トリガ型バックドア攻撃
脚ロボットの足裏圧力・接地パターンを隠しトリガとして学習させ、VLMプランナーの目標選択を密かに切り替えるバックドア攻撃を提案し、良性接触と悪性接触を選別する方策を評価した。
原題: StepTrigger: Contact-State-Triggered Backdoor Attacks on VLM-Powered Legged Robots / Jiageng Zhang, Doniyorkhon Obidov, Kaichen Yang
日本語で読む → - 論文VLA/ナビゲーションAI
WNM-3D: 3Dシーン条件付けによるクローズドループVLNのための世界ナビゲーションモデル
連続的な視覚言語ナビゲーション(VLN)のための生成的世界行動モデルを提案し、3Dシーン表現を条件として将来の視覚と行動を同時生成することで、クローズドループのナビゲーション性能を向上させた。
原題: WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN / Yuehao Huang, Yunzi Wu, Xiaotao Zhang 他
日本語で読む → - 論文VLA画像認識
CofactVLA: 反事実的介入による視覚・言語・行動モデルの交絡除去
視覚・言語・行動モデルが言語指示を無視して視覚的な交絡因子に過適合する問題を、反事実的介入を用いて軽減する新しい因果介入フレームワークを提案した。
原題: CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention / Yan Zhang, Yinan Wu, Haoran Duan 他
日本語で読む → - 論文VLA/エッジ推論cs.AR
Deltoris: ビットレベル疎性と投機的推論による具現化AIのリアルタイムVLA推論の実現
拡散ベースのVLAモデルのエッジでの高速推論を実現するため、時間的類似性を利用したビット疎性アルゴリズムと投機的推論、専用アクセラレータを設計した。
原題: Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference / Zheng Liu, Zeyu Guo, Zihan Liu 他
日本語で読む → - 論文VLA/攻撃画像認識
DRIFT: フローマッチングVLAのノイズ除去軌道を敵対的パッチ攻撃で脱線させる
フローマッチング型の視覚言語行動モデルに対する敵対的攻撃手法を提案し、ロボットのグリッパーに置いた小さなパッチでほぼ全てのタスクを失敗させられることを示した。
原題: DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack / Hoseong Tae, Jong-Seok Lee
日本語で読む → - 論文VLAロボティクス
接地された意味的再結合による視覚言語行動モデルの指示一般化の堅牢化
VLAモデルが言い換え指示で性能低下する原因を、アーキテクチャ上の問題として特定し、タスク意味と視覚特徴を明示的に融合する介入(GSR)を提案して、パラフレーズ不変性を大幅に改善した。
原題: Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models / Zhaokai Yin, Zhipeng Zhang
日本語で読む →