論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
HALO: 身体性マルチモーダル連鎖推論のための統合視覚-言語-行動モデル
テキスト推論・視覚的サブゴール予測・行動予測を統合したEM-CoT推論を可能にするVLAモデルHALOを提案し、シミュレーションと実環境でベースラインを上回る性能を示した。
原題: HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning / Quanxin Shou, Fangqi Zhu, Shawn Chen 他
日本語で読む → - 論文VLAロボティクス
頑健なスキル、脆い接地:マルチオブジェクトピッキングによる視覚言語行動ポリシーの限定的汎化の診断
VLAポリシーが物体と言語の対応を本当に学習しているのかを調べるため、物体配置のばらつきを段階的に増やすマルチオブジェクトピッキング実験を行い、操作スキルと指示追従が分離していることを示した。
原題: Robust Skills, Brittle Grounding: Diagnosing Restricted Generalization in Vision-Language Action Policies via Multi-Object Picking / David Emukpere, Romain Deffayet, Jean-Michel Renders
日本語で読む → - 論文VLAAI
IntentCUA: コンピュータ操作エージェントのための意図レベル表現によるスキル抽象化とマルチエージェント計画
コンピュータ操作エージェント向けに、意図レベルの表現でスキルを抽象化し共有メモリ上で複数エージェントが協調するフレームワークを提案し、長期的タスクの成功率と効率を改善した。
原題: IntentCUA: Learning Intent-level Representations for Skill Abstraction and Multi-Agent Planning in Computer-Use Agents / Seoyoung Lee, Seobin Yoon, Seongbeen Lee 他
日本語で読む → - 論文VLAロボティクス
EdgeNav-QE: エッジデバイス上のLAMナビゲーションのためのQLoRA量子化と動的早期終了
大規模行動モデルを4bit量子化と動的早期終了で軽量化し、エッジ上でのリアルタイム自律ナビゲーションを実現するフレームワークを提案。
原題: EdgeNav-QE: QLoRA Quantization and Dynamic Early Exit for LAM-based Navigation on Edge Devices / Mengyun Liu, Shanshan Huang, Jianan Jiang
日本語で読む → - 論文VLAロボティクス
FUTURE-VLA: 実時間実行下での統合軌道予測
長時間の映像履歴を効率的に圧縮し、潜在空間での自己回帰により将来の視覚予測と行動生成を単一のフォワードパスで行うVLAアーキテクチャを提案。予測に基づく人間参加型の実行ゲーティングも実現した。
原題: FUTURE-VLA: Forecasting Unified Trajectories Under Real-time Execution / Jingjing Fan, Yushan Liu, Shoujie Li 他
日本語で読む → - 論文VLAロボティクス
実世界の屋内ツアー動画から得たマルチモーダルイベント知識による視覚言語ナビゲーションの強化
実世界の屋内動画からマルチモーダル時空間知識グラフを構築し、粗い指示や長期的推論を要する視覚言語ナビゲーションにイベント知識を統合する手法を提案した論文。
原題: Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos / Haoxuan Xu, Tianfu Li, Wenbo Chen 他
日本語で読む → - 論文VLAロボティクス
リー群上の分散協調マルチロボット視覚慣性測距オドメトリ
複数ロボットのVIOとUWB測距をリー群上の右不変誤差定式化で密に融合し、アンカー位置を状態に含めて自己校正しながら分散協調で高精度・高ロバストな自己位置推定を実現するフレームワークを提案。
原題: Distributed and Consistent Multi-Robot Visual-Inertial-Ranging Odometry on Lie Groups / Ziwei Kang, Yizhi Zhou
日本語で読む → - 論文VLAロボティクス
Vision-Language-Actionロボットのメタモルフィックテスト
VLAモデルを搭載したロボットのテストオラクル問題を緩和するため、メタモルフィック関係を提案し、入力変更が軌道に与える影響を評価する手法を検証した。
原題: Metamorphic Testing of Vision-Language Action-Enabled Robots / Pablo Valle, Sergio Segura, Shaukat Ali 他
日本語で読む → - 論文VLAcs.SE
自律型水中ロボットソフトウェアの知覚における視覚言語モデルの評価
自律型水中ロボットの知覚モジュールに視覚言語モデルを適用し、水中ゴミ検出における性能と不確実性を評価した。
原題: Assessing Vision-Language Models for Perception in Autonomous Underwater Robotic Software / Muhammad Yousaf, Aitor Arrieta, Shaukat Ali 他
日本語で読む → - 論文VLA機械学習
視覚言語モデルが実現するタスク中心の潜在行動
視覚言語モデルの常識推論を活用し、動画中のタスクに関連する動きとノイズを分離することで、潜在行動モデルの学習を改善する手法を提案。
原題: Vision-Language Models Unlock Task-Centric Latent Actions / Alexander Nikulin, Ilya Zisman, Albina Klepach 他
日本語で読む → - 論文VLA自然言語
知識経験学習によるエージェント的世界モデルの整合
LLMエージェントが物理世界の法則を尊重した計画を立てられるよう、環境フィードバックから記号的な世界知識リポジトリを自律構築するWorldMindを提案。
原題: Aligning Agentic World Models via Knowledgeable Experience Learning / Baochang Ren, Yunzhi Yao, Rui Sun 他
日本語で読む → - 論文VLAAI
現在のエージェントは世界モデルを先見のツールとして活用できていない
視覚言語モデルベースのエージェントが生成的世界モデルを外部シミュレータとして使えるかを検証し、シミュレーションの起動判断や予測結果の解釈・統合がボトルネックで性能が向上しないことを示した実証研究。
原題: Current Agents Fail to Leverage World Model as Tool for Foresight / Cheng Qian, Emre Can Acikgoz, Bingxuan Li 他
日本語で読む → - 論文VLAセキュリティcs.CR
状態バックドア:視覚言語行動モデルに対するステルスな実世界ポイズニング攻撃
ロボットアームの初期状態をトリガーとして悪用し、VLAモデルに標的の誤動作を引き起こすバックドア攻撃を提案。遺伝的アルゴリズムで最適なトリガーを探索し、実世界タスクで90%以上の攻撃成功率を達成した。
原題: State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State Space / Ji Guo, Wenbo Jiang, Yansong Lin 他
日本語で読む → - 論文VLAロボティクス
TwinBrainVLA: 非対称Mixture-of-Transformersによる汎用VLMの身体化タスクへの活用
凍結した汎用VLM(左脳)と学習可能な専門家(右脳)を非対称Mixture-of-Transformersで統合し、汎用知識を保ちながら操作タスクを高精度に実行するVLAモデルを提案。
原題: TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers / Bin Yu, Shijie Lian, Xiaopeng Lin 他
日本語で読む → - 論文VLAロボティクス
AIR-VLA: 空中マニピュレーションのための視覚-言語-行動システム
空中マニピュレーションに特化した初のVLAベンチマークを構築し、物理シミュレーション環境と3000件の遠隔操作デモデータセットを公開して、既存VLAモデルの性能と限界を評価した。
原題: AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation / Jianli Sun, Bin Tian, Qiyao Zhang 他
日本語で読む → - 論文VLAAI
Cosmos Policy: 視覚運動制御と計画のための動画モデル微調整
大規模事前学習済み動画モデルを、アーキテクチャ変更なしの一段階の追加学習だけでロボット方策に変換し、行動・将来画像・価値を潜在フレームとして生成して計画も可能にした手法。
原題: Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning / Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin 他
日本語で読む → - 論文VLAAI
MemCtrl: MLLMを活用した身体性エージェントの能動的メモリ制御
MLLMに学習可能なメモリヘッドを追加し、探索中の観察や内省をオンラインで取捨選択することで、身体性タスクの達成率を平均約16%向上させた。
原題: MemCtrl: Using MLLMs as Active Memory Controllers on Embodied Agents / Vishnu Sashank Dorbala, Dinesh Manocha
日本語で読む → - 論文VLAロボティクス
InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
原題: InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation / Junhao Cai, Zetao Cai, Jiafei Cao 他
日本語で読む → - 論文VLAロボティクス
CARE: ロボット制御のための連続潜在行動表現のマルチタスク事前学習
行動ラベルなしで動画とテキストのペアのみから連続的な潜在行動表現を学習し、少数のラベル付きデータで微調整することでロボット制御を実現するフレームワークを提案。
原題: CARE: Multi-Task Pretraining for Latent Continuous Action Representation in Robot Control / Jiaqi Shi, Xulong Zhang, Xiaoyang Qu 他
日本語で読む → - 論文VLA画像認識
Fast-ThinkAct: 言語化可能な潜在プランニングによる効率的な視覚-言語-行動推論
推論トレースを潜在的な思考連鎖に蒸留し、推論VLAの推論遅延を最大89.3%削減しつつ長期的プランニングや適応性能を維持する手法を提案。
原題: Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning / Chi-Pin Huang, Yunze Man, Zhiding Yu 他
日本語で読む → - 論文VLA機械学習
収縮拡散ポリシー:微分方程式に基づく収縮スコアサンプリングによる堅牢な行動拡散
拡散ポリシーのサンプリング過程に収縮性を導入し、ソルバーやスコアマッチングの誤差に頑健で、データ不足時にも強いオフライン学習手法を提案した。
原題: Contractive Diffusion Policies: Robust Action Diffusion via Contractive Score-Based Sampling with Differential Equations / Amin Abyaneh, Charlotte Morissette, Mohamad H. Danesh 他
日本語で読む → - 論文VLAAI
LangForce: 潜在行動クエリによる視覚言語行動モデルのベイズ分解
視覚言語行動モデルが言語指示を無視して視覚のみに依存する「情報崩壊」問題を、ベイズ分解と潜在行動クエリで解決し、未知環境での汎化性能を向上させた研究。
原題: LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries / Shijie Lian, Bin Yu, Xiaopeng Lin 他
日本語で読む → - 論文VLA評価ベンチマークロボティクス
グレートマーチ100:身体性AIエージェント評価のための100の詳細指向タスク
ロボット学習の評価に向けて、多様な相互作用とロングテール行動を網羅する100の詳細設計タスク「GM-100」を提案し、複数のVLAモデルの性能差を明確に評価できることを示した。
原題: The Great March 100: 100 Detail-oriented Tasks for Evaluating Embodied AI Agents / Ziyu Wang, Chenyuan Liu, Yushun Xiang 他
日本語で読む → - 論文VLAロボティクス
ACoT-VLA: 視覚言語行動モデルのための行動連鎖推論
行動空間で直接推論する「行動連鎖推論(ACoT)」を提案し、粗い行動意図を明示的・暗黙的に生成して最終方策を導くVLAアーキテクチャを実現した。
原題: ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models / Linqing Zhong, Yi Liu, Yifei Wei 他
日本語で読む → - 論文VLAAI
Drive-P2D: 自動運転向けVLMのための段階的知覚から意思決定へのベンチマーク
自動運転における視覚言語モデル(VLM)を、物体・シーン・意思決定の3段階で評価する6,650問のベンチマークを提案し、推論と回答を分離して採点・誤り分析を行う。
原題: Drive-P2D: A Progressive Perception-to-Decision Benchmark for VLMs in Autonomous Driving / Zecong Tang, Zixu Wang, Yifei Wang 他
日本語で読む → - 論文VLAロボティクス
ReViP: 視覚-固有感覚の再バランスによる視覚-言語-行動モデルの偽完了の緩和
VLAモデルが固有感覚に過度に依存して生じる「偽完了」問題を分析し、進捗を考慮した視覚的手がかりで視覚と言語の接地を強化する新フレームワークReViPを提案した。
原題: ReViP: Mitigating False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance / Zhuohao Li, Yinghao Li, Jian-Jian Jiang 他
日本語で読む → - 論文VLAロボティクス
CLARE: 自律的アダプタルーティングと拡張による視覚-言語-行動モデルの継続学習
VLAモデルに軽量アダプタを追加し、層ごとの特徴類似度に基づいて必要な箇所だけを自律的に拡張することで、過去データやタスクIDなしに破滅的忘却を防ぎながら新タスクを継続学習するフレームワークを提案。
原題: CLARE: Continual Learning for Vision-Language-Action Models via Autonomous Adapter Routing and Expansion / Ralf Römer, Yi Zhang, Yuming Li 他
日本語で読む → - 論文VLAロボティクス
デモンストレーション不要のLLMエージェントによるロボット制御
ソフトウェア開発用のLLMエージェントフレームワークをそのままロボット操作に適用し、デモやファインチューニングなしでLIBEROなどで高い成功率を達成した。
原題: Demonstration-Free Robotic Control via LLM Agents / Brian Y. Tsui, Alan Y. Fang, Tiffany J. Hwu
日本語で読む → - 論文VLAロボティクス
視覚プロンプトを用いた視覚-言語-行動モデルによるオフロード自動運転
オフロード自動運転向けに、セマンティックセグメンテーションを視覚プロンプトとして使い自己整合性付き思考連鎖で推論するVLAフレームワークOFF-EMMAを提案し、軌道計画精度を改善した。
原題: A Vision-Language-Action Model with Visual Prompt for OFF-Road Autonomous Driving / Liangdong Zhang, Yiming Nie, Haoyang Li 他
日本語で読む → - 論文VLAロボティクス
AC^2-VLA: 行動文脈を考慮した適応的計算による効率的なロボットマニピュレーション
VLAモデルの推論における時間・空間・深さ方向の冗長性に着目し、行動文脈に基づいて計算を適応的に再利用・削減するフレームワークを提案。密なモデルと同等の成功率を保ちつつ最大1.79倍の高速化とFLOPs29.4%削減を実現した。
原題: AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation / Wenda Yu, Tianshi Wang, Fengling Li 他
日本語で読む →