論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/30 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA画像認識
基盤モデル連携の再考:代理タスク推論による特化モデルの強化
基盤モデルと特化モデルの協調をタスク分解として捉え、特化モデルの予測候補を基盤モデルが選択・検証する代理タスクで改善するフレームワークFATを提案。2D/3D物体検出、軌道予測、セマンティックセグメンテーションで効果を実証。
原題: Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning / Hongyi Lin, Yang Liu, Jinhua Zhao 他
日本語で読む → - 論文VLA/安全性評価画像認識
EgoSafetyBench:具身VLMをランタイム安全監視役として評価する診断用エゴセントリック動画ベンチマーク
ロボット視点の動画で、安全監視VLMが本当の危険を見逃さず、見かけだけの異常に過剰介入しないかを診断するベンチマークを構築し、10種のVLMを評価した。
原題: EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards / Siddhant Panpatil, Arth Singh, Mijin Koo 他
日本語で読む → - 論文VLA/評価ベンチマークAI
SurgVLA-Bench: 腹腔鏡手術ロボットのための視覚言語行動モデル評価ベンチマーク
腹腔鏡手術ロボット向けのVLAモデルを評価する初の包括的ベンチマークを提案し、SurRoLシミュレーション上で階層的タスクと多次元評価フレームワークを構築した。
原題: SurgVLA-Bench: Towards Evaluating Vision-Language-Action Models for Laparoscopic Surgical Robotics / Jiashuo Sun, Yue He, Wenxuan Liu 他
日本語で読む → - 論文VLA/推論高速化画像認識
行動に足る速さで:低遅延ロボットVLM/VLAのための時空間ビジュアルトークン統合
ロボット向け視覚言語モデルや行動モデルの推論遅延を減らすため、視覚エンコード段階で冗長なトークンを時空間的に統合するプラグアンドプレイのフレームワークST-Mergeを提案した。
原題: Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs / Junzhou Chen, Jindong Wang, Gang Zhou
日本語で読む → - 論文VLAAI
iFLYTEK-Embodied-Omni技術報告
視覚・言語・行動を単一のOmniフレームワークで統合したマルチモーダル基盤モデルを提案し、脳と小脳の協調に例えられる設計で、指示理解から行動生成までを一貫して行う。
原題: iFLYTEK-Embodied-Omni Technical Report / Yuan Zhang, Jingfei Ni, Guanchen Lu 他
日本語で読む → - 論文VLA/セキュリティ機械学習
信頼された想像への攻撃:想像してから行動する世界モデルに対するオラクルレベルの整合性攻撃
想像してから行動するVLAポリシーにおいて、世界行動モデルが生成する未来の潜在軌道を攻撃対象とし、観測摂動による非標的破壊が容易であることを示し、パラメータフリーの検出器を提案した。
原題: Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models / Linghan Chen, Kaiyan Ji, Minyu Guo
日本語で読む → - 論文VLA画像認識
AIR: MLLMにおけるコードを用いた適応的インターリーブ推論
マルチモーダル大規模言語モデルに、コードを介した数値計算タスクの適応的推論能力を強化学習で付与する手法を提案。
原題: AIR: Adaptive Interleaved Reasoning with Code in MLLMs / Cong Han, Xiaohan Lan, Haibo Qiu 他
日本語で読む → - 論文VLA画像認識
PolicyTrim: 視覚言語行動モデルの本質的なポリシー効率を高める
VLAモデルの実行効率を、推論遅延ではなく行動チャンクの有効長と物理ステップ数に着目して改善する強化学習ベースの後訓練フレームワークを提案した。
原題: PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models / Xianghui Wang, Feng Chen, Wenbo Zhang 他
日本語で読む → - 論文VLA/行動理解画像認識
ゴールドポイントスナイパー:微細な行動理解のためのVLMにおける自己誘導型視覚推論
ロボットが広視野画像中の小さな人物の微細な行動を理解するため、軽量VLMに自己誘導型のマルチモーダル推論を組み込むフレームワークGPSを提案し、行動関連の重要点抽出、自己質問による検証、意味的含意評価で精度と事実整合性を向上させた。
原題: Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding / Haodi Liu, Xinhang Yang, Kunda Yan 他
日本語で読む → - 論文VLA画像認識
半教師あり視覚-言語-行動モデル
ロボットの行動予測に必要な教師付きデモデータを減らすため、未ラベルの軌道から信頼できる擬似行動を生成する自己蒸留型教師-学生フレームワークSemiVLAを提案した。
原題: Semi-Supervised Vision-Language-Action Model / Hongyang He, Jiuming Liu, Victor Sanchez
日本語で読む → - 論文VLA画像認識
Occ-VLM: 占有度に基づく屋内シーン理解のための視覚言語モデル
2D画像のみから3Dシーン占有度を幾何学的先行情報として再構成し、前景トークンを3D空間に対応付けてLLMで理解する、統一的な3D視覚言語モデルを提案した。
原題: Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding / Jianing Li, Zhou Fang, Yijiang Liu 他
日本語で読む → - 論文VLA画像認識
EventVLA: イベント駆動型視覚証拠メモリによる長期的視覚言語行動ポリシー
長期的なロボット操作タスクで、視覚情報が隠れたり見えなくなったりする問題に対処するため、重要な視覚イベントを予測して記憶する新しいフレームワークEventVLAを提案した。シミュレーションと実機タスクで既存手法より成功率が大幅に向上した。
原題: EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies / Ganlin Yang, Zhangzheng Tu, Yuqiang Yang 他
日本語で読む → - 論文VLA画像認識
FOCA: 未来指向型条件付けによるデータ効率的な視覚言語行動適応
視覚言語行動モデルの少数ショット模倣学習における性能低下を改善するため、未来の相互作用埋め込みと目標観察を活用した未来指向型条件付けフレームワークを提案した。
原題: FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation / Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen 他
日本語で読む → - 論文VLA評価機械学習
VLAは基本を知っているか?視覚言語行動モデルにおける常識・世界知識の保持を測る
VLAモデルがロボットデータで微調整後も常識や世界知識を保持しているかを、行動で回答する新しい評価プロトコルAct2Answerを導入して検証した。
原題: Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models / Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin 他
日本語で読む → - 論文VLAロボティクス
フローベースの視覚言語行動モデルにおける不確実性の定量化
フローマッチングを用いた視覚言語行動モデル(VLA)に対して、速度場の不一致に基づく効率的な不確実性推定手法を提案し、失敗検出と能動的ファインチューニングに応用した。
原題: Uncertainty Quantification for Flow-Based Vision-Language-Action Models / Ralf Römer, Maximilian Seeliger, Saida Liu 他
日本語で読む → - 論文VLA/操作画像認識
WeaveLA: 反復ロボット操作のためのイベント駆動型サブタスク間潜在記憶の織り込み
VLAポリシーに、サブタスク完了イベントで圧縮した潜在記憶を次のサブタスクの行動生成に渡す軽量なクロスサブタスク記憶チャネルを追加し、反復操作の成功率を向上させた。
原題: WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation / Shoujing Zhu, Zhenyang Liu, Fungmiu Wang 他
日本語で読む → - 論文VLA/基盤モデルロボティクス
Qwen-RobotManip技術報告:アライメントがロボット操作基盤モデルのスケールを解放する
ロボット操作のための視覚言語行動基盤モデルQwen-RobotManipを提案し、異種データを統一フレームワークで整列させることで大規模学習を可能にし、ゼロショット汎化やクロスエンボディ転移などの創発的能力を示した。
原題: Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models / Haoqi Yuan, Zhixuan Liang, Anzhe Chen 他
日本語で読む → - 論文VLA画像認識
GeneralVLA-2: 幾何認識再構成と管理されたメモリによるロボット計画
ロボットの軌道計画のための視覚言語行動モデルを改善し、3D再構成の精度向上と長期メモリの品質管理を実現した。
原題: GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning / Haoyu Wang, Guoqing Ma, Zeyu Zhang 他
日本語で読む → - 論文ヒューマノイド操作/VLA/強化学習ロボティクス
ROVE: 強化学習によるヒューマノイド操作のための人間介入の活用
不完全な人間介入データを用いてヒューマノイドVLAモデルを強化学習で訓練するフレームワークROVEを提案。楽観的価値推定とクロスエンボディ映像を活用し、高価値な行動を優先学習することで実世界の接触を伴う操作タスクで性能を向上させた。
原題: ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning / Wei Xiao, Weiliang Tang, Yuying Ge 他
日本語で読む → - 論文VLA画像認識
ロボット操作コマンド生成のためのオブジェクト中心映像理解の分離
映像デモからロボット操作コマンドを生成する際、動作認識と物体識別を分離し、タスク関連物体を特定する新しい手法を提案。TSMと物体選択アルゴリズムを統合し、精度と汎化性を向上させた。
原題: Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands / Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang 他
日本語で読む → - 論文VLA画像認識
セマンティックフリップ:身体化質問応答と空間定位における堅牢な拒否のための合成OOD生成
視覚言語モデルが回答不能なクエリに対して過信する問題を解決するため、クエリとビデオメモリを独立に変換してOODペアを合成し、軽量な拒否モジュールを訓練するフレームワークを提案した。
原題: Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization / Dongbin Na, Chanwoo Kim, Giyun Choi 他
日本語で読む → - 論文VLA/圧縮画像認識
視覚言語行動モデルのための学習型画像圧縮
VLAロボットの制御性能を保ちつつ帯域を節約するため、カメラ視点や空間領域ごとの重要度に応じてビットレートを適応配分する学習型画像圧縮フレームワークSPARCを提案した。
原題: Learned Image Compression for Vision-Language-Action Models / Hyeonjun Kim, Jegwang Ryu, Sangbeom Ha 他
日本語で読む → - 論文VLA/検索拡張ロボティクス
再学習せずに検索せよ:テスト時に視覚言語行動モデルを新タスクへ拡張する手法
新しいタスクへの適応を、モデルの再学習ではなく、デモンストレーションの検索で置き換える手法を提案。凍結したポリシーが検索した軌跡を条件付けに使い、タスク追加をパラメータ更新なしで実現する。
原題: Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time / Jeongeun Park, Juhan Park, Taekyung Kim 他
日本語で読む → - 論文VLA画像認識
考えるより先に動け:視覚言語行動モデルにおける強化学習を用いた潜在推論と早期終了戦略
視覚言語行動モデルにおいて、明示的なテキスト推論を避け、潜在変数による推論を強化学習で最適化し、信頼度に応じて推論を早期終了することで、高速かつ高精度な行動決定を実現した。
原題: Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models / Dianqiao Lei, Lianlei Shan
日本語で読む → - 論文VLA画像認識
多様な潜在世界モデルによる効率的なマルチモーダル推論
視覚入力の複数の解釈を潜在空間で並列に推論し、強化学習で計算資源を適応配分するマルチモーダル推論フレームワークDLWMを提案した。
原題: DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning / David Huang, Lianlei Shan
日本語で読む → - 論文自動運転/VLA画像認識
RT-VLA: 知識蒸留によるリアルタイム視覚言語行動モデル
大規模なVLAモデルの推論遅延を解決するため、教師モデルSimLingoから知識蒸留で軽量な学生モデルRT-VLAを構築し、推論時間を大幅に削減しつつ運転性能と言語推論を維持する手法を提案した。
原題: RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation / Xiangyu Huang, Zhenlin Hua, Han Zhou 他
日本語で読む → - 論文VLA自然言語
LabVLA: 科学実験室における視覚言語行動モデルの基盤構築
科学実験室向けのVLAモデルを開発し、シミュレーションデータ生成と2段階学習で実験プロトコルの実行を可能にした。
原題: LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories / Baochang Ren, Xinjie Liu, Xi Chen 他
日本語で読む → - 論文VLA/コード生成cs.PL
機能キャッシュ移植による身体化エージェント向けロバストかつ高速なコードポリシー合成
コード生成LLMの遅延と不安定性を解決するため、検証済み関数コードとKVキャッシュを再利用してポリシーを合成するFCGraftを提案。タスク成功率と生成速度を大幅に向上させた。
原題: Functional Cache Grafting: Robust and Rapid Code-Policy Synthesis for Embodied Agents / Saehun Chun, Wonje Choi, Sera Choi 他
日本語で読む → - 論文VLA/セキュリティロボティクス
軌道レベルでのリダイレクション攻撃:視覚言語行動モデルに対する
視覚言語行動(VLA)モデルに対して、指示文をわずかに変更するだけで、意図したタスクに見せかけつつ最終的な物理的結果を攻撃者が指定した目標に変える「軌道レベル」の脆弱性を発見し、その攻撃を自動生成する手法を提案した。
原題: Trajectory-Level Redirection Attacks on Vision-Language-Action Models / Gokul Puthumanaillam, Vardhan Dongre, Pranay Thangeda 他
日本語で読む → - 論文VLAAI
WISE: Minecraftにおける長期的目標達成エージェントのためのWhy-Which推論
Minecraftのような環境での長期的タスクを達成するエージェント向けに、因果イベントグラフを用いた記憶と推論を統合したフレームワークWISEを提案し、従来手法より成功率と効率を向上させた。
原題: WISE: A Long-Horizon Agent in Minecraft with Why-Which Reasoning / Renmin Cheng, Changhao Chen
日本語で読む →