論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/10/16 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA機械学習
自己対戦ファインチューニングによるエージェントRLのための世界モデル内在化
LLMエージェントに状態表現と遷移モデルからなる内部世界モデルを自己対戦SFTで学習させ、方策最適化前に未来状態をシミュレートすることでOOD環境でのRL性能を大幅に向上させる手法SPAを提案。
原題: Internalizing World Models via Self-Play Finetuning for Agentic RL / Shiqi Chen, Tongyao Zhu, Zian Wang 他
日本語で読む → - 論文VLA画像認識
Vision-Language-Actionモデルに対するモデル非依存の敵対的攻撃と防御
VLAモデルにカメラ視野内に置ける敵対的パッチを生成するモデル非依存攻撃EDPAを提案し、視覚エンコーダの敵対的ファインチューニングによる防御法も示した。
原題: Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models / Haochuan Xu, Yun Sing Koh, Shuhuai Huang 他
日本語で読む → - 論文VLAcs.CR
物理オブジェクトをトリガとする目標指向バックドア攻撃:VLAモデルに対する新たな脅威
訓練データに物理オブジェクトをトリガとして混入させるだけで、VLAモデルに特定の目標行動を実行させるバックドア攻撃GoBAを提案し、BadLIBEROベンチマークで97%の成功率を示した。
原題: Goal-oriented Backdoor Attack against Vision-Language-Action Models via Physical Objects / Zirun Zhou, Zhengyang Xiao, Haochuan Xu 他
日本語で読む → - 論文VLAロボティクス
SUM-AgriVLN: 農業用視覚言語ナビゲーションのための空間理解メモリ
農業ロボットの視覚言語ナビゲーションにおいて、過去の空間メモリを活用するSUMモジュールを提案し、繰り返し指示への対応精度を向上させた。
原題: SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation / Xiaobei Zhao, Xingqi Lyu, Xin Chen 他
日本語で読む → - 論文VLAロボティクス
QuASH: 自然言語ヒューリスティクスによる視覚言語ロボットマップのクエリ
視覚言語モデルの埋め込みを用いたロボットマップに対し、クエリに関連する同義語・反意語を活用して環境をマッチ/非マッチに分類するクエリ手法を提案し、マップと画像のクエリ性能を向上させた。
原題: QuASH: Using Natural-Language Heuristics to Query Visual-Language Robotic Maps / Matti Pekkanen, Francesco Verdoja, Ville Kyrki
日本語で読む → - 論文VLA/LLMプランニングAI
不確実な環境下での意思決定のための情報探索フレームワークInfoSeeker
LLMを用いた意思決定において、内部モデルと実環境のずれを解消するため、行動前に情報を能動的に集める計画手法を提案し、部分観測環境の新ベンチマークで大幅な性能向上を示した。
原題: Information Seeking for Robust Decision Making under Partial Observability / Djengo Cyun-Jyun Fang, Tsung-Wei Ke
日本語で読む → - 論文VLAAI
信頼できるCode-as-Policiesに向けて:身体性タスク計画のためのニューロシンボリックフレームワーク
LLMによるコード生成型タスク計画に記号的検証と環境との対話的検証を組み込み、動的・部分観測環境でのタスク成功率と信頼性を向上させた。
原題: Towards Reliable Code-as-Policies: A Neuro-Symbolic Framework for Embodied Task Planning / Sanghyun Ahn, Wonje Choi, Junyong Lee 他
日本語で読む → - 論文VLA画像認識
PhysToolBench:マルチモーダル大規模言語モデルの物理ツール理解を評価するベンチマーク
MLLMが物理ツールをどれだけ理解しているかを評価する初のVQAベンチマークを構築し、32モデルを評価した結果、ツール理解に大きな欠陥があることを明らかにした。
原題: PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs / Zixin Zhang, Kanghao Chen, Xingwang Lin 他
日本語で読む → - 論文VLAロボティクス
身体性ギャップを越えて:ソフトロボットへの視覚-言語-行動モデルの展開
視覚-言語-行動(VLA)モデルをソフト連続マニピュレータに適用し、ファインチューニングにより剛体ロボットと同等の性能を達成して安全な人間-ロボット相互作用を実現した。
原題: Bridging Embodiment Gaps: Deploying Vision-Language-Action Models on Soft Robots / Haochen Su, Cristian Meo, Francesco Stella 他
日本語で読む → - 論文VLAロボティクス
Spatial Forcing:視覚-言語-行動モデルのための暗黙的な空間表現アラインメント
3D入力や深度推定器に頼らず、VLAモデルの中間視覚埋め込みを事前学習済み3D基盤モデルの幾何表現に揃えることで、空間理解を暗黙的に獲得させ、行動精度と学習効率を向上させる手法を提案。
原題: Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model / Fuhao Li, Wenxuan Song, Han Zhao 他
日本語で読む → - 論文VLAロボティクス
オラクル誘導マスク付き対照強化学習による視覚運動ポリシー
視覚運動ポリシー学習を表現学習とポリシー学習の2段階に分離し、マスク付きTransformerと対照学習で視覚表現を抽出、さらにオラクル教師の指導でサンプル効率と性能を向上させるフレームワークを提案。
原題: Oracle-Guided Masked Contrastive Reinforcement Learning for Visuomotor Policies / Yuhang Zhang, Jiaping Xiao, Chao Yan 他
日本語で読む → - 論文VLAロボティクス
InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシー
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
原題: InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy / Xinyi Chen, Yilun Chen, Yanwei Fu 他
日本語で読む → - 論文VLA画像認識
LIBERO-PRO:記憶を超えたVLAモデルの堅牢で公平な評価に向けて
VLAモデル評価用ベンチマークLIBEROを拡張し、物体・初期状態・指示・環境を摂動させて評価したところ、標準評価で90%超の精度が汎化設定では0.0%に崩壊し、モデルがタスク理解ではなく訓練データの丸暗記に依存していることを明らかにした。
原題: LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization / Xueyang Zhou, Yangming Xu, Guiyao Tie 他
日本語で読む → - 論文VLAロボティクス
ロボットアシスタント:器用な視覚-言語-行動モデルによる協調タスクの完遂
事前学習済みVLAモデルを人間-ロボット協調に適応させ、意図予測や行動後処理を加えて、ピックアップとパスを組み合わせた長期的な協調動作を実現した。
原題: Robotic Assistant: Completing Collaborative Tasks with Dexterous Vision-Language-Action Models / Boshi An, Chenyu Yang, Robert Katzschmann
日本語で読む → - 論文VLAロボティクス
TrackVLA++:具現化視覚追跡のための推論と記憶能力を引き出すVLAモデル
移動する対象を追跡する具現化視覚追跡において、空間推論と長期記憶のモジュールを導入し、遮蔽や類似物体に強いVLAモデルを提案した。
原題: TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking / Jiahang Liu, Yunpeng Qi, Jiazhao Zhang 他
日本語で読む → - 論文VLA画像認識
OmniSAT: コンパクトな行動トークンによる高速自己回帰VLA
行動をBスプライン符号化と多段残差量子化で圧縮トークン化し、自己回帰型VLAの系列長を6.8倍短縮して学習効率を高める手法を提案。
原題: OmniSAT: Compact Action Token, Faster Auto Regression / Huaihai Lyu, Chaofan Chen, Senwei Xie 他
日本語で読む → - 論文VLAAI
D2E: デスクトップデータによる視覚-行動事前学習のスケーリングと身体性AIへの転移
デスクトップのゲーム操作データを大規模に収集・圧縮し、汎用逆動力学モデルで疑似ラベル付けして事前学習することで、ロボットの操作・ナビゲーションタスクへ転移可能な基盤モデルを構築した。
原題: D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI / Suhwan Choi, Jaeyoon Jung, Haebin Seong 他
日本語で読む → - 論文VLAロボティクス
一点ではなく面で捉える:ロボットタスクの空間グラウンディングのための適応的アフォーダンスヒートマップによる不確実性の表現
空間的な目標を離散的な点ではなく連続的なアフォーダンスヒートマップとして表現し、不確実性を捉えることで、実世界のマニピュレーション成功率82%と最大50倍の高速化を実現したフレームワークRoboMAPを提案。
原題: More than A Point: Capturing Uncertainty with Adaptive Affordance Heatmaps for Spatial Grounding in Robotic Tasks / Xinyu Shao, Yanzhe Tang, Pengwei Xie 他
日本語で読む → - 論文VLA画像認識
世界モデル拡張VLAのためのデュアルストリーム拡散
視覚・言語・行動モデルに世界モデルを組み合わせ、状態と行動を別ストリームで拡散生成するDUSTを提案し、シミュレーションと実機で性能向上を実証した。
原題: Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model / John Won, Kyungmin Lee, Huiwon Jang 他
日本語で読む → - 論文VLAロボティクス
実生活の人間活動動画を用いたロボットマニピュレーション向け視覚-言語-行動モデルのスケーラブル事前学習
人間の手の日常動画を自動解析してロボットのVLA学習データに変換し、100万エピソード規模のデータセットでモデルを事前学習することで、未知環境でのゼロショット性能と実機微調整時の成功率・汎化性能を向上させた。
原題: Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos / Qixiu Li, Yu Deng, Yaobo Liang 他
日本語で読む → - 論文VLAロボティクス
行動偏差を考慮した低遅延ワイヤレスロボット推論
行動クローニングポリシーの推論を低遅延化するため、行動偏差に基づいてドラフトを選択的に送信・検証する手法を提案し、通信と計算のオーバーヘッドを削減しつつ精度を維持した。
原題: Action Deviation-Aware Inference for Low-Latency Wireless Robots / Jeyoung Park, Yeonsub Lim, Seungeun Oh 他
日本語で読む → - 論文VLAロボティクス
ビデオ再計画による暗黙的な状態推定
ビデオベースの計画フレームワークにインタラクション時のデータを統合し、モデルパラメータをオンライン更新して失敗した計画を除外することで、暗黙的な状態推定を実現する手法を提案。
原題: Implicit State Estimation via Video Replanning / Po-Chen Ko, Jiayuan Mao, Yu-Hsiang Fu 他
日本語で読む → - 論文VLA画像認識
視覚言語モデルの戦略的融合:自動運転におけるマルチラベルタスクのためのShapleyクレジット付き文脈認識Dawid-Skene
自動運転のマルチラベル理解に向けて、複数の視覚言語モデルの信頼性をゲーム理論的に統合する手法を提案し、単一モデルより高精度かつ解釈可能な融合を実現した。
原題: Strategic Fusion of Vision Language Models: Shapley-Credited Context-Aware Dawid-Skene for Multi-Label Tasks in Autonomous Driving / Yuxiang Feng, Keyang Zhang, Hassane Ouchouid 他
日本語で読む → - 論文VLAロボティクス
X-VLA:ソフトプロンプト付きTransformerによるスケーラブルなクロスエンボディメント視覚言語行動モデル
多様なロボットのデータ源ごとに学習可能なソフトプロンプトを割り当てることで、異なる機体を横断して学習できる汎用VLAモデルX-VLAを提案し、6つのシミュレーションと3体の実機でSOTA性能を示した。
原題: X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model / Jinliang Zheng, Jianxiong Li, Zhihao Wang 他
日本語で読む → - 論文VLAロボティクス
ポリシーを合成せよ!テスト時分布レベル合成による拡散・フローベースロボットポリシーの改善
複数の事前学習済みロボットポリシーの分布スコアを凸結合しテスト時探索で合成する訓練不要手法GPCを提案し、単一ポリシーを超える性能を実現した。
原題: Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition / Jiahang Cao, Yize Huang, Hanzhong Guo 他
日本語で読む → - 論文VLAロボティクス
VITA-E:見る・聞く・話す・行動するを同時に実現する身体的インタラクション
2つのVLAモデルを並列に動かす二重モデル構成と「モデル・アズ・コントローラ」により、ロボットが環境を見ながらユーザーの音声を聞き、発話し、行動を同時並行で実行し、割り込みにも即応できる身体的対話フレームワークを提案した。
原題: VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting / Xiaoyu Liu, Chaoyou Fu, Chi Yan 他
日本語で読む → - 論文VLAロボティクス
RoVer: 視覚-言語-行動モデルのためのテスト時検証器としてのロボット報酬モデル
VLAモデルの推論時にロボット過程報酬モデルを検証器として使い、候補行動を生成・評価・選択することで、追加学習なしに性能を向上させるフレームワークを提案。
原題: RoVer: Robot Reward Model as Test-Time Verifier for Vision-Language-Action Model / Mingtong Dai, Lingbo Liu, Yongjie Bai 他
日本語で読む → - 論文VLAAI
Memo: 強化学習による記憶効率の良い身体性エージェントの訓練
Transformerベースの強化学習において、定期的な要約トークンを入力に挟み込むことで記憶の生成と検索を行い、長期的なタスクを効率的に学習する手法を提案。
原題: Memo: Training Memory-Efficient Embodied Agents with Reinforcement Learning / Gunshi Gupta, Karmesh Yadav, Zsolt Kira 他
日本語で読む → - 論文VLAcs.CR
DropVLA: 視覚言語行動モデルに対する行動レベルバックドア攻撃
VLAモデルの微調整時に視覚トリガーを混ぜ、攻撃者が指定したタイミングで特定の行動(例:グリッパを開く)を実行させる行動レベルバックドア攻撃を提案し、実機でも検証した。
原題: DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models / Zonghuan Xu, Jiayu Li, Yunhan Zhao 他
日本語で読む → - 論文VLAロボティクス
TIGeR: ロボティクス向け視覚言語モデルにおけるツール統合幾何推論
視覚言語モデルに外部ツールで正確な幾何計算を生成・実行させる枠組みを提案し、ロボット操作に必要なセンチメートル精度を実現した。
原題: TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics / Yi Han, Enshen Zhou, Shanyu Rong 他
日本語で読む →