論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/10/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
VLA^2: エージェントフレームワークで視覚言語行動モデルを強化し未知の概念操作を実現
OpenVLAを実行基盤とし、Web検索や物体検出などの外部モジュールを活用して未知物体の視覚・言語知識を補完するエージェントフレームワークを提案。LIBERO環境での新ベンチマークで、ハードレベル成功率を44.2%向上させた。
原題: VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation / Han Zhao, Jiaxuan Zhang, Wenxuan Song 他
日本語で読む → - 論文VLAロボティクス
Avi: ボリュメトリック推論による行動生成
3D点群と言語理解を組み合わせ、次フレームの点群を生成して古典的な幾何変換でロボット動作を計算する3D VLAアーキテクチャを提案。遮蔽や視点変化に頑健な汎化行動を実現する。
原題: Avi: Action from Volumetric Inference / Harris Song, Long Le
日本語で読む → - 論文VLAロボティクス
LIBERO-Plus:視覚言語行動モデルの堅牢性に関する詳細分析
VLAモデルのロバスト性を7つの摂動次元で体系的に評価し、見かけの性能の裏に隠れた脆弱性を明らかにした。
原題: LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models / Senyu Fei, Siyin Wang, Junhao Shi 他
日本語で読む → - 論文VLAロボティクス
チームXiaomi EV-AD VLA:キャプション誘導検索システムによるクロスモーダルドローン航法
ドローンの自然言語誘導画像検索において、VLMで候補画像のキャプションを生成し再ランキングする2段階手法を提案し、ベースラインを5%改善した。
原題: Team Xiaomi EV-AD VLA: Caption-Guided Retrieval System for Cross-Modal Drone Navigation -- Technical Report for IROS 2025 RoboSense Challenge Track 4 / Lingfeng Zhang, Erjia Xiao, Yuchen Zhang 他
日本語で読む → - 論文VLAロボティクス
RoboChallenge:実機ロボットによる具現化ポリシーの大規模評価
多数のモデルとタスクを実機で評価するオンラインシステムRoboChallengeを構築し、初期ベンチマークTable30で最新VLAモデルを調査した。
原題: RoboChallenge: Large-scale Real-robot Evaluation of Embodied Policies / Adina Yakefu, Bin Xie, Chongyang Xu 他
日本語で読む → - 論文VLAロボティクス
ContextVLA:マルチフレーム文脈を効率的に活用する視覚-言語-行動モデル
過去の観測を1つの文脈トークンに圧縮することで、計算コストを抑えつつマルチフレームの時間的文脈を活用してロボットタスクの成功率を高めるVLAモデルを提案。
原題: ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context / Huiwon Jang, Sihyun Yu, Heeseung Kwon 他
日本語で読む → - 論文VLAロボティクス
USIMとU0:汎用水下ロボットのための視覚-言語-行動データセットとモデル
言語指示で動く汎用水下ロボット向けに、BlueROV2の約25時間分の模擬データセットUSIMと、空間認識を強化した視覚-言語-行動モデルU0を提案し、既存手法を上回る性能を示した。
原題: USIM and U0: A Vision-Language-Action Dataset and Model for General Underwater Robots / Junwen Gu, Zhiheng Wu, Pengxuan Si 他
日本語で読む → - 論文VLAロボティクス
Dejavu:身体性知能のための経験フィードバック学習
凍結したVLAポリシーに過去の実行記憶を検索して与える経験フィードバックネットワークを提案し、展開後も経験から学習して適応性と成功率を向上させる。
原題: Dejavu: Towards Experience Feedback Learning for Embodied Intelligence / Shaokai Wu, Yanbiao Ji, Qiuchang Li 他
日本語で読む → - 論文VLAロボティクス
NoTVLA: 物語的行動インターフェースによる意味を保つロボット適応
VLAモデルの破滅的忘却を防ぐため、ロボットエンドエフェクタの軌跡を時間圧縮・空間推論で疎にし、その疎軌跡でファインチューニングするNoTVLAを提案。pi0より大幅に少ない計算量で高性能・高汎化を実現。
原題: NoTVLA: Semantics-Preserving Robot Adaptation via Narrative Action Interfaces / Zheng Huang, Mingyu Liu, Xiaoyi Lin 他
日本語で読む → - 論文VLAロボティクス
リンゴを持ってきて、ソファは要らない:VLAモデルにおける身体性AIコマンドの無関係な文脈の影響
VLAモデルが言い換えや無関係な文脈を含む指示に対してどれだけ頑健かを体系的に評価し、意味的・語彙的に類似した文脈で性能が約50%低下することを示した。LLMベースのフィルタリングで元の性能の最大98.5%を回復する手法を提案。
原題: Bring the Apple, Not the Sofa: Impact of Irrelevant Context in Embodied AI Commands on VLA Models / Daria Pugacheva, Andrey Moskalenko, Denis Shepelev 他
日本語で読む → - 論文VLAロボティクス
IntentionVLA: 人間とロボットのインタラクションのための汎用かつ効率的な意図推論
意図推論・空間グラウンディング・簡潔な身体性推論を組み合わせたカリキュラム学習と効率的推論機構により、間接的な指示から人間の意図を推論して行動生成するVLAフレームワークを提案。
原題: IntentionVLA: Generalizable and Efficient Embodied Intention Reasoning for Human-Robot Interaction / Yandu Chen, Kefan Gu, Yuqing Wen 他
日本語で読む → - 論文VLA画像認識
Less is More: 自動運転のための軽量かつ強力な視覚言語モデル
自動運転を言語問題として捉え、視覚言語モデルを用いて前視カメラ入力から直接軌道を予測する一段階エンドツーエンドフレームワークMax-V1を提案。nuScenesで30%以上の性能向上を達成。
原題: Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving / Sheng Yang, Tong Zhan, Guancheng Chen 他
日本語で読む → - 論文VLAロボティクス
NEBULA: 視覚言語行動エージェントを正しく評価できているか?
VLAエージェントの評価のための統一エコシステムNEBULAを提案し、細粒度の能力テストと系統的ストレステストを組み合わせた二軸評価プロトコルを導入した。
原題: NEBULA: Do We Evaluate Vision-Language-Action Agents Correctly? / Jierui Peng, Yanyan Zhang, Yicheng Duan 他
日本語で読む → - 論文VLAロボティクス
シミュレーションからルールへ:形式的視覚計画のためのデュアルVLMフレームワーク
視覚言語モデルとPDDLプランナを組み合わせ、シミュレーションと生成の2つのVLMでPDDLのドメインと問題ファイルを自動生成し、未知の環境や外観でも計画を可能にするフレームワークを提案。
原題: Simulation to Rules: A Dual-VLM Framework for Formal Visual Planning / Yilun Hao, Yongchao Chen, Chuchu Fan 他
日本語で読む → - 論文VLAロボティクス
SITCOM: VLAのための推論時計算スケーリング
事前学習済みVLAに学習済みダイナミクスモデルによる多段階ロールアウトと報酬ベースの軌道選択を組み合わせ、長期的な計画能力を強化するフレームワークを提案。SIMPLER環境でタスク完了率を48%から72%に改善した。
原題: SITCOM: Scaling Inference-Time COMpute for VLAs / Ayudh Saxena, Harsh Shah, Sandeep Routray 他
日本語で読む → - 論文VLAロボティクス
UniJEPA:連続・離散表現の統合学習によるロボットポリシーの強化
100万件超の操作動画で視覚表現を事前学習し、ロボット実機データで微調整することで、予測表現から行動トークンへのマッピングを学習する汎用ロボットポリシー手法を提案。
原題: UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning / Jianke Zhang, Yucheng Hu, Yanjiang Guo 他
日本語で読む → - 論文VLAAI
RoboGPT-R1:強化学習によるロボットタスクプランニングの強化
視覚言語モデルを教師あり微調整と強化学習の2段階で訓練し、長期的な操作タスクの計画能力を高める手法を提案。小型モデルながら大規模モデルを上回る性能を達成。
原題: RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning / Jinrui Liu, Bingyan Nie, Boyu Li 他
日本語で読む → - 論文VLAロボティクス
生成的ロボット方策の実行時故障予測
生成的な模倣学習方策の実行時故障を、故障データなしで予測するFIPERを提案。OOD検出と行動不確実性を組み合わせ、成功ロールアウトで較正する。
原題: Failure Prediction at Runtime for Generative Robot Policies / Ralf Römer, Adrian Kobras, Luca Worbis 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルのための対照表現正則化
VLAモデルの表現をロボットの固有感覚状態と対照学習で整合させ、実機マニピュレーションの成功率を向上させた研究。
原題: Contrastive Representation Regularization for Vision-Language-Action Models / Taeyoung Kim, Jimin Lee, Myungkyu Koo 他
日本語で読む → - 論文VLAロボティクス
はさみを持って走るな:VLAモデルは枝刈りで壊れるが回復可能
VLAモデルを枝刈りすると性能が大きく劣化し安全性違反も増えるが、重み空間で密モデルと枝刈りモデルを一度補間して補正項を計算する学習不要の手法GLUESTICKにより、効率を保ちつつ成功率を回復できることを示した。
原題: Don't Run with Scissors: Pruning Breaks VLA Models but They Can Be Recovered / Jason Jabbour, Dong-Ki Kim, Max Smith 他
日本語で読む → - 論文VLAロボティクス
Vision-Language-Actionモデルのためのハイブリッド訓練
思考連鎖(CoT)を学習しつつ推論時には省略可能にするハイブリッド訓練(HyT)を提案し、ロボット操作の性能を保ちながら推論速度を改善した。
原題: Hybrid Training for Vision-Language-Action Models / Pietro Mazzaglia, Cansu Sancaktar, Markus Peschl 他
日本語で読む → - 論文VLA画像認識
QDepth-VLA:量子化深度予測を補助監督とする視覚-言語-行動モデル
VLAモデルにVQ-VAEで量子化した深度マップの潜在トークンを予測する補助タスクを追加し、空間推論能力とマニピュレーション性能を向上させた。
原題: QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models / Yixuan Li, Yuhui Chen, Mingcai Zhou 他
日本語で読む → - 論文VLAAI
目に見える以上のもの?視覚言語運転モデルにおける推論と計画の乖離の解明
運転用VLMエージェントの計画が自然言語推論に因果的に依存するかを検証し、実際には推論ではなく事前情報に依存していることを示した研究。
原題: More Than Meets the Eye? Uncovering the Reasoning-Planning Disconnect in Training Vision-Language Driving Models / Xurui Song, Shuo Huai, JingJing Jiang 他
日本語で読む → - 論文VLA画像認識
EmbodiedBrain: 具現化知能のためのタスクプランニング性能の限界を拡張する
7Bと32Bの視覚言語基盤モデルEmbodiedBrainを提案し、SFTとStep-GRPOを組み合わせた学習法と新しい評価環境で具現化タスクの計画性能を向上させた。
原題: EmbodiedBrain: Expanding Performance Boundaries of Task Planning for Embodied Intelligence / Ding Zou, Feifan Wang, Mengyu Ge 他
日本語で読む → - 論文VLAAI
聴き・見・話し・行動する統合モデルELLSA
視覚・テキスト・音声・行動を単一アーキテクチャで同時に知覚・生成する全二重エンドツーエンドモデルを提案し、対話と行動の割り込みや発話しながらの行動などを実現した。
原題: End-to-end Listen, Look, Speak and Act / Siyin Wang, Wenyi Yu, Xianzhao Chen 他
日本語で読む → - 論文VLA画像認識
WristWorld: 4D世界モデルによるロボットマニピュレーションのための手首視点映像生成
アンカー視点の映像から手首視点の映像を生成する4D世界モデルを提案し、VLAモデルのマニピュレーション性能を向上させた。
原題: WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation / Zezhong Qian, Xiaowei Chi, Yuming Li 他
日本語で読む → - 論文VLAロボティクス
MatterDoor: 生成モデルによるゼロショット時空間意味論的事前分布のサンプリング
事前学習済み生成視覚モデルを用いて、ドア越しに隠れた部屋の3D点群仮説を生成し、ロボットのナビゲーションや目標指向行動のための時空間意味論的事前分布をゼロショットで導出する手法を提案。
原題: MatterDoor: Sampling Zero-shot Spatio-semantic Priors using Generative Models / Subhransu S. Bhattacharjee, Hao Lu, Dylan Campbell 他
日本語で読む → - 論文VLAロボティクス
VLAをリアルタイム速度で動かす
単一のコンシューマGPU上でpi0級のマルチビューVLAを30Hzのフレームレート・最大480Hzの軌道周波数で動作させる推論最適化手法を提案し、落下するペンを掴むタスクで100%の成功率を達成した。
原題: Running VLAs at Real-time Speed / Yunchao Ma, Yizhuang Zhou, Yunhuan Yang 他
日本語で読む → - 論文VLAロボティクス
自己改善VLAのための反省ベースタスク適応
VLMの因果推論で失敗から報酬を自動生成し強化学習を加速、成功軌道の模倣で報酬ハッキングを防ぐ二経路フレームワークを提案。
原題: Reflection-Based Task Adaptation for Self-Improving VLA / Baicheng Li, Dong Wu, Zike Yan 他
日本語で読む → - 論文VLA画像認識
メタデータとタスク特化プロンプトによる堅牢な運転QA
自動運転の高次QAに向け、マルチモーダルLLMを6カメラ入力とシーン情報で条件付けし、自己一貫性とタスク別プロンプトで精度と堅牢性を向上させた。
原題: Robust Driving QA through Metadata-Grounded Context and Task-Specific Prompts / Seungjun Yu, Junsung Park, Youngsun Lim 他
日本語で読む →