論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/22 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
中央値時間アンサンブル:アクションチャンク型視覚運動ポリシーのための学習不要なロバスト集約
アクションチャンク型ポリシーの時間アンサンブルにおいて、平均ではなく候補予測の座標ごとの中央値を用いることで、敵対的汚染やカメラ故障に対して学習なしでロバスト性を向上させる手法を提案。
原題: Median Temporal Ensembling: Training-Free Robust Aggregation for Action-Chunked Visuomotor Policies / Yuhang Jiang
日本語で読む → - 論文VLAロボティクス
MedVLA: 閉ループ精密医療ロボット操作のための階層型視覚-言語-行動フレームワーク
高レベルなマルチモーダル推論と低レベルの関数制約付き実行を組み合わせた階層型VLAフレームワークを提案し、柔軟電極挿入タスクで95%の成功率を達成した。
原題: MedVLA: A Hierarchical Vision-Language-Action Framework for Closed-Loop Precision Medical Robot Manipulation / Junjie Xie, Chuxuan He, Angen Ye 他
日本語で読む → - 論文VLAロボティクス
再構成誤差を超えて:自己回帰型視覚-言語-行動モデルのための解析的・データ駆動型行動トークン化
自己回帰型VLAモデルにおける行動トークン化を、再構成誤差だけでなく閉ループ制御性能の観点から比較し、再構成忠実度だけでは行動表現を選べないことを示した研究。
原題: Beyond Reconstruction Error: Analytical and Data-Driven Action Tokenization for Autoregressive Vision-Language-Action Models / Yuxin Yang, Gaohan He, Changxue Guan 他
日本語で読む → - 論文VLAロボティクス
RoboFollow:身体性エージェントにおける指示追従の幻想を暴く
視覚シーンが一つのタスクしか許さない「低シーンエントロピー」問題を指摘し、言語理解を厳密に診断する4段階ベンチマークRoboFollowを提案。9つのVLA/WAMポリシーを評価し、指示追従能力が実は脆弱であることを示した。
原題: RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents / Chang Guo, Yukun Xie, Bohan Tan 他
日本語で読む → - 論文VLAロボティクス
RouteRLT: VLAポリシーを制御すべきRL専門家をいつ・どれにするか学習する
汎用VLAモデルと精密作業に特化したRL専門家を切り替えるルーティング手法を提案し、接続器挿入やケーブル操作などの実タスクで有効性を示した。
原題: RouteRLT: Learning When and Which RL Specialist Should Control a Vision-Language-Action Policy / Chongyu Zhu, Jaden Hinds, Hyegang Kim 他
日本語で読む → - 論文自動運転VLAロボティクス
走ってから歩け:VLM自動運転のためのRun-then-Walkスケジューリング戦略
VLMベースの自動運転プランナー向けに、進捗探索を優先する「Run」段階と安全性を修復する「Walk」段階を分けた2段階GRPO報酬スケジューリングを提案し、性能と収束速度を両立させた。
原題: Sometimes You Gotta Run Before You Can Walk: Run-then-Walk Scheduling Strategy for VLM Autonomous Driving / Yuqi Ye, Shangkun Sun, Junhong Lin 他
日本語で読む → - 論文VLAロボティクス
階層的間取り誘導型視覚言語探索による身体性質問応答
RGB-D観測から階層的シーングラフと開放語彙占有マップを構築し、間取りの事前情報とVLM計画を組み合わせて未知環境を効率的に探索するEQAフレームワークを提案した。
原題: Hierarchical Floorplan-Guided Vision-Language Exploration for Embodied Question Answering / Albert Gassol Puigjaner, Kostas Alexis
日本語で読む → - 論文VLAロボティクス
IndustrialVLA-Bench:オープンロボットポリシーモデルの追跡可能な多軸評価
6つのVLA/WAMモデルを統一プロトコルで評価し、クリーン性能・ロバスト性・言語感度・実行コストを比較したベンチマークを提案。
原題: IndustrialVLA-Bench: A Traceable Multi-Axis Evaluation of Open Robot Policy Models / Yiqi Wang, Zhifeng Rao, Jiaqi Zhang 他
日本語で読む → - 論文VLAロボティクス
SparseNav: 指示条件付きスパース意味知覚による訓練不要な視覚言語ナビゲーション
現在の指示に必要なランドマークだけをオンデマンドで知覚し、軽量なBEV地図とスパースな記憶でVLMプランナを導く、訓練不要の視覚言語ナビゲーション手法。
原題: SparseNav: Instruction-conditioned Sparse Semantic Perception for Training-Free Vision-Language Navigation / Quanhua Chen, Juhan Kang, Runfeng Lin 他
日本語で読む → - 論文VLAロボティクス
MachEmbodied-U0:身体知能のための統合理解・生成モデル
理解と生成の専門家をMixture-of-Transformersで統合し、視覚力学と行動生成をフローマッチングで結びつけた身体知能基盤モデルを提案。LIBEROで99.0%の成功率を達成。
原題: MachEmbodied-U0: Unified Understanding and Generation Model for Embodied Intelligence / Haoran Wen, Wenfu Wang, Kunsong Shi 他
日本語で読む → - 論文VLAロボティクス
魚眼VLA:単一魚眼カメラで操作のための広域認識と高精細視野を両立
単一の魚眼カメラから広域視野とエンドエフェクタ中心の局所クロップを同時に取得し、VLAモデルと組み合わせて卓上・棚・コンベア上の操作を実現した研究。
原題: Fisheye-VLA: Decoupling Coverage and Acuity for Manipulation with a Single Fisheye Camera / Ziang Ren, Zike Yan, Raymond Zhang 他
日本語で読む → - 論文VLAロボティクス
VisForce: 目標条件付き巧みな操作のための現在力と目標力の視覚的接地
指先位置に現在力と目標力を視覚的に重畳し、目標条件付きクロスアテンションで力認識動作を生成するVLA手法を提案し、実機で把持・操作タスクを評価した。
原題: VisForce: Visual Grounding of Current and Desired Forces for Goal-Conditioned Dexterous Manipulation / Jung-Woo Lee, Soo-Chul Lim
日本語で読む → - 論文VLAロボティクス
CableVLA: ケーブル配線のためのシミュレーション特権的グローバル・ローカル表現学習
シミュレーションの特権情報を活用し、ケーブルのトポロジーと触覚を表現する視覚言語行動フレームワークを提案。ケーブル配線タスクの成功率を62.6%から84.9%に向上させた。
原題: CableVLA: Simulation-Privileged Global-Local Representation Learning for Cable Routing / Zhifei Teng, Bo Feng, Xiang Zou 他
日本語で読む → - 論文VLA画像認識
Metric-Bench: 屋内シーンにおけるVLMの文脈内空間メトリック推論の探究
画像内の参照物体を手がかりに、カメラ内部パラメータなしでVLMが2Dから3Dへのメトリック推論を行うベンチマークと強化学習微調整手法を提案。
原題: Metric-Bench: Exploring In-context Spatial Metric Reasoning in VLMs for Indoor Scenes / Yuling Xi, Haokai Zhang, Muzhi Zhu 他
日本語で読む → - 論文VLAロボティクス
HABILIS Brain 0: 視覚言語行動と残差フロー回復のための幾何変化監督
現在の観測からマルチビューの未来-現在の幾何変化トークンを予測するGC-VLAを提案し、4段階の学習でLIBEROにおいて99.55%の成功率を達成した。
原題: HABILIS Brain 0: Geometry-Change Supervision for Vision-Language-Action and Residual Flow Recovery / Jinu Pahk, Jesoon Kang, Taegeon Park 他
日本語で読む → - 論文VLAロボティクス
行動は1パッチに値する:PatchWAMによる統合的世界-行動モデリング
連続行動を固定マッピングでパッチとして表現し、専用の行動ヘッドや専門家なしに単一の生成モデルで視覚予測と行動生成を同時に行うPatchWAMを提案。LIBERO-Plusで91.8%、RoboTwin 2.0で96.12%の成功率を達成。
原題: An Action Is Worth One Patch: Unified World-Action Modeling with PatchWAM / Tianheng Wang, Zhou Xie, Heng Jia 他
日本語で読む → - 論文VLAロボティクス
身体を知る:VLMによる直接的・自己改善的なロボット制御のためのハーネス
視覚言語モデルの重みを固定したまま、ロボットの身体構造に関する知識を明示化・更新可能にし、行動選択と過去の経験解釈を改善するフレームワークKnowBodyを提案。実機4タスクで成功率75%を達成。
原題: Know Your Body: A Harness for Direct and Self-Improving Robot Control with VLMs / Zeyu Lou, Yanhong Zeng, Yong Wang 他
日本語で読む → - 論文VLAロボティクス
DualWAM: 非同期グローバル計画と局所修正のためのデュアルシステム世界行動モデル
グローバル計画と手首視点による局所修正を非同期に分離し、高頻度な閉ループ制御を可能にした世界行動モデル。FrankaとGalbotでのゼロショット操作で成功率を平均4.5ポイント向上させ、16.6倍の高速化を実現。
原題: DualWAM: Dual-System World Action Models for Asynchronous Global Planning and Local Refinement / Yixin Zheng, Jiangran Lyu, Yuntian Deng 他
日本語で読む → - 論文VLAロボティクス
視覚品質を超えて:ワールドアクションモデルによるテスト時計画の研究
ワールドアクションモデルが生成する行動と予測結果を用いた計画の可能性を検証し、視覚品質や物理整合性に基づく選択では限界があることを示した研究。
原題: Beyond Visual Quality: A Study of Test-Time Planning with World Action Models / Jianhao Yuan, Yu Yuan, Benjamin Ramtoula 他
日本語で読む → - 論文VLAロボティクス
VLMベース視覚言語ナビゲーションモデルは何に依存しているのか:方策行動の解釈と操作
VLMベースの視覚言語ナビゲーションモデルが視覚・指示・記憶をどう統合し、内部表現を操作することで未知環境での性能を向上できるかを解明した研究。
原題: What do VLM-Based Vision-Language Navigation Models Rely on: Interpreting and Steering Policy Behavior / Débora Oliveira Makowski, Samiran Gode, Abhijeet Nayak 他
日本語で読む → - 論文VLAロボティクス
Bridge3D:Vision-Language-Actionモデルに3D空間での知覚と行動を可能にする
2D中心のVLAモデルに3D基盤モデルの特徴と3Dセマンティックフィールドを組み込み、3D空間での精密なマニピュレーションを実現した。
原題: Bridge3D: Enabling Vision-Language-Action Models to See and Act in 3D / Haoxuan Li, Sixu Yan, Lianghui Zhu 他
日本語で読む → - 論文VLA画像認識
LiDAR言語モデルは時空間関係を本当に理解しているのか?
4D LiDAR言語モデルの時空間推論を診断するため、nuScenesを用いた1万問のベンチマークLiDAR-Halluを提案し、集計精度では隠れる失敗を明らかにした。
原題: Do LiDAR Language Models Really Understand Spatio-temporal Relationships? / Runyi Yang, Murat Akkoyun, Di Wen 他
日本語で読む → - 論文VLAロボティクス
RoboTalk: マルチモーダル実演からのマルチロボット通信と協調の学習
小規模VLMをオンデバイスで動かすため、調理タスクのマルチモーダル軌道データセットを生成し、ロボット間の自然言語通信と協調行動を学習させる手法を提案した。
原題: RoboTalk: Learning Multi-Robot Communication and Coordination from Multimodal Demonstrations / Dorian Benhamou Goldfajn, Mason Nakamura, Saaduddin Mahmud 他
日本語で読む → - 論文VLAロボティクス
ActiveArena:ロボットマニピュレーションにおける能動的知覚のベンチマークと理解
能動的知覚と操作を評価するためのシミュレータと35タスクのベンチマーク、および13種のVLA構成を提案し、記憶管理やOOD汎化の要因を分析した。
原題: ActiveArena: Benchmarking and Understanding Active Perception in Robotic Manipulation / Yibo Li, Enshen Zhou, Rui Chen 他
日本語で読む → - 論文VLAロボティクス
ME-Brain-1.0:記憶・認知・行動による自己進化型身体知能
行動実行から経験獲得・進化を経て実行改善へと至る閉ループで自己進化する身体知能システムを提案し、再学習なしにベンチマークで大幅な性能向上を達成した。
原題: ME-Brain-1.0: Memory, Cognition and Action for Evolving Embodied Intelligence / Wei He, Hengtao Li, Zhongrui Yu 他
日本語で読む → - 論文VLAロボティクス
CARE: 経験に基づく原子的修正実行によるVision-Language-Actionポリシーの回復
VLAポリシーの失敗ロールアウトから段階別の失敗分布を学習し、推論時に3Dモニタリングで原子的な修正動作をトリガーすることで、ロボット操作の回復性能を向上させるフレームワーク。
原題: CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies / Junlan Xiao, Junwei Jiang, Zaibin Zhang 他
日本語で読む → - 論文VLA画像認識
ME-VLM:身体性認知とエージェント連携を統合した視覚言語モデル
身体性認知とマルチモーダルエージェント能力を統合したVLMを提案し、身体性・エージェント・自動運転・ナビゲーションのベンチマークで競争力のある性能を達成。エッジ展開向けの最適化も行った。
原題: ME-VLM:A Unified VLM for Embodied Cognition and Agent Coordination / Foundation Model, Li Auto Inc
日本語で読む → - 論文VLA画像認識
予想外のロボットポリシー:GPT-6 AstraのRoboDojoとその先における初期評価
大規模言語モデルをロボット操作のポリシーとして直接使えるかを検証し、GPT-6 Astraが公開ポリシーを上回る成功率を示す一方、精度や動的制御を要するタスクは苦手であることを明らかにした。
原題: An Unexpected Robot Policy: Early Evaluations of GPT-6 Astra on RoboDojo and Beyond / Wenbo Zhang, Kaixuan Wang, Yutao Ouyang 他
日本語で読む → - 論文VLAAI
X-Planner: 身体性知能のためのイベント構造化タスクプランニング
VLAシステムのためのプランニングフロントエンドX-Plannerを提案し、イベント構造化された計画形式と段階的デコーディングで長期的操作タスクの計画品質と実行性能を向上させた。
原題: X-Planner: Event-Structured Task Planning for Embodied Intelligence / Howard Lu, Shalfun Li, Porter Pan 他
日本語で読む → - 論文VLAロボティクス
Zeva-Ego: 一人称視点動画の中間学習と文脈内因果学習によるロボットマニピュレーション
一人称視点の人間動画から行動中心の監督信号を作りVLAモデルを中間学習させ、さらに展開時に行動と結果のフィードバックからパラメータ更新なしで適応する枠組みを提案。
原題: Zeva-Ego: Egocentric Mid-Training with In-Context Causal Learning for Robot Manipulation / Bingjia Huang, Xin Ding, Fu Chen 他
日本語で読む →