論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/21 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
ActiveArena:ロボットマニピュレーションにおける能動的知覚のベンチマークと理解
能動的知覚と操作を評価するためのシミュレータと35タスクのベンチマーク、および13種のVLA構成を提案し、記憶管理やOOD汎化の要因を分析した。
原題: ActiveArena: Benchmarking and Understanding Active Perception in Robotic Manipulation / Yibo Li, Enshen Zhou, Rui Chen 他
日本語で読む → - 論文VLAロボティクス
DualWAM: 非同期グローバル計画と局所修正のためのデュアルシステム世界行動モデル
グローバル計画と手首視点による局所修正を非同期に分離し、高頻度な閉ループ制御を可能にした世界行動モデル。FrankaとGalbotでのゼロショット操作で成功率を平均4.5ポイント向上させ、16.6倍の高速化を実現。
原題: DualWAM: Dual-System World Action Models for Asynchronous Global Planning and Local Refinement / Yixin Zheng, Jiangran Lyu, Yuntian Deng 他
日本語で読む → - 論文VLAロボティクス
RoboTalk: マルチモーダル実演からのマルチロボット通信と協調の学習
小規模VLMをオンデバイスで動かすため、調理タスクのマルチモーダル軌道データセットを生成し、ロボット間の自然言語通信と協調行動を学習させる手法を提案した。
原題: RoboTalk: Learning Multi-Robot Communication and Coordination from Multimodal Demonstrations / Dorian Benhamou Goldfajn, Mason Nakamura, Saaduddin Mahmud 他
日本語で読む → - 論文VLAロボティクス
FoldQuantVLA: 一貫した折り畳みによる視覚-言語-行動モデルのネイティブローbit量子化
視覚-言語-行動モデルを再学習なしで4bit量子化し、TensorRTプラグインで高速化する手法を提案。実機タスクで成功率を維持・向上させた。
原題: FoldQuantVLA: Native Low-Bit Quantization of Vision-Language-Action Models via Consistent Folding / Hung T. Ho, Khanh D. Nguyen, Quang D. Nguyen 他
日本語で読む → - 論文VLAロボティクス
LIBERO-VPro:ロボット基盤モデルの閉ループ視覚ロバスト性ベンチマーク
実行中の視覚情報を意図的に乱すことで、ロボット基盤モデルの閉ループ視覚ロバスト性を体系的に評価するベンチマークLIBERO-VProを提案し、VLAとWAMのロバスト性プロファイルの違いを明らかにした。
原題: LIBERO-VPro: Benchmarking Closed-Loop Visual Robustness of Robotic Foundation Models / Huiqiong Li, Zhiting Mei, Anirudha Majumdar 他
日本語で読む → - 論文VLAロボティクス
世界モデルのように考え、VLAのように行動する:世界モデル表現をコンパクトなロボット方策に蒸留
凍結した世界モデルの内部特徴をVLA訓練に特徴整合項として一度だけ蒸留し、推論時コストを増やさずにロボット方策の堅牢性と成功率を向上させた。
原題: Think Like a World Model, Act Like a VLA: Distilling World-Model Representations into Compact Robot Policies / Trung Dao, Sankalp Yamsani, Jaden Park 他
日本語で読む → - 論文VLA画像認識
予想外のロボットポリシー:GPT-6 AstraのRoboDojoとその先における初期評価
大規模言語モデルをロボット操作のポリシーとして直接使えるかを検証し、GPT-6 Astraが公開ポリシーを上回る成功率を示す一方、精度や動的制御を要するタスクは苦手であることを明らかにした。
原題: An Unexpected Robot Policy: Early Evaluations of GPT-6 Astra on RoboDojo and Beyond / Wenbo Zhang, Kaixuan Wang, Yutao Ouyang 他
日本語で読む → - 論文VLAロボティクス
人間とロボットの協調における計画学習:適応的インタラクションのためのマルチモーダル強化学習
家庭内で物体を探す際に、言語と身体動作を含むマルチモーダル信号を扱いながらユーザーを支援するロボットの対話方針を、強化学習で自動生成する手法を提案し、実世界でのユーザー研究で有効性を示した。
原題: Learning to Plan in Human-Robot Collaboration: Multimodal Reinforcement Learning for Adaptive Interaction / Afagh Mehri Shervedani, Siyu Li, Natawut Monaikul 他
日本語で読む → - 論文VLAロボティクス
VLMベース視覚言語ナビゲーションモデルは何に依存しているのか:方策行動の解釈と操作
VLMベースの視覚言語ナビゲーションモデルが視覚・指示・記憶をどう統合し、内部表現を操作することで未知環境での性能を向上できるかを解明した研究。
原題: What do VLM-Based Vision-Language Navigation Models Rely on: Interpreting and Steering Policy Behavior / Débora Oliveira Makowski, Samiran Gode, Abhijeet Nayak 他
日本語で読む → - 論文VLAAI
X-Planner: 身体性知能のためのイベント構造化タスクプランニング
VLAシステムのためのプランニングフロントエンドX-Plannerを提案し、イベント構造化された計画形式と段階的デコーディングで長期的操作タスクの計画品質と実行性能を向上させた。
原題: X-Planner: Event-Structured Task Planning for Embodied Intelligence / Howard Lu, Shalfun Li, Porter Pan 他
日本語で読む → - 論文VLAロボティクス
見た目の変化を超えて:VLAモデルのためのタスク意味論的行動校正
凍結したVLAモデルにタスク意味論に基づく行動校正を追加し、見た目変化への不要な反応を抑えつつ、意味が変わった時のみ行動を変える手法を提案。
原題: Beyond Appearance Shifts: Task-Semantic Action Calibration for VLA Models / Shuaijun Liu, Feiyang You, Chengyu Wu 他
日本語で読む → - 論文VLAロボティクス
トポロジー情報を活用した視覚プロンプティングによる視覚言語行動ポリシー
複雑な障害物形状を持つ操作タスクにおいて、トポロジー署名を用いてVLAポリシーを誘導する視覚プロンプティングフレームワークを提案し、シミュレーションと実機で有効性を示した。
原題: Topology-Informed Visual Prompting For Vision Language Action Policies / Haoyang Wu, Abhinav Kumar, Dmitry Berenson
日本語で読む → - 論文VLAロボティクス
SCULPT-VLA: 段階的行動グラウンディングによる構造化制御の学習
VLAポリシーにおいて、タスク進行・シーン動態・空間グラウンディングの要素を段階的に学習させ、教師なしで連続制御を洗練する手法を提案。LIBEROや実機タスクで成功率を向上させた。
原題: SCULPT-VLA: Learning Structured Control through Staged Action Grounding / Wenbo Li, Yiteng Chen, Wei Zhang 他
日本語で読む → - 論文VLAロボティクス
スパイキングニューラルネットワークによるActor-Critic PPO制御を用いた、インフラ・建築物内の狭所開口部を通過するUAV自律ナビゲーション
スパイキングニューラルネットワークとPPOを組み合わせたActor-Critic強化学習により、橋梁やトンネルなど制約の多い3次元環境でUAVを自律飛行させ、窓通過タスクで63.77%の成功率を達成した。
原題: Spiking Neural Network Actor-Critic Proximal Policy Optimization Control for Autonomous UAV Navigation Through Constrained Openings in Civil Infrastructure and Buildings / Francis Noah Walugembe, Maciej Wielgosz, Tomaž Goričan 他
日本語で読む → - 論文VLAロボティクス
RiverVLN: フェーズ接地型時間的視覚言語ナビゲーションによる無人水上艇の河川航行
河川を航行する無人水上艇(USV)向けに、長期的な言語指示を視覚的に検証可能な意味フェーズ列に変換し、予測・実行・再観測ループで連続的なSE(2)姿勢増分を予測するナビゲーション手法PGT-NAVとベンチマークRiverVLNを提案した。
原題: RiverVLN: Phase-Grounded Temporal Vision--Language Navigation for Unmanned Surface Vehicles / Jieling Wu, Yuehao Huang, Jiajun Lv 他
日本語で読む → - 論文VLAAI
PhysAI-Bench:自律UAV物理AIにおけるLLMベースエージェント意思決定のベンチマーク
自律UAVミッションの対話ログから抽出した1万件超の意思決定インスタンスで、29の基盤モデルのエージェント的意思決定能力を評価するベンチマークを提案。
原題: PhysAI-Bench: A Benchmark for LLM-Based Agentic Decision-Making in Autonomous UAV-Centric Physical AI / Mohamed Amine Ferrag, Merouane Debbah, Abderrahmane Lakas 他
日本語で読む → - 論文VLA画像認識
MaskVLA: 視覚マスキングによるVision-Language-Actionモデルの軌道過学習の抑制
VLAモデルの微調整時にメインカメラの視覚情報をランダムに一部マスクすることで、手首カメラ情報の活用を促し、軌道過学習を防いで汎化性能とタスク成功率を向上させる手法を提案。
原題: MaskVLA: Visual Masking Against Trajectory Overfitting of Vision-Language-Action Model / Yuxuan Jiang, Jiaying Huang, Ge Wang 他
日本語で読む → - 論文VLAロボティクス
TaskAnchor: 長期的マニピュレーションのための反応型VLAにおけるタスク状態の接地
視覚的に似た観測でも実行段階によって行動が異なる「タスク状態の曖昧さ」を解消するため、実行履歴に基づく軽量アダプタTaskAnchorを提案し、VLAの成功率を大幅に向上させた。
原題: TaskAnchor: Grounding Task State in Reactive VLAs for Long-Horizon Manipulation / Hengyan Liu, Wenlve Zhou, Bo Yue 他
日本語で読む → - 論文VLA画像認識
潜在行動モデルにおける代数的整合性だけでは時間構造を保証できない
潜在行動モデルの代数的整合性(加法性・反対称性)が時間構造の獲得を証明しないことを示し、制約なしモデルでも同程度の誤差削減が得られることを明らかにした。
原題: Algebraic Consistency Alone Does Not Certify Temporal Structure in Latent Action Models / Di Wen, Ruodi Zhang, Kailun Yang 他
日本語で読む → - 論文VLAロボティクス
人間中心マルチモーダル観測からの能動的ロボット行動推論
明示的な指示なしに、人間と環境のマルチモーダルな手がかりからロボットが取るべき行動を判断する「能動的ロボット行動推論」を定式化し、実世界データセットProActionと参照モデルMMC2Actを提案した。
原題: Cognitive Action Reasoning for Proactive Robots from Human-Centered Multimodal Observations / Zhihao Gu, Kechao Zhu, Yuanfeng Wu 他
日本語で読む → - 論文VLAロボティクス
CompVLA: 接触を伴うマニピュレーションのための可変コンプライアンス視覚-言語-行動モデル
RGB画像と言語入力から動作と剛性行列を同時に予測し、接触の多いタスクで高い成功率を達成するVLAフレームワークを提案した。
原題: CompVLA: A Variable Compliance Vision-Language-Action Model for Contact-rich Manipulation / Jongmin Kim, Junsu Ha, Che-Sang Park 他
日本語で読む → - 論文VLAロボティクス
AR-WAM: 視覚条件付きエージェント対応ワールドアクションモデルによるロボットマニピュレーション
言語指示の代わりにバウンディングボックスと操作トークンで条件付けする0.5Bパラメータの世界行動モデルを提案し、エージェント駆動のロボット制御を実現した。
原題: AR-WAM: A Visual-Conditioned Agent-Ready World Action Model for Robotic Manipulation / Yicheng Jiang, Zesen Gan, Xiaobo Wang 他
日本語で読む → - 論文VLAロボティクス
接地行動モデル:ロボティクスの基盤としての3Dグラウンディング
言語・点・ボックス指示を対象物の3D表現に変換し、マルチストリームTransformerで行動を予測するロボット基盤モデルGAMを提案。RoboTwin 2.0やLIBERO-PROで高い成功率を示した。
原題: Grounded Action Model: 3D Grounding as a Foundation for Robotics / Gehao Zhang, Weikai Huang, Shailesh Shailesh 他
日本語で読む → - 論文VLAロボティクス
ForceRFT: 力誘導残差強化学習によるVLA行動の洗練
接触を伴うタスク向けに、人間の修正と自律的な試行結果から力条件付きの残差行動を学習し、VLA方策を改善するフレームワークを提案。
原題: ForceRFT: Refining VLA Actions through Force-Guided Residual Reinforcement Learning / Yichen Wang, Chaoyang Zhang, Xuqi Su 他
日本語で読む → - 論文VLAロボティクス
閉ループ崩壊の解剖:圧縮VLAポリシーの因果的事例研究
圧縮された操作ポリシーがオフライン評価を通過しながら閉ループで崩壊する事例を因果的に分析し、失敗の構造と標準的な修復法が効かないことを示した。
原題: Anatomy of a Closed-Loop Collapse: A Causal Case Study of a Compressed VLA Policy / Fengze Jia
日本語で読む → - 論文VLAロボティクス
非同期リプレイ固定方策改善による安定かつ効率的な実世界オンラインVLA事後学習
ロールアウトと学習を並行して行い、リプレイされた行動に基づいて価値関数と方策を更新することで、実世界のVLAモデルを短時間で安定的にオンライン事後学習する手法を提案。
原題: Stable and Efficient Real-World Online VLA Post-Training via Asynchronous Replay-Anchored Policy Improvement / Jiarui Yang, Jiajin Zhang, Bin Zhu 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルの連合ファインチューニングに関する実証研究とオープンテストベッド
事前学習済みVLAモデルを連合学習でファインチューニングする際の設計選択を体系的に検証し、シミュレーションと実機実験を通じて知見と課題を明らかにした。
原題: An Empirical Study and Open Testbed for Federated Fine-Tuning of Vision-Language-Action Models / Zhekai Duan, Kevin Ziyang Xie, Xinyu Tan 他
日本語で読む → - 論文VLAロボティクス
StateMem: VLAポリシーのための単一状態残差メモリと適応推論
予測誤差で更新する単一のメモリトークンとキャッシュ再利用の適応制御により、履歴情報を保持しつつ計算を削減するVLAポリシーを提案。
原題: StateMem: Single-State Residual Memory with Adaptive Inference for Vision-Language-Action Policies / Wenzhuo Li, Qiongfeng Shi, Yi Zhou
日本語で読む → - 論文VLA機械学習
政策不確実性を活用した効率的なワールドモデルベースVLA政策最適化のための優先ロールアウト
VLA政策の強化学習において、政策の不確実性が高い状態に優先的にモデルロールアウトを割り当てる軽量サンプリング層U-GROWを提案し、シミュレーションと実機のマニピュレーションタスクで効率と有効性を示した。
原題: Prioritized Rollouts for Efficient World Model-based Vision-Language-Action Policy Optimization / Yifei Sheng, Haoxiang Ren, Zhilong Zhang 他
日本語で読む → - 論文VLAロボティクス
H-VLA:キーアクション推論と運動計画を統合行動空間で行う階層型視覚-言語-行動モデル
高レベルのキーアクション推論と低レベルの運動生成を分離し、統一されたカメラ中心行動空間でロボット操作を学習する階層型VLAフレームワークを提案。
原題: H-VLA: Hierarchical Vision-Language-Action Model with Key-Action Reasoning and Motion Planning in a Unified Action Space / Xiongfeng Peng, Lu Xu, Yandong Wang 他
日本語で読む →