論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
オープンボキャブラリ目標理解を備えたUAV向け接地視覚言語ナビゲーション
LLMとVLMを組み合わせ、機体の単眼カメラ映像のみから言語指示に従って連続速度指令を生成するUAVナビゲーションフレームワークVLFlyを提案し、未学習環境でも高い汎化性能を示した。
原題: Grounded Vision-Language Navigation for UAVs with Open-Vocabulary Goal Understanding / Yuhang Zhang, Haosheng Yu, Jiaping Xiao 他
日本語で読む → - 論文VLAロボティクス
ControlVLA: 事前学習済み視覚言語行動モデルのための少数ショット物体中心適応
ControlNet風のアーキテクチャで物体中心表現を導入し、10〜20回のデモンストレーションだけで多様な実世界操作タスクに適応できるフレームワークを提案。
原題: ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models / Puhao Li, Yingying Wu, Ziheng Xi 他
日本語で読む → - 論文VLAロボティクス
自律運転のためのコミュニケーション型世界モデルの自己中心学習
各エージェントが低次元の潜在表現で世界モデルを学習し、軽量な通信で情報共有しながら自己中心学習を行うMARL手法CALLを提案し、CARLAでの軌道計画タスクで性能向上を示した。
原題: Ego-centric Learning of Communicative World Models for Autonomous Driving / Hang Wang, Dechen Gao, Junshan Zhang
日本語で読む → - 論文VLAロボティクス
ProVox: 状況に応じた人とロボットの協調のためのパーソナライズと先回り計画
大規模言語モデルを活用し、ユーザーの好みや意図を事前に取り込んで、指示を待たずに先回りして行動を計画する協働ロボットの枠組みを提案した。家庭内の調理補助タスクでのユーザー研究により評価した。
原題: ProVox: Personalization and Proactive Planning for Situated Human-Robot Collaboration / Jennifer Grannen, Siddharth Karamcheti, Blake Wulfe 他
日本語で読む → - 論文VLAロボティクス
AMPLIFY: ロボット学習のためのアクションなし動き事前分布
アクションラベルなしの大規模動画からキーポイント軌跡を離散モーショントークンに符号化し、順動力学と逆動力学を分離して学習することで、ロボット方策の汎化性能を向上させるフレームワーク。
原題: AMPLIFY: Actionless Motion Priors for Robot Learning from Videos / Jeremy A. Collins, Loránd Cheng, Kunal Aneja 他
日本語で読む → - 論文自動運転/VLAロボティクス
VLM統合型実世界自動運転のための階層的テストプラットフォーム
VLMを組み込んだ自動運転システムを実世界の閉鎖コースで評価するため、低遅延ミドルウェアと知覚・計画・制御を分離した階層的テストプラットフォームを提案し、ケーススタディで有効性を示した。
原題: A Hierarchical Test Platform for Vision Language Model (VLM)-Integrated Real-World Autonomous Driving / Yupeng Zhou, Can Cui, Juntong Peng 他
日本語で読む → - 論文VLA画像認識
視覚的身体脳:マルチモーダル大規模言語モデルに空間での知覚・思考・制御を
マルチモーダルLLMをロボット制御に統合するVeBrainを提案し、テキストベースの制御信号を実機の動作ポリシーに変換するアダプタと大規模指示データセットで脚ロボットやアームの適応的な操作を実現した。
原題: Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces / Gen Luo, Ganlin Yang, Ziyang Gong 他
日本語で読む → - 論文VLAロボティクス
EASE: 自己教師ありエネルギー最小化による身体性を伴う能動的イベント知覚
予測誤差とエントロピーを内在的シグナルとして自由エネルギー最小化を行い、時空間表現学習と身体制御を統合した自己教師ありフレームワークEASEを提案。注釈や外部報酬なしでイベントのセグメンテーション・要約・追跡を実現する。
原題: EASE: Embodied Active Event Perception via Self-Supervised Energy Minimization / Zhou Chen, Sanjoy Kundu, Harsimran S. Baweja 他
日本語で読む → - 論文VLA機械学習
大規模視覚言語モデルのフィードバックを活用する評価ベース強化学習の強化
大規模視覚言語モデルから軌道の絶対評価を得て報酬関数を学習するERL-VLMを提案し、データ不均衡やノイズに対処して従来手法を上回る性能を示した。
原題: Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models / Tung Minh Luu, Younghwan Lee, Donghoon Lee 他
日本語で読む → - 論文VLAロボティクス
物体中心3Dモーションフィールドによる人間動画からのロボット学習
人間の動画から物体中心の3Dモーションフィールドを抽出し、ロボットのゼロショット制御を可能にするフレームワークを提案。ノイズの多い深度から頑健に動きを推定し、多様なタスクで高い成功率を達成。
原題: Object-centric 3D Motion Field for Robot Learning from Human Videos / Zhao-Heng Yin, Sherry Yang, Pieter Abbeel
日本語で読む → - 論文VLAロボティクス
PSALM-V: 大規模言語モデルによる対話型視覚環境での記号計画の自動化
視覚環境での試行錯誤を通じて行動の事前・事後条件を自動学習し、LLMで記号計画を立案するシステムを提案。部分的観測下でも計画成功率を37%から74%に向上させた。
原題: PSALM-V: Automating Symbolic Planning in Interactive Visual Environments with Large Language Models / Wang Bill Zhu, Miaosen Chai, Ishika Singh 他
日本語で読む → - 論文VLAロボティクス
類推による適応:機能的対応関係を介した視覚運動ポリシーの分布外汎化
視覚運動ポリシーが分布外の見た目に遭遇した際、専門家から「どの訓練時の観察が機能的に対応するか」というフィードバックを得ることで、新たな実演収集や再訓練なしに既存の行動を転移させる手法を提案した。
原題: Adapting by Analogy: OOD Generalization of Visuomotor Policies via Functional Correspondence / Pranay Gupta, Henny Admoni, Andrea Bajcsy
日本語で読む → - 論文VLAロボティクス
RLRC: 強化学習による圧縮VLAモデルの性能回復
VLAモデルを構造的プルーニング・強化学習による性能回復・量子化の3段階で圧縮し、メモリを最大8分の1、推論を2.3倍高速化しつつ成功率を維持した。
原題: RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models / Yuxuan Chen, Yixin Han, Yize Huang 他
日本語で読む → - 論文VLA自然言語
ASMR: 大規模生成モデルによるロボット行動選択のためのデータ拡張フレームワーク
大規模言語モデルと拡散モデルで対話と環境画像を生成し、ロボット支援のマルチモーダル行動選択モデルをデータ拡張する手法を提案。実世界データで最高性能を達成。
原題: ASMR: Augmenting Life Scenario using Large Generative Models for Robotic Action Reflection / Shang-Chi Tsai, Seiya Kawano, Angel Garcia Contreras 他
日本語で読む → - 論文VLAロボティクス
ROSA: ロボット状態を活用した視覚言語と行動のアライメント
ロボットの状態推定データを自動取得してVLAモデルの訓練に組み込み、視覚言語空間と行動空間のずれを埋めることで、少ないデータでも高性能・高汎化を実現する手法を提案。
原題: ROSA: Harnessing Robot States for Vision-Language and Action Alignment / Yuqing Wen, Kefan Gu, Haoxuan Liu 他
日本語で読む → - 論文VLAロボティクス
MinD: リアルタイム計画と暗黙的リスク分析のためのデュアルシステム世界モデルの学習
低頻度の映像生成と高頻度の拡散ポリシーを非同期に組み合わせ、単一ステップの潜在特徴でリアルタイムに行動計画とリスク予測を行う世界モデルを提案。
原題: MinD: Learning A Dual-System World Model for Real-Time Planning and Implicit Risk Analysis / Xiaowei Chi, Kuangzhi Ge, Jiaming Liu 他
日本語で読む → - 論文VLAロボティクス
CapsDT: カプセルロボット操作のための拡散トランスフォーマー
胃内で動作するカプセル内視鏡ロボットを、視覚と言語指示から拡散トランスフォーマーで制御する手法を提案し、シミュレータで評価した。
原題: CapsDT: Diffusion-Transformer for Capsule Robot Manipulation / Xiting He, Mingwu Su, Xinqi Jiang 他
日本語で読む → - 論文VLAロボティクス
VLAモデルのポストトレーニングと人間の運動学習の類似性:進展・課題・動向
ロボット操作のためのVLAモデルのポストトレーニング手法を、人間の運動学習理論に基づいて4カテゴリに整理し、ベンチマーク結果や今後の課題をまとめたサーベイ。
原題: Parallels Between VLA Model Post-Training and Human Motor Learning: Progress, Challenges, and Trends / Tian-Yu Xiang, Ao-Qun Jin, Xiao-Hu Zhou 他
日本語で読む → - 論文VLAロボティクス
AntiGrounding:ロボット行動をVLM表現空間に持ち上げて意思決定を行う
ロボットの行動候補をVLMの表現空間に直接持ち上げ、複数視点の軌道を描画してVQAで指示に基づく意思決定を行うことで、ゼロショットで最適な閉ループ軌道を生成するフレームワークを提案。
原題: AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making / Wenbo Li, Shiyi Wang, Yiteng Chen 他
日本語で読む → - 論文VLAロボティクス
WorldVLA:自己回帰型行動世界モデルへの挑戦
視覚・言語・行動モデルと世界モデルを統合し、行動と画像の相互生成を通じて行動生成と将来画像予測を同時に改善する自己回帰型フレームワークを提案。
原題: WorldVLA: Towards Autoregressive Action World Model / Jun Cen, Chaohui Yu, Hangjie Yuan 他
日本語で読む → - 論文VLAAI
身体性ウェブエージェント:物理世界とデジタル世界を統合するエージェント知能
3Dシミュレーション環境とウェブインターフェースを統合したプラットフォームを構築し、料理・ナビゲーション・買い物など物理とデジタルの協調推論を要するタスクのベンチマークを提案した。
原題: Embodied Web Agents: Bridging Physical-Digital Realms for Integrated Agent Intelligence / Yining Hong, Rui Sun, Bingxuan Li 他
日本語で読む → - 論文VLAロボティクス
DyNaVLM: 動的視点と自己洗練グラフメモリを備えたゼロショット視覚言語ナビゲーションシステム
VLMを用いて、固定間隔に縛られず自由にナビゲーション目標を選べる視覚言語ナビゲーションを実現し、物体位置をトポロジカル関係として記憶する自己洗練グラフメモリで性能を高めた。
原題: DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory / Zihe Ji, Huangxuan Lin, Yue Gao
日本語で読む → - 論文VLAロボティクス
多段階ヒューマノイド操作のための階層的視覚言語プランニング
視覚言語モデルでスキル選択と完了判定を行う高レベル層、模倣学習による中間スキル層、強化学習による低レベル全身制御層からなる階層的枠組みを構築し、Unitree G1で多段階のピックアンドプレースを実現した。
原題: Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation / André Schakkal, Ben Zandonati, Zhutian Yang 他
日本語で読む → - 論文VLAロボティクス
CronusVLA: マルチフレーム視覚-言語-行動モデリングによる効率的で堅牢なマニピュレーション
単一フレームのVLAモデルをマルチフレームに拡張し、特徴チャンキングで履歴情報を集約することで、計算負荷を抑えつつ操作性能と観測の堅牢性を向上させた。
原題: CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling / Hao Li, Shuai Yang, Yilun Chen 他
日本語で読む → - 論文VLAロボティクス
CEED-VLA: 早期終了デコーディングを備えた一貫性視覚-言語-行動モデル
視覚-言語-行動モデルの推論を高速化するため、一貫性蒸留と早期終了デコーディングを導入し、4倍以上の加速を実現した。
原題: CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding / Wenxuan Song, Jiayi Chen, Pengxiang Ding 他
日本語で読む → - 論文VLAロボティクス
DualMap: 動的に変化する環境での自然言語ナビゲーションのためのオンラインオープン語彙セマンティックマッピング
ロボットが自然言語クエリで動的に変化する環境を理解・ナビゲートできるよう、グローバル抽象マップとローカル具体マップを組み合わせたオンラインオープン語彙セマンティックマッピングシステムを提案した。
原題: DualMap: Online Open-Vocabulary Semantic Mapping for Natural Language Navigation in Dynamic Changing Scenes / Jiajun Jiang, Yiming Zhu, Zirui Wu 他
日本語で読む → - 論文VLAロボティクス
LeVERB: 潜在視覚言語指示によるヒューマノイド全身制御
ヒューマノイドの全身制御向けに、視覚言語ポリシーが潜在的な行動語彙を学習し、強化学習ベースの全身制御ポリシーがそれを実行する階層型フレームワークを提案。150以上のタスクを含む初のsim-to-real対応ベンチマークで評価し、単純な階層型VLAより7.8倍高い成功率を達成。
原題: LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction / Haoru Xue, Xiaoyu Huang, Dantong Niu 他
日本語で読む → - 論文VLAロボティクス
Robot-R1: ロボティクスにおける身体性推論を強化する強化学習
強化学習を用いてロボット制御のための身体性推論を改善するフレームワークを提案し、SFTを上回る性能を達成した。
原題: Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics / Dongyoung Kim, Sumin Park, Huiwon Jang 他
日本語で読む → - 論文VLAロボティクス
能動的テスト時視覚言語ナビゲーション
不確実なナビゲーション結果に対するエピソード的フィードバックを用いたテスト時能動学習フレームワークATENAを提案し、混合エントロピー最適化と自己能動学習戦略で適応的な意思決定を実現した。
原題: Active Test-time Vision-Language Navigation / Heeju Ko, Sungjune Kim, Gyeongrok Oh 他
日本語で読む → - 論文VLAロボティクス
Goal-VLA: 画像生成VLMを物体中心の世界モデルとして活用するゼロショットロボットマニピュレーション
画像生成型VLMを世界モデルとして使い、目標状態の画像を生成して物体姿勢を導出することで、追加学習なしに多様な操作タスクを実現するフレームワークを提案。
原題: Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation / Haonan Chen, Jingxiang Guo, Bangjun Wang 他
日本語で読む →