論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2024/12/17 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA機械学習
PAE: 基盤モデルエージェントのための自律的スキル発見フレームワーク
基盤モデルエージェントが環境の文脈情報からタスクを自律的に提案し、VLMによる成功評価を報酬として強化学習でスキルを獲得する学習システムPAEを提案した。
原題: Proposer-Agent-Evaluator(PAE): Autonomous Skill Discovery For Foundation Model Internet Agents / Yifei Zhou, Qianlan Yang, Kaixiang Lin 他
日本語で読む → - 論文VLA機械学習
自己回帰的特徴とアドバンテージ重み付けによる高精度な行動基盤モデル
強化学習の行動基盤モデルFBの課題である線形タスク表現を自己回帰的特徴で非線形化し、オフラインRL技術を組み合わせて性能を向上させた。
原題: Finer Behavioral Foundation Models via Auto-Regressive Features and Advantage Weighting / Edoardo Cetin, Ahmed Touati, Yann Ollivier
日本語で読む → - 論文VLA画像認識
AutoTrust: 自動運転向け大規模視覚言語モデルの信頼性ベンチマーク
自動運転向け視覚言語モデルの信頼性を、信憑性・安全性・堅牢性・プライバシー・公平性の観点から評価するベンチマークを構築し、6つのモデルを比較評価した。
原題: AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving / Shuo Xing, Hongyuan Hua, Xiangbo Gao 他
日本語で読む → - 論文VLAロボティクス
RoboMatrix: スキル中心の階層型フレームワークによるオープンワールドでのスケーラブルなロボットタスク計画と実行
多様なタスクから汎用メタスキルを抽出し、LLMによるタスク分解と移動・操作を統合したVLAモデルで未見タスクを遂行するスキル中心の階層型ロボットフレームワークを提案した。
原題: RoboMatrix: A Skill-centric Hierarchical Framework for Scalable Robot Task Planning and Execution in Open-World / Weixin Mao, Weiheng Zhong, Zhou Jiang 他
日本語で読む → - 論文VLAロボティクス
TraceVLA:視覚トレースプロンプトで汎用ロボットポリシーの時空間認識を強化
状態行動軌跡を視覚的にエンコードする視覚トレースプロンプトを導入し、VLAモデルの時空間認識を改善。15万件の操作軌跡でOpenVLAを微調整したTraceVLAは、シミュレーションと実機で大幅な性能向上を達成。
原題: TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies / Ruijie Zheng, Yongyuan Liang, Shuaiyi Huang 他
日本語で読む → - 論文VLA画像認識
SAT: マルチモーダル言語モデルのための動的空間適性トレーニング
3Dシミュレータを用いて静的・動的な空間推論を含む17.5万件のQAペアと2万シーンからなるデータセットSATを構築し、マルチモーダル言語モデルの空間認識能力を訓練する手法を提案した。
原題: SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models / Arijit Ray, Jiafei Duan, Ellis Brown 他
日本語で読む → - 論文VLAロボティクス
QUART-Online: 四足歩行ロボット学習のための遅延フリー大規模マルチモーダル言語モデル
四足歩行ロボットの視覚-言語-行動タスクにおいて、推論遅延を解消するために行動チャンク離散化を導入し、言語基盤モデルの性能を落とさずにリアルタイム推論を実現した研究。
原題: QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning / Xinyang Tong, Pengxiang Ding, Yiguo Fan 他
日本語で読む → - 論文自動運転VLAロボティクス
PKRD-CoT: 自動運転向けマルチモーダル大規模言語モデルのための統合チェーン・オブ・ソート・プロンプティング
自動運転の知覚・知識・推論・意思決定の4能力に基づくゼロショットCoTプロンプト設計PKRD-CoTを提案し、GPT-4.0などMLLMの運転タスク性能を評価した研究。
原題: PKRD-CoT: A Unified Chain-of-thought Prompting for Multi-Modal Large Language Models in Autonomous Driving / Xuewen Luo, Fan Ding, Yinsheng Song 他
日本語で読む → - 論文VLAロボティクス
高速でロバストな視覚運動リーマン・フローマッチング方策
リーマン多様体上のフローマッチングを用いて、幾何学的制約を考慮しつつ高速推論と安定性を両立した視覚運動方策を提案し、実機を含む10タスクで既存手法を上回る性能を示した。
原題: Fast and Robust Visuomotor Riemannian Flow Matching Policy / Haoran Ding, Noémie Jaquier, Jan Peters 他
日本語で読む → - 論文VLA画像認識
RoboTron-Drive:自動運転のためのオールインワン大規模マルチモーダルモデル
画像や多視点動画を入力とし、知覚・予測・計画を含む多様な自動運転タスクを単一モデルで実行する汎用大規模マルチモーダルモデルを提案し、複数ベンチマークで最先端性能を達成した。
原題: RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving / Zhijian Huang, Chengjian Feng, Feng Yan 他
日本語で読む → - 論文VLAロボティクス
ロボットに怒鳴らないで:言語モデル駆動ロボットのための協調インターフェースとしての物理的修正
LLMで動作するロボットに対し、人間が物理的な力で動きを修正すると、その意図を再推定して自然言語に変換し、以後のLLMの指示生成を改善する手法を提案した。
原題: Don't Yell at Your Robot: Physical Correction as the Collaborative Interface for Language Model Powered Robots / Chuye Zhang, Yifei Simon Shao, Harshil Parekh 他
日本語で読む → - 論文VLA画像認識
想像による計画:視覚と言語によるナビゲーションのためのエピソード的シミュレーションとエピソード的記憶
人間のエピソード的シミュレーションと記憶に着想を得て、エージェントが未来のシーンを想像しながら記憶を拡張するVLNアーキテクチャを提案し、SPLで最先端を達成した。
原題: Planning from Imagination: Episodic Simulation and Episodic Memory for Vision-and-Language Navigation / Yiyuan Pan, Yunzhe Xu, Zhe Liu 他
日本語で読む → - 論文VLAロボティクス
Code-as-Monitor: 制約認識型ビジュアルプログラミングによるロボットの受動的・能動的障害検出
VLMが生成したコードで時空間制約を評価し、ロボットの予期せぬ失敗の事後検出と予見可能な失敗の事前防止を統一的に実現する手法を提案。
原題: Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection / Enshen Zhou, Qi Su, Cheng Chi 他
日本語で読む → - 論文VLAロボティクス
ロボティクス応用に向けたTransformerの進展:レビュー
Transformerアーキテクチャのロボティクスへの応用(知覚・計画・制御、事前学習済み基盤モデル、深層強化学習との統合など)に関する最近の研究動向をレビューし、課題と今後の方向性を論じた論文。
原題: Advances in Transformers for Robotic Applications: A Review / Nikunj Sanghai, Nik Bear Brown
日本語で読む → - 論文VLAロボティクス
社会的に敏感な領域における基盤モデルのガードレール構築のための接地オブザーバフレームワーク
ロボットの行動選択に着想を得て、基盤モデルの振る舞いをリアルタイムに監視・調整する「接地オブザーバ」フレームワークを提案し、雑談を維持するロボット対話システムで実証した。
原題: A Grounded Observer Framework for Establishing Guardrails for Foundation Models in Socially Sensitive Domains / Rebecca Ramnauth, Dražen Brščić, Brian Scassellati
日本語で読む → - 論文VLAロボティクス
連続環境における制約認識型ゼロショット視覚言語ナビゲーション
ゼロショットVLN-CEを制約認識型のサブ命令完了プロセスとして再構成し、CSMとCVMの2モジュールでナビゲーション計画を逐次生成するCA-Navを提案、ベンチマークで最高性能を達成した。
原題: Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments / Kehan Chen, Dong An, Yan Huang 他
日本語で読む → - 論文VLA画像認識
動画予測ポリシー:予測的視覚表現を持つ汎用ロボットポリシー
動画拡散モデルが持つ未来予測的な視覚表現を活用し、ロボット操作のための汎用ポリシーを学習する手法を提案。Calvinベンチマークと実世界の巧緻操作で大幅な性能向上を達成した。
原題: Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations / Yucheng Hu, Yanjiang Guo, Pengchao Wang 他
日本語で読む → - 論文VLAロボティクス
汎用ロボットのための視覚言語行動モデル構築で重要な要素
視覚言語行動モデル(VLA)の性能を左右する設計要因を大規模実験で分析し、汎用ロボット向けの新しいVLAファミリーRoboVLMsを提案した論文。
原題: What Matters in Building Vision-Language-Action Models for Generalist Robots / Xinghang Li, Peiyan Li, Long Qian 他
日本語で読む → - 論文VLAロボティクス
NaVILA: 脚式ロボットのための視覚-言語-行動モデルによるナビゲーション
脚式ロボットの視覚言語ナビゲーションにおいて、VLAモデルで「75cm前進」のような中間行動を生成し、それを強化学習による歩行ポリシーで実行する2階層フレームワークを提案した論文。
原題: NaVILA: Legged Robot Vision-Language-Action Model for Navigation / An-Chieh Cheng, Yandong Ji, Zhaojing Yang 他
日本語で読む → - 論文VLAロボティクス
Diffusion-VLA: 自己生成推論による汎用性と解釈性を備えたロボット基盤モデル
自己回帰モデルと拡散モデルを組み合わせ、自己生成した推論を方策学習に注入することで、解釈性が高く汎用性のある視覚運動方策を実現したロボット基盤モデル。
原題: Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning / Junjie Wen, Minjie Zhu, Yichen Zhu 他
日本語で読む → - 論文VLAロボティクス
VLABench: 長期的推論を伴う言語条件付きロボット操作のための大規模ベンチマーク
視覚言語行動モデル(VLA)向けに、世界知識や意図理解、多段階推論を要する100カテゴリ・2000以上の物体からなる言語条件付き操作タスクのベンチマークを構築した。
原題: VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks / Shiduo Zhang, Zhe Xu, Peiju Liu 他
日本語で読む → - 論文VLAロボティクス
たった1段落で十分:相互作用する信頼されたLLMによる豊かなロボット行動
4つのLLMを自然言語で連携させてロボットを制御し、低い通信レートでも多様なタスクを実現できることを示した研究。
原題: A Paragraph is All It Takes: Rich Robot Behaviors from Interacting, Trusted LLMs / OpenMind, Shaohong Zhong, Adam Zhou 他
日本語で読む → - 論文VLAロボティクス
TalkWithMachines:大規模・視覚言語モデルによる解釈可能な産業用ロボティクスのための人間-ロボットインタラクション強化
LLMとVLMをロボットの知覚・制御に統合し、自然言語指示の理解や内部状態の言語化を通じて、安全が重要な産業用ロボットの解釈可能性と人間-ロボットインタラクションを向上させる4つの制御ワークフローを提案・実験した論文。
原題: TalkWithMachines: Enhancing Human-Robot Interaction for Interpretable Industrial Robotics Through Large/Vision Language Models / Ammar N. Abbas, Csaba Beleznai
日本語で読む → - 論文VLAAI
視覚言語モデルと対照的プロンプトアンサンブルによる身体性エージェントの効率的な方策適応
事前学習済み視覚言語モデルと複数の視覚プロンプトを対照的に学習・アンサンブルし、身体性RLエージェントが未知の視覚環境変化に効率的に適応できる枠組みConPEを提案。
原題: Efficient Policy Adaptation with Contrastive Prompt Ensemble for Embodied Agents / Wonje Choi, Woo Kyung Kim, SeungHyun Kim 他
日本語で読む → - 論文VLAロボティクス
CoA-VLA: 視覚・テキストのアフォーダンス連鎖による視覚言語行動モデルの改善
ロボットの行動予測に、物体・把持・空間・移動の4種類のアフォーダンスを視覚とテキストで段階的に推論させることで、複雑なタスクでの精度と頑健性を高める手法を提案。
原題: CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance / Jinming Li, Yichen Zhu, Zhibin Tang 他
日本語で読む → - 論文VLAロボティクス
大規模人間動画から学ぶ汎用人型ポーズ制御
2000万件超の人間動画から人型ロボットのポーズとテキスト指示のデータセットHumanoid-Xを構築し、テキスト入力で人型ロボットを制御する大規模モデルUH-1を学習した。
原題: Learning from Massive Human Videos for Universal Humanoid Pose Control / Jiageng Mao, Siheng Zhao, Siqi Song 他
日本語で読む → - 論文VLAロボティクス
Emma-X: 接地された思考連鎖と先読み空間推論を備えた身体性マルチモーダル行動モデル
ロボット操作データセットBridgeV2を基に階層的な身体性データセットを構築し、把持状態と運動軌跡に基づく軌跡分割戦略を導入することで、接地された思考連鎖と先読み空間推論を可能にするVLAモデルEmma-Xを提案した。
原題: Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning / Qi Sun, Pengfei Hong, Tej Deep Pala 他
日本語で読む → - 論文VLA画像認識
状態から視覚へのDAggerと視覚強化学習はいつ選ぶべきか?
状態方策を事前学習してからオンライン模倣で視覚方策を学ぶ2段階手法State-to-Visual DAggerと視覚RLを16タスクで比較し、難タスクではDAggerが安定して優れるがサンプル効率の利点は限定的だと示した実証研究。
原題: When Should We Prefer State-to-Visual DAgger Over Visual Reinforcement Learning? / Tongzhou Mu, Zhaoyang Li, Stanisław Wiktor Strzelecki 他
日本語で読む → - 論文VLAAI
後知恵プランナー:実体指示追従のための閉ループ少数ショットプランナー
大規模言語モデルを用いた実体指示追従タスクにおいて、POMDPとして定式化し、適応モジュールと後知恵手法を組み合わせた閉ループプランナーを提案。少数ショット設定で従来の教師ありエージェントに匹敵または凌駕する性能を実現した。
原題: Hindsight Planner: A Closed-Loop Few-Shot Planner for Embodied Instruction Following / Yuxiao Yang, Shenao Zhang, Zhihan Liu 他
日本語で読む → - 論文VLAロボティクス
スコア・分布マッチング方策:マッチング蒸留による高速視覚運動方策
拡散方策をスコアマッチングと分布マッチングの二段階最適化で1ステップ生成器に変換し、6倍の推論高速化と高品質な行動生成を両立させた。
原題: Score and Distribution Matching Policy: Advanced Accelerated Visuomotor Policies via Matched Distillation / Bofang Jia, Pengxiang Ding, Can Cui 他
日本語で読む →