論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2024/12/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
製造設備選定を支援するLLMベースのコパイロットの設計
LLMとRAGを組み合わせ、ロボット・フィーダ・ビジョンシステムの選定をガイド付きで支援するコパイロットを提案し、産業パートナーの3ユースケースで有効性を確認した。
原題: Designing an LLM-Based Copilot for Manufacturing Equipment Selection / Jonas Werheid, Oleksandr Melnychuk, Hans Zhou 他
日本語で読む → - 論文VLAロボティクス
汎用ロボットのための視覚言語行動モデル構築で重要な要素
視覚言語行動モデル(VLA)の性能を左右する設計要因を大規模実験で分析し、汎用ロボット向けの新しいVLAファミリーRoboVLMsを提案した論文。
原題: What Matters in Building Vision-Language-Action Models for Generalist Robots / Xinghang Li, Peiyan Li, Long Qian 他
日本語で読む → - 論文VLAロボティクス
報酬と方策の共進化による言語指示からの効率的なスキル獲得
LLMで報酬関数を自動設計しつつ、報酬関数と方策を交互に進化させることで、言語指示からロボットスキルを効率的に獲得するフレームワークを提案。
原題: Efficient Language-instructed Skill Acquisition via Reward-Policy Co-Evolution / Changxin Huang, Yanbin Chang, Junfan Lin 他
日本語で読む → - 論文VLAロボティクス
環境知覚を活用した少数例での身体性エージェントの計画と再計画
言語指示と環境知覚を組み合わせ、視覚的手がかりで指示の曖昧さを補正しながら、少数の例で身体性エージェントのタスク計画を改善するFLAREを提案した。
原題: Multi-Modal Grounded Planning and Efficient Replanning For Learning Embodied Agents with A Few Examples / Taewoong Kim, Byeonghwi Kim, Jonghyun Choi
日本語で読む → - 論文VLAAI
後知恵プランナー:実体指示追従のための閉ループ少数ショットプランナー
大規模言語モデルを用いた実体指示追従タスクにおいて、POMDPとして定式化し、適応モジュールと後知恵手法を組み合わせた閉ループプランナーを提案。少数ショット設定で従来の教師ありエージェントに匹敵または凌駕する性能を実現した。
原題: Hindsight Planner: A Closed-Loop Few-Shot Planner for Embodied Instruction Following / Yuxiao Yang, Shenao Zhang, Zhihan Liu 他
日本語で読む → - 論文VLAロボティクス
社会的に敏感な領域における基盤モデルのガードレール構築のための接地オブザーバフレームワーク
ロボットの行動選択に着想を得て、基盤モデルの振る舞いをリアルタイムに監視・調整する「接地オブザーバ」フレームワークを提案し、雑談を維持するロボット対話システムで実証した。
原題: A Grounded Observer Framework for Establishing Guardrails for Foundation Models in Socially Sensitive Domains / Rebecca Ramnauth, Dražen Brščić, Brian Scassellati
日本語で読む → - 論文VLA画像認識
想像による計画:視覚と言語によるナビゲーションのためのエピソード的シミュレーションとエピソード的記憶
人間のエピソード的シミュレーションと記憶に着想を得て、エージェントが未来のシーンを想像しながら記憶を拡張するVLNアーキテクチャを提案し、SPLで最先端を達成した。
原題: Planning from Imagination: Episodic Simulation and Episodic Memory for Vision-and-Language Navigation / Yiyuan Pan, Yunzhe Xu, Zhe Liu 他
日本語で読む → - 論文VLAロボティクス
RoboMatrix: スキル中心の階層型フレームワークによるオープンワールドでのスケーラブルなロボットタスク計画と実行
多様なタスクから汎用メタスキルを抽出し、LLMによるタスク分解と移動・操作を統合したVLAモデルで未見タスクを遂行するスキル中心の階層型ロボットフレームワークを提案した。
原題: RoboMatrix: A Skill-centric Hierarchical Framework for Scalable Robot Task Planning and Execution in Open-World / Weixin Mao, Weiheng Zhong, Zhou Jiang 他
日本語で読む → - 論文VLAロボティクス
CoA-VLA: 視覚・テキストのアフォーダンス連鎖による視覚言語行動モデルの改善
ロボットの行動予測に、物体・把持・空間・移動の4種類のアフォーダンスを視覚とテキストで段階的に推論させることで、複雑なタスクでの精度と頑健性を高める手法を提案。
原題: CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance / Jinming Li, Yichen Zhu, Zhibin Tang 他
日本語で読む → - 論文VLAロボティクス
Diffusion-VLA: 自己生成推論による汎用性と解釈性を備えたロボット基盤モデル
自己回帰モデルと拡散モデルを組み合わせ、自己生成した推論を方策学習に注入することで、解釈性が高く汎用性のある視覚運動方策を実現したロボット基盤モデル。
原題: Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning / Junjie Wen, Minjie Zhu, Yichen Zhu 他
日本語で読む → - 論文VLAAI
RLZero: ドメイン内教師なしで言語から直接方策を推論
言語指示から動画生成モデルで想像した観測を対象環境に投影し、教師なし強化学習で事前学習したエージェントが即座に模倣することで、追加学習なしに言語から行動を生成する手法を提案。
原題: RLZero: Direct Policy Inference from Language Without In-Domain Supervision / Harshit Sikchi, Siddhant Agarwal, Pranaya Jajoo 他
日本語で読む → - 論文VLAロボティクス
ロボティクス応用に向けたTransformerの進展:レビュー
Transformerアーキテクチャのロボティクスへの応用(知覚・計画・制御、事前学習済み基盤モデル、深層強化学習との統合など)に関する最近の研究動向をレビューし、課題と今後の方向性を論じた論文。
原題: Advances in Transformers for Robotic Applications: A Review / Nikunj Sanghai, Nik Bear Brown
日本語で読む → - 論文VLAロボティクス
QUART-Online: 四足歩行ロボット学習のための遅延フリー大規模マルチモーダル言語モデル
四足歩行ロボットの視覚-言語-行動タスクにおいて、推論遅延を解消するために行動チャンク離散化を導入し、言語基盤モデルの性能を落とさずにリアルタイム推論を実現した研究。
原題: QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning / Xinyang Tong, Pengxiang Ding, Yiguo Fan 他
日本語で読む → - 論文VLAロボティクス
高速でロバストな視覚運動リーマン・フローマッチング方策
リーマン多様体上のフローマッチングを用いて、幾何学的制約を考慮しつつ高速推論と安定性を両立した視覚運動方策を提案し、実機を含む10タスクで既存手法を上回る性能を示した。
原題: Fast and Robust Visuomotor Riemannian Flow Matching Policy / Haoran Ding, Noémie Jaquier, Jan Peters 他
日本語で読む → - 論文VLA画像認識
RoboTron-Drive:自動運転のためのオールインワン大規模マルチモーダルモデル
画像や多視点動画を入力とし、知覚・予測・計画を含む多様な自動運転タスクを単一モデルで実行する汎用大規模マルチモーダルモデルを提案し、複数ベンチマークで最先端性能を達成した。
原題: RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving / Zhijian Huang, Chengjian Feng, Feng Yan 他
日本語で読む → - 論文VLAロボティクス
Code-as-Monitor: 制約認識型ビジュアルプログラミングによるロボットの受動的・能動的障害検出
VLMが生成したコードで時空間制約を評価し、ロボットの予期せぬ失敗の事後検出と予見可能な失敗の事前防止を統一的に実現する手法を提案。
原題: Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection / Enshen Zhou, Qi Su, Cheng Chi 他
日本語で読む → - 論文VLA画像認識
動画予測ポリシー:予測的視覚表現を持つ汎用ロボットポリシー
動画拡散モデルが持つ未来予測的な視覚表現を活用し、ロボット操作のための汎用ポリシーを学習する手法を提案。Calvinベンチマークと実世界の巧緻操作で大幅な性能向上を達成した。
原題: Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations / Yucheng Hu, Yanjiang Guo, Pengchao Wang 他
日本語で読む → - 論文VLAロボティクス
スコア・分布マッチング方策:マッチング蒸留による高速視覚運動方策
拡散方策をスコアマッチングと分布マッチングの二段階最適化で1ステップ生成器に変換し、6倍の推論高速化と高品質な行動生成を両立させた。
原題: Score and Distribution Matching Policy: Advanced Accelerated Visuomotor Policies via Matched Distillation / Bofang Jia, Pengxiang Ding, Can Cui 他
日本語で読む → - 論文VLAロボティクス
NaVILA: 脚式ロボットのための視覚-言語-行動モデルによるナビゲーション
脚式ロボットの視覚言語ナビゲーションにおいて、VLAモデルで「75cm前進」のような中間行動を生成し、それを強化学習による歩行ポリシーで実行する2階層フレームワークを提案した論文。
原題: NaVILA: Legged Robot Vision-Language-Action Model for Navigation / An-Chieh Cheng, Yandong Ji, Zhaojing Yang 他
日本語で読む → - 論文VLAロボティクス
VLABench: 長期的推論を伴う言語条件付きロボット操作のための大規模ベンチマーク
視覚言語行動モデル(VLA)向けに、世界知識や意図理解、多段階推論を要する100カテゴリ・2000以上の物体からなる言語条件付き操作タスクのベンチマークを構築した。
原題: VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks / Shiduo Zhang, Zhe Xu, Peiju Liu 他
日本語で読む → - 論文VLAロボティクス
たった1段落で十分:相互作用する信頼されたLLMによる豊かなロボット行動
4つのLLMを自然言語で連携させてロボットを制御し、低い通信レートでも多様なタスクを実現できることを示した研究。
原題: A Paragraph is All It Takes: Rich Robot Behaviors from Interacting, Trusted LLMs / OpenMind, Shaohong Zhong, Adam Zhou 他
日本語で読む → - 論文VLAロボティクス
TalkWithMachines:大規模・視覚言語モデルによる解釈可能な産業用ロボティクスのための人間-ロボットインタラクション強化
LLMとVLMをロボットの知覚・制御に統合し、自然言語指示の理解や内部状態の言語化を通じて、安全が重要な産業用ロボットの解釈可能性と人間-ロボットインタラクションを向上させる4つの制御ワークフローを提案・実験した論文。
原題: TalkWithMachines: Enhancing Human-Robot Interaction for Interpretable Industrial Robotics Through Large/Vision Language Models / Ammar N. Abbas, Csaba Beleznai
日本語で読む → - 論文VLAAI
視覚言語モデルと対照的プロンプトアンサンブルによる身体性エージェントの効率的な方策適応
事前学習済み視覚言語モデルと複数の視覚プロンプトを対照的に学習・アンサンブルし、身体性RLエージェントが未知の視覚環境変化に効率的に適応できる枠組みConPEを提案。
原題: Efficient Policy Adaptation with Contrastive Prompt Ensemble for Embodied Agents / Wonje Choi, Woo Kyung Kim, SeungHyun Kim 他
日本語で読む → - 論文VLAロボティクス
大規模人間動画から学ぶ汎用人型ポーズ制御
2000万件超の人間動画から人型ロボットのポーズとテキスト指示のデータセットHumanoid-Xを構築し、テキスト入力で人型ロボットを制御する大規模モデルUH-1を学習した。
原題: Learning from Massive Human Videos for Universal Humanoid Pose Control / Jiageng Mao, Siheng Zhao, Siqi Song 他
日本語で読む → - 論文VLAロボティクス
Emma-X: 接地された思考連鎖と先読み空間推論を備えた身体性マルチモーダル行動モデル
ロボット操作データセットBridgeV2を基に階層的な身体性データセットを構築し、把持状態と運動軌跡に基づく軌跡分割戦略を導入することで、接地された思考連鎖と先読み空間推論を可能にするVLAモデルEmma-Xを提案した。
原題: Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning / Qi Sun, Pengfei Hong, Tej Deep Pala 他
日本語で読む → - 論文VLA画像認識
状態から視覚へのDAggerと視覚強化学習はいつ選ぶべきか?
状態方策を事前学習してからオンライン模倣で視覚方策を学ぶ2段階手法State-to-Visual DAggerと視覚RLを16タスクで比較し、難タスクではDAggerが安定して優れるがサンプル効率の利点は限定的だと示した実証研究。
原題: When Should We Prefer State-to-Visual DAgger Over Visual Reinforcement Learning? / Tongzhou Mu, Zhaoyang Li, Stanisław Wiktor Strzelecki 他
日本語で読む → - 論文VLAロボティクス
DaDu-E:ロボット計算パイプラインにおける大規模言語モデルの役割を再考する
軽量LLMとスキル命令・フィードバック・記憶拡張を組み合わせた閉ループ計画フレームワークDaDu-Eを提案し、大規模モデル並みの成功率を6.6倍少ない計算量で実現した。
原題: DaDu-E: Rethinking the Role of Large Language Model in Robotic Computing Pipeline / Wenhao Sun, Sai Hou, Zixuan Wang 他
日本語で読む → - 論文VLAロボティクス
ロボットに怒鳴らないで:言語モデル駆動ロボットのための協調インターフェースとしての物理的修正
LLMで動作するロボットに対し、人間が物理的な力で動きを修正すると、その意図を再推定して自然言語に変換し、以後のLLMの指示生成を改善する手法を提案した。
原題: Don't Yell at Your Robot: Physical Correction as the Collaborative Interface for Language Model Powered Robots / Chuye Zhang, Yifei Simon Shao, Harshil Parekh 他
日本語で読む → - 論文VLAロボティクス
Moto: 動画からロボット操作を学習するための橋渡し言語としての潜在モーショントークン
動画を潜在モーショントークン列に変換し、自己回帰的に事前学習することで、ロボット操作に転移可能な運動知識を獲得する手法を提案。
原題: Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos / Yi Chen, Yuying Ge, Weiliang Tang 他
日本語で読む → - 論文VLA機械学習
STEVE-Audio: Minecraftエージェントの目標条件付けモダリティの拡張
MinecraftエージェントSTEVE-1に音声を目標条件として与えられるよう拡張し、音声から潜在目標空間へのマッピングを学習した研究。
原題: STEVE-Audio: Expanding the Goal Conditioning Modalities of Embodied Agents in Minecraft / Nicholas Lenzen, Amogh Raut, Andrew Melnik
日本語で読む →