論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2024/10/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
基盤モデルによるゼロショットラベリングでロボット方策学習をスケールさせる
視覚言語基盤モデルを組み合わせ、未整理の長期ロボットデータに自然言語指示を自動でゼロショット付与するNILSを提案し、11.5万軌道以上をラベリングした。
原題: Scaling Robot Policy Learning via Zero-Shot Labeling with Foundation Models / Nils Blank, Moritz Reuss, Marcel Rühle 他
日本語で読む → - 論文VLAロボティクス
UNCOM: 卓上環境におけるゼロショット文脈認識コマンド理解
音声・ジェスチャー・場面文脈を統合し、事前学習モデルを活用してゼロショットでロボットへの自然言語指示を構造化するハイブリッドフレームワークを提案。TIAGo++ロボットで実環境評価し82.39%の成功率を達成。
原題: UNCOM: Zero-shot Context-Aware Command Understanding for Tabletop Scenarios / Antonio Galiza Cerdeira Gonzalez, Paweł Gajewski, Bipin Indurkhya
日本語で読む → - 論文VLAロボティクス
ロボット拡散トランスフォーマーの構成要素
拡散モデルとトランスフォーマーを組み合わせたロボット政策の設計指針を検討し、長期的な器用タスクで高性能を発揮する新アーキテクチャを提案した。
原題: The Ingredients for Robotic Diffusion Transformers / Sudeep Dasari, Oier Mees, Sebastian Zhao 他
日本語で読む → - 論文VLAロボティクス
AHA: ロボットマニピュレーションの失敗を検出・推論する視覚言語モデル
ロボット操作の失敗を自然言語で検出・説明するオープンソースVLM「AHA」を提案し、シミュレーションで生成した大規模失敗データセットで学習させ、実世界や未見タスクへの汎化性能を示した。
原題: AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation / Jiafei Duan, Wilbert Pumacay, Nishanth Kumar 他
日本語で読む → - 論文VLAロボティクス
LADEV: ロボットマニピュレーションにおける視覚-言語-行動モデルのための言語駆動型テスト・評価プラットフォーム
自然言語からシミュレーション環境を自動生成し、言い換えタスク指示やバッチ評価によりVLAモデルを効率的にテスト・評価するプラットフォームLADEVを提案した。
原題: LADEV: A Language-Driven Testing and Evaluation Platform for Vision-Language-Action Models in Robotic Manipulation / Zhijie Wang, Zhehua Zhou, Jiayang Song 他
日本語で読む → - 論文VLAロボティクス
事前学習済み視覚言語モデルの画像-テキスト検索とブラックボックス最適化によるロボット状態認識
事前学習済み視覚言語モデルの画像-テキスト検索を利用し、複数の言語プロンプトとその重みをブラックボックス最適化で調整することで、再学習なしに多様な環境状態を認識する手法を提案。
原題: Robotic State Recognition with Image-to-Text Retrieval Task of Pre-Trained Vision-Language Model and Black-Box Optimization / Kento Kawaharazuka, Yoshiki Obinata, Naoaki Kanazawa 他
日本語で読む → - 論文VLAロボティクス
生成ポリシーの失敗モードを解き明かす:一貫性と進捗のランタイムモニタリング
模倣学習ポリシーの失敗を、行動の時間的一貫性の統計的監視とVLMによるタスク進捗監視を組み合わせて検出するランタイム監視フレームワークSentinelを提案。
原題: Unpacking Failure Modes of Generative Policies: Runtime Monitoring of Consistency and Progress / Christopher Agia, Rohan Sinha, Jingyun Yang 他
日本語で読む → - 論文VLAロボティクス
ロボティクスにおける生成AIと強化学習の二重性:レビュー
生成AIと強化学習をロボティクスに統合する研究をレビューし、相互補完的な役割に着目した新たな分類法を提案するとともに、課題と今後の方向性を議論した。
原題: The Duality of Generative AI and Reinforcement Learning in Robotics: A Review / Angelo Moroncelli, Vishal Soni, Marco Forgione 他
日本語で読む → - 論文VLAロボティクス
G²TR: 大規模事前学習モデルを組み合わせたロボット指示追従のための汎用的接地時系列推論
人間の過去の行動を参照する指示に対し、大規模事前学習モデルを組み合わせて、関連する過去の映像区間の特定・対象物体の推論・現在位置の追跡を行う時系列推論手法を提案した。
原題: G$^{2}$TR: Generalized Grounded Temporal Reasoning for Robot Instruction Following by Combining Large Pre-trained Models / Riya Arora, Niveditha Narendranath, Aman Tambi 他
日本語で読む → - 論文VLAロボティクス
AIVIO: AI支援視覚慣性オドメトリによるUAVの閉ループ物体相対ナビゲーション
IMUとRGBカメラのみの最小構成で、合成データのみで学習した深層学習ベースの物体姿勢推定器を搭載し、物体相対の閉ループ飛行を実現したUAVシステムを提案。電力柱点検での実機実験で有効性を検証した。
原題: AIVIO: Closed-loop, Object-relative Navigation of UAVs with AI-aided Visual Inertial Odometry / Thomas Jantos, Martin Scheiber, Christian Brommer 他
日本語で読む → - 論文VLAロボティクス
VLMが見て、ロボットが動く:人間のデモ動画からロボット行動計画を生成
視覚言語モデル(VLM)を用いて人間のデモ動画を解釈し、ロボットのタスク計画を自動生成する手法SeeDoを提案。キーフレーム選択と視覚認識、VLM推論を統合し、シミュレーションと実機で有効性を検証した。
原題: VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model / Beichen Wang, Juexiao Zhang, Shuwen Dong 他
日本語で読む → - 論文VLA自然言語
身体性会話AIのためのユーザーエージェントシミュレーション
大規模言語モデルを用いて、仮想環境内でロボットと対話するユーザーエージェントを構築し、TEAChデータセットと比較して人間らしい対話行動を生成できるか評価した。
原題: Simulating User Agents for Embodied Conversational-AI / Daniel Philipov, Vardhan Dongre, Gokhan Tur 他
日本語で読む → - 論文VLAロボティクス
拡散トランスフォーマーポリシー
大規模マルチモーダル拡散トランスフォーマーで連続行動系列を直接ノイズ除去し、多様なロボットデータセットで汎化性能を向上させる手法を提案。
原題: Diffusion Transformer Policy / Zhi Hou, Tianyi Zhang, Yuwen Xiong 他
日本語で読む → - 論文VLAAI
安全制約付き計画のための言語モデルの検証と改良の統合手法
言語モデルが生成するロボットプログラムをオートマトン表現に変換して安全仕様を検証し、その結果を活用した微調整で安全なプログラム生成を効率化する手法を提案。
原題: Joint Verification and Refinement of Language Models for Safety-Constrained Planning / Yunhao Yang, Neel P. Bhatt, William Ward 他
日本語で読む → - 論文VLAロボティクス
ROSA: 自然言語でロボットを操作するROSエージェント
大規模言語モデルを活用し、自然言語による指示をROSのコマンドに変換してロボット操作を可能にするAIエージェントROSAを提案。ROS1/ROS2対応で安全性機構も備える。
原題: Enabling Novel Mission Operations and Interactions with ROSA: The Robot Operating System Agent / Rob Royce, Marcel Kaufmann, Jonathan Becktor 他
日本語で読む → - 論文VLAロボティクス
汎用ロボット基盤モデルを価値誘導で操る:V-GPS
オフライン強化学習で学習した価値関数を用いて汎用ロボット方策の行動を再ランク付けし、微調整なしで性能を向上させる手法を提案。
原題: Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance / Mitsuhiko Nakamoto, Oier Mees, Aviral Kumar 他
日本語で読む → - 論文VLAAI
オープンエンド対話からの目標推論
LLMとの対話から自然言語で目標を抽出し、ベイズ推論で不確実性を扱いながら多様なユーザー目標をオンラインで学習・達成する手法を提案。
原題: Goal Inference from Open-Ended Dialog / Rachel Ma, Jingyi Qu, Andreea Bobu 他
日本語で読む → - 論文VLA自然言語
不完全な世界モデルを用いた身体性環境への大規模言語モデルの接地
シミュレータなどの不完全な世界モデルを活用し、LLMエージェントが自動で多様な指示データを生成・自己改善することで、LLMの物理推論やロボティクスタスク性能を大幅に向上させる手法GLIMOを提案。
原題: Grounding Large Language Models In Embodied Environment With Imperfect World Models / Haolan Liu, Jishen Zhao
日本語で読む → - 論文VLA画像認識
HiRT: 階層型ロボットトランスフォーマーによるロボット制御の強化
大規模VLAモデルの計算コストと遅延を抑えるため、低頻度のVLMと高頻度の視覚ポリシーを組み合わせた階層型トランスフォーマーを提案し、動的タスクの成功率を向上させた。
原題: HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers / Jianke Zhang, Yanjiang Guo, Xiaoyu Chen 他
日本語で読む → - 論文VLA自然言語
対話によるコード生成:自動運転車テスト用シナリオ生成のための対話システム設計事例
自動運転車のシミュレーションテスト用に、自然言語でシナリオを生成する対話システムを設計。対話が成功に重要で、成功率が4.5倍向上することを示した。
原題: Conversational Code Generation: a Case Study of Designing a Dialogue System for Generating Driving Scenarios for Testing Autonomous Vehicles / Rimvydas Rubavicius, Antonio Valerio Miceli-Barone, Alex Lascarides 他
日本語で読む → - 論文VLAロボティクス
ニューロシンボリックなスキル発見による条件付き多段階プランニング
少数のラベルなし低レベルスキル軌道から汎化可能な高レベル記号スキルを獲得し、視覚言語モデルで解釈して多段階プランニングを行う手法を提案。実世界の雑然とした環境でも長期的タスクを実行できることを示した。
原題: Neuro-Symbolic Skill Discovery for Conditional Multi-Level Planning / Hakan Aktas, Yigit Yildirim, Ahmet Firat Gamsiz 他
日本語で読む → - 論文VLAロボティクス
EfficientEQA:オープン語彙な身体性質問応答への効率的アプローチ
ロボットが効率的に探索しながら自由形式で質問に答えるためのフレームワークを提案し、意味重視の探索と適応的停止、RAGによる回答生成で精度向上と探索ステップ削減を実現した。
原題: EfficientEQA: An Efficient Approach to Open-Vocabulary Embodied Question Answering / Kai Cheng, Zhengyuan Li, Xingpeng Sun 他
日本語で読む → - 論文VLAロボティクス
Hibikino-Musashi@Home 2024 チーム記述論文
家庭サービスロボットの競技チームが、視覚学習用データセット生成器とHSRシミュレータ上の開発環境、LLMによるタスクプランナを開発した取り組みをまとめた論文。
原題: Hibikino-Musashi@Home 2024 Team Description Paper / Kosei Isomoto, Akinobu Mizutani, Fumiya Matsuzaki 他
日本語で読む → - 論文VLAロボティクス
CoT-TL: 思考連鎖推論による低リソース時相知識表現を用いた計画指示の形式化
自然言語の計画指示をLinear Temporal Logicに変換する際、思考連鎖推論と意味役割を活用したデータ効率の良いインコンテキスト学習フレームワークCoT-TLを提案し、低データ設定で高精度を達成した。
原題: CoT-TL: Low-Resource Temporal Knowledge Representation of Planning Instructions Using Chain-of-Thought Reasoning / Kumar Manas, Stefan Zwicklbauer, Adrian Paschke
日本語で読む → - 論文VLAロボティクス
SPINE: 非構造環境における不完全な自然言語指示ミッションのためのオンライン意味プランニング
大規模言語モデルを用いて、不完全な自然言語ミッション指示からサブタスクを推論し、オンラインで地図生成しながら再帰的ホライズン計画で実行するプランナを提案。2万m²超の屋外環境で既存手法の2倍以上の効率を達成。
原題: SPINE: Online Semantic Planning for Missions with Incomplete Natural Language Specifications in Unstructured Environments / Zachary Ravichandran, Varun Murali, Mariliza Tzes 他
日本語で読む → - 論文VLAロボティクス
言語駆動型方策蒸留によるマルチエージェント強化学習の協調運転
LLMを教師エージェントとして用い、その意思決定を小規模な生徒エージェントに蒸留することで、協調運転タスクにおけるMARLの学習効率と性能を向上させる手法を提案した。
原題: Language-Driven Policy Distillation for Cooperative Driving in Multi-Agent Reinforcement Learning / Jiaqi Liu, Chengkai Xu, Peng Hang 他
日本語で読む → - 論文VLA機械学習
π0: 汎用ロボット制御のための視覚-言語-行動フローモデル
事前学習済み視覚言語モデルにフローマッチングを組み合わせ、多様なロボットの大規模データで訓練することで、洗濯物畳みや箱組み立てなどの器用なタスクをゼロショットや言語指示で実行できる汎用ロボット基盤モデルを提案した。
原題: π0: A Vision-Language-Action Flow Model for General Robot Control / Kevin Black, Noah Brown, Danny Driess 他
日本語で読む → - 論文VLAロボティクス
GenDP: カテゴリレベル汎化を実現する3Dセマンティックフィールド拡散ポリシー
マルチビューRGBDから大規模視覚モデルで3D記述子場を生成し、参照記述子と比較して意味場を得ることで、拡散ポリシーの未見物体への汎化性能を20%から93%に向上させた。
原題: GenDP: 3D Semantic Fields for Category-Level Generalizable Diffusion Policy / Yixuan Wang, Guang Yin, Binghao Huang 他
日本語で読む → - 論文VLAロボティクス
Flex: 基盤モデル特徴量によるエンドツーエンドのテキスト指示視覚ナビゲーション
事前学習済みVLMを凍結したパッチ単位の特徴抽出器として使い、少量のシミュレーションデータで訓練したドローンの視覚ナビゲーション方策が、未知のテキスト指示や実世界の視覚変化に汎化できることを示した。
原題: Flex: End-to-End Text-Instructed Visual Navigation from Foundation Model Features / Makram Chahine, Alex Quach, Alaa Maalouf 他
日本語で読む → - 論文VLAロボティクス
すべてを見つけ出せ:マルチオブジェクト探索のための汎用視覚言語モデル手法
視覚言語モデルを活用し、複数物体を効率的に探索する手法Finderを提案。マルチチャネルスコアマップで複数物体を同時追跡し、実世界・シミュレーションで既存手法を上回る性能を示した。
原題: Find Everything: A General Vision Language Model Approach to Multi-Object Search / Daniel Choi, Angus Fung, Haitong Wang 他
日本語で読む →