論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2024/10/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
ロボティクスにおける生成AIと強化学習の二重性:レビュー
生成AIと強化学習をロボティクスに統合する研究をレビューし、相互補完的な役割に着目した新たな分類法を提案するとともに、課題と今後の方向性を議論した。
原題: The Duality of Generative AI and Reinforcement Learning in Robotics: A Review / Angelo Moroncelli, Vishal Soni, Marco Forgione 他
日本語で読む → - 論文VLA機械学習
PointPatchRL:マスク付き再構成による点群強化学習の改善
点群をパッチ分割してトークン化しTransformerで処理する強化学習手法を提案し、マスク付き再構成による表現学習を組み合わせることで、変形物体を含む複雑な操作タスクで画像ベースの手法を上回る性能を示した。
原題: PointPatchRL -- Masked Reconstruction Improves Reinforcement Learning on Point Clouds / Balázs Gyenes, Nikolai Franke, Philipp Becker 他
日本語で読む → - 論文VLA自然言語
身体性強化学習エージェントへの教示:言語使用の情報量と多様性
強化学習エージェントへの言語入力について、フィードバックの情報量と表現の多様性が学習・推論に与える影響を4つのベンチマークで検証し、多様で情報豊富な言語教示が汎化と新タスクへの適応を促進することを示した。
原題: Teaching Embodied Reinforcement Learning Agents: Informativeness and Diversity of Language Use / Jiajun Xi, Yinong He, Jianing Yang 他
日本語で読む → - 論文VLAロボティクス
GHIL-Glue: フィルタリングされたサブゴール画像による階層制御
生成モデルが作るサブゴール画像をフィルタリングし、下位方策と効果的に繋ぐことで、言語条件付きロボット操作の汎化性能を向上させた研究。
原題: GHIL-Glue: Hierarchical Control with Filtered Subgoal Images / Kyle B. Hatch, Ashwin Balakrishna, Oier Mees 他
日本語で読む → - 論文VLAロボティクス
生成ポリシーの失敗モードを解き明かす:一貫性と進捗のランタイムモニタリング
模倣学習ポリシーの失敗を、行動の時間的一貫性の統計的監視とVLMによるタスク進捗監視を組み合わせて検出するランタイム監視フレームワークSentinelを提案。
原題: Unpacking Failure Modes of Generative Policies: Runtime Monitoring of Consistency and Progress / Christopher Agia, Rohan Sinha, Jingyun Yang 他
日本語で読む → - 論文VLAロボティクス
ワンステップ拡散方策:拡散蒸留による高速視覚運動方策
事前学習済み拡散方策を蒸留して1ステップで行動を生成する手法を提案し、推論速度を1.5Hzから62Hzへと大幅に高速化した。
原題: One-Step Diffusion Policy: Fast Visuomotor Policies via Diffusion Distillation / Zhendong Wang, Zhaoshuo Li, Ajay Mandlekar 他
日本語で読む → - 論文VLAロボティクス
文脈内学習でLLMにロボット動作を予測させるRoboPrompt
訓練なしのテキストのみのLLMが、キーフレームから抽出した動作と物体姿勢をテキスト化した実演を文脈内学習に用いてロボット動作を直接予測するフレームワークを提案。
原題: In-Context Learning Enables Robot Action Prediction in LLMs / Yida Yin, Zekai Wang, Yuvan Sharma 他
日本語で読む → - 論文VLAロボティクス
事前学習済み視覚言語モデルの画像-テキスト検索とブラックボックス最適化によるロボット状態認識
事前学習済み視覚言語モデルの画像-テキスト検索を利用し、複数の言語プロンプトとその重みをブラックボックス最適化で調整することで、再学習なしに多様な環境状態を認識する手法を提案。
原題: Robotic State Recognition with Image-to-Text Retrieval Task of Pre-Trained Vision-Language Model and Black-Box Optimization / Kento Kawaharazuka, Yoshiki Obinata, Naoaki Kanazawa 他
日本語で読む → - 論文VLAロボティクス
文脈ベースの視覚言語による場所認識
ゼロショットの言語駆動型セマンティックセグメンテーションで画素埋め込みを抽出し、追加学習なしでシーン変化に頑健な視覚的場所認識を実現した。
原題: Context-Based Visual-Language Place Recognition / Soojin Woo, Seong-Woo Kim
日本語で読む → - 論文VLAロボティクス
二重過程VLA:VLMを活用した効率的なロボットマニピュレーション
二重過程理論に着想を得て、大規模VLMで高レベル推論を低頻度で行い、小型モデルでリアルタイム制御を担う階層的VLAフレームワークを提案し、推論速度とタスク成功率を向上させた。
原題: A Dual Process VLA: Efficient Robotic Manipulation Leveraging VLM / ByungOk Han, Jaehong Kim, Jinhyeok Jang
日本語で読む → - 論文VLAロボティクス
視覚言語モデルによる対話の位置曖昧性解消とロボットナビゲーション
屋内ロボットが自然言語指示の位置曖昧性を、大規模言語モデルと視覚言語モデルによる複数ターンの対話で解消し、対象物体のIDから3D深度マップへとマッピングして目的地へ移動する手法を提案した。
原題: Resolving Positional Ambiguity in Dialogues by Vision-Language Models for Robot Navigation / Kuan-Lin Chen, Tzu-Ti Wei, Li-Tzu Yeh 他
日本語で読む → - 論文VLA機械学習
π0: 汎用ロボット制御のための視覚-言語-行動フローモデル
事前学習済み視覚言語モデルにフローマッチングを組み合わせ、多様なロボットの大規模データで訓練することで、洗濯物畳みや箱組み立てなどの器用なタスクをゼロショットや言語指示で実行できる汎用ロボット基盤モデルを提案した。
原題: π0: A Vision-Language-Action Flow Model for General Robot Control / Kevin Black, Noah Brown, Danny Driess 他
日本語で読む → - 論文VLA画像認識
現実的なUAV視覚言語ナビゲーションに向けて:プラットフォーム・ベンチマーク・手法
UAV向けの視覚言語ナビゲーション(VLN)を現実的にするため、飛行制御を備えたOpenUAVプラットフォーム、約1.2万軌道のデータセット、補助情報付きベンチマークUAV-Need-Help、およびマルチモーダルLLMベースのナビゲーション手法を提案した論文。
原題: Towards Realistic UAV Vision-Language Navigation: Platform, Benchmark, and Methodology / Xiangyu Wang, Donglin Yang, Ziqin Wang 他
日本語で読む → - 論文VLAロボティクス
LADEV: ロボットマニピュレーションにおける視覚-言語-行動モデルのための言語駆動型テスト・評価プラットフォーム
自然言語からシミュレーション環境を自動生成し、言い換えタスク指示やバッチ評価によりVLAモデルを効率的にテスト・評価するプラットフォームLADEVを提案した。
原題: LADEV: A Language-Driven Testing and Evaluation Platform for Vision-Language-Action Models in Robotic Manipulation / Zhijie Wang, Zhehua Zhou, Jiayang Song 他
日本語で読む → - 論文VLAロボティクス
AHA: ロボットマニピュレーションの失敗を検出・推論する視覚言語モデル
ロボット操作の失敗を自然言語で検出・説明するオープンソースVLM「AHA」を提案し、シミュレーションで生成した大規模失敗データセットで学習させ、実世界や未見タスクへの汎化性能を示した。
原題: AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation / Jiafei Duan, Wilbert Pumacay, Nishanth Kumar 他
日本語で読む → - 論文VLAロボティクス
CoT-TL: 思考連鎖推論による低リソース時相知識表現を用いた計画指示の形式化
自然言語の計画指示をLinear Temporal Logicに変換する際、思考連鎖推論と意味役割を活用したデータ効率の良いインコンテキスト学習フレームワークCoT-TLを提案し、低データ設定で高精度を達成した。
原題: CoT-TL: Low-Resource Temporal Knowledge Representation of Planning Instructions Using Chain-of-Thought Reasoning / Kumar Manas, Stefan Zwicklbauer, Adrian Paschke
日本語で読む → - 論文VLAロボティクス
GenDP: カテゴリレベル汎化を実現する3Dセマンティックフィールド拡散ポリシー
マルチビューRGBDから大規模視覚モデルで3D記述子場を生成し、参照記述子と比較して意味場を得ることで、拡散ポリシーの未見物体への汎化性能を20%から93%に向上させた。
原題: GenDP: 3D Semantic Fields for Category-Level Generalizable Diffusion Policy / Yixuan Wang, Guang Yin, Binghao Huang 他
日本語で読む → - 論文VLAロボティクス
VLMが見て、ロボットが動く:人間のデモ動画からロボット行動計画を生成
視覚言語モデル(VLM)を用いて人間のデモ動画を解釈し、ロボットのタスク計画を自動生成する手法SeeDoを提案。キーフレーム選択と視覚認識、VLM推論を統合し、シミュレーションと実機で有効性を検証した。
原題: VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model / Beichen Wang, Juexiao Zhang, Shuwen Dong 他
日本語で読む → - 論文VLAロボティクス
Flex: 基盤モデル特徴量によるエンドツーエンドのテキスト指示視覚ナビゲーション
事前学習済みVLMを凍結したパッチ単位の特徴抽出器として使い、少量のシミュレーションデータで訓練したドローンの視覚ナビゲーション方策が、未知のテキスト指示や実世界の視覚変化に汎化できることを示した。
原題: Flex: End-to-End Text-Instructed Visual Navigation from Foundation Model Features / Makram Chahine, Alex Quach, Alaa Maalouf 他
日本語で読む → - 論文VLAロボティクス
動画からの潜在行動事前学習
ロボットの行動ラベルなしでインターネット規模の動画からVLAモデルを事前学習する手法を提案し、実世界のマニピュレーションタスクで既存手法を上回る性能を示した。
原題: Latent Action Pretraining from Videos / Seonghyeon Ye, Joel Jang, Byeongguk Jeon 他
日本語で読む → - 論文VLAロボティクス
UNCOM: 卓上環境におけるゼロショット文脈認識コマンド理解
音声・ジェスチャー・場面文脈を統合し、事前学習モデルを活用してゼロショットでロボットへの自然言語指示を構造化するハイブリッドフレームワークを提案。TIAGo++ロボットで実環境評価し82.39%の成功率を達成。
原題: UNCOM: Zero-shot Context-Aware Command Understanding for Tabletop Scenarios / Antonio Galiza Cerdeira Gonzalez, Paweł Gajewski, Bipin Indurkhya
日本語で読む → - 論文VLA自然言語
対話によるコード生成:自動運転車テスト用シナリオ生成のための対話システム設計事例
自動運転車のシミュレーションテスト用に、自然言語でシナリオを生成する対話システムを設計。対話が成功に重要で、成功率が4.5倍向上することを示した。
原題: Conversational Code Generation: a Case Study of Designing a Dialogue System for Generating Driving Scenarios for Testing Autonomous Vehicles / Rimvydas Rubavicius, Antonio Valerio Miceli-Barone, Alex Lascarides 他
日本語で読む → - 論文VLAロボティクス
GR-2: ウェブ規模の知識を持つ生成型ビデオ・言語・行動モデルによるロボットマニピュレーション
3800万本のインターネット動画で事前学習した大規模モデルをロボット軌道で微調整し、100以上のタスクで平均97.7%の成功率と未知環境への高い汎化性能を実現した。
原題: GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation / Chi-Lam Cheang, Guangzeng Chen, Ya Jing 他
日本語で読む → - 論文VLAロボティクス
すべてを見つけ出せ:マルチオブジェクト探索のための汎用視覚言語モデル手法
視覚言語モデルを活用し、複数物体を効率的に探索する手法Finderを提案。マルチチャネルスコアマップで複数物体を同時追跡し、実世界・シミュレーションで既存手法を上回る性能を示した。
原題: Find Everything: A General Vision Language Model Approach to Multi-Object Search / Daniel Choi, Angus Fung, Haitong Wang 他
日本語で読む → - 論文VLAロボティクス
Robo-MUTUAL: 単一モーダル学習によるロボットのマルチモーダルタスク指示
単一モーダルの指示データを活用し、クロスモーダルアライメントを事前学習とCollapse/Corrupt操作で強化することで、ロボットがマルチモーダルなタスク指示を理解できるフレームワークを提案。
原題: Robo-MUTUAL: Robotic Multimodal Task Specification via Unimodal Learning / Jianxiong Li, Zhihao Wang, Jinliang Zheng 他
日本語で読む → - 論文VLAロボティクス
ロボット拡散トランスフォーマーの構成要素
拡散モデルとトランスフォーマーを組み合わせたロボット政策の設計指針を検討し、長期的な器用タスクで高性能を発揮する新アーキテクチャを提案した。
原題: The Ingredients for Robotic Diffusion Transformers / Sudeep Dasari, Oier Mees, Sebastian Zhao 他
日本語で読む → - 論文VLAロボティクス
シミュレーション環境におけるUAV制御への大規模言語モデル統合:モジュラー対話アプローチ
大規模言語モデルをUAV制御に統合するための枠組みを提案し、自然言語コマンドによる直感的な操作や自律的意思決定の可能性を、ロボティクスシミュレータ上での概念実証を通じて示した。
原題: Integrating Large Language Models for UAV Control in Simulated Environments: A Modular Interaction Approach / Abhishek Phadke, Alihan Hadimlioglu, Tianxing Chu 他
日本語で読む → - 論文VLAロボティクス
ニューロシンボリックなスキル発見による条件付き多段階プランニング
少数のラベルなし低レベルスキル軌道から汎化可能な高レベル記号スキルを獲得し、視覚言語モデルで解釈して多段階プランニングを行う手法を提案。実世界の雑然とした環境でも長期的タスクを実行できることを示した。
原題: Neuro-Symbolic Skill Discovery for Conditional Multi-Level Planning / Hakan Aktas, Yigit Yildirim, Ahmet Firat Gamsiz 他
日本語で読む → - 論文VLA画像認識
HiRT: 階層型ロボットトランスフォーマーによるロボット制御の強化
大規模VLAモデルの計算コストと遅延を抑えるため、低頻度のVLMと高頻度の視覚ポリシーを組み合わせた階層型トランスフォーマーを提案し、動的タスクの成功率を向上させた。
原題: HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers / Jianke Zhang, Yanjiang Guo, Xiaoyu Chen 他
日本語で読む → - 論文VLA自然言語
不完全な世界モデルを用いた身体性環境への大規模言語モデルの接地
シミュレータなどの不完全な世界モデルを活用し、LLMエージェントが自動で多様な指示データを生成・自己改善することで、LLMの物理推論やロボティクスタスク性能を大幅に向上させる手法GLIMOを提案。
原題: Grounding Large Language Models In Embodied Environment With Imperfect World Models / Haolan Liu, Jishen Zhao
日本語で読む →