論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2024/11/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
IGOR: 身体性AI基盤モデルのための画像ゴール表現による原子的制御単位
画像間の変化を潜在行動に圧縮し、人間と多様なロボットに共通する意味的に一貫した行動空間を学習することで、知識転移や言語との整合、ロボット制御を可能にする基盤モデルを提案した。
原題: IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI / Xiaoyu Chen, Junliang Guo, Tianyu He 他
日本語で読む → - 論文VLA画像認識
NavAgent: 都市街路ビューのマルチスケール融合によるUAV身体性視覚言語ナビゲーション
大規模視覚言語モデルを活用し、トポロジカルマップ・パノラマ・ランドマークのマルチスケール情報を統合して都市環境でのUAVナビゲーションを実現するモデルを提案。
原題: NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation / Youzhi Liu, Fanglong Yao, Yuanchang Yue 他
日本語で読む → - 論文VLAロボティクス
InstruGen: 大規模マルチモーダルモデルによる視覚言語ナビゲーション向け指示文の自動生成
YouTubeの住宅ツアー動画を実環境に近いナビゲーション場面として使い、大規模マルチモーダルモデルで多様で高品質な経路と指示文のペアを自動生成する手法を提案し、未見環境での性能を向上させた。
原題: InstruGen: Automatic Instruction Generation for Vision-and-Language Navigation Via Large Multimodal Models / Yu Yan, Rongtao Xu, Jiazhao Zhang 他
日本語で読む → - 論文VLAロボティクス
ClevrSkills: ロボティクスにおける構成的言語・視覚推論
ロボット操作タスクの構成的推論を評価するベンチマークClevrSkillsを提案し、視覚言語モデルが低レベル技能を組み合わせた高レベルタスクに失敗することを示した。
原題: ClevrSkills: Compositional Language and Visual Reasoning in Robotics / Sanjay Haresh, Daniel Dijkman, Apratim Bhattacharyya 他
日本語で読む → - 論文VLAロボティクス
スパイキングTransformer拡散ポリシーによる脳模倣行動生成
スパイキングニューラルネットと拡散モデルを組み合わせたTransformerベースのポリシーを提案し、ロボット操作タスクで従来手法を上回る性能を示した。
原題: Brain-inspired Action Generation with Spiking Transformer Diffusion Policy Model / Qianhao Wang, Yinqian Sun, Enmeng Lu 他
日本語で読む → - 論文VLAロボティクス
ロボット基盤モデル監査のための身体性レッドチーミング
視覚言語モデルを使って文脈に即した難易度の高い指示を自動生成し、言語条件付きロボットモデルの性能と安全性を評価する手法を提案した。
原題: Embodied Red Teaming for Auditing Robotic Foundation Models / Sathwik Karnik, Zhang-Wei Hong, Nishant Abhangi 他
日本語で読む → - 論文VLA画像認識
視覚的場所認識における新興トレンドと研究機会の探求
ロボットの自己位置推定やSLAMで重要となる視覚的場所認識について、Vision-Languageモデルなど最近の研究動向と今後の機会を概観したサーベイ。
原題: Exploring Emerging Trends and Research Opportunities in Visual Place Recognition / Antonios Gasteratos, Konstantinos A. Tsintotas, Tobias Fischer 他
日本語で読む → - 論文VLA画像認識
生成的ワールドエクスプローラー
エージェントが大規模3D世界を心的に探索し、想像した観測で信念を更新して意思決定に活かすフレームワークを提案。
原題: Generative World Explorer / Taiming Lu, Tianmin Shu, Alan Yuille 他
日本語で読む → - 論文VLAロボティクス
大規模言語モデルによる自律水上艇のCOLREGs意思決定と制御
大規模言語モデルを自律水上艇の意思決定に初めて適用し、海上衝突予防規則に基づく衝突回避と航路追従を実現した研究。
原題: Large Language Model-based Decision-making for COLREGs and the Control of Autonomous Surface Vehicles / Klinsmann Agyei, Pouria Sarhadi, Wasif Naeem
日本語で読む → - 論文自動運転/VLAロボティクス
悪天候下の自動運転に向けたMLLMベースの新手法
GPT-4oを用いたマルチモーダル大規模言語モデル(MLLM)をLimSim++とCARLAシミュレータに統合し、悪天候や低視界などの厳しい環境下での自動運転エージェントの性能を評価した。
原題: A Novel MLLM-based Approach for Autonomous Driving in Different Weather Conditions / Sonda Fourati, Wael Jaafar, Noura Baccar
日本語で読む → - 論文VLAcs.MA
二つの頭脳は一つより優れる:人間とロボットの対話のための協調型LLMエージェント
複数のLLMエージェントを協調させてロボット指示を生成する手法を検証し、一部の協調構成がエラー削減と抽象問題解決に有効であることを示した。
原題: Two Heads Are Better Than One: Collaborative LLM Embodied Agents for Human-Robot Interaction / Mitchell Rosser, Marc. G Carmichael
日本語で読む → - 論文VLAロボティクス
Tra-MoE: 複数ドメインからの軌道予測モデル学習による適応的ポリシー条件付け
スパースMoEアーキテクチャで任意点軌道を予測し、適応的ポリシー条件付けでロボット制御を改善する手法を提案。
原題: Tra-MoE: Learning Trajectory Prediction Model from Multiple Domains for Adaptive Policy Conditioning / Jiange Yang, Haoyi Zhu, Yating Wang 他
日本語で読む → - 論文VLA画像認識
エンドツーエンドロボット学習のための空間的視覚知覚
単眼深度推定と新たな画像拡張AugBlenderを組み合わせ、照明変化など環境変動に頑健な映像ベースの空間知覚フレームワークを提案し、模倣学習の汎化性能を向上させた。
原題: Spatially Visual Perception for End-to-End Robotic Learning / Travis Davies, Jiahuan Yan, Xiang Chen 他
日本語で読む → - 論文VLAロボティクス
人間との対話による推論時ポリシーステアリング
事前学習済みの生成ポリシーを微調整せずに、人間の介入でサンプリング過程をバイアスし、意図に沿った行動を引き出す枠組みを提案。
原題: Inference-Time Policy Steering through Human Interactions / Yanwei Wang, Lirui Wang, Yilun Du 他
日本語で読む → - 論文VLAロボティクス
GRAPE: 選好アライメントによるロボット方策の汎化
成功・失敗の試行から報酬を暗黙的に学習し、大規模視覚言語モデルが提案する時空間制約で選好を自動設計することで、VLAモデルの未見タスクへの汎化性能を高める手法。
原題: GRAPE: Generalizing Robot Policy via Preference Alignment / Zijian Zhang, Kaiyuan Zheng, Zhaorun Chen 他
日本語で読む → - 論文VLA画像認識
AdaVLN: 動く人間がいる連続屋内環境での視覚言語ナビゲーション
動的に動く人間障害物を含む屋内3D環境で自然言語指示に基づきロボットをナビゲートさせる新タスクAdaVLNを提案し、シミュレータとデータセットを構築してベースライン評価を行った。
原題: AdaVLN: Towards Visual Language Navigation in Continuous Indoor Environments with Moving Humans / Dillon Loh, Tomasz Bednarz, Xinxing Xia 他
日本語で読む → - 論文VLAロボティクス
視覚言語モデルとビヘイビアツリーによるロボットの失敗対応
視覚言語モデル(VLM)を監視役として使い、ロボットのタスク実行中の未知の失敗を検知し、不足する条件やスキルをビヘイビアツリーに組み込むことで自律的に回復できるようにする手法を提案した。
原題: Addressing Failures in Robotics using Vision-Based Language Models (VLMs) and Behavior Trees (BT) / Faseeh Ahmad, Jonathan Styrud, Volker Krueger
日本語で読む → - 論文VLA画像認識
物体検出モダリティを統合した視覚言語モデルによる自動運転エージェントの強化
自動運転向け視覚言語モデルにYOLOSベースの物体検出ネットワークを追加し、マルチビュー処理を改善することで、視覚的質問応答タスクの性能を向上させた研究。
原題: Integrating Object Detection Modality into Visual Language Model for Enhanced Autonomous Driving Agent / Linfeng He, Yiming Sun, Sihao Wu 他
日本語で読む → - 論文VLAロボティクス
CogACT: 認知と行動を融合するロボット操作のための基盤的視覚-言語-行動モデル
VLMの出力を条件とする専用の拡散行動トランスフォーマーを組み込んだ新しいVLAアーキテクチャを提案し、ロボット操作の成功率と汎化性能を大幅に向上させた。
原題: CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation / Qixiu Li, Yaobo Liang, Zeyu Wang 他
日本語で読む → - 論文VLAロボティクス
目標条件付き探索による動画モデルの行動への接地
大規模動画モデルを自己探索によって連続行動に直接接地させ、報酬や行動ラベルなしで複雑なタスクを解くフレームワークを提案した。
原題: Grounding Video Models to Actions through Goal Conditioned Exploration / Yunhao Luo, Yilun Du
日本語で読む → - 論文VLAロボティクス
DeeR-VLA:ロボット実行のためのマルチモーダル大規模言語モデルの動的推論
ロボットの計算資源制約に対応するため、状況に応じてMLLMの活性化サイズを自動調整する動的早期終了フレームワークを提案し、CALVINベンチマークで効率と性能を両立させた。
原題: DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution / Yang Yue, Yulin Wang, Bingyi Kang 他
日本語で読む → - 論文VLAロボティクス
MissionGPT: ロボティクストランスフォーマーモデルに基づく移動ロボットのミッションプランナー
Transformerと大規模言語モデルを用いて、知覚アルゴリズムなしにカメラ映像のみから移動ロボットのタスクを計画・実行するミッションプランナーを提案し、基本動作で50%以上の成功率を達成した。
原題: MissionGPT: Mission Planner for Mobile Robot based on Robotics Transformer Model / Vladimir Berman, Artem Bazhenov, Dzmitry Tsetserukou
日本語で読む → - 論文VLAロボティクス
マルチモーダル基盤モデルによる計画時の不確実性を分離・定量化する形式的手法
視覚理解に起因する知覚不確実性と計画生成の決定不確実性を分離し、形式検証とConformal Predictionで定量化して、能動的再観測や高確信データでの微調整によりロボットタスクの信頼性を高める枠組みを提案した。
原題: Know Where You're Uncertain When Planning with Multimodal Foundation Models: A Formal Framework / Neel P. Bhatt, Yunhao Yang, Rohan Siva 他
日本語で読む → - 論文VLA画像認識
RoboSpatial:ロボティクスのための2D・3D視覚言語モデルに空間理解を教える
ロボティクス向けの大規模空間理解データセットRoboSpatialを構築し、2D・3Dの視覚言語モデルに空間推論を学習させることで、空間アフォーダンス予測やロボット操作などのタスク性能を向上させた。
原題: RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics / Chan Hee Song, Valts Blukis, Jonathan Tremblay 他
日本語で読む → - 論文VLAロボティクス
ロボットロジックのパラメータ化における生成AIの理解
映画撮影を例に、LLMが自然言語によるエンドユーザーの意図を解釈し、ロボットアームの低レベル動作パラメータに変換するプロセスを探求した研究。
原題: Understanding Generative AI in Robot Logic Parametrization / Yuna Hwang, Arissa J. Sato, Pragathi Praveena 他
日本語で読む → - 論文VLAロボティクス
行動予測と画像予測の統合拡散過程による視覚ポリシー学習
画像予測とロボット行動生成を同一の拡散過程で統合し、将来画像と行動を同時に予測する視覚ポリシー学習フレームワークPADを提案。Metaworldベンチマークで26.3%の相対改善を達成。
原題: Prediction with Action: Visual Policy Learning via Joint Denoising Process / Yanjiang Guo, Yucheng Hu, Jianke Zhang 他
日本語で読む → - 論文VLAロボティクス
ロボット中心プーリングによる身体所有感を高めたEnd-to-End視覚運動方策学習
画像特徴をロボットの固有感覚状態と相関する領域に集約するRobot-centric Poolingを提案し、自己や周囲の類似物に頑健な視覚運動方策を実現した。
原題: Raising Body Ownership in End-to-End Visuomotor Policy Learning via Robot-Centric Pooling / Zheyu Zhuang, Ville Kyrki, Danica Kragic
日本語で読む → - 論文VLAロボティクス
視界に時を刻む:LLM駆動ロボットの動的環境知覚のためのシーングラフフィルタリング
RGB-Dデータから意味的シーングラフを生成・更新し、パーティクルフィルタで動的環境での物体位置推定を行うLLM駆動ロボット制御アーキテクチャを提案した。
原題: Time is on my sight: scene graph filtering for dynamic environment perception in an LLM-driven robot / Simone Colombani, Luca Brini, Dimitri Ognibene 他
日本語で読む → - 論文VLAロボティクス
ロボットの経験を実世界の自然言語で接地するRONAR
マルチモーダルなロボット経験をLLMで自然言語ナレーションに変換し、行動説明や失敗分析、人間との対話による復旧を支援するシステムを提案。
原題: I Can Tell What I am Doing: Toward Real-World Natural Language Grounding of Robot Experiences / Zihan Wang, Brian Liang, Varad Dhat 他
日本語で読む → - 論文VLAロボティクス
CLIP-RT: 自然言語監督から言語条件付きロボット方策を学習
非専門家が自然言語でロボットのデモを収集できる枠組みと、そのデータから言語条件付き視覚運動方策を学習するVLAモデルCLIP-RTを提案し、OpenVLAより7倍小さいパラメータで成功率を24%上回った。
原題: CLIP-RT: Learning Language-Conditioned Robotic Policies from Natural Language Supervision / Gi-Cheon Kang, Junghyun Kim, Kyuhwan Shim 他
日本語で読む →