論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA画像認識
IRef-VLA: 不完全な言語指示を用いた3Dシーンにおける対話的参照グラウンディングのベンチマーク
不完全・曖昧な自然言語指示で3D屋内をナビゲートするタスク向けに、11.5Kの3Dスキャン部屋と470万件の参照文を含む大規模ベンチマークデータセットを構築し、既存モデルの性能評価基盤を提供した。
原題: IRef-VLA: A Benchmark for Interactive Referential Grounding with Imperfect Language in 3D Scenes / Haochen Zhang, Nader Zantout, Pujith Kachana 他
日本語で読む → - 論文VLAロボティクス
到達可能性解析による形式保証付き安全なLLM制御ロボット
データ駆動型到達可能性解析を用いて、LLMが制御するロボットの安全性を形式的に保証するフレームワークを提案し、自律ナビゲーションとタスク計画で有効性を示した。
原題: Safe LLM-Controlled Robots with Formal Guarantees via Reachability Analysis / Ahmad Hafez, Alireza Naderi Akhormeh, Amr Hegazy 他
日本語で読む → - 論文VLAロボティクス
Gemini Robotics:AIを物理世界へ
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
原題: Gemini Robotics: Bringing AI into the Physical World / Gemini Robotics Team, Saminda Abeyruwan, Joshua Ainslie 他
日本語で読む → - 論文VLA画像認識
Robusto-1データセット:ペルーの実世界OOD自動運転VQAにおける人間とVLMの比較
ペルーのドライブレコーダー映像を用いた自動運転VQAデータセットを構築し、人間と視覚言語モデルの応答をRSAで比較して認知的な一致度を調べた。
原題: Robusto-1 Dataset: Comparing Humans and VLMs on real out-of-distribution Autonomous Driving VQA from Peru / Dunant Cusipuma, David Ortega, Victor Flores-Benites 他
日本語で読む → - 論文VLAロボティクス
ヒューマノイド方策~ヒューマン方策
一人称視点の人間の操作データをヒューマノイドロボットの学習に活用するため、人間とロボットの状態行動空間を統合したHuman Action Transformer (HAT)を提案し、汎化性能とロバスト性を向上させた。
原題: Humanoid Policy ~ Human Policy / Ri-Zhao Qiu, Shiqi Yang, Xuxin Cheng 他
日本語で読む → - 論文VLA画像認識
AutoDrive-QA:都市自動運転における視覚言語モデル評価のための多肢選択ベンチマーク
都市運転の視覚言語モデル評価用に、既存の自由回答QAデータセットを現実的な誤りカテゴリに基づく多肢選択問題へ変換した初のベンチマークを提案し、再現性と解釈性の高い評価を可能にした。
原題: AutoDrive-QA: A Multiple-Choice Benchmark for Vision-Language Evaluation in Urban Autonomous Driving / Boshra Khalili, Andrew W. Smyth
日本語で読む → - 論文VLAロボティクス
半確率的な安全性保証を備えた視覚ベースニューラルネットワーク制御器の学習
画像入力の高次元性と状態と見え方の未知の関係に対処するため、到達可能性解析と条件付き生成ネットワーク、分布非依存の裾不等式を組み合わせた半確率的検証フレームワークを提案し、安全損失とデータサンプリング、カリキュラム学習で安全な視覚ベース制御器を効率的に学習する。
原題: Learning Vision-Based Neural Network Controllers with Semi-Probabilistic Safety Guarantees / Xinhang Ma, Junlin Wu, Hussein Sibai 他
日本語で読む → - 論文VLA画像認識
COSMO: 選択的記憶の組み合わせによる低コスト視覚言語ナビゲーション
視覚言語ナビゲーション(VLN)において、状態空間モジュールとトランスフォーマーを統合し、選択的状態空間モジュール(RSSとCS3)を導入することで、高性能と低計算コストを両立する新アーキテクチャCOSMOを提案した。
原題: COSMO: Combination of Selective Memorization for Low-cost Vision-and-Language Navigation / Siqi Zhang, Yanyuan Qiao, Qunbo Wang 他
日本語で読む → - 論文VLAロボティクス
ManeuverGPT:LLMエージェントによる自動運転車のスタント制御
大規模言語モデルをエージェントとして用い、CARLAシミュレーション内でJターンなどの高難度スタント走行を生成・実行するフレームワークを提案。
原題: ManeuverGPT Agentic Control for Safe Autonomous Stunt Maneuvers / Shawn Azdam, Pranav Doma, Aliasghar Moj Arab
日本語で読む → - 論文VLAロボティクス
RoboDexVLM:視覚言語モデルによる巧みなロボット操作のためのタスク計画と運動制御
視覚言語モデルを活用し、多様な物体を把持できる巧みなハンドを持つ協働マニピュレータ向けに、自然言語コマンドで長期的タスクを計画・実行するフレームワークを提案した。
原題: RoboDexVLM: Visual Language Model-Enabled Task Planning and Motion Control for Dexterous Robot Manipulation / Haichao Liu, Sikai Guo, Pengfei Mai 他
日本語で読む → - 論文VLAロボティクス
洗練されたポリシー蒸留:VLA汎用モデルからRLエキスパートへ
VLAモデルを教師として強化学習で蒸留し、マニピュレーションタスクにおいてVLAを上回る高性能なエキスパートポリシーを効率的に学習する手法を提案。
原題: Refined Policy Distillation: From VLA Generalists to RL Experts / Tobias Jülg, Wolfram Burgard, Florian Walter
日本語で読む → - 論文VLA画像認識
DriveLMM-o1: 自動運転シナリオ理解のための段階的推論データセットと大規模マルチモーダルモデル
自動運転の知覚・予測・計画を段階的に推論するVQAデータセット(学習18k・テスト4k超)とベンチマークを構築し、そのデータで微調整した大規模マルチモーダルモデルを提案した論文。
原題: DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding / Ayesha Ishaq, Jean Lahoud, Ketan More 他
日本語で読む → - 論文VLAロボティクス
大規模言語モデルが実現する汎用空中知能エージェント
LLM推論とロボット自律性を機体上で統合し、通信が制限された環境でもオープンワールドのタスクを実行できる空中知能エージェントを開発した。
原題: General-Purpose Aerial Intelligent Agents Empowered by Large Language Models / Ji Zhao, Xiao Lin
日本語で読む → - 論文VLAロボティクス
RoboFlamingo-Plus:深度とRGBの知覚を融合した視覚言語モデルによるロボットマニピュレーションの強化
既存のRoboFlamingoに深度情報を取り込み、RGBと深度を視覚言語モデルで統合することで、言語指示に基づくロボット操作性能を10〜20%向上させた研究。
原題: RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation / Sheng Wang
日本語で読む → - 論文VLAロボティクス
曖昧な指示からタスク計画へ:LLMに基づくフィードバック駆動型HRCタスクプランニングフレームワーク
大規模言語モデル(LLM)と人間のフィードバックを組み合わせ、曖昧な高レベル指示から人間とロボットの協調タスク計画を動的に生成・修正するハイブリッドフレームワークを提案した。
原題: From Vague Instructions to Task Plans: A Feedback-Driven HRC Task Planning Framework based on LLMs / Afagh Mehri Shervedani, Matthew R. Walter, Milos Zefran
日本語で読む → - 論文VLAロボティクス
知覚・推論・適応:VLM誘導による精密ロボットマニピュレーションのための二層フレームワーク
VLMによる高レベル計画を細かい動作列に分解し、タスクメモリ・2Dトポロジグラフ・3D空間ネットワークを併用して、高速かつ高精度で誤り訂正可能な精密マニピュレーションを実現する手法を提案した。
原題: Perceiving, Reasoning, Adapting: A Dual-Layer Framework for VLM-Guided Precision Robotic Manipulation / Qingxuan Jia, Guoqin Tang, Zeyuan Huang 他
日本語で読む → - 論文VLAロボティクス
GR00T N1: 汎用人型ロボットのためのオープン基盤モデル
視覚言語モジュールと拡散トランスフォーマを組み合わせた二重システム構成のVLA基盤モデルを提案し、実機・人間動画・合成データで学習して人型ロボットの両手マニピュレーションを実現した。
原題: GR00T N1: An Open Foundation Model for Generalist Humanoid Robots / NVIDIA, :, Johan Bjorck 他
日本語で読む → - 論文VLA画像認識
トラッキング情報を活用した大規模マルチモーダルモデルによる運転シーン理解
自動運転向けLMMに3Dトラッキング情報を追加入力し、時空間理解を強化する手法を提案。DriveLM-nuScenesで精度9.5%向上を達成。
原題: Tracking Meets Large Multimodal Models for Driving Scenario Understanding / Ayesha Ishaq, Jean Lahoud, Fahad Shahbaz Khan 他
日本語で読む → - 論文VLAロボティクス
RaceVLA: 人間らしい挙動を実現するVLAベースのレーシングドローン航法
視覚・言語・行動(VLA)モデルをドローンレース用データセットで微調整し、人間パイロットのような適応的な航法を実現した研究。
原題: RaceVLA: VLA-based Racing Drone Navigation with Human-like Behaviour / Valerii Serpiva, Artem Lykov, Artyom Myshlyaev 他
日本語で読む → - 論文VLAロボティクス
CLEA: 動的環境におけるタスク実行を強化する閉ループ型身体性エージェント
4つのオープンソースLLMを機能分離して組み合わせ、環境記憶に基づく対話型タスク計画とマルチモーダル実行批評による階層的再計画を備えた閉ループ身体性エージェントを提案し、実環境で成功率と完了率を大幅に改善した。
原題: CLEA: Closed-Loop Embodied Agent for Enhancing Task Execution in Dynamic Environments / Mingcong Lei, Ge Wang, Yiming Zhao 他
日本語で読む → - 論文VLAロボティクス
VidBot: 野生の2D人間動画から汎化可能な3D行動を学習し、ゼロショットロボットマニピュレーションを実現
インターネット上の一人称RGB動画から3Dハンド軌跡を抽出し、粗から細へのアフォーダンス学習と拡散モデルでロボットのゼロショット操作を可能にするフレームワークを提案。
原題: VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation / Hanzhi Chen, Boyang Sun, Anran Zhang 他
日本語で読む → - 論文VLAロボティクス
GPT-4とリアルタイム状態フィードバックによるロボットエージェント戦略の探索
GPT-4に目標を与えてヒューマノイドロボットの行動を生成させる手法を提案し、安全性やタスク遷移、状態フィードバックを考慮した実世界・シミュレーション実験で有効性を示した。
原題: Exploring GPT-4 for Robotic Agent Strategy with Real-Time State Feedback and a Reactive Behaviour Framework / Thomas O'Brien, Ysobel Sims
日本語で読む → - 論文VLA画像認識
見えざるものを見えるものから:基盤モデルによる観察・指示の書き換えで視覚言語ナビゲーションを拡張
視覚言語ナビゲーションのデータ不足を解消するため、基盤モデルで訓練データの観察と指示を書き換えて新たなペアを生成し、未知環境への汎化を促す手法を提案。
原題: Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation / Ziming Wei, Bingqian Lin, Yunshuang Nie 他
日本語で読む → - 論文VLAロボティクス
OTTER: テキスト認識型視覚特徴抽出を備えた視覚-言語-行動モデル
言語指示に意味的に対応する視覚特徴だけを選択的に抽出して行動予測に用いるVLAアーキテクチャを提案し、事前学習済みの視覚言語モデルを凍結したまま高いゼロショット汎化を実現した。
原題: OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction / Huang Huang, Fangchen Liu, Letian Fu 他
日本語で読む → - 論文ヒューマノイド/VLAロボティクス
Trinity: モジュール型ヒューマノイドロボットAIシステム
強化学習・大規模言語モデル・視覚言語モデルを統合し、複雑な環境でヒューマノイドロボットを効率的に制御するAIシステムTrinityを提案した。
原題: Trinity: A Modular Humanoid Robot AI System / Jingkai Sun, Qiang Zhang, Gang Han 他
日本語で読む → - 論文VLAロボティクス
ブラックボックス視覚位置認識モデルからのマルチロボット・データフリー継続的コミュニカティブ学習
ロボット間で内部モデルが非公開でも、メンバーシップ推論攻撃を通信手段として活用し、クエリ応答のみで視覚位置認識を継続的に改善するデータフリーなマルチロボット学習フレームワークを提案。
原題: Multi-Robot Data-Free Continual Communicative Learning (CCL) from Black-Box Visual Place Recognition Models / Kenta Tsukahara, Kanji Tanaka, Daiki Iwata 他
日本語で読む → - 論文VLA自然言語
世界モデリングでより良いプランナーへ:身体性タスク計画のための二重選好最適化
視覚言語モデルによる身体性タスク計画において、状態予測と行動選択を選好学習で同時に最適化するD²POを提案し、人間の注釈なしで選好データを収集する木探索機構を導入した。
原題: World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning / Siyin Wang, Zhaoye Fei, Qinyuan Cheng 他
日本語で読む → - 論文自動運転VLA画像認識
AlphaDrive:強化学習と推論で自動運転におけるVLMの能力を引き出す
自動運転向けにGRPOベースの強化学習報酬と2段階の計画推論訓練を組み合わせたVLMフレームワークを提案し、計画性能と訓練効率を改善した。
原題: AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning / Bo Jiang, Shaoyu Chen, Qian Zhang 他
日本語で読む → - 論文VLAAI
事前学習済み埋め込みを行動仕様記述の仕組みとして用いる手法
知覚モデルを用いるシステムの振る舞いを、理想と観測の埋め込み間の距離で記述する新しい時相論理ETLを提案し、基盤モデル駆動ロボットの計画タスクで有効性を示した。
原題: Pretrained Embeddings as a Behavior Specification Mechanism / Parv Kapoor, Abigail Hammer, Ashish Kapoor 他
日本語で読む → - 論文VLA画像認識
PanoGen++: 視覚と言語によるナビゲーションのためのドメイン適応型テキスト誘導パノラマ環境生成
拡散モデルをドメイン適応微調整してテキストから多様なパノラマ環境を生成し、VLNタスクの訓練データ不足を解消して性能を向上させた。
原題: PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation / Sen Wang, Dongliang Zhou, Liang Xie 他
日本語で読む →