論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA画像認識
自動運転におけるマルチモーダル大規模言語モデルのシナリオ理解を能力駆動で評価する枠組み
自動運転向けMLLMのシナリオ理解を、意味・空間・時間・物理の4能力軸で体系的に評価する枠組みを提案し、実交通シナリオで適用例を示した。
原題: A Framework for a Capability-driven Evaluation of Scenario Understanding for Multimodal Large Language Models in Autonomous Driving / Tin Stribor Sohn, Philipp Reis, Maximilian Dillitzer 他
日本語で読む → - 論文VLAロボティクス
MoLe-VLA: レイヤ混合による動的レイヤスキップ型視覚言語行動モデル
LLMの各層をエキスパートとみなし、ロボットの状態に応じて必要な層だけを動的に活性化する視覚言語行動モデルを提案し、計算コストを抑えつつ操作タスクの性能を維持した。
原題: MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation / Rongyu Zhang, Menghang Dong, Yuan Zhang 他
日本語で読む → - 論文VLAロボティクス
ManeuverGPT:LLMエージェントによる自動運転車のスタント制御
大規模言語モデルをエージェントとして用い、CARLAシミュレーション内でJターンなどの高難度スタント走行を生成・実行するフレームワークを提案。
原題: ManeuverGPT Agentic Control for Safe Autonomous Stunt Maneuvers / Shawn Azdam, Pranav Doma, Aliasghar Moj Arab
日本語で読む → - 論文VLAロボティクス
EmbodiedVSR: 動的シーングラフ誘導による視覚空間タスクの連鎖推論
動的シーングラフとChain-of-Thought推論を組み合わせ、微調整なしで身体性エージェントの空間推論を強化するフレームワークを提案し、新ベンチマークで有効性を示した。
原題: EmbodiedVSR: Dynamic Scene Graph-Guided Chain-of-Thought Reasoning for Visual Spatial Tasks / Yi Zhang, Qiang Zhang, Xiaozhu Ju 他
日本語で読む → - 論文VLA画像認識
PanoGen++: 視覚と言語によるナビゲーションのためのドメイン適応型テキスト誘導パノラマ環境生成
拡散モデルをドメイン適応微調整してテキストから多様なパノラマ環境を生成し、VLNタスクの訓練データ不足を解消して性能を向上させた。
原題: PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation / Sen Wang, Dongliang Zhou, Liang Xie 他
日本語で読む → - 論文VLA自然言語
PRISM: 暗黙的シーン理解による選好洗練を用いた3D視覚言語選好ベース強化学習
3D点群と言語モデルを統合し、Chain-of-Thought推論で将来を考慮した選好を洗練させることで、遮蔽や視点バイアスに強い選好ベース強化学習フレームワークを提案した。
原題: PRISM: Preference Refinement via Implicit Scene Modeling for 3D Vision-Language Preference-Based Reinforcement Learning / Yirong Sun, Yanjun Chen
日本語で読む → - 論文VLAAI
事前学習済み埋め込みを行動仕様記述の仕組みとして用いる手法
知覚モデルを用いるシステムの振る舞いを、理想と観測の埋め込み間の距離で記述する新しい時相論理ETLを提案し、基盤モデル駆動ロボットの計画タスクで有効性を示した。
原題: Pretrained Embeddings as a Behavior Specification Mechanism / Parv Kapoor, Abigail Hammer, Ashish Kapoor 他
日本語で読む → - 論文ヒューマノイド/VLAロボティクス
Trinity: モジュール型ヒューマノイドロボットAIシステム
強化学習・大規模言語モデル・視覚言語モデルを統合し、複雑な環境でヒューマノイドロボットを効率的に制御するAIシステムTrinityを提案した。
原題: Trinity: A Modular Humanoid Robot AI System / Jingkai Sun, Qiang Zhang, Gang Han 他
日本語で読む → - 論文VLA画像認識
DeepSeekは外科医のように推論できるか?ロボット支援手術における視覚言語理解の実証評価
DeepSeekモデルをロボット手術の視覚言語タスク(単語QA・視覚QA・詳細記述)で評価し、汎用マルチモーダルモデルより優れるが臨床要件には未達であることを示した実証研究。
原題: Can DeepSeek Reason Like a Surgeon? An Empirical Evaluation for Vision-Language Understanding in Robotic-Assisted Surgery / Boyi Ma, Yanguang Zhao, Jie Wang 他
日本語で読む → - 論文VLAロボティクス
RAIDER: ツールを活用する大規模言語モデルエージェントによるロボット行動の問題検出・説明・回復
LLMと実世界のツールを組み合わせ、ロボットの行動問題を動的に検出・説明・回復するエージェントRAIDERを提案し、家庭環境シミュレーションと実機支援タスクで有効性を示した。
原題: RAIDER: Tool-Equipped Large Language Model Agent for Robotic Action Issue Detection, Explanation and Recovery / Silvia Izquierdo-Badiola, Carlos Rizzo, Guillem Alenyà
日本語で読む → - 論文VLA画像認識
COSMO: 選択的記憶の組み合わせによる低コスト視覚言語ナビゲーション
視覚言語ナビゲーション(VLN)において、状態空間モジュールとトランスフォーマーを統合し、選択的状態空間モジュール(RSSとCS3)を導入することで、高性能と低計算コストを両立する新アーキテクチャCOSMOを提案した。
原題: COSMO: Combination of Selective Memorization for Low-cost Vision-and-Language Navigation / Siqi Zhang, Yanyuan Qiao, Qunbo Wang 他
日本語で読む → - 論文VLAロボティクス
LUMOS: 世界モデルを用いた言語条件付き模倣学習
学習した世界モデルの潜在空間で長期ロールアウトを練習し、言語指示で操作可能なスキルを実機ロボットにゼロショット転移する模倣学習フレームワーク。
原題: LUMOS: Language-Conditioned Imitation Learning with World Models / Iman Nematollahi, Branton DeMoss, Akshay L Chandra 他
日本語で読む → - 論文VLA画像認識
トラッキング情報を活用した大規模マルチモーダルモデルによる運転シーン理解
自動運転向けLMMに3Dトラッキング情報を追加入力し、時空間理解を強化する手法を提案。DriveLM-nuScenesで精度9.5%向上を達成。
原題: Tracking Meets Large Multimodal Models for Driving Scenario Understanding / Ayesha Ishaq, Jean Lahoud, Fahad Shahbaz Khan 他
日本語で読む → - 論文VLAロボティクス
半確率的な安全性保証を備えた視覚ベースニューラルネットワーク制御器の学習
画像入力の高次元性と状態と見え方の未知の関係に対処するため、到達可能性解析と条件付き生成ネットワーク、分布非依存の裾不等式を組み合わせた半確率的検証フレームワークを提案し、安全損失とデータサンプリング、カリキュラム学習で安全な視覚ベース制御器を効率的に学習する。
原題: Learning Vision-Based Neural Network Controllers with Semi-Probabilistic Safety Guarantees / Xinhang Ma, Junlin Wu, Hussein Sibai 他
日本語で読む → - 論文VLA自然言語
世界モデリングでより良いプランナーへ:身体性タスク計画のための二重選好最適化
視覚言語モデルによる身体性タスク計画において、状態予測と行動選択を選好学習で同時に最適化するD²POを提案し、人間の注釈なしで選好データを収集する木探索機構を導入した。
原題: World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning / Siyin Wang, Zhaoye Fei, Qinyuan Cheng 他
日本語で読む → - 論文VLAロボティクス
CLEA: 動的環境におけるタスク実行を強化する閉ループ型身体性エージェント
4つのオープンソースLLMを機能分離して組み合わせ、環境記憶に基づく対話型タスク計画とマルチモーダル実行批評による階層的再計画を備えた閉ループ身体性エージェントを提案し、実環境で成功率と完了率を大幅に改善した。
原題: CLEA: Closed-Loop Embodied Agent for Enhancing Task Execution in Dynamic Environments / Mingcong Lei, Ge Wang, Yiming Zhao 他
日本語で読む → - 論文VLA機械学習
タスクトークン:行動基盤モデルを柔軟に適応させる手法
強化学習でタスク特化のエンコーダを学習し、凍結した行動基盤モデルへの追加入力トークンとして使うことで、汎用性を保ちながら特定タスクに適応させる手法を提案。
原題: Task Tokens: A Flexible Approach to Adapting Behavior Foundation Models / Ron Vainshtein, Zohar Rimon, Shie Mannor 他
日本語で読む → - 論文VLAHCI
VRと2Dインターフェースが選好に基づくロボット学習における人間のフィードバックに与える影響
ロボットナビゲーションの選好学習において、VRと2Dインターフェースのどちらで人間のフィードバックを集めるかが、ユーザー体験や選好の一貫性、学習された方策に与える影響を大規模データセットで比較分析した研究。
原題: The Impact of VR and 2D Interfaces on Human Feedback in Preference-Based Robot Learning / Jorge de Heuvel, Daniel Marta, Simon Holk 他
日本語で読む → - 論文VLAロボティクス
大規模言語モデルが実現する汎用空中知能エージェント
LLM推論とロボット自律性を機体上で統合し、通信が制限された環境でもオープンワールドのタスクを実行できる空中知能エージェントを開発した。
原題: General-Purpose Aerial Intelligent Agents Empowered by Large Language Models / Ji Zhao, Xiao Lin
日本語で読む → - 論文VLAロボティクス
UAV-VLRR: 視覚言語情報を用いたNMPCによるUAV捜索救助の迅速応答
視覚言語モデルとLLMでシーンを解釈し、障害物回避機能付き非線形モデル予測制御でドローンを飛行させる捜索救助システムを開発し、既存の自動操縦や人間のパイロットより高速な応答を実現した。
原題: UAV-VLRR: Vision-Language Informed NMPC for Rapid Response in UAV Search and Rescue / Yasheerah Yaqoot, Muhammad Ahsan Mustafa, Oleg Sautenkov 他
日本語で読む → - 論文VLAロボティクス
知覚・推論・適応:VLM誘導による精密ロボットマニピュレーションのための二層フレームワーク
VLMによる高レベル計画を細かい動作列に分解し、タスクメモリ・2Dトポロジグラフ・3D空間ネットワークを併用して、高速かつ高精度で誤り訂正可能な精密マニピュレーションを実現する手法を提案した。
原題: Perceiving, Reasoning, Adapting: A Dual-Layer Framework for VLM-Guided Precision Robotic Manipulation / Qingxuan Jia, Guoqin Tang, Zeyuan Huang 他
日本語で読む → - 論文VLAロボティクス
RoboFlamingo-Plus:深度とRGBの知覚を融合した視覚言語モデルによるロボットマニピュレーションの強化
既存のRoboFlamingoに深度情報を取り込み、RGBと深度を視覚言語モデルで統合することで、言語指示に基づくロボット操作性能を10〜20%向上させた研究。
原題: RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation / Sheng Wang
日本語で読む → - 論文VLAロボティクス
ヒューマノイド方策~ヒューマン方策
一人称視点の人間の操作データをヒューマノイドロボットの学習に活用するため、人間とロボットの状態行動空間を統合したHuman Action Transformer (HAT)を提案し、汎化性能とロバスト性を向上させた。
原題: Humanoid Policy ~ Human Policy / Ri-Zhao Qiu, Shiqi Yang, Xuxin Cheng 他
日本語で読む → - 論文VLA画像認識
AutoDrive-QA:都市自動運転における視覚言語モデル評価のための多肢選択ベンチマーク
都市運転の視覚言語モデル評価用に、既存の自由回答QAデータセットを現実的な誤りカテゴリに基づく多肢選択問題へ変換した初のベンチマークを提案し、再現性と解釈性の高い評価を可能にした。
原題: AutoDrive-QA: A Multiple-Choice Benchmark for Vision-Language Evaluation in Urban Autonomous Driving / Boshra Khalili, Andrew W. Smyth
日本語で読む → - 論文VLA画像認識
見えざるものを見えるものから:基盤モデルによる観察・指示の書き換えで視覚言語ナビゲーションを拡張
視覚言語ナビゲーションのデータ不足を解消するため、基盤モデルで訓練データの観察と指示を書き換えて新たなペアを生成し、未知環境への汎化を促す手法を提案。
原題: Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation / Ziming Wei, Bingqian Lin, Yunshuang Nie 他
日本語で読む → - 論文VLAロボティクス
RaceVLA: 人間らしい挙動を実現するVLAベースのレーシングドローン航法
視覚・言語・行動(VLA)モデルをドローンレース用データセットで微調整し、人間パイロットのような適応的な航法を実現した研究。
原題: RaceVLA: VLA-based Racing Drone Navigation with Human-like Behaviour / Valerii Serpiva, Artem Lykov, Artyom Myshlyaev 他
日本語で読む → - 論文VLAロボティクス
OTTER: テキスト認識型視覚特徴抽出を備えた視覚-言語-行動モデル
言語指示に意味的に対応する視覚特徴だけを選択的に抽出して行動予測に用いるVLAアーキテクチャを提案し、事前学習済みの視覚言語モデルを凍結したまま高いゼロショット汎化を実現した。
原題: OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction / Huang Huang, Fangchen Liu, Letian Fu 他
日本語で読む → - 論文VLAロボティクス
統合動画行動モデル
動画と行動を統合的に学習し、推論時は動画生成を省略して高速に行動を予測できるロボティクス向けモデルを提案。
原題: Unified Video Action Model / Shuang Li, Yihuai Gao, Dorsa Sadigh 他
日本語で読む → - 論文VLAロボティクス
Being-0: 視覚言語モデルとモジュール型スキルを統合したヒューマノイドロボットエージェント
基盤モデルによる高レベルな指示理解・計画と、モジュール型スキルライブラリによる歩行・マニピュレーションを、軽量VLMのConnectorで橋渡しする階層型エージェントを提案し、実機ヒューマノイドで長期的タスクを実現した。
原題: Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills / Haoqi Yuan, Yu Bai, Yuhui Fu 他
日本語で読む → - 論文VLA画像認識
ロボット学習のための事前学習済み視覚モデルのデータ中心再検討
ロボット学習用の視覚モデルにおいて、非物体中心データでも物体中心表現を獲得できるSlotMIMを提案し、認識・シーン理解・ロボットタスクで性能を向上させた。
原題: A Data-Centric Revisit of Pre-Trained Vision Models for Robot Learning / Xin Wen, Bingchen Zhao, Yilun Chen 他
日本語で読む →