論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
DexVLA: 汎用ロボット制御のためのプラグイン拡散エキスパートを備えた視覚言語モデル
拡散ベースのアクションエキスパートをVLAモデルに組み込み、身体カリキュラム学習で効率的に訓練することで、多様なロボット身体での複雑な長期的タスクを実現した。
原題: DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control / Junjie Wen, Yichen Zhu, Jinming Li 他
日本語で読む → - 論文VLA機械学習
スキーマ誘導シーングラフ推論:マルチエージェントLLMシステムによるSG²
シーングラフのスキーマを手がかりに、計画立案エージェントと情報検索エージェントが反復協調して空間推論を行うマルチエージェントLLMフレームワークを提案し、Q&Aや計画タスクで既存手法を上回る性能を示した。
原題: Schema-Guided Scene-Graph Reasoning based on Multi-Agent Large Language Model System / Yiye Chen, Harpreet Sawhney, Nicholas Gydé 他
日本語で読む → - 論文VLAロボティクス
DexGraspVLA:汎用器用把持に向けた視覚-言語-行動フレームワーク
事前学習済み視覚言語モデルを高レベル計画に、拡散ベースの行動制御器を低レベルに用いた階層型フレームワークで、多様な未見の乱雑シーンでも90%以上の器用把持を実現した。
原題: DexGraspVLA: A Vision-Language-Action Framework Towards General Dexterous Grasping / Yifan Zhong, Xuchuan Huang, Ruochong Li 他
日本語で読む → - 論文VLAロボティクス
SoFar: 言語に基づく物体の向きが空間推論と物体操作を橋渡しする
自然言語で物体の向きを定義する「意味的向き」を導入し、大規模データセットとゼロショット予測モデルを構築して、6自由度の空間推論とロボット動作生成を可能にした。
原題: SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation / Zekun Qi, Wenyao Zhang, Yufei Ding 他
日本語で読む → - 論文VLAHCI
AoECR:高齢者介護ロボットのAI化
介護ベッドを基盤に患者と看護師の対話データセットを構築し、大規模言語モデルを微調整して安全な操作と人間らしい応答を実現する高齢者介護ロボット向けの汎用AIアーキテクチャを提案した。
原題: AoECR: AI-ization of Elderly Care Robot / Linkun Zhou, Jian Li, Yadong Mo 他
日本語で読む → - 論文VLAロボティクス
GEVRM: 目標表現型ビデオ生成モデルによるロバストな視覚マニピュレーション
内部モデル制御の原理を取り入れ、テキスト誘導のビデオ生成で将来の視覚的目標を生成しつつ、摂動を内部埋め込みとして推定することで、外乱に強い閉ループVLAを実現した研究。
原題: GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation / Hongyin Zhang, Pengxiang Ding, Shangke Lyu 他
日本語で読む → - 論文VLAAI
User-VLM 360°: 社会的ヒューマンロボットインタラクションのためのユーザー認識チューニングによる個人適応型視覚言語モデル
ユーザーの視覚・言語信号に基づきリアルタイムで適応する個人化視覚言語モデルを提案し、バイアス軽減と社会的感情データセットを統合してPepperロボットで実証した。
原題: USER-VLM 360: Personalized Vision Language Models with User-aware Tuning for Social Human-Robot Interactions / Hamed Rahimi, Adil Bahaj, Mouad Abrini 他
日本語で読む → - 論文VLAロボティクス
RoboBrain:抽象的から具体的へと至るロボット操作のための統合脳モデル
ロボット操作に必要な計画・アフォーダンス知覚・軌道予測を統合したMLLMベースの脳モデルRoboBrainを提案し、多次元情報を付与した大規模データセットShareRobotで訓練して最先端性能を達成した。
原題: RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete / Yuheng Ji, Huajie Tan, Jiayu Shi 他
日本語で読む → - 論文VLAロボティクス
4D表現で事前学習する自己回帰ロボットモデル
人間の動画から得た3D点追跡の4D表現を活用し、ロボット制御に効率的に転移できる自己回帰モデルARM4Rを提案した。
原題: Pre-training Auto-regressive Robotic Models with 4D Representations / Dantong Niu, Yuvan Sharma, Haoru Xue 他
日本語で読む → - 論文VLAロボティクス
3D空間接地型視覚言語フレームワークによるロボットタスク計画:プロンプト自動合成と教師あり推論
2D画像を点群にマッピングしてVLMに3D空間情報を自動抽出させ、小型言語モデルで出力を監督することで、幻覚を抑え高信頼なロボット制御コードを生成するフレームワークを提案。再学習不要で96%のタスク成功率を達成した。
原題: 3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning / Guoqin Tang, Qingxuan Jia, Zeyuan Huang 他
日本語で読む → - 論文VLAロボティクス
空間認識インストラクションチューニング:視覚障害者を支援する盲導犬ロボットのためのデータセットとベンチマーク
視覚障害者支援の盲導犬ロボット向けに、3D空間の経路と周囲環境を理解させるSAITデータセットとSA-Benchを構築し、空間認識を強化したVLMが歩行案内で既存手法を上回ることを示した。
原題: Space-Aware Instruction Tuning: Dataset and Benchmark for Guide Dog Robots Assisting the Visually Impaired / ByungOk Han, Woo-han Yun, Beom-Su Seo 他
日本語で読む → - 論文VLA画像認識
テキストと視覚を繋ぐ:クロスモーダル場所認識のためのマルチビューテキスト・視覚位置合わせ手法
テキスト記述のみで画像データベースを照合する初の場所認識手法Text4VPRを提案し、360度マルチビュー画像との位置合わせを実現した。
原題: Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition / Tianyi Shang, Zhenyu Li, Pengjie Xu 他
日本語で読む → - 論文VLAロボティクス
時間的絡み合いの罠:視覚運動ポリシー学習における事前学習済み視覚表現の活用
事前学習済み視覚表現を逐次意思決定に使うと時間的絡み合いが生じる問題を指摘し、その影響を定量化して、絡み合いを解く簡単なベースラインを提案した論文。
原題: The Temporal Trap: Entanglement in Pre-Trained Visual Representations for Visuomotor Policy Learning / Nikolaos Tsagkas, Andreas Sochopoulos, Duolikun Danier 他
日本語で読む → - 論文VLAロボティクス
ChatVLA:視覚・言語・行動モデルによるマルチモーダル理解とロボット制御の統合
視覚言語行動モデルにおける「忘却」と「タスク干渉」を解決するため、段階的アライメント訓練とMixture-of-Expertsを組み合わせたChatVLAを提案し、マルチモーダル理解と実ロボット操作の両方で高性能を実現した。
原題: ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model / Zhongyi Zhou, Yichen Zhu, Minjie Zhu 他
日本語で読む → - 論文VLAロボティクス
ConRFT: 一貫性ポリシーによるVLAモデルの強化学習ファインチューニング
VLAモデルをオフラインとオンラインの強化学習でファインチューニングし、実世界の接触を伴う操作タスクで成功率を大幅に向上させた手法。
原題: ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy / Yuhui Chen, Shuai Tian, Shugao Liu 他
日本語で読む → - 論文VLAロボティクス
EvolvingAgent: 長期タスクのためのカリキュラム自己進化エージェントと継続的世界モデル
人間の介入なしに自己計画・自己制御・自己反省を通じて長期タスクを遂行するエージェントを提案し、LLMとマルチモーダル経験を活用した計画、世界モデルに基づく行動制御、カリキュラム学習による反省機構を統合した。
原題: EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks / Tongtong Feng, Xin Wang, Zekai Zhou 他
日本語で読む → - 論文VLAAI
汎用人工知能に向けた大規模言語モデル:基礎原理とアプローチのサーベイ
大規模言語モデルが人間レベルの汎用知能に到達するために必要な身体性・記号接地・因果性・記憶という基礎的問題を整理し、最新の研究アプローチを概観したサーベイ論文。
原題: Large language models for artificial general intelligence (AGI): A survey of foundational principles and approaches / Alhassan Mumuni, Fuseini Mumuni
日本語で読む → - 論文VLA画像認識
ロボティクス向け画像ベース地理推定:ブラックボックス視覚言語モデルは実用域に達したか
ブラックボックス設定の生成型視覚言語モデルを単体のゼロショット地理推定システムとして評価し、プロンプトやクエリ画像の変動に対する精度と一貫性を調査した。
原題: Image-based Geo-localization for Robotics: Are Black-box Vision-Language Models there yet? / Sania Waheed, Bruno Ferrarini, Michael Milford 他
日本語で読む → - 論文VLAロボティクス
SpatialVLA:視覚-言語-行動モデルのための空間表現の探求
ロボット操作における空間理解の重要性に着目し、3D位置エンコーディングと適応的行動グリッドを導入した視覚-言語-行動基盤モデルSpatialVLAを提案。110万件の実世界ロボットデータで事前学習し、ゼロショットでの操作や新環境への適応を実現した。
原題: SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model / Delin Qu, Haoming Song, Qizhi Chen 他
日本語で読む → - 論文VLAロボティクス
オンライン強化学習による視覚言語行動モデルの改善
大規模視覚言語行動モデルをオンライン強化学習で改善する際の不安定性と計算負荷に対処するため、強化学習と教師あり学習を交互に繰り返すiRe-VLAフレームワークを提案し、シミュレーションと実機で有効性を検証した。
原題: Improving Vision-Language-Action Model with Online Reinforcement Learning / Yanjiang Guo, Jianke Zhang, Xiaoyu Chen 他
日本語で読む → - 論文VLA画像認識
VLMは自動運転に本当に使えるのか?信頼性・データ・評価指標の観点からの実証研究
自動運転向けVLMの信頼性を17設定・約2万フレームで評価するベンチマークDriveBenchを構築し、VLMが視覚ではなく一般知識やテキスト手がかりに依存しがちであることを明らかにした。
原題: Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives / Shaoyuan Xie, Lingdong Kong, Yuhao Dong 他
日本語で読む → - 論文自動運転/VLAAI
SenseRAG: LLMベース自動運転のための能動的クエリによる環境知識ベース構築
マルチモーダルなセンサデータをLLMが読める知識ベースに統合し、能動的RAGと思考連鎖プロンプトで自動運転の状況認識・予測性能を向上させるフレームワークを提案。
原題: SenseRAG: Constructing Environmental Knowledge Bases with Proactive Querying for LLM-Based Autonomous Driving / Xuewen Luo, Fan Ding, Fengze Yang 他
日本語で読む → - 論文VLA画像認識
PhysBench:視覚言語モデルの物理世界理解を評価・強化するベンチマーク
視覚言語モデル(VLM)の物理世界理解を評価する10,002件のベンチマークPhysBenchを提案し、75モデルの評価と、視覚モデルを組み合わせて物理理解を強化するPhysAgentを開発した。
原題: PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding / Wei Chow, Jiageng Mao, Boyi Li 他
日本語で読む → - 論文VLAロボティクス
ロボティックプログラマー:動画指示によるロボット操作のためのポリシーコード生成
大規模言語モデルと視覚言語モデルを活用し、動画から実行可能なコードを合成するVideo2Codeを開発。自由形式の指示と視覚情報からゼロショットでロボット操作ポリシーコードを生成する基盤モデルRoboProを提案。
原題: Robotic Programmer: Video Instructed Policy Code Generation for Robotic Manipulation / Senwei Xie, Hongyu Wang, Zhanqi Xiao 他
日本語で読む → - 論文VLAロボティクス
Shake-VLA: 視覚言語行動モデルによる双腕ロボットのカクテル調製システム
視覚・音声・言語モデルを統合したVLAシステムで、双腕ロボットが材料の検出・計量・混合作業を行い、カクテルを自動調製する。
原題: Shake-VLA: Vision-Language-Action Model-Based System for Bimanual Robotic Manipulations and Liquid Mixing / Muhamamd Haris Khan, Selamawit Asfaw, Dmitrii Iarchuk 他
日本語で読む → - 論文VLAロボティクス
UAVとLLMの融合:エージェント型低空モビリティへの展望
UAVと大規模言語モデル(LLM)の統合に関する研究動向を整理し、マルチモーダルデータや応用タスクを分類するとともに、自律的な知能を持つエージェント型UAVへのロードマップを提案したサーベイ論文。
原題: UAVs Meet LLMs: Overviews and Perspectives Toward Agentic Low-Altitude Mobility / Yonglin Tian, Fei Lin, Yiduo Li 他
日本語で読む → - 論文VLAロボティクス
UAV-VLA:大規模航空ミッション生成のための視覚言語行動システム
衛星画像とVLM・GPTを組み合わせ、テキスト指示から飛行経路と行動計画を生成するUAV向けシステムを提案。
原題: UAV-VLA: Vision-Language-Action System for Large Scale Aerial Mission Generation / Oleg Sautenkov, Yasheerah Yaqoot, Artem Lykov 他
日本語で読む → - 論文VLAロボティクス
EnerVerse: ロボットマニピュレーションのための身体化未来空間の想像
指示から未来の身体化空間を予測する生成ロボティクス基盤モデルを提案し、4Dガウススプラッティングと組み合わせてシミュレーションと実世界のギャップを縮め、高性能な操作を実現した。
原題: EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation / Siyuan Huang, Liliang Chen, Pengfei Zhou 他
日本語で読む → - 論文VLAロボティクス
CoDriveVLM: VLMで強化した都市協調配車と運動計画による未来のオンデマンド自律モビリティ
VLMを活用して配車と衝突リスク評価を統合し、分散協調型の運動計画を組み合わせることで、オンデマンド自律モビリティシステムの同時配車・協調走行を実現するフレームワークを提案した。
原題: CoDriveVLM: VLM-Enhanced Urban Cooperative Dispatching and Motion Planning for Future Autonomous Mobility on Demand Systems / Haichao Liu, Ruoyu Yao, Wenru Liu 他
日本語で読む → - 論文VLAロボティクス
ユニバーサルアクションによる具現化基盤モデルの強化
多様なロボットの動作を共通の「ユニバーサルアクション空間」で表現し、異なる機体間でのデータ活用と汎化性能を高める具現化基盤モデルUniActを提案。0.5Bパラメータで14倍規模の既存モデルを上回る。
原題: Universal Actions for Enhanced Embodied Foundation Models / Jinliang Zheng, Jianxiong Li, Dongxiu Liu 他
日本語で読む →