論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
身体性エージェントと人間の適応のための通信効率の良い欲求アラインメント
家庭支援シミュレーション環境HA-Desireを構築し、曖昧な指示からユーザの潜在的な欲求を推論して適応するフレームワークFAMERを提案した。欲求ベースの心的推論と反省ベースの通信モジュールにより、タスク実行と通信効率を大幅に向上させた。
原題: Communication-Efficient Desire Alignment for Embodied Agent-Human Adaptation / Yuanfei Wang, Xinju Huang, Fangwei Zhong 他
日本語で読む → - 論文VLA機械学習
Vision-Language-Actionモデルのための対話型ポストトレーニング
疎な成功報酬のみを用いた強化学習ベースの対話型ポストトレーニング手法RIPT-VLAを提案し、VLAモデルの適応性と成功率を大幅に向上させた。
原題: Interactive Post-Training for Vision-Language-Action Models / Shuhan Tan, Kairan Dou, Yue Zhao 他
日本語で読む → - 論文VLAロボティクス
意味的知能:低コストロボティクスにおけるGPT-4とA*プランニングの統合
低コストロボット上でGPT-4の意味推論とA*経路計画を組み合わせ、FSMを使わずに高レベルな指示を解釈して経路生成するハイブリッド手法を提案した論文。
原題: Semantic Intelligence: Integrating GPT-4 with A Planning in Low-Cost Robotics / Jesse Barkley, Abraham George, Amir Barati Farimani
日本語で読む → - 論文VLA機械学習
知識を保護する視覚-言語-行動モデル:高速学習・高速推論・より良い汎化
連続制御用のアクションエキスパートを組み込んだVLAモデルにおいて、学習速度と知識転移が損なわれる問題を分析し、VLMバックボーンを保護する学習手法を提案した。
原題: Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better / Danny Driess, Jost Tobias Springenberg, Brian Ichter 他
日本語で読む → - 論文VLAロボティクス
LogisticsVLN: エージェント型UAVによる低高度ラストマイル配送のための視覚言語ナビゲーション
MLLMを活用し、要求理解・階層特定・物体検出・行動決定を組み合わせたUAV配送システムを提案し、CARLAシミュレータ上のVLDデータセットで有効性を検証した。
原題: LogisticsVLN: Vision-Language Navigation For Low-Altitude Terminal Delivery Based on Agentic UAVs / Xinyuan Zhang, Yonglin Tian, Fei Lin 他
日本語で読む → - 論文VLAロボティクス
LightEMMA: 自動運転のための軽量エンドツーエンドマルチモーダルモデル
様々な視覚言語モデルを統合して自動運転エージェントを構築し、nuScenes予測タスクで性能を比較評価する軽量フレームワークを提案した。
原題: LightEMMA: Lightweight End-to-End Multimodal Model for Autonomous Driving / Zhijie Qiao, Haowei Li, Zhong Cao 他
日本語で読む → - 論文VLAロボティクス
ManiTaskGen: 視覚言語エージェントの身体的意思決定を評価・改善するための包括的タスク生成器
任意のシーンに対して多様で実行可能な移動操作タスクを自動生成するシステムを提案し、シミュレーションと実環境でその有効性を示すとともに、生成タスクを用いたベンチマーク構築とエージェント性能向上手法を提示した。
原題: ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making / Liu Dai, Haina Wang, Weikang Wan 他
日本語で読む → - 論文VLAロボティクス
UAV-Flow Colosseo:言葉に反応して飛ぶUAV模倣学習の実世界ベンチマーク
言語指示に応じて短距離・反応的な飛行を行う「Flying-on-a-Word」タスクを定式化し、実世界データセット・制御フレームワーク・シミュレータを備えた初のベンチマークUAV-Flowを構築した。
原題: UAV-Flow Colosseo: A Real-World Benchmark for Flying-on-a-Word UAV Imitation Learning / Xiangyu Wang, Donglin Yang, Yue Liao 他
日本語で読む → - 論文VLAロボティクス
自己注意機構によるRGB-イベント融合を用いた衝突予測
RGBカメラとイベントカメラの2つの入力を自己注意機構で融合し、ドローンの動的物体との衝突時刻と位置を予測する手法を提案。単一モダリティとの精度・計算コストのトレードオフを評価した。
原題: RGB-Event Fusion with Self-Attention for Collision Prediction / Pietro Bonazzi, Christian Vogt, Michael Jost 他
日本語で読む → - 論文VLAロボティクス
LA-RCS: LLMエージェントに基づくロボット制御システム
LLMエージェントを活用し、ユーザ要求に基づく計画立案・環境観測・実行・適応を自律的に行う二重エージェント型ロボット制御システムを提案し、4種類のシナリオで平均90%の成功率を達成した。
原題: LA-RCS: LLM-Agent-Based Robot Control System / TaekHyun Park, YoungJun Choi, SeungHoon Shin 他
日本語で読む → - 論文VLAロボティクス
Search-TTA: 実環境での視覚探索のためのマルチモーダルテスト時適応フレームワーク
衛星画像とCLIPを活用した視覚探索において、探索中に不確実性重み付き勾配更新で予測を動的に修正するテスト時適応フレームワークを提案し、大規模生態データセットAVS-Benchで最大30%の性能向上を達成した。
原題: Search-TTA: A Multimodal Test-Time Adaptation Framework for Visual Search in the Wild / Derek Ming Siang Tan, Shailesh, Boyang Liu 他
日本語で読む → - 論文VLAロボティクス
条件付き最適輸送カップリングによる高速フローベース視覚運動ポリシー
ノイズとサンプル間の条件付き最適輸送カップリングを用いてフローODEを直線化し、拡散ポリシーより10倍高速で成功率も4%高い少数ステップのロボット視覚運動ポリシーを実現した。
原題: Fast Flow-based Visuomotor Policies via Conditional Optimal Transport Couplings / Andreas Sochopoulos, Nikolay Malkin, Nikolaos Tsagkas 他
日本語で読む → - 論文VLAロボティクス
オフライン目標条件付き強化学習のための極値フローマッチング
フローマッチングの性質を利用して学習分布の最小値・最大値を推定し、目標条件付き模倣・強化学習アルゴリズムを構築。OGBenchとTalosヒューマノイドでの実機検証を行った。
原題: Extremum Flow Matching for Offline Goal Conditioned Reinforcement Learning / Quentin Rouxel, Clemente Donoso, Fei Chen 他
日本語で読む → - 論文VLAロボティクス
Spatial-LLaVA: 空間参照表現を用いた視覚理解のための大規模言語モデル強化
SUN-Spot v2.0データセットを構築し、空間参照表現を学習させたマルチモーダルLLM「Spatial-LLaVA」を提案。ゼロショット空間推論ベンチマークで3.15%の性能向上を達成した。
原題: Spatial-LLaVA: Enhancing Large Language Models with Spatial Referring Expressions for Visual Understanding / Xuefei Sun, Doncey Albin, Cecilia Mauceri 他
日本語で読む → - 論文VLAロボティクス
生成的スキル獲得のための身体性推論のリアルタイム検証
身体性エージェントのスキル学習に検証モデルを導入し、手動の報酬設計なしで高密度報酬を自動生成するVERGSAを提案。タスク成功率を21%向上させた。
原題: Real-Time Verification of Embodied Reasoning for Generative Skill Acquisition / Bo Yue, Shuqi Guo, Kaiyu Hu 他
日本語で読む → - 論文VLAロボティクス
ヒューマノイドロボットの自律性に向けて:連続思考機械(CTM)とモデルコンテキストプロトコル(MCP)を統合した動的アーキテクチャ
ヒューマノイドロボットの自律行動を実現するため、連続思考機械(CTM)とモデルコンテキストプロトコル(MCP)を組み合わせた動的アーキテクチャを提案し、シミュレーション実験で有効性を検証した論文。
原題: Towards Humanoid Robot Autonomy: A Dynamic Architecture Integrating Continuous thought Machines (CTM) and Model Context Protocol (MCP) / Libo Wang
日本語で読む → - 論文VLA画像認識
CoMo: インターネット動画から連続潜在運動を学習するスケーラブルなロボット学習
インターネット動画から連続的な潜在運動表現を教師なしで学習し、未知動画へのゼロショット汎化と擬似行動ラベル生成を可能にする手法CoMoを提案。
原題: CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning / Jiange Yang, Yansong Shi, Haoyi Zhu 他
日本語で読む → - 論文VLA画像認識
DOPE: 視覚と言語によるナビゲーションのためのデュアル物体知覚強化ネットワーク
視覚と言語によるナビゲーション(VLN)において、指示文から重要なフレーズを抽出し、物体と行動の詳細を活用するテキスト物体知覚強化と、異なるモダリティ間の物体関係をモデル化する画像物体知覚強化を組み合わせたDOPEを提案。
原題: DOPE: Dual Object Perception-Enhancement Network for Vision-and-Language Navigation / Yinfeng Yu, Dongsheng Yang
日本語で読む → - 論文VLAロボティクス
GraspVLA:10億規模の合成行動データで事前学習した把持基盤モデル
シミュレーションで生成した10億フレームの把持データセットSynGrasp-1Bを用いて、視覚・言語・行動を統合したVLAモデルGraspVLAを事前学習し、実世界でのゼロショット汎化と少数ショット適応を実現した。
原題: GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data / Shengliang Deng, Mi Yan, Songlin Wei 他
日本語で読む → - 論文VLAロボティクス
想像・検証・実行:視覚言語モデルによる記憶誘導型エージェント探索
視覚言語モデルでシーンを想像し物理的妥当性を検証してから行動する探索フレームワークIVEを提案し、多様な探索と下流学習の性能向上を実現した。
原題: Imagine, Verify, Execute: Memory-guided Agentic Exploration with Vision-Language Models / Seungjae Lee, Daniel Ekpo, Haowen Liu 他
日本語で読む → - 論文VLAロボティクス
Robo2VLM:大規模実世界ロボット操作データセットからの視覚的質問応答
ロボットの実軌道データから操作フェーズを切り出し、空間・目標・相互作用推論のVQAデータセットを自動生成するフレームワークを提案し、VLMの評価・改善に有効性を示した。
原題: Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets / Kaiyuan Chen, Shuangyu Xie, Zehan Ma 他
日本語で読む → - 論文VLAロボティクス
ブラックボックス運転支援の監視を支援:車線維持支援の予測アラートに向けた視覚言語モデル
LKAlertは、視覚言語モデルを用いて車線維持支援の失敗を1〜3秒前に予測し、自然言語で説明する監視アラートシステムで、予測・説明可能なLKAlert用ベンチマークも提案した。
原題: Bridging Human Oversight and Black-box Driver Assistance: Vision-Language Models for Predictive Alerting in Lane Keeping Assist Systems / Yuhang Wang, Hao Zhou
日本語で読む → - 論文VLAロボティクス
Aux-Think: データ効率の良い視覚言語ナビゲーションのための推論戦略の探求
視覚言語ナビゲーション(VLN)において推論戦略を体系的に評価し、推論時の推論崩壊問題を明らかにした上で、CoT教師あり学習で推論パターンを内部化しつつ直接行動予測を行うAux-Thinkを提案した。
原題: Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation / Shuo Wang, Yongcai Wang, Wanting Li 他
日本語で読む → - 論文VLAロボティクス
条件付けが鍵:拡散ポリシーの学習は思ったより速い
条件拡散ポリシー学習で生じる「損失崩壊」を特定し、条件に依存したソース分布を用いるCocosを提案。少ない学習ステップとパラメータで大規模事前学習VLAに匹敵する性能を実現した。
原題: Conditioning Matters: Training Diffusion Policies is Faster Than You Think / Zibin Dong, Yicheng Liu, Yinchuan Li 他
日本語で読む → - 論文VLA画像認識
視覚空間認知のための視覚エキスパート階層融合
意味理解と空間構造の二重エンコーダと空間QAデータセットで学習させたMLLM「ViCA2」を提案し、VSI-Benchで最高精度を達成した。
原題: Towards Visuospatial Cognition via Hierarchical Fusion of Visual Experts / Qi Feng
日本語で読む → - 論文VLAロボティクス
ReLI: 言語に依存しない人間-ロボットインタラクション手法
大規模基盤モデルを言語から行動へのモデルに変換し、多言語での自然な対話を通じてロボットが環境を推論しタスクを実行できる言語非依存の手法を提案。140言語で90%以上の精度を達成。
原題: ReLI: A Language-Agnostic Approach to Human-Robot Interaction / Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci 他
日本語で読む → - 論文VLAロボティクス
ReFineVLA:推論を考慮した教師ガイド付き転移ファインチューニング
専門家モデルが生成した推論根拠でデータセットを拡張し、VLAモデルに行動の理由を考えさせるファインチューニング手法を提案。複雑な操作タスクでの汎化性能と解釈性を向上させた。
原題: ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning / Tuan Van Vo, Tan Quang Nguyen, Khang Minh Nguyen 他
日本語で読む → - 論文VLAロボティクス
BadNAVer: 視覚言語ナビゲーションに対するジェイルブレイク攻撃の探索
MLLM駆動の視覚言語ナビゲータに対する初の体系的なジェイルブレイク攻撃を提案し、シミュレータと実機で90%超の攻撃成功率を示した。
原題: BadNAVer: Exploring Jailbreak Attacks On Vision-and-Language Navigation / Wenqi Lyu, Zerui Li, Yanyuan Qiao 他
日本語で読む → - 論文VLA画像認識
Dynam3D: 動的階層型3Dトークンによる視覚言語ナビゲーションのためのVLM強化
RGB-D画像からCLIP特徴を3D空間に投影し、動的で階層的な3D表現を構築することで、視覚言語ナビゲーションにおける3D理解と長期記憶を向上させるモデルを提案した。
原題: Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation / Zihan Wang, Seungjun Lee, Gim Hee Lee
日本語で読む → - 論文VLA画像認識
視覚言語モデルに対するユーザー信頼のマッピング:研究動向・課題・展望
視覚言語モデル(VLM)とのユーザーインタラクションにおける信頼の動態に関する研究を、認知科学的能力・協働モード・エージェント行動の観点から整理し、今後の信頼研究の要件を提示したサーベイ。
原題: Mapping User Trust in Vision Language Models: Research Landscape, Challenges, and Prospects / Agnese Chiatti, Sara Bernardini, Lara Shibelski Godoy Piccolo 他
日本語で読む →