論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/1/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文自動運転/VLAAI
SenseRAG: LLMベース自動運転のための能動的クエリによる環境知識ベース構築
マルチモーダルなセンサデータをLLMが読める知識ベースに統合し、能動的RAGと思考連鎖プロンプトで自動運転の状況認識・予測性能を向上させるフレームワークを提案。
原題: SenseRAG: Constructing Environmental Knowledge Bases with Proactive Querying for LLM-Based Autonomous Driving / Xuewen Luo, Fan Ding, Fengze Yang 他
日本語で読む → - 論文VLAロボティクス
ユニバーサルアクションによる具現化基盤モデルの強化
多様なロボットの動作を共通の「ユニバーサルアクション空間」で表現し、異なる機体間でのデータ活用と汎化性能を高める具現化基盤モデルUniActを提案。0.5Bパラメータで14倍規模の既存モデルを上回る。
原題: Universal Actions for Enhanced Embodied Foundation Models / Jinliang Zheng, Jianxiong Li, Dongxiu Liu 他
日本語で読む → - 論文VLAロボティクス
VLM駆動型ビヘイビアツリーによる文脈認識型タスクプランニング
視覚言語モデル(VLM)を用いて、視覚条件を考慮したビヘイビアツリーを対話的に生成・編集し、視覚的に複雑な環境での文脈認識型ロボット動作を実現するフレームワークを提案。実世界のカフェ環境で検証した。
原題: VLM-driven Behavior Tree for Context-aware Task Planning / Naoki Wake, Atsushi Kanehira, Jun Takamatsu 他
日本語で読む → - 論文VLAロボティクス
視覚言語モデルによる計画立案とロボット支援教育への応用
視覚言語モデル(VLM)を使い、初期状態の画像と目標状態の記述からPDDL問題を自動生成するImage2PDDLを提案し、ブロックワールドなどで評価した論文。
原題: Planning with Vision-Language Models and a Use Case in Robot-Assisted Teaching / Xuzhe Dang, Lada Kudláčková, Stefan Edelkamp
日本語で読む → - 論文VLAロボティクス
LiLMaps: 学習可能な暗黙的言語マップ
視覚言語特徴を統合して増分暗黙的マップを強化し、新規物体出現時のデコーダ最適化と視点間の予測不一致を解決する手法を提案。
原題: LiLMaps: Learnable Implicit Language Maps / Evgenii Kruzhkov, Sven Behnke
日本語で読む → - 論文VLAロボティクス
Shake-VLA: 視覚言語行動モデルによる双腕ロボットのカクテル調製システム
視覚・音声・言語モデルを統合したVLAシステムで、双腕ロボットが材料の検出・計量・混合作業を行い、カクテルを自動調製する。
原題: Shake-VLA: Vision-Language-Action Model-Based System for Bimanual Robotic Manipulations and Liquid Mixing / Muhamamd Haris Khan, Selamawit Asfaw, Dmitrii Iarchuk 他
日本語で読む → - 論文VLA自然言語
ロボットナビゲーションにおける言語と計画:最先端モデルの多言語評価
アラビア語を含む多言語の言語モデルを用いて、視覚と言語によるロボットナビゲーションの計画能力を評価した研究。
原題: Language and Planning in Robotic Navigation: A Multilingual Evaluation of State-of-the-Art Models / Malak Mansour, Ahmed Aly, Bahey Tharwat 他
日本語で読む → - 論文VLA画像認識
自動運転における歩行者行動とシーン理解への視覚言語モデルの応用
大規模視覚言語モデルの知識を効率的な視覚ネットワークに蒸留し、歩行者の行動予測とシーン理解に適用することで、多様で包括的な意味属性の生成と予測精度の向上を実現した。
原題: Application of Vision-Language Model to Pedestrians Behavior and Scene Understanding in Autonomous Driving / Haoxiang Gao, Li Zhang, Yu Zhao 他
日本語で読む → - 論文VLA画像認識
PhysBench:視覚言語モデルの物理世界理解を評価・強化するベンチマーク
視覚言語モデル(VLM)の物理世界理解を評価する10,002件のベンチマークPhysBenchを提案し、75モデルの評価と、視覚モデルを組み合わせて物理理解を強化するPhysAgentを開発した。
原題: PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding / Wei Chow, Jiageng Mao, Boyi Li 他
日本語で読む → - 論文VLA自然言語
3D-MoE:Rectified Flowによる姿勢拡散を備えた3D視覚・空間推論向けMixture-of-ExpertsマルチモーダルLLM
既存の密活性化LLMをMixture-of-Experts化し、Rectified Flow拡散ヘッド(Pose-DiT)を組み合わせることで、3D質問応答と身体性タスク計画を少ない活性パラメータで高精度に実行するフレームワークを提案した。
原題: 3D-MoE: A Mixture-of-Experts Multi-modal LLM for 3D Vision and Pose Diffusion via Rectified Flow / Yueen Ma, Yuzheng Zhuang, Jianye Hao 他
日本語で読む → - 論文VLAロボティクス
CoDriveVLM: VLMで強化した都市協調配車と運動計画による未来のオンデマンド自律モビリティ
VLMを活用して配車と衝突リスク評価を統合し、分散協調型の運動計画を組み合わせることで、オンデマンド自律モビリティシステムの同時配車・協調走行を実現するフレームワークを提案した。
原題: CoDriveVLM: VLM-Enhanced Urban Cooperative Dispatching and Motion Planning for Future Autonomous Mobility on Demand Systems / Haichao Liu, Ruoyu Yao, Wenru Liu 他
日本語で読む → - 論文VLAロボティクス
夢見るドローン:視覚ベース飛行のためのモデルベース強化学習
DreamerV3を用いて、カメラ画像のみを入力としてドローンレースコースを最大9m/sで飛行する視覚運動ポリシーを学習させた研究。
原題: Dream to Fly: Model-Based Reinforcement Learning for Vision-Based Drone Flight / Angel Romero, Ashwin Shenai, Ismail Geles 他
日本語で読む → - 論文VLAcs.AR
AI不確実性推定のための360 fJ/サンプルin-word GRNGを備えた65nmベイズニューラルネットワークアクセラレータ
SRAMメモリワード内にガウス乱数生成器を直接統合し、ベイズニューラルネットワークの不確実性推定をエッジで高速・低消費電力に実行するASICチップを開発した。
原題: A 65 nm Bayesian Neural Network Accelerator with 360 fJ/Sample In-Word GRNG for AI Uncertainty Estimation / Zephan M. Enciso, Boyang Cheng, Likai Pei 他
日本語で読む → - 論文VLAロボティクス
ロボティックプログラマー:動画指示によるロボット操作のためのポリシーコード生成
大規模言語モデルと視覚言語モデルを活用し、動画から実行可能なコードを合成するVideo2Codeを開発。自由形式の指示と視覚情報からゼロショットでロボット操作ポリシーコードを生成する基盤モデルRoboProを提案。
原題: Robotic Programmer: Video Instructed Policy Code Generation for Robotic Manipulation / Senwei Xie, Hongyu Wang, Zhanqi Xiao 他
日本語で読む → - 論文VLAロボティクス
UAV-VLA:大規模航空ミッション生成のための視覚言語行動システム
衛星画像とVLM・GPTを組み合わせ、テキスト指示から飛行経路と行動計画を生成するUAV向けシステムを提案。
原題: UAV-VLA: Vision-Language-Action System for Large Scale Aerial Mission Generation / Oleg Sautenkov, Yasheerah Yaqoot, Artem Lykov 他
日本語で読む → - 論文VLA画像認識
ECBench:マルチモーダル基盤モデルは自己中心的世界を理解できるか?包括的身体認知ベンチマーク
ロボットの自己認知や動的シーン知覚、幻覚といった身体認知能力を体系的に評価するため、30次元の認知軸を持つベンチマークECBenchと評価システムECEvaluを提案し、各種LVLMを評価した。
原題: ECBench: Can Multi-modal Foundation Models Understand the Egocentric World? A Holistic Embodied Cognition Benchmark / Ronghao Dang, Yuqian Yuan, Wenqi Zhang 他
日本語で読む → - 論文VLA画像認識
ロボティクス向け画像ベース地理推定:ブラックボックス視覚言語モデルは実用域に達したか
ブラックボックス設定の生成型視覚言語モデルを単体のゼロショット地理推定システムとして評価し、プロンプトやクエリ画像の変動に対する精度と一貫性を調査した。
原題: Image-based Geo-localization for Robotics: Are Black-box Vision-Language Models there yet? / Sania Waheed, Bruno Ferrarini, Michael Milford 他
日本語で読む → - 論文VLAロボティクス
EnerVerse: ロボットマニピュレーションのための身体化未来空間の想像
指示から未来の身体化空間を予測する生成ロボティクス基盤モデルを提案し、4Dガウススプラッティングと組み合わせてシミュレーションと実世界のギャップを縮め、高性能な操作を実現した。
原題: EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation / Siyuan Huang, Liliang Chen, Pengfei Zhou 他
日本語で読む → - 論文VLAロボティクス
ピクセルから述語へ:事前学習済み視覚言語モデルによる記号的世界モデルの学習
事前学習済み視覚言語モデルを用いて画像から記号的な述語を抽出し、長期タスクの計画に使える抽象的世界モデルを少数の実演から学習する手法を提案。
原題: From Pixels to Predicates: Learning Symbolic World Models via Pretrained Vision-Language Models / Ashay Athalye, Nishanth Kumar, Tom Silver 他
日本語で読む → - 論文VLAロボティクス
FAST: 視覚言語行動モデルのための効率的な行動トークン化
離散コサイン変換に基づく新しい行動トークン化手法FASTを提案し、高頻度で器用なロボットタスクにおける自己回帰型VLAの学習を可能にした。
原題: FAST: Efficient Action Tokenization for Vision-Language-Action Models / Karl Pertsch, Kyle Stachowicz, Brian Ichter 他
日本語で読む → - 論文VLA機械学習
Vintix: 文脈内強化学習による汎用行動モデル
文脈内強化学習(ICRL)をスケールさせるため、クロスドメインで動作する固定の行動モデルを構築し、アルゴリズム蒸留が専門家蒸留に代わる有効な手法であることを示した。
原題: Vintix: Action Model via In-Context Reinforcement Learning / Andrey Polubarov, Nikita Lyubaykin, Alexander Derevyagin 他
日本語で読む → - 論文VLAロボティクス
ロボット知能モデルのための深層学習に基づく準意識トレーニング
深層学習を用いてロボット知能モデルに環境情報を学習・推論させ、未経験の概念を統合できる汎化能力と、擬人的行動を学ぶ準意識的トレーニングの可能性を探った研究。
原題: Deep Learning based Quasi-consciousness Training for Robot Intelligent Model / Yuchun Li, Fang Zhang
日本語で読む → - 論文VLAロボティクス
オンライン強化学習による視覚言語行動モデルの改善
大規模視覚言語行動モデルをオンライン強化学習で改善する際の不安定性と計算負荷に対処するため、強化学習と教師あり学習を交互に繰り返すiRe-VLAフレームワークを提案し、シミュレーションと実機で有効性を検証した。
原題: Improving Vision-Language-Action Model with Online Reinforcement Learning / Yanjiang Guo, Jianke Zhang, Xiaoyu Chen 他
日本語で読む → - 論文VLA画像認識
大規模視覚言語モデルの最新動向:アラインメント、ベンチマーク、評価、課題に関するサーベイ
2025年までの主要な視覚言語モデル(VLM)のモデル情報、アーキテクチャの変遷とアラインメント手法、ベンチマークと評価指標、幻覚や公平性などの課題を体系的にまとめたサーベイ論文。
原題: A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges / Zongxia Li, Xiyang Wu, Hongyang Du 他
日本語で読む → - 論文VLAロボティクス
SpatialCoT:座標アライメントと思考連鎖による身体性タスク計画の空間推論強化
視覚言語モデルの空間推論能力を高めるため、座標の双方向アライメントと思考連鎖に基づく空間グラウンディングを組み合わせたSpatialCoTを提案し、ナビゲーションとマニピュレーションのタスクで従来手法を上回る性能を示した。
原題: SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning / Yuecheng Liu, Dafeng Chi, Shiguang Wu 他
日本語で読む → - 論文VLA画像認識
VLMは自動運転に本当に使えるのか?信頼性・データ・評価指標の観点からの実証研究
自動運転向けVLMの信頼性を17設定・約2万フレームで評価するベンチマークDriveBenchを構築し、VLMが視覚ではなく一般知識やテキスト手がかりに依存しがちであることを明らかにした。
原題: Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives / Shaoyuan Xie, Lingdong Kong, Yuhao Dong 他
日本語で読む → - 論文VLAロボティクス
PO-GVINS: 姿勢のみ表現によるGNSS・視覚・慣性の密結合統合
視覚慣性システムに姿勢のみ表現を導入し、3D特徴点を状態から除外することで線形化誤差と次元爆発を回避し、GNSS生測定と整数アンビギュイティ解を統合したドリフトフリーな測位フレームワークを提案。
原題: PO-GVINS: Tightly Coupled GNSS-Visual-Inertial Integration with Pose-Only Representation / Zhuo Xu, Feng Zhu, Zihang Zhang 他
日本語で読む → - 論文VLAロボティクス
RDMM: 特定ドメインにおける文脈認識を強化したオンデバイスロボット意思決定用の微調整済みLLMモデル
8GBメモリのオンデバイス環境で動作する、視覚・音声認識を統合したロボット意思決定フレームワークRDMMを提案し、家庭内競技のデータセットで93%の計画精度を達成した。
原題: RDMM: Fine-Tuned LLM Models for On-Device Robotic Decision Making with Enhanced Contextual Awareness in Specific Domains / Shady Nasrat, Myungsu Kim, Seonil Lee 他
日本語で読む → - 論文VLA画像認識
Social-LLaVA:人間的言語推論による社会的空間でのロボットナビゲーション強化
人とロボットの社会的インタラクション4万件のVQAデータセットSNEIを作成し、VLMを微調整したSocial-LLaVAで社会的に配慮したロボットナビゲーションを実現した。
原題: Social-LLaVA: Enhancing Robot Navigation through Human-Language Reasoning in Social Spaces / Amirreza Payandeh, Daeun Song, Mohammad Nazeri 他
日本語で読む → - 論文VLAロボティクス
視覚を超えて:言語グラウンディングによる異種センサーでの汎用ロボット方策のファインチューニング
自然言語を共通のクロスモーダル基盤として用い、視覚・触覚・音声などの異種センサー入力を扱えるよう汎用ロボット方策をファインチューニングする手法FuSeを提案。実世界実験で成功率を20%以上向上させた。
原題: Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding / Joshua Jones, Oier Mees, Carmelo Sferrazza 他
日本語で読む →