論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文自動運転/VLAロボティクス
NavigScene:視覚範囲を超えた自動運転のための局所知覚とグローバルナビゲーションの橋渡し
局所的な視覚情報とグローバルなナビゲーション情報を統合する補助データセットNavigSceneを提案し、ナビゲーション誘導の推論・選好最適化・視覚言語行動モデルの3手法で自動運転の知覚・予測・計画・QA性能を向上させた。
原題: NavigScene: Bridging Local Perception and Global Navigation for Beyond-Visual-Range Autonomous Driving / Qucheng Peng, Chen Bai, Guoxiang Zhang 他
日本語で読む → - 論文VLA画像認識
再帰的視覚想像と適応的言語接地による視覚言語ナビゲーション
視覚言語ナビゲーションにおいて、履歴視覚情報を再帰的に要約し、言語命令と適応的に整合させることで、長系列のナビゲーション判断を改善する手法を提案した論文。
原題: Recursive Visual Imagination and Adaptive Linguistic Grounding for Vision Language Navigation / Bolei Chen, Jiaxu Kang, Yifei Wang 他
日本語で読む → - 論文VLA画像認識
視点変化に頑健な視覚言語ナビゲーションのための視点不変学習
連続環境における視覚言語ナビゲーション(VLNCE)で、カメラの高さや角度が変化しても性能が落ちにくい視点不変なポストトレーニング手法VILを提案し、R2R-CEとRxR-CEで成功率を8〜15%改善した。
原題: View Invariant Learning for Vision-Language Navigation in Continuous Environments / Josh Qixuan Sun, Huaiyuan Weng, Xiaoying Xing 他
日本語で読む → - 論文VLAロボティクス
MoIRA: マルチタスクロボティクス向けモジュール型インストラクションルーティングアーキテクチャ
既存のVLAモデルを専門家として組み合わせ、テキストベースの外部ルーターでゼロショットにタスクを振り分けるモジュール型MoEフレームワークを提案。ヒューマノイドやLIBEROベンチマークで汎用モデルを上回る性能を示した。
原題: MoIRA: Modular Instruction Routing Architecture for Multi-Task Robotics / Dmytro Kuzmenko, Nadiya Shvai
日本語で読む → - 論文VLAAI
VLMPlanner: 視覚言語モデルと運動計画の統合
視覚言語モデル(VLM)を自動運転の運動計画に組み込み、生画像から得た文脈情報でリアルタイムプランナを誘導するハイブリッド手法を提案。シーン複雑度に応じて推論頻度を調整する機構も導入した。
原題: VLMPlanner: Integrating Visual Language Models with Motion Planning / Zhipeng Tang, Sha Zhang, Jiajun Deng 他
日本語で読む → - 論文VLAHCI
iLearnRobot:対話から継続的に学習するマルチモーダルロボット
非専門家との自然な対話を通じてロボットが継続的に学習・改善するMLLMベースの対話型ロボットシステムを提案し、質問連鎖と二重モダリティ検索で同じミスの繰り返しを防ぐ。
原題: iLearnRobot: An Interactive Learning-Based Multi-Modal Robot with Continuous Improvement / Kohou Wang, ZhaoXiang Liu, Lin Bai 他
日本語で読む → - 論文VLAロボティクス
視覚運動エージェントの汎化可能な空間知能のためのスケーラブルなマルチタスク強化学習
Minecraft環境で大規模マルチタスク強化学習を行い、視覚運動エージェントが未見の世界や実世界設定へゼロショット汎化できることを示した。
原題: Scalable Multi-Task Reinforcement Learning for Generalizable Spatial Intelligence in Visuomotor Agents / Shaofei Cai, Zhancun Mu, Haiwen Xia 他
日本語で読む → - 論文VLA機械学習
報酬モデリング不要の大規模視覚言語モデルフィードバックによる方策学習
大規模視覚言語モデルに軌道ペアの選好を問い合わせ、報酬モデルを学習せずに直接方策を訓練する手法PLAREを提案し、ロボット操作タスクで有効性を示した。
原題: Policy Learning from Large Vision-Language Model Feedback without Reward Modeling / Tung M. Luu, Donghoon Lee, Younghwan Lee 他
日本語で読む → - 論文VLA画像認識
Talk2Event: イベントカメラによる動的シーンの言語接地理解
イベントカメラの非同期ストリームを言語と結びつける大規模ベンチマークTalk2Eventを構築し、属性を考慮した接地フレームワークEventReferを提案した。
原題: Talk2Event: Grounded Understanding of Dynamic Scenes from Event Cameras / Lingdong Kong, Dongyue Lu, Ao Liang 他
日本語で読む → - 論文自動運転/VLAロボティクス
適応的自律運転のための知覚・言語・行動統合フレームワーク
カメラ・LiDAR・レーダーのマルチセンサ融合とGPT-4.1による推論を組み合わせ、知覚から言語的理解を経て行動決定までを統合した自動運転フレームワークを提案。市街地交差点での評価で軌道追従や適応計画の性能向上を示した。
原題: A Unified Perception-Language-Action Framework for Adaptive Autonomous Driving / Yi Zhang, Erik Leo Haß, Kuo-Yi Chao 他
日本語で読む → - 論文VLAロボティクス
GR-3 汎用ロボットポリシー構築に向けた大規模VLAモデル
ウェブ規模の視覚言語データとVR収集の人間軌道データ、ロボット軌道データを組み合わせて訓練した大規模VLAモデルGR-3を開発し、両腕移動ロボットByteMiniと統合して新規物体・環境・長期タスクへの汎化性能を示した。
原題: GR-3 Technical Report / Chilam Cheang, Sijin Chen, Zhongren Cui 他
日本語で読む → - 論文VLAロボティクス
視覚言語ナビゲーションにおける身体性ギャップの再考:物理的・視覚的格差の包括的研究
人型・四足・車輪ロボットに対応した物理的に現実的なVLN評価プラットフォームVLN-PEを提案し、既存のVLN手法が実機環境で性能劣化する要因を体系的に分析した。
原題: Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities / Liuyi Wang, Xinyuan Xia, Hui Zhao 他
日本語で読む → - 論文VLAロボティクス
StreamVLN:スローファスト文脈モデリングによるストリーミング視覚言語ナビゲーション
視覚と言語の入力からリアルタイムに行動を生成するVLN向けに、高速な対話文脈と低速更新の記憶文脈を組み合わせたストリーミングフレームワークを提案し、低遅延で最先端性能を達成した。
原題: StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling / Meng Wei, Chenyang Wan, Xiqian Yu 他
日本語で読む → - 論文VLAロボティクス
Evo-0: 暗黙的な空間理解を備えた視覚-言語-行動モデル
既存の視覚基盤モデルを活用し、RGB画像のみから3D幾何特徴を暗黙的に取り込むプラグアンドプレイモジュールを提案し、VLAモデルの空間理解能力を向上させた。
原題: Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding / Tao Lin, Gen Li, Yilei Zhong 他
日本語で読む → - 論文VLA画像認識
Being-H0: 大規模人間動画からの視覚-言語-行動事前学習
大規模な人間の動画を活用し、巧みな操作を可能にする視覚-言語-行動モデルを事前学習する手法を提案。物理指示チューニングにより、実世界のロボット操作への転移性能を向上させた。
原題: Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos / Hao Luo, Yicheng Feng, Wanpeng Zhang 他
日本語で読む → - 論文VLA機械学習
行動的探索:インコンテキスト適応による探索の学習
専門家のデモデータを用いて、過去の観測と探索度合いを条件に行動を予測する長文脈生成モデルを訓練し、オンラインでの高速適応と効率的な探索を実現する手法を提案。
原題: Behavioral Exploration: Learning to Explore via In-Context Adaptation / Andrew Wagenmaker, Zhiyuan Zhou, Sergey Levine
日本語で読む → - 論文VLA画像認識
VOTE: 軌道アンサンブル投票による視覚-言語-行動モデルの最適化
VLAモデルの推論遅延と学習コストを削減するため、少ない行動トークンで並列生成する学習フレームワークと、過去と現在の予測を投票で統合する推論最適化を提案し、成功率と推論速度を大幅に向上させた。
原題: VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting / Juyi Lin, Amir Taherin, Arash Akbari 他
日本語で読む → - 論文VLAロボティクス
見て、集中して、行動する:人間の視線と周辺視型Vision Transformerによる効率的で頑健なロボット学習
人間の視線運動を模した能動的視覚システムGIAVAを開発し、注視点に基づく周辺視パッチトークン化をViTに組み込むことで、計算量を大幅に削減しつつ背景の妨害に対する頑健性と高精度タスクの成功率を向上させた。
原題: Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers / Ian Chuang, Jinyu Zou, Andrew Lee 他
日本語で読む → - 論文VLAロボティクス
VLMをロボット向けに:低レベル手順推論の自己批判的蒸留
小さな視覚言語モデルが外部教師なしで自己批判・修正・検証を繰り返し、ロボット実行可能な手順計画を生成する自己改善フレームワークを提案。
原題: Making VLMs More Robot-Friendly: Self-Critical Distillation of Low-Level Procedural Reasoning / Chan Young Park, Jillian Fisher, Marius Memmel 他
日本語で読む → - 論文VLAロボティクス
EdgeVLA: エッジデバイス向け効率的な視覚-言語-行動モデル
エンドエフェクタ位置予測の自己回帰を排除し小型言語モデルを活用することで、視覚-言語-行動モデルの推論を高速化しエッジデバイスでのリアルタイム動作を可能にした。
原題: EdgeVLA: Efficient Vision-Language-Action Models / Paweł Budzianowski, Wesley Maa, Matthew Freed 他
日本語で読む → - 論文VLAロボティクス
憲法コントローラ:不確実環境下で規範に従うエージェントのための疑念校正ステアリング
深層確率論理プログラムと自己疑念の概念を組み合わせ、不確実な環境でも規則に従い安全に行動する自律エージェントを実現するフレームワークCoCoを提案し、実世界の空中移動実験で有効性を示した。
原題: The Constitutional Controller: Doubt-Calibrated Steering of Compliant Agents / Simon Kohaut, Felix Divo, Navid Hamid 他
日本語で読む → - 論文VLAロボティクス
VLMから時間的に一貫した報酬を学習なしで生成する手法
VLMを用いてサブゴールの状態変化を追跡し、ベイズ推定で報酬を生成することで、追加学習なしにロボット操作の強化学習を高精度化するフレームワークを提案。
原題: Training-free Generation of Temporally Consistent Rewards from VLMs / Yinuo Zhao, Jiale Yuan, Zhiyuan Xu 他
日本語で読む → - 論文VLAロボティクス
Octopi-1.5:視覚・触覚・言語モデルの実演
触覚信号を複数部位から処理し、RAGで新規物体を学習できる視覚・触覚・言語モデルOctopi-1.5を、手持ち型触覚デバイスTMIを通じて実演する。
原題: Demonstrating the Octopi-1.5 Visual-Tactile-Language Model / Samson Yu, Kelvin Lin, Harold Soh
日本語で読む → - 論文VLAロボティクス
AirStar:音声とジェスチャーで操る知能ドローンアシスタント
大規模言語モデルを頭脳に、音声やジェスチャーで指示できるドローン「AirStar」を開発。地理空間知識と文脈推論を組み合わせ、バドミントンコートまで案内するなど、長距離ナビゲーションと近距離制御を実現した。
原題: "Hi AirStar, Guide Me to the Badminton Court." / Ziqin Wang, Jinyu Chen, Xiangyi Zheng 他
日本語で読む → - 論文VLAロボティクス
大規模シーングラフにおける汎用複数物体回収のためのLLMと動作計画の交互実行
大規模シーングラフ環境で複数の物体を複数箇所に運ぶ長期タスクに対し、LLMと動作計画を交互に実行する手法を提案し、従来比30%の性能向上を達成した。
原題: Interleaved LLM and Motion Planning for Generalized Multi-Object Collection in Large Scene Graphs / Ruochu Yang, Yu Zhou, Fumin Zhang 他
日本語で読む → - 論文VLA画像認識
GaussianVLM: 言語対応ガウシアンスプラットによるシーン中心3D視覚言語モデル
3Dガウシアンスプラットに言語特徴を直接埋め込み、物体検出器に依存せずに3Dシーン理解と身体性推論を行う視覚言語モデルを提案した。
原題: GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond / Anna-Maria Halacheva, Jan-Nico Zaech, Xi Wang 他
日本語で読む → - 論文VLAロボティクス
DEMONSTRATE: マルチタスク実演学習によるゼロショット言語からロボット制御へ
言語指示とロボット実演をマルチタスク学習で結びつけ、LLMのプロンプト設計に頼らずにゼロショットで制御を生成する手法を提案。
原題: DEMONSTRATE: Zero-shot Language to Robotic Control via Multi-task Demonstration Learning / Rahel Rickenbach, Bruce Lee, René Zurbrügg 他
日本語で読む → - 論文VLA画像認識
ThinkAct: 強化学習された視覚潜在計画による視覚-言語-行動推論
マルチモーダルLLMで行動整合的な視覚報酬を用いて推論計画を生成し、それを視覚潜在に圧縮して行動モデルを条件付ける二重システムフレームワークを提案。複雑な身体性AIタスクでの少数ショット適応や長期計画、自己修正を実現した。
原題: ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning / Chi-Pin Huang, Yueh-Hua Wu, Min-Hung Chen 他
日本語で読む → - 論文VLAロボティクス
VLMgineer: 視覚言語モデルをロボットの道具職人に
視覚言語モデルのコード生成と進化的探索を組み合わせ、タスクを解くための物理ツールとその操作計画を自動で共設計するフレームワークを提案し、日常的な操作タスクの新ベンチマークで有効性を示した。
原題: VLMgineer: Vision Language Models as Robotic Toolsmiths / George Jiayuan Gao, Tianyu Li, Junyao Shi 他
日本語で読む → - 論文VLAロボティクス
FOUNDER: 世界モデルに基盤モデルを接地させたオープンエンド身体性意思決定
基盤モデルの知識と世界モデルのダイナミクスを統合し、報酬なしでテキストや動画で指定された多様なタスクを身体性環境で解くフレームワークを提案。
原題: FOUNDER: Grounding Foundation Models in World Models for Open-Ended Embodied Decision Making / Yucen Wang, Rui Yu, Shenghua Wan 他
日本語で読む →