論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
LERa: 視覚フィードバックによる再計画で指示に従う
視覚言語モデルを用いて、生のRGB画像と指示・初期計画・失敗検知だけからシーンを記述し誤りを特定して計画を修正する再計画手法を提案し、動的環境や失敗を伴うタスクで成功率を大幅に改善した。
原題: LERa: Replanning with Visual Feedback in Instruction Following / Svyatoslav Pchelintsev, Maxim Patratskiy, Anatoly Onishchenko 他
日本語で読む → - 論文VLA機械学習
マルチモーダル行動モデル評価・適応のためのオープンソースツールキットとベンチマークスイート
視覚・言語・行動を統合したマルチモーダル行動モデルを評価・適応するためのオープンソースベンチマーク「MultiNet」と関連ツールキットを提案し、1.3兆トークン超の複合データセットを提供する。
原題: An Open-Source Software Toolkit & Benchmark Suite for the Evaluation and Adaptation of Multimodal Action Models / Pranav Guruprasad, Yangyue Wang, Sudipta Chowdhury 他
日本語で読む → - 論文VLAロボティクス
MinD: リアルタイム計画と暗黙的リスク分析のためのデュアルシステム世界モデルの学習
低頻度の映像生成と高頻度の拡散ポリシーを非同期に組み合わせ、単一ステップの潜在特徴でリアルタイムに行動計画とリスク予測を行う世界モデルを提案。
原題: MinD: Learning A Dual-System World Model for Real-Time Planning and Implicit Risk Analysis / Xiaowei Chi, Kuangzhi Ge, Jiaming Liu 他
日本語で読む → - 論文自動運転/VLA画像認識
ReCogDrive:強化学習型認知フレームワークによるエンドツーエンド自動運転
VLMの運転知識を拡散プランナに注入し、DiffGRPOで安全性を強化する自動運転フレームワークを提案。NAVSIMとBench2Driveで最先端性能を達成。
原題: ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving / Yongkang Li, Kaixin Xiong, Xiangyu Guo 他
日本語で読む → - 論文VLAロボティクス
EASE: 自己教師ありエネルギー最小化による身体性を伴う能動的イベント知覚
予測誤差とエントロピーを内在的シグナルとして自由エネルギー最小化を行い、時空間表現学習と身体制御を統合した自己教師ありフレームワークEASEを提案。注釈や外部報酬なしでイベントのセグメンテーション・要約・追跡を実現する。
原題: EASE: Embodied Active Event Perception via Self-Supervised Energy Minimization / Zhou Chen, Sanjoy Kundu, Harsimran S. Baweja 他
日本語で読む → - 論文VLAロボティクス
量子化LLMをロボティクスに統合するエッジAIフレームワークllama_ros
量子化された大規模言語モデルをROS 2ロボットに組み込み、限られた計算資源でも自然言語処理を活用できるようにするツールllama_rosを提案した。
原題: Integrating Quantized LLMs into Robotics Systems as Edge AI to Leverage their Natural Language Processing Capabilities / Miguel Á. González-Santamarta, Francisco J. Rodríguez-Lera, David Sobrín-Hidalgo 他
日本語で読む → - 論文自動運転/VLAロボティクス
VLM統合型実世界自動運転のための階層的テストプラットフォーム
VLMを組み込んだ自動運転システムを実世界の閉鎖コースで評価するため、低遅延ミドルウェアと知覚・計画・制御を分離した階層的テストプラットフォームを提案し、ケーススタディで有効性を示した。
原題: A Hierarchical Test Platform for Vision Language Model (VLM)-Integrated Real-World Autonomous Driving / Yupeng Zhou, Can Cui, Juntong Peng 他
日本語で読む → - 論文VLAロボティクス
AMPLIFY: ロボット学習のためのアクションなし動き事前分布
アクションラベルなしの大規模動画からキーポイント軌跡を離散モーショントークンに符号化し、順動力学と逆動力学を分離して学習することで、ロボット方策の汎化性能を向上させるフレームワーク。
原題: AMPLIFY: Actionless Motion Priors for Robot Learning from Videos / Jeremy A. Collins, Loránd Cheng, Kunal Aneja 他
日本語で読む → - 論文VLAロボティクス
ProVox: 状況に応じた人とロボットの協調のためのパーソナライズと先回り計画
大規模言語モデルを活用し、ユーザーの好みや意図を事前に取り込んで、指示を待たずに先回りして行動を計画する協働ロボットの枠組みを提案した。家庭内の調理補助タスクでのユーザー研究により評価した。
原題: ProVox: Personalization and Proactive Planning for Situated Human-Robot Collaboration / Jennifer Grannen, Siddharth Karamcheti, Blake Wulfe 他
日本語で読む → - 論文VLAロボティクス
オープンボキャブラリ目標理解を備えたUAV向け接地視覚言語ナビゲーション
LLMとVLMを組み合わせ、機体の単眼カメラ映像のみから言語指示に従って連続速度指令を生成するUAVナビゲーションフレームワークVLFlyを提案し、未学習環境でも高い汎化性能を示した。
原題: Grounded Vision-Language Navigation for UAVs with Open-Vocabulary Goal Understanding / Yuhang Zhang, Haosheng Yu, Jiaping Xiao 他
日本語で読む → - 論文VLA画像認識
CDP: 因果拡散による堅牢な自己回帰視覚運動ポリシー学習
過去の行動系列を条件に加えることで、劣化した観測下でも高精度な操作を可能にするTransformerベースの拡散ポリシーを提案。
原題: CDP: Towards Robust Autoregressive Visuomotor Policy Learning via Causal Diffusion / Jiahua Ma, Yiran Qin, Yixiong Li 他
日本語で読む → - 論文VLAロボティクス
TGRPO:軌道単位のグループ相対方策最適化によるVision-Language-Actionモデルのファインチューニング
大規模言語モデルで密な報酬関数を自動生成し、軌道をグループ単位で比較・正規化するオンライン強化学習でVLAモデルをファインチューニングする手法を提案。LIBEROベンチマークで平均成功率80.7%を達成した。
原題: TGRPO :Fine-tuning Vision-Language-Action Model via Trajectory-wise Group Relative Policy Optimization / Zengjue Chen, Runliang Niu, He Kong 他
日本語で読む → - 論文VLA画像認識
統一視覚言語行動モデル
視覚・言語・行動を離散トークン列として自己回帰的にモデル化し、大規模動画から因果ダイナミクスを学習する統合VLAモデルUniVLAを提案。
原題: Unified Vision-Language-Action Model / Yuqi Wang, Xinghang Li, Wenxuan Wang 他
日本語で読む → - 論文VLAロボティクス
自律運転のためのコミュニケーション型世界モデルの自己中心学習
各エージェントが低次元の潜在表現で世界モデルを学習し、軽量な通信で情報共有しながら自己中心学習を行うMARL手法CALLを提案し、CARLAでの軌道計画タスクで性能向上を示した。
原題: Ego-centric Learning of Communicative World Models for Autonomous Driving / Hang Wang, Dechen Gao, Junshan Zhang
日本語で読む → - 論文ベンチマーク/VLAロボティクス
PhyBlock: 3Dブロック組み立てによる物理理解と計画の段階的ベンチマーク
視覚言語モデルの物理理解と計画能力を評価するため、4段階の認知階層を持つ3Dブロック組み立てタスクとVQAを組み合わせたベンチマークを提案し、21モデルを評価した。
原題: PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly / Liang Ma, Jiajun Wen, Min Lin 他
日本語で読む → - 論文VLA画像認識
視覚的身体脳:マルチモーダル大規模言語モデルに空間での知覚・思考・制御を
マルチモーダルLLMをロボット制御に統合するVeBrainを提案し、テキストベースの制御信号を実機の動作ポリシーに変換するアダプタと大規模指示データセットで脚ロボットやアームの適応的な操作を実現した。
原題: Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces / Gen Luo, Ganlin Yang, Ziyang Gong 他
日本語で読む → - 論文VLAロボティクス
One For All: LLMによる精密農業における異種ロボットミッションプランニング
大規模言語モデルとプリミティブを活用し、非専門家が自然言語で異種ロボットを制御できる精密農業向けミッションプランナーを提案。車輪ロボットに加えマニピュレーションや視覚タスクにも拡張し、多様なロボットで複雑な農業ミッションを実行可能なことを示した。
原題: One For All: LLM-based Heterogeneous Mission Planning in Precision Agriculture / Marcos Abel Zuzuárregui, Mustafa Melih Toslak, Stefano Carpin
日本語で読む → - 論文VLAロボティクス
物体中心3Dモーションフィールドによる人間動画からのロボット学習
人間の動画から物体中心の3Dモーションフィールドを抽出し、ロボットのゼロショット制御を可能にするフレームワークを提案。ノイズの多い深度から頑健に動きを推定し、多様なタスクで高い成功率を達成。
原題: Object-centric 3D Motion Field for Robot Learning from Human Videos / Zhao-Heng Yin, Sherry Yang, Pieter Abbeel
日本語で読む → - 論文VLAAI
V-JEPA 2: 自己教師あり動画モデルによる理解・予測・計画
大規模動画データで自己教師あり事前学習したV-JEPA 2を提案し、ロボット軌道で微調整した世界モデルにより、未知環境でのゼロショット物体操作を実現した。
原題: V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning / Mido Assran, Adrien Bardes, David Fan 他
日本語で読む → - 論文VLA自然言語
ASMR: 大規模生成モデルによるロボット行動選択のためのデータ拡張フレームワーク
大規模言語モデルと拡散モデルで対話と環境画像を生成し、ロボット支援のマルチモーダル行動選択モデルをデータ拡張する手法を提案。実世界データで最高性能を達成。
原題: ASMR: Augmenting Life Scenario using Large Generative Models for Robotic Action Reflection / Shang-Chi Tsai, Seiya Kawano, Angel Garcia Contreras 他
日本語で読む → - 論文VLAロボティクス
Fast-in-Slow:高速操作と低速推論を統合するデュアルシステム基盤モデル
VLMベースの推論システムに実行モジュールを部分的にパラメータ共有して組み込み、高速かつ精密なロボット操作を実現する統合型VLAモデルを提案。
原題: Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning / Hao Chen, Jiaming Liu, Chenyang Gu 他
日本語で読む → - 論文VLAロボティクス
ロボットナビゲーションと操作のためのマルチモーダル空間言語マップ
視覚・言語・音声の特徴を3D環境再構成に融合した空間マップを構築し、LLMと組み合わせて自然言語指示やマルチモーダルな目標を地図上に定位してロボットのナビゲーションと操作を可能にする手法を提案。
原題: Multimodal Spatial Language Maps for Robot Navigation and Manipulation / Chenguang Huang, Oier Mees, Andy Zeng 他
日本語で読む → - 論文VLA画像認識
VLA-OS:視覚言語行動モデルにおける計画表現とパラダイムの構造化と分析
VLAモデルの計画パラダイムと表現を統一的に比較するVLA-OSを提案し、視覚接地表現が言語表現より優れ、階層型VLAが性能・汎化・拡張性で優位だが速度が遅いことを示した。
原題: VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models / Chongkai Gao, Zixuan Liu, Zhenghao Chi 他
日本語で読む → - 論文VLAロボティクス
CapsDT: カプセルロボット操作のための拡散トランスフォーマー
胃内で動作するカプセル内視鏡ロボットを、視覚と言語指示から拡散トランスフォーマーで制御する手法を提案し、シミュレータで評価した。
原題: CapsDT: Diffusion-Transformer for Capsule Robot Manipulation / Xiting He, Mingwu Su, Xinqi Jiang 他
日本語で読む → - 論文VLAcs.NI
大規模言語モデルを活用した飛行ネットワークにおける自律UAV制御フレームワーク
オープンソースLLMとUAV自動操縦を統合し、自然言語指示からミッションコードを生成して自律制御を可能にするFLUCを提案・評価した。
原題: A Framework Leveraging Large Language Models for Autonomous UAV Control in Flying Networks / Diana Nunes, Ricardo Amorim, Pedro Ribeiro 他
日本語で読む → - 論文VLAロボティクス
HRIBench:人とロボットのインタラクションにおけるリアルタイム人間知覚のための視覚言語モデルベンチマーク
HRI向けの視覚言語モデルを評価するため、非言語的手がかりや指示理解など5領域・計1000問のVQAベンチマークを構築し、11モデルの性能と遅延を評価した。
原題: HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction / Zhonghao Shi, Enyu Zhao, Nathaniel Dennler 他
日本語で読む → - 論文VLAロボティクス
CronusVLA: マルチフレーム視覚-言語-行動モデリングによる効率的で堅牢なマニピュレーション
単一フレームのVLAモデルをマルチフレームに拡張し、特徴チャンキングで履歴情報を集約することで、計算負荷を抑えつつ操作性能と観測の堅牢性を向上させた。
原題: CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling / Hao Li, Shuai Yang, Yilun Chen 他
日本語で読む → - 論文VLAロボティクス
RLRC: 強化学習による圧縮VLAモデルの性能回復
VLAモデルを構造的プルーニング・強化学習による性能回復・量子化の3段階で圧縮し、メモリを最大8分の1、推論を2.3倍高速化しつつ成功率を維持した。
原題: RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models / Yuxuan Chen, Yixin Han, Yize Huang 他
日本語で読む → - 論文VLA機械学習
AmbiK: キッチン環境における曖昧なタスクのデータセット
キッチンでロボットに与えられる曖昧な指示とその明確化版を1000組集め、曖昧性検出手法を統一的に比較できるベンチマークを構築した。
原題: AmbiK: Dataset of Ambiguous Tasks in Kitchen Environment / Anastasiia Ivanova, Eva Bakaeva, Zoya Volovikova 他
日本語で読む → - 論文VLAロボティクス
WoMAP: 実世界モデルによる身体性を伴うオープン語彙物体位置推定
ガウススプラッティングによる実→シミュ→実パイプラインと潜在世界モデルを組み合わせ、実演データなしでオープン語彙物体位置推定ポリシーを学習する手法を提案。
原題: WoMAP: World Models For Embodied Open-Vocabulary Object Localization / Tenny Yin, Zhiting Mei, Tao Sun 他
日本語で読む →