論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/11/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
iFlyBot-VLM 技術報告
視覚と言語を統合し、ロボットの知覚と動作制御をつなぐ汎用VLMを提案。10のベンチマークで最高性能を達成し、データと重みを公開予定。
原題: iFlyBot-VLM Technical Report / Xin Nie, Zhiyuan Cheng, Yuan Zhang 他
日本語で読む → - 論文VLAロボティクス
MAP-VLA:視覚言語行動モデルのための記憶拡張プロンプティングによるロボット操作
長期タスクに弱いVLAモデルに対し、過去のデモから記憶ライブラリを構築し、類似軌道を検索してソフトプロンプトとして注入することで、凍結したVLAの行動生成を軽量に拡張する手法。
原題: MAP-VLA: Memory-Augmented Prompting for Vision-Language-Action Model in Robotic Manipulation / Runhao Li, Wenkai Guo, Zhenyu Wu 他
日本語で読む → - 論文VLAロボティクス
Maestro:視覚言語モデルでロボティクスモジュールを統合するゼロショット汎用ロボット
VLMコーディングエージェントが知覚・計画・制御モジュールを動的に組み合わせてプログラム的政策を生成し、ゼロショットで汎用ロボットを実現する手法を提案。
原題: Maestro: Orchestrating Robotics Modules with Vision-Language Models for Zero-Shot Generalist Robots / Junyao Shi, Rujia Yang, Kaitian Chao 他
日本語で読む → - 論文VLAロボティクス
GraSP-VLA:VLAポリシーによる長期計画のためのグラフベース記号行動表現
連続シーングラフから記号的な計画ドメインを生成し、VLAポリシーを統括することで長期タスクを実現するニューロシンボリック手法を提案。
原題: GraSP-VLA: Graph-based Symbolic Action Representation for Long-Horizon Planning with VLA Policies / Maëlic Neau, Zoe Falomir, Paulo E. Santos 他
日本語で読む → - 論文VLAロボティクス
PerspAct: 視点取得と能動的視覚によるLLMの状況的協調スキルの向上
LLMに他者の視点を明示的に与え、能動的な視覚探索と組み合わせることで、協調タスクにおける指示理解の精度が向上することを示した研究。
原題: PerspAct: Enhancing LLM Situated Collaboration Skills through Perspective Taking and Active Vision / Sabrina Patania, Luca Annese, Anita Pellegrini 他
日本語で読む → - 論文VLAロボティクス
EveryDayVLA: 低コストロボット操作のための視覚-言語-行動モデル
300ドル以下で組み立て可能な6自由度マニピュレータと、離散・連続行動を統合出力し不確実性に応じて再計画するVLAモデルを提案し、実環境で従来手法を大きく上回る成功率を達成した。
原題: EveryDayVLA: A Vision-Language-Action Model for Affordable Robotic Manipulation / Samarth Chopra, Alex McMoil, Ben Carnovale 他
日本語で読む → - 論文VLAロボティクス
知覚と行動の統合:暗黙的視覚Chain-of-Thoughtを用いたハイブリッドモダリティパイプラインによるロボット行動生成
視覚と言語と行動を共有の離散潜在空間で統合し、暗黙的な視覚Chain-of-Thoughtで将来フレーム予測とロボット行動を同時に生成するVITAフレームワークを提案。シミュレーションと実環境で既存手法を上回る性能を示した。
原題: Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation / Xiangkai Ma, Lekai Xing, Han Zhang 他
日本語で読む → - 論文VLA機械学習
Pelican-VL 1.0:身体知能のための基盤ブレインモデル
7B〜72Bパラメータのオープンソース身体知能向けマルチモーダル基盤モデルを開発し、大規模データと新学習機構DPPOにより既存モデルを上回る性能を達成した。
原題: Pelican-VL 1.0: A Foundation Brain Model for Embodied Intelligence / Yi Zhang, Che Liu, Xiancong Ren 他
日本語で読む → - 論文VLAロボティクス
Lite VLA:CPU制約のあるエッジロボット上での効率的な視覚-言語-行動制御
小型VLMをオンボードで動かし、クラウドに頼らず移動しながらリアルタイムにシーン理解と推論を行うエッジロボット向けフレームワークを実証した。
原題: Lite VLA: Efficient Vision-Language-Action Control on CPU-Bound Edge Robots / Justin Williams, Kishor Datta Gupta, Roy George 他
日本語で読む → - 論文VLAロボティクス
発見・学習・強化:多様なRL生成軌道による視覚-言語-行動事前学習のスケーリング
強化学習で多様な行動パターンを発見し、VLAモデルの事前学習用データを自動生成するフレームワークDLRを提案。標準RLより多様で高成功率の軌道を生成し、下流タスク性能とデータスケーリングを改善する。
原題: Discover, Learn, and Reinforce: Scaling Vision-Language-Action Pretraining with Diverse RL-Generated Trajectories / Rushuai Yang, Zhiyuan Feng, Tianxiang Zhang 他
日本語で読む → - 論文VLAロボティクス
観測前のリスクを見抜く:視覚言語モデルによる自動運転の潜在的リスク推論
自動運転における「まだ観測されていない潜在的リスク」を推論するための視覚言語データセットPotentialRiskQAと、それに基づく推論フレームワークPR-Reasonerを提案した。
原題: Seeing before Observable: Potential Risk Reasoning in Autonomous Driving via Vision Language Models / Jiaxin Liu, Xiangyu Yan, Liang Peng 他
日本語で読む → - 論文VLA画像認識
実験室から実世界応用へ:モバイルロボティクス向けエッジデバイス上でのゼロショットシーン解釈の評価
モバイルロボティクス向けに、エッジデバイスで動作する小型視覚言語モデル(VLM)のゼロショットシーン解釈と行動認識能力を評価し、精度と推論時間のトレードオフや課題を議論した。
原題: From the Laboratory to Real-World Application: Evaluating Zero-Shot Scene Interpretation on Edge Devices for Mobile Robotics / Nicolas Schuler, Lea Dewald, Nick Baldig 他
日本語で読む → - 論文VLAロボティクス
Fast-SmartWay: パノラマ不要のエンドツーエンドゼロショット視覚言語ナビゲーション
正面のRGB-D画像3枚と言語指示のみからMLLMが直接行動を予測するゼロショットVLN-CEフレームワークを提案し、パノラマ観測とウェイポイント予測器を排除して遅延を大幅に削減した。
原題: Fast-SmartWay: Panoramic-Free End-to-End Zero-Shot Vision-and-Language Navigation / Xiangyu Shi, Zerui Li, Yanyuan Qiao 他
日本語で読む → - 論文VLA画像認識
Reasoning-VLA:自動運転向けの高速で汎用的な視覚-言語-行動推論モデル
学習可能な行動クエリと推論強化された視覚言語特徴を並列に用いて連続行動軌道を生成するVLAフレームワークを提案し、8つの自動運転データセットを統合して学習・強化学習微調整を行い、最先端の性能と汎化性、高速推論を実現した。
原題: Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving / Dapeng Zhang, Zhenlong Yuan, Zhangquan Chen 他
日本語で読む → - 論文VLAロボティクス
観測外乱に耐える協調合流のためのフォールトトレラントMARL
高速道路の合流シーンで、観測ノイズに強い協調運転を実現するため、敵対的故障注入と自己診断機能を備えたマルチエージェント強化学習手法を提案した。
原題: Fault-Tolerant MARL for CAVs under Observation Perturbations for Highway On-Ramp Merging / Yuchen Shi, Huaxin Pei, Yi Zhang 他
日本語で読む → - 論文VLAロボティクス
長文脈Q-FormerとマルチモーダルLLMを統合したロボット確認生成と行動計画
動画の長文脈情報を活用するQ-FormerとマルチモーダルLLMを組み合わせ、人間との対話に基づくロボットの行動確認と行動計画の精度を向上させた研究。
原題: Robot Confirmation Generation and Action Planning Using Long-context Q-Former Integrated with Multimodal LLM / Chiori Hori, Yoshiki Masuyama, Siddarth Jain 他
日本語で読む → - 論文VLAロボティクス
OpenVLN: オープンワールド空中視覚言語ナビゲーション
限られたデータでUAVの言語誘導飛行を実現するため、強化学習でVLMを微調整し、長期的軌道計画を可能にするフレームワークを提案。
原題: OpenVLN: Open-world Aerial Vision-Language Navigation / Peican Lin, Gan Sun, Chenxi Liu 他
日本語で読む → - 論文VLAロボティクス
RynnVLA-002:視覚言語行動と世界モデルの統合
視覚言語行動モデルと世界モデルを統合し、環境の物理を学習して行動生成を洗練させるフレームワークを提案。シミュレーションと実機で性能向上を実証。
原題: RynnVLA-002: A Unified Vision-Language-Action and World Model / Jun Cen, Siteng Huang, Yuqian Yuan 他
日本語で読む → - 論文VLAロボティクス
MARS: マルチモーダル大規模言語モデルによる支援知能のためのマルチエージェントロボットシステム
視覚認識・リスク評価・計画・評価の4エージェントをMLLMで統合し、障害者支援のスマートホームロボット向けにリスクを考慮した適応的な行動計画を実現するシステムを提案した。
原題: MARS: Multi-Agent Robotic System with Multimodal Large Language Models for Assistive Intelligence / Renjun Gao
日本語で読む → - 論文VLAロボティクス
光学フロー制約によるロバストな潜在行動学習
エージェントの光学フローを行動信号として活用し、妨害要素に強い潜在行動表現を学習する疑似教師ありフレームワークLAOFを提案。模倣学習と強化学習で既存手法を上回る性能を示した。
原題: LAOF: Robust Latent Action Learning with Optical Flow Constraints / Xizhou Bu, Jiexi Lyu, Fulei Sun 他
日本語で読む → - 論文VLAロボティクス
拡散ポリシーと結合した力学系の閉ループ安定性に関する理論的限界
拡散ポリシーのノイズ除去を途中で打ち切って行動を実行し、プラントの力学と並行して進める場合の閉ループ安定性の理論限界を導出した研究。
原題: Theoretical Closed-loop Stability Bounds for Dynamical System Coupled with Diffusion Policies / Gabriel Lauzier, Alexandre Girard, François Ferland
日本語で読む → - 論文VLA画像認識
SO-Bench:マルチモーダルLLMの構造化出力評価ベンチマーク
UI画面・自然画像・文書・グラフの4領域で、画像からJSONスキーマに沿った構造化出力を生成する能力を評価するベンチマークSO-Benchを構築し、既存モデルの課題を明らかにした。
原題: SO-Bench: A Structural Output Evaluation of Multimodal LLMs / Di Feng, Kaixin Ma, Feng Nan 他
日本語で読む → - 論文VLAロボティクス
見て、ズームして、理解する:身体性知覚のためのロボット眼球
言語指示に基づきPTZカメラのパン・チルト・ズームを調整して最適な視野を得るVLAモデルEyeVLAを提案し、500サンプルで実世界適応を実現した。
原題: Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception / Jiashu Yang, Yifan Han, Yucheng Xie 他
日本語で読む → - 論文VLA画像認識
PixelVLA:視覚言語行動モデルにおけるピクセルレベル理解の推進
ピクセル単位のシーン理解とテキスト・画像のマルチモーダル指示に対応したVLAモデルを提案し、大規模ピクセル注釈データセットで学習することで、低コストながら操作成功率を大幅に向上させた。
原題: PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model / Wenqi Liang, Gan Sun, Yao He 他
日本語で読む → - 論文VLAロボティクス
X-Diffusion: 異なる身体性の人間デモンストレーションから拡散ポリシーを学習
人間の動作をノイズの多いロボット動作とみなし、拡散過程の高ノイズ段階でのみ人間デモを学習に使うことで、身体性の違いを吸収しつつタスク意図を活用する手法を提案。実機5タスクで成功率を16%向上。
原題: X-Diffusion: Training Diffusion Policies on Cross-Embodiment Human Demonstrations / Maximus A. Pace, Prithwish Dan, Chuanruo Ning 他
日本語で読む → - 論文VLA画像認識
Target-Bench:動画世界モデルは意味的ターゲットへの地図なし経路計画を達成できるか?
動画世界モデルの意味的推論・空間推定・計画能力を評価する初のベンチマークTarget-Benchを提案し、既存モデルの性能不足と実ロボットデータでの微調整による改善を示した。
原題: Target-Bench: Can Video World Models Achieve Mapless Path Planning with Semantic Targets? / Dingrui Wang, Zhihao Liang, Hongyuan Ye 他
日本語で読む → - 論文VLA画像認識
OmniVLA: 物理的根拠に基づくマルチモーダルVLAと統合マルチセンサ知覚によるロボットマニピュレーション
赤外線カメラ・ミリ波レーダー・マイクアレイをRGB画像に統合する「センサマスク画像」表現を提案し、RGBのみのVLAより成功率84%で大幅に優れるマルチモーダルVLAモデルを実現した。
原題: OmniVLA: Physically-Grounded Multimodal VLA with Unified Multi-Sensor Perception for Robotic Manipulation / Heyu Guo, Shanmu Wang, Ruichun Ma 他
日本語で読む → - 論文VLAロボティクス
AsyncVLA:視覚言語行動モデルのための非同期フローマッチング
VLAモデルの行動生成に非同期フローマッチングを導入し、行動の信頼度に基づく自己修正を可能にすることで、長期的タスクでの安定性とデータ効率を向上させた。
原題: AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models / Yuhua Jiang, Shuang Cheng, Yan Ding 他
日本語で読む → - 論文VLAロボティクス
ExpReS-VLA: 経験再生と検索による視覚言語行動モデルの特化
事前学習済みVLAモデルを、圧縮した経験再生バッファと検索拡張生成で破滅的忘却を防ぎつつ展開環境に高速適応させる手法。
原題: ExpReS-VLA: Specializing Vision-Language-Action Models Through Experience Replay and Retrieval / Shahram Najam Syed, Yatharth Ahuja, Arthur Jakobsson 他
日本語で読む → - 論文VLAロボティクス
意味と物理の整合を図る連続的視覚-言語-行動の共同学習による行動クローニング
視覚・言語・固有感覚入力を連続的に共同学習し、双方向クロスアテンションで意味と物理のずれを解消することで、行動クローニングの累積誤差を抑え、滑らかで一貫した操作を実現するフレームワークを提案した。
原題: Continuous Vision-Language-Action Co-Learning with Semantic-Physical Alignment for Behavioral Cloning / Xiuxiu Qi, Yu Yang, Jiannong Cao 他
日本語で読む →