論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/12/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
HiMoE-VLA:汎用視覚言語行動ポリシーのための階層的Mixture-of-Experts
異なるロボットの実演データを混ぜて学習する際の負の転移を防ぐため、行動空間ごとに特化する階層的MoE行動モジュールを提案し、CALVINやLIBERO、実機タスクで高い性能を達成した。
原題: HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies / Zhiying Du, Bei Liu, Yaobo Liang 他
日本語で読む → - 論文VLAロボティクス
LEO-RobotAgent:言語駆動型身体操作のための汎用ロボットエージェント
LLMがUAV・ロボットアーム・車輪ロボットなど多様なロボットを操作し、複雑なタスクをこなす汎用エージェントフレームワークを提案。モジュール式ツールセットと人間との協調機構を備える。
原題: LEO-RobotAgent: A General-purpose Robotic Agent for Language-driven Embodied Operator / Lihuang Chen, Xiangyu Luo, Jun Meng
日本語で読む → - 論文VLAロボティクス
StereoVLA: ステレオ視で視覚言語行動モデルを強化
大規模合成ステレオデータから幾何学的手がかりを取り入れた初のVLAモデルを提案し、精密な空間認識と視点ロバスト性を実現した。
原題: StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision / Shengliang Deng, Mi Yan, Yixin Zheng 他
日本語で読む → - 論文VLA画像認識
GeoPredict: 予測キネマティクスと3Dガウス幾何を活用した高精度VLAマニピュレーション
ロボットアームの将来の3Dキーポイント軌道と作業空間の3Dガウス幾何を予測するモジュールをVLAモデルに追加し、訓練時のみの監督で推論時は軽量なトークン追加だけで精度を向上させた。
原題: GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation / Jingjing Qian, Boyao Han, Chen Shi 他
日本語で読む → - 論文VLA画像認識
MomaGraph: 視覚言語モデルによる状態認識統合シーングラフと身体性タスクプランニング
家庭内の移動マニピュレータ向けに、空間的・機能的関係と物体状態を統合したシーングラフ表現MomaGraphと、大規模データセット・評価ベンチマーク・強化学習で訓練した7B視覚言語モデルMomaGraph-R1を提案し、ゼロショットタスクプランニングで最先端性能を達成した。
原題: MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Model for Embodied Task Planning / Yuanchen Ju, Yongyuan Liang, Yen-Jen Wang 他
日本語で読む → - 論文VLAロボティクス
自動運転のための視覚-言語-行動モデル:過去・現在・未来
自動運転における視覚-言語-行動(VLA)フレームワークの進化を整理し、End-to-End型とDual-System型の2つのパラダイムに分類して、その特徴と課題を概観したサーベイ論文。
原題: Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future / Tianshuai Hu, Xiaolu Liu, Song Wang 他
日本語で読む → - 論文VLA画像認識
D3D-VLP: 動的3D視覚言語計画モデルによる身体性グラウンディングとナビゲーション
単一の3D視覚言語モデルとChain-of-Thoughtで計画・グラウンディング・ナビゲーション・質問応答を統合し、断片的な教師信号から相互補強的に学習する手法を提案。複数ベンチマークで最先端を達成。
原題: D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation / Zihan Wang, Seungjun Lee, Guangzhao Dai 他
日本語で読む → - 論文VLAロボティクス
全身ロボット操作のための非同期Fast-Slow視覚言語行動ポリシー
VLM推論と高速行動生成を非同期に分離し、潜在表現バッファと全身行動トークナイザで統合したVLAフレームワークを提案。3Bモデルで30Hzの全身行動生成を実現した。
原題: Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation / Teqiang Zou, Hongliang Zeng, Yuxuan Nong 他
日本語で読む → - 論文VLA機械学習
原子行動スライシング:汎用VLAエージェントのためのプランナー整合オプション
長期的なデモを短い原子行動に分解するAASを提案し、LIBEROで検証済みデータセットを作成。CLIP-RT+の微調整によりタスク成功率が向上した。
原題: Atomic Action Slicing: Planner-Aligned Options for Generalist VLA Agents / Stefan Tabakov, Asen Popov, Dimitar Dimitrov 他
日本語で読む → - 論文VLAロボティクス
アフォーダンス場介入:ロボットマニピュレーションにおけるVLAの記憶トラップからの脱出
VLAモデルが未知環境で記憶した軌道に固執する「記憶トラップ」を固有感覚で検知し、3D空間アフォーダンス場をプラグインとして用いて軌道を修正する軽量ハイブリッド手法を提案。
原題: Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation / Siyu Xu, Zijian Wang, Yunke Wang 他
日本語で読む → - 論文VLAロボティクス
橋上の基盤モデル:視覚言語モデルによる海事自律航行の意味的ハザード検出と安全機動
視覚言語モデル(VLM)を用いて、港湾シーンでの意味的な危険(ダイバーフラッグや火災など)を検出し、人間が介入可能な短時間のフォールバック機動を選択する「Semantic Lookout」を提案した研究。
原題: Foundation models on the bridge: Semantic hazard detection and safety maneuvers for maritime autonomy with vision-language models / Kim Alexander Christensen, Andreas Gudahl Tufte, Alexey Gusev 他
日本語で読む → - 論文VLAロボティクス
単眼深度推定を用いた農業向け視覚言語ナビゲーション
農業ロボットの単眼カメラ映像から深度特徴を生成し、言語指示に従ったナビゲーション精度を向上させる手法を提案した。
原題: MDE-AgriVLN: Agricultural Vision-and-Language Navigation with Monocular Depth Estimation / Xiaobei Zhao, Xingqi Lyu, Xin Chen 他
日本語で読む → - 論文VLAロボティクス
Vision-Language-Actionモデルのタスク適応:2025 BEHAVIORチャレンジ優勝ソリューション
2025 BEHAVIORチャレンジで優勝した、Pi0.5をベースに相関ノイズや混合層注意などを導入した双腕操作・ナビゲーション対応の視覚行動ポリシー。
原題: Task adaptation of Vision-Language-Action model: 1st Place Solution for the 2025 BEHAVIOR Challenge / Ilia Larchenko, Gleb Zarin, Akash Karnatak
日本語で読む → - 論文VLAロボティクス
論理を考慮したマニピュレーションに向けて:スマート製造におけるVLMベースアシスタントのための知識プリミティブ
製造現場での接触を伴う操作に必要なパラメータを8項目のタプルとして形式化し、VLMベースのアシスタントとロボット制御の間で知識信号として活用する手法を提案した。3Dプリンタのスプール取り外しタスクで検証した。
原題: Towards Logic-Aware Manipulation: A Knowledge Primitive for VLM-Based Assistants in Smart Manufacturing / Suchang Chen, Daqiang Guo
日本語で読む → - 論文VLA機械学習
同変拡散ポリシーの対称性を考慮した誘導:利点と限界
同変拡散ポリシー(EDP)を強化学習で微調整する際、対称性を考慮した誘導フレームワークを提案し、標準・同変・近似同変RL戦略を比較して、サンプル効率や安定性の利点と限界を明らかにした。
原題: Symmetry-Aware Steering of Equivariant Diffusion Policies: Benefits and Limits / Minwoo Park, Junwoo Chang, Jongeun Choi 他
日本語で読む → - 論文VLAAI
SIMA 2: 仮想世界のための汎用身体性エージェント
Gemini基盤モデルをベースに、多様な3D仮想世界で言語や画像による指示を理解し行動する汎用エージェントSIMA 2を開発。未知環境への汎化や自己改善による新スキル獲得を実現した。
原題: SIMA 2: A Generalist Embodied Agent for Virtual Worlds / SIMA team, Adrian Bolton, Alexander Lerchner 他
日本語で読む → - 論文VLAロボティクス
ロボティクスのための視覚言語モデルにおける推論を伴う空間トレースに向けて
3D空間の参照と計測を統合したVLM「RoboTracer」を提案し、強化学習による多段階の空間推論を実現。大規模データセットとベンチマークも構築し、ロボットの長期的タスク実行に応用した。
原題: Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics / Enshen Zhou, Yibo Li, Jingkun An 他
日本語で読む → - 論文VLAAI
ActionFlow: エッジ上での視覚言語モデル向けパイプライン型アクション高速化
VLAモデルの推論をマイクロリクエストのパイプラインとして再定義し、PrefillとDecodeを跨いでバッチ処理することで、再学習なしにエッジ上で2.55倍のFPS向上を実現した。
原題: ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge / Yuntao Dai, Hang Gu, Teng Wang 他
日本語で読む → - 論文VLAロボティクス
VideoVLA:動画生成モデルを汎用ロボットマニピュレータに転換
大規模動画生成モデルをロボットの視覚-言語-行動モデルに転換し、言語指示と画像から行動列と将来の視覚結果を同時予測することで、新規物体や他機体スキルへの汎化を実現した。
原題: VideoVLA: Video Generators Can Be Generalizable Robot Manipulators / Yichao Shen, Fangyun Wei, Zhiying Du 他
日本語で読む → - 論文VLAロボティクス
未来の触覚を予測して接触操作を学習するDreamTacVLA
高解像度触覚画像と視覚を統合し、将来の触覚信号を予測する触覚ワールドモデルで微調整することで、接触の多い操作タスクにおけるVLAモデルの性能を向上させた研究。
原題: Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation / Guo Ye, Zexi Zhang, Xu Zhao 他
日本語で読む → - 論文VLAロボティクス
RoboNeuron: 身体性AIにおけるエージェント駆動型オーケストレーションのための中間層インフラ
LLMエージェントとロボットミドルウェア(ROS2)を接続する中間層を提案し、VLAバックエンドの変更をシステム再構築なしで可能にした。
原題: RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI / Weifan Guan, Qinghao Hu, Huasen Xi 他
日本語で読む → - 論文VLA画像認識
MM-ACT: マルチモーダル並列生成から行動を学習する統合VLAモデル
テキスト・画像・行動を共有トークン空間で統合し、並列デコードで生成するVLAモデルを提案。LIBEROや実機Franka、RoboTwin2.0で高い成功率を達成した。
原題: MM-ACT: Learn from Multimodal Parallel Generation to Act / Haotian Liang, Xinyi Chen, Bin Wang 他
日本語で読む → - 論文VLA機械学習
Sigma: 視覚-言語-行動モデルのテレパシー的整合への鍵
オープンソースのpi0.5_baseをベースにLoRA微調整と推論アダプタを組み合わせ、意味論と連続制御の間の整合を図るVLAモデルSigmaを構築し、制御MSEを低減した。
原題: Sigma: The Key for Vision-Language-Action Models toward Telepathic Alignment / Libo Wang
日本語で読む → - 論文VLA画像認識
DarkQA: 低照度屋内環境における視覚的プリミティブ質問応答のための視覚言語モデルベンチマーク
低照度環境での視覚言語モデルの性能を評価するため、物理的に忠実な劣化を再現した9.4Kの質問応答ペアからなるベンチマークDarkQAを提案し、既存モデルの性能低下とLLIE前処理の不安定さを明らかにした。
原題: DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes / Yohan Park, Hyunwoo Ha, Wonjun Jo 他
日本語で読む → - 論文VLAロボティクス
自己回帰離散事前学習による身体性VLM推論とロボット行動の統合
身体性推論を評価するベンチマークERIQと、連続制御を離散化するFACTトークナイザを提案し、推論と行動を統合したGenieReasonerで実世界マニピュレーション性能を向上させた。
原題: Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training / Yi Liu, Sukai Wang, Dafeng Wei 他
日本語で読む → - 論文VLAロボティクス
動的ロボットタスク計画のための視覚-言語-方策モデル
実世界データで微調整した視覚言語モデルを基に、自然言語指示を解釈し、タスクシーンを推論してロボットの行動方策を生成するVLPモデルを提案。タスク変更に応じて方策を動的に更新でき、異なるロボットや新規タスクへの適応性を示した。
原題: Vision-Language-Policy Model for Dynamic Robot Task Planning / Jin Wang, Kim Tien Ly, Jacques Cloete 他
日本語で読む → - 論文VLAロボティクス
ImplicitRDP: 構造的スローファスト学習による視覚-力覚拡散ポリシー
視覚と力覚を単一ネットワークで統合し、非同期トークンを因果注意で処理する拡散ポリシーを提案。接触の多い操作タスクで高い反応性と成功率を実現した。
原題: ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning / Wendi Chen, Han Xue, Yi Wang 他
日本語で読む → - 論文VLAロボティクス
EVE: 生成的ポリシーのための生成器-検証器システム
拡散・フローマッチングなどの生成的視覚運動ポリシーを、追加学習なしでテスト時にVLMベースの検証器群と組み合わせて性能を向上させるフレームワークEVEを提案。
原題: EVE: A Generator-Verifier System for Generative Policies / Yusuf Ali, Gryphon Patlin, Karthik Kothuri 他
日本語で読む → - 論文VLAロボティクス
大規模言語モデルによるニューロシンボリック制御:言語指示に基づく空間タスク
LLMに記号的なタスク解釈を任せ、連続空間の動作は軽量ニューラルコントローラが担うモジュール型ニューロシンボリック枠組みを提案し、言語指示付き平面マニピュレーションで成功率と効率を大幅に改善した。
原題: Neuro-Symbolic Control with Large Language Models for Language-Guided Spatial Tasks / Momina Liaqat Ali, Muhammad Abid, Muhammad Saqlain 他
日本語で読む → - 論文VLAロボティクス
物体中心・幾何グラウンディングによる clutter に頑健な VLA モデル
VLA の知覚と行動を分離し、タスク関連物体の領域選択と3D構造の強調を行う知覚モジュールを導入することで、 clutter や背景変化に強い操作を実現した。
原題: Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding / Khoa Vo, Taisei Hanyu, Yuki Ikebe 他
日本語で読む →