論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/8/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAcs.SE
視覚言語モデルによる産業用自律移動ロボットのテスト
産業用AMRの安全要件を違反する多様な人間行動をVLMで生成し、シミュレータ上でロボットの不確実な挙動を明らかにするテスト手法RVSGを提案した。
原題: Vision Language Model-based Testing of Industrial Autonomous Mobile Robots / Jiahui Wu, Chengjie Lu, Aitor Arrieta 他
日本語で読む → - 論文VLA自然言語
ROVER: 視覚言語モデルによる身体性タスクのための動画再帰推論
長い動画を短いサブタスクに再帰的に分割し、視覚言語モデルが局所的なフレーム列を正確に推論できるようにするフレームワークROVERを提案。ロボット操作動画でのタスク進捗推定や動画QAで性能を向上させた。
原題: ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks / Philip Schroeder, Ondrej Biza, Thomas Weng 他
日本語で読む → - 論文VLAロボティクス
ロボットマニピュレーションのための大規模VLMベース視覚-言語-行動モデル:サーベイ
大規模視覚言語モデルを基盤とした視覚-言語-行動(VLA)モデルによるロボットマニピュレーション研究を、アーキテクチャの分類や関連分野との統合、今後の方向性を含めて初めて体系的にレビューしたサーベイ論文。
原題: Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey / Rui Shao, Wei Li, Lingsen Zhang 他
日本語で読む → - 論文VLAロボティクス
Long-VLA:ロボットマニピュレーションのための長期的タスクに挑む視覚言語行動モデル
長期的なロボット操作タスクに特化した初のエンドツーエンドVLAモデルを提案し、フェーズ認識入力マスキングでサブタスクの連携を改善、新ベンチマークL-CALVINで評価した。
原題: Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation / Yiguo Fan, Pengxiang Ding, Shuanghao Bai 他
日本語で読む → - 論文VLAロボティクス
LLMによる自然言語からロボット言語への正確性保証付き翻訳フレームワーク
LLMが生成するロボット制御プログラムの正確性を検証・保証するため、ロボットスキル言語(RSL)とコンパイラ/デバッガを提案し、フィードバックによる微調整で性能を向上させた。
原題: An LLM-powered Natural-to-Robotic Language Translation Framework with Correctness Guarantees / ZhenDong Chen, ZhanShang Nie, ShiXing Wan 他
日本語で読む → - 論文VLAロボティクス
ExploreVLM:視覚言語モデルによる閉ループロボット探索タスクプランニング
視覚言語モデルを活用し、自己反省型の二段階プランナーと物体中心の空間関係グラフ、実行検証による閉ループ機構で、ロボットの対話的探索とリアルタイム再計画を実現したフレームワーク。
原題: ExploreVLM: Closed-Loop Robot Exploration Task Planning with Vision-Language Models / Zhichen Lou, Kechun Xu, Zhongxiang Zhou 他
日本語で読む → - 論文VLAロボティクス
近接場通信と融合する身体性エッジ知能:概念・設計・検証
大規模モデルをロボット近傍のエッジで動かす身体性エッジ知能と、超大規模アンテナアレイを用いる近接場通信を統合し、両者を協調最適化する枠組みを提案・検証した論文。
原題: Embodied Edge Intelligence Meets Near Field Communication: Concept, Design, and Verification / Guoliang Li, Xibin Jin, Yujie Wan 他
日本語で読む → - 論文VLAAI
エッジ上のマルチモーダルセンサ融合と視覚言語モデルによる自動運転のリアルタイム事故回避
軽量VLMを微調整し、インフラからの危険警告と車載センサデータを統合して安全な軌道を生成するエッジ向けフレームワークREACTを提案。DeepAccidentで衝突率77%削減、推論遅延0.57秒を達成。
原題: Edge-Based Multimodal Sensor Data Fusion with Vision Language Models (VLMs) for Real-time Autonomous Vehicle Accident Avoidance / Fengze Yang, Bo Yu, Yang Zhou 他
日本語で読む → - 論文VLAロボティクス
Triple-S: ロボティクスにおける長期的含意タスクを解く協調型マルチLLMフレームワーク
複数のLLMが簡略化・解決・要約の役割を分担する閉ループで協調し、ロボット制御の長期的含意タスクの成功率と頑健性を高めるフレームワークを提案。
原題: Triple-S: A Collaborative Multi-LLM Framework for Solving Long-Horizon Implicative Tasks in Robotics / Zixi Jia, Hongbin Gao, Fashe Li 他
日本語で読む → - 論文VLA画像認識
AR-VRM: 類推推論による視覚ロボット操作のための人間動作模倣
人間の動作動画から手のキーポイントを予測するVLMを事前学習し、ロボット微調整時に人間とロボットの対応関係を類推推論で学習することで、視覚ロボット操作の性能を向上させた研究。
原題: AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning / Dejie Yang, Zijing Zhao, Yang Liu
日本語で読む → - 論文VLAロボティクス
AimBot: 視覚運動ポリシーの空間認識を高める簡易補助視覚キュー
多視点RGB画像に照準線とスコープを重ねてエンドエフェクタの状態を明示し、視覚運動ポリシーの性能を向上させる軽量な視覚拡張手法を提案。
原題: AimBot: A Simple Auxiliary Visual Cue to Enhance Spatial Awareness of Visuomotor Policies / Yinpei Dai, Jayjun Lee, Yichi Zhang 他
日本語で読む → - 論文VLAロボティクス
拡散ポリシーのためのリアルタイム反復スキーム
最適制御のリアルタイム反復法を応用し、前時刻の解を初期値に使うことで拡散ポリシーの推論を高速化する手法を提案。蒸留や再設計なしで大規模モデルにも適用可能。
原題: Real-Time Iteration Scheme for Diffusion Policy / Yufei Duan, Hang Yin, Danica Kragic
日本語で読む → - 論文VLAロボティクス
OpenMap: オープン語彙視覚言語マッピングによる指示のグラウンディング
自由形式の言語指示を3Dシーン内の特定物体に結びつけるゼロショットの視覚言語マップを提案し、ナビゲーションタスクでの指示グラウンディング精度を向上させた。
原題: OpenMap: Instruction Grounding via Open-Vocabulary Visual-Language Mapping / Danyang Li, Zenghui Yang, Guangpeng Qi 他
日本語で読む → - 論文VLA画像認識
RynnEC:MLLMを身体性認知の世界へ
汎用視覚言語モデルに領域エンコーダとマスクデコーダを組み込み、領域中心の動画理解で物体属性・セグメンテーション・空間推論を高精度化した身体性認知向けMLLMを提案。
原題: RynnEC: Bringing MLLMs into Embodied World / Ronghao Dang, Yuqian Yuan, Yunxuan Mao 他
日本語で読む → - 論文VLAロボティクス
身体性マニピュレーションのための視覚-言語-行動モデルに関するサーベイ
身体性知能におけるロボット操作のための視覚-言語-行動(VLA)モデルについて、アーキテクチャの変遷やデータセット、学習手法、評価方法を5つの観点から整理し、課題と今後の方向性をまとめたサーベイ論文。
原題: Survey of Vision-Language-Action Models for Embodied Manipulation / Haoran Li, Yuhui Chen, Wenbo Cui 他
日本語で読む → - 論文VLA画像認識
TTF-VLA: 視覚言語行動モデルのためのピクセル注意統合による時間トークン融合
VLAモデルが各時刻で独立に視覚入力を処理し時間情報を捨てている問題に対し、履歴と現在の視覚表現を選択的に融合する学習不要の手法を提案し、操作タスクの成功率を向上させた。
原題: TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models / Chenghao Liu, Jiachen Zhang, Chengxuan Li 他
日本語で読む → - 論文VLAロボティクス
コネクテッド自動運転車における深層マルチタスク学習のサーベイ
コネクテッド自動運転車(CAV)における深層マルチタスク学習(MTL)の初の包括的サーベイであり、知覚・予測・計画・制御・V2X通信・無線リソース管理の各領域におけるMTL手法を整理し、課題と展望を論じる。
原題: A Survey on Deep Multi-Task Learning in Connected Autonomous Vehicles / Jiayuan Wang, Farhad Pourpanah, Q. M. Jonathan Wu 他
日本語で読む → - 論文VLAロボティクス
GhostShell: 具現化システムにおける並行行動プログラミングのためのストリーミングLLM関数呼び出し
LLMの生成ストリームから関数呼び出しを逐次解析し、マルチチャネルスケジューリングで複数ロボットコンポーネントの並行・並列動作を実現する手法を提案。実機33タスクで有効性を検証した。
原題: GhostShell: Streaming LLM Function Calls for Concurrent Embodied Programming / Jian Gong, Youwei Huang, Bo Yuan 他
日本語で読む → - 論文VLAロボティクス
RoboInspector:LLMロボット操作におけるポリシーコードの信頼性欠如を暴く
LLMによるロボット操作のポリシーコード生成が、タスクの複雑さや指示の粒度によって不安定になる問題を体系的に分析し、失敗原因を4つに分類。失敗コードのフィードバックによる改善手法で信頼性を最大35%向上させた。
原題: RoboInspector: Unveiling the Unreliability of Policy Code for LLM-enabled Robotic Manipulation / Chenduo Ying, Linkang Du, Peng Cheng 他
日本語で読む → - 論文VLAロボティクス
潜在ポリシーバリア:分布内に留まることで堅牢な視覚運動ポリシーを学習する
専門家デモの潜在表現を障壁として扱い、拡散ポリシーとダイナミクスモデルを組み合わせて、追加の人間修正なしに視覚運動ポリシーの堅牢性とデータ効率を向上させるフレームワークを提案。
原題: Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution / Zhanyi Sun, Shuran Song
日本語で読む → - 論文VLAAI
オープンエンド対話からの目標推論による柔軟なエージェントアラインメント
対話を通じてユーザーの目標を動的に推論し、LLMエージェントを柔軟にアラインメントする手法GOODを提案。買い物・家庭ロボティクス・コーディングの3領域で有効性を示した。
原題: Flexible Agent Alignment with Goal Inference from Open-Ended Dialog / Rachel Ma, Jingyi Qu, Andreea Bobu 他
日本語で読む → - 論文VLA機械学習
Spec-VLA:緩和された受理基準による視覚-言語-行動モデルの投機的デコーディング
視覚-言語-行動モデルの推論を高速化するため、行動トークン間の相対距離を利用して受理基準を緩和した投機的デコーディングフレームワークを提案し、成功率を維持しつつ1.42倍の高速化を実現した。
原題: Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance / Songsheng Wang, Rucheng Yu, Zhihang Yuan 他
日本語で読む → - 論文VLAロボティクス
TriVLA: エピソード的世界モデリングを備えた三システム統合型視覚-言語-行動モデルによる汎用ロボット制御
エピソード記憶の概念を取り入れ、VLMによるマルチモーダル理解と動画拡散モデルによる時系列予測、フローマッチングによる行動生成を統合した三システム構成のVLAモデルを提案し、実世界のマニピュレーションタスクで高い性能を示した。
原題: TriVLA: A Triple-System-Based Unified Vision-Language-Action Model with Episodic World Modeling for General Robot Control / Zhenyang Liu, Yongchong Gu, Sixiao Zheng 他
日本語で読む → - 論文VLAロボティクス
VLA-Touch:二段階の触覚フィードバックで視覚-言語-行動モデルを強化
ベースのVLAモデルを微調整せずに、触覚言語モデルによる高レベル計画と拡散ベース制御器による行動修正の二段階で触覚フィードバックを統合し、接触を伴うタスクの計画効率と実行精度を向上させた。
原題: VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback / Jianxin Bi, Kevin Yuchen Ma, Ce Hao 他
日本語で読む → - 論文VLAロボティクス
InstructVLA: 理解から操作へと導く視覚-言語-行動インストラクションチューニング
大規模視覚言語モデルの推論能力を保ちつつ、身体性推論を活用して操作性能を高める新しいVLAモデルと学習法を提案し、汎化ベンチマークで大幅な改善を示した。
原題: InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation / Shuai Yang, Hao Li, Bin Wang 他
日本語で読む → - 論文VLAロボティクス
villa-X:Vision-Language-Actionモデルにおける潜在行動モデリングの強化
VLA事前学習に潜在行動(2フレーム間の動きの抽象表現)を組み込み、その学習方法と統合方法を改善したViLLAフレームワークvilla-Xを提案。未見の身体でもゼロショットで潜在行動計画を生成でき、シミュレーションと実機のグリッパー・多指ハンド操作で高性能を示した。
原題: villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models / Xiaoyu Chen, Hangxing Wei, Pushi Zhang 他
日本語で読む → - 論文自動運転/VLAロボティクス
LaViPlan:言語誘導視覚経路計画と検証可能報酬強化学習
自動運転のOODシナリオに対応するため、検証可能報酬強化学習(RLVR)で視覚言語モデルを微調整し、言語推論と行動レベルの軌道計画を整合させるフレームワークを提案。
原題: LaViPlan : Language-Guided Visual Path Planning with RLVR / Hayeon Oh
日本語で読む → - 論文VLA画像認識
MindJourney:世界モデルによるテスト時スケーリングで空間推論を実現
VLMに動画拡散ベースの世界モデルを組み合わせ、テスト時に視点移動を探索させることで3D空間推論を強化するフレームワークを提案。
原題: MindJourney: Test-Time Scaling with World Models for Spatial Reasoning / Yuncong Yang, Jiageng Liu, Zheyuan Zhang 他
日本語で読む → - 論文VLAロボティクス
分散型AIエージェントによる水中ロボットの認知的自律性
ROS 2上で分散型大規模言語モデルAIエージェントを統合し、水中ロボットに適応的な認知自律性を実現するアーキテクチャUROSAを提案・検証した論文。
原題: Distributed AI Agents for Cognitive Underwater Robot Autonomy / Markus Buchholz, Ignacio Carlucho, Michele Grimaldi 他
日本語で読む → - 論文VLAロボティクス
cVLA: 効率的なカメラ空間VLAに向けて
視覚言語モデルを活用し、画像座標でエンドエフェクタの軌道ウェイポイントを直接予測する軽量なVLAを提案。シミュレーションで訓練し実機への転移性能を示した。
原題: cVLA: Towards Efficient Camera-Space VLAs / Max Argus, Jelena Bratulic, Houman Masnavi 他
日本語で読む →