論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
AgentRob:仮想フォーラムエージェントから物理ロボットのハイジャックまで
オンラインフォーラムとLLMエージェント、物理ロボットをMCPで繋ぎ、フォーラム上の指示でロボットを操作・結果報告する枠組みを提案。
原題: AgentRob: From Virtual Forum Agents to Hijacked Physical Robots / Wenrui Liu, Yaxuan Wang, Xun Zhang 他
日本語で読む → - 論文VLAロボティクス
HMVLA: 双曲空間マルチモーダル融合による視覚-言語-行動モデル
視覚・言語・行動モデルにおいて、画像と言語の階層構造を双曲空間に埋め込んで意味的整合を図り、MoE機構で効率化するフレームワークを提案した。
原題: HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models / Kun Wang, Xiao Feng, Mingcheng Qu 他
日本語で読む → - 論文自動運転VLA画像認識
SToRM: マルチモーダルLLMのための教師ありトークン削減による効率的なエンドツーエンド自動運転
自動運転向けマルチモーダルLLMの視覚トークンを教師あり学習で削減し、全トークン使用時と同等の性能を保ちつつ計算効率を高めるフレームワークを提案。
原題: SToRM: Supervised Token Reduction for Multi-modal LLMs toward efficient end-to-end autonomous driving / Seo Hyun Kim, Jin Bok Park, Do Yeon Koo 他
日本語で読む → - 論文VLAロボティクス
TOPReward: トークン確率を隠れたゼロショット報酬として用いるロボティクス
事前学習済み動画言語モデルのトークン確率を利用し、タスク指示に対する進捗を密な報酬として推定する訓練不要の手法を提案。実世界の操作ベンチマークで従来の訓練不要手法を上回る性能を示した。
原題: TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics / Shirui Chen, Cole Harrison, Ying-Chun Lee 他
日本語で読む → - 論文VLAロボティクス
Vision-language-actionモデルの実用性を再考する:包括的ベンチマークと改良ベースライン
VLAモデルの実用性を評価する新ベンチマークCEBenchを提案し、その知見に基づき軽量で実用的なLLaVA-VLAを開発した。
原題: Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline / Wenxuan Song, Jiayi Chen, Xiaoquan Sun 他
日本語で読む → - 論文VLAロボティクス
グローバル事前分布と局所一貫性を活用したデュアルメモリ拡張VLAモデルによる効率的なロボットマニピュレーション
タスクレベルの事前分布メモリと実行履歴の一貫性メモリを組み合わせ、拡散ベースのVLAモデルの推論効率と時間的一貫性を改善した手法OptimusVLAを提案。複数のシミュレーションベンチマークで成功率を大幅に向上させた。
原題: Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation / Zaijing Li, Bing Hu, Rui Shao 他
日本語で読む → - 論文VLAロボティクス
FRAPPE: 複数未来表現アラインメントによる汎用ロボット方策への世界モデリングの注入
未来の観測の潜在表現を予測し、複数の視覚基盤モデルと並列にアラインメントすることで、汎用ロボット方策に世界認識を効率的に組み込む手法を提案。
原題: FRAPPE: Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment / Han Zhao, Jingbo Wang, Wenxuan Song 他
日本語で読む → - 論文VLAロボティクス
自動運転における構造化Chain-of-Thoughtの高速化
自動運転のVLAモデル向けに、Chain-of-Thought推論を依存グラフに分解し並列デコードすることで、精度を保ちつつ3〜4倍高速化する手法を提案。
原題: Accelerating Structured Chain-of-Thought in Autonomous Vehicles / Yi Gu, Yan Wang, Yuxiao Chen 他
日本語で読む → - 論文VLAロボティクス
潜在推論VLA:視覚-言語-行動モデルのための潜在思考と予測
Chain-of-Thought推論を連続潜在表現に内部化し、推論時の明示的生成を不要にすることで、最大90%の遅延削減を実現したVLAフレームワーク。
原題: Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models / Shuanghao Bai, Jing Lyu, Wanqi Zhou 他
日本語で読む → - 論文VLAロボティクス
空中水中ハイブリッド車両のためのクロスドメイン持続モニタリング
空中と水中の両方で活動できるハイブリッド車両に対し、深層強化学習と転移学習を組み合わせ、LiDARとソナー入力を用いた共通ポリシーで持続的モニタリングを実現する手法を提案した。
原題: Cross domain Persistent Monitoring for Hybrid Aerial Underwater Vehicles / Ricardo B. Grando, Victor A. Kich, Alisson H. Kolling 他
日本語で読む → - 論文自動運転/VLAロボティクス
SteerVLA:長尾運転シーンで視覚言語行動モデルを操舵する
VLMの常識推論で細かい言語指示を生成し、VLA運転ポリシーを操舵する手法を提案。閉ループベンチマークで長尾シーンの性能を大幅に改善した。
原題: SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios / Tian Gao, Celine Tan, Catherine Glossop 他
日本語で読む → - 論文VLAロボティクス
自己修正VLA:スパースな世界想像によるオンライン行動洗練
VLAモデルに将来予測ヘッドを追加し、予測したスパースな未来状態に基づいて報酬を再形成することで、オンラインで行動を自己修正する手法を提案。シミュレーションと実機で成功率と効率が向上。
原題: Self-Correcting VLA: Online Action Refinement via Sparse World Imagination / Chenyv Liu, Wentao Tan, Lei Zhu 他
日本語で読む → - 論文VLAロボティクス
Green-VLA: 汎用ロボットのための段階的視覚-言語-行動モデル
5段階のカリキュラムで学習する視覚-言語-行動モデルを提案し、ヒューマノイドや移動マニピュレータなど多様な機体を単一ポリシーで制御、実機で汎化性能と長期的タスク効率を向上させた。
原題: Green-VLA: Staged Vision-Language-Action Model for Generalist Robots / I. Apanasevich, M. Artemyev, R. Babakyan 他
日本語で読む → - 論文VLAロボティクス
VLAは限界を知っている:ロボットポリシーのための適応的実行ホライズン
フローベースVLAモデルの実行ホライズンを自己注意重みから動的に推定するAutoHorizonを提案し、シミュレーションと実機で性能向上を実証した。
原題: VLA Knows Its Limits: Adaptive Execution Horizons for Robot Policies / Haoxuan Wang, Gengyu Zhang, Yan Yan 他
日本語で読む → - 論文VLAロボティクス
MobileManiBench:モバイルマニピュレーションのためのモデル検証を簡素化するベンチマーク
NVIDIA Isaac Simと強化学習を用いて、多様なモバイルマニピュレーション軌道を自動生成する大規模ベンチマークを構築し、代表的なVLAモデルの性能を評価した。
原題: MobileManiBench: Simplifying Model Verification for Mobile Manipulation / Wenbo Wang, Fangyun Wei, QiXiu Li 他
日本語で読む → - 論文VLAロボティクス
実時間マルチモーダルLLMとツール呼び出しによる状況依存的具現化対話のための現代システムレシピ
実時間マルチモーダルLLMと注意・能動知覚のためのツール群を組み合わせ、家庭的な6シナリオで対話品質とツール判断精度を評価した。
原題: A Modern System Recipe for Situated Embodied Human-Robot Conversation with Real-Time Multimodal LLMs and Tool-Calling / Dong Won Lee, Sarah Gillet, Louis-Philippe Morency 他
日本語で読む → - 論文VLAロボティクス
LIEREx: ロボット探索のための言語-画像埋め込み
CLIPなどの視覚言語基盤モデルと3Dセマンティックシーングラフを統合し、未知環境で目標指向の探索を自律エージェントが行えるようにした研究。
原題: LIEREx: Language-Image Embeddings for Robotic Exploration / Felix Igelbrink, Lennart Niecksch, Marian Renz 他
日本語で読む → - 論文VLAロボティクス
BTGenBot-2: 小型言語モデルによる効率的なビヘイビアツリー生成
自然言語のタスク指示とロボットの行動プリミティブから実行可能なビヘイビアツリーをXMLで直接生成する1Bパラメータのオープンソース小型言語モデルを提案し、標準ベンチマークを構築した。
原題: BTGenBot-2: Efficient Behavior Tree Generation with Small Language Models / Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci
日本語で読む → - 論文自動運転/VLAロボティクス
HERMES: ロングテール自動運転のための視覚言語モデルを用いたリスク認識型マルチモーダル統合システム
視覚言語モデルを活用し、ロングテールな混在交通環境でのリスクを明示的に考慮した軌道計画を行う、エンドツーエンド自動運転フレームワークを提案。
原題: HERMES: A Holistic End-to-End Risk-Aware Multimodal Embodied System with Vision-Language Models for Long-Tail Autonomous Driving / Weizhe Tang, Junwei You, Jiaxi Liu 他
日本語で読む → - 論文VLAロボティクス
SA-VLA: 空間認識型フローマッチングによる視覚-言語-行動強化学習
フローマッチング型VLAポリシーの強化学習適応時に空間的帰納バイアスが失われる問題に対し、空間表現の融合・幾何学的進捗に基づく密報酬・空間条件付き探索戦略を組み合わせ、空間分布シフト下での汎化性能を高める手法を提案。
原題: SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning / Xu Pan, Zhenglin Wan, Xingrui Yu 他
日本語で読む → - 論文VLAロボティクス
World-Gymnast: 世界モデル内での強化学習によるロボット訓練
実世界の動画と行動データから学習した世界モデル内でVLA方針を強化学習し、実機性能で教師あり学習やシミュレータを上回ることを示した。
原題: World-Gymnast: Training Robots with Reinforcement Learning in a World Model / Ansh Kumar Sharma, Yixiang Sun, Ninghao Lu 他
日本語で読む → - 論文VLA画像認識
QVLA: 視覚-言語-行動モデルの量子化におけるチャネルごとの重要度割り当て
VLAモデルの量子化を行動空間の感度に基づいてチャネル単位でビット幅を割り当てる手法を提案し、メモリ削減とタスク成功率の両立を実現した。
原題: QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization / Yuhao Xu, Yantai Yang, Zhenyang Fan 他
日本語で読む → - 論文VLAロボティクス
ProAct: 構造認識型能動応答のためのベンチマークとマルチモーダルフレームワーク
75タスク・91,581アノテーションからなる能動エージェント用ベンチマークProAct-75を構築し、タスクグラフとMLLMを活用したベースラインProAct-Helperを提案した。
原題: ProAct: A Benchmark and Multimodal Framework for Structure-Aware Proactive Response / Xiaomeng Zhu, Fengming Zhu, Weijie Zhou 他
日本語で読む → - 論文VLAロボティクス
EgoActor: 視覚言語モデルによるヒューマノイドロボットの空間認識型一人称視点行動へのタスク計画の接地
一人称視覚言語モデルEgoActorを提案し、高レベル指示から歩行・頭部動作・操作コマンドを直接予測してヒューマノイドの知覚と実行をリアルタイムに統合する。
原題: EgoActor: Grounding Task Planning into Spatial-aware Egocentric Actions for Humanoid Robots via Visual-Language Models / Yu Bai, MingMing Yu, Chaojie Li 他
日本語で読む → - 論文VLAロボティクス
GeneralVLA:知識誘導型軌道計画による汎化可能な視覚-言語-行動モデル
基盤モデルの汎化能力を活かし、アフォーダンス認識・3D軌道計画・制御を階層化したVLAモデルを提案。実機データや人間の実演なしでゼロショットのマニピュレーションを実現する。
原題: GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning / Guoqing Ma, Siheng Wang, Zeyu Zhang 他
日本語で読む → - 論文VLAロボティクス
VLN-Pilot: 大規模視覚言語モデルを屋内ドローンの自律操縦者として活用
大規模視覚言語モデル(VLLM)をドローンのパイロット役に据え、自然言語指示と視覚情報から屋内での自律飛行を実現するフレームワークを提案し、フォトリアルなシミュレーションで有効性を示した。
原題: VLN-Pilot: Large Vision-Language Model as an Autonomous Indoor Drone Operator / Bessie Dominguez-Dager, Sergio Suescun-Ferrandiz, Felix Escalona 他
日本語で読む → - 論文VLA画像認識
スパース動画生成による実世界の視界外ビジョン言語ナビゲーション
動画生成モデルを視界外ナビゲーションに初導入し、20秒先の未来をスパースに生成することでサブ秒推論を実現した手法SparseVideoNavを提案。
原題: Sparse Video Generation Propels Real-World Beyond-the-View Vision-Language Navigation / Hai Zhang, Siqi Liang, Li Chen 他
日本語で読む → - 論文VLA画像認識
LIBERO-X:視覚言語行動モデルの堅牢性を測るリトマス試験
VLAモデルの汎化・堅牢性を細かく評価するため、難易度を段階付けた評価プロトコルと多様な人間操作データを備えた新ベンチマークLIBERO-Xを提案した。
原題: LIBERO-X: Robustness Litmus for Vision-Language-Action Models / Guodong Wang, Chenkai Zhang, Qingjie Liu 他
日本語で読む → - 論文VLAロボティクス
CLUE: 注意機構を用いた言語視覚理解によるクロスモーダル曖昧性解消
VLMのクロスモーダル注意を空間的に接地した信号に変換し、参照曖昧性を検出して質問すべきタイミングを判断する対話型視覚接地モデルを提案。
原題: CLUE: Crossmodal disambiguation via Language-vision Understanding with attEntion / Mouad Abrini, Mohamed Chetouani
日本語で読む → - 論文VLAロボティクス
再帰的深さを持つVLA:潜在的反復推論による視覚言語行動モデルのテスト時計算スケーリング
重み共有の再帰的な行動ヘッドを用いて、推論時に潜在空間での反復的な洗練を行うことで、メモリ使用量を一定に保ちながら計算量を適応的に増やせるVLAアーキテクチャを提案した。
原題: Recurrent-Depth VLA: Implicit Test-Time Compute Scaling of Vision-Language-Action Models via Latent Iterative Reasoning / Yalcin Tur, Jalal Naghiyev, Haoquan Fang 他
日本語で読む →