論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/26 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
RA-VLA: テスト時適応のための検索拡張VLA
新しいタスク分布に弱いVLAモデルの問題を解決するため、行動に合わせた文脈検索と実行パイプラインを統合した検索拡張VLAフレームワークを提案し、LIBEROベンチマークと実環境で高い成功率と効率を実証した。
原題: RA-VLA: Retrieval-Augmented VLA for Test-Time Adaptation / Sanghwan Jang, Minjin Jeon, Minsoo Kim 他
日本語で読む → - 論文VLA画像認識
StreamPI: 視覚・言語・行動モデルのためのストリーミング型マルチモーダル時間モデリング
単一フレームのVLAモデルに追加パラメータなしで時間的推論能力を付与するフレームワークを提案し、実ロボットタスクで有効性を実証した。
原題: StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models / Zhe Liu, Jinghua Hou, Yuxiang Lu 他
日本語で読む → - 論文VLA/3Dガウス/世界モデルロボティクス
GaussianDream++: ロボット操作のための効率的な3Dガウス世界モデリング
VLAポリシーに世界状態トークンと世界予測トークンを挿入し、訓練時のみ3Dガウス表現で現在と未来の世界を監督することで、推論時の追加コストなしに操作性能を向上させる手法を提案。
原題: GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation / Yuqing Jiang, Zijian Zhang, Weitao Zhou 他
日本語で読む → - 論文VLAロボティクス
MA-VLA: 協調と構成的汎化のためのマルチアーム視覚言語行動モデル
複数アームの協調動作をアトミックな行動割り当てで分解し、訓練時にアームの役割をシャッフルすることで、未見の協調パターンへの汎化を実現するVLAモデルを提案した。
原題: MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization / Zaibin Zhang, Junlan Xiao, Zhongbo Zhang 他
日本語で読む → - 論文VLAロボティクス
一つのポリシー、多様な身体:異種具現化操作のためのカメラ中心の統一アクション幾何学事前学習
異なるロボット形態やカメラ設定をまたいで操作データを統一するため、カメラで観測可能なアンカー動作を共通のアクション表現として用いる新しいフレームワークUCAG-Pを提案。単一のVLAポリシーで複数のベンチマークを高精度に達成した。
原題: One Policy, Many Embodiments: Unified Camera-Centric Action Geometry Pre-training for Heterogeneous Embodied Manipulation / Xiaomi Embodied Intelligence Team, University of Macau, : 他
日本語で読む → - 論文VLAロボティクス
LM-X: 進捗・イベント・不確実性予測による説明可能な汎用ロボット操作の行動モデリング
汎用VLAポリシーに、タスク進捗・イベント遷移・局所信頼性を明示的に予測する3つの信号を導入し、制御に内在する説明可能性を実現した。大規模事前学習と実ロボットデータで高い成功率を達成した。
原題: LM-X: Explainable Action Modeling with Progress, Event, and Uncertainty Prediction for Generalist Robot Manipulation / Jin Lou, Jingxuan Zhu, Andong Chen 他
日本語で読む → - 論文VLA画像認識
V-Link: アクションDiTにおける失われた視覚表現の回復による視覚-言語-行動モデルの強化
VLAモデルのアクション専門家が視覚特徴を十分に活用できない問題を解決するため、VLM内に空間・意味クエリを学習し、非対称経路でAction DiTに注入するV-Linkを提案。ベンチマークで成功率を大幅に向上させた。
原題: V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models / Yehao Lu, Jiarui Yang, Yuning Su 他
日本語で読む → - 論文VLAAI
GameWAM: ビデオゲームのためのワールドアクションモデル
ビデオゲーム向けに、将来の視覚観測と実行可能なキーボード・マウス操作を同時生成する世界行動モデル(WAM)を提案し、ネイティブな閉ループゲームプレイとGUI制御を実現した。
原題: GameWAM: A World Action Model for Video Games / Yuncheng Guo, Zhanqiu Zhang, Yiwen Guo 他
日本語で読む → - 論文VLAロボティクス
GaussVLA:幾何認識型空間推論を備えた視覚言語行動モデル
視覚言語行動モデルに3Dガウス表現と深度認識型思考連鎖を導入し、空間操作性能を向上させた。
原題: GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model / Md Selim Sarowar, Md Tanvir Islam, Sungho Kim 他
日本語で読む → - 論文VLAロボティクス
階層的スキル検索による視覚言語行動モデルのデータ効率的適応
長期的な操作タスクを階層的に分解し、サブタスクの言語検索と行動特徴の再ランキングを組み合わせて関連デモを検索することで、少数のデモでもVLAモデルを効率的に適応させる手法を提案した。
原題: Hierarchical Skill Retrieval for Data-Efficient Adaptation of Vision-Language-Action Models / Haoran Hao, Shahram Najam Syed, Jeff Schneider 他
日本語で読む → - 論文VLAロボティクス
グリッパー認識型視覚言語行動モデル
異なるグリッパー種別に応じた戦略を学習できるよう、5種類のグリッパーを含む大規模データセットと、専用トークナイザーとポリシールーティングを備えたモデルを提案した。
原題: Gripper-aware Vision Language Action Models / Hanyi Zhang, Zihong Luo, Tianyu Li 他
日本語で読む → - 論文VLAロボティクス
GaussianWAM: 3Dガウス場から世界行動モデルへの幾何学と意味の蒸留
多視点観測から3Dガウス場を介して幾何・意味情報を世界行動モデルに蒸留し、ロボット操作の視覚予測と行動生成を強化する手法を提案。
原題: GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models / Zijian Zhang, Yuqing Jiang, Weitao Zhou 他
日本語で読む → - 論文VLA/世界モデルロボティクス
TrAct: ロボット制御と視覚予測を視覚トラックで橋渡しする
ロボットの行動と画像変化の弱い対応を補うため、視覚トラックを中間表現として用いる世界モデルベースの意思決定フレームワークTrActを提案。シミュレーションと実機で成功率を大幅に向上させた。
原題: TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks / Zhi Cao, Howard Ji, Kevin Zhang 他
日本語で読む → - 論文VLAロボティクス
潜在アクションを意図として用いた効率的な未来想像による世界行動モデル
ロボット制御のための世界行動モデルにおいて、テスト時の未来観測生成の遅延を削減するため、潜在アクションを意図の表現として用いるLAWAを提案。将来の観測を生成せずに効率的な未来想像を実現し、少ないデモデータや分布外シナリオでの性能を向上させた。
原題: Latent Action as Intention Enables Efficient Future Imagination for World Action Models / Xiang Li, Yupeng Zheng, Songen Gu 他
日本語で読む → - 論文VLA画像認識
GlanceWAM: 世界行動モデルのためのスパースなテスト時想像
ビデオ生成モデルの物理的知識をロボット学習に活用しつつ、制御レートでの同期生成の遅延問題を回避するため、非同期に未来フレームを想像し、潜在空間で直接行動を生成する手法を提案。RoboCasaやLIBEROで高い成功率と高速推論を実現。
原題: GlanceWAM: Sparse Test-Time Imagination for World-Action Models / Linhan Wang, Zijian An, Mingyuan Zhang 他
日本語で読む → - 論文VLAロボティクス
PonderPounce: 事前学習済みMLLMをロボット制御のエピソードコンテキストエンジンとして活用
PonderPounceは、マルチモーダル大規模言語モデル(MLLM)のネイティブな因果コンテキストをロボットの記憶として再利用し、エピソード観察やデモンストレーションを蓄積してサブゴール生成を行うSystem2と、現在の観察から直接アクションを出力するSystem1のVLAを非同期に連携させる新しいアーキテクチャを提案する。専用の記憶モジュールやブリッジ事前学習なしでエンドツーエンドに訓練され、低遅延で高周波のアクション生成を実現する。
原題: PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control / Suhwan Choi, Jaeyoon Jung, Sungkyung Kim 他
日本語で読む → - 論文VLA/操作ロボティクス
Pointing-VLA: 視覚言語行動操作のための型付き空間接地インターフェース
VLAモデルの空間接地をテキスト座標ではなく型付きヘッドで直接予測し、実行契約によりPICKとPLACEを分離。Bridge/WidowXでSOTAを達成し、実ロボット成功率を52.7%から80.7%に向上させた。
原題: Pointing-VLA: Typed Spatial Grounding Interfaces for Vision-Language-Action Manipulation / Xiwen Chen, Zelin Li, Zhiruo Zhou 他
日本語で読む → - 論文VLAロボティクス
UniMem: 視覚言語行動モデルのためのマルチモーダル記憶と制御の統合
長期的な記憶を必要とするタスクで性能が低下するVLAモデルに対し、イベント分類器とキーフレームエンコーダを用いて記憶と制御を単一モデルに統合するフレームワークを提案し、シミュレーションと実機で既存手法を上回る性能を達成した。
原題: UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models / Lars Osterberg, Maggie Wang, Mac Schwager
日本語で読む → - 論文VLAロボティクス
意図を持って行動する:視覚言語行動モデルのための行動意図の蒸留
視覚言語行動モデルの行動デコーダに、将来の行動の意図を蒸留する手法を提案し、シミュレーションと実世界のタスクで成功率を向上させた。
原題: Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models / Sangoh Lee, Sangwoo Mo, Wook-Shin Han
日本語で読む → - 論文VLA画像認識
Object-Uni: オブジェクト中心の空間理解と制御可能な生成のための統一モデル
オブジェクトの姿勢を明示的な幾何変数として扱い、姿勢認識・空間推論・姿勢条件付き生成・新規視点合成を統一したモデルを提案。視点ベースの姿勢抽象化とオブジェクトトークンに基づく姿勢アンカーにより、連続的な姿勢の理解と生成を実現する。
原題: Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation / Mining Tan, Yinuo Wang, Ziqi Zhou 他
日本語で読む → - 論文VLA/操作ロボティクス
必要な時だけ考える:視覚言語行動操作における選択的スローパス介入のためのプロンプト権限制御
凍結された視覚言語行動(VLA)ポリシーに検索テキストを追加すると、プロンプト形式の変化が実行を支配し成功率が大幅に低下する「プロンプト形式崩壊」を特定し、候補生成とポリシー入力変更の許可を分離するプロンプト権限インターフェースTOWN-VLAを導入。これにより、シミュレーションと実機で成功率が向上した。
原題: Think Only When Needed: Prompt-Authority Control for Selective Slow-Path Intervention in Vision-Language-Action Manipulation / Zhiruo Zhou, Zelin Li, Xiwen Chen 他
日本語で読む → - 論文VLA/ベンチマークロボティクス
InstructMove: 指示追従操作のためのテキスト必須ベンチマーク
視覚的に顕著な物体や唯一の動作候補に頼らず、言語指示にのみ従って正解が決まる「テキスト必須」な操作ベンチマークInstructMoveを提案し、VLAモデルの指示追従能力を診断・改善する。
原題: InstructMove: A Text-Indispensable Benchmark for Instruction-Following Manipulation / Mengao Zhao, Ziang Li, Chaodong Huang 他
日本語で読む → - 論文VLAロボティクス
ROS2SmolVLA: 産業用軽量ロボットへの小型視覚言語行動モデル統合の実現
産業用ロボットに小型VLAモデルを統合するためのROS 2インターフェースを開発し、実機でのピックアンドプレース検証を行った。
原題: ROS2SmolVLA: Enabling Small Vision-Language-Action Models for Integration into Industrial-Grade Lightweight Robots / Nils Mandischer, Noah Böckmann, Ludwig Holl 他
日本語で読む → - 論文VLA/蒸留AI
WAM-OPD: ワールドアクションモデルのためのオンポリシー蒸留
ビデオ生成とロボット動作生成を統合したワールドアクションモデル(WAM)の蒸留後性能低下を、オンポリシー蒸留で修復する手法を提案。学生モデルが環境で行動し、教師モデルがその履歴に基づいてビデオと動作のターゲットを提供することで、タスク成功率が大幅に向上した。
原題: WAM-OPD: On-Policy Distillation for World Action Models / Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng 他
日本語で読む → - 論文VLA/両腕操作ロボティクス
驚くほど単純なモダリティマスキングによる堅牢な両腕視覚言語行動モデル
両腕ロボット操作のための視覚言語行動モデルの堅牢性を、トレーニング中にモダリティチャネルをランダムにマスクするだけのシンプルな手法で向上させた。
原題: Robust Bimanual Vision-Language-Action Models via Embarrassingly Simple Modality Masking / Dongzhou Cheng, Ziang Li, Yixiao Zhou 他
日本語で読む → - 論文VLAロボティクス
LD4WAM: 人間のビデオから潜在ダイナミクスを学習するワールドアクションモデル
人間のビデオからロボットの行動に直接使える潜在ダイナミクスを学習し、将来のビデオ生成と行動条件付けを組み合わせたワールドアクションモデルを提案。5,000時間以上のデータで事前学習し、シミュレーションと実機で高い性能を達成。
原題: LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models / Zhenhao Shen, Jiaqi Liang, Jasper Lu 他
日本語で読む → - 論文VLA画像認識
ViSMoE: 身体化された指示表現グラウンディングのための視覚認識スパース混合エキスパート
エージェントが自然言語指示に基づいて遠隔の物体を特定するタスクにおいて、視覚情報の種類に応じて専門化したスパース混合エキスパートを用いることで、ビューと物体の識別表現を改善し、既存手法を上回る性能を達成した。
原題: ViSMoE: Visual-Aware Sparse Mixture-of-Experts for Embodied Referring Expression Grounding / Shuo Feng, Piji Li
日本語で読む → - 論文VLA/強化学習ロボティクス
CounterAlign: 視覚言語行動モデルのための反事実的監督
専門家のデモンストレーションのみから、指示を入れ替えることで反事実的なデータを合成し、オフライン強化学習の報酬モデルを学習する手法を提案。ロボット操作の堅牢性を向上させる。
原題: CounterAlign: Counterfactual Supervision for Vision-Language-Action Models / Haru Kondoh, Kei Ota, Asako Kanezaki 他
日本語で読む → - 論文VLAロボティクス
Ludi 0.1: 社会的知能を持つロボットのためのエージェントシステム
ロボットが曖昧な指示を理解し、文脈を保持し、意図の変化に応じて行動を修正しながら人間と協調するための、対話・推論・記憶・ナビゲーション・操作を統合したエージェントシステムを提案した。
原題: Ludi${}_{\scriptscriptstyle 0.1}$: An Agentic System for Socially Intelligent Robots / Wooseong Chung, William Cong, Jakub Dworakowski 他
日本語で読む → - 論文VLA/社会的知能AI
信念なき行動:視覚言語モデルにおける心の理論の協調的社会行動への変換の測定
心の理論の推論と社会的行動のギャップを測るベンチマークMOSAICを導入し、VLMがToM制約下で一貫した行動を生成できないことを示した。
原題: Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models / Tonglin Yan, Gregoire Sergeant-Perthuis, David Rudrauf
日本語で読む →