論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
LAP: 言語-行動事前学習によるゼロショットの異機体転移
ロボットの低レベル行動を自然言語で表現して事前学習することで、未知のロボット機体にもファインチューニングなしでゼロショット転移できるVLAモデルLAP-3Bを提案した。
原題: LAP: Language-Action Pre-Training Enables Zero-shot Cross-Embodiment Transfer / Lihan Zha, Asher J. Hancock, Mingtong Zhang 他
日本語で読む → - 論文VLAロボティクス
AsyncVLA:エッジ上での高速・堅牢なナビゲーションのための非同期VLA
大規模基盤モデルを遠隔ワークステーションで動かし、軽量なオンボードアダプタが高頻度で動作を補正する非同期制御フレームワークを提案し、最大6秒の通信遅延下でも高いナビゲーション成功率を実現した。
原題: AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge / Noriaki Hirose, Catherine Glossop, Dhruv Shah 他
日本語で読む → - 論文VLAロボティクス
MOTIF: 少数ショットでの異なる身体間転送のための行動モチーフ学習
異なるロボット身体間での少数ショット転送を可能にするため、身体に依存しない時空間パターン(行動モチーフ)をベクトル量子化で抽出し、フローマッチング方策を導く軽量予測器を設計した手法。
原題: MOTIF: Learning Action Motifs for Few-shot Cross-Embodiment Transfer / Heng Zhi, Wentao Tan, Lei Zhu 他
日本語で読む → - 論文VLAロボティクス
DM0: フィジカルAIに向けた身体性ネイティブな視覚-言語-行動モデル
身体性を後付けでなく最初から統合し、大規模事前学習からフローマッチング行動専門家と空間Chain-of-Thoughtで操作とナビゲーションを統一的に学習するVLAフレームワークDM0を提案。
原題: DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI / En Yu, Haoran Lv, Jianjian Sun 他
日本語で読む → - 論文VLAロボティクス
ロボットの失敗検出と推論のための自己洗練型視覚言語モデル
ロボットの失敗検出と推論をマルチタスクの自己洗練プロセスとして定式化し、疎な二値ラベルと少数の詳細な推論アノテーションを組み合わせて学習するARMORを提案。推論時には複数の洗練軌跡から自信度の高い予測を選択し、失敗検出率と推論性能で従来手法を大幅に上回る。
原題: Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning / Carl Qi, Xiaojie Wang, Silong Yong 他
日本語で読む → - 論文VLAロボティクス
RISE: 構成可能な世界モデルによる自己改善ロボット方策
ロボット操作のための構成可能な世界モデルを提案し、想像空間での強化学習により実世界での安全性・コスト問題を回避しつつ、動的タスクで大幅な性能向上を実現した。
原題: RISE: Self-Improving Robot Policy with Compositional World Model / Jiazhi Yang, Kunyang Lin, Jinwei Li 他
日本語で読む → - 論文VLAロボティクス
STaR: 長期的マルチモーダルロボット記憶のためのスケーラブルなタスク条件付き検索
ロボットの長期記憶を構築し、情報ボトルネック原理に基づくタスク条件付き検索で必要な記憶を抽出するエージェント推論フレームワークを提案。屋内・屋外の実環境で有効性を実証。
原題: STaR: Scalable Task-Conditioned Retrieval for Long-Horizon Multimodal Robot Memory / Mingfeng Yuan, Hao Zhang, Mahan Mohammadi 他
日本語で読む → - 論文VLAロボティクス
マルチモーダル大規模言語モデルによる実時間状況推論
GPT-4oとTurtleBot 4を組み合わせ、家庭内の視覚情報から掃除開始の適切さを判断するシステムを構築し、文脈や価値観に基づく意思決定の可能性と課題を示した。
原題: Multimodal Large Language Models for Real-Time Situated Reasoning / Giulio Antonio Abbo, Senne Lenaerts, Tony Belpaeme
日本語で読む → - 論文VLAロボティクス
ABot-N0:多様な身体性ナビゲーションのためのVLA基盤モデルに関する技術報告
5種類のナビゲーションタスクを統一的に扱うVLA基盤モデルABot-N0を提案し、大規模データセット構築と7ベンチマークでのSOTA達成、実環境での長期ミッションを可能にした。
原題: ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation / Zedong Chu, Shichao Xie, Xiaolong Wu 他
日本語で読む → - 論文VLA画像認識
JEPA-VLA:VLAモデルに動画予測埋め込みが必要な理由
動画で事前学習した予測埋め込み(V-JEPA 2)をVLAモデルに適応的に統合し、サンプル効率と汎化性能を大幅に向上させる手法を提案。
原題: JEPA-VLA: Video Predictive Embedding is Needed for VLA Models / Shangchen Miao, Ningya Feng, Jialong Wu 他
日本語で読む → - 論文VLAロボティクス
HoloBrain-0 技術報告
ロボットの身体情報(カメラ配置やURDF)を組み込んだVLAフレームワークを提案し、事前学習と事後学習でシミュレーションと実機のマニピュレーションタスクを高精度に達成、エコシステム全体をオープンソース化した。
原題: HoloBrain-0 Technical Report / Xuewu Lin, Tianwei Lin, Yun Du 他
日本語で読む → - 論文VLAロボティクス
検証のスケーリングは視覚-言語-行動の整合性において方策学習のスケーリングより効果的になり得る
視覚-言語-行動モデルの指示と行動のずれを減らすため、テスト時に言い換え指示と行動候補を増やして検証する手法CoVerを提案し、方策事前学習のスケーリングより高い性能を示した。
原題: Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment / Jacky Kwok, Xilun Zhang, Mengdi Xu 他
日本語で読む → - 論文VLAロボティクス
BFA++: マルチビュー視覚言語行動モデルのための階層的ベスト特徴認識トークンプルーニング
VLAモデル向けに、視点内・視点間の2段階重要度予測で動的にトークンを削減し、マルチビュー入力の計算効率と操作成功率を両立させるフレームワークを提案した。
原題: BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model / Haosheng Li, Weixin Mao, Zihan Lan 他
日本語で読む → - 論文VLAロボティクス
BagelVLA: 視覚・言語・行動の交互生成による長期的マニピュレーションの強化
言語計画と視覚予測を行動生成ループに交互に組み込み、長期的なロボット操作タスクの性能を高める統合モデルを提案した。
原題: BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation / Yucheng Hu, Jianke Zhang, Yuanfei Luo 他
日本語で読む → - 論文VLA画像認識
ステアリングからペダリングへ:自動運転VLMはサイクリスト支援の空間知覚と計画に汎化するか?
自転車視点の知覚・時空間理解・交通ルール推論を評価するベンチマークCyclingVQAを提案し、31以上のVLMを評価した結果、自動運転特化モデルが汎用モデルに劣る場合があることを示した。
原題: From Steering to Pedalling: Do Autonomous Driving VLMs Generalize to Cyclist-Assistive Spatial Perception and Planning? / Krishna Kanth Nakka, Vedasri Nakka
日本語で読む → - 論文VLAロボティクス
TIC-VLA:動的環境におけるロボットナビゲーションのための制御内思考型視覚-言語-行動モデル
遅延する意味推論を明示的にモデル化し、非同期推論に適応した視覚-言語-行動モデルを提案。動的環境での言語誘導ナビゲーションをリアルタイム制御で実現する。
原題: TIC-VLA: A Think-in-Control Vision-Language-Action Model for Robot Navigation in Dynamic Environments / Zhiyu Huang, Yun Zhang, Johnson Liu 他
日本語で読む → - 論文VLAロボティクス
Sci-VLA: 科学実験の長期的タスクのためのエージェント型VLA推論プラグイン
科学実験の長期的タスクにおいて、VLAモデルが苦手とする原子タスク間の遷移をLLMエージェントが推論・補完し、追加学習なしで複合タスクを実行可能にする推論プラグインを提案。
原題: Sci-VLA: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments / Yiwen Pang, Bo Zhou, Changjin Li 他
日本語で読む → - 論文VLAロボティクス
ST4VLA: 視覚言語行動モデルのための空間誘導訓練
VLMに空間的な事前知識を組み込む二段階訓練でロボットの行動生成を改善し、SimplerEnvで新たなSOTAを達成した研究。
原題: ST4VLA: Spatially Guided Training for Vision-Language-Action Models / Jinhui Ye, Fangjing Wang, Ning Gao 他
日本語で読む → - 論文VLAロボティクス
再帰的深さを持つVLA:潜在的反復推論による視覚言語行動モデルのテスト時計算スケーリング
重み共有の再帰的な行動ヘッドを用いて、推論時に潜在空間での反復的な洗練を行うことで、メモリ使用量を一定に保ちながら計算量を適応的に増やせるVLAアーキテクチャを提案した。
原題: Recurrent-Depth VLA: Implicit Test-Time Compute Scaling of Vision-Language-Action Models via Latent Iterative Reasoning / Yalcin Tur, Jalal Naghiyev, Haoquan Fang 他
日本語で読む → - 論文VLAロボティクス
CLUE: 注意機構を用いた言語視覚理解によるクロスモーダル曖昧性解消
VLMのクロスモーダル注意を空間的に接地した信号に変換し、参照曖昧性を検出して質問すべきタイミングを判断する対話型視覚接地モデルを提案。
原題: CLUE: Crossmodal disambiguation via Language-vision Understanding with attEntion / Mouad Abrini, Mohamed Chetouani
日本語で読む → - 論文VLA画像認識
LIBERO-X:視覚言語行動モデルの堅牢性を測るリトマス試験
VLAモデルの汎化・堅牢性を細かく評価するため、難易度を段階付けた評価プロトコルと多様な人間操作データを備えた新ベンチマークLIBERO-Xを提案した。
原題: LIBERO-X: Robustness Litmus for Vision-Language-Action Models / Guodong Wang, Chenkai Zhang, Qingjie Liu 他
日本語で読む → - 論文VLA画像認識
スパース動画生成による実世界の視界外ビジョン言語ナビゲーション
動画生成モデルを視界外ナビゲーションに初導入し、20秒先の未来をスパースに生成することでサブ秒推論を実現した手法SparseVideoNavを提案。
原題: Sparse Video Generation Propels Real-World Beyond-the-View Vision-Language Navigation / Hai Zhang, Siqi Liang, Li Chen 他
日本語で読む → - 論文VLAロボティクス
VLN-Pilot: 大規模視覚言語モデルを屋内ドローンの自律操縦者として活用
大規模視覚言語モデル(VLLM)をドローンのパイロット役に据え、自然言語指示と視覚情報から屋内での自律飛行を実現するフレームワークを提案し、フォトリアルなシミュレーションで有効性を示した。
原題: VLN-Pilot: Large Vision-Language Model as an Autonomous Indoor Drone Operator / Bessie Dominguez-Dager, Sergio Suescun-Ferrandiz, Felix Escalona 他
日本語で読む → - 論文VLAロボティクス
GeneralVLA:知識誘導型軌道計画による汎化可能な視覚-言語-行動モデル
基盤モデルの汎化能力を活かし、アフォーダンス認識・3D軌道計画・制御を階層化したVLAモデルを提案。実機データや人間の実演なしでゼロショットのマニピュレーションを実現する。
原題: GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning / Guoqing Ma, Siheng Wang, Zeyu Zhang 他
日本語で読む → - 論文VLAロボティクス
EgoActor: 視覚言語モデルによるヒューマノイドロボットの空間認識型一人称視点行動へのタスク計画の接地
一人称視覚言語モデルEgoActorを提案し、高レベル指示から歩行・頭部動作・操作コマンドを直接予測してヒューマノイドの知覚と実行をリアルタイムに統合する。
原題: EgoActor: Grounding Task Planning into Spatial-aware Egocentric Actions for Humanoid Robots via Visual-Language Models / Yu Bai, MingMing Yu, Chaojie Li 他
日本語で読む → - 論文VLAロボティクス
ProAct: 構造認識型能動応答のためのベンチマークとマルチモーダルフレームワーク
75タスク・91,581アノテーションからなる能動エージェント用ベンチマークProAct-75を構築し、タスクグラフとMLLMを活用したベースラインProAct-Helperを提案した。
原題: ProAct: A Benchmark and Multimodal Framework for Structure-Aware Proactive Response / Xiaomeng Zhu, Fengming Zhu, Weijie Zhou 他
日本語で読む → - 論文VLA画像認識
QVLA: 視覚-言語-行動モデルの量子化におけるチャネルごとの重要度割り当て
VLAモデルの量子化を行動空間の感度に基づいてチャネル単位でビット幅を割り当てる手法を提案し、メモリ削減とタスク成功率の両立を実現した。
原題: QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization / Yuhao Xu, Yantai Yang, Zhenyang Fan 他
日本語で読む → - 論文VLAロボティクス
SA-VLA: 空間認識型フローマッチングによる視覚-言語-行動強化学習
フローマッチング型VLAポリシーの強化学習適応時に空間的帰納バイアスが失われる問題に対し、空間表現の融合・幾何学的進捗に基づく密報酬・空間条件付き探索戦略を組み合わせ、空間分布シフト下での汎化性能を高める手法を提案。
原題: SA-VLA: Spatially-Aware Flow-Matching for Vision-Language-Action Reinforcement Learning / Xu Pan, Zhenglin Wan, Xingrui Yu 他
日本語で読む → - 論文自動運転/VLAロボティクス
HERMES: ロングテール自動運転のための視覚言語モデルを用いたリスク認識型マルチモーダル統合システム
視覚言語モデルを活用し、ロングテールな混在交通環境でのリスクを明示的に考慮した軌道計画を行う、エンドツーエンド自動運転フレームワークを提案。
原題: HERMES: A Holistic End-to-End Risk-Aware Multimodal Embodied System with Vision-Language Models for Long-Tail Autonomous Driving / Weizhe Tang, Junwei You, Jiaxi Liu 他
日本語で読む → - 論文VLAロボティクス
BTGenBot-2: 小型言語モデルによる効率的なビヘイビアツリー生成
自然言語のタスク指示とロボットの行動プリミティブから実行可能なビヘイビアツリーをXMLで直接生成する1Bパラメータのオープンソース小型言語モデルを提案し、標準ベンチマークを構築した。
原題: BTGenBot-2: Efficient Behavior Tree Generation with Small Language Models / Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci
日本語で読む →