論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/4/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文データ生成/VLAロボティクス
V-CAGE: ロボット操作のための視覚閉ループエージェント生成エンジン
VLAモデル学習用の高品質な合成データを自動生成するエージェントフレームワークを提案。セマンティックなレイアウト計画と視覚自己検証により、物理的に実行可能なシーンと軌道を生成し、データ圧縮も実現する。
原題: V-CAGE: Vision-Closed-Loop Agentic Generation Engine for Robotic Manipulation / Yaru Liu, Ao-bo Wang, Nanyang Ye
日本語で読む → - 論文VLA/推論高速化画像認識
VLA-InfoEntropy: 学習不要の視覚注意情報エントロピーによるVLAモデルの推論高速化と成功率向上
視覚言語行動(VLA)モデルの推論を高速化するため、画像エントロピーと注意エントロピーを用いて重要領域を動的に選択し、冗長な視覚情報を削減する手法を提案した。
原題: VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success / Chuhang Liu, Yayun He, Zuheng Kang 他
日本語で読む → - 論文VLAロボティクス
ProGAL-VLA: 予測的推論による視覚言語行動モデルの接地整合
視覚言語行動モデルが指示を無視する問題に対し、3Dエンティティ中心グラフとシンボリックサブゴール計画、接地整合損失を導入し、指示感度と曖昧さ検出を向上させた。
原題: ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models / Nastaran Darabi, Amit Ranjan Trivedi
日本語で読む → - 論文VLA/操作ロボティクス
SpatialVAM: 空間認識型マルチビュービデオ拡散によるデータ効率的なロボットポリシー
3D空間構造と時間変化を同時に捉えるため、空間認識型のマルチビューヒートマップビデオとRGBビデオを生成する初の3Dビデオ行動モデルを提案し、少数のデモで汎用的な操作を実現した。
原題: SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy / Peiyan Li, Yixiang Chen, Yuan Xu 他
日本語で読む → - 論文VLAAI
Rule-VLN:意味推論と幾何補正による知覚とコンプライアンスの橋渡し
ルール遵守ナビゲーションのための大規模都市ベンチマークRule-VLNを構築し、事前学習済みエージェントに安全意識を付与するゼロショットモジュールSNRMを提案した。
原題: Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification / Jiawen Wen, Penglei Sun, Wenjie Zhang 他
日本語で読む → - 論文VLA/自律システムロボティクス
SpaceMind: 軌道上サービス自律化のためのモジュール型自己進化型身体化視覚言語エージェントフレームワーク
軌道上サービスを自律化するため、視覚センサーで知覚し3D空間を推論するモジュール型・自己進化型のVLMエージェントフレームワークを提案し、シミュレーションと実機で検証した。
原題: SpaceMind: A Modular and Self-Evolving Embodied Vision-Language Agent Framework for Autonomous On-orbit Servicing / Aodi Wu, Haodong Han, Xubo Luo 他
日本語で読む → - 論文VLAロボティクス
JoyAI-RA 0.1: ロボット自律性のための基盤モデル
オープンワールドでのロボット操作の汎化を目指し、ウェブデータ、人間の操作動画、シミュレーション、実ロボットデータを統合したVLA基盤モデルJoyAI-RAを提案。実世界とシミュレーションで最先端性能を達成した。
原題: JoyAI-RA 0.1: A Foundation Model for Robotic Autonomy / Tianle Zhang, Zhihao Yuan, Dafeng Chi 他
日本語で読む → - 論文VLAロボティクス
推論時適応アクションチャンキングによる視覚言語行動モデルの性能向上
VLAモデルにおいて、アクションのチャンクサイズを予測のエントロピーに基づいて適応的に決定する戦略を提案し、シミュレーションと実世界の操作タスクで性能を向上させた。
原題: Adaptive Action Chunking at Inference-time for Vision-Language-Action Models / Yuanchang Liang, Xiaobo Wang, Kai Wang 他
日本語で読む → - 論文VLA/タスク実行ロボティクス
オープンワールドタスク実行におけるVLAエージェントの長期記憶
化学実験自動化のための二層メモリと将来状態予測を備えたVLAベースのフレームワークChemBotを提案し、長期的なタスク成功率を向上させた。
原題: Long-Term Memory for VLA-based Agents in Open-World Task Execution / Xu Huang, Weixin Mao, Yinhao Li 他
日本語で読む → - 論文VLA/ロバスト性/レッドチーミングロボティクス
多様性を考慮したレッドチーミングによる視覚言語行動モデルの言語的脆弱性の解明
ロボット操作のための視覚言語行動モデル(VLA)の言語的変化に対する頑健性を評価するため、多様な敵対的指示を生成するフレームワークDAERTを提案し、既存手法より多様で効果的な失敗パターンを発見した。
原題: Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming / Baoshun Tong, Haoran He, Ling Pan 他
日本語で読む → - 論文自動運転/VLAロボティクス
因果的シーン叙述と実行時安全監視による視覚言語行動駆動モデルの性能向上
自動運転向けVLAモデルへのテキスト入力を因果構造で再構成し、実行時安全監視を加えることで運転性能を大幅に改善した。
原題: Causal Scene Narration with Runtime Safety Supervision for Vision-Language-Action Driving / Yun Li, Yidu Zhang, Simon Thompson 他
日本語で読む → - 論文VLAロボティクス
KITE: キーフレーム索引付きトークン化証拠によるVLMベースのロボット故障解析
ロボットの長時間実行ビデオを、動きの重要なキーフレームと鳥瞰図表現に凝縮し、視覚言語モデル(VLM)で故障検出・特定・説明・修正を行うトレーニング不要のフロントエンドを提案した。
原題: KITE: Keyframe-Indexed Tokenized Evidence for VLM-Based Robot Failure Analysis / Mehdi Hosseinzadeh, King Hang Wong, Feras Dayoub
日本語で読む → - 論文VLAロボティクス
階層型視覚言語行動モデルの明示的な言語-行動整合による接地
ロボットの言語と行動の整合性を明示的に学習するフレームワークを提案し、階層型VLAモデルの接地を改善した。
原題: Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment / Theodor Wulff, Federico Tavella, Rahul Singh Maharjan 他
日本語で読む → - 論文VLA/量子化ロボティクス
ドリフト対応ポストトレーニング量子化による効率的な視覚言語行動モデル
視覚言語行動モデル(VLA)の量子化時に生じる時間的誤差蓄積による動作ドリフトを解決するため、ドリフト対応PTQ(DA-PTQ)を提案。クロススペース表現補償と動作駆動混合精度割り当てにより、低ビットでも高精度な制御を実現。
原題: DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models / Siyuan Xu, Tianshi Wang, Fengling Li 他
日本語で読む → - 論文自動運転/VLA画像認識
UniDriveVLA:自動運転のための理解・知覚・行動計画の統合
自動運転向けのVLAモデルにおいて、空間知覚と意味推論の競合を解消するため、Mixture-of-Transformersによる専門家分離を導入した統合モデルUniDriveVLAを提案し、nuScenesとBench2Driveで最先端性能を達成した。
原題: UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving / Yongkang Li, Lijun Zhou, Sixu Yan 他
日本語で読む → - 論文VLAロボティクス
ノイズから意図へ:残差ブリッジによる生成的VLAポリシーのアンカリング
生成的VLAポリシーを「ノイズからの生成」から「意図からの精緻化」へと転換し、スペクトル解析で制御を低周波の意図と高周波の残差に分離して、残差拡散ブリッジで局所ダイナミクスを精緻化するResVLAを提案した。
原題: From Noise to Intent: Anchoring Generative VLA Policies with Residual Bridges / Yiming Zhong, Yaoyu He, Zemin Yang 他
日本語で読む → - 論文VLAロボティクス
AnchorVLA: アンカー拡散による効率的なエンドツーエンド移動操作
移動操作において、拡散ポリシーの多様な行動生成を保ちつつ、推論コストを削減するため、アンカー軌道周辺で局所的に拡散する手法を提案し、実行時のドリフトを軽減する自己補正機構も導入した。
原題: AnchorVLA: Anchored Diffusion for Efficient End-to-End Mobile Manipulation / Jia Syuen Lim, Zhizhen Zhang, Peter Bohm 他
日本語で読む → - 論文VLA/操作ロボティクス
CodeGraphVLP: コードによる計画とセマンティックグラフ状態を組み合わせた非マルコフ型視覚言語行動モデル
長期的なロボット操作タスクにおいて、セマンティックグラフ状態とコードベースのプランナーを組み合わせ、視覚言語行動モデルの実行を支援する階層的フレームワークを提案した。
原題: CodeGraphVLP: Code-as-Planner Meets Semantic-Graph State for Non-Markovian Vision-Language-Action Models / Khoa Vo, Sieu Tran, Taisei Hanyu 他
日本語で読む → - 論文VLAロボティクス
圧縮ギャップ:離散トークン化が視覚・言語・行動モデルのスケーリングを制限する理由
視覚エンコーダの性能向上が、行動を離散トークンで表現するVLAモデルでは性能向上に結びつかないことを示し、情報ボトルネックの位置がスケーリング挙動を決める「圧縮ギャップ」原理を提唱した。
原題: The Compression Gap: Why Discrete Tokenization Limits Vision-Language-Action Model Scaling / Takuya Shiba
日本語で読む → - 論文VLA機械学習
π0.7: 操縦可能な汎用ロボット基盤モデルと創発的能力
多様なコンテキスト条件付けを用いて、未見環境での言語指示追従やゼロショットの身体汎化を実現するロボット基盤モデルπ0.7を提案した。
原題: ${\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities / Physical Intelligence, Bo Ai, Ali Amin 他
日本語で読む → - 論文VLA/マニピュレーションロボティクス
AnySlot: ゼロショットのスロット配置のための目標条件付き視覚言語行動ポリシー
言語指示による精密な物体配置を実現するため、言語を視覚的な目標マーカーに変換し、目標条件付きVLAポリシーで実行する階層的フレームワークを提案。また、スロット配置の評価用ベンチマークSlotBenchも導入。
原題: AnySlot: Goal-Conditioned Vision-Language-Action Policies for Zero-Shot Slot-Level Placement / Zhaofeng Hu, Sifan Zhou, Qinbo Zhang 他
日本語で読む → - 論文VLA/世界モデルロボティクス
Motubrain: ロボット制御のための高度な世界行動モデル
視覚・言語・行動を統合した世界行動モデルMotubrainを提案し、動画と行動の同時予測や多様なロボットデータへの対応、高速な実時間推論を実現した。
原題: Motubrain: An Advanced World Action Model for Robot Control / Motubrain Team, Chendong Xiang, Fan Bao 他
日本語で読む → - 論文VLA/世界モデルロボティクス
非同期ノイズ除去によるビデオ事前学習を活用した統合4D世界行動モデリング
ロボットのリアルタイム行動実行と高忠実度な4D世界生成(ビデオ+3D再構成)を単一フレームワークで統合するX-WAMを提案し、非同期ノイズサンプリングにより行動効率と生成品質を両立した。
原題: Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising / Jun Guo, Qiwei Li, Peiyan Li 他
日本語で読む → - 論文VLAロボティクス
StarVLA-α: 視覚言語行動システムの複雑さを低減する
VLAモデルの設計選択を制御条件下で研究するため、複雑さを最小限に抑えたシンプルなベースラインStarVLA-αを提案し、複数ベンチマークで高い性能を達成した。
原題: StarVLA-$\alpha$: Reducing Complexity in Vision-Language-Action Systems / Jinhui Ye, Ning Gao, Senqiao Yang 他
日本語で読む → - 論文VLA画像認識
アクションイメージ:マルチビュー動画生成によるエンドツーエンド方策学習
ロボットの7自由度動作をピクセルに接地したアクション動画として表現し、動画生成モデル自体を方策として用いる統一的な世界行動モデルを提案した。RLBenchと実機評価で高いゼロショット成功率を達成した。
原題: Action Images: End-to-End Policy Learning via Multiview Video Generation / Haoyu Zhen, Zixian Gao, Qiao Sun 他
日本語で読む → - 論文VLA/操作学習ロボティクス
大規模な人間のデモから学習するロボット操作のための人間意図事前分布
人間のデモ動画から操作の事前知識を学び、ロボット操作に活用する階層型VLAフレームワークMoT-HRAを提案。大規模データセットHA-2.2Mを構築し、意図推定とロボット制御を統合することで、分布シフト下での堅牢な操作を実現。
原題: Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation / Yifan Xie, YuAn Wang, Guangyu Chen 他
日本語で読む → - 論文セキュリティ/VLA画像認識
FlowHijack: フローマッチング型視覚言語行動モデルに対する動力学を考慮したバックドア攻撃
フローマッチング型VLAモデルのベクトル場動力学を標的とした初のバックドア攻撃フレームワークを提案し、ステルス性の高いトリガーで高い攻撃成功率を達成した。
原題: FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models / Xinyuan An, Tao Luo, Gengyun Peng 他
日本語で読む → - 論文VLA/構造化ポリシーロボティクス
合成ニューロシンボリック監視による視覚言語モデルからの構造化ロボットポリシー学習
視覚言語モデルを用いて、視覚観察と自然言語指示から実行可能なビヘイビアツリーポリシーを自動生成するニューロシンボリック手法を提案し、合成データのみで学習したモデルが実ロボットで動作することを示した。
原題: Learning Structured Robot Policies from Vision-Language Models via Synthetic Neuro-Symbolic Supervision / Alessandro Adami, Tommaso Tubaldo, Marco Todescato 他
日本語で読む → - 論文VLAロボティクス
Libra-VLA: 非同期の粗密デュアルシステムによる学習均衡の実現
VLAモデルを粗い意図予測と細かい動作生成の2段階に分離し、学習負荷の均衡と非同期実行を実現する新しいアーキテクチャを提案した。
原題: Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System / Yifei Wei, Linqing Zhong, Yi Liu 他
日本語で読む → - 論文VLAロボティクス
OmniVLA-RL: 空間理解とオンラインRLを備えた視覚言語行動モデル
視覚言語行動モデルの空間認識精度と強化学習の安定性を改善するため、Mix-of-TransformersアーキテクチャとFlow-GSPOという新しい学習手法を提案し、LIBEROベンチマークで性能を実証した。
原題: OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL / Haoxiang Jie, Yaoyuan Yan, Xiangyu Wei 他
日本語で読む →