論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/4/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/操作ロボティクス
OFlow: 物体認識を組み込んだ時間的フローマッチングによる堅牢なロボット操作
ロボット操作のためのVLAモデルに、物体認識を組み込んだ時間的フローマッチングを導入し、将来予測と物体認識を統一した潜在空間で行うことで、分布シフト下での堅牢性を向上させた。
原題: OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation / Kuanning Wang, Ke Fan, Chenhao Qiu 他
日本語で読む → - 論文VLAAI
PRTS: 対比表現を用いたプリミティブ推論とタスク実行システム
視覚言語行動モデルを、教師あり模倣学習ではなく目標条件付き強化学習として再構成し、言語指示を目標として扱うことで、物理的な到達可能性を評価する統一埋め込み空間を学習する基盤モデルを提案した。
原題: PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations / Yang Zhang, Jiangyuan Zhao, Chenyou Fan 他
日本語で読む → - 論文VLAロボティクス
JoyAI-RA 0.1: ロボット自律性のための基盤モデル
オープンワールドでのロボット操作の汎化を目指し、ウェブデータ、人間の操作動画、シミュレーション、実ロボットデータを統合したVLA基盤モデルJoyAI-RAを提案。実世界とシミュレーションで最先端性能を達成した。
原題: JoyAI-RA 0.1: A Foundation Model for Robotic Autonomy / Tianle Zhang, Zhihao Yuan, Dafeng Chi 他
日本語で読む → - 論文VLAロボティクス
AIM: 空間価値マップを用いた意図認識型統合世界行動モデリング
事前学習済みのビデオ生成モデルを基盤に、将来の観測と空間価値マップを共同で予測し、意図認識型の注意機構と自己蒸留強化学習によりロボットの行動生成を高精度化する手法を提案した。
原題: AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps / Liaoyuan Fan, Zetian Xu, Chen Cao 他
日本語で読む → - 論文セキュリティ/VLA画像認識
FlowHijack: フローマッチング型視覚言語行動モデルに対する動力学を考慮したバックドア攻撃
フローマッチング型VLAモデルのベクトル場動力学を標的とした初のバックドア攻撃フレームワークを提案し、ステルス性の高いトリガーで高い攻撃成功率を達成した。
原題: FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models / Xinyuan An, Tao Luo, Gengyun Peng 他
日本語で読む → - 論文VLA画像認識
LARY: 汎用視覚-行動対応のための潜在行動表現ベンチマーク
人間の行動ビデオから学習した潜在行動表現の能力を評価する統一ベンチマークを構築し、汎用視覚基盤モデルが専門の潜在行動モデルより優れ、潜在空間が物理行動空間とより良く整合することを示した。
原題: LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment / Dujun Nie, Fengjiao Chen, Qi Lv 他
日本語で読む → - 論文VLAロボティクス
VAG: 身体化データ合成のためのデュアルストリーム動画-行動生成
ロボットの基盤モデル学習用に、動画と行動を同時生成する統一フレームワークVAGを提案。動画と行動の整合性を高め、合成データでポリシーの汎化性能を向上させる。
原題: VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis / Xiaolei Lang, Yang Wang, Yukun Zhou 他
日本語で読む → - 論文VLA/操作画像認識
E-VLA: 暗所・ぼやけシーンのためのイベント拡張型視覚言語行動モデル
暗所やモーションブラーなどの劣化環境でロバストな操作を実現するため、イベントカメラの情報をVLAモデルに統合するフレームワークを提案した。実機データセットと軽量な統合手法により、従来の画像のみでは失敗する状況で成功率を大幅に向上させた。
原題: E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes / Jiajun Zhai, Hao Shi, Shangwei Guo 他
日本語で読む → - 論文VLA/強化学習機械学習
RLトークン:視覚言語行動モデルを用いたオンライン強化学習のブートストラップ
事前学習済みの視覚言語行動モデル(VLA)にRLトークンと呼ばれる小型の表現を追加し、その上で強化学習を行うことで、実ロボット上で数時間の練習だけで効率的に微調整できる手法を提案した。
原題: RL Token: Bootstrapping Online RL with Vision-Language-Action Models / Charles Xu, Jost Tobias Springenberg, Michael Equi 他
日本語で読む → - 論文VLAロボティクス
実現可能な行動近傍事前分布による視覚言語行動モデルのファインチューニング強化
ロボット操作では各状態にほぼ等価な行動の近傍が存在するが、既存のVLA訓練はこれを無視する。本研究では、この近傍構造をガウス事前分布でモデル化する正則化を導入し、サンプル効率と成功率を向上させた。
原題: Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior / Haochen Niu, Kanyu Zhang, Shuyu Yin 他
日本語で読む → - 論文VLA機械学習
明示的な物理的実現可能性はVLA学習に有効か?実証研究
拡散型VLAポリシーの訓練に幾何学的な実現可能性の監視を追加し、障害物回避操作タスクで物理的信頼性と性能が向上することを実証した。
原題: Can Explicit Physical Feasibility Benefit VLA Learning? An Empirical Study / Yubai Wei, Chen Wu, Hashem Haghbayan
日本語で読む → - 論文VLA/自律システムロボティクス
SpaceMind: 軌道上サービス自律化のためのモジュール型自己進化型身体化視覚言語エージェントフレームワーク
軌道上サービスを自律化するため、視覚センサーで知覚し3D空間を推論するモジュール型・自己進化型のVLMエージェントフレームワークを提案し、シミュレーションと実機で検証した。
原題: SpaceMind: A Modular and Self-Evolving Embodied Vision-Language Agent Framework for Autonomous On-orbit Servicing / Aodi Wu, Haodong Han, Xubo Luo 他
日本語で読む → - 論文自動運転/VLA画像認識
Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
原題: Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation / Jinghui Lu, Jiayi Guan, Zhijian Huang 他
日本語で読む → - 論文VLAロボティクス
STRONG-VLA: マルチモーダル摂動下での視覚言語行動モデルの分離型ロバスト性学習
視覚と言語の両方に摂動が加わる状況で脆弱なVLAモデルに対し、ロバスト性獲得とタスク忠実性の回復を分離した2段階の微調整フレームワークを提案し、LIBEROベンチマークで成功率を大幅に向上させた。
原題: STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations / Yuhan Xie, Yuping Yan, Yunqi Zhao 他
日本語で読む → - 論文VLA/操作ロボティクス
開ループ計画、閉ループ検証:VLAのための投機的検証
VLAモデルの高コストな推論を効率化するため、重いVLAで低頻度に行動チャンクを計画し、軽量な検証器が最新観測に基づいて実行を監視・必要時のみ再計画するフレームワークSV-VLAを提案した。
原題: Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA / Zihua Wang, Zhitao Lin, Ruibo Li 他
日本語で読む → - 論文VLA/ロバスト性/レッドチーミングロボティクス
多様性を考慮したレッドチーミングによる視覚言語行動モデルの言語的脆弱性の解明
ロボット操作のための視覚言語行動モデル(VLA)の言語的変化に対する頑健性を評価するため、多様な敵対的指示を生成するフレームワークDAERTを提案し、既存手法より多様で効果的な失敗パターンを発見した。
原題: Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming / Baoshun Tong, Haoran He, Ling Pan 他
日本語で読む → - 論文VLAロボティクス
StarVLA-α: 視覚言語行動システムの複雑さを低減する
VLAモデルの設計選択を制御条件下で研究するため、複雑さを最小限に抑えたシンプルなベースラインStarVLA-αを提案し、複数ベンチマークで高い性能を達成した。
原題: StarVLA-$\alpha$: Reducing Complexity in Vision-Language-Action Systems / Jinhui Ye, Ning Gao, Senqiao Yang 他
日本語で読む → - 論文VLAロボティクス
マスク世界モデル:ロバストなロボット政策学習のための重要要素予測
動画生成事前学習に基づく世界モデルがロボット政策学習に有望だが、RGB予測は背景や照明などの無関係な要素に過適合しがち。本論文では、ピクセルではなくセマンティックマスクの進化を予測するマスク世界モデル(MWM)を提案し、幾何学的情報ボトルネックにより物理ダイナミクスと接触関係を捉えつつ視覚ノイズを除去。拡散ベースの政策ヘッドと統合し、LIBEROやRLBenchでSOTAを達成し、実世界実験でもロバスト性を示した。
原題: Mask World Model: Predicting What Matters for Robust Robot Policy Learning / Yunfan Lou, Xiaowei Chi, Xiaojie Zhang 他
日本語で読む → - 論文VLA/ポストトレーニングロボティクス
Hi-WM: 人間参加型ワールドモデルによるロボットポストトレーニングのスケーラブル化
実世界での介入を必要とせず、学習したワールドモデル内で人間が修正行動を提供することで、失敗箇所に集中したポリシー改善を実現するポストトレーニング手法を提案。実機操作タスクで成功率を大幅に向上させた。
原題: Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training / Yaxuan Li, Zhongyi Zhou, Yefei Chen 他
日本語で読む → - 論文VLA/構造化ポリシーロボティクス
合成ニューロシンボリック監視による視覚言語モデルからの構造化ロボットポリシー学習
視覚言語モデルを用いて、視覚観察と自然言語指示から実行可能なビヘイビアツリーポリシーを自動生成するニューロシンボリック手法を提案し、合成データのみで学習したモデルが実ロボットで動作することを示した。
原題: Learning Structured Robot Policies from Vision-Language Models via Synthetic Neuro-Symbolic Supervision / Alessandro Adami, Tommaso Tubaldo, Marco Todescato 他
日本語で読む → - 論文VLA/操作ロボティクス
AnchorRefine: 軌道アンカーと残差補正に基づく協調操作のためのVLAモデル
VLAモデルの動作生成を大域的な軌道計画と局所的な微細補正に分解する階層フレームワークを提案し、シミュレーションと実機で成功率を向上させた。
原題: AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models / Tingzheng Jia, Kan Guo, Lanping Qian 他
日本語で読む → - 論文自動運転/VLAロボティクス
因果的シーン叙述と実行時安全監視による視覚言語行動駆動モデルの性能向上
自動運転向けVLAモデルへのテキスト入力を因果構造で再構成し、実行時安全監視を加えることで運転性能を大幅に改善した。
原題: Causal Scene Narration with Runtime Safety Supervision for Vision-Language-Action Driving / Yun Li, Yidu Zhang, Simon Thompson 他
日本語で読む → - 論文VLA/タスク実行ロボティクス
オープンワールドタスク実行におけるVLAエージェントの長期記憶
化学実験自動化のための二層メモリと将来状態予測を備えたVLAベースのフレームワークChemBotを提案し、長期的なタスク成功率を向上させた。
原題: Long-Term Memory for VLA-based Agents in Open-World Task Execution / Xu Huang, Weixin Mao, Yinhao Li 他
日本語で読む → - 論文VLAロボティクス
文法制約付き大規模言語モデルによる精密なロボットコマンド理解
産業用ロボットの安全な操作のために、文法制約を組み込んだLLMを提案し、自然言語入力をロボット実行可能なJSON形式のコマンドに変換する。
原題: Precise Robot Command Understanding Using Grammar-Constrained Large Language Models / Xinyun Huo, Raghav Gnanasambandam, Xinyao Zhang
日本語で読む → - 論文VLA/操作学習ロボティクス
大規模な人間のデモから学習するロボット操作のための人間意図事前分布
人間のデモ動画から操作の事前知識を学び、ロボット操作に活用する階層型VLAフレームワークMoT-HRAを提案。大規模データセットHA-2.2Mを構築し、意図推定とロボット制御を統合することで、分布シフト下での堅牢な操作を実現。
原題: Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation / Yifan Xie, YuAn Wang, Guangyu Chen 他
日本語で読む → - 論文VLA/安全性評価ロボティクス
HazardArena: 視覚言語行動モデルにおける意味的安全性の評価
視覚言語行動モデル(VLA)の安全性を評価するベンチマークを構築し、安全/危険の双子シナリオで意味的文脈による不安全行動を検出。訓練不要のSafety Option Layerで不安全行動を低減する手法も提案。
原題: HazardArena: Evaluating Semantic Safety in Vision-Language-Action Models / Zixing Chen, Yifeng Gao, Li Wang 他
日本語で読む → - 論文VLA/タスク計画ロボティクス
Ro-SLM: ロボットのタスク計画と動作コード生成のためのオンボード小型言語モデル
クラウドや高性能計算機に依存せず、UAVなどの小型ロボットに搭載可能な小型言語モデル(SLM)を、LLMの知識蒸留と報酬関数によるファインチューニングで実用レベルに引き上げるフレームワークRo-SLMを提案した。
原題: Ro-SLM: Onboard Small Language Models for Robot Task Planning and Operation Code Generation / Wenhao Wang, Yanyan Li, Long Jiao 他
日本語で読む → - 論文VLA/操作ロボティクス
Goal2Skill: 適応的計画と内省による長期的操作
長期的な操作タスクを高レベルの計画と低レベルの実行に分離した二重システムフレームワークを提案し、記憶と適応的再計画を実現して成功率を大幅に向上させた。
原題: Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection / Zhen Liu, Xinyu Ning, Zhe Hu 他
日本語で読む → - 論文VLA/操作ロボティクス
M²-VLA: 層混合とメタスキルによる汎用操作のための視覚言語モデル強化
視覚言語モデルをロボット操作のバックボーンとして直接活用し、層混合戦略とメタスキルモジュールを導入して、高次意味理解と精密制御のギャップを埋める新しいVLAモデルを提案した。シミュレーションと実環境で有効性とゼロショット汎化を実証した。
原題: $M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills / Siyao Xiao, Yuhong Zhang, Zhifang Liu 他
日本語で読む → - 論文VLAロボティクス
StarVLA: 視覚言語行動モデル開発のためのレゴ風コードベース
VLA研究の断片化を解消するため、モジュール式のバックボーン・アクションヘッド構造と統一評価インターフェースを備えたオープンソースコードベースStarVLAを提案した。
原題: StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing / StarVLA Community
日本語で読む →