論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/19 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA機械学習
政策不確実性を活用した効率的なワールドモデルベースVLA政策最適化のための優先ロールアウト
VLA政策の強化学習において、政策の不確実性が高い状態に優先的にモデルロールアウトを割り当てる軽量サンプリング層U-GROWを提案し、シミュレーションと実機のマニピュレーションタスクで効率と有効性を示した。
原題: Prioritized Rollouts for Efficient World Model-based Vision-Language-Action Policy Optimization / Yifei Sheng, Haoxiang Ren, Zhilong Zhang 他
日本語で読む → - 論文VLAロボティクス
H-VLA:キーアクション推論と運動計画を統合行動空間で行う階層型視覚-言語-行動モデル
高レベルのキーアクション推論と低レベルの運動生成を分離し、統一されたカメラ中心行動空間でロボット操作を学習する階層型VLAフレームワークを提案。
原題: H-VLA: Hierarchical Vision-Language-Action Model with Key-Action Reasoning and Motion Planning in a Unified Action Space / Xiongfeng Peng, Lu Xu, Yandong Wang 他
日本語で読む → - 論文VLAロボティクス
SynthDemo-RL:LLM誘導合成デモでVLA適応のゼロ報酬障壁を突破
LLM教師が合成デモを生成し、VLA学生をSFTで蒸留後PPOで微調整することで、人間のデモなしにスパース報酬タスクの成功率を大幅に改善する手法を提案。
原題: SynthDemo-RL: Breaking the Zero-Reward Barrier in VLA Adaptation with LLM-Guided Synthetic Demonstrations / Hiroaki Kingetsu, Hiroaki Kurihara, Kaoru Yokoo 他
日本語で読む → - 論文VLAロボティクス
必要なときに反応せよ:VLAポリシーのためのイベント駆動型非同期推論
VLAモデルの推論間隔をシーンの変化に応じて動的に調整するイベント駆動型非同期推論を提案し、動作の一貫性と即応性を両立させて実世界タスクで高い成功率を達成した。
原題: React When You Need To: Event-Triggered Asynchronous Inference for VLA Policies / Yansong Wu, Huaqing Li, Tianding Hou 他
日本語で読む → - 論文VLAロボティクス
AtomEgo: 一人称視点ロボット統合による身体性基盤モデル事前学習の探求
約2,659時間の一人称視点人間データとロボットデータを組み合わせ、身体性基盤モデルの事前学習における効果的な統合手法を体系的に検討した研究。
原題: AtomEgo: Exploring Ego-Robot Integration for Embodied Foundation Model Pretraining / Di Wu, Dongchen Zheng, Junhe Sheng 他
日本語で読む → - 論文VLAロボティクス
FAN: 視覚-言語-行動モデルの継続適応のための先見的行動正規化
VLAモデルの継続学習において、行動の正規化統計を較正セットから一度だけ推定して固定するFANを提案し、単腕・両腕操作の実タスクで高い性能と安定性を示した。
原題: FAN: Foresight Action Normalization for Continual Adaptation of Vision-Language-Action Models / Yijun Hong, Jiarun Zhu, Xiaoquan Sun 他
日本語で読む → - 論文VLAロボティクス
FOCAL-VLA:サブタスク誘導型幾何蒸留と暗黙的ワールドモデリングによる視覚言語行動モデル
サブタスクに関連する領域に絞って幾何知識を蒸留し、将来の3D変化を暗黙的にモデル化することで、精密かつ長期的なロボット操作を可能にするVLAフレームワークを提案。
原題: FOCAL-VLA: Subtask-Guided Geometry Distillation and Implicit World Modeling for Vision-Language-Action Models / Zhiyuan Gao, Di Wen, Yanxiang Zhan 他
日本語で読む → - 論文VLA/安全制御ロボティクス
VLPSA: 学習済みポリシーの全身安全を実現する視覚言語ポアソン安全行動
VLAポリシーのための安全フィルタリング手法VLPSAを提案し、認識データからポアソン安全関数をオンライン合成してCBF-QPで全身と把持物体の衝突回避を実現、再学習なしで安全性を大幅に向上させた。
原題: VLPSA: Vision-Language-Poisson-Safe Actions for Full-Body Safety of Learned Policies / Meg Wilkinson, Emily Fourney, Joel W. Burdick 他
日本語で読む → - 論文VLAロボティクス
ノイズ空間軌道最適化によるワンステップ生成ポリシーの安全なリアルタイム誘導
ワンステップ生成ポリシーの入力ノイズ空間で軌道最適化を行い、衝突回避などの制約を満たしつつリアルタイムにポリシーを誘導する手法INSPOを提案。
原題: Safe Real-Time Policy Steering via Noise-Space Trajectory Optimization for One-Step Generative Policies / Qingyi Chen, Joseph Ruan, Zachary Kingston
日本語で読む → - 論文VLAロボティクス
VLA-Scope: 視覚言語行動モデルのためのシフト対応失敗予測
VLAモデルの分布シフト下での実行失敗を、入力シフトの検出と実行履歴を組み合わせて予測する2段階フレームワークを提案。
原題: VLA-Scope: Shift-Aware Failure Prediction for Vision-Language-Action Models / Kaiwen Zhu, Dongfang Liu, Liangkai Liu
日本語で読む → - 論文VLAロボティクス
少ないステップでより良い行動:VLAポリシーのフローマッチング推論の再考
フローマッチングベースのVLAポリシーにおいて、積分ステップ数を増やす代わりに、軽量なTransformerで終点補正を行うことで、推論コストを削減しつつ成功率を向上させる手法を提案。
原題: Fewer Steps, Better Actions: Rethinking Flow-Matching Inference for VLA Policies / Zhipeng Tang, Xinda Chen, Weining Rao 他
日本語で読む → - 論文VLAロボティクス
CommitFlow: 長期的ロボットマニピュレーションVLA実行のための意味的コミットメント検証と局所修正
VLAポリシーの長期実行において、各段階で必要な物理的状態が満たされる前に次の段階へ進んでしまう問題に対し、意味的コミットメントの監視と局所修正を組み合わせた閉ループ実行フレームワークを提案し、RoboTwin 2.0でベースポリシーを22.7%上回る成功率を達成した。
原題: CommitFlow: Semantic Commitment Verification and Local Correction for Long-Horizon Robot Manipulation VLA Execution / Zixiang Zhao, Yansong Feng, Yang Yang 他
日本語で読む → - 論文VLAロボティクス
GALA: 幾何情報を考慮した潜在行動モデリングによるマルチ身体VLA事前学習
エンドエフェクタの3D幾何運動を統合した潜在行動表現を提案し、多様な身体のデータから細粒度の動作を捉えるVLAモデル事前学習を実現した。
原題: GALA: Geometry-Aware Latent Action Modeling for Vision-Language-Action Model Pretraining across Embodiments / Yichen Liu, Puzhen Yuan, Xiang Zhu 他
日本語で読む → - 論文VLA画像認識
PRIME: VLAモデルにおける状況記憶埋め込みによる知覚フィードバック
自動運転VLAモデルに、過去の知覚・推論・ナビ目標・予測行動を集約した状況記憶で知覚クエリを条件付けるフィードバック機構を導入し、Bench2DriveでSOTA性能を達成した。
原題: PRIME: Perception Feedback with Situational Memory Embeddings in VLA Models / Erik Deinzer, Naya Baslan, Luca Paparusso 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動ポリシー間における成果条件付きエンドエフェクタ幾何
4つのVLAポリシーによる15,000回のLIBEROロールアウトを解析し、両方成功したペアは片方のみ成功したペアよりエンドエフェクタ軌道が近いことを示した。
原題: Outcome-Conditioned End-Effector Geometry Across Vision-Language-Action Policies / Xingyu Lin, Zhuang Li, Zhongrun Wu 他
日本語で読む → - 論文VLAロボティクス
SafeStage: 視覚言語条件付きロボットマニピュレーションの実行前・実行中・実行後の安全性評価
視覚言語条件付きロボット操作の安全性を、タスク実行の前・中・後の3段階で評価するベンチマークSafeStageを提案し、VLAポリシーがタスク成功と安全性違反を同時に起こしうることを示した。
原題: SafeStage: Evaluating Safety Before, During, and After Vision-Language-Conditioned Robot Manipulation / Jinzhu Luo, Qi Zhang, Wei Wang 他
日本語で読む → - 論文VLA画像認識
MT-WAM: 予測表現を行動生成へ再方向づける映像拡散トランスフォーマー
映像拡散トランスフォーマーの単一順伝播表現に、将来の2D点軌跡と視覚特徴の補助監督を加え、行動生成に必要な動態・空間構造を強調する手法を提案。LIBEROで98.2%、LIBERO-Plusで73.7%の成功率を達成した。
原題: MT-WAM: Reorienting the One-Pass Predictive Representation Toward Action Generation / Yiguang Yang, Jiankun Peng, Xiaoming Wang 他
日本語で読む → - 論文VLAロボティクス
VT-Bridge: 軽量残差適応で事前学習済み基盤VLAをVTLAへ橋渡し
事前学習済みVLAモデルに軽量な残差アダプタを追加するだけで、触覚情報を活用した接触の多いマニピュレーションを少ないデータで実現する手法を提案。
原題: VT-Bridge: Bridging Pretrained Foundation VLAs to VTLAs via Lightweight Residual Adaptation / Yansong Wu, Tuo Yang, Rongping Zhao 他
日本語で読む → - 論文VLAロボティクス
DPed-VLN:動的歩行者環境における社会的規範に沿った視覚言語ナビゲーションのベンチマーク
歩行者が動く環境での視覚言語ナビゲーションを評価するHabitat 3.0ベンチマークを構築し、歩行者を考慮した強化学習・模倣学習ポリシーDPetを提案した。
原題: DPed-VLN: A Benchmark for Socially Compliant Vision-and-Language Navigation in Dynamic Pedestrian Environments / Haojie Dai, Xiangyi Wang, Liuyi Wang 他
日本語で読む → - 論文VLAロボティクス
行動類似性監督による潜在行動モデルの異機体間転移の改善
潜在行動モデルにおいて、真の行動を予測する代わりに行動間の類似性を監督信号として用いることで、異なるロボット間での知識転移性能を向上させる手法を提案した。
原題: Improving Cross-embodiment Transfer in Latent Action Models with Action-Similarity Supervision / Maxime Alvarez, Renzo Caballero, Tatsuya Matsushima 他
日本語で読む → - 論文VLAロボティクス
VLMベースの目標探索における空間・意味的不確かさ:探索と識別のバランス
VLMを用いた目標探索で、位置の空間的不確かさと目標同一性の意味的不確かさを分離して扱い、情報利得に基づく計画で探索と識別のトレードオフを最適化する手法を提案した。
原題: Spatial-Semantic Uncertainty in VLM-Based Target Search: Balancing Exploration and Identification / Alkesh K. Srivastava, Jonathan Diller, Vijay Kumar 他
日本語で読む → - 論文VLAロボティクス
オフライン隠れ状態蒸留による強剪定VLAモデルの復元
幅方向の構造的剪定で縮小したVLAモデルを、教師モデルの隠れ状態をオフラインで蒸留することで、オンライン強化学習なしに性能を大幅に回復させる手法を提案。
原題: Recovering Aggressively Pruned Vision-Language-Action Models with Offline Hidden-State Distillation / Chiyoung Kim, Sanghyuk Roy Choi, Minhyeok Lee
日本語で読む → - 論文VLAロボティクス
ただでコンプライアンスを:双方向テレオペレーションによる識別可能なインピーダンスの学習
双方向テレオペレーションで操作者の意図する平衡点と剛性を分離し、追加アノテーションなしで方向依存のコンプライアンスラベルを生成、VLAに姿勢と共に剛性を出力させる手法を提案。
原題: Compliance for Free: Learning Identifiable Impedance via Bilateral Teleoperation / Harsha Guda, Adrià Colomé, Carme Torras
日本語で読む → - 論文VLAロボティクス
StageGuard: エージェント蒸留による長期的ロボットタスクの段階遷移学習
大規模VLMの推論を蒸留した軽量モデルで、長期ロボットタスクにおけるサブタスク完了判定とスキル切替を高精度かつ低遅延で行うフレームワークを提案。
原題: StageGuard: Learning Stage Transitions for Long-Horizon Robot Tasks via Agentic Distillation / Jinbang Huang, Yuanzhao Hu, Zhiyuan Li 他
日本語で読む → - 論文VLAロボティクス
EmbodiedMind: 効率的な身体性知能のための適応的データキュレーションとプレフィックス木強化学習
身体性基盤モデルの学習において、低情報サンプルの除去、タスク間のバランス調整、長期的計画におけるクレジット割り当て問題を解決するため、RSFT、IR-GRPO、Trie-GRPOを組み合わせた効率的な訓練パラダイムを提案。
原題: EmbodiedMind: Adaptive Data Curation and Prefix-Tree Reinforcement Learning for Efficient Embodied Intelligence / Feifan Wang, Zongbing Zhang, Yu Zhang 他
日本語で読む → - 論文VLAロボティクス
VA-Bench:視覚実演・能動的知覚・メートル制御による身体性空間知能の評価
RGB実演から手順を学び、カメラ視点を能動的に選び、メートル単位の動作指令を出してフィードバックで修正する「観察-推論-行動-修正」ループを評価するベンチマークVA-Benchを提案。最良モデルでもタスク成功率は約54%にとどまることを示した。
原題: VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control / Zhongbo Zhang, Jiayi Jin, Yifan Wang 他
日本語で読む → - 論文VLA画像認識
パッチ除去後も持続する視覚言語行動ポリシーへの敵対的影響
VLAポリシーへの敵対的パッチが除去後も持続する状態効果を引き起こすことを示し、状態復元プロトコルで即時影響と持続影響を分離して評価した。
原題: Beyond Patch Removal: Persistent Adversarial Effects in Vision-Language-Action Policies / Enhao Wu, Fusen Guo, Yuxin Cao 他
日本語で読む → - 論文VLAAI
意図から行動へ:車両音声コマンド認可におけるLLM安全性のベンチマーク
車載音声アシスタントにおけるLLMの実行前認可判断を評価する202シナリオのベンチマークを提案し、7クラス分類での意思決定整合性と安全性エラーを測定した。
原題: From Intent to Action: Benchmarking LLM Safety in Vehicle Voice Command Authorization / Diba Afroze, Xingli Zhang, Yazhou Tu 他
日本語で読む → - 論文VLA機械学習
Uni-LaDiR:潜在拡散がマルチモーダル推論を統合する
異なるモダリティの推論過程を共有潜在空間のトークンに変換し、拡散モデルで次の思考ブロックを予測する統合推論フレームワークを提案。視覚言語タスクとロボット操作タスクで性能を向上させた。
原題: Uni-LaDiR: Latent Diffusion Unifies Multimodal Reasoning / Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang 他
日本語で読む → - 論文VLAロボティクス
GeoAAC: VLAポリシーのノイズ除去軌道の幾何に基づく適応的アクションチャンキング
フローベースVLAポリシーにおいて、ノイズ除去軌道の幾何情報から予測信頼性を推定し、追加学習なしでアクションホライズンを適応的に決定する手法を提案。シミュレーションと実機で成功率を改善。
原題: GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies / Xin Chen, Sen Chen, Yujuan Ding 他
日本語で読む →