論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/失敗回復ロボティクス
馴染みのある未来への回帰:事前生成マイルストーン選択によるVLAポリシーの失敗回復
VLAポリシーが操作中に軌道から逸脱した際、事前に生成した未来状態のマイルストーンを選択して固定目標とすることで、微調整なしに失敗から回復させる手法を提案した。
原題: Back to the Familiar Future: Failure Recovery for VLA Policies via Pre-Imagined Milestone Selection / Suyeon Shin, Juwon Kim, Hyeonbin Park 他
日本語で読む → - 論文VLAロボティクス
MemoryVAM: ロボット操作のためのビデオ行動モデルへの記憶統合
ビデオワールドモデルポリシーにエピソード記憶機構を導入し、長期的な操作タスクで過去の情報を活用できるようにした。LIBERO-Memで成功率を5%から42.5%に向上させた。
原題: MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation / Yuxin Jiang, Chang Yu, Yunuo Chen 他
日本語で読む → - 論文VLAロボティクス
Hy-Embodied-0.5-VLA:視覚言語行動モデルから実世界ロボット学習スタックへ
データ収集からモデル設計、事前学習、微調整、強化学習、実機展開までを含むロボット学習の全スタックを備えたエンドツーエンドシステムを提案した論文。
原題: Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack / He Zhang, Lingzhu Xiang, Haitao Lin 他
日本語で読む → - 論文VLA/強化学習機械学習
ROAD-VLA: 自己蒸留による視覚言語行動モデルのロバストなオンライン適応
ロボット操作のための視覚言語行動モデル(VLA)のオンライン適応を強化するため、行動空間で近位教師を構築する自己蒸留フレームワークを提案。スパースな報酬を密なトークンレベルの信号に変換し、PPOを上回る性能を示した。
原題: ROAD-VLA: Robust Online Adaptation via Self-Distillation for Vision-Language-Action Models / Kejing Wang, Toan Nguyen, Minh Hoang Nguyen 他
日本語で読む → - 論文VLA/スキル獲得ロボティクス
InSight: 操縦可能なVLAによる自己誘導型スキル獲得
VLAモデルにプリミティブ動作レベルでの操縦性を持たせ、デモンストレーションの自動分割とVLMによるデータ収集のフィードバックループを通じて、人間のデモなしに新しい操作スキルを自律的に獲得するフレームワークを提案した。
原題: InSight: Self-Guided Skill Acquisition via Steerable VLAs / Maggie Wang, Lars Osterberg, Stephen Tian 他
日本語で読む → - 論文双腕操作/VLAロボティクス
Co-VLA: 双腕ビジョン・ランゲージ・アクションシステムのための協調認識型構造化アクションモデリング
双腕ロボット操作において、明示的な協調構造をVLAモデルに導入し、共有・残差潜在変数と制御器により信頼性と解釈可能性を向上させるフレームワークを提案した。
原題: Co-VLA: Coordination-Aware Structured Action Modeling for Dual-Arm Vision-Language-Action Systems / Yandong Wang, Jiaqian Yu, Xiongfeng Peng 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動のための連続推論
自然言語はタスクレベルの粒度であり連続制御には不向きなため、VLAポリシーに適した連続思考を導入し、共有ガウス潜在変数として自己検証目的で学習する手法を提案した。
原題: Continuous Reasoning for Vision-Language-Action / Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルにおける宣言的知識と手続き的知識の分離
ロボットの模倣学習において、物体の概念(宣言的知識)と操作方法(手続き的知識)を分離できないことが汎化の妨げとなっている。本論文では、情報の流れを再構成した新しいVLAモデルw²VLAを提案し、モジュール化により知識を分離してゼロショット転移を可能にする。
原題: Decoupling the Declarative from the Procedural in Vision-Language-Action Models / Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu 他
日本語で読む → - 論文安全強化学習/VLAロボティクス
SafeDojo: インタラクティブワールドモデルによるVLAのための安全強化学習
視覚言語行動(VLA)ポリシー向けに、ワールドモデルベースの想像を通じて安全な行動を学習する初のモデルベース安全強化学習フレームワークを提案。
原題: SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model / Kai Tang, Peidong Jia, Zhong Chu 他
日本語で読む → - 論文VLA/シミュレーション/人型ロボットロボティクス
LEGS: 具現化ガウススプラッティング世界における遠隔操作不要のVLA微調整による人型ロコ操作
人型ロボットの移動操作タスク向けに、遠隔操作デモなしで合成データを生成し、VLAポリシーを微調整するハイブリッドシミュレータLEGSを提案。3DGS背景とメッシュ前景を組み合わせ、実機で遠隔操作デモと同等以上の性能を達成した。
原題: LEGS: Fine-Tuning Teleop-Free VLAs for Humanoid Loco-manipulation in an Embodied Gaussian Splatting World / Hojune Kim, Timothy Chen, Jiankai Sun 他
日本語で読む → - 論文VLA/強化学習ロボティクス
Z-1: 視覚言語行動モデルのための効率的強化学習
フローベースのVLAモデルに強化学習を適用し、公開データセットのみで24タスクの成功率を大幅に向上させた。
原題: Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models / Lang Cao, Renhong Chen, Luyi Li 他
日本語で読む → - 論文VLAロボティクス
VLAMotor: エージェントベースのデータ合成による視覚言語行動モデルのテスト駆動型強化
VLAモデルのエッジケースでの失敗を検出し、その失敗を教師データに変換してモデルを微調整するフレームワークVLAMotorを提案した。
原題: VLAMotor: Test-Guided Enhancement of Vision-Language-Action Models via Agent-BasedData Synthesis / Zeqin Liao, Peifan Ren, Zixu Gao 他
日本語で読む → - 論文VLAロボティクス
MuseVLA: ロボット操作のための適応型マルチモーダルセンシング視覚言語行動モデル
RGBカメラだけでは捉えられない温度や音、レーダーなどの多様なセンサ情報を、タスクに応じてツールのように選択・統合できる視覚言語行動モデルを提案した。
原題: MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation / Xingyuming Liu, Ruichun Ma, Heyu Guo 他
日本語で読む → - 論文VLAロボティクス
Efficient-WAM: 低コストな未来想像を備えた10億パラメータの世界行動モデル
未来の視覚予測を圧縮し、推論コストを大幅に削減した世界行動モデルを提案。実機で約100msの低遅延を実現しつつ、制御性能を維持する。
原題: Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination / Jiajun Li, Tiecheng Guo, Yifan Ye 他
日本語で読む → - 論文VLA/移動マニピュレーションロボティクス
グループ別誤差が重要:11自由度移動マニピュレーションのための視覚言語行動モデルのファインチューニング
異種の関節グループを持つ移動マニピュレータ向けにVLAモデルをファインチューニングする際、総MSEが低いチェックポイントが実機で最良とは限らないことを示し、グループ別誤差がより信頼できる選択指標であると主張する論文。
原題: Per-Group Error, Not Total MSE: Fine-Tuning Vision-Language-Action Models for 11-DoF Mobile Manipulation / Pau Montagut Bofi, Mario García Blasco, Tessa Pulli 他
日本語で読む → - 論文VLAロボティクス
クロスエンボディメントロボット操作のための行動事前学習
視覚言語行動モデルにおいて、行動モジュールに事前に運動の事前知識を学習させる2段階トレーニング手法を提案し、クロスエンボディメント設定での性能を向上させた。
原題: Learning Action Priors for Cross-embodiment Robot Manipulation / Dong Jing, Tianqi Zhang, Jiaqi Liu 他
日本語で読む → - 論文VLA画像認識
反射型VLA:文脈内の行動結果がVLAの汎化を促進する
視覚言語行動モデル(VLA)の汎化性能を向上させるため、観察・行動・結果の三つ組を文脈として利用する「Reflective VLA」を提案した。従来の反応型モデルでは捉えられない環境固有の要因を、行動後の変化から推定することで、分布シフト下での成功率を向上させた。
原題: Reflective VLA: In-Context Action Consequences Make VLAs Generalize / Qing Lian, Kent Yu, Lei Zhang
日本語で読む → - 論文VLA画像認識
DeepLatent: 並列潜在視覚推論による画像思考
視覚言語モデルにおいて、画像を中間推論ステップに埋め込む「画像で考える」パラダイムを強化するため、並列に潜在視覚状態を生成するフレームワークDeepLatentを提案した。
原題: DeepLatent: Think with Images via Parallel Latent Visual Reasoning / Dongchen Lu, Zhimo Li, Mao Shu 他
日本語で読む → - 論文VLAAI
視覚言語行動モデルにおける閉ループ神経活性制御
視覚言語行動モデルのテスト時介入を固定係数から適応的な閉ループ制御に変え、タスク成功率と概念制御の安定性を向上させる手法を提案した。
原題: Closed-Loop Neural Activation Control in Vision-Language-Action Models / Abhijith Babu, Ramneet Kaur, Nathaniel D. Bastian 他
日本語で読む → - 論文VLA画像認識
VisualThink-VLA: 視覚的推論による効率的で低遅延な視覚言語行動ポリシー
テキストの思考連鎖に代わる視覚的推論を導入し、行動予測の精度を保ちつつ推論遅延を大幅に削減したVLAポリシーを提案。
原題: VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies / Mingjian Gao, Wenqiao Zhang, Yuqian Yuan 他
日本語で読む → - 論文VLA画像認識
逆動力学学習による視覚言語行動モデルの状態エイリアシング緩和
視覚言語行動モデルにおいて、視覚的に類似した状態が異なる行動を必要とする問題(状態エイリアシング)を、逆動力学学習を補助目的として導入することで緩和する手法を提案した。
原題: Mitigating State Aliasing in Vision-Language-Action Models via Inverse Dynamics Learning / Kyujin Lee, Injae Kim, Jihwan Park 他
日本語で読む → - 論文VLAモデル解析AI
VLA-Trace: 表現と行動のトレーシングによる視覚-言語-行動モデルの診断
VLAモデルがマルチモーダル知識を身体制御に変換する過程を、表現ダイナミクスから因果帰属、行動発現まで段階的に診断するフレームワークを提案し、π0.5とOpenVLAの比較分析からモデル間の適応戦略や制御経路の違いを明らかにした。
原題: VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing / Haoyuan Shi, Xiancong Ren, Yingji Zhang 他
日本語で読む → - 論文VLA/攻撃/転移性画像認識
VLA-Hijack: 視覚的プロプリオセプション乗っ取りによる視覚言語行動モデルへの転移可能なパッチ攻撃
VLAモデルが動作計画前にロボットアームの自己位置を視覚で特定する共通の脆弱性を突き、注意誘導型プロプリオセプション抑制とマルチモーダル注入によりパッチを偽の身体として埋め込む転移可能な攻撃手法を提案した。
原題: VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking / Jiyuan Fu, Kaixun Jiang, Jingkai Jia 他
日本語で読む → - 論文VLA画像認識
GEM: 生成的監視が身体化知能を強化する
視覚言語モデルの事前学習に深度マップ生成タスクを統合し、身体化環境での空間・物理理解を向上させるGEMを提案。大規模データセットGEM-4Mを公開し、シミュレーションと実世界で高い性能を実証した。
原題: GEM: Generative Supervision Helps Embodied Intelligence / Ruowen Zhao, Bangguo Li, Zuyan Liu 他
日本語で読む → - 論文VLA/量子化画像認識
HoloQ-VLA: 視覚言語行動モデルの一様W4A4量子化
視覚言語行動モデルを、拡散アクションヘッドを含む全体を一様に4ビット量子化する訓練不要のフレームワークを提案し、性能を維持しつつメモリを大幅削減した。
原題: HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models / Xinyu Wang, Mingze Li, Sicheng Lyu 他
日本語で読む → - 論文VLAAI
PEAM: Minecraftにおける経験の対比的内部化によるパラメトリック具現化エージェントメモリ
Minecraft環境で、エージェントの記憶を推論時の検索からパラメータ内蔵スキルへ変換するフレームワークを提案。失敗と修正のペアを学習し、忘却を防ぎながら自己進化する。
原題: PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft / Yuchen Guo, Junli Gong, Weicheng Wang 他
日本語で読む → - 論文VLA/ロバスト性cs.CR
能力とロバスト性は両立できない:視覚言語行動モデルに対する情報理論的限界
視覚言語行動モデル(VLA)は、わずかな敵対的摂動で成功率が劇的に低下することを示し、その能力とロバスト性のトレードオフに理論的下限が存在することを情報理論的に証明した。
原題: Capability and Robustness Cannot Both Be Free: An Information-Theoretic Bound for Vision-Language-Action Models / Jianwei Tai
日本語で読む → - 論文VLA画像認識
VLA初期化のためのVLM表現の再考
VLAモデルの初期化に使う事前学習済みVLM表現の設計を、能力別のVQA教師信号・パラメータ更新戦略・ロボットデータ事前学習の3軸で分析し、元のVLM表現の保持が重要で、LoRAベースの段階的学習が最良であることを示した。
原題: Rethinking VLM Representation for VLA Initialization / Weifeng Lin, Siyuan Huang, Hao Li 他
日本語で読む → - 論文VLA画像認識
LLaVA-OneVision-2:次世代知覚知能に向けて
動画を圧縮ビットストリームとして扱い、適応的な時間グループと空間的証拠の選択によりトークン予算を効率的に配分する新しい視覚言語モデルを提案。大規模なオープン監視データで学習し、動画理解や時間的・空間的接地、操作トレース推論などで高性能を達成。
原題: LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence / Xiang An, Yin Xie, Feilong Tang 他
日本語で読む → - 論文VLA画像認識
OmniEgo-R^2: CVPR 2026 EgoCrossチャレンジのためのルーティング推論フレームワーク
手術、産業、エクストリームスポーツ、動物視点など複数領域の自己中心視点動画推論を扱うEgoCrossチャレンジで、時間的証拠の正規化や領域非依存の能力ルーティング等を備えた統合推論パイプラインOmniEgo-R^2を提案し、2位を獲得した。
原題: OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026 / Zixu Li, Zhiwei Chen, Zhiheng Fu 他
日本語で読む →