論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/4 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/操作ロボティクス
AffordanceVLA:アフォーダンス認識による行動生成を強化する視覚言語行動モデル
視覚言語モデルとロボット制御の構造的ミスマッチを解消するため、アフォーダンス予測を中間表現として導入し、物体の接地・2D位置特定・3D幾何推論を段階的に行う統一フレームワークを提案した。
原題: AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding / Qize Yu, Jiadi You, Yuran Wang 他
日本語で読む → - 論文VLAロボティクス
ActiveMimic: 能動的知覚を備えた自己中心視点ビデオ事前学習
自己中心視点の人間ビデオから能動的知覚(カメラ動作)を活用してロボット操作を事前学習するフレームワークを提案し、ロボットデータ事前学習と同等の性能を実現した。
原題: ActiveMimic: Egocentric Video Pretraining with Active Perception / Xingyao Lin, Guojin Zhong, Tianyi Lu 他
日本語で読む → - 論文VLA機械学習
Flash-WAM: モダリティ認識蒸留によるワールドアクションモデルの高速化
ビデオとロボット動作を同時生成するワールドアクションモデルを、モダリティごとに適切な蒸留手法を適用して単一ステップ推論に圧縮し、リアルタイム制御を可能にした。
原題: Flash-WAM: Modality-Aware Distillation for World Action Models / Arman Akbari, Ci Zhang, Arash Akbari 他
日本語で読む → - 論文VLA画像認識
3DThinkVLA: 潜在3D事前知識を3D思考誘導共学習で視覚言語行動モデルに付与する
視覚言語行動(VLA)モデルに、3D幾何知覚と3D空間推論を分離して潜在空間に注入する共学習フレームワークを提案し、推論時の追加テキスト生成なしに暗黙的な3D空間推論を可能にする。
原題: 3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training / Jiaxin Shi, Xidong Zhang, Fucai Zhu 他
日本語で読む → - 論文VLAロボティクス
PointAction: 3D点群をロボット制御の普遍的な行動表現として用いる
ビデオ生成モデルを基盤に、将来のRGBフレームと動的3D点群を同時予測し、その点群の動きを行動デコーダでロボットの実行可能な行動に変換するフレームワークを提案。RGBのみの行動基盤の曖昧さを低減し、限られた行動教師データで異なるタスクやロボットへの転移を実現。
原題: PointAction: 3D Points as Universal Action Representations for Robot Control / Mutian Tong, Han Jiang, Qiao Feng 他
日本語で読む → - 論文継続学習/VLAロボティクス
PHASER: 位相認識と意味的経験再生による視覚言語行動モデルの継続学習
視覚言語行動モデルの継続学習における破滅的忘却を防ぐため、操作軌道の位相(サブスキル)に注目した経験再生手法PHASERを提案。位相ごとのメモリ割り当てと忘却リスクに基づく動的優先付けで、LIBEROベンチマークで最大31%の成功率向上を達成した。
原題: PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models / Ziyang Chen, Shaoguang Wang, Weiyu Guo 他
日本語で読む → - 論文VLA画像認識
シーンへのダイブ:焦点プラン生成による視覚言語意思決定における知覚ボトルネックの打破
ロボット操作やナビゲーションなどの視覚言語意思決定タスクにおいて、VLMとVLAの知覚ボトルネック(視覚的幻覚)を軽減するため、粗から精への焦点プラン生成法SceneDiverを提案した。
原題: Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation / Boyuan Xiao, Bohong Chen, Yumeng Li 他
日本語で読む → - 論文VLA/テスト生成cs.SE
MANGO: 視覚言語行動モデルのための自動マルチエージェントテストオラクル生成
VLAロボットのテスト用に、自然言語のタスク記述から細粒度のオラクルを自動生成するマルチエージェントフレームワークを提案。
原題: MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models / Pablo Valle, Shaukat Ali, Aitor Arrieta 他
日本語で読む → - 論文VLA/強化学習ロボティクス
本能を信じよ:視覚言語行動モデルのための信頼度駆動型テスト時強化学習
視覚言語行動モデル(VLA)が内部の評価能力を持ち、高信頼度の軌道が成功しやすいことを利用し、外部報酬なしで自己改善するテスト時強化学習フレームワークT^2VLAを提案した。
原題: Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models / Siyao Chen, Jiakang Yuan, Jiaxin Wang 他
日本語で読む → - 論文ナビゲーション/VLA/強化学習ロボティクス
専門家ガイドGRPOによる意図に正確に沿ったVLA空中ナビゲーション
VLAモデルを用いたUAVナビゲーションにおいて、専門家データで強化した強化学習フレームワークEG-GRPOを提案し、複雑な指示への意図整合性と成功率を大幅に向上させた。
原題: Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO / Tianyang Chen, Wenjun Li, Xin zhou 他
日本語で読む → - 論文VLA/操作ロボティクス
ProbeAct: プローブ誘導による訓練不要の視覚言語行動モデル障害回復
視覚言語行動モデル(VLA)の失敗を検出・回復する訓練不要の介入フレームワークを提案。隠れ状態プローブと運動状態機械、制御障壁関数フィルタを組み合わせ、追加学習なしで成功率を向上させる。
原題: ProbeAct: Probe-Guided Training-Free Failure Recovery in Vision-Language-Action Models / Fan Zhang, Seongbin Park, Baharan Mirzasoleiman 他
日本語で読む → - 論文VLA/シミュレーションロボティクス
生き残るものを監視せよ:合成ロボット動画からの幾何学誘導VLA適応
合成ロボット動画から幾何学情報(2Dエンドエフェクタ経路点)を抽出し、VLAモデルの視覚バックボーンを補助タスクで調整する手法を提案。制御は実デモのみで学習し、幾何学情報で表現の崩壊を防ぐ。
原題: Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos / Danze Chen, Yanzhe Chen, Qiming Huang 他
日本語で読む → - 論文社会的ナビゲーション/VLAロボティクス
見たものに基づいて行動する:視覚言語行動モデルにおける安全な社会的ナビゲーションの実現
事前学習済みの視覚言語行動(VLA)モデルが歩行者と障害物の区別や衝突予測信号を内部表現に持つことを利用し、注釈不要の2段階ポストトレーニング手法SALSAを提案。反事実的なシーンと将来リスクの教師信号で行動生成と潜在表現を整合させ、近接衝突を86.4%削減した。
原題: Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models / Qingzi Wang, Xiyang Wu, Guangyao Shi 他
日本語で読む → - 論文VLAロボティクス
幾何学的行動モデルによるロボットポリシー学習
事前学習済みの幾何基盤モデルを共有基盤として、言語条件付きの未来予測と行動生成を統合した操作ポリシーを提案。シミュレーションと実機で高精度・高速・軽量を実証。
原題: Geometric Action Model for Robot Policy Learning / Jisang Han, Seonghu Jeon, Jaewoo Jung 他
日本語で読む → - 論文VLA/強化学習ロボティクス
FlowPRO: フローマッチングVLAの報酬なし強化学習による微調整 - 近接化選好最適化を用いて
フローマッチング型VLAモデルを実ロボットに展開可能なポリシーへと微調整する、報酬なしのオフライン強化学習フレームワークFlowPROを提案。選好最適化に近接正則化を導入し、介入・ロールバックデータから高品質なポリシーを学習する。
原題: FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization / Yihao Wu, He Zhang, Junbo Tan 他
日本語で読む → - 論文VLAロボティクス
異種ロボット学習のための統合運動-行動モデリング
3D物体運動軌跡を共通インターフェースとして用い、視覚運動制御と力学モデリングを統合するモデルを提案。マスク生成目的と対照学習により、多様なデータソースからのマルチタスク事前学習と、複数の推論モードでの適応を実現する。
原題: Unified Motion-Action Modeling for Heterogeneous Robot Learning / Yunhao Cao, Shitong Liu, Chao Feng 他
日本語で読む → - 論文VLAロボティクス
クロスエンボディメントロボット操作のための行動事前学習
視覚言語行動モデルにおいて、行動モジュールに事前に運動の事前知識を学習させる2段階トレーニング手法を提案し、クロスエンボディメント設定での性能を向上させた。
原題: Learning Action Priors for Cross-embodiment Robot Manipulation / Dong Jing, Tianqi Zhang, Jiaqi Liu 他
日本語で読む → - 論文VLAロボティクス
GeoAlign: セマンティクスを超えた状態誘導による空間的位置合わせをVLAモデルに導入
VLAモデルにロボットの状態情報を利用した幾何学的特徴の位置合わせ機構を導入し、操作タスクの成功率を向上させた。
原題: GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models / Yizhi Chen, Zhanxiang Cao, Xinyi Peng 他
日本語で読む → - 論文VLA/モデル圧縮ロボティクス
視覚言語行動モデルにおけるパラメータ冗長性の再考:VLMからVLAへの適応からの洞察
VLAモデルのパラメータ削減時に性能劣化が不可避とされる従来の見解に疑問を呈し、適応時のパラメータ変化の空間分布を解析し、モジュールごとの重要度に基づくマルチモジュール同時刈り込み手法を提案した。
原題: Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation / Fengnian Zhang, Tao Huang, Siyu Xu 他
日本語で読む → - 論文VLAロボティクス
LaWAM: 効率的なダイナミクス認識ロボットポリシーのための潜在世界行動モデル
ロボットの行動がシーンをどう変えるかを予測する潜在空間の世界モデルを導入し、ピクセル単位の動画生成を避けつつ、高成功率と低遅延を実現した。
原題: LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies / Jialei Chen, Kai Wang, Kang Chen 他
日本語で読む → - 論文VLA画像認識
反射型VLA:文脈内の行動結果がVLAの汎化を促進する
視覚言語行動モデル(VLA)の汎化性能を向上させるため、観察・行動・結果の三つ組を文脈として利用する「Reflective VLA」を提案した。従来の反応型モデルでは捉えられない環境固有の要因を、行動後の変化から推定することで、分布シフト下での成功率を向上させた。
原題: Reflective VLA: In-Context Action Consequences Make VLAs Generalize / Qing Lian, Kent Yu, Lei Zhang
日本語で読む → - 論文VLA/継続学習ロボティクス
RECALL: 視覚言語行動モデルにおける能動的生涯学習のための回復経験収集
この論文は、視覚言語行動モデルを能動的かつ継続的に学習させる手法を提案し、不確実性に基づくデータ収集が受動的な模倣学習よりも効率的であることを示す一方、回復データのみでの微調整が破滅的忘却を引き起こすことを明らかにし、継続学習技術の評価を行っています。
原題: RECALL: Recovery Experience Collection for Active Lifelong Learning in Vision-Language-Action Models / Ulas Berk Karli, Tesca Fitzgerald
日本語で読む → - 論文VLA画像認識
ImageWAM: 世界行動モデルは本当にビデオ生成が必要か、それとも画像編集だけで十分か?
ビデオ生成に依存する世界行動モデル(WAM)の課題を指摘し、代わりに画像編集モデルを利用したImageWAMを提案。推論時に画像編集のKVキャッシュを行動予測に活用し、計算コストを大幅削減しつつ性能を向上させた。
原題: ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing? / Yuyang Zhang, Wenyao Zhang, Zekun Qi 他
日本語で読む → - 論文VLA画像認識
動作焦点の潜在アクションによる人間のエゴビデオからのクロスエンボディVLA訓練
ラベルなしの人間のエゴビデオから動作の潜在アクションを抽出し、ロボットのVLAモデルを訓練する手法を提案。シミュレーションと実環境で、わずか50トラジェクトリの適応で大規模データセットで訓練した最先端モデルと同等の性能を達成。
原題: Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos / Runze Xu, Yiluo Zhang, Jian Wang 他
日本語で読む → - 論文VLA/触覚ロボティクス
TAP-VLA: 視覚言語行動モデルのための触覚アノテーションプロンプティング
触覚情報を視覚的なオーバーレイとしてVLAモデルに統合し、接触を伴う操作タスクの成功率を大幅に向上させるフレームワークを提案した。
原題: TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models / Mark Van der Merwe, Mohamad Louai Shehab, Jayjun Lee 他
日本語で読む → - 論文VLAロボティクス
HoloAgent-0: 3D空間メモリを備えた統合具現化エージェントフレームワーク
言語指示を実行可能なスキルグラフに変換し、3D空間メモリとロボットスキルを統合して実ロボットで閉ループ実行を実現する統一エージェントフレームワークを提案した。
原題: HoloAgent-0: A Unified Embodied Agent Framework with 3D Spatial Memory / Xiaolin Zhou, Liu Liu, Tingyang Xiao 他
日本語で読む → - 論文VLA/失敗予測ロボティクス
Tri-Info: 情報理論によるVLAモデルの汎用的で解釈可能な失敗予測
VLAモデルの動作を情報理論の観点から分析し、成功と失敗で異なる情報的シグネチャを捉えるTri-Info信号を提案。再学習なしでアーキテクチャや環境をまたいで失敗を検出でき、実世界タスクでも高い精度を達成。
原題: Tri-Info: Generalizable, Interpretable Failure Prediction for VLA Models via Information Theory / Jinghan Yang, Yunchao Zhang, Wang Yuan 他
日本語で読む → - 論文VLA/スキル獲得ロボティクス
InSight: 操縦可能なVLAによる自己誘導型スキル獲得
VLAモデルにプリミティブ動作レベルでの操縦性を持たせ、デモンストレーションの自動分割とVLMによるデータ収集のフィードバックループを通じて、人間のデモなしに新しい操作スキルを自律的に獲得するフレームワークを提案した。
原題: InSight: Self-Guided Skill Acquisition via Steerable VLAs / Maggie Wang, Lars Osterberg, Stephen Tian 他
日本語で読む → - 論文VLAロボティクス
MemoryVAM: ロボット操作のためのビデオ行動モデルへの記憶統合
ビデオワールドモデルポリシーにエピソード記憶機構を導入し、長期的な操作タスクで過去の情報を活用できるようにした。LIBERO-Memで成功率を5%から42.5%に向上させた。
原題: MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation / Yuxin Jiang, Chang Yu, Yunuo Chen 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルにおける宣言的知識と手続き的知識の分離
ロボットの模倣学習において、物体の概念(宣言的知識)と操作方法(手続き的知識)を分離できないことが汎化の妨げとなっている。本論文では、情報の流れを再構成した新しいVLAモデルw²VLAを提案し、モジュール化により知識を分離してゼロショット転移を可能にする。
原題: Decoupling the Declarative from the Procedural in Vision-Language-Action Models / Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu 他
日本語で読む →