論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/21 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA画像認識
抽象から具体へ:視覚言語行動モデルのための行動表現学習
VLAモデルの分布シフト下での性能低下に対し、長期的な行動表現を学習するBehaviorVLAを提案。因果Mambaベースのエンコーダと位相条件付きデコーダで、シミュレーションと実世界で高い成功率とデータ効率を達成。
原題: From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model / Bing Hu, Zaijing Li, Rui Shao 他
日本語で読む → - 論文VLA画像認識
視覚と言語を理解し、人間や環境と対話する機械知能
画像キャプション、視覚対話、対話型指示追従の3つのタスクに対して、新しいアーキテクチャを提案し、性能と効率を向上させた博士論文。
原題: Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments / Van Quang Nguyen
日本語で読む → - 論文VLA画像認識
AtlasVA: 教師なしVLMエージェントのための自己進化型視覚スキルメモリ
VLMエージェントの経験を視覚的に保持する自己進化型メモリフレームワークを提案。空間ヒートマップ、視覚例、テキストスキルの3層で構成し、教師なしで危険・親和性アトラスを進化させて強化学習の報酬として利用する。
原題: AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents / Pan Wang, Yihao Hu, Xiujin Liu 他
日本語で読む → - 論文VLA画像認識
臨床視覚言語モデルにおける医療文脈が意思決定を歪める
胸部X線画像と臨床テキストを用いたタスクで、視覚言語モデルがテキストに過度に依存し、無関係な病歴やプロンプトの変更に影響されやすいことを明らかにした論文。
原題: Medical Context Distorts Decisions in Clinical Vision Language Models / David Restrepo, Ira Ktena, Maria Vakalopoulou 他
日本語で読む → - 論文VLA画像認識
LASAR: 潜在認知マップによる時空間推論の実現
エージェントが空間構造の内部モデルを獲得するよう促すため、二重記憶システムと対照学習を導入し、VLN-CEやVSI-Benchで性能を向上させた。
原題: LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map / Jinzhou Tang, Sidi Liu, Waikit Xiu 他
日本語で読む → - 論文VLA/ベンチマーク画像認識
EPIC-Bench: 視覚言語モデルにおける細粒度な身体化視覚グラウンディングのための知覚中心ベンチマーク
身体化エージェントの視覚基盤として使われる視覚言語モデル(VLM)の、実際の環境での細かい視覚認識能力を評価するベンチマークEPIC-Benchを提案。6.6kの注釈付きデータで、対象位置特定・ナビゲーション・操作の3段階にわたる23タスクを設定し、89以上のVLMを評価した。
原題: EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models / Haozhe Shan, Xiancong Ren, Han Dong 他
日本語で読む → - 論文VLA画像認識
正しい予測、誤解を招く説明:視覚言語モデルの説明の脆弱性について
CLIPベースの視覚言語モデルにおいて、予測を変えずに説明ヒートマップを操作できる攻撃手法X-Shiftを提案し、説明の忠実性と予測の乖離を実証した。
原題: Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations / Narges Babadi, Hadis Karimipour
日本語で読む → - 論文VLA/蒸留画像認識
オフライン意味ガイダンスによる効率的な視覚言語行動ポリシー蒸留
大規模な視覚言語行動(VLA)モデルを軽量な学生ポリシーへ蒸留する際、オフラインの視覚言語モデルから高次意味情報(タスク位相アンカーや多フレーム方向記述)を教師信号として活用するフレームワークVLA-ADを提案。モデルサイズを44倍削減しつつ、教師とほぼ同等の性能を達成。
原題: Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation / Jin Shi, Brady Zhang, Yishun Lu
日本語で読む → - 論文VLA画像認識
UAM: VLA訓練における忘却問題への二経路視点からのアプローチ
VLAモデルがVLMのマルチモーダル能力を失う「身体化税」問題を、生物学的視覚の二経路構造に着想を得て、並列な背側経路(Dorsal Expert)を追加するUAMを提案し、忘却を抑えつつ操作性能を向上させた。
原題: UAM: A Dual-Stream Perspective on Forgetting in VLA Training / Jianke Zhang, Yuanfei Luo, Yucheng Hu 他
日本語で読む → - 論文VLA画像認識
二重ボトルネックの打破:統一マルチモーダルモデルを自己適応型インターリーブ視覚推論器へ進化させる
理解と生成のギャップによるX2Iタスクの二重ボトルネック(注意の絡まりと視覚的洗練不足)を解決するため、指示の複雑さに応じて生成戦略を自律的に切り替えるフレームワークを提案した。
原題: Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners / Qingyang Liu, Bingjie Gao, Canmiao Fu 他
日本語で読む → - 論文VLA画像認識
ForgeVLA: 言語アノテーションなしの連合視覚言語行動学習
分散した視覚・行動ペアから、言語アノテーションやデータ集約なしにVLAモデルを学習する連合学習フレームワークを提案した。
原題: ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations / Yuhao Zhou, Yunpeng Zhu, Yang Zhou 他
日本語で読む → - 論文VLAcs.GR
JoyAI-Image: 統一マルチモーダル理解と生成における空間知能の覚醒
視覚理解・テキストからの画像生成・指示による画像編集を統合したマルチモーダル基盤モデルを提案し、空間認識能力を強化した。
原題: JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation / Lin Song, Wenbo Li, Guoqing Ma 他
日本語で読む → - 論文VLA/強化学習/人間介入ロボティクス
UniSteer: 人間のガイダンスを活用したVLA適応のための統合ノイズステアリング
拡散型VLAモデルの実世界適応を効率化するため、人間の修正行動をノイズ空間の強化学習に統合するフレームワークUniSteerを提案。実機実験で成功率を平均66分で20%から90%に向上させた。
原題: UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation / Junjie Lu, Xinyao Qin, Yuhua Jiang 他
日本語で読む → - 論文VLAロボティクス
PointACT: マルチスケール点群アクション相互作用を備えた視覚言語行動モデル
ロボット操作のための視覚言語行動モデルに、階層的な3D点群表現を統合し、アクション生成時に局所的な幾何学と大域的なシーン構造を考慮できるようにした。LIBEROとRLBenchで性能が向上した。
原題: PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction / Shizhe Chen, Paul Pacaud, Cordelia Schmid
日本語で読む → - 論文VLA画像認識
EARL: 一人称視点インタラクション推論とピクセル接地のための解析誘導型強化学習フレームワーク
一人称視点映像から人間と環境のインタラクションを理解し、テキスト回答とピクセル単位のマスクを生成する強化学習フレームワークを提案した。
原題: EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding / Yuejiao Su, Xinshen Zhang, Zhen Ye 他
日本語で読む → - 論文VLA画像認識
TriRelVLA: 汎化可能な身体化操作のための三者関係構造
視覚言語行動モデルの汎化性を高めるため、物体・手・タスクの三者関係を明示的に表現し、関係性に基づいて行動生成を行うフレームワークを提案した。
原題: TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation / Hanyu Zhou, Chuanhao Ma, Gim Hee Lee
日本語で読む → - 論文VLAロボティクス
動力学ブラインドネスの克服:VLAモデルのための学習不要のペース・経路補正
単一フレーム観測に基づくVLAモデルが動的環境で性能劣化する問題に対し、学習不要で閉形式の推論時補正演算子を提案し、動的環境での成功率を最大28.8%向上させた。
原題: Overcoming Dynamics-Blindness: Training-Free Pace-and-Path Correction for VLA Models / Yanyan Zhang, Chaoda Song, Vikash Singh 他
日本語で読む → - 論文データセット/VLAロボティクス
SABER: 実世界VLA適応のためのスケーラブルな行動ベース身体データセット
小売環境でのロボット操作性能を向上させるため、実際の店舗で100時間以上の自然な映像から構築した高忠実度の行動データセットSABERを提案。頭部カメラと360度カメラを併用し、手先の器用な動作から全身動作までを収録し、VLAモデルの適応に有効なデータを提供する。
原題: SABER: A Scalable Action-Based Embodied Dataset for Real-World VLA Adaptation / Narsimha Menga, Parikshit Sakurikar, Amirreza Rouhi 他
日本語で読む → - 論文VLA解釈可能性ロボティクス
イベント基盤のスパースオートエンコーダによる視覚言語行動ポリシーの解釈
視覚言語行動(VLA)ポリシーの隠れ表現を、行動イベントに基づいてスパースオートエンコーダ(SAE)で分析し、閉ループ行動への因果効果を評価する解釈可能性パイプラインを提案した。
原題: Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies / Xinchen Jin, Aditya Chatterjee, Pranav Kumar 他
日本語で読む → - 論文VLAロボティクス
ProgVLA: 進捗を考慮したロボット操作スキル学習
計算・メモリ制約下で信頼性の高い操作を実現する、タスク進捗の明示表現を持つコンパクトなVLAモデルを提案。長いマルチモーダル系列を効率的に処理し、進捗ヘッドによるRL訓練で長期的タスク成功率を向上させる。
原題: ProgVLA: Progress-Aware Robot Manipulation Skill Learning / Seungsu Kim, Jinyoung Choi, Seungmin Baek 他
日本語で読む → - 論文VLAロボティクス
Being-H0.7: 自己中心視点ビデオからの潜在世界行動モデル
将来のフレーム生成をせずに、潜在空間での未来推論をVLAポリシーに組み込む新しいモデルを提案。訓練時のみ未来情報を使う二重分岐設計により、推論時は現在の観察のみで将来を考慮した行動決定を実現し、シミュレーションと実世界タスクで高性能を達成した。
原題: Being-H0.7: A Latent World-Action Model from Egocentric Videos / Hao Luo, Wanpeng Zhang, Yicheng Feng 他
日本語で読む → - 論文VLA/操作ロボティクス
IntentVLA:曖昧なロボット操作のための短期的意図モデリング
視覚と言語の観察が似ていても異なる行動を取るマルチモーダルな模倣データに対し、過去の視覚観察を短期的意図として符号化し、行動生成を条件付けるVLAフレームワークを提案。曖昧さを評価するベンチマークAliasBenchも導入し、複数の環境で安定性と性能を向上させた。
原題: IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation / Shijie Lian, Bin Yu, Xiaopeng Lin 他
日本語で読む → - 論文VLA/操作ロボティクス
SEVO: 能動照明とデータ中心収集による堅牢なVLA操作のための意味強化仮想観測
VLAポリシーの環境間ロバスト性を向上させるため、RGBカメラストリームを変換するデータ中心アプローチSEVOを提案。照明、背景、妨害物を変えたデータ収集が最も重要で、透明ボトルの把持成功率を大幅に改善した。
原題: SEVO: Semantic-Enhanced Virtual Observation for Robust VLA Manipulation via Active Illumination and Data-Centric Collection / Tianchonghui Fang, Yuan Zhuang, Fei Miao
日本語で読む → - 論文VLA/世界モデル/サーベイロボティクス
ワールドアクションモデル:身体化AIの次のフロンティア
視覚言語行動モデルに世界モデルを統合した「ワールドアクションモデル」の概念を定義し、既存手法を分類・整理したサーベイ論文。
原題: World Action Models: The Next Frontier in Embodied AI / Siyin Wang, Junhao Shi, Zhaoyang Fu 他
日本語で読む → - 論文VLA/失敗検出ロボティクス
軌跡の中のかくれんぼ:VLA実行時監視のための失敗シグナル発見
軌跡レベルのラベルのみから、ステップ単位の注釈なしで失敗を示す行動を特定するフレームワークを提案し、VLAモデルの実行時失敗検出性能を向上させた。
原題: Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring / Seongheon Park, Wendi Li, Changdae Oh 他
日本語で読む → - 論文VLAロボティクス
PriorVLA: 事前知識を保持した視覚言語行動モデルの適応
事前学習済みの視覚言語行動モデルを下流タスクに適応させる際、事前知識を保持しつつ効率的に活用するフレームワークPriorVLAを提案。凍結した事前エキスパートと適応エキスパートを組み合わせ、パラメータ更新を25%に抑えつつ、分布外や少数サンプル設定で高い性能を達成。
原題: PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models / Xinyu Guo, Bin Xie, Wei Chai 他
日本語で読む → - 論文VLA機械学習
BOKBO:VLAポリシーのための較正された棄権層
VLAポリシーの推論時にK個の候補アクションをサンプリングする手法に対し、全てが不安全な場合に実行違反を防ぐための、有限サンプル保証付きの棄権層を提案した。
原題: BOKBO (Best of K Bad Options): Calibrated Abstention for VLA Policies / Anya Singh, Cabrel Happi, Jai Relan 他
日本語で読む → - 論文VLA/汎化ロボティクス
VLA-Pro: 視覚言語行動モデルのためのクロスタスク手続き記憶転送
タスク固有のLoRAアダプタを手続き記憶として保存し、推論時に現在のマルチモーダル文脈に基づいて関連記憶を検索・融合することで、未見タスクへの汎化を向上させるプラグアンドプレイフレームワークを提案した。
原題: VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models / Shengyu Si, Yuanzhuo Lu, Ruimeng Yang 他
日本語で読む → - 論文VLAロボティクス
CSR: 大規模キャッシュ状態表現による無限地平リアルタイムポリシー
大規模LLMをロボットの連続的認知エンジンとして使う際のレイテンシ問題を解決するため、KVキャッシュ再利用を最適化するCSRフレームワークと、非同期状態調整アルゴリズムを提案し、実機で26倍のレイテンシ削減を達成した。
原題: CSR: Infinite-Horizon Real-Time Policies with Massive Cached State Representations / Robin Karlsson, Go Suzui
日本語で読む → - 論文VLAロボティクス
Premover: 指示が完了する前から行動を開始する高速ビジョン・言語・行動制御
ユーザーが指示を入力している待ち時間を利用して事前計算を行う軽量モジュールをVLAポリシーに追加し、成功率を保ちながら応答時間を短縮する手法を提案した。
原題: Premover: Fast Vision-Language-Action Control by Acting Before Instructions Are Complete / Joonha Park, Jiseung Jeong, Taesik Gong
日本語で読む →