論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/幾何理解画像認識
幾何基盤モデルが視覚言語行動モデルに与える影響の理解
視覚言語行動モデル(VLA)と3D再構成のための幾何基盤モデル(GFM)の統合について、VLAの幾何理解の欠如を線形プロービングで定量化し、幾何情報を注入する3つのアーキテクチャを比較、さらに非アーキテクチャ的選択の影響を分析した。
原題: Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models / Yurou Yang, Muyuan Lin, Roberto Martin-Martin 他
日本語で読む → - 論文VLA/行動監視ロボティクス
VLAの失敗の仕方はアーキテクチャごとに異なる:ブラックボックス行動監視が明らかにする構造特異的な失敗シグネチャ
VLAアーキテクチャ(VQ-BeT、Diffusion Policy、ACT)がモーターコマンドレベルで異なる失敗パターンを示すことを発見し、アーキテクチャに合わせた監視手法の選択が重要であることを示した。
原題: How VLAs Fail Differently: Black-Box Action Monitoring Reveals Architecture-Specific Failure Signatures / Krishnam Gupta
日本語で読む → - 論文VLAAI
視点計画:VLMによる3D空間の能動的推論と計画
VLMがカメラ移動による視点変化を予測し、複数ステップの計画で目標視点を特定できるかを検証し、その能力を高める反復的自己探索と視点グラフ蒸留の枠組みを提案した。
原題: Planning with the Views / Kangrui Wang, Linjie Li, Zhengyuan Yang 他
日本語で読む → - 論文VLAロボティクス
X-DiffVLA: クロスエンボディ拡散行動ヘッドを備えた視覚言語行動モデル
異なるエンドエフェクタを持つロボット間で知識を転移できる拡散ベースのVLAモデルを提案し、エンボディフォーシングと形態学的ツリー拡散により性能を向上させた。
原題: X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models / Boyu Li, Chaoyi Xu, Haoqi Yuan 他
日本語で読む → - 論文VLA/マルチエージェント/実験室自動化ロボティクス
BioProVLA-Agent: 生物学的実験室操作のための手頃でプロトコル駆動・視覚強化・閉ループ推論可能なVLA搭載具身マルチエージェントシステム
生物実験室の自動化を目的に、プロトコルを入力として、LLMによるサブタスク分解、VLMによる状態検証、VLAによる実行を閉ループで行う低コストなマルチエージェントシステムを提案した。透明な実験器具や反射などの視覚的擾乱に強いオンライン拡張手法も導入している。
原題: BioProVLA-Agent: An Affordable, Protocol-Driven, Vision-Enhanced VLA-Enabled Embodied Multi-Agent System with Closed-Loop-Capable Reasoning for Biological Laboratory Manipulation / Zhaohui Du, Zhe Wang, Dongzhan Zhou 他
日本語で読む → - 論文VLA/操作ロボティクス
RLDX-1 技術報告書
多機能な汎用ロボットポリシーRLDX-1を提案し、マルチストリームアクショントランスフォーマーにより多様なモダリティを統合して、器用な操作タスクで既存のVLAモデルを上回る性能を示した。
原題: RLDX-1 Technical Report / Dongyoung Kim, Huiwon Jang, Myungkyu Koo 他
日本語で読む → - 論文VLA/ロボット操作ロボティクス
Sentinel-VLA: 動的推論とエラー回復のための能動的状態監視を備えたメタ認知VLAモデル
VLAモデルに能動的な状態監視モジュールを追加し、必要時のみ動的推論やエラー回復を行うメタ認知型モデルを提案。自己進化的継続学習と直交アダプタにより性能向上と破滅的忘却防止を実現し、実機で成功率を30%以上向上させた。
原題: Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery / Wenhao Li, Xiu Su, Dan Niu 他
日本語で読む → - 論文VLAロボティクス
FineVLA: 操縦可能な視覚言語行動ポリシーのための細粒度命令整合
ロボットタスクの実行方法に関する細かい指示(腕、方向、接触領域など)をVLAモデルに学習させるためのデータセットとベンチマーク、およびポリシーを構築した。
原題: FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies / Xintong Hu, Xuhong Huang, Jinyu Zhang 他
日本語で読む → - 論文VLAロボティクス
MolmoAct2: 実世界展開のための行動推論モデル
実世界展開に適した完全オープンな行動推論モデルMolmoAct2を提案し、空間推論に特化したVLMバックボーン、新しいデータセット、オープンな行動トーカナイザ、適応的推論機構などを導入して性能と効率を向上させた。
原題: MolmoAct2: Action Reasoning Models for Real-world Deployment / Haoquan Fang, Jiafei Duan, Donovan Clay 他
日本語で読む → - 論文VLA/ベンチマークロボティクス
VLA-REPLICA: 実世界での視覚言語行動モデル評価のための低コストで再現可能なベンチマーク
低コストで再現可能な実世界ベンチマークを提案し、VLAモデルの評価を標準化する。
原題: VLA-REPLICA: A Low-Cost, Reproducible Benchmark for Real-World Evaluation of Vision-Language-Action Models / Alex S. Huang, Jiahui Zhang, Shiqing Tang 他
日本語で読む → - 論文VLAロボティクス
Afford-VLA: 内在化されたアフォーダンスによる行動整合的な視覚プランニング
VLAモデルにタスク条件付きアフォーダンスを内部生成・利用する視覚プランニング機構を導入し、行動予測と密結合させることで操作性能を向上させた。
原題: Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance / Runze Wang, Yuqian Fu, Yu Li 他
日本語で読む → - 論文VLAロボティクス
CKT-WAM: ワールドアクションモデル間のパラメータ効率的な文脈知識転送
異なるワールドアクションモデル間で知識を転送する際、テキスト埋め込み空間のコンパクトな文脈を用いて、軽量なアダプタと圧縮機構で教師モデルの知識を生徒モデルに注入する手法を提案。LIBERO-Plusで1.17%の学習可能パラメータで86.1%の成功率を達成。
原題: CKT-WAM: Parameter-Efficient Context Knowledge Transfer Between World Action Models / Yuhua Jiang, Yijun Guo, Hongbing Yang 他
日本語で読む → - 論文VLAロボティクス
PointACT: マルチスケール点群アクション相互作用を備えた視覚言語行動モデル
ロボット操作のための視覚言語行動モデルに、階層的な3D点群表現を統合し、アクション生成時に局所的な幾何学と大域的なシーン構造を考慮できるようにした。LIBEROとRLBenchで性能が向上した。
原題: PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction / Shizhe Chen, Paul Pacaud, Cordelia Schmid
日本語で読む → - 論文VLAロボティクス
PriorVLA: 事前知識を保持した視覚言語行動モデルの適応
事前学習済みの視覚言語行動モデルを下流タスクに適応させる際、事前知識を保持しつつ効率的に活用するフレームワークPriorVLAを提案。凍結した事前エキスパートと適応エキスパートを組み合わせ、パラメータ更新を25%に抑えつつ、分布外や少数サンプル設定で高い性能を達成。
原題: PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models / Xinyu Guo, Bin Xie, Wei Chai 他
日本語で読む → - 論文VLA画像認識
EARL: 一人称視点インタラクション推論とピクセル接地のための解析誘導型強化学習フレームワーク
一人称視点映像から人間と環境のインタラクションを理解し、テキスト回答とピクセル単位のマスクを生成する強化学習フレームワークを提案した。
原題: EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding / Yuejiao Su, Xinshen Zhang, Zhen Ye 他
日本語で読む → - 論文VLAロボティクス
点追跡が世界行動モデルを改善する
ピクセル予測に加えて2D点追跡と可視性を予測する世界行動モデルJOPATを提案し、長期的なダイナミクスと遮蔽への頑健性を向上させた。
原題: Point Tracking Improves World Action Models / Jiarui Guan, Wenshuai Zhao, Yue Pei 他
日本語で読む → - 論文VLA画像認識
TriRelVLA: 汎化可能な身体化操作のための三者関係構造
視覚言語行動モデルの汎化性を高めるため、物体・手・タスクの三者関係を明示的に表現し、関係性に基づいて行動生成を行うフレームワークを提案した。
原題: TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation / Hanyu Zhou, Chuanhao Ma, Gim Hee Lee
日本語で読む → - 論文VLA/価値学習ロボティクス
凍結VLAがすでに知っている成功の兆候:基盤ロボットポリシーにおける価値様構造の探索研究
凍結したVLAポリシーの特徴表現から、軽量な線形プローブで成功確率を予測できることを示し、それを用いて行動選択を改善した。
原題: What Frozen VLAs Already Know About Success: A Probing Study of Value-Like Structure in Foundation Robot Policies / Jiachen Zhang, Junnan Nie, Junyi Lao 他
日本語で読む → - 論文VLA/汎化ロボティクス
VLA-Pro: 視覚言語行動モデルのためのクロスタスク手続き記憶転送
タスク固有のLoRAアダプタを手続き記憶として保存し、推論時に現在のマルチモーダル文脈に基づいて関連記憶を検索・融合することで、未見タスクへの汎化を向上させるプラグアンドプレイフレームワークを提案した。
原題: VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models / Shengyu Si, Yuanzhuo Lu, Ruimeng Yang 他
日本語で読む → - 論文VLAロボティクス
視覚プリミティブによる行動生成
視覚言語行動モデルにおいて、視覚プリミティブを介して行動生成を行う新しいアーキテクチャを提案し、実ロボットのピックアンドプレースタスクで成功率を大幅に向上させた。
原題: Action with Visual Primitives / Weilong Guo, Yuchen Wang, Renping Zhou 他
日本語で読む → - 論文VLA/変形物操作ロボティクス
DeMaVLA: 汎用変形物操作のための視覚言語行動基盤モデル
変形物(衣類など)の折りたたみを多様な物体・環境で行える視覚言語行動基盤モデルを提案し、実ロボットデモと人間介入データで訓練して汎用性を実証した。
原題: DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation / Taiyi Su, Jian Zhu, Tianjian Wang 他
日本語で読む → - 論文VLA/ベンチマークロボティクス
Colosseum V2: 視覚言語行動モデルの汎化性能を評価するベンチマーク
VLAモデルの汎化性能を体系的に評価する大規模シミュレーションベンチマークColosseum V2を構築し、既存手法の限界を明らかにした。
原題: Colosseum V2: Benchmarking Generalization for Vision Language Action Models / Jeremy Morgan, Prajwal Vijay, Hyeonho Oh 他
日本語で読む → - 論文VLAロボティクス
ProgVLA: 進捗を考慮したロボット操作スキル学習
計算・メモリ制約下で信頼性の高い操作を実現する、タスク進捗の明示表現を持つコンパクトなVLAモデルを提案。長いマルチモーダル系列を効率的に処理し、進捗ヘッドによるRL訓練で長期的タスク成功率を向上させる。
原題: ProgVLA: Progress-Aware Robot Manipulation Skill Learning / Seungsu Kim, Jinyoung Choi, Seungmin Baek 他
日本語で読む → - 論文VLAロボティクス
WorldVLN: 空中視覚言語ナビゲーションのための自己回帰的世界行動モデル
空中VLNを予測駆動の世界行動問題として捉え、自己回帰ビデオバックボーンで世界状態遷移を予測し、実行可能なウェイポイント行動に直接デコードする初のモデルWorldVLNを提案。2段階訓練と強化学習により、ベンチマークで12%以上の成功率向上を達成し、実ドローンへのゼロショット転送も実証。
原題: WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation / Baining Zhao, Jiacheng Xu, Weicheng Feng 他
日本語で読む → - 論文VLAロボティクス
予測に基づくサブゴール生成による長期タスク解決のためのAnticipation-VLA
長期にわたるロボットタスクを解決するため、タスクの進行に応じて適応的にサブゴールを生成する予測モデルを導入し、階層型VLAモデルを提案した。
原題: Anticipation-VLA: Solving Long-Horizon Embodied Tasks via Anticipation-based Subgoal Generation / Zhilong Zhang, Wenyu Luo, Haonan Wang 他
日本語で読む → - 論文VLAロボティクス
ELAN4D: 身体中心の4D監視による視覚言語行動モデルのプラグアンドプレイ適応
ロボットのキーポイントの未来の3D軌跡を予測する補助分岐をVLAモデルに追加し、外乱下での汎化性能を向上させるフレームワークを提案した。
原題: ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation / Zeyuan He, Bowen Yang, Zhirui Fang 他
日本語で読む → - 論文VLAロボティクス
GuidedVLA: プラグアンドプレイの行動注意特化によるタスク関連因子の指定
VLAモデルの行動デコーダを機能部品として捉え、個々の注意ヘッドに明示的な補助信号でタスク関連因子(物体接地、空間幾何、時間的スキル論理)を学習させるフレームワークを提案し、シミュレーションと実機で汎化性能を向上させた。
原題: GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization / Xiaosong Jia, Bowen Yang, Zuhao Ge 他
日本語で読む → - 論文VLA/強化学習/人間介入ロボティクス
UniSteer: 人間のガイダンスを活用したVLA適応のための統合ノイズステアリング
拡散型VLAモデルの実世界適応を効率化するため、人間の修正行動をノイズ空間の強化学習に統合するフレームワークUniSteerを提案。実機実験で成功率を平均66分で20%から90%に向上させた。
原題: UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation / Junjie Lu, Xinyao Qin, Yuhua Jiang 他
日本語で読む → - 論文VLAロボティクス
PAPO-VLA: 計画を考慮した視覚言語行動モデルのポリシー最適化
VLAモデルの実行を計画と実行の二役に分解し、計画アクションを特定して重要度を推定し、GRPOの利点推定に組み込むことで、タスク成功に重要な行動を重点的に最適化する手法を提案した。
原題: PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models / Peizheng Guo, Jingyao Wang, Changwen Zheng 他
日本語で読む → - 論文VLAロボティクス
未来は互換性があるか?ワールドアクションモデルにおける動的整合性の診断
ワールドアクションモデルが生成する未来予測が、視覚的に妥当なだけでなく、行動系列と動的に整合しているかを検証し、整合性を評価指標として導入。さらに、整合性に基づく価値フリーな選択戦略を提案し、ロボット操作タスクでの成功率を向上させた。
原題: Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models / Bo-Kai Ruan, Teng-Fang Hsiao, Ling Lo 他
日本語で読む →