論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
Pelican-Unify 1.0: 理解・推論・想像・行動を統合した身体化基盤モデル
単一のVLMと統一未来生成器を用いて、理解・推論・想像・行動を一つのモデルで統合的に学習・実行する身体化基盤モデルを提案し、各能力のベンチマークで高い性能を達成した。
原題: Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action / Yi Zhang, Yinda Chen, Che Liu 他
日本語で読む → - 論文VLAロボティクス
故障認識型ロボット制御のためのヘルス条件付き視覚言語行動モデル
ロボットの物理的な劣化(関節の劣化やアクチュエータ故障など)に対応するため、健康状態ベクトルを入力として受け取り、劣化した関節でもタスクを完了できるように適応する視覚言語行動(VLA)モデルを提案した。
原題: Health-Conditioned Vision-Language-Action Models for Malfunction-Aware Robot Control / Hüseyin Arslan, Özgür Erkent
日本語で読む → - 論文VLA/計画ロボティクス
オンデバイスロボット計画:推論の冗長性を排除した効率的な意思決定
ロボットの推論ワークロードに時間的冗長性があることに着目し、不要な推論を最小化するフレームワークREISを提案。シーンゲーティングとKVステアリングにより推論オーバーヘッドを削減しつつ性能を維持する。
原題: On-Device Robotic Planning: Eliminating Inference Redundancy for Efficient Decision-Making / Joonhee Lee, Hyunseung Shin, Hyunmi Kim 他
日本語で読む → - 論文VLA機械学習
BOKBO:VLAポリシーのための較正された棄権層
VLAポリシーの推論時にK個の候補アクションをサンプリングする手法に対し、全てが不安全な場合に実行違反を防ぐための、有限サンプル保証付きの棄権層を提案した。
原題: BOKBO (Best of K Bad Options): Calibrated Abstention for VLA Policies / Anya Singh, Cabrel Happi, Jai Relan 他
日本語で読む → - 論文VLA/触覚/操作ロボティクス
AT-VLA: 適応的触覚注入による視覚言語行動モデルのフィードバック反応向上
接触を伴う操作タスクで視覚言語行動モデルの性能を高めるため、適応的に触覚情報を注入する仕組みと、高速な触覚反応を可能にする二重ストリーム構造を提案した。
原題: AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models / Xiaoqi Li, Muhe Cai, Jiadong Xu 他
日本語で読む → - 論文VLAロボティクス
PriorVLA: 事前知識を保持した視覚言語行動モデルの適応
事前学習済みの視覚言語行動モデルを下流タスクに適応させる際、事前知識を保持しつつ効率的に活用するフレームワークPriorVLAを提案。凍結した事前エキスパートと適応エキスパートを組み合わせ、パラメータ更新を25%に抑えつつ、分布外や少数サンプル設定で高い性能を達成。
原題: PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models / Xinyu Guo, Bin Xie, Wei Chai 他
日本語で読む → - 論文VLA/効率化画像認識
SAFE-Pruner: 意味的注意に基づく未来予測型トークンプルーニングによる効率的な視覚言語行動操作
視覚言語行動モデルの推論を高速化するため、将来の層の注意情報を予測して重要でない視覚トークンを刈り込むプラグアンドプレイ手法を提案した。
原題: SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation / Shilin Ma, Chubin Zhang, Changyuan Wang 他
日本語で読む → - 論文VLA/展開ロボティクス
工場フロアでのVLAパイプライン展開事例研究:産業用包装タスクにおけるワークフロー、失敗、教訓
産業用包装タスクで事前学習済みVLAポリシーを工場現場に適応させる実践的な取り組みを報告し、反復的な微調整と展開駆動の改善を通じて得られた失敗モードと教訓をまとめた。
原題: A Factory-Floor Deployment Case Study of VLA Pipelines for Industrial Packaging Task: Workflow, Failures, and Lessons / Brian Zhu, Philipp Schmitt, Philine Meister 他
日本語で読む → - 論文VLA/操作ロボティクス
PrimitiveVLA: 再利用可能な運動プリミティブ学習による効率的で汎用的なロボット操作
VLAモデルのデータ効率と汎化を改善するため、デモを再利用可能な運動プリミティブに分解し、推論時に組み立てるフレームワークを提案した。
原題: PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation / Yutai Li, Shaohui Peng, Jiaming Guo 他
日本語で読む → - 論文VLA/汎化ロボティクス
VLA-Pro: 視覚言語行動モデルのためのクロスタスク手続き記憶転送
タスク固有のLoRAアダプタを手続き記憶として保存し、推論時に現在のマルチモーダル文脈に基づいて関連記憶を検索・融合することで、未見タスクへの汎化を向上させるプラグアンドプレイフレームワークを提案した。
原題: VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models / Shengyu Si, Yuanzhuo Lu, Ruimeng Yang 他
日本語で読む → - 論文VLA画像認識
視覚予測型VLAモデルのテスト時学習
視覚予測型VLAモデルのOOD脆弱性を、テスト時に予測画像と観測のペアを用いた自己教師あり学習で改善する手法を提案。
原題: Test-Time Training for Visual Foresight Vision-Language-Action Models / Sangwu Park, Wonjoong Kim, Yeonjun In 他
日本語で読む → - 論文VLA画像認識
LocateAnything: 並列ボックスデコードによる高速・高品質な視覚言語グラウンディング
視覚言語モデルによる物体検出・グラウンディングを、ボックス座標を並列に一度でデコードする方式に変え、推論速度と精度を両立させた。
原題: LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding / Shihao Wang, Shilong Liu, Yuanguo Kuang 他
日本語で読む → - 論文VLA/ベンチマークロボティクス
PhAIL: 実ロボットVLAベンチマークと分布評価手法
実ロボットでのVLAポリシー評価を、成功率だけでなく成功までの時間分布に基づく手法で行う新しいベンチマークと評価方法を提案した論文。
原題: PhAIL: A Real-Robot VLA Benchmark and Distributional Methodology / Sergey Arkhangelskiy
日本語で読む → - 論文VLAロボティクス
AwareVLN: 自己認識による視覚言語ナビゲーションの推論
視覚と言語によるナビゲーションにおいて、エージェントの状態とタスクの進捗を理解する自己認識推論機構を導入し、エンドツーエンドで高性能なナビゲーションを実現した。
原題: AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation / Wenxuan Guo, Xiuwei Xu, Yichen Liu 他
日本語で読む → - 論文VLAロボティクス
「イエスマン症候群」:身体化ロボットエージェントにおける棄権のベンチマーキング
身体化ロボットのための視覚言語モデルが、曖昧・物理的に不可能・誤った前提に基づく指示を認識して棄権する能力を評価するベンチマーク「RoboAbstention」を提案した。
原題: The Yes-Man Syndrome: Benchmarking Abstention in Embodied Robotic Agents / Doguhan Yeke, Elif Su Temirel, Ananth Shreekumar 他
日本語で読む → - 論文VLAロボティクス
CSR: 大規模キャッシュ状態表現による無限地平リアルタイムポリシー
大規模LLMをロボットの連続的認知エンジンとして使う際のレイテンシ問題を解決するため、KVキャッシュ再利用を最適化するCSRフレームワークと、非同期状態調整アルゴリズムを提案し、実機で26倍のレイテンシ削減を達成した。
原題: CSR: Infinite-Horizon Real-Time Policies with Massive Cached State Representations / Robin Karlsson, Go Suzui
日本語で読む → - 論文VLA/検証画像認識
Pre-VLA: 信頼性の高い視覚言語行動・ワールドモデル展開のための先制ランタイム検証
VLAモデルや生成ワールドモデルの行動生成の不確実性に対処するため、物理実行や想像の前に行動の妥当性を検証する統一ランタイム検証アーキテクチャを提案した。
原題: Pre-VLA: Preemptive Runtime Verification for Reliable Vision-Language-Action and World-Model Rollouts / Zhen Sun, Yongjian Guo, Haoran Sun 他
日本語で読む → - 論文VLAロボティクス
ElegantVLA: 効率的な視覚言語行動モデルのための思考タイミング学習
VLAモデルの計算コストを削減するため、制御ステップごとに計算量を動的に調整するプラグイン型の位相適応推論フレームワークを提案。
原題: ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models / Ye Li, Huanan Liu, Kangye Ji 他
日本語で読む → - 論文VLA/操作ロボティクス
IntentVLA:曖昧なロボット操作のための短期的意図モデリング
視覚と言語の観察が似ていても異なる行動を取るマルチモーダルな模倣データに対し、過去の視覚観察を短期的意図として符号化し、行動生成を条件付けるVLAフレームワークを提案。曖昧さを評価するベンチマークAliasBenchも導入し、複数の環境で安定性と性能を向上させた。
原題: IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation / Shijie Lian, Bin Yu, Xiaopeng Lin 他
日本語で読む → - 論文VLAロボティクス
PhysBrain 1.0 技術報告書
大規模な人間の一人称視点ビデオから物理的常識を抽出し、視覚言語行動モデルとロボット制御ポリシーに転移する手法を提案し、複数のベンチマークで最高性能を達成した。
原題: PhysBrain 1.0 Technical Report / Shijie Lian, Bin Yu, Xiaopeng Lin 他
日本語で読む → - 論文自動運転/VLAロボティクス
SafeAlign-VLA: リスク認識型自動運転のための負例強化安全整合フレームワーク
自動運転向けVLAモデルに負例(危険シナリオ)を活用した安全整合フレームワークを提案し、カウンターファクチュアルな軌道生成とグループ相対方策最適化により衝突率を低減した。
原題: SafeAlign-VLA: A Negative-Enhanced Safe Alignment Framework for Risk-Aware Autonomous Driving / Kefei Tian, Yuansheng Lian, Kai Yang 他
日本語で読む → - 論文VLAロボティクス
BlockVLA: ブロック拡散ファインチューニングによる自己回帰VLAの高速化
自己回帰型VLAモデルの推論遅延を減らすため、ブロック拡散パラダイムを導入し、ブロック内で並列生成しつつブロック間の因果性を保つことで、推論を高速化する手法を提案した。
原題: BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning / Ruiheng Wang, Shuanghao Bai, Haoran Zhang 他
日本語で読む → - 論文VLA/行動監視ロボティクス
VLAの失敗の仕方はアーキテクチャごとに異なる:ブラックボックス行動監視が明らかにする構造特異的な失敗シグネチャ
VLAアーキテクチャ(VQ-BeT、Diffusion Policy、ACT)がモーターコマンドレベルで異なる失敗パターンを示すことを発見し、アーキテクチャに合わせた監視手法の選択が重要であることを示した。
原題: How VLAs Fail Differently: Black-Box Action Monitoring Reveals Architecture-Specific Failure Signatures / Krishnam Gupta
日本語で読む → - 論文VLA/強化学習ロボティクス
Feat2Go: 視覚特徴に基づく価値推定による身体化強化学習
事前学習済み視覚世界モデルから得た段階的進捗目標を価値モデルで予測し、終端報酬を整形することでVLAモデルの強化学習を改善するフレームワークを提案。
原題: Feat2Go: Visual Feature-Grounded Value Estimation for Embodied Reinforcement Learning / Junyang Shu, Zhiwei Lin, Bingqing Wei 他
日本語で読む → - 論文VLAAI
視点計画:VLMによる3D空間の能動的推論と計画
VLMがカメラ移動による視点変化を予測し、複数ステップの計画で目標視点を特定できるかを検証し、その能力を高める反復的自己探索と視点グラフ蒸留の枠組みを提案した。
原題: Planning with the Views / Kangrui Wang, Linjie Li, Zhengyuan Yang 他
日本語で読む → - 論文VLAロボティクス
Wall-OSS-0.5 技術報告書
大規模VLA事前学習がロボットの実行可能な行動を直接生み出すかを検証し、ゼロショットで実ロボット動作を達成するオープンソース4Bモデルを提案した。
原題: Wall-OSS-0.5 Technical Report / Ryan Yu, Pushi Zhang, Starrick Liu 他
日本語で読む → - 論文継続学習/VLAロボティクス
視覚言語行動モデルは実世界データから忘れずに継続学習できるか?
実世界のロボット連続操作タスクでVLAモデルの継続学習を検証し、経験再生が破滅的忘却を防ぎ、ジョイント訓練と同等以上の性能を達成することを示した。
原題: Can Vision-Language-Action Models Learn from Real-World Data Continually without Forgetting? / Jiarun Zhu, Yijun Hong, Xiaoquan Sun 他
日本語で読む → - 論文VLA/操作ロボティクス
Dexora: 高自由度両腕巧緻操作のためのオープンソースVLA
両腕・両手の高自由度操作を対象とした初のオープンソースVLAシステムDexoraを提案し、ハイブリッド遠隔操作とデータ品質を考慮した学習手法により、巧緻操作の成功率を大幅に向上させた。
原題: Dexora: Open-source VLA for High-DoF Bimanual Dexterity / Zongzheng Zhang, Jingrui Pang, Zhuo Yang 他
日本語で読む → - 論文VLAロボティクス
X-DiffVLA: クロスエンボディ拡散行動ヘッドを備えた視覚言語行動モデル
異なるエンドエフェクタを持つロボット間で知識を転移できる拡散ベースのVLAモデルを提案し、エンボディフォーシングと形態学的ツリー拡散により性能を向上させた。
原題: X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models / Boyu Li, Chaoyi Xu, Haoqi Yuan 他
日本語で読む → - 論文VLAロボティクス
Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
原題: Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments / Qiuyue Wang, Mingsheng Li, Jian Guan 他
日本語で読む →