論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/ロボットアーム/オープンソースロボティクス
OpenEAI-Platform: オープンソースの具現化人工知能ハードウェア・ソフトウェア統合プラットフォーム
低コストの6+1自由度ロボットアームと再現可能なVLAモデルを統合した完全オープンソースのプラットフォームを提案し、実世界の操作タスクで商用アームや大規模事前学習モデルと同等以上の性能を示した。
原題: OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform / Jinyuan Zhang, Luoyi Fan, Leiyu Wang 他
日本語で読む → - 論文VLAロボティクス
Vesta: 汎用身体化推論モデル
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
原題: Vesta: A Generalist Embodied Reasoning Model / Johan Bjorck, Zhiqi Li, Yunze Man 他
日本語で読む → - 論文VLA画像認識
X-Tokenizer: 視覚・言語・行動事前学習のためのマルチモーダル行動トークナイザー
ロボットの行動を離散コードに変換する際、単なる再構成ではなく意味的なインターフェースとして学習する新しいトークナイザーを提案。マスク行動モデリングと対照学習により、行動コードが視覚言語の意味と整合するようにした。
原題: X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining / Miracle Kang, Lights Shi, Lucy Liang 他
日本語で読む → - 論文VLA/意思決定ロボティクス
RouterVLA: 成長するVLAプールのための予算配分と専門家オンボーディング
ロボットチームが複数の視覚言語行動ポリシーを持つ際に、新しい条件に対してどの専門家を配置し、どの候補をプールに追加するかを決定する手法を提案した。
原題: RouterVLA: Budgeted Commissioning and Expert Onboarding for Growing VLA Pools / Xingyu Ren, Chugang Yi, Youran Sun
日本語で読む → - 論文VLAロボティクス
自己回帰ポリシーによるリアルタイム実行
自己回帰型の視覚言語行動モデルをリアルタイムで実行する手法を提案し、トークン化の調整と制約付きデコードにより遅延を保証して性能を向上させることを示した。
原題: Real-Time Execution with Autoregressive Policies / Sangkyu Lee, Seohyeon Park, Tackgeun You 他
日本語で読む → - 論文VLAロボティクス
VLAMotor: エージェントベースのデータ合成による視覚言語行動モデルのテスト駆動型強化
VLAモデルのエッジケースでの失敗を検出し、その失敗を教師データに変換してモデルを微調整するフレームワークVLAMotorを提案した。
原題: VLAMotor: Test-Guided Enhancement of Vision-Language-Action Models via Agent-BasedData Synthesis / Zeqin Liao, Peifan Ren, Zixu Gao 他
日本語で読む → - 論文VLA/世界モデルロボティクス
τ0-WM: ロボット操作のための統合ビデオ・アクション世界モデル
ロボット操作のための、ポリシー学習・ビデオ予測・行動評価を単一の未来予測フレームワークに統合した世界モデルを提案。実ロボットデータ約27,300時間で訓練し、推論時に候補行動のサンプリングと評価・修正を行うことで、長期的で細かい操作タスクで高い性能を示した。
原題: $\tau_0$-WM: A Unified Video-Action World Model for Robotic Manipulation / Pengfei Zhou, Shengcong Chen, Di Chen 他
日本語で読む → - 論文VLAロボティクス
平坦性が視覚言語行動モデルの指示追従を維持する
視覚言語行動モデルの微調整時に平坦性を保つ最適化を適用し、指示無視の失敗を大幅に改善した。
原題: Flatness Preserves Instruction Following in Vision-Language-Action Models / Haochen Zhang, Yonatan Bisk
日本語で読む → - 論文VLA/ロバスト性ロボティクス
関節レベルの物理的故障下における視覚言語行動モデルの脆弱性の解明
実ロボットにVLAモデルを展開する際、関節の物理的故障(摩擦増加など)が性能を著しく低下させることを示し、故障を推定して補正する軽量な残差校正フレームワークJ-PARCを提案した。
原題: Uncovering Vulnerability of Vision-Language-Action Models under Joint-Level Physical Faults / Minsoo Jo, Taeju Kwon, Junha Chun 他
日本語で読む → - 論文VLAロボティクス
OneVLA: 身体性タスクのための統一フレームワーク
ナビゲーションと操作を単一のフレームワークに統合したVLAモデルを提案し、タスク固有のアーキテクチャを不要にする統一アクションヘッドと多段階トレーニング戦略を導入。シミュレーションと実環境で最先端の性能を達成した。
原題: OneVLA: A Unified Framework for Embodied Tasks / Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang 他
日本語で読む → - 論文VLA評価ロボティクス
FATE-VLA: 視覚言語行動モデルのための失敗を考慮したテスト生成
VLAモデルの評価を、固定ベンチマークではなく、失敗が起きやすい高リスクなシーンを能動的に探索するテスト生成問題として捉え、多様性駆動の探索とサロゲートモデルを組み合わせて、より多くの多様な失敗モードを発見する手法を提案した。
原題: FATE-VLA:Failue-aware test generation for vision-language-action models / Arusa Kanwal, Pablo Valle, Shaukat Ali 他
日本語で読む → - 論文共有自律 / VLA / 遠隔操作ロボティクス
SAPS: 遠隔操作と事前学習VLAのブレンドによるポリシー誘導の共有自律
事前学習済みのVLAポリシーと人間の遠隔操作をアクションレベルでブレンドする共有自律フレームワークを提案し、再学習や追加モデルなしで成功率を最大82%向上させた。
原題: SAPS: Shared Autonomy for Policy Steering by Blending Teleoperation with a Pretrained VLA / Crystal Zhou, Jehan Yang, Douglas J. Weber 他
日本語で読む → - 論文VLA自然言語
英語を超えて:視覚・言語・行動モデルにおける多言語ギャップの解明
視覚・言語・行動モデルが英語以外の指示で性能が大幅に低下する多言語ギャップを初めて体系的に調査し、その原因を分析した。
原題: Beyond English: Uncovering the Multilingual Gap in Vision-Language-Action Models / Hanyang Chen, Hongliang Li, Jiarui Cao 他
日本語で読む → - 論文VLAロボティクス
出力レベル正則化が単一GPU VLAファインチューニングにおけるシード抽選問題を解消する
VLAモデルのファインチューニングで、ランダムシードによって成功率が大きく低下する「シード抽選」問題を発見し、出力レベルの正則化(VICReg、Dropout、学習率減衰)がこの問題を完全に解消することを示した論文。
原題: Output-Level Regularization Eliminates the Seed Lottery in Single-GPU VLA Fine-Tuning / Jeffrin Sam, Dzmitry Tsetserukou
日本語で読む → - 論文VLA/汎化ロボティクス
APT: 行動エキスパートの事前学習による視覚-言語-行動ポリシーの指示汎化の改善
視覚-言語-行動モデルにおいて、言語データの不均衡が原因で未見の指示への汎化が悪い問題を、行動エキスパートを事前学習する二段階手法APTで解決した。
原題: APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies / Kechun Xu, Zhenjie Zhu, Anzhe Chen 他
日本語で読む → - 論文VLAロボティクス
少なく見て、多く指定する:汎用VLAのための視覚的証拠予算
視覚言語行動(VLA)モデルの汎化を改善するため、指示を詳細な軌跡・サブタスク言語で再ラベルし、明示的な視覚的証拠予算を課して実行器を訓練するフレームワークS2を提案した。
原題: See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs / Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota
日本語で読む → - 論文VLAロボティクス
クロスエンボディメントロボット操作のための行動事前学習
視覚言語行動モデルにおいて、行動モジュールに事前に運動の事前知識を学習させる2段階トレーニング手法を提案し、クロスエンボディメント設定での性能を向上させた。
原題: Learning Action Priors for Cross-embodiment Robot Manipulation / Dong Jing, Tianqi Zhang, Jiaqi Liu 他
日本語で読む → - 論文VLA/モデル圧縮ロボティクス
視覚言語行動モデルにおけるパラメータ冗長性の再考:VLMからVLAへの適応からの洞察
VLAモデルのパラメータ削減時に性能劣化が不可避とされる従来の見解に疑問を呈し、適応時のパラメータ変化の空間分布を解析し、モジュールごとの重要度に基づくマルチモジュール同時刈り込み手法を提案した。
原題: Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation / Fengnian Zhang, Tao Huang, Siyu Xu 他
日本語で読む → - 論文VLA/テスト生成cs.SE
MANGO: 視覚言語行動モデルのための自動マルチエージェントテストオラクル生成
VLAロボットのテスト用に、自然言語のタスク記述から細粒度のオラクルを自動生成するマルチエージェントフレームワークを提案。
原題: MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models / Pablo Valle, Shaukat Ali, Aitor Arrieta 他
日本語で読む → - 論文VLAロボティクス
潜在誘導フローマッチングによる視覚言語行動ポリシーの改善
視覚言語行動ポリシーに、成功可能性の軌跡を学習する自己誘導型フローマッチングを導入し、外部批評家なしで最良の行動選択を可能にする手法を提案した。
原題: Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement / Yunpeng Mei, Jiakai He, Hongjie Cao 他
日本語で読む → - 論文VLAロボティクス
密な身体化チェーン・オブ・ソート監視による視覚言語行動モデルの訓練
ロボット間の転移を改善するため、視覚言語モデルに密な身体化チェーン・オブ・ソート(ECoT)監視を導入し、推論時にはECoT生成をスキップできるデュアルストリームアーキテクチャのVLAモデルZR-0を提案した。
原題: Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision / Haoyang Li, Guanlin Li, Youhe Feng 他
日本語で読む → - 論文VLA画像認識
一般共変アクションモデリング:時空間分離による一般化多様体の構築
ロボットの動作生成において、絶対座標への回帰が一般共変性に反する問題を解決するため、時空間を分離して動作多様体を構築するGAMフレームワークを提案した。
原題: General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling / Huaihai Lyu, Chaofan Chen, Mingyu Cao 他
日本語で読む → - 論文VLA/失敗予測ロボティクス
Tri-Info: 情報理論によるVLAモデルの汎用的で解釈可能な失敗予測
VLAモデルの動作を情報理論の観点から分析し、成功と失敗で異なる情報的シグネチャを捉えるTri-Info信号を提案。再学習なしでアーキテクチャや環境をまたいで失敗を検出でき、実世界タスクでも高い精度を達成。
原題: Tri-Info: Generalizable, Interpretable Failure Prediction for VLA Models via Information Theory / Jinghan Yang, Yunchao Zhang, Wang Yuan 他
日本語で読む → - 論文VLA/全身制御ロボティクス
OpenHLM:全身ヒューマノイド移動操作の実証的レシピ
ヒューマノイドの全身協調動作を実現するため、言語と画像から全自由度を直接制御するVLAモデルの構築方法を体系的に研究し、実用的なレシピを提案した。
原題: OpenHLM: An Empirical Recipe for Whole-Body Humanoid Loco-Manipulation / Yingdong Hu, Haodong Zhu, Boyuan Zheng 他
日本語で読む → - 論文ナビゲーション/VLA/強化学習ロボティクス
専門家ガイドGRPOによる意図に正確に沿ったVLA空中ナビゲーション
VLAモデルを用いたUAVナビゲーションにおいて、専門家データで強化した強化学習フレームワークEG-GRPOを提案し、複雑な指示への意図整合性と成功率を大幅に向上させた。
原題: Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO / Tianyang Chen, Wenjun Li, Xin zhou 他
日本語で読む → - 論文VLAロボティクス
CT-VAM: 小脳-視床に着想を得た効率的な視覚運動制御のための視覚行動モデル
大規模言語モデルによる高次推論とローカルでの高速制御を分離するため、小脳-視床経路に着想を得た軽量な視覚行動モデルCT-VAMを提案。68Mパラメータで大規模VLAに匹敵する性能を達成し、実機でも高速制御を実現した。
原題: CT-VAM: A Cerebello-Thalamic-Inspired Vision-Action Model for Efficient Visuomotor Control / Jiacheng Li, Yize Guo, Jiabin Guo 他
日本語で読む → - 論文VLAロボティクス
TempoVLA: 速度制御可能な視覚言語行動ポリシーの学習
ロボット操作の速度を明示的な条件で制御できる単一のVLAモデルを提案。デモの軌道を任意の速度に再タイミングするデータ拡張と、速度をポリシーに供給する機構を組み合わせ、低リスク区間での高速化と高リスク区間での低速化を実現した。
原題: TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies / Dong Jing, Jingchen Nie, Tianqi Zhang 他
日本語で読む → - 論文VLAロボティクス
PearlVLA: 潜在空間における段階的動作計画の洗練
視覚言語行動モデル(VLA)の推論を潜在空間で行うことで、高速な動作生成と明示的な熟考の両立を実現するフレームワークを提案した。
原題: PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space / Bochen Yang, Lianlei Shan
日本語で読む → - 論文VLA画像認識
視覚分布シフト下でのOpenVLA失敗の早期警告信号
視覚変化によりVLAポリシーが失敗する前に、内部活性化に失敗予兆信号があるか調査。線形モニタで失敗を高精度に遡及識別できるが、クリーンなエピソードでも誤警報が多いことを示した。
原題: Early Warning Signals for OpenVLA Failure under Visual Distribution Shift / Dipesh Tharu Mahato, Rachel Ren
日本語で読む → - 論文VLA画像認識
ImageWAM: 世界行動モデルは本当にビデオ生成が必要か、それとも画像編集だけで十分か?
ビデオ生成に依存する世界行動モデル(WAM)の課題を指摘し、代わりに画像編集モデルを利用したImageWAMを提案。推論時に画像編集のKVキャッシュを行動予測に活用し、計算コストを大幅削減しつつ性能を向上させた。
原題: ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing? / Yuyang Zhang, Wenyao Zhang, Zekun Qi 他
日本語で読む →