論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/5 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA画像認識
MobileVLA-R1 2.0: モバイルロボット制御のための強化学習強化推論
モバイルロボットのVLAシステムにおいて、言語指示を実行可能な行動に変換する課題に対し、構造化された推論と強化学習を組み合わせたフレームワークを提案し、ナビゲーションや操作タスクで評価した。
原題: MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control / Ting Huang, Yue Huang, Zeyu Zhang 他
日本語で読む → - 論文VLA/力覚制御ロボティクス
CR-VLA-Force: 制御認識型コンプライアンスVLAモデルによる頑健な接触豊富なロボット操作の学習
力覚認識を統合したVLAモデルが精密な力追従と迅速な調整に弱い問題を解決するため、マルチモーダルMoEと多段階訓練、適応コンプライアンス制御を備えたCC-VLAフレームワークを提案し、実機実験で有効性を示した。
原題: CR-VLA-Force: Learning Control-aware Compliance VLA Model for Robust Contact-rich Robotic Manipulation / Zhaohong Mai, Chao Wang, Chao Zeng 他
日本語で読む → - 論文VLAロボティクス
失敗境界学習によるロバストな視覚言語行動モデル
専門家デモの模倣だけでは失敗境界が不明なため、デジタルツインでのロールアウトとセマンティック進捗定位を用いて失敗境界を発見・整形し、ロバストなVLAモデルを実現する手法DLSを提案。
原題: Where Success Breaks: Failure-Boundary Learning for Robust Vision-Language-Action Models / Yanzhe Chen, Zhijun Cao, Mike Zheng Shou
日本語で読む → - 論文VLAAI
LayerRoute: 行動条件付きレイヤー混合ルーティングによる視覚言語行動ポリシー
視覚言語行動(VLA)ポリシーにおいて、行動モジュールの状態に応じてVLMのレイヤー表現を動的に混合・再利用するルーティング手法を提案し、シミュレーションと実世界で性能を向上させた。
原題: LayerRoute: Action-Conditioned Mixture-of-Layers Routing for Vision-Language-Action Policies / Zheng Lu, Haoran Liao, Wanqi Zhong 他
日本語で読む → - 論文VLA/ベンチマークロボティクス
RoboSPA: VLAモデルは単純なシーンと短期的なタスクを超えられるか?
VLAモデルの空間的・手続き的複雑さに対する推論能力を診断する大規模ロボット操作ベンチマークRoboSPAを提案し、既存モデルの限界を明らかにした。
原題: RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks? / Zhenxuan Fan, Bo Zhang, Yutong Lin 他
日本語で読む → - 論文VLAロボティクス
推論コストなしの推論:ロボットVLAポリシーのための潜在意味的足場
ロボットのVLAモデルに、推論時のコストを増やさずに物理的推論の能力を持たせるため、訓練中にアクショントークンの表現をテキストの推論根拠に合わせる補助損失を導入し、推論時にはそのヘッドを捨てる手法を提案した。
原題: Reasoning Without Inference Cost: Latent Semantic Scaffolding for Robot VLA Policies / Andrew Ting Yan Li, Zhuo Li, Zhelin Yang 他
日本語で読む → - 論文VLAロボティクス
長期的視覚言語行動操作のための神経記号的推論
長期的な操作タスクを遂行するために、学習されたVLA制御と明示的なタスクグラフおよびマルチモーダル手続き記憶を組み合わせた神経記号的枠組みを提案する。
原題: Towards Neuro-Symbolic Procedural Reasoning for Long-Horizon Vision-Language-Action Manipulation / Vivek Chavan, Yahuan Shi, Oliver Heimann 他
日本語で読む → - 論文VLAロボティクス
一言で変わる行動:言語条件付き身体化推論の実ロボットベンチマーク
タスクが変わらない場合は行動を維持し、タスクが変わった場合のみ行動を正しく更新する能力を評価する、実ロボット向けの新しいベンチマークを提案した。
原題: One Word, Different Action: A Real-Robot Benchmark for Language-Conditioned Embodied Reasoning / Yiwei Liu, Luwei Yang, Shunbo Lei
日本語で読む → - 論文VLA画像認識
時間を考慮した支援ナビゲーション
視覚と言語のエージェントが、ユーザーへの応答タイミングを計画できるかを検証し、複雑な屋外環境での支援ナビゲーション用の大規模ベンチマークを導入。既存のMLLMの限界を明らかにし、指示の理由を予測する単純な改良で性能が向上することを示した。
原題: Time-Aware Assistive Navigation / Masaki Kuribayashi, Zhongkai Shangguan, Eshed Ohn-Bar
日本語で読む → - 論文VLAロボティクス
GE-Act 2.0: ロボット操作のためのワールドアクションモデルの事前学習とスケーリング
操作データのみで生成・行動コンポーネントをゼロから学習するワールドアクションモデルを提案し、大規模データでの事前学習とスケーリングの効果を検証した。
原題: GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation / AgiBot Research Team, Renhang Liu, Wenzhi Zhao 他
日本語で読む → - 論文移動操作/VLA/力推定ロボティクス
FWBC-VLA: 接触を伴う移動操作のための力認識全身補償
車輪付き脚ロボットの接触を伴う移動操作において、力センサを使わずに接触力を推定し、その情報をVLAモデルに統合することで、タスクレベルの行動生成と低レベルの全身補償制御を橋渡しするフレームワークを提案した。
原題: FWBC-VLA: Force-Aware Whole-Body Compensation for Contact-Rich Loco-Manipulation / Yutian Zhang, Siyuan Ma, Liwen Yang 他
日本語で読む → - 論文VLA/強化学習ロボティクス
VLA-Precision: 非対称共同ブートストラップによる視覚言語行動モデルの効率的な実世界オンライン強化学習
実世界のオンライン強化学習を用いて、精密な操作タスクにおける視覚言語行動モデルの性能を向上させるフレームワークを提案した。
原題: VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models / Chenyu Su, Zhaolong Shen, Yuan Qian 他
日本語で読む → - 論文両腕操作/VLA/データセットロボティクス
1500時間のデモからオン方針修正までの両腕家庭操作のスケーリング
家庭内両腕操作タスクの1500時間のデモデータセットを公開し、VLAモデルXR-2を訓練。データ量とDAgger修正データの増加に伴い成功率が向上するスケーリング傾向を実証した。
原題: Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections / Jiafeng Xu, Qi Li, Yan Shen 他
日本語で読む → - 論文VLAロボティクス
WISE: ワールドモデル誘導による想像スケジューリングを用いた視覚言語行動モデルの効率的なポストトレーニング
ロボット操作のポストトレーニングにおいて、ワールドモデルによる想像を必要な状態でのみ、信頼できる範囲で使用するフレームワークWISEを提案し、計算時間を約80%削減しつつ性能を向上させた。
原題: WISE: World-model-guided Imagination Scheduling for Efficient Post-training of Vision-Language-Action Models / Chenhao Zhang, Hanyu Zhao, Hang Cheng 他
日本語で読む → - 論文VLA/転移学習ロボティクス
ZETA: テーブルトップ操作におけるゼロショット・クロスエンボディメントVLA転移の統制研究
異なるロボット形態へのゼロショット転移を体系的に評価するため、厳密な定義と統制ベンチマークを導入し、状態表現・事前学習の多様性・補助学習・対象形態の露出の影響を分析した。
原題: ZETA: A Controlled Study of Zero-Shot Cross-Embodiment VLA Transfer for Tabletop Manipulation / Mi Yan, Wenhao Zhang, Zhiqi Zhang 他
日本語で読む → - 論文VLA画像認識
幾何学的潜在拡散による空間認識ワールドアクションモデル
事前学習済みビデオ拡散モデルをRGBと深度の同時予測に拡張し、3D情報を活用したロボットポリシー学習を実現する空間認識ワールドアクションモデル(SA-WAM)を提案した。
原題: Spatially Aware World Action Model via Geometric Latent Diffusion / Javier Alejandro Lopetegui Gonzalez, Paul Pacaud, Cordelia Schmid
日本語で読む → - 論文自動運転/VLA画像認識
運転用VLAの異なる車体構成へのゼロショット転移に向けて
運転タスクのVLAモデルにおいて、複数データセットでの訓練とBEV-Forcing補助タスクが、未見のカメラ構成へのゼロショット転移性能を向上させることを示した。ただし、訓練データの多様性を増やすと補助タスクの効果は減少する。
原題: Towards Zero-Shot Transfer Across Embodiments For Driving VLAs / Caio Azevedo, Stefano Sabatini, Sascha Hornauer 他
日本語で読む → - 論文VLAロボティクス
静かなる妨害:LLM搭載ロボットシステムに対する内部状態トリガーバックドア攻撃
LLMで制御されるロボットに、外部刺激ではなくロボット自身の過去の行動履歴をトリガーとする隠れたバックドアを埋め込めることを示し、通常時は性能を保ちつつ特定条件下で停止や衝突を引き起こせることを実験で明らかにした。
原題: Silent Sabotage: Internal State Triggered Backdoor Attacks on LLM-Powered Robotic Systems / Doniyorkhon Obidov, Shivayogi Akki, Tan Chen 他
日本語で読む → - 論文VLAロボティクス
どのモダリティが重要かを感知する:ロバストなVLAポリシーのための証拠ゲート正則化
VLAポリシーが複数センサー入力の融合時に生じる「モダリティ絡み合い」問題を解決するため、センサーごとのタスク関連性に基づいて正則化を適応的に適用するEvidence-Gated Regularization (EGR)を提案した。シミュレーションと実ロボットで成功率を大幅に向上させた。
原題: Sensing Which Modality Matters: Evidence-Gated Regularization for Robust VLA Policies / Yue Yang, Diego Romeres, Chiori Hori 他
日本語で読む → - 論文VLA画像認識
SimpleMemVLA: 視覚言語行動モデルのためのシンプルかつ効果的なネイティブビデオメモリ
専用メモリモジュールを使わず、過去の観察をタイムスタンプ付きビデオとしてそのままバックボーンに渡すことで、長時間の操作タスクで高い性能を達成するVLAを提案した。
原題: SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models / Cheng Yin, Wang Xu, Junpeng Yang 他
日本語で読む → - 論文VLAロボティクス
ShieldVLA: 視覚言語行動モデルのための実行可能性を考慮した安全アライメント
視覚言語行動モデルに対し、ハミルトン・ヤコビ到達可能性に基づく安全クリティックを学習させ、安全領域内での報酬最大化と危険時の回復を分離するファインチューニング手法を提案。安全性コストを平均57%削減し、タスク成功率も向上させた。
原題: ShieldVLA: Feasibility-Aware Safety Alignment for Vision-Language-Action Models / Manan Tayal, Akshay Nambi
日本語で読む → - 論文VLA画像認識
LookStep: 言語的先見とイベント駆動メモリによる効率的な視覚言語ナビゲーション
視覚言語ナビゲーションのための、言語ラベルによる将来状態予測とイベント駆動型メモリを組み合わせた効率的なエンドツーエンドフレームワークを提案。
原題: LookStep: Efficient Vision-Language Navigation with Linguistic Foresight and Event Driven Memory / Kun-Yang Yu, Yingzhe Li, Hongyu Xu 他
日本語で読む → - 論文VLA/解釈可能性ロボティクス
視覚・言語・行動モデルの潜在クラスタ解析
VLAモデルの内部表現を層ごとに解析し、行動デコーダの潜在空間をクラスタリングして解釈可能な概念を抽出するフレームワークを提案した。
原題: Latent Cluster Analysis for Vision-Language-Action Models / Theodor Wulff, Sergio Lanza, Tamara Bila 他
日本語で読む → - 論文VLA/スキル学習機械学習
REFACTOR-VLA: 型付きモータープログラムの教師なしライブラリ学習
本論文は、ロボットの行動を再利用可能な抽象化(スキル)として組織化する新しいVLAモデルを提案し、長期的なタスクでの性能向上と解釈可能性の向上を目指す。
原題: REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs / Riyaaz Shaik, Chandru Venkataraman
日本語で読む → - 論文VLAAI
家庭用デバイスの汎用的視覚基盤探索に向けて
視覚言語モデルが未知の家庭用デバイスを操作する能力を評価する新しいベンチマークVGEBenchを提案し、既存モデルが知識を物理的操作に変換するのが難しいことを示した。
原題: Towards Generalizable Visually Grounded Exploration of Household Devices / Linhao Zheng, Zeming Liu, Wangke Chen 他
日本語で読む → - 論文VLA画像認識
部品のグラウンディングこそがボトルネック:VLMのアフォーダンス予測における失敗要因の特定
VLMのアフォーダンス予測を「対象部品の特定」と「必要な動作の知識」に分離し、失敗の主因が動作知識の欠如ではなく部品グラウンディングにあることを19物体・8モデルの実験で示した。
原題: Part Grounding, Not Action Knowledge: Locating the Bottleneck in VLM Affordance Prediction / Sarthak Sattigeri
日本語で読む → - 論文VLA/ドローン制御ロボティクス
マルチモーダルLLMをドローン制御の汎用視覚言語行動エージェントとして評価する:指令、接近、追跡、探索
マルチモーダルLLMをドローン制御ループに直接組み込み、プロンプトのみで行動空間を宣言するエージェントを提案し、接近・追跡・探索・群制御の4能力を評価するベンチマークを導入した。
原題: Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching / Jaewoo Park, Minyoung Lee, Sukmin Seo 他
日本語で読む → - 論文VLA/アクションチャンキングロボティクス
停止タイミングの学習:VLAにおける内部クロスアテンション動態を用いた適応的アクションチャンキング
固定長のアクションチャンキングの限界を克服するため、アクションエキスパート内のクロスアテンションのエントロピー上昇を検出し、実行中に動的にチャンク長を調整するトレーニング不要の手法を提案した。
原題: Knowing When to Stop: Adaptive Action Chunking via Internal Cross-Attention Dynamics in VLAs / Runze Xu, Xiaolong Shan, Shuang Dai 他
日本語で読む → - 論文VLAロボティクス
EmbodiedSkills: VLAエージェントの統合フレームワーク
VLAモデルを長期的タスクに適用するための、実行提案としてのスキル判断を検証する統合フレームワークを提案。
原題: EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents / Wei Wang, Wenqiao Zhang, Yutong Lin 他
日本語で読む → - 論文VLAロボティクス
CometVLA: 身体性データピラミッドの共学習による物理理解の獲得
ロボット操作タスクにおける物理常識の欠如を補うため、身体性に整合した物理VQAデータとベンチマークを構築し、VLAモデルを共学習させる手法を提案。実世界とシミュレーションで性能向上を確認した。
原題: CometVLA: Co-Training on an Embodied Data Pyramid towards Physical Understanding / Hanwen Wan, Dafeng Chi, Linbo Zhai 他
日本語で読む →