論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/エッジ推論ロボティクス
Jetson-PI: 先読み整合非同期推論による搭載リアルタイムロボット制御の実現
低消費電力の搭載デバイス上でVLAモデルを高速に動作させるため、非同期推論の課題を解決する先読み整合補正と信頼度ベースのスケジューリングを提案した論文。
原題: Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference / Zebin Yang, Qi Wang, Yunhe Wang 他
日本語で読む → - 論文VLA/操作学習ロボティクス
TFP: 時間条件付きメモリ融合ポリシーによる視覚運動学習
視覚言語行動(VLA)ポリシーは反応的で、段階依存の操作タスクで失敗する問題を解決するため、時間条件付きメモリ融合ポリシー(TFP)を提案。液体時定数ダイナミクスでタスク進行の信念を維持し、フローマッチング行動デコーダに適応変調で注入することで、LIBERO等で成功率を向上させた。
原題: TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning / Yushen Liang, Yue Peng, Baosheng Jin 他
日本語で読む → - 論文VLA/ヒューマノイドロボティクス
ラボから店舗へのギャップを埋める:小売ヒューマノイド向けデータ効率的なポストトレーニングと経験駆動学習VLAフレームワーク
スーパーマーケットの棚補充タスクにおいて、データ効率的なポストトレーニングと経験駆動の学習を組み合わせたVLAフレームワークを提案し、単一GPUで実世界運用可能な性能を達成した。
原題: Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids / Roger Sala Sisó, Tiago Silvério, Jakob Sand 他
日本語で読む → - 論文VLAロボティクス
CAC-VLA: 視覚言語行動モデルのための文脈ゲート型行動条件付け
VLAモデル内に軽量な潜在行動インターフェースを導入し、文脈ゲートで行動エキスパートへの影響を調整することで、ロボット操作の成功率を向上させた。
原題: CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models / Yifu Xiong, Wenhao Yu, Jiaxuan Lin 他
日本語で読む → - 論文VLA/操作ロボティクス
Cortex: 長期的操作のための双方向整合型具現化エージェントフレームワーク
高レベルVLMと低レベルVLAの間の計画ギャップを埋めるため、32の標準スキルプリミティブと実行可能性原則を導入し、4k時間以上のビデオデータと30時間のシミュレーションデータを自動生成して、長期的操作タスクを改善するフレームワークを提案した。
原題: Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation / Jiaqi Peng, Xiqian Yu, Delin Feng 他
日本語で読む → - 論文VLAロボティクス
ガイド付きアクションフロー:フローマッチング型視覚言語行動ポリシーのためのQガイド推論
事前学習済みのフローマッチング型VLAポリシーを凍結したまま、学習済みのアクション批評家を用いて推論時にサンプリングをガイドし、ロボット操作の成功率を向上させる手法を提案した。
原題: Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies / Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng 他
日本語で読む → - 論文VLA/推論ランタイムロボティクス
Embodied.cpp: 異種ロボット向け具現化AIモデルのポータブル推論ランタイム
VLAモデルや世界行動モデルなどの具現化AIモデルを、異なるロボットやエッジデバイス上で効率的に実行するためのC++推論ランタイムを提案。モジュール化された5層構造により、多レート実行や低遅延推論を実現し、Pythonベースラインと比較して1.05〜2.70倍の高速化とVRAM削減を達成した。
原題: Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots / Ling Xu, Borui Li, Hao Wu 他
日本語で読む → - 論文VLAロボティクス
FBFM: ワールドアクションモデル実行のための訓練不要な非同期フィードバック機構
フローマッチングに基づくワールドアクションモデルにおいて、チャンク境界を待たずに実観測を内部フィードバックとして注入し、長期タスクでのドリフトを抑制する訓練不要の推論機構を提案した。
原題: FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution / Peize Li, Ruimeng Zhang, Ru Zhang 他
日本語で読む → - 論文VLAロボティクス
SEAM: 視覚言語行動ポリシーにおけるアクションチャンク動作の滑らかな実行
アクションチャンク方式のVLAポリシーで生じるチャンク境界の不連続を、学習不要の推論時補正で滑らかにする手法を提案した。
原題: SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies / Dijia Zhan, Xuemiao Xu, Jinyi Li 他
日本語で読む → - 論文VLA/力覚/接触操作ロボティクス
力の注入に遅すぎることはない:反応的力注入によるVLAポストトレーニングの加速
事前学習済みの視覚言語行動(VLA)ポリシーに、接触反応性を追加するフレームワークLIFTを提案。力覚メモリとゼロ初期化クロスアテンションで反応的アクション専門家を移植し、オンラインDAggerループで分布シフトに対処。タオル折り、本挿入、ハノイの輪配置で性能向上を実証。
原題: Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection / Yi Wang, Wendi Chen, Zimo Wen 他
日本語で読む → - 論文VLA/航法ロボティクス
Exp2VLA: 専門家デモからのドローン航法のための視覚言語行動モデル
強化学習や遠隔操作などの専門家の行動を蒸留して、言語指示に従うドローン航法用のコンパクトなVLAモデルを微調整するパイプラインを提案した。
原題: Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations / Van Huyen Dang, Kabilesh Rajendran, Erdi Sayar 他
日本語で読む → - 論文VLA/生涯学習ロボティクス
人間らしい物理的知能に向けて:ロボット操作のための生涯視覚言語行動学習
ロボット操作におけるVLAモデルの生涯学習を実現するため、二重タイムスケール適応機構とキャッシュ効率的なリプレイ戦略を備えたLifelongVLAフレームワークを提案した。
原題: Towards Human-like Physical Intelligence: Lifelong Vision-Language-Action Learning for Robotic Manipulation / Yao He, Gan Sun, Wenqi Liang 他
日本語で読む → - 論文VLA/ヒューマノイド/操作ロボティクス
ヒューマノイドVLAにおけるループの閉鎖:検証可能な移動操作のための持続的3Dオブジェクトトークン
RGB-D観測から役割インデックス付きの3Dオブジェクト記録を維持し、それをオブジェクトトークンとして行動生成と幾何学的述語チェックの両方に使用することで、検証可能な閉ループ実行を実現するPOT-VLAを提案。実機でベースラインを大幅に上回る成功率を達成。
原題: Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation / Peng Ren, Haoyang Ge, Jiang Zhao 他
日本語で読む → - 論文VLAAI
Action QFormer: 行動監視下での構造化表現形成による視覚言語行動モデルの性能向上
視覚言語行動モデルにおいて、行動監視が継承したマルチモーダル表現を形成する役割を分析し、クエリベースのインターフェースを導入して行動に適した表現を再構成することで、ゼロショットsim-to-realナビゲーションの成功率を大幅に向上させた。
原題: Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models / Yufeng Ji, Wenhao Tang, Haoyi Niu 他
日本語で読む → - 論文VLA/触覚/操作ロボティクス
τ: 未来の視覚的監督から学習する触覚拡張型視覚言語行動モデル
接触を伴う操作タスク向けに、将来の視覚情報を教師信号として触覚表現を学習し、事前学習済みVLAモデルに統合するフレームワークを提案。専用データセットTacAuraも導入し、未見物体やシーンへの汎化性能を向上させた。
原題: {\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision / Ning Cheng, Jinan Xu, Wanlin Li 他
日本語で読む → - 論文データ選択/模倣学習/VLAロボティクス
SIEVE: VLAモデルを用いた模倣学習のための構造認識データ選択
ロボットのデモデータから再利用可能なプリミティブと遷移構造を抽出し、構造的な被覆率を最大化するようにデータを選択することで、少ないデータと学習ステップで高性能なVLAポリシーを学習する手法を提案した。
原題: SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models / Changti Wu, Bin Yu, Zhaolong Shen 他
日本語で読む → - 論文VLA/高速化ロボティクス
効率的な視覚言語行動推論のための時間的冗長性の削減
VLAモデルの推論遅延を減らすため、視覚エンコーディングと拡散サンプリングの時間的冗長性を削減するシステムレベルの高速化手法を提案。動的領域のみのトークン更新と2ステップの拡散サンプリングにより、性能を保ちつつ2倍以上の高速化を達成。
原題: Reducing Temporal Redundancy for Efficient Vision-Language-Action Inference / Yuzhou Wu, Yuxin Zheng, Muchun Niu 他
日本語で読む → - 論文VLA/計画ロボティクス
STeP: 信号時相論理による視覚言語モデルを用いた行動生成の精密仕様化
視覚言語行動モデルによる指示分解を、信号時相論理(STL)で精密な制約に変換し、実行時検証・監視・再計画を行う階層的フレームワークを提案した。
原題: STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models / Kasra Torshizi, Anukriti Singh, Sidharth Mathur 他
日本語で読む → - 論文VLAロボティクス
Mixture-of-Experts VLAにおける創発的な構成スキル
専門家デモからロボットポリシーをエンドツーエンドで学習する際、Mixture-of-Expertsアーキテクチャを用いることで、タスク分解や階層構造を事前に定義せずとも、再利用可能で解釈可能なプリミティブが創発的に獲得されることを示した論文。
原題: Emergent Compositional Skills in Mixture-of-Experts VLAs / Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss 他
日本語で読む → - 論文VLA/制御ロボティクス
機構的解釈可能性と最適制御によるワールドアクションモデルの堅牢性向上
機構的解釈可能性を用いてワールドアクションモデルの堅牢性を解析し、対比的活性化方向による学習不要のステアリングと、モデルベース最適制御によるフィードバック制御を提案して堅牢性を向上させた。
原題: Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control / Jihoon Hong, Julian Skifstad, Qiyue Dai 他
日本語で読む → - 論文VLA/タスク計画ロボティクス
エージェント統括型視覚言語行動スキル合成における意味的ハンドオフ失敗の診断
長期的な家庭タスクでスキル間の境界が不明確なために生じる失敗を、BEHAVIOR-1K環境で分析し、スキル単体の性能と合成時の頑健性を分離評価する手法を提案した。
原題: Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition / Ke Rui, Yushen Zuo, Jiawei Wang 他
日本語で読む → - 論文VLAロボティクス
視覚運動ポリシー学習のための順序付きアクショントークン
ロボットの連続的なアクションを離散トークンに変換する際、高圧縮・完全復号可能・順序性を満たす新しいトークナイザーOATを提案し、複数のベンチマークで有効性を示した。
原題: Ordered Action Tokens for Visuomotor Policy Learning / Chaoqi Liu, Yue Zhao, Haonan Chen 他
日本語で読む → - 論文VLA/オフラインRLロボティクス
RedFlow: 失敗をアクションレベルの修正へと変換するフローマッチングVLAポリシー
フローマッチングVLAポリシー向けに、失敗データをアクションレベルの修正信号に変換するオフライン強化学習フレームワークRedFlowを提案。実世界成功率を56.7%から74.7%に向上させた。
原題: RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy / Zhengyang Yan, Junhao Li, Fangqi Zhu 他
日本語で読む → - 論文VLA画像認識
大規模視覚言語モデルを用いたトークンベースのアフォーダンス接地
大規模視覚言語モデルの出力トークンの注意マップを活用し、外部教師なしで行動関連領域を特定するゼロショットのアフォーダンス接地フレームワークを提案した。
原題: Token-Based Affordance Grounding with Large Vision-Language Models / Seung Il Lee, Qinqian Lei, Daguang Xu 他
日本語で読む → - 論文VLA/移動操作画像認識
ABot-M0.5: 移動と操作を統合した世界行動モデル
移動操作ロボットのための世界行動モデルを提案し、時間粒度・行動空間・学習と推論の整合性を揃えることで、長期的なタスク実行の精度とロバスト性を向上させた。
原題: ABot-M0.5: Unified Mobility-and-Manipulation World Action Model / Ronghan Chen, Yandan Yang, Zuojin Tang 他
日本語で読む → - 論文VLAロボティクス
具現化GPT-5.1:世界モデルの証拠か?
身体性やシミュレーション訓練を受けていない大規模マルチモーダルモデルGPT-5.1が、物理ロボットの高レベル制御としてナビゲーションや物体操作を実行できるかを探る探索的研究。
原題: Embodied GPT-5.1: Evidence of a World Model? / Roberto Spinelli, Thiago C. Martins
日本語で読む → - 論文VLA/ロボット基盤モデルロボティクス
基盤から応用へ:実践におけるVLAモデルの改善
VLA基盤モデルの実用化ギャップを埋めるため、データパイプライン刷新、行動空間拡張、予測ダイナミクスモデリングの3点を改良したLingBot-VLA 2.0を提案し、ベンチマークで効果を実証した。
原題: From Foundation to Application: Improving VLA Models in Practice / Wei Wu, Fangjing Wang, Fan Lu 他
日本語で読む → - 論文VLAロボティクス
RoboTALES: タスク整合的なシミュレート未来による推論誘導型ロボットポリシーの学習
事前学習済みビデオ生成モデルをロボット制御に活用する際、想像した未来がタスク意図からずれたり、行動条件付けが不確実になる問題を解決するため、階層的LLMプランナーとVLM批評家を用いてタスク整合的な未来を生成し、ロボットポリシーを学習する単一フレームワークを提案した。
原題: RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures / Hanan Gani, Tejal Kulkarni, Madhoolika Chodavarapu 他
日本語で読む → - 論文VLA/セグメンテーション画像認識
GEAR-Seg: 推論セグメンテーションとデータエンジンのための根拠付き説明可能エージェント
推論セグメンテーションを、クラス非依存セグメンテーション、意味記述、LLM推論に分離した説明可能なエージェントを提案し、ゼロショットで高性能を達成。さらに、大規模データセットGEAR-131Kを自動生成し、軽量モデルの蒸留実験で有効性を示した。
原題: GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine / Yanan Wang, Wen Li, Yibin Ying 他
日本語で読む → - 論文VLAロボティクス
VLAモデルのテスト時モダリティ適応のための因果性を考慮した推論-診断-精緻化フレームワーク
視覚と言語と行動を統合するVLAモデルにおいて、テスト時に視覚情報の重要度を因果効果として推定し、行動予測を動的に調整するフレームワークを提案した。
原題: A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models / Haoyu Zhang, Yuwei Wu, Jin Chen 他
日本語で読む →