論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/UAV追跡ロボティクス
CosFly-VLA: UAV追跡のための空間認識型視覚言語行動モデル
建物や障害物による遮蔽中でもターゲットを追跡できる、空間認識を備えた視覚言語行動(VLA)モデルを提案。大規模データでの事前学習とカリキュラム学習、強化学習により、遮蔽時の追跡性能を向上させる。
原題: CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking / Ruilong Ren, Songsheng Cheng, Yunpeng Zhou 他
日本語で読む → - 論文VLA/クロスエンボディメント転移ロボティクス
行動整合表現によるクロスエンボディメント転移
ロボット操作の大規模模倣学習において、行動整合表現(物体のバウンディングボックスや言語動作、エンドエフェクタの軌跡など)がVLAモデルのクロスエンボディメント転移を促進するかを検証し、シミュレーションベンチマークで評価。エンドエフェクタ軌跡が特に有効で、シミュレーションから実機への転移成功率を28%向上させた。
原題: Cross-Embodiment Transfer via Behavior-Aligned Representations / Ajay Sridhar, Jensen Gao, Jonathan Yang 他
日本語で読む → - 論文VLA/計画AI
ワールドアクションプランナー:行動条件付きワールドモデルによる汎用意思決定
視覚言語モデルとマルチタスクのポーズ画像条件付きワールドモデルを組み合わせ、初期行動計画を提案し、想像上のロールアウトを最適化・探索で反復改良するロボット計画システムを提案。構成タスクや新規レイアウト、ゼロショット汎化で既存のVLAやWAMを上回る性能を示した。
原題: World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models / Xiangcheng Zhang, Yilun Du
日本語で読む → - 論文VLAロボティクス
小型VLAモデルに「どこを見るか」と「どう動くか」を教える
小型の視覚言語行動モデルに、空間的接地と行動生成の能力を効率的に教えるフレームワークXS-VLAを提案。蒸留とフローマッチングにより、実時間制御に適した小型モデルの性能を大幅に向上させた。
原題: Teaching Tiny VLA Models Where to Look and How to Move / Iok Tong Lei, Ying Jie Yap, Wei Huang 他
日本語で読む → - 論文VLA/操作ロボティクス
Lift3D-VLA: 3次元幾何と動力学を考慮した操作のためのVLAモデルのリフティング
VLAモデルに明示的な3次元点群推論と時間的に一貫した行動生成を組み込む統一フレームワークを提案。2Dモデルを3Dに持ち上げる戦略と自己教師あり学習で幾何と物理ダイナミクスを内部化し、LLMの多層で行動チャンクを予測する。
原題: Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation / Jiaming Liu, Qingpo Wuwu, Nuowei Han 他
日本語で読む → - 論文VLA画像認識
固定カメラから自由カメラへ:キャリブレーション不要の視点ロバストな視覚言語行動モデル
カメラの位置が変わっても、その位置情報を明示的に与えずにロボットが自分で視点を推定して操作できる新しいVLAモデルを提案した。カメラ中心の動作予測と手と目の関係行列の予測を組み合わせ、単眼RGB画像だけで多様な視点で成功率を向上させる。
原題: From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model / Wenhao Li, Xueying Jiang, Quanhao Qian 他
日本語で読む → - 論文VLA/エッジ推論ロボティクス
Jetson-PI: 先読み整合非同期推論による搭載リアルタイムロボット制御の実現
低消費電力の搭載デバイス上でVLAモデルを高速に動作させるため、非同期推論の課題を解決する先読み整合補正と信頼度ベースのスケジューリングを提案した論文。
原題: Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference / Zebin Yang, Qi Wang, Yunhe Wang 他
日本語で読む → - 論文VLAロボティクス
言葉は長く語る:言語によるロボットポリシー合成のガイド
この論文では、ロボットのポリシー獲得を対話的なプログラム合成タスクとして扱うフレームワーク「ARCHITECT」を提案し、人間の自然言語による修正をコードに反映し、再利用可能なスキルライブラリを構築することで、長期的なタスクでの性能向上と人間の介入削減を実現しています。
原題: A Few Words Go a Long Way: Language Guided Robot Policy Synthesis / Daphne Chen, Archit Ritesh Jain, Eric Goossen 他
日本語で読む → - 論文VLAロボティクス
VLAモデルのテスト時モダリティ適応のための因果性を考慮した推論-診断-精緻化フレームワーク
視覚と言語と行動を統合するVLAモデルにおいて、テスト時に視覚情報の重要度を因果効果として推定し、行動予測を動的に調整するフレームワークを提案した。
原題: A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models / Haoyu Zhang, Yuwei Wu, Jin Chen 他
日本語で読む → - 論文VLA画像認識
大規模視覚言語モデルを用いたトークンベースのアフォーダンス接地
大規模視覚言語モデルの出力トークンの注意マップを活用し、外部教師なしで行動関連領域を特定するゼロショットのアフォーダンス接地フレームワークを提案した。
原題: Token-Based Affordance Grounding with Large Vision-Language Models / Seung Il Lee, Qinqian Lei, Daguang Xu 他
日本語で読む → - 論文自動運転/VLAロボティクス
S-squared-VLA: 自動運転のための視覚言語行動モデルにおける意味ストリームと空間ストリームの分離
自動運転向けの視覚言語行動モデルにおいて、意味情報と空間情報のストリームを分離し、空間表現の崩壊を防ぐことで、高精度な制御を実現する新しいアーキテクチャを提案した。
原題: S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving / Jianguo Yu, Rukang Wang, Duanfeng Chu 他
日本語で読む → - 論文VLA/安全性ロボティクス
バリア強化フローマッチングによる安全な視覚言語行動モデル
フローマッチング生成モデルに制御バリア関数の安全性保証を統合し、モデル内部のノイズ除去過程を変更することで安全な軌道を生成する手法を提案。外部フィルタ不要で、操作タスクとナビゲーションで安全性と成功率を両立。
原題: Safe Vision Language Action Models via Barrier Enhanced Flow Matching / Kasra Sinaei, Hung-Chieh Wu, Donald Ebeigbe
日本語で読む → - 論文VLA/セグメンテーション画像認識
GEAR-Seg: 推論セグメンテーションとデータエンジンのための根拠付き説明可能エージェント
推論セグメンテーションを、クラス非依存セグメンテーション、意味記述、LLM推論に分離した説明可能なエージェントを提案し、ゼロショットで高性能を達成。さらに、大規模データセットGEAR-131Kを自動生成し、軽量モデルの蒸留実験で有効性を示した。
原題: GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine / Yanan Wang, Wen Li, Yibin Ying 他
日本語で読む → - 論文VLA/評価AI
空中MLLMエージェントのゼロショットミッションレベル評価
空中3D環境での長期的なタスクを評価するベンチマークMissionBenchを提案し、22のMLLMモデルが人間の84.4%に対し35%未満の成功率であることを示した。
原題: Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents / Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt 他
日本語で読む → - 論文VLA/高速化ロボティクス
ActionCache: アクションキャッシュとリファインメントによる視覚言語行動モデルの学習不要高速化
フローベースの視覚言語行動モデルにおける反復的ノイズ除去の計算ボトルネックを、過去の中間アクションを再利用する外部キャッシュで解消し、推論遅延を大幅に削減する手法を提案した。
原題: ActionCache: Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement / Ryuji Oi, Hikari Otsuka, Kosuke Matsushima 他
日本語で読む → - 論文VLA/データ拡張ロボティクス
VLAモデルのための行動合成訓練による行動範囲の拡大
既存のデモデータから新しい物理的に有効なデモを自動合成し、VLAモデルの過学習を防いで行動の汎化を向上させるオフライン拡張手法を提案した。
原題: Unleashing More Actions via Action Compositional Training for VLA Models / Kai Peng, Jie Lu, Xiaojiang Peng
日本語で読む → - 論文VLAロボティクス
CAC-VLA: 視覚言語行動モデルのための文脈ゲート型行動条件付け
VLAモデル内に軽量な潜在行動インターフェースを導入し、文脈ゲートで行動エキスパートへの影響を調整することで、ロボット操作の成功率を向上させた。
原題: CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models / Yifu Xiong, Wenhao Yu, Jiaxuan Lin 他
日本語で読む → - 論文VLA/計画ロボティクス
STeP: 信号時相論理による視覚言語モデルを用いた行動生成の精密仕様化
視覚言語行動モデルによる指示分解を、信号時相論理(STL)で精密な制約に変換し、実行時検証・監視・再計画を行う階層的フレームワークを提案した。
原題: STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models / Kasra Torshizi, Anukriti Singh, Sidharth Mathur 他
日本語で読む → - 論文VLAロボティクス
SEAM: 視覚言語行動ポリシーにおけるアクションチャンク動作の滑らかな実行
アクションチャンク方式のVLAポリシーで生じるチャンク境界の不連続を、学習不要の推論時補正で滑らかにする手法を提案した。
原題: SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies / Dijia Zhan, Xuemiao Xu, Jinyi Li 他
日本語で読む → - 論文VLA/ナビゲーション画像認識
緑は進め、赤は止まれ:VLAナビゲーションポリシーのためのセマンティックセグメンテーションによる視覚的グラウンディング
VLAナビゲーションモデルの性能を、SegFormerによるセマンティックセグメンテーションで走行可能領域を緑、非走行可能領域を赤に色付けする視覚的グラウンディング手法を提案し、誤差を最大44%削減することを示した。
原題: Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies / Adrian Szvoren, Dimitrios Kanoulas, Nilufer Tuptuk
日本語で読む → - 論文VLAロボティクス
DLAM: 時間的制約を伴う分布型潜在アクション
本論文は、ロボットの行動データ不足を補うため、行動ラベルなしのビデオから潜在アクションを学習する新しいモデルDLAMを提案する。各遷移を対角ガウス分布として表現し、時間的整合性を保ちながら再構成誤差の伝播を抑えることで、ロボットポリシー学習の性能を向上させる。
原題: DLAM: Distributional Latent Actions with Temporal Constraints / Zuojin Tang, Feifan Luo, Haoyun Liu 他
日本語で読む → - 論文VLAロボティクス
視覚運動ポリシー学習のための順序付きアクショントークン
ロボットの連続的なアクションを離散トークンに変換する際、高圧縮・完全復号可能・順序性を満たす新しいトークナイザーOATを提案し、複数のベンチマークで有効性を示した。
原題: Ordered Action Tokens for Visuomotor Policy Learning / Chaoqi Liu, Yue Zhao, Haonan Chen 他
日本語で読む → - 論文VLA/制御ロボティクス
機構的解釈可能性と最適制御によるワールドアクションモデルの堅牢性向上
機構的解釈可能性を用いてワールドアクションモデルの堅牢性を解析し、対比的活性化方向による学習不要のステアリングと、モデルベース最適制御によるフィードバック制御を提案して堅牢性を向上させた。
原題: Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control / Jihoon Hong, Julian Skifstad, Qiyue Dai 他
日本語で読む → - 論文VLA/タスク計画ロボティクス
エージェント統括型視覚言語行動スキル合成における意味的ハンドオフ失敗の診断
長期的な家庭タスクでスキル間の境界が不明確なために生じる失敗を、BEHAVIOR-1K環境で分析し、スキル単体の性能と合成時の頑健性を分離評価する手法を提案した。
原題: Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition / Ke Rui, Yushen Zuo, Jiawei Wang 他
日本語で読む → - 論文器用操作/VLAロボティクス
EgoSteer: 自己中心視点ビデオからの操縦可能な器用操作を実現するフルスタックシステム
自己中心視点の人間ビデオから大規模な事前学習データを構築し、言語指示に従う器用なロボット操作ポリシーを学習するフルスタックシステムを提案。実ロボットへの適応も効率的で、多様なタスクで高い成功率を達成した。
原題: EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos / Yifan Zhong, Zhang Chen, Tianrui Guan 他
日本語で読む → - 論文データ選択/模倣学習/VLAロボティクス
SIEVE: VLAモデルを用いた模倣学習のための構造認識データ選択
ロボットのデモデータから再利用可能なプリミティブと遷移構造を抽出し、構造的な被覆率を最大化するようにデータを選択することで、少ないデータと学習ステップで高性能なVLAポリシーを学習する手法を提案した。
原題: SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models / Changti Wu, Bin Yu, Zhaolong Shen 他
日本語で読む → - 論文VLA/ヒューマノイド/操作ロボティクス
ヒューマノイドVLAにおけるループの閉鎖:検証可能な移動操作のための持続的3Dオブジェクトトークン
RGB-D観測から役割インデックス付きの3Dオブジェクト記録を維持し、それをオブジェクトトークンとして行動生成と幾何学的述語チェックの両方に使用することで、検証可能な閉ループ実行を実現するPOT-VLAを提案。実機でベースラインを大幅に上回る成功率を達成。
原題: Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation / Peng Ren, Haoyang Ge, Jiang Zhao 他
日本語で読む → - 論文VLA/ロボット基盤モデルロボティクス
基盤から応用へ:実践におけるVLAモデルの改善
VLA基盤モデルの実用化ギャップを埋めるため、データパイプライン刷新、行動空間拡張、予測ダイナミクスモデリングの3点を改良したLingBot-VLA 2.0を提案し、ベンチマークで効果を実証した。
原題: From Foundation to Application: Improving VLA Models in Practice / Wei Wu, Fangjing Wang, Fan Lu 他
日本語で読む → - 論文VLAロボティクス
Bridge-WA: ロボット行動のための世界の変化箇所と変化方法の予測
ロボット操作のための軽量な世界行動モデルを提案し、将来の変化を教師モデルから蒸留した3つの事前知識で行動生成を条件付け、外乱に強い汎化を実現した。
原題: Bridge-WA: Predicting Where and How the World Changes for Robotic Action / Yongjie Bai, Hanting Wang, Mingtong Dai 他
日本語で読む → - 論文VLA/航法ロボティクス
Exp2VLA: 専門家デモからのドローン航法のための視覚言語行動モデル
強化学習や遠隔操作などの専門家の行動を蒸留して、言語指示に従うドローン航法用のコンパクトなVLAモデルを微調整するパイプラインを提案した。
原題: Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations / Van Huyen Dang, Kabilesh Rajendran, Erdi Sayar 他
日本語で読む →