論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/25 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAcs.MM
CTAN: 音視覚身体性ナビゲーションのための循環時間的注意ネットワーク
音と視覚の情報を双方向の循環一貫性制約で融合し、時間的記憶機構で履歴を活用する音視覚ナビゲーション手法を提案。
原題: CTAN: Cycle-Temporal Attention Network for Embodied Audio-Visual Navigation / Teng Liu, Yinfeng Yu
日本語で読む → - 論文VLAAI
言語的文脈が視覚言語モデルの視覚表現を再コード化する
視覚言語モデルにおいて、言語プロンプトが視覚表現を再コード化する仕組みを解明し、目標関連オブジェクトの参照表現と属性変調の因果的役割を実証した。
原題: Linguistic Context Recodes Visual Representations in Vision-Language Models / Brian Song, Michael A. Lepori, Ellie Pavlick
日本語で読む → - 論文VLAAI
Athena-Brain技術報告:汎用知能と身体化インタラクションのための効率的なロボット脳
8B規模のLLMをロボットのオンデバイス脳として開発し、多段階のポストトレーニングにより汎用知能と身体化インタラクション能力を両立させた。
原題: Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interaction / Jialian Li, Junhong Liu, Yuchen Cao 他
日本語で読む → - 論文VLAAI
PGN: 盤古マルチモーダル基盤モデルに基づく視覚言語ナビゲーションシステムの設計と実装
盤古マルチモーダル基盤モデルを用いたオフラインの視覚言語ナビゲーション行動予測システムを構築し、2段階の学習と8つのNPUでの実装により、専門家軌跡に対する行動一致率62.29%を達成した。
原題: PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model / Li Xian, Mingxi Li, Yizheng Wang 他
日本語で読む → - 論文VLAcs.DC
JoyNexus: VLAモデルのためのサービス指向マルチテナント後訓練
VLAモデルの後訓練を効率化するため、マルチテナント対応の統合サービスを提案。訓練・推論・環境サービスを分離し、APIで提供することで、リソース利用の効率化とコスト削減を実現。
原題: JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models / Haoran Sun, Wentao Zhang, Junyang Hua 他
日本語で読む → - 論文VLAAI
UESF-Bench: 統合型身体性探索・追従のためのベンチマークと分析
言語で指示された人物を探索し、その後追従する統合的なタスクのベンチマークを新たに構築し、探索と追従を切り替えるVLAフレームワークを提案・評価した論文。
原題: UESF-Bench: Benchmarking and Probing for Unified Embodied Seeking and Following / Kun Yu, Jianhua Yang, Yixiang Chen 他
日本語で読む → - 論文VLA画像認識
Hy-Embodied-VLM-1.0:効率的な物理世界エージェント
物理世界で動作する組み込みエージェント向けの基盤モデルを提案し、行動中心の能力分類に基づくデータパイプラインと効率的なMoEアーキテクチャにより、38ベンチマークで優れた性能を達成した。
原題: Hy-Embodied-VLM-1.0: Efficient Physical-World Agents / Ziyi Wang, Xumin Yu, Yongming Rao 他
日本語で読む → - 論文VLA画像認識
複雑な組立動作理解のための構成文脈ファインチューニングによる視覚言語モデル
組立動作を動詞・対象・工具の要素に分解し、視覚言語モデルを要素ごとにファインチューニングして、ビデオから組立動作を高精度に認識する手法を提案した。
原題: Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos / Hao Zheng, Jinyi Huang, Tiantian Zheng 他
日本語で読む → - 論文VLA/強化学習機械学習
少ないデータから多くを学ぶ:後知恵からの強化学習
VLAモデルの強化学習後訓練において、失敗したロールアウトを実際に達成したタスクに再ラベル付けする「後知恵からの学習」を提案し、サンプル効率を5倍向上させた。
原題: Learning More from Less: Reinforcement Learning from Hindsight / Iris Xu, Sunshine Jiang, John Marangola 他
日本語で読む → - 論文VLA画像認識
ビデオ生成モデルは汎用視覚学習器である
大規模テキストからビデオへの生成を視覚の事前学習パラダイムとして用い、テキスト指示で様々な視覚タスクを実行できる汎用モデルGenCeptionを提案した。
原題: Video Generation Models are General-Purpose Vision Learners / Letian Wang, Chuhan Zhang, Rishabh Kabra 他
日本語で読む → - 論文VLA画像認識
LEEVLA: 潜在環境進化における重要情報の認識による視覚言語行動モデル
視覚言語行動モデルが動的環境でタスクに重要な視覚情報を強調し、潜在世界表現の構造的進化を保つための新しいアーキテクチャを提案。ドリフト誘導型動的優先化と構造的特徴フロー生成により、タスク認識の「どこで・どのように」学習を実現し、ベンチマークで優れた性能を示した。
原題: LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action / Qi Lyu, Baicheng Liu, Xudong Wang 他
日本語で読む → - 論文VLA画像認識
自己中心視点のビデオ言語モデルは手と物体の両方の手がかりを捉えているか?
手と物体の相互作用認識において、既存のビデオ言語モデルが手や物体の見た目や動きではなく環境の相関に頼る問題を指摘し、手と物体のマスク学習と動的デコーダを導入して両方の手がかりを活用する手法を提案した。
原題: Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues? / Masatoshi Tateno, Alexandros Stergiou, Risa Shinoda 他
日本語で読む → - 論文VLA画像認識
具身知能のためのMixture-of-Expertsビデオ事前学習のスケーリング
ロボット制御に特化したビデオ生成モデルLingBot-Videoを提案。MoEアーキテクチャとロボット向けデータ、物理合理性を評価する報酬系で、デジタル生成と物理動作の橋渡しを目指す。
原題: Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence / Shuailei Ma, Jiaqi Liao, Xinyang Wang 他
日本語で読む → - 論文VLA機械学習
検証済みコード世界モデルによるワールドタイム計算
ドメインのダイナミクスをコードとして記述し、多数の検証可能な世界モデルから生成した軌道データでLLMを微調整することで、未学習の世界への汎化性能を大幅に向上させる手法を提案。
原題: World-Time Compute with Verified Code World Models / James Schwoebel, Ingrida Semenec, Jenia Rousseva 他
日本語で読む → - 論文VLA/強化学習機械学習
大規模視覚言語行動モデルにおける効率的かつ汎用的な強化学習のためのオフライン教師信号の活用
オフライン教師信号を強化学習に組み込むことで、OOD性能を保ちつつ学習効率を約2倍に向上させるハイブリッド手法を提案・評価した。
原題: Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models / Dmitriy Poyarkov, Aleksei Staroverov, Aleksandr I. Panov
日本語で読む → - 論文VLA画像認識
CanvasAgent: 視覚ツールのオーケストレーションによる複雑な画像生成・編集の実現
複雑な画像生成・編集を、複数の視覚ツールを順次呼び出すマルチモーダルエージェントで実現する。大規模データセットと強化学習でツール選択を学習する。
原題: CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration / Hairui Zhu, Yiying Yang, Tengjin Weng 他
日本語で読む → - 論文VLA機械学習
DynaVieW: スキーマ誘導型ワールドモデリングによる階層的視覚ダイナミクスの理解
マルチモーダルLLMが動画や複数画像の時間的変化を体系的にモデル化できない問題に対し、動的スキーマに基づくワールドモデルDynaVieWを提案。状態遷移系列を学習し、視覚ダイナミクスの予測とシミュレーションを実現する。
原題: DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics / Silin Gao, Hao Zhao, Zeming Chen 他
日本語で読む → - 論文VLA/強化学習AI
VLA Grounder: ブラックボックスVLAモデルのための言語条件付け空間最適化
凍結されたVLAモデルの動作を改善するため、人間の指示をVLAに適したコマンドへ変換する言語条件付け空間ポリシーを強化学習で最適化する手法を提案。
原題: VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models / Damir Shodiev, Aleksei Staroverov, Nikita Kachaev 他
日本語で読む → - 論文VLA画像認識
GuideMe: ストリーミング動画におけるマルチドメインタスクガイダンスと介入
マルチモーダル大規模言語モデルがリアルタイムの手順コーチとして機能できるかを評価するため、多領域のストリーミング動画ベンチマークGuideMeを構築し、既存モデルの性能を分析した。
原題: GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video / Fang Liu, Jinpeng Chen, Ke Xu 他
日本語で読む → - 論文VLAWモデル画像認識
WorldBagel:視覚・言語・行動・世界モデルの統合の力
統合型マルチモーダルモデルを用いて、ロボット操作タスクにおける世界モデルの性能を向上させる新しいフレームワークを提案した。
原題: WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling / Zelin Zhao, Min Shi, Bo Yuan 他
日本語で読む → - 論文VLAAI
経路レベルの後知恵指示による視覚言語ナビゲーションの意味的探索
視覚言語ナビゲーションエージェントの訓練において、探索軌道と指示の意味的ミスマッチを解決するため、後知恵推論を用いて指示を実際の探索経路に合わせるPhi-Navを提案した。
原題: Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation / Sung June Kim, Sangpil Kim, Honglak Lee
日本語で読む → - 論文VLA画像認識
時間的比率によるビデオ行動汎化ギャップの理解と緩和
ビデオ基盤モデルをロボット行動データで微調整すると構成的一般化能力が失われる問題を分析し、注意機構に基づく指標「時間的比率」を導入してその原因を解明し、推論時に適応的にガイドする手法を提案した。
原題: Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio / Utkarsh A. Mishra, Yongxin Chen, Danfei Xu 他
日本語で読む → - 論文触覚/VLA/操作ロボティクス
予期せぬ感覚を捉える:残差触覚表現によるResTacVLAの接触豊富な操作
視覚言語行動モデルに触覚を統合する際、視覚特徴が触覚を覆い隠す問題を解決するため、視覚予測と実際の触覚の差を残差表現として用い、視覚的に予測できない重要な接触イベントを捉えるResTacVLAを提案した。
原題: Feeling the Unexpected: ResTacVLA for Contact-Rich Manipulation via Residual Tactile Representation / Pengwei Zhang, Bin Xie, Xinpan Meng 他
日本語で読む → - 論文VLAロボティクス
SEAM: 視覚言語行動ポリシーにおけるアクションチャンク動作の滑らかな実行
アクションチャンク方式のVLAポリシーで生じるチャンク境界の不連続を、学習不要の推論時補正で滑らかにする手法を提案した。
原題: SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies / Dijia Zhan, Xuemiao Xu, Jinyi Li 他
日本語で読む → - 論文VLA/ロバスト性/物理攻撃ロボティクス
照明、カメラ、誤動作:照明ロバスト性がVLAモデルを色盲にするとき
VLAモデルが照明変化に弱いことを突いた物理的スポットライト攻撃FLAREを提案し、さらに色情報を守る対抗訓練法ChromaGuardで攻撃下でも高い成功率を達成した。
原題: Lights, Camera, Malfunction: When Illumination Robustness Leaves VLA Models Blind to Color / Marino Watanabe, Takami Sato, Kentaro Yoshioka
日本語で読む → - 論文VLA/触覚/操作ロボティクス
τ: 未来の視覚的監督から学習する触覚拡張型視覚言語行動モデル
接触を伴う操作タスク向けに、将来の視覚情報を教師信号として触覚表現を学習し、事前学習済みVLAモデルに統合するフレームワークを提案。専用データセットTacAuraも導入し、未見物体やシーンへの汎化性能を向上させた。
原題: {\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision / Ning Cheng, Jinan Xu, Wanlin Li 他
日本語で読む → - 論文VLA/ヒューマノイド/操作ロボティクス
ヒューマノイドVLAにおけるループの閉鎖:検証可能な移動操作のための持続的3Dオブジェクトトークン
RGB-D観測から役割インデックス付きの3Dオブジェクト記録を維持し、それをオブジェクトトークンとして行動生成と幾何学的述語チェックの両方に使用することで、検証可能な閉ループ実行を実現するPOT-VLAを提案。実機でベースラインを大幅に上回る成功率を達成。
原題: Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation / Peng Ren, Haoyang Ge, Jiang Zhao 他
日本語で読む → - 論文VLA/高速化ロボティクス
効率的な視覚言語行動推論のための時間的冗長性の削減
VLAモデルの推論遅延を減らすため、視覚エンコーディングと拡散サンプリングの時間的冗長性を削減するシステムレベルの高速化手法を提案。動的領域のみのトークン更新と2ステップの拡散サンプリングにより、性能を保ちつつ2倍以上の高速化を達成。
原題: Reducing Temporal Redundancy for Efficient Vision-Language-Action Inference / Yuzhou Wu, Yuxin Zheng, Muchun Niu 他
日本語で読む → - 論文VLA/計画ロボティクス
STeP: 信号時相論理による視覚言語モデルを用いた行動生成の精密仕様化
視覚言語行動モデルによる指示分解を、信号時相論理(STL)で精密な制約に変換し、実行時検証・監視・再計画を行う階層的フレームワークを提案した。
原題: STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models / Kasra Torshizi, Anukriti Singh, Sidharth Mathur 他
日本語で読む → - 論文データ選択/模倣学習/VLAロボティクス
SIEVE: VLAモデルを用いた模倣学習のための構造認識データ選択
ロボットのデモデータから再利用可能なプリミティブと遷移構造を抽出し、構造的な被覆率を最大化するようにデータを選択することで、少ないデータと学習ステップで高性能なVLAポリシーを学習する手法を提案した。
原題: SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models / Changti Wu, Bin Yu, Zhaolong Shen 他
日本語で読む →