論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/4/30 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA/ナビゲーション画像認識
SpaAct: 空間活性化遷移学習とカリキュラム適応による視覚言語ナビゲーション
視覚言語ナビゲーション(VLN)のためのVLM適応フレームワークSpaActを提案。後方行動推論と前方遷移予測の2つの空間活性化タスクと、TriPAカリキュラム学習により動的空間認識を獲得し、VLN-CEベンチマークでSOTAを達成。
原題: SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation / Pengna Li, Kangyi Wu, Shaoqing Xu 他
日本語で読む → - 論文VLA画像認識
幾何学的報酬クレジット割当によるPoint-VLMの3D理解の強化
点群と言語を扱うモデルが3D構造を誤って幻覚する問題を、報酬をトークン単位に分解して割り当てる手法と再投影整合性の制約で改善した論文。
原題: Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment / Jingkun Chen, Ruoshi Xu, Mingqi Gao 他
日本語で読む → - 論文VLA/セキュリティ画像認識
「サインを待っているなら…それは違うかも!」視覚注入による信頼境界の混乱を軽減するビジョン言語エージェントシステムの防御
ビジョン言語エージェントが環境の視覚情報(例:信号)に従うべきか、悪意ある視覚注入を無視すべきかの「信頼境界の混乱」問題を定義し、マルチエージェント防御フレームワークを提案して誤誘導を低減した。
原題: If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems / Jiamin Chang, Minhui Xue, Ruoxi Sun 他
日本語で読む → - 論文VLA画像認識
身体化エージェントのための環境理解ビジョン言語モデル
身体化エージェントの指示追従性能を高めるため、物体認識・タスク計画・行動理解・目標認識の4技能を微調整した環境理解フレームワークを提案し、失敗時の回復ステップとGRPOによる最適化で成功率を向上させた。
原題: Environmental Understanding Vision-Language Model for Embodied Agent / Jinsik Bang, Jaeyeon Bae, Donggyu Lee 他
日本語で読む → - 論文VLA画像認識
具現化ミッドトレーニング:視覚言語モデルと視覚言語行動モデルのギャップを埋める
視覚言語モデル(VLM)をロボット行動データに適応させる中間学習手法を提案し、操作ベンチマークで性能向上を確認した。
原題: EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training / Yiyang Du, Zhanqiu Guo, Xin Ye 他
日本語で読む → - 論文VLA/エージェント基盤画像認識
ABot-Claw: 持続的・協調的・自己進化型ロボットエージェントの基盤
OpenClawを拡張し、異種ロボットの協調、視覚中心のマルチモーダル記憶、批評家ベースの閉ループフィードバックを統合することで、実世界での長期的・自己進化的なロボットエージェントを実現する基盤を提案した。
原題: ABot-Claw: A Foundation for Persistent, Cooperative, and Self-Evolving Robotic Agents / Dongjie Huo, Haoyun Liu, Guoqing Liu 他
日本語で読む → - 論文VLA画像認識
EgoTL: 長時間タスクのための自己中心視点シンクアラウド連鎖
自己中心視点のデータに、発話と行動のタイムスタンプ付き思考連鎖とメートルスケールの空間情報を付与するパイプラインを構築し、VLMやワールドモデルの評価・微調整を行う。
原題: EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks / Lulin Liu, Dayou Li, Yiqing Liang 他
日本語で読む → - 論文VLA画像認識
HY-Embodied-0.5: 実世界エージェントのための具現化基盤モデル
実世界の具現化エージェント向けに設計された基盤モデル群を提案し、空間・時間的視覚知覚と推論能力を強化した。
原題: HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents / Tencent Robotics X, HY Vision Team, : 他
日本語で読む → - 論文VLA/アンラーニング画像認識
VLA-Forget:身体化基盤モデルのための視覚言語行動アンラーニング
ロボット操作のためのVLAモデルから、安全でない・スプリアス・プライバシー関連の行動を除去するアンラーニング手法を提案。知覚・言語・行動の各層を段階的に更新し、不要な知識を忘れつつ有用な能力を保持する。
原題: VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models / Ravi Ranjan, Agoritsa Polyzou
日本語で読む → - 論文VLA画像認識
身体化AIのための加法的合成潜在行動の学習
視覚遷移から潜在行動を学習する際に、物理運動の加法的・合成的構造を強制するモデルAC-LAMを提案し、下流のポリシー学習の性能を向上させた。
原題: Learning Additively Compositional Latent Actions for Embodied AI / Hangxing Wei, Xiaoyu Chen, Chuheng Zhang 他
日本語で読む → - 論文VLA画像認識
LatentUM: 潜在空間統合モデルによるインターリーブ型クロスモーダル推論の可能性を解き放つ
視覚理解と生成を共通の潜在空間で表現する統合モデルLatentUMを提案し、ピクセル空間を介さずに柔軟なクロスモーダル推論と生成を実現した。
原題: LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model / Jiachun Jin, Zetong Zhou, Xiao Yang 他
日本語で読む → - 論文VLAロボティクス
CorridorVLA: スパースアンカーによる生成アクションヘッドへの明示的な空間制約
VLAモデルにスパースな空間アンカーを導入し、許容領域を明示的に課すことでアクション生成を改善する手法を提案。LIBEROベンチマークで性能が向上した。
原題: CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors / Dachong Li, ZhuangZhuang Chen, Jin Zhang 他
日本語で読む → - 論文VLA/追跡画像認識
UAV-Track VLA: 視覚・言語・行動モデルによるドローン搭載型空中追跡
ドローンによる空中追跡のための視覚・言語・行動(VLA)モデルを提案し、時間圧縮ネットと並列デュアルブランチデコーダを導入して性能と効率を向上させた。
原題: UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models / Qiyao Zhang, Shuhua Zheng, Jianli Sun 他
日本語で読む → - 論文VLA画像認識
LARY: 汎用視覚-行動対応のための潜在行動表現ベンチマーク
人間の行動ビデオから学習した潜在行動表現の能力を評価する統一ベンチマークを構築し、汎用視覚基盤モデルが専門の潜在行動モデルより優れ、潜在空間が物理行動空間とより良く整合することを示した。
原題: LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment / Dujun Nie, Fengjiao Chen, Qi Lv 他
日本語で読む → - 論文VLAロボティクス
VAG: 身体化データ合成のためのデュアルストリーム動画-行動生成
ロボットの基盤モデル学習用に、動画と行動を同時生成する統一フレームワークVAGを提案。動画と行動の整合性を高め、合成データでポリシーの汎化性能を向上させる。
原題: VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis / Xiaolei Lang, Yang Wang, Yukun Zhou 他
日本語で読む → - 論文VLA/エッジ展開/高速化ロボティクス
XPU上でのVision-Language-Actionモデルの特性評価:オンボット展開のための制約と高速化
ロボット制御用のVLAモデルを、コスト・エネルギー・時間の観点で様々なエッジアクセラレータ上で評価し、推論の二相パターンを特定して、DP-CacheとV-AEFusionによる高速化手法を提案した。
原題: Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment / Kaijun Zhou, Qiwei Chen, Da Peng 他
日本語で読む → - 論文VLAロボティクス
FreqCache: 適応的な周波数ガイド型トークンキャッシングによる身体化VLNモデルの高速化
VLNモデルの計算コストを削減するため、周波数領域の特性を利用してトークンキャッシュの構築・更新・適応調整を行うFreqCacheを提案した。
原題: FreqCache: Accelerating Embodied VLN Models with Adaptive Frequency-Guided Token Caching / Zihao Zheng, Xingyue Zhou, Zhihao Mao 他
日本語で読む → - 論文VLA機械学習
π0.7: 操縦可能な汎用ロボット基盤モデルと創発的能力
多様なコンテキスト条件付けを用いて、未見環境での言語指示追従やゼロショットの身体汎化を実現するロボット基盤モデルπ0.7を提案した。
原題: ${\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities / Physical Intelligence, Bo Ai, Ali Amin 他
日本語で読む → - 論文VLA/自律システムロボティクス
SpaceMind: 軌道上サービス自律化のためのモジュール型自己進化型身体化視覚言語エージェントフレームワーク
軌道上サービスを自律化するため、視覚センサーで知覚し3D空間を推論するモジュール型・自己進化型のVLMエージェントフレームワークを提案し、シミュレーションと実機で検証した。
原題: SpaceMind: A Modular and Self-Evolving Embodied Vision-Language Agent Framework for Autonomous On-orbit Servicing / Aodi Wu, Haodong Han, Xubo Luo 他
日本語で読む → - 論文VLAロボティクス
AnchorVLA: アンカー拡散による効率的なエンドツーエンド移動操作
移動操作において、拡散ポリシーの多様な行動生成を保ちつつ、推論コストを削減するため、アンカー軌道周辺で局所的に拡散する手法を提案し、実行時のドリフトを軽減する自己補正機構も導入した。
原題: AnchorVLA: Anchored Diffusion for Efficient End-to-End Mobile Manipulation / Jia Syuen Lim, Zhizhen Zhang, Peter Bohm 他
日本語で読む → - 論文セキュリティ/VLA画像認識
FlowHijack: フローマッチング型視覚言語行動モデルに対する動力学を考慮したバックドア攻撃
フローマッチング型VLAモデルのベクトル場動力学を標的とした初のバックドア攻撃フレームワークを提案し、ステルス性の高いトリガーで高い攻撃成功率を達成した。
原題: FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models / Xinyuan An, Tao Luo, Gengyun Peng 他
日本語で読む → - 論文VLA/強化学習機械学習
RLトークン:視覚言語行動モデルを用いたオンライン強化学習のブートストラップ
事前学習済みの視覚言語行動モデル(VLA)にRLトークンと呼ばれる小型の表現を追加し、その上で強化学習を行うことで、実ロボット上で数時間の練習だけで効率的に微調整できる手法を提案した。
原題: RL Token: Bootstrapping Online RL with Vision-Language-Action Models / Charles Xu, Jost Tobias Springenberg, Michael Equi 他
日本語で読む → - 論文自動運転/VLA画像認識
UniDriveVLA:自動運転のための理解・知覚・行動計画の統合
自動運転向けのVLAモデルにおいて、空間知覚と意味推論の競合を解消するため、Mixture-of-Transformersによる専門家分離を導入した統合モデルUniDriveVLAを提案し、nuScenesとBench2Driveで最先端性能を達成した。
原題: UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving / Yongkang Li, Lijun Zhou, Sixu Yan 他
日本語で読む → - 論文VLAロボティクス
ロックインの打破:低データVLA後訓練における操縦性の維持
低データでの後訓練後にVLAポリシーが新しい指示に応答しなくなる「ロックイン」現象を特定し、視覚的接地の維持とテスト時の対照的プロンプトガイダンスによりこれを緩和するDeLockを提案した。
原題: Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training / Suning Huang, Jiaqi Shao, Ke Wang 他
日本語で読む → - 論文VLAロボティクス
AIM: 空間価値マップを用いた意図認識型統合世界行動モデリング
事前学習済みのビデオ生成モデルを基盤に、将来の観測と空間価値マップを共同で予測し、意図認識型の注意機構と自己蒸留強化学習によりロボットの行動生成を高精度化する手法を提案した。
原題: AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps / Liaoyuan Fan, Zetian Xu, Chen Cao 他
日本語で読む → - 論文VLAロボティクス
前方・逆動力学の事前学習分離によるロボット学習の非絡み合い化
視覚と言語・行動の予測を分離し、前方動力学モデルと逆動力学モデルを別々に事前学習してから統合するフレームワークDeFIを提案し、CALVINやSimplerEnvなどのベンチマークで最先端性能を達成した。
原題: Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining / Wenyao Zhang, Bozhou Zhang, Zekun Qi 他
日本語で読む → - 論文VLA/操作ロボティクス
CodeGraphVLP: コードによる計画とセマンティックグラフ状態を組み合わせた非マルコフ型視覚言語行動モデル
長期的なロボット操作タスクにおいて、セマンティックグラフ状態とコードベースのプランナーを組み合わせ、視覚言語行動モデルの実行を支援する階層的フレームワークを提案した。
原題: CodeGraphVLP: Code-as-Planner Meets Semantic-Graph State for Non-Markovian Vision-Language-Action Models / Khoa Vo, Sieu Tran, Taisei Hanyu 他
日本語で読む → - 論文VLA/3D推論画像認識
3D-VCD: 視覚的対照デコードによる3D-LLM具現化エージェントの幻覚抑制
3D環境で動作する大規模マルチモーダルモデルの幻覚を抑えるため、3Dシーングラフに摂動を加えて対照デコードする初の推論時手法を提案した。
原題: 3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding / Makanjuola Ogunleye, Eman Abdelrahman, Ismini Lourentzou
日本語で読む → - 論文VLAロボティクス
世界-価値-行動モデル:視覚言語行動システムのための暗黙的プランニング
視覚言語行動(VLA)モデルに、将来の軌跡の潜在表現を学習し、価値関数で評価することで暗黙的プランニングを可能にする統一フレームワークを提案した。
原題: World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems / Runze Li, Hongyin Zhang, Junxi Jin 他
日本語で読む → - 論文VLA/マニピュレーションロボティクス
AnySlot: ゼロショットのスロット配置のための目標条件付き視覚言語行動ポリシー
言語指示による精密な物体配置を実現するため、言語を視覚的な目標マーカーに変換し、目標条件付きVLAポリシーで実行する階層的フレームワークを提案。また、スロット配置の評価用ベンチマークSlotBenchも導入。
原題: AnySlot: Goal-Conditioned Vision-Language-Action Policies for Zero-Shot Slot-Level Placement / Zhaofeng Hu, Sifan Zhou, Qinbo Zhang 他
日本語で読む →