論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
FASTER: リアルタイムフローVLAの再考
フロー型VLAの反応遅延を分析し、Horizon-Aware Scheduleで直近動作のデノイズを1ステップに短縮してリアルタイム応答性を大幅に改善した手法を提案。
原題: FASTER: Rethinking Real-Time Flow VLAs / Yuxiang Lu, Zhe Liu, Xianzhe Fan 他
日本語で読む → - 論文VLA画像認識
TagaVLM: 視覚言語ナビゲーションのためのトポロジー認識型グローバル行動推論
VLMの自己注意機構に空間トポロジー構造を直接注入し、グローバルな行動推論を可能にすることで、視覚言語ナビゲーションの性能を向上させたフレームワーク。
原題: TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation / Jiaxing Liu, Zexi Zhang, Xiaoyan Li 他
日本語で読む → - 論文VLAロボティクス
最適化としての生成的制御:適応的で堅牢なロボット制御のための時間無条件フローマッチング
行動生成を軌道積分ではなく反復最適化として扱う時間無条件フレームワークGeCOを提案し、状態の難易度に応じて計算量を適応させ、OOD検出も可能にした。
原題: Generative Control as Optimization: Time Unconditional Flow Matching for Adaptive and Robust Robotic Control / Zunzhe Zhang, Runhan Huang, Yicheng Liu 他
日本語で読む → - 論文VLAロボティクス
VTAM:視覚と言語を超え、触覚を統合したビデオ・触覚・行動モデル
映像から行動を予測するVAMに触覚を追加し、接触の多い繊細な操作を安定化させるマルチモーダル世界モデルを提案。ポテトチップスの把持などで大幅な性能向上を実現。
原題: VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs / Haoran Yuan, Weigang Yi, Zhenyu Zhang 他
日本語で読む → - 論文VLAロボティクス
Safe-Night VLA: 熱知覚視覚言語行動モデルによる安全クリティカルなマニピュレーション
RGBでは見えない熱情報をVLAモデルに統合し、制御バリア関数による安全フィルタを組み合わせることで、非構造環境での安全な熱認識マニピュレーションを実現した研究。
原題: Safe-Night VLA: Seeing the Unseen via Thermal-Perceptive Vision-Language-Action Models for Safety-Critical Manipulation / Dian Yu, Qingchuan Zhou, Bingkun Huang 他
日本語で読む → - 論文VLAロボティクス
ニューラル暗黙アクションフィールド:視覚-言語-行動モデルのための離散ウェイポイントから連続関数へ
VLAモデルの行動表現を離散ウェイポイントから連続時間の行動関数へ再定式化し、任意の時間分解能で滑らかな制御を可能にした手法を提案。
原題: Neural Implicit Action Fields: From Discrete Waypoints to Continuous Functions for Vision-Language-Action Models / Haoyun Liu, Jianzhuang Zhao, Xinyuan Chang 他
日本語で読む → - 論文VLAロボティクス
RoboMME:ロボット汎用ポリシーの記憶能力を評価・理解するベンチマーク
長期的・履歴依存的な操作タスクにおけるVLAモデルの記憶機構を評価するため、16タスクからなる標準ベンチマークと14種の記憶拡張VLAを構築し、記憶表現の有効性がタスク依存であることを示した。
原題: RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies / Yinpei Dai, Hongze Fu, Jayjun Lee 他
日本語で読む → - 論文VLA/推論高速化ロボティクス
KERV: 身体化VLAモデルのための運動学的修正投機的復号
VLAモデルの推論を高速化するため、運動学に基づくカルマンフィルタでアクションを予測し、投機的復号の誤りを補正するフレームワークKERVを提案。誤り訂正の再推論を回避し、受容閾値を動的に調整することで、成功率をほぼ落とさずに27〜37%の高速化を達成した。
原題: KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models / Zihao Zheng, Zhihao Mao, Maoliang Li 他
日本語で読む → - 論文VLA画像認識
動的環境における汎化可能なロボットマニピュレーションに向けて
動的環境でのロボット操作のための大規模データセットDOMINOとベンチマークを構築し、動きを考慮したVLAモデルPUMAを提案した論文。
原題: Towards Generalizable Robotic Manipulation in Dynamic Environments / Heng Fang, Shangru Li, Shuhan Wang 他
日本語で読む → - 論文VLAロボティクス
ProgressVLA: 進捗ガイド付き拡散ポリシーによる視覚言語ロボット操作
ロボット操作のための視覚言語行動モデルに、タスク進捗の推定と微分可能な進捗ガイダンスを導入し、長期的なタスクでの成功率と汎化性能を向上させた。
原題: ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation / Hongyu Yan, Qiwei Li, Jiaolong Yang 他
日本語で読む → - 論文VLAロボティクス
SaiVLA-0: 大脳・橋・小脳の三部門構成による計算量を意識した視覚-言語-行動モデル
脳の大脳・橋・小脳の役割分担に着想を得て、凍結した視覚言語基盤と適応層、高速な並列カテゴリカル制御を組み合わせたVLAアーキテクチャを提案し、特徴キャッシュにより学習時間短縮と成功率向上を示した。
原題: SaiVLA-0: Cerebrum--Pons--Cerebellum Tripartite Architecture for Compute-Aware Vision-Language-Action / Xiang Shi, Wenlong Huang, Menglin Zou 他
日本語で読む → - 論文VLAロボティクス
形態情報をTransformerに埋め込むクロスロボット方策学習
ロボットの関節構造やトポロジーをTransformerに組み込み、複数の機体にまたがって動作する方策を学習する手法を提案した論文。
原題: Embedding Morphology into Transformers for Cross-Robot Policy Learning / Kei Suzuki, Jing Liu, Ye Wang 他
日本語で読む → - 論文VLAロボティクス
ISAC対応ロボット障害物回避のための目標指向セマンティック通信
UAVの障害物回避に向け、カルマンフィルタとマハラノビス距離ベースDWA、情報価値に基づく深層Qネットワークを組み合わせた目標指向セマンティック通信フレームワークを提案した。
原題: Goal-Oriented Semantic Communication for ISAC-Enabled Robotic Obstacle Avoidance / Wenjie Liu, Yansha Deng, Henk Wymeersch
日本語で読む → - 論文VLAロボティクス
FloorPlan-VLN: フロアプラン誘導型視覚言語ナビゲーションの新パラダイム
視覚言語ナビゲーション(VLN)において、フロアプランを大域的な空間事前情報として活用する新しいタスクとデータセットを提案し、簡潔な指示だけでナビゲーションを可能にする手法FP-Navを導入した。
原題: FloorPlan-VLN: A New Paradigm for Floor Plan Guided Vision-Language Navigation / Kehan Chen, Yan Huang, Dong An 他
日本語で読む → - 論文VLA/長期的タスクロボティクス
RoboClaw: 長期的ロボットタスクのためのスケーラブルなエージェント型フレームワーク
RoboClawは、データ収集・ポリシー学習・タスク実行を単一のVLM駆動コントローラで統合し、自己リセット機構により人間の介入を最小限に抑えつつ長期的タスクを自律的に実行するロボットフレームワークを提案する。
原題: RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks / Ruiying Li, Yunlang Zhou, YuYao Zhu 他
日本語で読む → - 論文VLA/器用操作ロボティクス
視覚言語行動モデルのためのクロスハンド潜在表現
多様な器用なロボットハンド間で共有可能な統一潜在行動空間を導入し、標準的なVLAアーキテクチャに組み込むことで、クロスエンボディメント学習を可能にするXL-VLAを提案した。
原題: Cross-Hand Latent Representation for Vision-Language-Action Models / Guangqi Jiang, Yutong Liang, Jianglong Ye 他
日本語で読む → - 論文VLAAI
OOWM: オブジェクト指向プログラムによる世界モデリングで身体性推論と計画を構造化
LLMの身体性タスク推論を、UMLのクラス図とアクティビティ図を用いたオブジェクト指向の世界モデルとして明示的に構造化し、SFTとGRPOで訓練する枠組みを提案。
原題: OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling / Hongyu Chen, Liang Lin, Guangrun Wang
日本語で読む → - 論文VLA機械学習
ジャンピーワールドモデルによる構成的一般計画
事前学習済み方策を時間的に拡張された行動として組み合わせ、複数タイムスケールの状態占有を予測する「ジャンピーワールドモデル」を学習することで、長期的な操作・ナビゲーションタスクの計画性能を大幅に向上させた研究。
原題: Compositional Planning with Jumpy World Models / Jesse Farebrother, Matteo Pirotta, Andrea Tirinzoni 他
日本語で読む → - 論文VLA機械学習
QuantVLA: 視覚言語行動モデルのためのスケール校正済み訓練不要ポストトレーニング量子化
VLAモデルを訓練なしで低ビット量子化する初のPTQフレームワークを提案し、拡散トランスフォーマの行動ヘッドも量子化してメモリを約70%削減しつつ成功率を向上させた。
原題: QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models / Jingxuan Zhang, Yunta Hsieh, Zhongwei Wan 他
日本語で読む → - 論文VLA機械学習
生成モデルにおけるGRPOの進展:サーベイ
Flow-GRPOをはじめとする生成モデル向けGRPO系強化学習アラインメントの手法と応用を、報酬設計や多様性保持などの観点から体系的に整理したサーベイ。
原題: Advances in GRPO for Generation Models: A Survey / Zexiang Liu, Xianglong He, Yangguang Li
日本語で読む → - 論文VLA量子化機械学習
HBVLA: 視覚-言語-行動モデルへの1ビット訓練後量子化の限界突破
VLAモデルを1ビットに二値化する際、行動生成に重要な重みをヘッセ行列で特定し、ハール領域でのグループ単位量子化を行うことで、精度劣化を抑えつつ省メモリ化を実現した。
原題: HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models / Xin Yan, Zhenglin Wan, Feiyang Ye 他
日本語で読む → - 論文VLA自然言語
視覚言語モデルにおける文脈依存アフォーダンス計算
視覚言語モデルが場面の文脈(エージェントの役割など)に応じて物体のアフォーダンス記述を大きく変化させる現象を定量化し、その変化が生成ノイズではなく安定した潜在因子に基づくことを示した。
原題: Context-Dependent Affordance Computation in Vision-Language Models / Murad Farzulla
日本語で読む → - 論文VLAAI
予算制約付きエージェント型大規模言語モデル:高コストツール利用のための意図ベース計画
厳しい金銭的予算下で外部ツールを呼び出して多段階タスクを解くLLMエージェントのための、意図認識型階層的世界モデルによる推論時計画フレームワークINTENTを提案。
原題: Budget-Constrained Agentic Large Language Models: Intention-Based Planning for Costly Tool Use / Hanbing Liu, Chunhao Tian, Nan An 他
日本語で読む → - 論文VLA機械学習
アフォーダンスを活用したLLMによる部分的世界モデリング
大規模言語モデルを部分的世界モデルとして捉え、アフォーダンスに基づく予測を抽出することで探索効率とタスク性能を向上させる手法を提案した論文。
原題: Affordances Enable Partial World Modeling with LLMs / Khimya Khetarpal, Gheorghe Comanici, Jonathan Richens 他
日本語で読む → - 論文VLA機械学習
オンデバイスLLMのためのハードウェア協調設計スケーリング則:ルーフライン・モデリングによるアプローチ
オンデバイスLLMのアーキテクチャ選択を高速化するため、訓練損失のスケーリング則と推論レイテンシのルーフラインモデルを組み合わせ、精度とレイテンシのパレートフロンティアを導出するハードウェア協調設計手法を提案した。
原題: Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device LLMs / Luoyang Sun, Jiwen Jiang, Yifeng Ding 他
日本語で読む → - 論文VLA機械学習
世界モデルによる実行可能な計画への生成動画のグラウンディング
生成動画を計画として使う際の物理的・時間的な不整合を、学習した行動条件付き世界モデルで潜在空間の軌道最適化により実行可能な行動列へ変換する手法を提案。
原題: Grounding Generated Videos in Feasible Plans via World Models / Christos Ziakas, Amir Bar, Alessandra Russo
日本語で読む → - 論文VLAロボティクス
潜在的他者視点取得:影響拡張ローカルモデルにおけるシュレーディンガー橋
他者の隠れた心的状態を推論するため、ニューロシンボリックな世界モデルとシュレーディンガー橋による視点変換を組み合わせ、社会的ナビゲーションタスクでモデルベース強化学習を行う手法を提案。
原題: Latent Perspective-Taking via a Schr\"odinger Bridge in Influence-Augmented Local Models / Kevin Alcedo, Pedro U. Lima, Rachid Alami
日本語で読む → - 論文VLAナビゲーションロボティクス
LongNav-R1: 長期的VLAナビゲーションのための適応的マルチターン強化学習
VLAモデルによる長期的ナビゲーションを、環境とのマルチターン対話として強化学習する枠組みを提案し、Horizon-Adaptive Policy Optimizationで時間的信用割当を改善、成功率を64.3%から73.0%に向上させた。
原題: LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation / Yue Hu, Avery Xi, Qixin Xiao 他
日本語で読む → - 論文VLAロボティクス
SimVLA:ロボットマニピュレーションのためのシンプルなVLAベースライン
知覚と制御を分離した軽量なVLAモデルを提案し、ロボット事前学習なしで大規模モデルを上回る性能をシミュレーションと実機で示した。
原題: SimVLA: A Simple VLA Baseline for Robotic Manipulation / Yuankai Luo, Woping Chen, Tong Liang 他
日本語で読む → - 論文VLA画像認識
QVLA: 視覚-言語-行動モデルの量子化におけるチャネルごとの重要度割り当て
VLAモデルの量子化を行動空間の感度に基づいてチャネル単位でビット幅を割り当てる手法を提案し、メモリ削減とタスク成功率の両立を実現した。
原題: QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization / Yuhao Xu, Yantai Yang, Zhenyang Fan 他
日本語で読む →