論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/1/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
一歩で十分:分散型MeanFlow方策最適化
拡散・フローマッチング方策の多段サンプリングを不要にし、蒸留なしの1ステップ生成と分散正則化・RL微調整を組み合わせて120Hz超のリアルタイムロボット制御を実現した手法を提案。
原題: One Step Is Enough: Dispersive MeanFlow Policy Optimization / Guowei Zou, Haitao Wang, Hejun Wu 他
日本語で読む → - 論文VLAロボティクス
ActiveVLA: 能動的知覚を視覚-言語-行動モデルに統合した高精度3Dロボットマニピュレーション
静的な手首カメラに頼る従来のVLAモデルに対し、重要領域の特定と能動的な視点選択・3Dズームインを行う2段階の枠組みを導入し、長期的・微細な操作精度を向上させた。
原題: ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation / Zhenyang Liu, Yongchong Gu, Yikai Wang 他
日本語で読む → - 論文VLAロボティクス
FRoM-W1: 言語指示による汎用人型全身制御フレームワーク
自然言語から人型ロボットの全身動作を生成・実行する2段階フレームワークを提案し、Unitree H1/G1で動作追従精度の向上を実証した。
原題: FRoM-W1: Towards General Humanoid Whole-Body Control with Language Instructions / Peng Li, Zihan Zhuang, Yangfan Gao 他
日本語で読む → - 論文VLAロボティクス
IVRA: 学習不要のヒント誘導による視覚トークン関係改善でロボット行動方策を強化
VLAモデルの視覚エンコーダ内の親和性情報を推論時に注入し、再学習なしで視覚トークンの空間理解を改善する手法を提案。
原題: IVRA: Improving Visual-Token Relations for Robot Action Policy with Training-Free Hint-Based Guidance / Jongwoo Park, Kanchana Ranasinghe, Jinhyeok Jang 他
日本語で読む → - 論文VLAロボティクス
FIRE-VLM:物理ベース火災デジタルツインにおけるUAV山火事追跡のための視覚言語駆動強化学習フレームワーク
高忠実度の山火事デジタルツイン内で、視覚言語モデル(VLM)の意味的報酬整形を用いてUAVの強化学習を行い、火災検出時間を最大6倍短縮した。
原題: FIRE-VLM: A Vision-Language-Driven Reinforcement Learning Framework for UAV Wildfire Tracking in a Physics-Grounded Fire Digital Twin / Chris Webb, Mobin Habibpour, Mayamin Hamid Raha 他
日本語で読む → - 論文VLAロボティクス
DroneVLA:視覚言語行動モデルによる空中マニピュレーション
自然言語の指示を理解するVLAモデルとGrounding DINOを組み合わせ、1自由度グリッパ付きドローンが対象物を把持し人へ受け渡すシステムを構築した。実機実験で位置推定・ナビゲーションの精度を検証した。
原題: DroneVLA: VLA based Aerial Manipulation / Fawad Mehboob, Monijesu James, Amir Habel 他
日本語で読む → - 論文VLAロボティクス
MetaWorld:高レベル指示を接地するための階層型ワールドモデルにおけるスキル転送と構成
VLMによる意味計画と潜在ダイナミクスモデルを組み合わせた階層型ワールドモデルを提案し、事前学習済みマルチエキスパート方策を転送することでヒューマノイドのロコマニピュレーションを効率化した。
原題: MetaWorld: Skill Transfer and Composition in a Hierarchical World Model for Grounding High-Level Instructions / Yutong Shen, Hangxu Liu, Kailin Pei 他
日本語で読む → - 論文VLA画像認識
蒸留とRGB-D Transformerによる高密度視覚埋め込みの効率的予測
Alpha-CLIPの教師埋め込みを蒸留し、RGB-D画像からピクセル単位のテキスト対応視覚埋め込みをリアルタイムで予測するDVEFormerを提案。
原題: Efficient Prediction of Dense Visual Embeddings via Distillation and RGB-D Transformers / Söhnke Benedikt Fischedick, Daniel Seichter, Benedict Stephan 他
日本語で読む → - 論文VLAロボティクス
テスト時強化学習によるVLAモデルのオンライン適応
推論中に段階的なタスク進捗を報酬として強化学習を行い、VLAモデルをその場で適応させるTT-VLAを提案。未知環境での適応性と成功率を向上させた。
原題: On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning / Changyu Liu, Yiyang Liu, Taowen Wang 他
日本語で読む → - 論文VLAロボティクス
CulinaryCut-VLAP:力覚対応マテリアルポイント法による食品切断のための視覚-言語-行動-物理フレームワーク
食品切断を対象に、MLS-MPMベースの物理シミュレータと視覚・言語・行動データセットを統合し、力覚情報を含む学習・評価ループを構築した研究。
原題: CulinaryCut-VLAP: A Vision-Language-Action-Physics Framework for Food Cutting via a Force-Aware Material Point Method / Hyunseo Koh, Chang-Yong Song, Youngjae Choi 他
日本語で読む → - 論文VLAロボティクス
VLAgents: VLA推論を効率化するポリシーサーバ
VLAモデルの推論を統一プロトコルで抽象化し、共有メモリと圧縮ストリーミングで通信を最適化するモジュラーポリシーサーバを提案。
原題: VLAgents: A Policy Server for Efficient VLA Inference / Tobias Jülg, Khaled Gamal, Nisarga Nilavadi 他
日本語で読む → - 論文VLAロボティクス
LaST₀:ロボット視覚言語行動モデルのための潜在時空間チェーン・オブ・ソート
言語ではなく潜在空間で未来の視覚・3D・固有感覚を推論する時空間Chain-of-Thoughtを導入し、低頻度推論と高頻度行動生成を分離した二重システムVLAフレームワークを提案。
原題: LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model / Zhuoyang Liu, Jiaming Liu, Hao Chen 他
日本語で読む → - 論文VLAロボティクス
視覚言語モデルによる社会的規範に沿ったロボットナビゲーションのためのプロンプト設計の探求
社会的規範に沿ったロボットナビゲーションにおいて、小型視覚言語モデル(VLM)の性能を引き出すプロンプト設計を、システム指示と動機づけの枠組みの2軸で検討し、競争相手の設定や微調整との相互作用を実験的に明らかにした。
原題: Probing Prompt Design for Socially Compliant Robot Navigation with Vision Language Models / Ling Xiao, Toshihiko Yamasaki
日本語で読む → - 論文VLAロボティクス
TaF-VLA: 力に基づくマニピュレーションのための触覚-力アラインメントVLAモデル
触覚入力を視覚的テクスチャではなく物理的な接触力に結びつけるTaF-Adapterを提案し、1000万件超の触覚-力同期データセットで学習してVLAモデルに統合した。
原題: TaF-VLA: Tactile-Force Alignment in Vision-Language-Action Models for Force-aware Manipulation / Yuzhe Huang, Pei Lin, Wanlin Li 他
日本語で読む → - 論文VLAロボティクス
身体性AIのためのメンタルワールドモデリング:包括的レビュー
身体性AIエージェントの社会的知能を実現するため、人間の内的心理状態を構造的に表現する「メンタルワールドモデル」に関する100以上の研究を整理し、理論枠組みと構成要素を体系化したレビュー。
原題: Modeling the Mental World for Embodied AI: A Comprehensive Review / Biyuan Liu, Daigang Xu, Lei Jiang 他
日本語で読む → - 論文VLAロボティクス
CycleVLA: サブタスクバックトラッキングと最小ベイズリスクデコーディングによる能動的自己修正型視覚言語行動モデル
VLAモデルに失敗を予期して実行中に自己修正する能力を付与し、サブタスクのバックトラッキングとMBRデコーディングで再試行成功率を高める手法を提案。シミュレーションと実機で成功率向上を実証。
原題: CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding / Chenyang Ma, Kai Lu, Guangyu Yang 他
日本語で読む → - 論文VLAロボティクス
Action-Sketcher: 視覚スケッチを介した長期的ロボット操作のための推論から行動へ
ロボットの視界に点・箱・矢印・関係を描く「視覚スケッチ」を中間表現として導入し、See-Think-Sketch-Actのサイクルで長期的な操作を実現するVLAフレームワークを提案。
原題: Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation / Huajie Tan, Peterson Co, Yijie Xu 他
日本語で読む → - 論文VLAAI
デジタルからフィジカルへ:物理知能のための自律型コーチとしてのデジタルエージェント
LLMエージェントが強化学習や模倣学習のタスク設計・デバッグ・最適化を自律的に行うベンチマークEmboCoach-Benchを提案し、人間設計を上回る性能を実証した。
原題: From Digital to Physical: Digital Agents as Autonomous Coaches for Physical Intelligence / Zixing Lei, Genjia Liu, Yuanshuo Zhang 他
日本語で読む → - 論文VLAロボティクス
SeqWalker: 階層的計画による逐次視野言語ナビゲーション
長期的な多タスク指示を階層的計画で分割し、視覚観察に基づくサブ指示選択と探索検証で軌道誤りを修正する視野言語ナビゲーションモデルを提案。
原題: SeqWalker: Sequential-Horizon Vision-and-Language Navigation with Hierarchical Planning / Zebin Han, Xudong Wang, Baichen Liu 他
日本語で読む → - 論文VLAロボティクス
DV-VLN: LLMベース視覚言語ナビゲーションのための信頼性の高い二重検証
LLMによる視覚言語ナビゲーションで、生成した行動候補を真偽検証とマスク実体検証の二重チャネルで検証し、信頼性を高めるフレームワークを提案。
原題: DV-VLN: Dual Verification for Reliable LLM-Based Vision-and-Language Navigation / Zijun Li, Shijie Li, Zhenxi Zhang 他
日本語で読む → - 論文VLAロボティクス
TIDAL: 拡散と行動の時間的インターリーブループによる高頻度VLA制御
拡散ベースVLAの推論遅延を解消するため、低頻度の意味推論と高頻度の行動生成を分離・交互実行する階層フレームワークを提案し、動的環境での追従性能を向上させた。
原題: TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control / Yuteng Sun, Haoran Wang, Ruofei Bai 他
日本語で読む → - 論文VLAロボティクス
LLM制御ロボティクスにおける信頼性:セキュリティ脅威、防御策、課題のサーベイ
LLMで制御されるロボットのセキュリティ脅威と防御策を体系的に整理し、攻撃手法・防御機構・評価ベンチマークを分類したサーベイ。
原題: Trust in LLM-controlled Robotics: a Survey of Security Threats, Defenses and Challenges / Xinyu Huang, Shyam Karthick V B, Taozhao Chen 他
日本語で読む → - 論文VLAロボティクス
RoboReward: ロボティクス向け汎用視覚言語報酬モデル
実ロボットの大規模データセットから報酬モデル用データセットとベンチマークを構築し、4B/8Bの視覚言語報酬モデルを訓練。短期的なロボットタスクで大規模VLMを上回る性能を達成し、実機強化学習に適用した。
原題: RoboReward: General-Purpose Vision-Language Reward Models for Robotics / Tony Lee, Andrew Wagenmaker, Karl Pertsch 他
日本語で読む → - 論文VLAロボティクス
Shallow-π: フローベースVLAのための知識蒸留
フローベースの視覚-言語-行動モデルのTransformer層を18層から6層に削減する知識蒸留フレームワークを提案し、成功率をほぼ落とさず2倍以上の推論高速化を実現した。
原題: Shallow-{\pi}: Knowledge Distillation for Flow-based VLAs / Boseong Jeon, Yunho Choi, Taehan Kim
日本語で読む → - 論文VLAロボティクス
VLingNav: 適応的推論と視覚支援言語記憶による身体性ナビゲーション
人間の二重過程理論に着想を得た適応的Chain-of-Thoughtと視覚支援言語記憶を備えたVLAナビゲーションモデルを提案し、長期的タスクにおける推論と記憶を強化した。
原題: VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory / Shaoan Wang, Yuanfei Luo, Xingyu Chen 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルのための安定した言語ガイダンス
VLAモデルが言語の言い回しの変化に弱い「モダリティ崩壊」を解決するため、意味意図と視覚的アフォーダンスを分離する確率的フレームワークRSSを提案し、敵対的な言語摂動下でも頑健な操作性能を実現した。
原題: Stable Language Guidance for Vision-Language-Action Models / Zhihao Zhan, Yuhao Chen, Jiaying Zhou 他
日本語で読む → - 論文VLAロボティクス
ロボット操作のためのエージェント型LLMフレームワークALRM
LLMによる推論とロボット制御を統合したエージェント型フレームワークALRMを提案し、多様な言語指示を含む56タスクの新ベンチマークで評価した。
原題: ALRM: Agentic LLM for Robotic Manipulation / Vitor Gaboardi dos Santos, Ibrahim Khadraoui, Ibrahim Farhat 他
日本語で読む → - 論文VLAロボティクス
LLMエージェントによる探索とスキル統合を用いたロボットナビゲーションとマニピュレーション
屋内ショッピングタスクを対象に、LLMベースのエージェントが看板検出で意味地図を構築し、自然言語指示から店舗間移動と物体把持までを一貫して実行するシステムを提案した。
原題: LLM-Based Agentic Exploration for Robot Navigation & Manipulation with Skill Orchestration / Abu Hanif Muhammad Syarubany, Farhan Zaki Rahmani, Trio Widianto
日本語で読む → - 論文VLAロボティクス
視点不変な潜在行動によるロバストな行動学習
軌道間の遷移パターンを捉える潜在行動をモデル化し、視点不変な表現を学習することで、未知の視点や新しいタスクへの汎化性能を向上させる事前学習フレームワークVILAを提案。
原題: Learning to Act Robustly with View-Invariant Latent Actions / Youngjoon Jeong, Junha Chun, Taesup Kim
日本語で読む → - 論文VLAロボティクス
RoboBrain 2.5:奥行きを見据え、時間を心に刻む
深度認識に基づく3D空間推論と、時間的な進捗予測を統合した次世代の身体性AI基盤モデルを提案し、複雑なマニピュレーションの精度と実行認識を向上させた。
原題: RoboBrain 2.5: Depth in Sight, Time in Mind / Huajie Tan, Enshen Zhou, Zhiyu Li 他
日本語で読む →