論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/12/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
HiF-VLA: 運動表現による視覚-言語-行動モデルのための後知恵・洞察・先見
ロボット操作のためのVLAモデルに、過去・現在・未来の運動情報を統合する世界モデルを組み込み、長期的なタスクの一貫性を向上させた研究。
原題: HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models / Minghui Lin, Pengxiang Ding, Shu Wang 他
日本語で読む → - 論文VLA画像認識
VAT: ViTの全表現を活用する視覚行動トランスフォーマー
ViTの全層の特徴を行動生成に融合させるVATを提案し、LIBEROベンチマークで98.15%の成功率を達成した模倣学習モデル。
原題: VAT: Vision Action Transformer by Unlocking Full Representation of ViT / Wenhao Li, Chengwei Ma, Weixin Mao
日本語で読む → - 論文VLAロボティクス
ManualVLA:思考連鎖による手順書生成とロボット操作を統合したVLAモデル
目標状態から実行手順を推論する「Manual Chain-of-Thought」を導入し、手順書生成と操作実行をMixture-of-Transformersで統合したVLAモデルを提案。3D Gaussian Splattingによるデジタルツインで訓練データを自動生成する。
原題: ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation / Chenyang Gu, Jiaming Liu, Hao Chen 他
日本語で読む → - 論文VLAAI
創発:能動的問い合わせによる非対称身体性エージェントの特権情報バイアス克服
AI2-THOR内で知識を持つLeaderとセンサー制限のあるFollowerの協調を検証し、能動的問い合わせが特権情報バイアスを軽減することを示した研究。
原題: Emergence: Overcoming Privileged Information Bias in Asymmetric Embodied Agents via Active Querying / Shaun Baek, Sam Liu, Joseph Ukpong
日本語で読む → - 論文VLA自然言語
食器を出して:収納された家庭用品の意味理解
家庭内で「お皿を持ってきて」という指示に対し、見えない収納場所を推論するベンチマークと、視覚と言語モデルを組み合わせたNOAMを提案した論文。
原題: Break Out the Silverware -- Semantic Understanding of Stored Household Items / Michaela Levi-Richter, Reuth Mirsky, Oren Glickman
日本語で読む → - 論文VLAロボティクス
固有感覚情報を活用した視覚言語モデルによるロボットタスクのキャプション生成とサブタスク分割
ロボットの関節・エンドエフェクタ状態を視覚言語モデルに入力し、タスクの自動キャプション生成とサブタスク分割の精度を向上させる手法を提案し、シミュレータ実験で有効性を検証した。
原題: Proprioception Enhances Vision Language Model in Generating Captions and Subtask Segmentations for Robot Task / Kanata Suzuki, Shota Shimizu, Tetsuya Ogata
日本語で読む → - 論文VLAロボティクス
VLSA: プラグアンドプレイ安全制約層を備えた視覚-言語-行動モデル
VLAモデルに制御バリア関数ベースの安全制約層を追加し、指示追従性能を保ちつつ衝突回避を改善する手法を提案し、SafeLIBEROベンチマークで評価した。
原題: VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer / Songqiao Hu, Zeyi Liu, Shuang Liu 他
日本語で読む → - 論文VLAロボティクス
大規模動画プランナーによる汎用ロボット制御
インターネット規模の人間活動動画で生成的なロボット計画モデルを基盤モデル規模で学習し、新しい場面やタスクに対してゼロショットで動画計画を生成して実機の行動に変換する手法を提案した。
原題: Large Video Planner Enables Generalizable Robot Control / Boyuan Chen, Tianyuan Zhang, Haoran Geng 他
日本語で読む → - 論文VLAロボティクス
Vidarc: 閉ループ制御のための身体性ビデオ拡散モデル
マスク付き逆動力学モデルを組み合わせた自己回帰的な身体性ビデオ拡散モデルにより、低遅延で高精度なロボットアームの閉ループ制御を実現した研究。
原題: Vidarc: Embodied Video Diffusion Model for Closed-loop Control / Yao Feng, Chendong Xiang, Xinyi Mao 他
日本語で読む → - 論文VLAロボティクス
RoboMirror: 模倣の前に理解する、動画からヒューマノイド歩行への変換
VLMを用いて動画から視覚的な運動意図を抽出し、拡散ポリシーを条件付けることで、ポーズ再構成やリターゲティングなしにヒューマノイドの歩行を生成するフレームワークを提案。
原題: RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion / Zhe Li, Cheng Chi, Boan Zhu 他
日本語で読む → - 論文VLA画像認識
VLN-MME:言語誘導視覚ナビゲーションエージェントとしてのMLLMの診断
視覚と言語によるナビゲーション(VLN)タスクでMLLMをゼロショットエージェントとして評価する統一ベンチマークVLN-MMEを提案し、CoT推論や自己反省を加えると性能が低下するなど、 embodiedナビゲーションにおけるMLLMの空間推論の弱さを明らかにした。
原題: VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents / Xunyi Zhao, Gengze Zhou, Qi Wu
日本語で読む → - 論文VLAロボティクス
VLA-Arena: 視覚言語行動モデルを評価するためのオープンソースベンチマークフレームワーク
VLAモデルの能力限界と失敗モードを定量化するため、タスク構造・言語・視覚の3軸で難易度を設計した170タスクのベンチマークを提案し、最先端モデルの汎化不足や安全性軽視を明らかにした。
原題: VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models / Borong Zhang, Jiahao Li, Jiachen Shen 他
日本語で読む → - 論文VLAロボティクス
HELP: 家庭タスクのための階層型身体化言語プランナ
家庭内タスクを解くため、LLMベースの複数エージェントを階層的に組み合わせたプランナを提案し、実機実験で評価した。
原題: HELP: Hierarchical Embodied Language Planner for Household Tasks / Alexandr V. Korchemnyi, Anatoly O. Onishchenko, Eva A. Bakaeva 他
日本語で読む → - 論文VLAロボティクス
自律飛行体のための視覚的方位予測
単眼カメラ映像からYOLOv5で地上車両を検出し、軽量ニューラルネットでUAVの方位角を予測するGPS不要の協調フレームワークを提案。
原題: Visual Heading Prediction for Autonomous Aerial Vehicles / Reza Ahmari, Ahmad Mohammadi, Vahid Hemmati 他
日本語で読む → - 論文VLAロボティクス
一度見れば実行できる:ワンショット動画デモからタスクを学習する視覚-言語-行動モデル
テスト時に1本の専門家デモ動画を見るだけで新しい操作スキルを獲得できるVLAモデルViVLAを提案し、未見タスクで30%以上の性能向上を達成した。
原題: See Once, Then Act: Vision-Language-Action Model with Task Learning from One-Shot Video Demonstrations / Guangyan Chen, Meiling Wang, Qi Shao 他
日本語で読む → - 論文VLAロボティクス
WholeBodyVLA:全身移動操作のための統合潜在VLA
低コストな自己視点動画から移動操作知識を学ぶ統合潜在VLAと、精密な移動指令を実行するRLポリシーを組み合わせ、ヒューマノイドの広域移動操作を実現した。
原題: WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control / Haoran Jiang, Jin Chen, Qingwen Bu 他
日本語で読む → - 論文VLAロボティクス
WAM-Diff: マスク拡散とMoE・オンライン強化学習を統合した自動運転VLAフレームワーク
自動運転の軌道生成にマスク拡散モデルを適用し、スパースMoEとオンライン強化学習を組み合わせることで、NAVSIMベンチマークで高い性能を達成したVLAフレームワーク。
原題: WAM-Diff: A Masked Diffusion VLA Framework with MoE and Online Reinforcement Learning for Autonomous Driving / Mingwang Xu, Jiahao Cui, Feipeng Cai 他
日本語で読む → - 論文VLAロボティクス
建設作業におけるロボットスキル学習のサンプル効率:階層型強化学習と視覚言語行動VLAモデルのベンチマーク
建設ロボットのスキル学習において、VLAモデルと強化学習を比較し、VLAが汎化性能と少数ショット学習で優れ、実タスクへの適用が容易であることを示した。
原題: Sample-Efficient Robot Skill Learning for Construction Tasks: Benchmarking Hierarchical Reinforcement Learning and Vision-Language-Action VLA Model / Zhaofeng Hu, Hongrui Yu, Vaidhyanathan Chandramouli 他
日本語で読む → - 論文VLAロボティクス
VLA-RAIL: VLAモデルとロボットのためのリアルタイム非同期推論リンカー
VLAモデルの推論とロボット制御を非同期化し、軌道平滑化とチャンク融合により動作のジッターや停止を抑えて高速・連続的な動作を実現するフレームワーク。
原題: VLA-RAIL: A Real-Time Asynchronous Inference Linker for VLA Models and Robots / Yongsheng Zhao, Lei Zhao, Baoping Cheng 他
日本語で読む → - 論文VLAロボティクス
視覚-言語-行動モデルにおける人間からロボットへの転移の創発
多様なロボットデータで事前学習したVLAモデルに人間の動画を共訓練すると、人間からロボットへのスキル転移が自然に生じることを示し、その要因が身体非依存の表現獲得にあると分析した。
原題: Emergence of Human to Robot Transfer in Vision-Language-Action Models / Simar Kareer, Karl Pertsch, James Darpinian 他
日本語で読む → - 論文VLAロボティクス
動作画像拡散との共同学習によるロボットVLAの性能向上
VLAモデルに将来の動きを予測する動作ヘッドを追加し、動作ヘッドと共同学習することで、推論速度を保ちながら動作推論能力と実環境性能を大幅に向上させた。
原題: Robotic VLA Benefits from Joint Learning with Motion Image Diffusion / Yu Fang, Kanchana Ranasinghe, Le Xue 他
日本語で読む → - 論文VLAロボティクス
VLA-AN: 複雑環境での空中ナビゲーション向け効率的オンボード視覚言語行動フレームワーク
3Dガウススプラッティングによる高忠実度データセットと3段階学習、軽量行動モジュールと幾何学的安全補正を組み合わせ、リソース制約のあるドローン上でリアルタイム推論を8.3倍高速化し、最大98.1%のタスク成功率を達成したオンボードVLAナビゲーション手法。
原題: VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments / Yuze Wu, Mo Zhu, Xingxing Li 他
日本語で読む → - 論文VLAロボティクス
RecipeMasterLLM:大規模言語モデル時代にRoboEarthを再考する
ユーザーの指示からRoboEarth標準知識グラフに沿ったOWL行動オントロジーを生成する高レベルプランナーを提案し、ファインチューニングしたLLMとRAGで環境知識を活用して行動記述を自動生成する。
原題: RecipeMasterLLM: Revisiting RoboEarth in the Era of Large Language Models / Asil Kaan Bozcuoglu, Ziyuan Liu
日本語で読む → - 論文VLAロボティクス
OXE-AugE: 異なるロボット形態間のポリシー学習を拡張するための大規模ロボットデータ拡張
Open X-Embodimentデータセットに9種類のロボット形態を追加し、440万軌道以上に拡張するパイプラインを構築。多様なアームとグリッパーでの学習が未知のロボットへの汎化性能を高めることを示した。
原題: OXE-AugE: A Large-Scale Robot Augmentation of OXE for Scaling Cross-Embodiment Policy Learning / Guanhua Ji, Harsha Polavaram, Lawrence Yunliang Chen 他
日本語で読む → - 論文VLAロボティクス
UAVとの対話:大規模言語モデルに基づく人とUAVのインタラクション
ユーザとUAVの自然言語による対話を実現するため、タスク計画エージェントと実行エージェントの二重LLMエージェント構成を提案し、4つの応用シナリオで性能を評価した。
原題: Chat with UAV -- Human-UAV Interaction Based on Large Language Models / Haoran Wang, Zhuohang Chen, Guang Li 他
日本語で読む → - 論文VLAロボティクス
移動ロボットによる建設現場の自律安全点検:多層VLM-LLMパイプライン
移動ロボットの自律ナビゲーションとVLM・LLMを組み合わせ、建設現場の安全規則に基づく点検報告を自動生成する多層フレームワークを提案し、実験室環境で有効性を検証した。
原題: Autonomous Construction-Site Safety Inspection Using Mobile Robots: A Multilayer VLM-LLM Pipeline / Hossein Naderi, Alireza Shojaei, Philip Agee 他
日本語で読む → - 論文VLAロボティクス
ICD-Net: ドローン向け視覚慣性SLAMのための慣性共分散変位ネットワーク
生の慣性計測データから変位と不確かさを学習し、VINS-Fusionの最適化に残差制約として組み込むことで、ドローンの視覚慣性SLAMの性能を向上させるフレームワークを提案。
原題: ICD-Net: Inertial Covariance Displacement Network for Drone Visual-Inertial SLAM / Tali Orlev Shapira, Itzik Klein
日本語で読む → - 論文VLAロボティクス
VISTAv2: 屋内視覚言語ナビゲーションのための世界想像モデル
過去の観測・行動候補・指示から未来の視点を生成し、オンライン価値マップとして計画に融合する世界モデルを提案。MP3DとRoboTHORで性能向上を実証。
原題: VISTAv2: World Imagination for Indoor Vision-and-Language Navigation / Yanjia Huang, Xianshun Jiang, Xiangbo Gao 他
日本語で読む → - 論文VLAロボティクス
ヒューマン・イン・ザ・ループ知能ロボットのための大規模行動モデルの設計
既存の基盤モデルを組み合わせ、記号的なラッパーと検証を組み込むことで、制御可能で解釈可能な大規模行動モデルを構築し、マルチモーダルロボットでその有効性を示した。
原題: Architecting Large Action Models for Human-in-the-Loop Intelligent Robots / Kanisorn Sangchai, Methasit Boonpun, Withawin Kraipetchara 他
日本語で読む → - 論文VLAロボティクス
RoboWheel: 実世界の人間デモンストレーションから異形態ロボット学習用データを生成するデータエンジン
人間の手と物体のインタラクション動画から、接触を考慮した軌道を再構成し、多様なロボット形態へ再ターゲティングして学習データを生成するデータエンジンを提案。VLAや模倣学習でテレオペ並みの性能を実証。
原題: RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning / Yuhong Zhang, Zihan Gao, Shengpeng Li 他
日本語で読む →