論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/11/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
ロボットマニピュレーション向けVision-Language-Actionモデルのベンチマーク経験
4つの代表的なVLAモデル(ACT、OpenVLA-OFT、RDT-1B、π0)をシミュレーションと実機ALOHA Mobileで4タスクにわたり標準化評価し、精度・適応性・指示追従性の観点から比較した実践的知見を報告する。
原題: Experiences from Benchmarking Vision-Language-Action Models for Robotic Manipulation / Yihao Zhang, Yuankai Qi, Xi Zheng
日本語で読む → - 論文自動運転/VLA画像認識
VLMからのリスク意味蒸留によるエンドツーエンド自動運転の強化
VLMが持つリスク推論をBEV特徴量に蒸留するRiskHeadを提案し、エンドツーエンド自動運転モデルの汎化性能とリスク対象への注意を向上させた研究。
原題: Enhancing End-to-End Autonomous Driving with Risk Semantic Distillaion from VLM / Jack Qin, Zhitao Wang, Yinan Zheng 他
日本語で読む → - 論文VLAロボティクス
言語モデルをロボティクス向け閉ループ高レベルプランナとして活用する:概要とベンチマーク
LLM/VLMをロボットの高レベルプランナとして閉ループで使う際の制御ホライズンやウォームスタートの影響を実験的に調べ、性能と堅牢性を高める実践的指針を示した。
原題: Using Language Models as Closed-Loop High-Level Planners for Robotics Applications: A Brief Overview and Benchmarks / Hao Wang, Sathwik Karnik, Bea Lim 他
日本語で読む → - 論文VLAロボティクス
微調整なしでVLAを実運用:身体性進化拡散によるプラグアンドプレイ推論時ポリシー誘導
事前学習済みVLAモデルを追加の微調整やデータ収集なしで実機展開するため、推論時にポリシーを誘導するプラグアンドプレイ手法VLA-Pilotを提案し、実世界の操作タスクで成功率を大幅に向上させた。
原題: Towards Deploying VLA without Fine-Tuning: Plug-and-Play Inference-Time VLA Policy Steering via Embodied Evolutionary Diffusion / Zhuo Li, Junjia Liu, Zhipeng Dong 他
日本語で読む → - 論文VLAロボティクス
LatBot: 視覚-言語-行動モデルのための普遍的潜在行動の蒸留
大規模な物体操作動画から物理的先行知識を考慮した潜在行動を学習し、最新のVLAモデルに蒸留することで、シミュレーションと実世界のロボット操作タスクにおける少数ショット転移性能を向上させた。
原題: LatBot: Distilling Universal Latent Actions for Vision-Language-Action Models / Zuolei Li, Xingyu Gao, Xiaofan Wang 他
日本語で読む → - 論文VLA画像認識
ActDistill: 効率的な視覚-言語-行動モデルのための汎用的な行動誘導自己蒸留
既存のVLAモデルの行動予測能力を軽量な生徒モデルに転移させる蒸留フレームワークを提案し、計算量を50%以上削減しつつ同等以上の性能を実現した。
原題: ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models / Wencheng Ye, Tianshi Wang, Lei Zhu 他
日本語で読む → - 論文VLAロボティクス
注意的特徴集約:ロバスト性を気にせずタスク関連の視覚手がかりに注目する方策
事前学習済み視覚表現を用いた視覚運動方策において、タスク無関係な情報を無視する軽量な注意的特徴集約機構を提案し、視覚的摂動に対するロバスト性を向上させた。
原題: Attentive Feature Aggregation or: How Policies Learn to Stop Worrying about Robustness and Attend to Task-Relevant Visual Cues / Nikolaos Tsagkas, Andreas Sochopoulos, Duolikun Danier 他
日本語で読む → - 論文VLAロボティクス
Compressor-VLA: 指示に基づく視覚トークン圧縮による効率的なロボットマニピュレーション
言語指示に応じて視覚トークンを動的に圧縮する2段階の手法を提案し、VLAモデルの計算量を削減しつつLIBEROベンチマークで高い成功率と実機転移を実現した。
原題: Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation / Juntao Gao, Feiyang Ye, Jing Zhang 他
日本語で読む → - 論文VLAロボティクス
SeFA-Policy: 選択的フロー整合による高速で正確な視覚運動ポリシー学習
拡散・フローベースのポリシー学習において、蒸留後の生成行動が観測とずれる問題を、専門家デモを用いた選択的フロー整合で補正し、推論遅延を98%以上削減しつつ高精度・高ロバストな視覚運動ポリシーを実現した。
原題: SeFA-Policy: Fast and Accurate Visuomotor Policy Learning with Selective Flow Alignment / Rong Xue, Jiageng Mao, Mingtong Zhang 他
日本語で読む → - 論文VLAロボティクス
InternData-A1:汎用ポリシー事前学習のための高忠実度合成データ
大規模シミュレーションで生成した63万軌道超の合成データセットInternData-A1を構築し、合成データのみでVLAモデルを事前学習しても実データと同等の性能が得られることを示した。
原題: InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy / Yang Tian, Yuyin Yang, Yiman Xie 他
日本語で読む → - 論文VLAロボティクス
GUIDES: 事前学習済みロボットポリシーを強化するインストラクター蒸留埋め込みによるガイダンス
事前学習済みロボットポリシーに、視覚言語モデルからの意味的ガイダンスを軽量に注入し、再設計なしでタスク成功率を向上させるフレームワーク。
原題: GUIDES: Guidance Using Instructor-Distilled Embeddings for Pre-trained Robot Policy Enhancement / Minquan Gao, Xinyi Li, Qing Yan 他
日本語で読む → - 論文VLA画像認識
GigaWorld-0:世界モデルをデータエンジンとして具現化AIを強化
視覚・言語・行動(VLA)学習のためのデータ生成エンジンとして、動画生成と3D生成を統合した世界モデルフレームワークを提案し、実世界データなしでロボットの汎化性能とタスク成功率を向上させた。
原題: GigaWorld-0: World Models as Data Engine to Empower Embodied AI / GigaWorld Team, Angen Ye, Boyuan Wang 他
日本語で読む → - 論文VLAロボティクス
VLMによるロボット組立タスクのスキル選択
視覚言語モデルと模倣学習を組み合わせ、自然言語指示に基づいてロボットが組立作業のスキルを選択・実行するフレームワークを提案した。
原題: VLM-driven Skill Selection for Robotic Assembly Tasks / Jeong-Jung Kim, Doo-Yeol Koh, Chang-Hyun Kim
日本語で読む → - 論文VLA画像認識
Prune-Then-Plan: 身体性質問応答における安定したフロンティア探索のためのステップレベル校正
VLMの過信によるフロンティア振動を抑えるため、ステップレベルで候補を枝刈りしてからカバレッジベースのプランナに決定を委ねる枠組みを提案し、EQAの探索効率と回答品質を改善した。
原題: Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering / Noah Frahm, Prakrut Patel, Yue Zhang 他
日本語で読む → - 論文VLAロボティクス
少数デモンストレーションによる視覚-言語-行動モデルのメカニズム的解釈に基づくファインチューニング
少数の実演からタスク固有のアテンションヘッドを特定し選択的にファインチューニングするRobotic Steeringを提案し、LoRAを上回る性能とロバスト性、計算コスト削減、解釈性向上を実機で示した。
原題: Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations / Chancharik Mitra, Yusen Luo, Raj Saravanan 他
日本語で読む → - 論文VLAロボティクス
共有自律によるエンドツーエンドの器用な腕・手VLAポリシー:自律ハンドVLAポリシーで拡張したVRテレオペレーションによる効率的なデータ収集
VRテレオペレーションで腕を人間が操作し、手は自律VLAポリシーが触覚・視覚フィードバックで制御する共有自律フレームワークを提案し、効率的に高品質な腕・手協調のデモを収集してエンドツーエンドVLAポリシーを学習、多様な物体で90%の成功率を達成した。
原題: End-to-End Dexterous Arm-Hand VLA Policies via Shared Autonomy: VR Teleoperation Augmented by Autonomous Hand VLA Policy for Efficient Data Collection / Yu Cui, Yujian Zhang, Lina Tao 他
日本語で読む → - 論文VLAロボティクス
統合拡散VLA:離散デノイジング拡散プロセスによる視覚・言語・行動モデル
視覚・言語・行動を単一の離散デノイジング拡散過程で統合し、画像生成と行動予測を同時に最適化するVLAモデルを提案。CALVINやLIBEROなどで最高性能を達成。
原題: Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process / Jiayi Chen, Wenxuan Song, Pengxiang Ding 他
日本語で読む → - 論文VLAロボティクス
ロボット駆動データフライホイール:実環境展開による継続的データ収集と基盤モデル適応
ロボットを実環境に配備してタスク遂行中に実世界データを収集し、基盤モデルを継続的に改善する「データフライホイール」枠組みを提案。図書館で2週間稼働した移動マニピュレータScanfordで、VLMの書架スキャンと自動ラベリングによりドメイン特化・隣接タスクの性能を向上させた。
原題: Robot-Powered Data Flywheels: Deploying Robots in the Wild for Continual Data Collection and Foundation Model Adaptation / Jennifer Grannen, Michelle Pan, Kenneth Llontop 他
日本語で読む → - 論文VLAロボティクス
LACY: 自己改善型ロボットマニピュレーションのための視覚言語モデルに基づく言語-行動サイクル
言語から行動への変換と行動から言語への説明を双方向に学習する視覚言語モデルを提案し、低信頼ケースを能動的に拡張して自己改善することで、実機・シミュレーションのピック&プレース成功率を平均56.46%向上させた。
原題: LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation / Youngjin Hong, Houjian Yu, Mingen Li 他
日本語で読む → - 論文VLAロボティクス
SPEAR-1: 3D理解によるロボット実演を超えるスケーリング
非ロボット画像に3D注釈を付与してVLMを強化し、3D認識と言語指示制御を統合したロボット基盤モデルSPEAR-1を提案。ロボット実演を20分の1に抑えつつ最先端性能を達成。
原題: SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding / Nikolay Nikolov, Giuliano Albanese, Sombit Dey 他
日本語で読む → - 論文VLAロボティクス
E0: Tweedie離散拡散によるVLAモデルの汎化性と細粒度制御の向上
量子化された行動トークン上でTweedie離散拡散を行うVLAフレームワークE0を提案し、視点摂動拡張と合わせて多様な環境での汎化と細かい制御を実現した。
原題: E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion / Zhihao Zhan, Jiaying Zhou, Likui Zhang 他
日本語で読む → - 論文VLAロボティクス
MobileVLA-R1: 四足歩行ロボットのための視覚-言語-行動モデルを強化学習で強化
自然言語指示を四足歩行ロボットの連続制御に接地させるため、多粒度Chain-of-Thoughtデータセットと教師あり学習+GRPO強化学習の二段階学習を組み合わせた統合VLAフレームワークを提案し、実機で有効性を示した。
原題: MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots / Ting Huang, Dongjian Li, Rui Yang 他
日本語で読む → - 論文VLAロボティクス
分離型アクションエキスパート:タスク知識を条件付け経路に閉じ込める
拡散ポリシーの行動生成バックボーンはタスク非依存にできることを示し、条件付け経路のみを学習させる分離型学習法を提案。244MのU-Netを5MのMLPに置き換えても同等以上の性能を達成した。
原題: Decoupled Action Expert: Confining Task Knowledge to the Conditioning Pathway / Jian Zhou, Sihao Lin, Shuai Fu 他
日本語で読む → - 論文VLAAI
QuickLAP: 半自律エージェントのための高速言語-行動選好学習
物理的な修正と言語によるフィードバックをベイズ的に統合し、LLMを用いて報酬関数をリアルタイムに学習する手法を提案。半自律運転シミュレータで報酬学習誤差を70%以上削減し、ユーザスタディでも高い理解度と協調性が示された。
原題: QuickLAP: Quick Language-Action Preference Learning for Semi-Autonomous Agents / Jordan Abi Nader, David Lee, Nathaniel Dennler 他
日本語で読む → - 論文VLAロボティクス
視覚-言語-行動モデルの未来を導く10の未解決課題
VLAモデルの発展における10の主要マイルストーンと新たな研究動向を議論し、今後の研究方向に注目を促す論文。
原題: 10 Open Challenges Steering the Future of Vision-Language-Action Models / Soujanya Poria, Navonil Majumder, Chia-Yu Hung 他
日本語で読む → - 論文VLAロボティクス
人間参加型選好アライメントによる展開可能な視覚駆動UAV河川航行
人間が介入して選好を提供するHITL学習手法SPAR-Hを提案し、視覚駆動UAVの河川追従をシミュレーションと実機で実現した。
原題: Deployable Vision-driven UAV River Navigation via Human-in-the-loop Preference Alignment / Zihan Wang, Jianwen Li, Li-Fan Wu 他
日本語で読む → - 論文VLAロボティクス
MergeVLA: スキル横断モデルマージによる汎用視覚言語行動エージェント
異なるタスクで訓練したVLAエキスパートを統合する際の非マージ性の原因を分析し、タスクマスク付きLoRAとクロスアテンションのみの行動エキスパートで設計段階からマージ可能にしたVLAアーキテクチャを提案。
原題: MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent / Yuxia Fu, Zhizhen Zhang, Yuqi Zhang 他
日本語で読む → - 論文VLAロボティクス
GPT-4にヒューマノイドの身体を与える:既製VLMと物理世界を繋ぐ架け橋の構築
既製の視覚言語モデル(GPT-4など)をヒューマノイドエージェントの制御に活用する手法BiBoを提案。指示を低レベルコマンドに変換するコンパイラと拡散モデルによる動作実行器で、オープン環境での相互作用タスク成功率90.2%を達成。
原題: Endowing GPT-4 with a Humanoid Body: Building the Bridge Between Off-the-Shelf VLMs and the Physical World / Yingzhao Jian, Zhongan Wang, Yi Yang 他
日本語で読む → - 論文VLA画像認識
残差強化学習によるデータ生成で自己改善する視覚言語行動モデル
VLAモデルの失敗領域を残差RLで探索し、展開分布に沿った軌道を収集・蒸留することで、追加の人間デモなしに性能を自己改善させるフレームワークPLDを提案。
原題: Self-Improving Vision-Language-Action Models with Data Generation via Residual RL / Wenli Xiao, Haotian Lin, Andy Peng 他
日本語で読む → - 論文VLA画像認識
iFlyBot-VLA 技術報告
人間とロボットの大規模操作動画で学習した潜在行動モデルと、二段階の行動表現でVLMと行動エキスパートを同時に訓練する新しいVLAフレームワークを提案し、LIBEROベンチマークと実機で有効性を示した。
原題: iFlyBot-VLA Technical Report / Yuan Zhang, Chenyu Xue, Wenjie Xu 他
日本語で読む →