論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/9/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
人間のデモを超えて:VLA学習用データを生成する拡散ベース強化学習
拡散モデルを用いた強化学習で高品質・低分散な軌道を生成し、人間のデモなしでVLAモデルを学習させる手法を提案。LIBEROベンチマークで人間データやガウスRLより高い成功率を達成。
原題: Beyond Human Demonstrations: Diffusion-Based Reinforcement Learning to Generate Data for VLA Training / Rushuai Yang, Hangxing Wei, Ran Zhang 他
日本語で読む → - 論文VLAロボティクス
PoseDiff: ロボット姿勢推定と動画から行動への制御を橋渡しする統合拡散モデル
単一のRGB画像からロボットの3Dキーポイントや関節角度を推定し、さらに動画のキーフレームから長期行動列を生成する拡散モデルを提案。姿勢推定と逆動力学を一つの枠組みで統合した。
原題: PoseDiff: A Unified Diffusion Model Bridging Robot Pose Estimation and Video-to-Action Control / Haozhuo Zhang, Michele Caprio, Jing Shao 他
日本語で読む → - 論文VLAロボティクス
Eva-VLA:実世界の物理的変動下における視覚言語行動モデルのロバスト性評価
VLAモデルの実世界での物理的変動に対するロバスト性を評価する初の統一フレームワークEva-VLAを提案し、最悪ケースを効率的に探索する手法を開発した。
原題: Eva-VLA: Evaluating Vision-Language-Action Models' Robustness Under Real-World Physical Variations / Hanqing Liu, Shouwei Ruan, Jiahuan Long 他
日本語で読む → - 論文VLAロボティクス
F1: 理解と生成を行動に橋渡しする視覚-言語-行動モデル
将来の視覚状態を予測する「視覚的先見」を意思決定に組み込み、それを目標として逆動力学で行動を生成するVLAフレームワークF1を提案し、実世界タスクとシミュレーションで成功率と汎化性能を大幅に向上させた。
原題: F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions / Qi Lv, Weijie Kong, Hao Li 他
日本語で読む → - 論文VLA画像認識
NinA: 正規化フローによるVLAモデルの高速化
VLAモデルの行動デコーダに正規化フローを導入し、拡散モデルと同等の性能を保ちつつ推論を高速化した研究。
原題: NinA: Normalizing Flows in Action. Training VLA Models with Normalizing Flows / Denis Tarasov, Alexander Nikulin, Ilya Zisman 他
日本語で読む → - 論文VLAロボティクス
AgriVLN: 農業ロボットのための視覚と言語によるナビゲーション
四足歩行ロボットによる農業シーンの視覚言語ナビゲーション用ベンチマークA2Aと、VLMベースのAgriVLNを提案し、指示分解モジュールで成功率を改善した。
原題: AgriVLN: Vision-and-Language Navigation for Agricultural Robots / Xiaobei Zhao, Xingqi Lyu, Xiang Li
日本語で読む → - 論文VLAロボティクス
潜在ポリシーバリア:分布内に留まることで堅牢な視覚運動ポリシーを学習する
専門家デモの潜在表現を障壁として扱い、拡散ポリシーとダイナミクスモデルを組み合わせて、追加の人間修正なしに視覚運動ポリシーの堅牢性とデータ効率を向上させるフレームワークを提案。
原題: Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution / Zhanyi Sun, Shuran Song
日本語で読む → - 論文VLA画像認識
離散拡散VLA:視覚言語行動ポリシーの行動デコーディングに離散拡散を導入
行動チャンクを離散化し、統合トランスフォーマー内で離散拡散により並列デコーディングするVLAを提案。適応的なデコーディング順序と再マスキングで誤り訂正を行い、LIBEROやSimplerEnvで高い成功率と事前学習能力の保持を実現した。
原題: Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies / Zhixuan Liang, Yizhuo Li, Tianshuo Yang 他
日本語で読む → - 論文VLAロボティクス
Genie Envisioner:ロボット操作のための統合ワールド基盤プラットフォーム
指示条件付き動画拡散モデルを核に、方策学習・評価・シミュレーションを一つの動画生成フレームワークへ統合した基盤を提案し、軽量デコーダで行動軌跡を生成、専用ベンチマークも整備した。
原題: Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation / Yue Liao, Pengfei Zhou, Siyuan Huang 他
日本語で読む → - 論文VLAロボティクス
見えない指示もお任せ:対話的質問によるマルチモーダルな直示参照解決
音源定位・意味地図・VLM・GPT-4oによる対話的質問を組み合わせ、ロボットの視野外にいるユーザーや物体への曖昧な指示を解決するフレームワークMIELを提案した。
原題: Take That for Me: Multimodal Exophora Resolution with Interactive Questioning for Ambiguous Out-of-View Instructions / Akira Oyama, Shoichi Hasegawa, Akira Taniguchi 他
日本語で読む → - 論文VLAロボティクス
見て行動することを学ぶ:ロボットマニピュレーションのためのタスク認識型仮想視点探索
再構成したシーンからタスクに適した仮想カメラ視点を選んで観測を再描画し、タスク特化型のMixture-of-Experts視覚エンコーダと組み合わせることで、遮蔽や視覚的分布シフトに頑健な多タスクロボット操作を実現した。
原題: Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation / Yongjie Bai, Zhouxia Wang, Yang Liu 他
日本語で読む → - 論文VLAロボティクス
MemoryVLA: ロボット操作のための視覚-言語-行動モデルにおける知覚・認知記憶
人間の作業記憶と海馬の記憶機構に着想を得て、知覚・認知トークンを記憶バンクに蓄え再利用するVLAモデルを提案し、長期的な依存を含む操作タスクで従来手法を上回る成功率を達成した。
原題: MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation / Hao Shi, Bin Xie, Yingfei Liu 他
日本語で読む → - 論文VLAロボティクス
GraphCoT-VLA:曖昧な指示に対応する3D空間認識推論型視覚言語行動モデル
曖昧な指示や未知環境に対応するため、構造化Chain-of-Thought推論とリアルタイム更新可能な3Dポーズ・物体グラフを統合したロボットマニピュレーション向けVLAモデルを提案。
原題: GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions / Helong Huang, Min Cen, Kai Tan 他
日本語で読む → - 論文VLAロボティクス
見たものから安全性をどう予測するか:画像制御自律性のための校正済み安全確率予測
画像入力で制御される自律システムに対し、ワールドモデルと変分オートエンコーダを用いて将来の潜在軌道を予測し、安全特性を満たす確率を校正して推定する枠組みを提案した論文。
原題: How Safe Will I Be Given What I Saw? Calibrated Prediction of Safety Chances for Image-Controlled Autonomy / Zhenjiang Mao, Mrinall Eashaan Umasudhan, Ivan Ruchkin
日本語で読む → - 論文VLAロボティクス
GhostShell: 具現化システムにおける並行行動プログラミングのためのストリーミングLLM関数呼び出し
LLMの生成ストリームから関数呼び出しを逐次解析し、マルチチャネルスケジューリングで複数ロボットコンポーネントの並行・並列動作を実現する手法を提案。実機33タスクで有効性を検証した。
原題: GhostShell: Streaming LLM Function Calls for Concurrent Embodied Programming / Jian Gong, Youwei Huang, Bo Yuan 他
日本語で読む → - 論文VLAロボティクス
INTENTION:対話的直感と接地されたVLMによるヒューマノイドロボット動作の傾向推論
視覚言語モデルによるシーン推論と対話駆動型メモリを統合し、新しい環境でも人間のように直感的に操作行動を推論できるロボットフレームワークを提案。
原題: INTENTION: Inferring Tendencies of Humanoid Robot Motion Through Interactive Intuition and Grounded VLM / Jin Wang, Weijie Wang, Boyuan Deng 他
日本語で読む → - 論文VLAロボティクス
RoboMemory: 物理エンボディドシステムにおける対話型環境学習のための脳に着想を得たマルチメモリエージェントフレームワーク
脳に着想を得て空間・時間・エピソード・意味記憶を統合したフレームワークを提案し、長期的な計画と対話型学習を実現してEmbodiedBenchで成功率を26.5%向上させた。
原題: RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems / Mingcong Lei, Honghao Cai, Yuyuan Yang 他
日本語で読む → - 論文VLAロボティクス
動画生成器はロボットポリシーである
動画生成をロボットポリシー学習の代理として用いる「Video Policy」を提案し、少ない実演データで未知の物体・背景・タスクへの汎化性能とサンプル効率を大幅に向上させた。
原題: Video Generators are Robot Policies / Junbang Liang, Pavel Tokmakov, Ruoshi Liu 他
日本語で読む → - 論文VLAロボティクス
MolmoAct: 空間で推論できる行動推論モデル
知覚・計画・制御を3段階で統合し、深度を考慮した知覚トークンから編集可能な軌道計画を生成して低レベル行動を予測するロボット基盤モデルを提案。シミュレーションと実世界で高い性能を示し、1万件超の軌道データセットも公開した。
原題: MolmoAct: Action Reasoning Models that can Reason in Space / Jason Lee, Jiafei Duan, Haoquan Fang 他
日本語で読む → - 論文VLAロボティクス
RoboInspector:LLMロボット操作におけるポリシーコードの信頼性欠如を暴く
LLMによるロボット操作のポリシーコード生成が、タスクの複雑さや指示の粒度によって不安定になる問題を体系的に分析し、失敗原因を4つに分類。失敗コードのフィードバックによる改善手法で信頼性を最大35%向上させた。
原題: RoboInspector: Unveiling the Unreliability of Policy Code for LLM-enabled Robotic Manipulation / Chenduo Ying, Linkang Du, Peng Cheng 他
日本語で読む → - 論文VLAロボティクス
視覚言語モデルを行動モデルとして用いた意図認識と支援
VLMとLLMを組み合わせて人間の指示から対象物や場所を絞り込み、ロボットが意図を素早く推論してナビゲーションやマニピュレーションを支援するフレームワークを提案した。
原題: Utilizing Vision-Language Models as Action Models for Intent Recognition and Assistance / Cesar Alan Contreras, Manolis Chiou, Alireza Rastegarpanah 他
日本語で読む → - 論文VLAAI
オープンエンド対話からの目標推論による柔軟なエージェントアラインメント
対話を通じてユーザーの目標を動的に推論し、LLMエージェントを柔軟にアラインメントする手法GOODを提案。買い物・家庭ロボティクス・コーディングの3領域で有効性を示した。
原題: Flexible Agent Alignment with Goal Inference from Open-Ended Dialog / Rachel Ma, Jingyi Qu, Andreea Bobu 他
日本語で読む → - 論文VLA画像認識
大規模視覚言語モデルによる経路指示追従:低レベル行動空間とパノラマ行動空間の比較
市販の大規模視覚言語モデルQwen2.5-VL-3BをR2Rデータセットでファインチューニングし、低レベル行動空間とパノラマ行動空間の両方で視覚言語ナビゲーションの性能を評価・比較した。
原題: Following Route Instructions using Large Vision-Language Models: A Comparison between Low-level and Panoramic Action Spaces / Vebjørn Haug Kåsene, Pierre Lison
日本語で読む → - 論文VLAロボティクス
コネクテッド自動運転車における深層マルチタスク学習のサーベイ
コネクテッド自動運転車(CAV)における深層マルチタスク学習(MTL)の初の包括的サーベイであり、知覚・予測・計画・制御・V2X通信・無線リソース管理の各領域におけるMTL手法を整理し、課題と展望を論じる。
原題: A Survey on Deep Multi-Task Learning in Connected Autonomous Vehicles / Jiayuan Wang, Farhad Pourpanah, Q. M. Jonathan Wu 他
日本語で読む → - 論文VLAロボティクス
汎用ロボット方策におけるショートカット学習:データセットの多様性と断片化の役割
大規模ロボットデータセットで訓練された汎用方策が訓練分布外で汎化しにくい原因を分析し、タスク無関係な特徴に依存する「ショートカット学習」が主因であること、サブデータセットの多様性不足と分布の断片化がそれを助長することを示した。さらにデータ拡張でショートカット学習を軽減し汎化性能を改善できることを実証した。
原題: Shortcut Learning in Generalist Robot Policies: The Role of Dataset Diversity and Fragmentation / Youguang Xing, Xu Luo, Junlin Xie 他
日本語で読む → - 論文VLAロボティクス
CAST: 反事実ラベルによる視覚言語行動モデルの指示追従性向上
視覚言語モデルを用いて既存のロボットデータセットに反事実ラベルを付与し、言語指示への追従性能を向上させる手法を提案。
原題: CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models / Catherine Glossop, William Chen, Arjun Bhorkar 他
日本語で読む → - 論文VLAロボティクス
身体性マニピュレーションのための視覚-言語-行動モデルに関するサーベイ
身体性知能におけるロボット操作のための視覚-言語-行動(VLA)モデルについて、アーキテクチャの変遷やデータセット、学習手法、評価方法を5つの観点から整理し、課題と今後の方向性をまとめたサーベイ論文。
原題: Survey of Vision-Language-Action Models for Embodied Manipulation / Haoran Li, Yuhui Chen, Wenbo Cui 他
日本語で読む → - 論文VLAAI
スケールアップしても薄まらない:RLベース汎用計画のためのゴール認識スパースGNN
PDDLで記述された計画問題を強化学習とグラフニューラルネットワークで解く際、状態を全結合グラフで表すと大規模環境で情報が薄まり学習が困難になる問題に対し、局所関係とゴール関連の空間特徴を選択的に符号化するスパースでゴール認識型のGNN表現を提案し、大規模グリッドでのドローンミッション計画で有効性を示した。
原題: Scaling Up without Fading Out: Goal-Aware Sparse GNN for RL-based Generalized Planning / Sangwoo Jeon, Juchul Shin, Gyeong-Tae Kim 他
日本語で読む → - 論文VLAナビゲーションロボティクス
CorrectNav: 自己修正フライホイールによる視覚言語行動ナビゲーションモデルの強化
訓練中の誤り軌道を自己修正データに自動変換して再学習を繰り返す「自己修正フライホイール」を提案し、単眼RGBベースのVLAナビゲーションモデルCorrectNavでR2R-CEとRxR-CEの成功率を大幅に更新した。
原題: CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model / Zhuoyuan Yu, Yuxing Long, Zihan Yang 他
日本語で読む → - 論文VLAロボティクス
RICL: 事前学習済み視覚-言語-行動モデルへの文脈内適応性の付与
模倣学習で事前学習されたVLAモデルに、少数の実演データを用いた追加学習で文脈内学習能力を後付けし、パラメータ更新なしで新しいマニピュレーションタスクを教えられるようにした。
原題: RICL: Adding In-Context Adaptability to Pre-Trained Vision-Language-Action Models / Kaustubh Sridhar, Souradeep Dutta, Dinesh Jayaraman 他
日本語で読む →