論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/8/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
ReconVLA:再構成型視覚-言語-行動モデルによる効果的なロボット知覚
視覚的注意を対象領域に正しく向けるため、注視領域を再構成する拡散トランスフォーマを組み込んだVLAモデルを提案し、精密操作と汎化性能を実証した。
原題: ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver / Wenxuan Song, Ziyang Zhou, Han Zhao 他
日本語で読む → - 論文VLAロボティクス
視覚基盤モデルと強化学習の統合による物体インタラクションの強化
SAMとYOLOv5をPPOエージェントに組み込み、AI2-THOR環境での物体操作とナビゲーション性能を大幅に向上させた。
原題: Integrating Vision Foundation Models with Reinforcement Learning for Enhanced Object Interaction / Ahmad Farooq, Kamran Iqbal
日本語で読む → - 論文VLAロボティクス
OmniVTLA: 触覚知覚を統合した視覚・触覚・言語・行動モデル
触覚センサの異種性に対応する二経路エンコーダと大規模触覚データセットObjTacを構築し、接触を伴う操作タスクで高い成功率を達成したVLAモデルを提案。
原題: OmniVTLA: Vision-Tactile-Language-Action Models with Semantic-Aligned Tactile Sensing / Zhengxue Cheng, Yiqian Zhang, Anni Tang 他
日本語で読む → - 論文VLAロボティクス
DAgger拡散ナビゲーション:視覚言語ナビゲーションのためのDAgger強化拡散ポリシー
視覚言語ナビゲーション(VLN-CE)において、従来の2段階計画を単一の条件付き拡散ポリシーに統合し、DAggerによるオンライン学習で複合誤差を抑えたエンドツーエンド手法を提案。
原題: DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation / Haoxiang Shi, Xiang Deng, Zaijing Li 他
日本語で読む → - 論文VLAロボティクス
NaviMaster: GUIナビゲーションと身体性ナビゲーションを統合する統一ポリシーの学習
GUI操作と身体性ナビゲーションを同一のMDPとして捉え、視覚的軌跡収集と強化学習で単一のエージェントを訓練し、両タスクで高性能を達成した。
原題: NaviMaster: Learning a Unified Policy for GUI and Embodied Navigation Tasks / Zhihao Luo, Wentao Yan, Jingyu Gong 他
日本語で読む → - 論文VLAロボティクス
リアルタイム3D視覚言語埋め込みマッピング
視覚言語モデルの2次元埋め込みを、実時間でメートル精度の3次元表現に統合する手法を提案し、自然言語による対象物の位置特定を可能にした。
原題: Real-Time 3D Vision-Language Embedding Mapping / Christian Rauch, Björn Ellensohn, Linus Nwankwo 他
日本語で読む → - 論文VLAロボティクス
事前学習済みVLAポリシーをモデルベース探索で改善するVLAPS
事前学習済みVLAポリシーの行動事前分布でMCTSをバイアスし、言語条件付きロボットタスクの成功率を高める推論フレームワークを提案。
原題: Improving Pre-Trained Vision-Language-Action Policies with Model-Based Search / Cyrus Neary, Omar G. Younis, Artur Kuramshin 他
日本語で読む → - 論文VLA画像認識
空間トレース:時空間理解でVLAモデルを強化
観測のキーポイントの視覚トレースを深度マップに投影し、空間と時間の情報を同時に捉えることでVLAモデルの性能を向上させる手法を提案。
原題: Spatial Traces: Enhancing VLA Models with Spatial-Temporal Understanding / Maxim A. Patratskiy, Alexey K. Kovalev, Aleksandr I. Panov
日本語で読む → - 論文VLAロボティクス
GeoVLA: 視覚言語行動モデルに3D表現を導入
深度マップから点群を生成し、視覚言語モデルの埋め込みと統合することで、3D空間認識を強化したロボットマニピュレーション用VLAフレームワークを提案。
原題: GeoVLA: Empowering 3D Representations in Vision-Language-Action Models / Lin Sun, Bin Xie, Yingfei Liu 他
日本語で読む → - 論文VLA画像認識
MonoDream:パノラマドリーミングによる単眼視覚言語ナビゲーション
単眼入力のみでパノラマRGB-D相当の空間表現を潜在空間で学習し、視覚言語ナビゲーションの性能を向上させる軽量VLAフレームワークを提案。
原題: MonoDream: Monocular Vision-Language Navigation with Panoramic Dreaming / Shuo Wang, Yongcai Wang, Zhaoxin Fan 他
日本語で読む → - 論文VLAロボティクス
大規模モデルが拓く身体性AI:意思決定と身体性学習に関するサーベイ
大規模モデルを活用した身体性AIの研究を、階層型・端到端の意思決定と模倣学習・強化学習、さらに世界モデルまで含めて体系的に整理したサーベイ。
原題: Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning / Wenlong Liang, Rui Zhou, Yang Ma 他
日本語で読む → - 論文VLAロボティクス
身体性を持つエージェントAIに向けて:LLM・VLM駆動のロボット自律性とインタラクションのレビューと分類
LLMやVLMをロボットに統合する研究を調査し、エージェントの役割やモデル統合手法を分類するタクソノミーを提案したサーベイ論文。
原題: Towards Embodied Agentic AI: Review and Classification of LLM- and VLM-Driven Robot Autonomy and Interaction / Sahar Salimpour, Lei Fu, Kajetan Rachwał 他
日本語で読む → - 論文VLAロボティクス
CO-RFT: チャンク型オフライン強化学習による視覚-言語-行動モデルの効率的ファインチューニング
VLAモデルをアクションチャンキング対応のオフライン強化学習でファインチューニングする手法を提案し、実環境で成功率57%向上・サイクルタイム22.3%短縮を達成した。
原題: CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning / Dongchi Huang, Zhirui Fang, Tianle Zhang 他
日本語で読む → - 論文VLA画像認識
離散拡散VLA:視覚言語行動ポリシーの行動デコーディングに離散拡散を導入
行動チャンクを離散化し、統合トランスフォーマー内で離散拡散により並列デコーディングするVLAを提案。適応的なデコーディング順序と再マスキングで誤り訂正を行い、LIBEROやSimplerEnvで高い成功率と事前学習能力の保持を実現した。
原題: Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies / Zhixuan Liang, Yizhuo Li, Tianshuo Yang 他
日本語で読む → - 論文VLAロボティクス
見たものから安全性をどう予測するか:画像制御自律性のための校正済み安全確率予測
画像入力で制御される自律システムに対し、ワールドモデルと変分オートエンコーダを用いて将来の潜在軌道を予測し、安全特性を満たす確率を校正して推定する枠組みを提案した論文。
原題: How Safe Will I Be Given What I Saw? Calibrated Prediction of Safety Chances for Image-Controlled Autonomy / Zhenjiang Mao, Mrinall Eashaan Umasudhan, Ivan Ruchkin
日本語で読む → - 論文VLAロボティクス
見えない指示もお任せ:対話的質問によるマルチモーダルな直示参照解決
音源定位・意味地図・VLM・GPT-4oによる対話的質問を組み合わせ、ロボットの視野外にいるユーザーや物体への曖昧な指示を解決するフレームワークMIELを提案した。
原題: Take That for Me: Multimodal Exophora Resolution with Interactive Questioning for Ambiguous Out-of-View Instructions / Akira Oyama, Shoichi Hasegawa, Akira Taniguchi 他
日本語で読む → - 論文VLAロボティクス
人間中心の汎用物理知能によるアジャイル製造自動化
VLAモデルを中心に、汎用物理知能(GPI)の概念を整理し、アジャイル製造への実用化に向けた課題と展望を6つの柱で体系的にレビューした。
原題: Human Centric General Physical Intelligence for Agile Manufacturing Automation / Sandeep Kanta, Mehrdad Tavassoli, Varun Teja Chirkuri 他
日本語で読む → - 論文VLAロボティクス
ケミストアイ:自己駆動型実験室における安全監視とロボット意思決定のための視覚言語モデル搭載システム
自己駆動型実験室の安全性を高めるため、RGB・深度・赤外線カメラと視覚言語モデルを組み合わせ、PPE違反や火災を検知してロボットを誘導する分散型監視システムを開発した。
原題: Chemist Eye: A Visual Language Model-Powered System for Safety Monitoring and Robot Decision-Making in Self-Driving Laboratories / Francisco Munguia-Galeano, Zhengxue Zhou, Satheeshkumar Veeramani 他
日本語で読む → - 論文VLAロボティクス
AgriVLN: 農業ロボットのための視覚と言語によるナビゲーション
四足歩行ロボットによる農業シーンの視覚言語ナビゲーション用ベンチマークA2Aと、VLMベースのAgriVLNを提案し、指示分解モジュールで成功率を改善した。
原題: AgriVLN: Vision-and-Language Navigation for Agricultural Robots / Xiaobei Zhao, Xingqi Lyu, Xiang Li
日本語で読む → - 論文VLAロボティクス
FedVLA: 二重ゲーティングMoEによる連合視覚言語行動学習
データプライバシーを守りつつ分散学習する初の連合VLAフレームワークを提案し、指示に基づくシーン解析と二重ゲーティングMoE、専門家駆動型集約で効率的なロボットマニピュレーションを実現した。
原題: FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic Manipulation / Cui Miao, Tao Chang, Meihan Wu 他
日本語で読む → - 論文VLAロボティクス
実世界での人とロボットの協働に自然言語を活用する
物理世界で働くロボットに大規模言語モデルを統合し、自然言語で人間と協働させるための課題と、認知エージェントを核としたアプローチ、ChatGPTを用いた概念実証実験を紹介する。
原題: Using Natural Language for Human-Robot Collaboration in the Real World / Peter Lindes, Kaoutar Skiker
日本語で読む → - 論文VLAロボティクス
Embodied-R1: 汎用ロボット操作のための強化学習による身体性推論
「ポインティング」を身体性に依存しない中間表現として用い、3Bの視覚言語モデルを強化学習ファインチューニングで訓練することで、未知の環境や実機タスクへのゼロショット汎化を実現した研究。
原題: Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation / Yifu Yuan, Haiqin Cui, Yaoting Huang 他
日本語で読む → - 論文VLAナビゲーションロボティクス
CorrectNav: 自己修正フライホイールによる視覚言語行動ナビゲーションモデルの強化
訓練中の誤り軌道を自己修正データに自動変換して再学習を繰り返す「自己修正フライホイール」を提案し、単眼RGBベースのVLAナビゲーションモデルCorrectNavでR2R-CEとRxR-CEの成功率を大幅に更新した。
原題: CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model / Zhuoyuan Yu, Yuxing Long, Zihan Yang 他
日本語で読む → - 論文VLA画像認識
CogVLA: 指示駆動型ルーティングとスパース化による認知整合型視覚-言語-行動モデル
人間のマルチモーダル協調に着想を得て、指示に応じて視覚トークンを選択・圧縮し、行動意図に基づき不要トークンを刈り込む3段階のVLAアーキテクチャを提案。学習コストと推論遅延を大幅に削減しつつ、LIBEROベンチマークで97.4%の成功率を達成した。
原題: CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification / Wei Li, Renshan Zhang, Rui Shao 他
日本語で読む → - 論文VLA画像認識
SegDAC: 動的オブジェクトトークンによる強化学習の視覚的汎化
テキスト誘導セグメンテーションで物体マスクを抽出し、可変長のオブジェクトトークン列をTransformerベースのActor-Criticで処理する強化学習手法を提案。視覚条件が変化するテスト時でも高い汎化性能を示した。
原題: SegDAC: Visual Generalization in Reinforcement Learning via Dynamic Object Tokens / Alexandre Brown, Glen Berseth
日本語で読む → - 論文VLAロボティクス
INTENTION:対話的直感と接地されたVLMによるヒューマノイドロボット動作の傾向推論
視覚言語モデルによるシーン推論と対話駆動型メモリを統合し、新しい環境でも人間のように直感的に操作行動を推論できるロボットフレームワークを提案。
原題: INTENTION: Inferring Tendencies of Humanoid Robot Motion Through Interactive Intuition and Grounded VLM / Jin Wang, Weijie Wang, Boyuan Deng 他
日本語で読む → - 論文VLAロボティクス
RoboMemory: 物理エンボディドシステムにおける対話型環境学習のための脳に着想を得たマルチメモリエージェントフレームワーク
脳に着想を得て空間・時間・エピソード・意味記憶を統合したフレームワークを提案し、長期的な計画と対話型学習を実現してEmbodiedBenchで成功率を26.5%向上させた。
原題: RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems / Mingcong Lei, Honghao Cai, Yuyuan Yang 他
日本語で読む → - 論文VLAロボティクス
動画生成器はロボットポリシーである
動画生成をロボットポリシー学習の代理として用いる「Video Policy」を提案し、少ない実演データで未知の物体・背景・タスクへの汎化性能とサンプル効率を大幅に向上させた。
原題: Video Generators are Robot Policies / Junbang Liang, Pavel Tokmakov, Ruoshi Liu 他
日本語で読む → - 論文VLAロボティクス
視覚言語モデルを行動モデルとして用いた意図認識と支援
VLMとLLMを組み合わせて人間の指示から対象物や場所を絞り込み、ロボットが意図を素早く推論してナビゲーションやマニピュレーションを支援するフレームワークを提案した。
原題: Utilizing Vision-Language Models as Action Models for Intent Recognition and Assistance / Cesar Alan Contreras, Manolis Chiou, Alireza Rastegarpanah 他
日本語で読む → - 論文VLAロボティクス
視覚-言語-行動モデル向けシミュレーションデータ収集のチュートリアルノート
VLAモデル学習用のシミュレーションデータ収集手法を、PyBullet・LIBERO・RT-Xの3つの代表的な枠組みを通じて解説したチュートリアル。
原題: A tutorial note on collecting simulated data for vision-language-action models / Heran Wu, Zirun Zhou, Jingfeng Zhang
日本語で読む →