論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
NVSPolicy: 適応的な新規視点合成による汎化可能な言語条件付き政策学習
入力画像から情報量の多い視点を選んで新規視点画像を合成し、その特徴を意味特徴と残差特徴に分離して階層的政策ネットワークに入力することで、言語条件付きロボット操作の汎化性能を高めた手法。
原題: NVSPolicy: Adaptive Novel-View Synthesis for Generalizable Language-Conditioned Policy Learning / Le Shi, Yifei Shi, Xin Xu 他
日本語で読む → - 論文VLAHCI
産業オートメーションへのオントロジーと知識拡張大規模言語モデルの適用:インダストリー5.0における人間とロボットの協働を実現するための意思決定ガイダンス
製造業における人間とロボットの協働に向けて、大規模言語モデル・オントロジー・知識グラフをどのように使い分けるべきかの意思決定ガイダンスを提供する論文。
原題: Applying Ontologies and Knowledge Augmented Large Language Models to Industrial Automation: A Decision-Making Guidance for Achieving Human-Robot Collaboration in Industry 5.0 / John Oyekan, Christopher Turner, Michael Bax 他
日本語で読む → - 論文VLAロボティクス
物理推論と座標系ラベリングによる力強いスキル獲得
VLMに軌道ではなく力(レンチ)を出力させ、座標系を画像に重ねることで、事前学習なしに様々なマニピュレーションタスクでゼロショット汎化を実現した。
原題: Unfettered Forceful Skill Acquisition with Physical Reasoning and Coordinate Frame Labeling / William Xie, Max Conway, Yutong Zhang 他
日本語で読む → - 論文VLA画像認識
Dynam3D: 動的階層型3Dトークンによる視覚言語ナビゲーションのためのVLM強化
RGB-D画像からCLIP特徴を3D空間に投影し、動的で階層的な3D表現を構築することで、視覚言語ナビゲーションにおける3D理解と長期記憶を向上させるモデルを提案した。
原題: Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation / Zihan Wang, Seungjun Lee, Gim Hee Lee
日本語で読む → - 論文VLAロボティクス
Interleave-VLA:画像とテキストの交互入力でロボット操作を強化
画像とテキストを交互に与える指示でロボットを学習させ、未知の物体への汎化性能を2倍に高め、手描きスケッチなどの柔軟な指示にも対応できるVLAモデルを提案。
原題: Interleave-VLA: Enhancing Robot Manipulation with Interleaved Image-Text Instructions / Cunxin Fan, Xiaosong Jia, Yihang Sun 他
日本語で読む → - 論文VLAAI
身体性AIのためのマルチモーダル・マルチタスク連合基盤モデル:エッジ統合の可能性と課題
身体性AI向けに、マルチモーダル・マルチタスク基盤モデルと連合学習を統合した新パラダイムM3T-FFMを提案し、エッジ展開の課題をEMBODYフレームワークで整理したビジョン論文。
原題: Multi-Modal Multi-Task (M3T) Federated Foundation Models for Embodied AI: Potentials and Challenges for Edge Integration / Kasra Borazjani, Payam Abdisarabshali, Fardis Nadimi 他
日本語で読む → - 論文VLAAI
空間に根ざした合成世界によるロボットの身体性認知への挑戦
NVIDIA Omniverseで生成した合成データセットを用い、視覚言語モデルに視点取得(VPT)を学習させる枠組みを提案。まずはZ軸距離の推論に焦点を当てる。
原題: Towards Embodied Cognition in Robots via Spatially Grounded Synthetic Worlds / Joel Currie, Gioele Migno, Enrico Piacenti 他
日本語で読む → - 論文VLA画像認識
視覚言語モデルに対するユーザー信頼のマッピング:研究動向・課題・展望
視覚言語モデル(VLM)とのユーザーインタラクションにおける信頼の動態に関する研究を、認知科学的能力・協働モード・エージェント行動の観点から整理し、今後の信頼研究の要件を提示したサーベイ。
原題: Mapping User Trust in Vision Language Models: Research Landscape, Challenges, and Prospects / Agnese Chiatti, Sara Bernardini, Lara Shibelski Godoy Piccolo 他
日本語で読む → - 論文VLAロボティクス
Search-TTA: 実環境での視覚探索のためのマルチモーダルテスト時適応フレームワーク
衛星画像とCLIPを活用した視覚探索において、探索中に不確実性重み付き勾配更新で予測を動的に修正するテスト時適応フレームワークを提案し、大規模生態データセットAVS-Benchで最大30%の性能向上を達成した。
原題: Search-TTA: A Multimodal Test-Time Adaptation Framework for Visual Search in the Wild / Derek Ming Siang Tan, Shailesh, Boyang Liu 他
日本語で読む → - 論文VLAロボティクス
OpenHelix: ロボットマニピュレーションのためのデュアルシステムVLAモデルの短いサーベイ、実証分析、オープンソース化
既存のデュアルシステムVLAアーキテクチャを整理・比較し、設計要素を実証評価した上で、低コストなオープンソースモデルを提供するプロジェクト。
原題: OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation / Can Cui, Pengxiang Ding, Wenxuan Song 他
日本語で読む → - 論文VLAロボティクス
CrayonRobo: 物体中心のプロンプト駆動型視覚-言語-行動モデルによるロボットマニピュレーション
RGB画像に手書き風の2D視覚プロンプトを重ね、低レベル動作と高レベル計画を同時に指示する視覚-言語-行動モデルを提案。キーフレームごとに接触姿勢と移動方向をSE(3)空間で予測し、長期タスクを実行する。
原題: CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation / Xiaoqi Li, Lingyun Xu, Mingxu Zhang 他
日本語で読む → - 論文VLAロボティクス
オープンエンドなマルチモーダル指示で視覚-言語-行動モデルの可能性を解き放つ
言語だけでなく画像・手書き文字・動画などの多様な指示を入力できるVLAモデルOE-VLAを提案し、従来の言語指示と同等以上の性能と4種類の追加タスクでの有効性を示した。
原題: Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions / Wei Zhao, Gongsheng Li, Zhefei Gong 他
日本語で読む → - 論文VLAロボティクス
Robo2VLM:大規模実世界ロボット操作データセットからの視覚的質問応答
ロボットの実軌道データから操作フェーズを切り出し、空間・目標・相互作用推論のVQAデータセットを自動生成するフレームワークを提案し、VLMの評価・改善に有効性を示した。
原題: Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets / Kaiyuan Chen, Shuangyu Xie, Zehan Ma 他
日本語で読む → - 論文VLAロボティクス
ピクセルモーションを汎用表現としたロボット制御フレームワークLangToMo
画像拡散モデルでテキストからピクセルモーションを生成し、それを中間表現としてロボット動作に変換する二重システム構成の視覚-言語-行動フレームワークを提案。
原題: Pixel Motion as Universal Representation for Robot Control / Kanchana Ranasinghe, Xiang Li, E-Ro Nguyen 他
日本語で読む → - 論文VLAロボティクス
適応的ストレステストによるブラックボックスLLMプランナの摂動観測下でのロバスト性評価
LLMプランナのプロンプト表現やセンサノイズの摂動に対する挙動を調査し、適応的ストレステストとMCTSで失敗を引き起こす摂動を効率的に探索する手法を提案した。
原題: Characterizing the Robustness of Black-Box LLM Planners Under Perturbed Observations with Adaptive Stress Testing / Neeloy Chakraborty, John Pohovey, Melkior Ornik 他
日本語で読む → - 論文VLAロボティクス
RoboFAC: ロボット失敗分析と修正のための包括的フレームワーク
ロボット操作の失敗を診断・修正するための大規模データセットと軽量マルチモーダルモデルを構築し、VLA制御の回復性能を向上させた。
原題: RoboFAC: A Comprehensive Framework for Robotic Failure Analysis and Correction / Zewei Ye, Weifeng Lu, Minghao Ye 他
日本語で読む → - 論文VLA画像認識
予測プロンプトと負例学習による汎化可能な視覚言語Few-Shot適応
視覚言語モデルのFew-Shot適応において、クエリごとに混同しやすいクラスを選択的に抑制し、LLMで生成した対比プロンプトと適応的融合重みを組み合わせることで、分布シフトやラベルノイズ下でも高精度を実現した。
原題: Generalizable Vision-Language Few-Shot Adaptation with Predictive Prompts and Negative Learning / Sriram Mandalika
日本語で読む → - 論文VLAロボティクス
拡散ポリシーに对称性を組み込むための実践的ガイド
拡散ポリシーに完全な同変設計を必要とせず、不変表現や同変視覚エンコーダ、フレーム平均化などの実践的手法で対称性の利点を組み込む方法を検討し、その有効性を実験的に示した。
原題: A Practical Guide for Incorporating Symmetry in Diffusion Policy / Dian Wang, Boce Hu, Shuran Song 他
日本語で読む → - 論文VLAロボティクス
3D CAVLA: 奥行きと3Dコンテキストを活用した未見タスクへの汎化を実現する視覚言語行動モデル
VLAモデルにChain-of-Thought推論、深度認識、関心領域検出を組み込み、未見タスクへの汎化性能を向上させたフレームワークを提案。
原題: 3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks / Vineet Bhat, Yu-Hsiang Lan, Prashanth Krishnamurthy 他
日本語で読む → - 論文VLA機械学習
インターネット動画知識の適応による新規タスクの解決
大規模動画生成モデルに少量のロボット実演データを適応させ、テキスト条件付けで新規タスクへ汎化する手法を比較し、逆確率適応という新手法を提案した。
原題: Solving New Tasks by Adapting Internet Video Knowledge / Calvin Luo, Zilai Zeng, Yilun Du 他
日本語で読む → - 論文VLAAI
見ることは信じること:基盤モデルを不確実性推定器として用いた信念空間プランニング
VLMを不確実性推定に用いて記号的な信念表現を構築し、部分観測環境で戦略的な情報収集を組み込んだ信念空間プランニングを実現した研究。
原題: Seeing is Believing: Belief-Space Planning with Foundation Models as Uncertainty Estimators / Linfeng Zhao, Willie McClinton, Aidan Curtis 他
日本語で読む → - 論文VLAロボティクス
透明な方策実行のための行動言語の統合モデリング
方策学習を言語生成問題として捉え、次に取る行動を自然言語で説明しながら行動トークンを自己回帰的に生成するモデルを提案し、Language-Table環境での長期的タスクにおいて説明文と行動軌跡の品質が同時に向上することを示した。
原題: Joint Action Language Modelling for Transparent Policy Execution / Theodor Wulff, Rahul Singh Maharjan, Xinyun Chi 他
日本語で読む → - 論文VLA画像認識
ReasonDrive: 推論強化型小型視覚言語モデルによる自動運転向け効率的視覚質問応答
GPT-4oで生成した推論連鎖を用いて小型VLMをファインチューニングし、自動運転の意思決定タスクにおける精度と説明性が向上することを示した研究。
原題: ReasonDrive: Efficient Visual Question Answering for Autonomous Vehicles with Reasoning-Enhanced Small Vision-Language Models / Amirhosein Chahe, Lifeng Zhou
日本語で読む → - 論文VLA機械学習
π0.5: オープンワールド汎化を実現する視覚-言語-行動モデル
異種タスクの共同学習により、未知の家庭環境でもキッチンや寝室の掃除などの長期的で器用な操作を実行できるVLAモデルπ0.5を提案した。
原題: $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization / Physical Intelligence, Kevin Black, Noah Brown 他
日本語で読む → - 論文VLAAI
ADAPT: あらゆるタスクの選好を能動的に発見・適応する手法
ユーザーの選好を能動的な質問で引き出しながら家事タスクを遂行するベンチマークADAPTと、そのためのLLM訓練手法Reflection-DPOを提案。
原題: ADAPT: Actively Discovering and Adapting to Preferences for any Task / Maithili Patel, Xavier Puig, Ruta Desai 他
日本語で読む → - 論文VLAロボティクス
統合ワールドモデル:大規模ロボットデータセットの事前学習に向けた動画と行動の拡散の結合
行動拡散と動画拡散を単一のトランスフォーマーに統合し、拡散タイムステップを制御することで政策・順動力学・逆動力学・動画生成を柔軟に表現できるUWMを提案。大規模マルチタスクデータでの事前学習と行動なし動画からの学習を可能にした。
原題: Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets / Chuning Zhu, Raymond Yu, Siyuan Feng 他
日本語で読む → - 論文VLAロボティクス
LLMを活用した家庭用ロボットの記憶拡張型タスクプランニングのための身体性エージェント
家庭内の物体管理を自律的に行うため、LLM駆動のエージェントオーケストレーションと記憶拡張型タスクプランニングを統合した身体性ロボットシステムを提案。RAGやGrounded SAM、LLaMa3.2-Visionを組み合わせ、ユーザー指示の実行と過去の行動追跡を可能にした。
原題: LLM-Empowered Embodied Agent for Memory-Augmented Task Planning in Household Robotics / Marc Glocker, Peter Hönig, Matthias Hirschmanner 他
日本語で読む → - 論文VLAロボティクス
AuDeRe: LLMによるロボット計画・制御の戦略自動決定と実現
タスク記述や環境制約に基づき、LLMが適切な計画・制御アルゴリズムを選択し、APIを呼び出して実行するフレームワークを提案。性能フィードバックによる反復推論で選択を洗練させ、ロボットの自律性を高める。
原題: AuDeRe: Automated Strategy Decision and Realization in Robot Planning and Control via LLMs / Yue Meng, Fei Chen, Yongchao Chen 他
日本語で読む → - 論文VLAロボティクス
Chain-of-Modality: マルチモーダル人間動画と視覚言語モデルによる操作プログラムの学習
筋電アームバンドやマイクなどで計測した人間の操作動画から、視覚言語モデルがタスク計画と力などの制御パラメータを抽出し、ロボットに操作タスクを実行させる手法を提案した。
原題: Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models / Chen Wang, Fei Xia, Wenhao Yu 他
日本語で読む → - 論文VLAロボティクス
AirVista-II: 動的シーン意味理解に向けた身体性UAVのエージェントシステム
動的環境でUAVが人間の介入なしにシーンを意味理解・推論できるよう、エージェントによるタスク識別・スケジューリングとマルチモーダル知覚、キーフレーム抽出を統合したエンドツーエンドシステムを提案。ゼロショットで多様なUAV動的シーンにおいて高品質な意味理解を実現した。
原題: AirVista-II: An Agentic System for Embodied UAVs Toward Dynamic Scene Semantic Understanding / Fei Lin, Yonglin Tian, Tengchao Zhang 他
日本語で読む →