論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文自動運転/VLAAI
DiffVLA: 視覚言語モデルが導く拡散プランニングによる自動運転
視覚言語モデルを活用したハイブリッドなスパース・デンス拡散ポリシーを提案し、効率的で多様な運転行動と軌道生成の改善を実現した自動運転手法。
原題: DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving / Anqing Jiang, Yu Gao, Zhigang Sun 他
日本語で読む → - 論文VLAロボティクス
AgentThink:自動運転向け視覚言語モデルにおけるツール拡張型思考連鎖推論の統合フレームワーク
自動運転向けに、思考連鎖推論と動的なツール呼び出しを統合したフレームワークAgentThinkを提案し、DriveLMM-o1ベンチマークで推論スコアを53.91%向上させた。
原題: AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving / Kangan Qian, Sicong Jiang, Yang Zhong 他
日本語で読む → - 論文VLAロボティクス
3D CAVLA: 奥行きと3Dコンテキストを活用した未見タスクへの汎化を実現する視覚言語行動モデル
VLAモデルにChain-of-Thought推論、深度認識、関心領域検出を組み込み、未見タスクへの汎化性能を向上させたフレームワークを提案。
原題: 3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks / Vineet Bhat, Yu-Hsiang Lan, Prashanth Krishnamurthy 他
日本語で読む → - 論文VLAロボティクス
適応的ストレステストによるブラックボックスLLMプランナの摂動観測下でのロバスト性評価
LLMプランナのプロンプト表現やセンサノイズの摂動に対する挙動を調査し、適応的ストレステストとMCTSで失敗を引き起こす摂動を効率的に探索する手法を提案した。
原題: Characterizing the Robustness of Black-Box LLM Planners Under Perturbed Observations with Adaptive Stress Testing / Neeloy Chakraborty, John Pohovey, Melkior Ornik 他
日本語で読む → - 論文VLAロボティクス
OneTwoVLA:適応的推論を備えた統合視覚言語行動モデル
行動と推論を単一モデルで統合し、必要な時だけ明示的に推論する適応的切替機構を導入したVLAモデル。長期的タスク計画やエラー回復、人間との対話、視覚的接地を実現。
原題: OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning / Fanqi Lin, Ruiqian Nai, Yingdong Hu 他
日本語で読む → - 論文VLAAI
身体性AIのためのマルチモーダル・マルチタスク連合基盤モデル:エッジ統合の可能性と課題
身体性AI向けに、マルチモーダル・マルチタスク基盤モデルと連合学習を統合した新パラダイムM3T-FFMを提案し、エッジ展開の課題をEMBODYフレームワークで整理したビジョン論文。
原題: Multi-Modal Multi-Task (M3T) Federated Foundation Models for Embodied AI: Potentials and Challenges for Edge Integration / Kasra Borazjani, Payam Abdisarabshali, Fardis Nadimi 他
日本語で読む → - 論文VLAロボティクス
UAV-CodeAgents: マルチエージェントReActと視覚言語推論によるスケーラブルなUAVミッション計画
LLM/VLMを活用したマルチエージェントフレームワークで、衛星画像と自然言語指示からUAVのミッションを自動生成し、火災検知タスクで93%の成功率を達成した。
原題: UAV-CodeAgents: Scalable UAV Mission Planning via Multi-Agent ReAct and Vision-Language Reasoning / Oleg Sautenkov, Yasheerah Yaqoot, Muhammad Ahsan Mustafa 他
日本語で読む → - 論文VLAAI
空間に根ざした合成世界によるロボットの身体性認知への挑戦
NVIDIA Omniverseで生成した合成データセットを用い、視覚言語モデルに視点取得(VPT)を学習させる枠組みを提案。まずはZ軸距離の推論に焦点を当てる。
原題: Towards Embodied Cognition in Robots via Spatially Grounded Synthetic Worlds / Joel Currie, Gioele Migno, Enrico Piacenti 他
日本語で読む → - 論文VLAロボティクス
DriveSOTIF: マルチモーダル大規模言語モデルによる知覚SOTIFの高度化
自動運転の知覚におけるSOTIFリスクに対応するため、専用データセットでマルチモーダル大規模言語モデルをファインチューニングし、安全性リスクの特定精度を向上させた。
原題: DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models / Shucheng Huang, Freda Shi, Chen Sun 他
日本語で読む → - 論文VLA画像認識
予測プロンプトと負例学習による汎化可能な視覚言語Few-Shot適応
視覚言語モデルのFew-Shot適応において、クエリごとに混同しやすいクラスを選択的に抑制し、LLMで生成した対比プロンプトと適応的融合重みを組み合わせることで、分布シフトやラベルノイズ下でも高精度を実現した。
原題: Generalizable Vision-Language Few-Shot Adaptation with Predictive Prompts and Negative Learning / Sriram Mandalika
日本語で読む → - 論文VLAロボティクス
ストリーミングフローポリシー:行動軌道をフロー軌道として扱う拡散・フローマッチングポリシーの簡略化
拡散・フローマッチングポリシーを簡略化し、行動軌道をフロー軌道として扱うことで、サンプリング中にリアルタイムで行動をロボットにストリーミング可能にした手法を提案。
原題: Streaming Flow Policy: Simplifying diffusion/flow-matching policies by treating action trajectories as flow trajectories / Sunshine Jiang, Xiaolin Fang, Nicholas Roy 他
日本語で読む → - 論文VLAロボティクス
ピクセルモーションを汎用表現としたロボット制御フレームワークLangToMo
画像拡散モデルでテキストからピクセルモーションを生成し、それを中間表現としてロボット動作に変換する二重システム構成の視覚-言語-行動フレームワークを提案。
原題: Pixel Motion as Universal Representation for Robot Control / Kanchana Ranasinghe, Xiang Li, E-Ro Nguyen 他
日本語で読む → - 論文VLAロボティクス
未見タスクへの汎化に挑む視覚-言語-行動マニピュレーションの限界探索
VLAモデルのクロスタスク汎化を評価する新ベンチマークAGNOSTOSを提案し、文脈内デモンストレーションで未見タスクの行動を予測するX-ICM手法を導入した。
原題: Exploring the Limits of Vision-Language-Action Manipulations in Cross-task Generalization / Jiaming Zhou, Ke Ye, Jiayi Liu 他
日本語で読む → - 論文VLAロボティクス
ReinboT: 強化学習でロボットの視覚言語マニピュレーションを強化
模倣学習ベースの視覚言語行動モデルに強化学習の累積報酬最大化を取り入れ、高密度リターン予測で混合品質データから頑健な操作方策を学習する手法を提案。
原題: ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning / Hongyin Zhang, Zifeng Zhuang, Han Zhao 他
日本語で読む → - 論文VLA画像認識
視空間認知アシスタント
実世界の屋内動画から32万件のQAデータセットViCA-322Kを構築し、それを用いて微調整したViCA-7Bが視空間推論ベンチマークVSI-Benchの8タスクで最高性能を達成した。
原題: Visuospatial Cognitive Assistant / Qi Feng
日本語で読む → - 論文VLAロボティクス
ReWiND: 言語ガイド報酬で新規デモなしにロボット方策を教える
言語指示から報酬関数を学習し、オフラインRLで事前学習した方策を新規タスクに少ない試行で適応させるフレームワークを提案。
原題: ReWiND: Language-Guided Rewards Teach Robot Policies without New Demonstrations / Jiahui Zhang, Yusen Luo, Abrar Anwar 他
日本語で読む → - 論文VLAロボティクス
VLAは閉じた世界に留まるが、新規指示への汎化能力を持つ
VLAの内部表現を推論時に操作することで、学習済みタスクのスキルを組み合わせて新規タスクを実行できることを示し、新ベンチマークLIBERO-OODで評価した。
原題: VLAs are Confined yet Capable of Generalizing to Novel Instructions / Quanyi Li
日本語で読む → - 論文VLAロボティクス
エージェント型ロボット:身体性エージェントにおける視覚-言語-行動モデルのための脳に着想を得たフレームワーク
人間組織の標準作業手順に着想を得た「標準化行動手順(SAP)」で計画・実行・検証を連携させ、長期的なロボット操作を自己検証しながら遂行する脳模倣型フレームワークを提案。LIBEROベンチマークで平均成功率79.6%を達成。
原題: Agentic Robot: A Brain-Inspired Framework for Vision-Language-Action Models in Embodied Agents / Zhejian Yang, Yongchao Chen, Xueyang Zhou 他
日本語で読む → - 論文VLAHCI
産業オートメーションへのオントロジーと知識拡張大規模言語モデルの適用:インダストリー5.0における人間とロボットの協働を実現するための意思決定ガイダンス
製造業における人間とロボットの協働に向けて、大規模言語モデル・オントロジー・知識グラフをどのように使い分けるべきかの意思決定ガイダンスを提供する論文。
原題: Applying Ontologies and Knowledge Augmented Large Language Models to Industrial Automation: A Decision-Making Guidance for Achieving Human-Robot Collaboration in Industry 5.0 / John Oyekan, Christopher Turner, Michael Bax 他
日本語で読む → - 論文VLAロボティクス
グラウンディングからマニピュレーションへ:具現化ロボットシステムにおける基盤モデル統合のケーススタディ
ロボットシステム構築の3つのパラダイム(VLAモデル、VLMパイプライン、マルチモーダルLLMパイプライン)を、複雑な指示理解と物体操作の2つのケーススタディで評価し、汎化とデータ効率のトレードオフを明らかにした。
原題: From Grounding to Manipulation: Case Studies of Foundation Model Integration in Embodied Robotic Systems / Xiuchao Sui, Daiying Tian, Qi Sun 他
日本語で読む → - 論文VLAロボティクス
CrayonRobo: 物体中心のプロンプト駆動型視覚-言語-行動モデルによるロボットマニピュレーション
RGB画像に手書き風の2D視覚プロンプトを重ね、低レベル動作と高レベル計画を同時に指示する視覚-言語-行動モデルを提案。キーフレームごとに接触姿勢と移動方向をSE(3)空間で予測し、長期タスクを実行する。
原題: CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation / Xiaoqi Li, Lingyun Xu, Mingxu Zhang 他
日本語で読む → - 論文VLAロボティクス
三重階層拡散方策による視覚運動学習
RGB-D入力・多スケール視覚表現・階層的条件付き拡散を組み合わせ、視覚特徴と行動生成の統合を強化した視覚運動方策を提案。44のシミュレーションタスクで平均27.5%改善し、実機双腕タスクでも高性能を示した。
原題: H$^3$DP: Triply-Hierarchical Diffusion Policy for Visuomotor Learning / Yiyang Lu, Yufeng Tian, Zhecheng Yuan 他
日本語で読む → - 論文VLAロボティクス
OpenHelix: ロボットマニピュレーションのためのデュアルシステムVLAモデルの短いサーベイ、実証分析、オープンソース化
既存のデュアルシステムVLAアーキテクチャを整理・比較し、設計要素を実証評価した上で、低コストなオープンソースモデルを提供するプロジェクト。
原題: OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation / Can Cui, Pengxiang Ding, Wenxuan Song 他
日本語で読む → - 論文VLAAI
マルチモーダル大規模言語モデル駆動ロボットにおける感覚運動的自己認識
マルチモーダルLLMを自律移動ロボットに統合し、感覚運動経験を通じて自己認識(自己同定や予測的認識)を獲得できるかを調査した。
原題: Sensorimotor Self-Recognition in Multimodal Large Language Model-Driven Robots / Iñaki Dellibarda Varela, Pablo Romero-Sorozabal, Diego Torricelli 他
日本語で読む → - 論文VLAロボティクス
VISTA: 視覚と言語によるナビゲーションのための生成的視覚想像
拡散モデルを用いて言語指示に基づく未来の視覚イメージを生成し、現在の観測と整合させながら行動を決定するVLNフレームワークを提案。R2RとRoboTHORで最高性能を達成。
原題: VISTA: Generative Visual Imagination for Vision-and-Language Navigation / Yanjia Huang, Mingyang Wu, Renjie Li 他
日本語で読む → - 論文VLAロボティクス
GPSとNLPを用いた自動データキュレーションによる自動運転向け視覚言語ナビゲーション用指示-行動ペアの生成
GPS音声案内と映像を自動収集し、人手なしで指示-行動ペアを生成するプロトタイプADVLAT-Engineを構築、GPS指示を8種類に分類した。
原題: Automated Data Curation Using GPS & NLP to Generate Instruction-Action Pairs for Autonomous Vehicle Vision-Language Navigation Datasets / Guillermo Roque, Erika Maquiling, Jose Giovanni Tapia Lopez 他
日本語で読む → - 論文VLAロボティクス
DreamGen:動画世界モデルでロボット学習の汎化を解き放つ
画像から動画を生成するモデルでロボットの疑似行動データを作り、1つのテレオペデータから多様な行動・環境への汎化を実現する4段階パイプラインを提案。
原題: DreamGen: Unlocking Generalization in Robot Learning through Video World Models / Joel Jang, Seonghyeon Ye, Zongyu Lin 他
日本語で読む → - 論文VLAロボティクス
言語モデルによるエッジでのカメラ制御とシーン理解
大規模言語モデルを用いてPTZカメラを自然言語で制御するOPUSを提案し、エッジ展開向けに小型化しつつ高性能を実現した。
原題: Camera Control at the Edge with Language Models for Scene Understanding / Alexiy Buynitsky, Sina Ehsani, Bhanu Pallakonda 他
日本語で読む → - 論文VLAロボティクス
物理推論と座標系ラベリングによる力強いスキル獲得
VLMに軌道ではなく力(レンチ)を出力させ、座標系を画像に重ねることで、事前学習なしに様々なマニピュレーションタスクでゼロショット汎化を実現した。
原題: Unfettered Forceful Skill Acquisition with Physical Reasoning and Coordinate Frame Labeling / William Xie, Max Conway, Yutong Zhang 他
日本語で読む → - 論文VLAAI
神経記号的コンセプト
感覚入力と行動出力に基づく神経記号的コンセプトの語彙を用いて、継続学習と柔軟な推論が可能なエージェントを構築する概念中心の枠組みを提案。
原題: Neuro-Symbolic Concepts / Jiayuan Mao, Joshua B. Tenenbaum, Jiajun Wu
日本語で読む →