論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
視覚-言語-行動モデルサーベイ:行動トークン化の観点から
視覚と言語の入力を行動トークンに変換して実行するVLAモデルを、行動トークンの種類(言語記述・コード・アフォーダンス・軌道など)で分類し、各手法の長所と課題を整理したサーベイ。
原題: A Survey on Vision-Language-Action Models: An Action Tokenization Perspective / Yifan Zhong, Fengshuo Bai, Shaofei Cai 他
日本語で読む → - 論文VLA機械学習
報酬モデリング不要の大規模視覚言語モデルフィードバックによる方策学習
大規模視覚言語モデルに軌道ペアの選好を問い合わせ、報酬モデルを学習せずに直接方策を訓練する手法PLAREを提案し、ロボット操作タスクで有効性を示した。
原題: Policy Learning from Large Vision-Language Model Feedback without Reward Modeling / Tung M. Luu, Donghoon Lee, Younghwan Lee 他
日本語で読む → - 論文自動運転/VLAロボティクス
適応的自律運転のための知覚・言語・行動統合フレームワーク
カメラ・LiDAR・レーダーのマルチセンサ融合とGPT-4.1による推論を組み合わせ、知覚から言語的理解を経て行動決定までを統合した自動運転フレームワークを提案。市街地交差点での評価で軌道追従や適応計画の性能向上を示した。
原題: A Unified Perception-Language-Action Framework for Adaptive Autonomous Driving / Yi Zhang, Erik Leo Haß, Kuo-Yi Chao 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルにおける信頼度較正
視覚言語行動(VLA)基盤モデルの信頼度較正を初めて調査し、タスク成功と較正誤差の関係や時間変化を分析。プロンプトアンサンブルと行動別プラットスケーリングという軽量な改善手法を提案した。
原題: Confidence Calibration in Vision-Language-Action Models / Thomas P Zollo, Richard Zemel
日本語で読む → - 論文VLAロボティクス
GR-3 汎用ロボットポリシー構築に向けた大規模VLAモデル
ウェブ規模の視覚言語データとVR収集の人間軌道データ、ロボット軌道データを組み合わせて訓練した大規模VLAモデルGR-3を開発し、両腕移動ロボットByteMiniと統合して新規物体・環境・長期タスクへの汎化性能を示した。
原題: GR-3 Technical Report / Chilam Cheang, Sijin Chen, Zhongren Cui 他
日本語で読む → - 論文VLAロボティクス
視覚言語ナビゲーションにおける身体性ギャップの再考:物理的・視覚的格差の包括的研究
人型・四足・車輪ロボットに対応した物理的に現実的なVLN評価プラットフォームVLN-PEを提案し、既存のVLN手法が実機環境で性能劣化する要因を体系的に分析した。
原題: Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities / Liuyi Wang, Xinyuan Xia, Hui Zhao 他
日本語で読む → - 論文VLAロボティクス
Evo-0: 暗黙的な空間理解を備えた視覚-言語-行動モデル
既存の視覚基盤モデルを活用し、RGB画像のみから3D幾何特徴を暗黙的に取り込むプラグアンドプレイモジュールを提案し、VLAモデルの空間理解能力を向上させた。
原題: Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding / Tao Lin, Gen Li, Yilei Zhong 他
日本語で読む → - 論文VLA画像認識
Being-H0: 大規模人間動画からの視覚-言語-行動事前学習
大規模な人間の動画を活用し、巧みな操作を可能にする視覚-言語-行動モデルを事前学習する手法を提案。物理指示チューニングにより、実世界のロボット操作への転移性能を向上させた。
原題: Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos / Hao Luo, Yicheng Feng, Wanpeng Zhang 他
日本語で読む → - 論文VLAロボティクス
見て、集中して、行動する:人間の視線と周辺視型Vision Transformerによる効率的で頑健なロボット学習
人間の視線運動を模した能動的視覚システムGIAVAを開発し、注視点に基づく周辺視パッチトークン化をViTに組み込むことで、計算量を大幅に削減しつつ背景の妨害に対する頑健性と高精度タスクの成功率を向上させた。
原題: Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers / Ian Chuang, Jinyu Zou, Andrew Lee 他
日本語で読む → - 論文VLA機械学習
行動的探索:インコンテキスト適応による探索の学習
専門家のデモデータを用いて、過去の観測と探索度合いを条件に行動を予測する長文脈生成モデルを訓練し、オンラインでの高速適応と効率的な探索を実現する手法を提案。
原題: Behavioral Exploration: Learning to Explore via In-Context Adaptation / Andrew Wagenmaker, Zhiyuan Zhou, Sergey Levine
日本語で読む → - 論文VLAロボティクス
触覚VLA:視覚-言語-行動モデルの物理知識を触覚汎化へ解き放つ
視覚・言語・行動モデルに触覚センシングを融合し、接触を伴うタスクで力制御と触覚フィードバックに基づく適応的な行動を可能にするフレームワークを提案。
原題: Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization / Jialei Huang, Shuo Wang, Fanqi Lin 他
日本語で読む → - 論文VLAロボティクス
VLA-Touch:二段階の触覚フィードバックで視覚-言語-行動モデルを強化
ベースのVLAモデルを微調整せずに、触覚言語モデルによる高レベル計画と拡散ベース制御器による行動修正の二段階で触覚フィードバックを統合し、接触を伴うタスクの計画効率と実行精度を向上させた。
原題: VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback / Jianxin Bi, Kevin Yuchen Ma, Ce Hao 他
日本語で読む → - 論文VLAロボティクス
villa-X:Vision-Language-Actionモデルにおける潜在行動モデリングの強化
VLA事前学習に潜在行動(2フレーム間の動きの抽象表現)を組み込み、その学習方法と統合方法を改善したViLLAフレームワークvilla-Xを提案。未見の身体でもゼロショットで潜在行動計画を生成でき、シミュレーションと実機のグリッパー・多指ハンド操作で高性能を示した。
原題: villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models / Xiaoyu Chen, Hangxing Wei, Pushi Zhang 他
日本語で読む → - 論文VLAロボティクス
cVLA: 効率的なカメラ空間VLAに向けて
視覚言語モデルを活用し、画像座標でエンドエフェクタの軌道ウェイポイントを直接予測する軽量なVLAを提案。シミュレーションで訓練し実機への転移性能を示した。
原題: cVLA: Towards Efficient Camera-Space VLAs / Max Argus, Jelena Bratulic, Houman Masnavi 他
日本語で読む → - 論文VLA画像認識
VOTE: 軌道アンサンブル投票による視覚-言語-行動モデルの最適化
VLAモデルの推論遅延と学習コストを削減するため、少ない行動トークンで並列生成する学習フレームワークと、過去と現在の予測を投票で統合する推論最適化を提案し、成功率と推論速度を大幅に向上させた。
原題: VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting / Juyi Lin, Amir Taherin, Arash Akbari 他
日本語で読む → - 論文自動運転/VLAロボティクス
NavigScene:視覚範囲を超えた自動運転のための局所知覚とグローバルナビゲーションの橋渡し
局所的な視覚情報とグローバルなナビゲーション情報を統合する補助データセットNavigSceneを提案し、ナビゲーション誘導の推論・選好最適化・視覚言語行動モデルの3手法で自動運転の知覚・予測・計画・QA性能を向上させた。
原題: NavigScene: Bridging Local Perception and Global Navigation for Beyond-Visual-Range Autonomous Driving / Qucheng Peng, Chen Bai, Guoxiang Zhang 他
日本語で読む → - 論文VLAロボティクス
VLMをロボット向けに:低レベル手順推論の自己批判的蒸留
小さな視覚言語モデルが外部教師なしで自己批判・修正・検証を繰り返し、ロボット実行可能な手順計画を生成する自己改善フレームワークを提案。
原題: Making VLMs More Robot-Friendly: Self-Critical Distillation of Low-Level Procedural Reasoning / Chan Young Park, Jillian Fisher, Marius Memmel 他
日本語で読む → - 論文VLAロボティクス
EdgeVLA: エッジデバイス向け効率的な視覚-言語-行動モデル
エンドエフェクタ位置予測の自己回帰を排除し小型言語モデルを活用することで、視覚-言語-行動モデルの推論を高速化しエッジデバイスでのリアルタイム動作を可能にした。
原題: EdgeVLA: Efficient Vision-Language-Action Models / Paweł Budzianowski, Wesley Maa, Matthew Freed 他
日本語で読む → - 論文VLAロボティクス
憲法コントローラ:不確実環境下で規範に従うエージェントのための疑念校正ステアリング
深層確率論理プログラムと自己疑念の概念を組み合わせ、不確実な環境でも規則に従い安全に行動する自律エージェントを実現するフレームワークCoCoを提案し、実世界の空中移動実験で有効性を示した。
原題: The Constitutional Controller: Doubt-Calibrated Steering of Compliant Agents / Simon Kohaut, Felix Divo, Navid Hamid 他
日本語で読む → - 論文VLAロボティクス
VLMから時間的に一貫した報酬を学習なしで生成する手法
VLMを用いてサブゴールの状態変化を追跡し、ベイズ推定で報酬を生成することで、追加学習なしにロボット操作の強化学習を高精度化するフレームワークを提案。
原題: Training-free Generation of Temporally Consistent Rewards from VLMs / Yinuo Zhao, Jiale Yuan, Zhiyuan Xu 他
日本語で読む → - 論文VLAロボティクス
InstructVLA: 理解から操作へと導く視覚-言語-行動インストラクションチューニング
大規模視覚言語モデルの推論能力を保ちつつ、身体性推論を活用して操作性能を高める新しいVLAモデルと学習法を提案し、汎化ベンチマークで大幅な改善を示した。
原題: InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation / Shuai Yang, Hao Li, Bin Wang 他
日本語で読む → - 論文VLA画像認識
Talk2Event: イベントカメラによる動的シーンの言語接地理解
イベントカメラの非同期ストリームを言語と結びつける大規模ベンチマークTalk2Eventを構築し、属性を考慮した接地フレームワークEventReferを提案した。
原題: Talk2Event: Grounded Understanding of Dynamic Scenes from Event Cameras / Lingdong Kong, Dongyue Lu, Ao Liang 他
日本語で読む → - 論文VLAロボティクス
Octopi-1.5:視覚・触覚・言語モデルの実演
触覚信号を複数部位から処理し、RAGで新規物体を学習できる視覚・触覚・言語モデルOctopi-1.5を、手持ち型触覚デバイスTMIを通じて実演する。
原題: Demonstrating the Octopi-1.5 Visual-Tactile-Language Model / Samson Yu, Kelvin Lin, Harold Soh
日本語で読む → - 論文VLA画像認識
VLM誘導による惑星規模の視覚的位置認識
VLMで候補地域を絞り込み、検索ベースの視覚的位置認識と再ランキングを組み合わせることで、地球規模の画像ジオローカリゼーション精度を向上させたハイブリッド手法を提案。
原題: VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization / Sania Waheed, Na Min An, Michael Milford 他
日本語で読む → - 論文VLAロボティクス
SCREP: シーン座標回帰と証拠学習に基づく知覚認識型軌道生成
証拠学習ベースのシーン座標回帰による姿勢推定と、不確実性の低いシーン座標へカメラを向ける再帰ホライズン軌道最適化を組み合わせ、GPS拒否環境での自律飛行の位置推定精度を向上させる手法を提案。
原題: SCREP: Scene Coordinate Regression and Evidential Learning-based Perception-Aware Trajectory Generation / Juyeop Han, Lukas Lao Beyer, Guilherme V. Cavalheiro 他
日本語で読む → - 論文VLAロボティクス
AirStar:音声とジェスチャーで操る知能ドローンアシスタント
大規模言語モデルを頭脳に、音声やジェスチャーで指示できるドローン「AirStar」を開発。地理空間知識と文脈推論を組み合わせ、バドミントンコートまで案内するなど、長距離ナビゲーションと近距離制御を実現した。
原題: "Hi AirStar, Guide Me to the Badminton Court." / Ziqin Wang, Jinyu Chen, Xiangyi Zheng 他
日本語で読む → - 論文VLA画像認識
ロボット操作のための幾何学認識4D動画生成
複数視点の点群整合性を訓練時に監督することで、単一RGB-D画像から時空間的に整合した未来動画を生成し、ロボットの操作軌道復元に応用する4D動画生成モデルを提案。
原題: Geometry-aware 4D Video Generation for Robot Manipulation / Zeyi Liu, Shuang Li, Eric Cousineau 他
日本語で読む → - 論文VLAロボティクス
ロボットマニピュレーションにおける視覚言語行動モデル:系統的レビュー
視覚・言語・制御を統合するVLAモデル102件、基盤データセット26件、シミュレーション環境12件を体系的に整理し、アーキテクチャやデータの分類枠組みと今後の課題を示したレビュー論文。
原題: Vision Language Action Models in Robotic Manipulation: A Systematic Review / Muhayy Ud Din, Waseem Akram, Lyes Saad Saoud 他
日本語で読む → - 論文VLAロボティクス
StreamVLN:スローファスト文脈モデリングによるストリーミング視覚言語ナビゲーション
視覚と言語の入力からリアルタイムに行動を生成するVLN向けに、高速な対話文脈と低速更新の記憶文脈を組み合わせたストリーミングフレームワークを提案し、低遅延で最先端性能を達成した。
原題: StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling / Meng Wei, Chenyang Wan, Xiqian Yu 他
日本語で読む → - 論文自動運転/VLAロボティクス
LaViPlan:言語誘導視覚経路計画と検証可能報酬強化学習
自動運転のOODシナリオに対応するため、検証可能報酬強化学習(RLVR)で視覚言語モデルを微調整し、言語推論と行動レベルの軌道計画を整合させるフレームワークを提案。
原題: LaViPlan : Language-Guided Visual Path Planning with RLVR / Hayeon Oh
日本語で読む →