論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/12/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
視覚-言語-行動モデルによる選択的ロボット分解:デスクトップからの重要部品抽出に関するケーススタディ
廃棄デスクトップからRAMやCPUを分解するタスクにVLAモデル(OpenVLA、OpenVLA-OFT)を適用し、微調整した結果、初期段階は成功するが一部の重要サブタスクで失敗することを示し、ルールベース制御とのハイブリッド戦略の有効性を報告した。
原題: Vision-Language-Action Models for Selective Robotic Disassembly: A Case Study on Critical Component Extraction from Desktops / Chang Liu, Sibo Tian, Sara Behdad 他
日本語で読む → - 論文VLAロボティクス
Video2Act: ロボットの時空間運動モデリングを備えた二重システム動画拡散ポリシー
動画拡散モデルから前景境界とフレーム間運動を抽出して行動生成の条件に使い、低速なSystem 2と高速なSystem 1の非同期二重構成でロボット操作を高精度化した研究。
原題: Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling / Yueru Jia, Jiaming Liu, Shengbang Liu 他
日本語で読む → - 論文VLAロボティクス
VLAモデルをアンチ探索として誘導:テスト時スケーリングによる安定化
VLAモデルの推論時不安定性を、軽量な疑似カウント推定器で行動チャンクを検証し、最も確からしいものを選ぶテスト時スケーリング手法TACOで解決する。
原題: Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach / Siyuan Yang, Yang Zhang, Haoran He 他
日本語で読む → - 論文VLAロボティクス
私のカップを持ってきて!視覚的注意プロンプティングによる視覚言語行動モデルの個人化
参照画像を視覚メモリとして使い、凍結したVLAモデルにトップダウン注意を注入する学習不要のVAPを提案し、個人所有物の操作を可能にした。
原題: Bring My Cup! Personalizing Vision-Language-Action Models with Visual Attentive Prompting / Sangoh Lee, Sangwoo Mo, Wook-Shin Han
日本語で読む → - 論文VLA画像認識
MindDrive: オンライン強化学習による自動運転向け視覚言語行動モデル
自動運転VLAの課題を解決するため、LLMに2種類のLoRAを組み合わせ、離散的な言語決定に対してオンライン強化学習を行うフレームワークを提案した。
原題: MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning / Haoyu Fu, Diankun Zhang, Zongchuang Zhao 他
日本語で読む → - 論文VLA画像認識
赤外線産業センシングのための視覚言語モデル:積層造形シーン記述への応用
赤外線カメラ画像をRGB互換入力に変換し、CLIPベースの視覚言語モデルを再学習なしで適応させるゼロショット枠組みVLM-IRISを提案し、3Dプリンタ上でのワークピース存在検出を実証した。
原題: Vision-Language Models for Infrared Industrial Sensing in Additive Manufacturing Scene Description / Nazanin Mahjourian, Vinh Nguyen
日本語で読む → - 論文VLAロボティクス
mimic-video: VLAを超える汎化可能なロボット制御のためのビデオ行動モデル
大規模動画モデルを事前学習に用い、その潜在表現からフローマッチングでロボットの低レベル行動を生成するVideo-Action Modelを提案。シミュレーションと実機のマニピュレーションでVLAを上回り、サンプル効率10倍・収束速度2倍を達成した。
原題: mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs / Jonas Pai, Liam Achenbach, Victoriano Montesinos 他
日本語で読む → - 論文VLAロボティクス
VLAモデルの信頼性指標としての輸送不一致
フローマッチング型VLAモデルにおいて、観測特徴と行動表現間の輸送コストを信頼性指標として利用し、推論時に行動を反復修正する軽量プラグインDiGを提案した論文。
原題: Transport Discrepancy as a Reliability Signal for Vision-Language-Action Models / Wanpeng Zhang, Ye Wang, Hao Luo 他
日本語で読む → - 論文VLAロボティクス
パラメータマージによる視覚-言語-行動ロボット方策の頑健なファインチューニング
ファインチューニング時に事前学習済みモデルと重みを補間することで、汎用能力を保ちつつ新しいタスクを頑健に学習する手法を提案した。
原題: Robust Finetuning of Vision-Language-Action Robot Policies via Parameter Merging / Yajat Yadav, Zhiyuan Zhou, Andrew Wagenmaker 他
日本語で読む → - 論文VLAロボティクス
LLMによる静的テキストシミュレーションを用いた修正型ロボット操作コード生成
LLMを静的シミュレータとして活用し、ロボット操作コードの実行をテキスト上で検証・修正するフレームワークを提案。物理実験や専用シミュレータ不要で高精度なコード生成を実現した。
原題: LLM-Driven Corrective Robot Operation Code Generation with Static Text-Based Simulation / Wenhao Wang, Yi Rong, Yanyan Li 他
日本語で読む → - 論文自動運転/VLAロボティクス
LLaViDA: 明示的推論と軌道計画強化のための大規模言語視覚運転アシスタント
視覚言語モデル(VLM)を用いて物体運動予測・意味的接地・連鎖的推論を行い、二段階学習で自動運転の軌道計画を高精度化した研究。NuScenesで平均L2誤差0.31m・衝突率0.10%を達成。
原題: LLaViDA: A Large Language Vision Driving Assistant for Explicit Reasoning and Enhanced Trajectory Planning / Yudong Liu, Spencer Hallyburton, Jiwoo Kim 他
日本語で読む → - 論文VLAロボティクス
REALM: ロボットマニピュレーションの汎化性能を評価する実機-シミュレーション検証ベンチマーク
VLAモデルの汎化性能を評価するための高忠実度シミュレーションベンチマークREALMを提案し、実機性能との相関を示すとともに、既存VLAモデルの汎化・ロバスト性が未解決課題であることを明らかにした。
原題: REALM: A Real-to-Sim Validated Benchmark for Generalization in Robotic Manipulation / Martin Sedlacek, Pavlo Yefanov, Georgy Ponimatkin 他
日本語で読む → - 論文VLA画像認識
R4: 4次元時空間における視覚言語モデルのための検索拡張推論
視覚言語モデルに4次元時空間の構造化された生涯記憶を持たせ、訓練なしで検索拡張推論を行うフレームワークR4を提案。物体レベルの意味情報を空間と時間に紐づけて蓄積し、クエリを意味・空間・時間のキーに分解して検索することで、動的環境でのエピソード的・協調的推論を可能にする。
原題: R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space / Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso 他
日本語で読む → - 論文自動運転/VLAロボティクス
WAM-Flow: 離散フローマッチングによる並列粗密運動計画
自動運転の軌道計画を離散フローマッチングで並列生成するVLAモデルを提案し、NAVSIMで高精度を達成した。
原題: WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving / Yifang Xu, Jiahao Cui, Feipeng Cai 他
日本語で読む → - 論文VLA画像認識
MMDrive: マルチ表現融合による視覚を超えた対話的シーン理解
占有マップ・LiDAR点群・テキスト記述を統合し、質問に応じて適応的に融合する自動運転向けマルチモーダル視覚言語モデルを提案。DriveLMとNuScenes-QAで高精度を達成。
原題: MMDrive: Interactive Scene Understanding Beyond Vision with Multi-representational Fusion / Minghui Hou, Wei-Hsing Huang, Shaofeng Liang 他
日本語で読む → - 論文VLAロボティクス
手頃なフィジカルAIに向けて:実世界ロボット制御のためのVLAモデルのLoRAファインチューニング
LoRAと量子化を用いて30億パラメータ級のVLAモデルを8GB VRAMの民生GPUで動かせるようにファインチューニングし、低コストなSO101ロボットアームでのボタン押しタスクに実装した研究。
原題: Towards Accessible Physical AI: LoRA-Based Fine-Tuning of VLA Models for Real-World Robot Control / Abdullah Yahya Abdullah Omaisan, Ibrahim Sheikh Mohamed
日本語で読む → - 論文VLAロボティクス
GLaD: 視覚言語行動モデルのための幾何潜在蒸留
3D幾何情報を知識蒸留でVLAモデルに組み込み、深度センサーや3D注釈なしで空間推論と操作性能を向上させた手法。
原題: GLaD: Geometric Latent Distillation for Vision-Language-Action Models / Minghao Guo, Meng Cao, Jiachen Tao 他
日本語で読む → - 論文VLA画像認識
FASTer: ニューラル行動トークン化による効率的な自己回帰型視覚言語行動モデリング
行動チャンクを単一チャネル画像として符号化する学習可能なトークナイザと、ブロック単位の自己回帰復号化を組み合わせ、推論速度とタスク性能を両立させたVLAフレームワークを提案。
原題: FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization / Yicheng Liu, Shiduo Zhang, Zibin Dong 他
日本語で読む → - 論文VLAロボティクス
成功・失敗デモンストレーションを活用した階層型視覚言語行動モデル
失敗デモも学習信号として活用し、高レベル推論と低レベル制御を分離した階層型VLAモデルVINEを提案。計画時に失敗を考慮した探索を行うことでマニピュレーションの成功率とロバスト性を向上させた。
原題: Hierarchical Vision Language Action Model Using Success and Failure Demonstrations / Jeongeun Park, Jihwan Yoon, Byungwoo Jeon 他
日本語で読む → - 論文VLA画像認識
画像生成モデルをロボットマニピュレーションの視覚プランナーとして活用
画像生成モデルをLoRAで軽く微調整し、言語指示や2D軌跡からロボット操作の動画を生成する視覚プランナーとして使えることを示した研究。
原題: Image Generation as a Visual Planner for Robotic Manipulation / Ye Pang
日本語で読む → - 論文VLAロボティクス
Cosmos-H-Surgical: 世界モデルによる手術ロボット方策の動画学習
手術動画から世界モデルを構築し、逆動力学モデルで擬似キネマティクスを推定することで、実演データ不足を補い手術ロボットのVLA方策を学習する手法を提案。
原題: Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling / Yufan He, Pengfei Guo, Mengya Xu 他
日本語で読む → - 論文VLA画像認識
SpaceTools: 二重対話型強化学習によるツール拡張空間推論
VLMが複数の視覚ツールを強化学習で協調利用できるよう訓練する二段階フレームワークDIRLを提案し、空間推論ベンチマークで最高性能と実機マニピュレーションを実現した。
原題: SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL / Siyi Chen, Mikaela Angelina Uy, Chan Hee Song 他
日本語で読む → - 論文VLAロボティクス
LookPlanGraph: VLMによるグラフ拡張を用いた身体性指示追従手法
シーングラフをVLMで実行中に更新し、環境変化に対応する指示追従手法を提案。シミュレーションと実環境で有効性を示し、新データセットGraSIFも導入。
原題: LookPlanGraph: Embodied Instruction Following Method with VLM Graph Augmentation / Anatoly O. Onishchenko, Alexey K. Kovalev, Aleksandr I. Panov
日本語で読む → - 論文VLAロボティクス
EVOLVE-VLA: 環境フィードバックによるテスト時訓練で視覚言語行動モデルを適応させる
テスト時に環境との相互作用から学習し、ノイズの多い進捗推定を平滑化して方策を進化的に改善するVLA向けテスト時訓練フレームワークを提案。
原題: EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models / Zechen Bai, Chen Gao, Mike Zheng Shou
日本語で読む → - 論文VLAロボティクス
心から手へ:身体性推論による目的志向のロボット制御
視覚言語モデルの推論能力を身体性推論と行動予測へ段階的に拡張し、二腕移動マニピュレータAstribot S1での実機評価で高い性能を示した汎用VLAモデルLumo-1を提案。
原題: Mind to Hand: Purposeful Robotic Control via Embodied Reasoning / Peijun Tang, Shangjin Xie, Binyan Sun 他
日本語で読む → - 論文VLAロボティクス
人間動画からの視覚-物理アライメントによる空間認識VLA事前学習
人間の動画から3D視覚・動作アノテーションを抽出し、2D視覚と3D空間推論を事前学習で結びつけるVLAモデルを提案。下流のロボットタスクで2D視覚と3D動作の対応が改善し、汎化性能が向上した。
原題: Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos / Yicheng Feng, Wanpeng Zhang, Ye Wang 他
日本語で読む → - 論文VLAロボティクス
IndoorUAV: 屋内連続環境における視覚言語UAVナビゲーションのベンチマーク
屋内ドローン向けの視覚言語ナビゲーション(VLN)ベンチマークとデータセット、およびタスク分解とマルチモーダル推論を用いたナビゲーションモデルを提案した論文。
原題: IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments / Xu Liu, Yu Liu, Hanshuo Qiu 他
日本語で読む → - 論文VLAロボティクス
視覚言語ロボット操作のための環境横断的な失敗推論データのスケーリング
成功軌道を摂動させて多様な失敗データを自動生成し、VLMで推論トレースを付与した大規模データセットFailCoTを構築。これで訓練した検証モデルGuardianは未知環境での失敗検出性能を向上させ、操作タスクの成功率を高めた。
原題: Scaling Cross-Environment Failure Reasoning Data for Vision-Language Robotic Manipulation / Paul Pacaud, Ricardo Garcia, Shizhe Chen 他
日本語で読む → - 論文VLAロボティクス
Embodied4C:身体性を持つ視覚言語ナビゲーションの本質を測るベンチマーク
自動運転車・ドローン・ロボットアームの3つの身体性で視覚言語モデルの推論・制御能力を評価する閉ループベンチマークを提案し、空間・時間推論が最大のボトルネックであることを示した。
原題: Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation / Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso 他
日本語で読む → - 論文VLA画像認識
SwiftVLA:軽量VLAモデルのための時空間ダイナミクスを最小オーバーヘッドで解き放つ
軽量な視覚言語モデルに4D特徴を融合トークンとマスク再構成で組み込み、推論時には4D入力を不要にして高速・省メモリで高性能なVLAモデルを実現した。
原題: SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead / Chaojun Ni, Cheng Chen, Xiaofeng Wang 他
日本語で読む →