論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
PSALM-V: 大規模言語モデルによる対話型視覚環境での記号計画の自動化
視覚環境での試行錯誤を通じて行動の事前・事後条件を自動学習し、LLMで記号計画を立案するシステムを提案。部分的観測下でも計画成功率を37%から74%に向上させた。
原題: PSALM-V: Automating Symbolic Planning in Interactive Visual Environments with Large Language Models / Wang Bill Zhu, Miaosen Chai, Ishika Singh 他
日本語で読む → - 論文VLA機械学習
大規模視覚言語モデルのフィードバックを活用する評価ベース強化学習の強化
大規模視覚言語モデルから軌道の絶対評価を得て報酬関数を学習するERL-VLMを提案し、データ不均衡やノイズに対処して従来手法を上回る性能を示した。
原題: Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models / Tung Minh Luu, Younghwan Lee, Donghoon Lee 他
日本語で読む → - 論文VLA画像認識
自動運転のための視覚-言語-行動モデルに関するサーベイ
自動運転向けの視覚・言語・行動を統合したVLAモデルについて、アーキテクチャや20以上の代表モデル、データセット、課題を初めて体系的にまとめたサーベイ。
原題: A Survey on Vision-Language-Action Models for Autonomous Driving / Sicong Jiang, Zilin Huang, Kangan Qian 他
日本語で読む → - 論文VLAロボティクス
SwitchVLA: 実行状態を考慮したタスク切り替えが可能な視覚-言語-行動モデル
実行中に指示が変わっても柔軟に対応できるVLAフレームワークを提案し、外部プランナーや専用データなしで滑らかなタスク切り替えを実現した。
原題: SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models / Meng Li, Zhen Zhao, Zhengping Che 他
日本語で読む → - 論文VLA画像認識
Da Yu:水上監視とシーン理解のためのUSV向け画像キャプショニング
水上環境の画像キャプションデータセットWaterCaptionを構築し、USV向けのエッジ展開可能なマルチモーダル大規模言語モデルDa Yuを提案した。
原題: Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding / Runwei Guan, Ningwei Ouyang, Tianhao Xu 他
日本語で読む → - 論文VLAAI
身体性ウェブエージェント:物理世界とデジタル世界を統合するエージェント知能
3Dシミュレーション環境とウェブインターフェースを統合したプラットフォームを構築し、料理・ナビゲーション・買い物など物理とデジタルの協調推論を要するタスクのベンチマークを提案した。
原題: Embodied Web Agents: Bridging Physical-Digital Realms for Integrated Agent Intelligence / Yining Hong, Rui Sun, Bingxuan Li 他
日本語で読む → - 論文VLAロボティクス
STAR: 回転拡張ベクトル量子化による多様なロボットスキル抽象化の学習
VQ-VAEのコードブック崩壊とスキル間因果関係の欠如を解決するため、回転拡張残差スキル量子化と因果スキルトランスフォーマーを組み合わせ、LIBEROベンチマークと実世界タスクで約12%の性能向上を達成した。
原題: STAR: Learning Diverse Robot Skill Abstractions through Rotation-Augmented Vector Quantization / Hao Li, Qi Lv, Rui Shao 他
日本語で読む → - 論文VLAロボティクス
空中・地上ロボットシステムにおける意味的ナビゲーションとマニピュレーションのための階層的言語モデル
LLMによる階層的タスク分解とVLMによる意味的知覚を統合し、空中ロボットが地上ロボットを誘導して長期的な物体配置タスクをゼロショットで遂行する異種協調システムを提案。
原題: Hierarchical Language Models for Semantic Navigation and Manipulation in an Aerial-Ground Robotic System / Haokun Liu, Zhaoqi Ma, Yunong Li 他
日本語で読む → - 論文VLAロボティクス
RoboMonkey: VLAモデルのためのテスト時サンプリングと検証のスケーリング
VLAモデルのテスト時スケーリングを調査し、サンプリングと検証によりロバスト性を高めるフレームワークRoboMonkeyを提案。合成データで訓練したVLM検証器で行動を選択し、分布外タスクで25%の性能向上を実現。
原題: RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models / Jacky Kwok, Christopher Agia, Rohan Sinha 他
日本語で読む → - 論文VLAAI
反復的な方策改善による大規模言語モデルを用いた感覚運動制御
LLMがエージェントの記述から制御方策を生成し、評価中の性能フィードバックと感覚運動データを用いて反復的に改善することで、連続観測を連続行動に写像する制御を実現する手法を提案した。
原題: Sensory-Motor Control with Large Language Models via Iterative Policy Refinement / Jônata Tyska Carvalho, Stefano Nolfi
日本語で読む → - 論文VLAロボティクス
RationalVLA:デュアルシステムを備えた合理的視覚言語行動モデル
曖昧・不可能な指示を拒否しつつ、実行可能な指示に基づくロボットアーム操作を行う二重システムの視覚言語行動モデルを提案し、新ベンチマークRAMAで評価した。
原題: RationalVLA: A Rational Vision-Language-Action Model with Dual System / Wenxuan Song, Jiayi Chen, Wenxue Li 他
日本語で読む → - 論文VLAAI
IS-Bench:家庭内タスクにおけるVLM駆動型身体エージェントの対話型安全性評価
家庭内タスクを行うVLM駆動型エージェントの対話型安全性を評価する初のマルチモーダルベンチマークIS-Benchを提案し、161のシナリオと388のリスクで危険回避行動の手順を検証した。
原題: IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks / Xiaoya Lu, Zeren Chen, Xuhao Hu 他
日本語で読む → - 論文VLAロボティクス
BridgeVLA: 視覚言語モデルによる効率的な3Dマニピュレーション学習のための入出力アラインメント
3D入力を複数の2D画像に投影し、2Dヒートマップで行動予測を行うことで、VLMを活用した3Dマニピュレーション学習を効率化する手法を提案。
原題: BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models / Peiyan Li, Yixiang Chen, Hongtao Wu 他
日本語で読む → - 論文VLAAI
拡散ポリシー高速化のためのブロック単位適応キャッシュ
拡散ポリシーの推論を、ブロック単位で中間特徴を適応的にキャッシュ・再利用することで、学習不要で高速化する手法を提案。
原題: Block-wise Adaptive Caching for Accelerating Diffusion Policy / Kangye Ji, Yuan Meng, Hanyun Cui 他
日本語で読む → - 論文VLAロボティクス
ロボット視覚言語行動モデルへの敵対的攻撃
視覚言語行動モデル(VLA)にLLMのジェイルブレイク攻撃を適用し、ロボットの制御権を奪取できることを示した研究。
原題: Adversarial Attacks on Robotic Vision Language Action Models / Eliot Krzysztof Jones, Alexander Robey, Andy Zou 他
日本語で読む → - 論文VLA画像認識
一人称視点動画におけるゼロショット時間的インタラクション定位
一人称視点動画で人間と物体の把持動作のタイミングを、大規模視覚言語モデルと3D手の速度を活用してゼロショットで高精度に定位する手法EgoLocを提案した。
原題: Zero-Shot Temporal Interaction Localization for Egocentric Videos / Erhang Zhang, Junyi Ma, Yin-Dong Zheng 他
日本語で読む → - 論文VLAロボティクス
GRaD-Nav++:ガウスラディアンスフィールドと微分可能力学による視覚言語モデル駆動ドローン航法
3Dガウススプラッティングシミュレータと微分可能強化学習で訓練した軽量VLAモデルを機載し、自然言語指示に従ってリアルタイムにドローンを飛行させるフレームワークを提案。
原題: GRaD-Nav++: Vision-Language Model Enabled Visual Drone Navigation with Gaussian Radiance Fields and Differentiable Dynamics / Qianzhong Chen, Naixiang Gao, Suning Huang 他
日本語で読む → - 論文VLAロボティクス
LoHoVLA:長期的な身体タスクのための統合視覚言語行動モデル
大規模視覚言語モデルを基盤に、言語と行動トークンを統合生成し、階層的閉ループ制御で長期的身体タスクを遂行するVLAフレームワークを提案。
原題: LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks / Yi Yang, Jiaxuan Sun, Siqi Kou 他
日本語で読む → - 論文VLAロボティクス
意味的デジタルツインによる言語モデルのロボット計画への接地
意味的デジタルツインと大規模言語モデルを組み合わせ、自然言語指示を環境情報に基づいて行動計画に変換し、失敗時には再計画を行うロボットタスク実行フレームワークを提案した。
原題: Grounding Language Models with Semantic Digital Twins for Robotic Planning / Mehreen Naeem, Andrew Melnik, Michael Beetz
日本語で読む → - 論文VLAロボティクス
Fast ECoT: 思考の再利用による効率的な身体性Chain-of-Thought推論
VLAモデルの身体性Chain-of-Thought推論を、高レベル推論のキャッシュ・再利用とモジュール推論の並列生成により高速化し、学習不要でリアルタイム動作に近づけた手法。
原題: Fast ECoT: Efficient Embodied Chain-of-Thought via Thoughts Reuse / Zhekai Duan, Yuan Zhang, Shikai Geng 他
日本語で読む → - 論文VLAAI
製造業における知覚・説明・自律行動のためのハイブリッド推論
産業用3Dプリンタを対象に、視覚言語行動モデルとプロセス専門家・回帰モデル・検索拡張生成を組み合わせ、定量精度と汎化性能を両立させた自律制御フレームワークCIPHERを提案。
原題: Hybrid Reasoning for Perception, Explanation, and Autonomous Action in Manufacturing / Christos Margadji, Sebastian W. Pattinson
日本語で読む → - 論文VLAロボティクス
人間支援によるロボット政策の行動選好最適化
人間とのインタラクションから得た選好信号を用いてVLAモデルを事後的に改善するAPOを提案し、失敗からの学習を可能にした。
原題: Human-assisted Robotic Policy Refinement via Action Preference Optimization / Wenke Xia, Yichu Yang, Hongtao Wu 他
日本語で読む → - 論文VLA自然言語
SoMi-ToM:身体的社会的相互作用における多視点Theory of Mindの評価
マルチエージェントの身体的社会的相互作用を題材に、一人称視点と三人称視点の両方からTheory of Mindを評価するベンチマークSoMi-ToMを提案し、LVLMの性能を人間と比較評価した。
原題: SoMi-ToM: Evaluating Multi-Perspective Theory of Mind in Embodied Social Interactions / Xianzhe Fan, Xuhui Zhou, Chuanyang Jin 他
日本語で読む → - 論文VLAロボティクス
視覚ロボット計画のための自己改善ループ
ロボットタスクを解くための視覚計画モデルを、自己生成した軌跡で反復的に改善するSILVRを提案し、未見タスクでも性能が向上することを示した。
原題: Self-Improving Loops for Visual Robotic Planning / Calvin Luo, Zilai Zeng, Mingxi Jia 他
日本語で読む → - 論文VLAロボティクス
DURA-CPS:LLM搭載サイバーフィジカルシステムの信頼性保証のためのマルチロールオーケストレータ
AI搭載CPSの検証・検証を自動化するため、安全監視やセキュリティ評価などの役割をエージェントに割り当てて反復的に信頼性を評価・改善するフレームワークを提案し、自動運転車の交差点走行のケーススタディで有効性を示した。
原題: DURA-CPS: A Multi-Role Orchestrator for Dependability Assurance in LLM-Enabled Cyber-Physical Systems / Trisanth Srinivasan, Santosh Patapati, Himani Musku 他
日本語で読む → - 論文VLAロボティクス
OG-VLA: 正投影画像生成による3D認識型視覚言語行動モデル
多視点RGBD観測を正投影画像に変換し、LLMと拡散モデルでエンドエフェクタの次位置・姿勢を生成する3D認識型VLAを提案。未見環境への汎化性能を大幅に向上。
原題: OG-VLA: Orthographic Image Generation for 3D-Aware Vision-Language Action Model / Ishika Singh, Ankit Goyal, Stan Birchfield 他
日本語で読む → - 論文VLAロボティクス
DynaGuide: 動的ガイダンスによる拡散ポリシーの能動的制御
拡散ポリシーの生成過程に外部のダイナミクスモデルからのガイダンスを注入することで、追加学習なしに既存ポリシーを多様な目的へ誘導できる手法を提案。
原題: DynaGuide: Steering Diffusion Polices with Active Dynamic Guidance / Maximilian Du, Shuran Song
日本語で読む → - 論文VLAロボティクス
意図から実行へ:Vision-Language-Actionモデルの汎化境界を探る
VLAモデルの汎化能力を体系的に評価するため、言語・視覚・物体に関する50のシミュレーションタスクを用意し、最先端モデルが知覚や計画は得意でも、分布外の状況では動作実行が崩れることを示した。
原題: From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models / Irving Fang, Juexiao Zhang, Shengbang Tong 他
日本語で読む → - 論文VLAロボティクス
アクションチャンキング方策のリアルタイム実行
拡散・フロー系VLAの推論遅延に対応するため、次チャンクを生成しつつ現在のチャンクを非同期実行するRTCを提案し、動的タスクでの有効性を示した。
原題: Real-Time Execution of Action Chunking Flow Policies / Kevin Black, Manuel Y. Galliker, Sergey Levine
日本語で読む → - 論文VLAロボティクス
オンデバイス言語モデルによるロボット計画のための最小限の人間介入での蒸留
クラウドに依存せずオンデバイスで動作する小型言語モデルベースのロボットプランナーを、既存のLLMプランナーから合成データを用いて蒸留するフレームワークPRISMを提案し、Llama-3.2-3Bの性能をGPT-4oの10-20%から93%以上に向上させた。
原題: Distilling On-device Language Models for Robot Planning with Minimal Human Intervention / Zachary Ravichandran, Ignacio Hounie, Fernando Cladera 他
日本語で読む →