論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
意図から実行へ:Vision-Language-Actionモデルの汎化境界を探る
VLAモデルの汎化能力を体系的に評価するため、言語・視覚・物体に関する50のシミュレーションタスクを用意し、最先端モデルが知覚や計画は得意でも、分布外の状況では動作実行が崩れることを示した。
原題: From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models / Irving Fang, Juexiao Zhang, Shengbang Tong 他
日本語で読む → - 論文VLAロボティクス
対話で飛ばす:PX4ベースのドローンエージェントに対する自然言語制御の実現
PX4・ROS 2・ローカルLLM/VLMを組み合わせ、ドローンを自然言語で操作できるオープンソースのエージェントフレームワークを構築し、シミュレーションと実機で複数モデルの性能を比較評価した。
原題: Taking Flight with Dialogue: Enabling Natural Language Control for PX4-based Drone Agent / Shoon Kit Lim, Melissa Jia Ying Chong, Jing Huey Khor 他
日本語で読む → - 論文VLAロボティクス
SAFE: 視覚言語行動モデル向けマルチタスク故障検知
VLAの内部特徴からタスク失敗の可能性を予測する汎用的な故障検知器SAFEを提案し、未見タスクでも高精度・早期検知を実現した。
原題: SAFE: Multitask Failure Detection for Vision-Language-Action Models / Qiao Gu, Yuanliang Ju, Shengxiang Sun 他
日本語で読む → - 論文VLAロボティクス
アクションチャンキング方策のリアルタイム実行
拡散・フロー系VLAの推論遅延に対応するため、次チャンクを生成しつつ現在のチャンクを非同期実行するRTCを提案し、動的タスクでの有効性を示した。
原題: Real-Time Execution of Action Chunking Flow Policies / Kevin Black, Manuel Y. Galliker, Sergey Levine
日本語で読む → - 論文VLA画像認識
自動運転のための視覚-言語-行動モデルに関するサーベイ
自動運転向けの視覚・言語・行動を統合したVLAモデルについて、アーキテクチャや20以上の代表モデル、データセット、課題を初めて体系的にまとめたサーベイ。
原題: A Survey on Vision-Language-Action Models for Autonomous Driving / Sicong Jiang, Zilin Huang, Kangan Qian 他
日本語で読む → - 論文VLAロボティクス
WorldGym: 世界モデルを政策評価環境として活用
行動条件付き動画生成モデルを仮想環境として使い、VLAロボット政策の成功率やランキングを実世界と高い相関で評価できる手法を提案。
原題: WorldGym: World Model as An Environment for Policy Evaluation / Julian Quevedo, Ansh Kumar Sharma, Yixiang Sun 他
日本語で読む → - 論文VLA画像認識
EaqVLA: 視覚-言語-行動モデルのための符号化整合量子化
VLAモデルの量子化におけるトークン不整合問題を分析し、符号化整合を考慮した混合精度量子化フレームワークを提案。既存手法より高い量子化性能と加速を実現。
原題: EaqVLA: Encoding-aligned Quantization for Vision-Language-Action Models / Feng Jiang, Zihao Zheng, Xiuping Cui 他
日本語で読む → - 論文VLA機械学習
RLはVLAの汎化に何をもたらすか?実証研究
VLAモデルの汎化性能を評価するベンチマークを構築し、RL微調整(特にPPO)がSFTより意味理解と実行頑健性を大幅に向上させることを示した実証研究。
原題: What Can RL Bring to VLA Generalization? An Empirical Study / Jijia Liu, Feng Gao, Bingwen Wei 他
日本語で読む → - 論文VLA機械学習
GenPO: 拡散生成モデルとオンポリシー強化学習の融合
拡散ポリシーをPPOなどのオンポリシーRLに組み込むため、正確な拡散反転と二重ダミー行動機構で対数尤度計算を可能にした生成ポリシー最適化フレームワークを提案。
原題: GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning / Shutong Ding, Ke Hu, Shan Zhong 他
日本語で読む → - 論文VLA画像認識
手続き生成されたオープンエンド行動環境における視覚・言語・行動モデルのベンチマーク
Procgenの多様な手続き的タスクでVLM/VLAモデルのゼロショット汎化性能を評価するベンチマークMultiNet v0.2を提案し、OODタスクでの限界やアーキテクチャ設計の重要性を明らかにした。
原題: Benchmarking Vision, Language, & Action Models in Procedurally Generated, Open Ended Action Environments / Pranav Guruprasad, Yangyue Wang, Sudipta Chowdhury 他
日本語で読む → - 論文VLAロボティクス
ManipBench:視覚言語モデルの低レベルロボット操作能力を評価するベンチマーク
視覚言語モデルが物体間の相互作用や変形物体の操作をどれだけ理解できるかを評価する新しいベンチマークManipBenchを提案し、33モデルをテストした。
原題: ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation / Enyu Zhao, Vedant Raval, Hejia Zhang 他
日本語で読む → - 論文VLAロボティクス
RobotxR1: 閉ループ強化学習による大規模言語モデルの身体性ロボット知能の実現
小型LLMを閉ループ強化学習で訓練し、ロボットの身体性知能を実現する手法を提案。自動運転タスクでSFTベースラインを上回り、GPT-4oをも超える制御適応性を達成した。
原題: RobotxR1: Enabling Embodied Robotic Intelligence on Large Language Models through Closed-Loop Reinforcement Learning / Liam Boyle, Nicolas Baumann, Paviththiren Sivasothilingam 他
日本語で読む → - 論文VLA画像認識
GeoVLM: 視覚言語マッチングによる自動運転車のジオローカリゼーション改善
視覚言語モデルのゼロショット能力を活用し、地上画像と衛星画像のクロスビュー記述を生成して再ランキングを行うことで、自動運転車のクロスビュー地理的位置推定の精度を向上させる手法を提案。
原題: GeoVLM: Improving Automated Vehicle Geolocalisation Using Vision-Language Matching / Barkin Dagda, Muhammad Awais, Saber Fallah
日本語で読む → - 論文VLAロボティクス
CLAM: ラベルなし実演からのロボット学習のための連続潜在行動モデル
行動ラベルなしの観察列とタスク非依存のプレイデータのみから、自己教師ありダイナミクス予測で連続潜在行動を推論し、実機ロボットの制御方策を学習する手法を提案。
原題: CLAM: Continuous Latent Action Models for Robot Learning from Unlabeled Demonstrations / Anthony Liang, Pavel Czempin, Matthew M. Hong 他
日本語で読む → - 論文VLA画像認識
左脳から右脳へ:視覚と言語によるナビゲーションのための適応的テキストドリーマー
視覚と言語によるナビゲーション(VLN)において、LLMをベースに左脳(論理統合)と右脳(想像的予測)の二重分岐構造で将来の環境意味を言語形式で適応的に想像し、ナビゲーション専門モジュールと統合する手法を提案。R2Rベンチマークで少ないパラメータで最先端性能を達成。
原題: Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation / Pingrui Zhang, Yifei Su, Pengyuan Wu 他
日本語で読む → - 論文VLAロボティクス
TrackVLA: 実環境における身体性視覚追跡
視覚と言語と行動を統合したVLAモデルで、対象認識と軌道計画を同時に学習し、遮蔽や動きの激しい実環境でも10FPSで頑健に目標を追跡する。
原題: TrackVLA: Embodied Visual Tracking in the Wild / Shaoan Wang, Jiazhao Zhang, Minghan Li 他
日本語で読む → - 論文VLAcs.MA
分散型安全シールドを用いた安全かつ効率的な自動運転車の車線変更
マルチエージェント強化学習による車線変更制御に、制御バリア関数とルールベースを組み合わせた分散型ハイブリッド安全シールドを統合し、衝突ゼロと交通効率の両立を実現した。
原題: Safe and Efficient CAV Lane Changing using Decentralised Safety Shields / Bharathkumar Hegde, Melanie Bouroche
日本語で読む → - 論文VLAロボティクス
VLA-RL:スケーラブルな強化学習による汎用ロボットマニピュレーションの習得
事前学習済みVLAモデルをオンライン強化学習で改善し、スパース報酬をVLMベースの報酬モデルで補うことで、LIBEROの40タスクで最高性能を達成した。
原題: VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning / Guanxing Lu, Wenkai Guo, Chubin Zhang 他
日本語で読む → - 論文VLAロボティクス
拡散ポリシーに对称性を組み込むための実践的ガイド
拡散ポリシーに完全な同変設計を必要とせず、不変表現や同変視覚エンコーダ、フレーム平均化などの実践的手法で対称性の利点を組み込む方法を検討し、その有効性を実験的に示した。
原題: A Practical Guide for Incorporating Symmetry in Diffusion Policy / Dian Wang, Boce Hu, Shuran Song 他
日本語で読む → - 論文VLAロボティクス
Hume:視覚-言語-行動モデルにシステム2思考を導入
価値誘導型の熟考(システム2)と軽量な反応型ポリシー(システム1)を組み合わせた二重システムVLAモデルを提案し、器用なロボット制御を実現した。
原題: Hume: Introducing System-2 Thinking in Visual-Language-Action Model / Haoming Song, Delin Qu, Yuanqi Yao 他
日本語で読む → - 論文VLAロボティクス
FLARE: 暗黙的世界モデリングによるロボット学習
将来の観測の潜在表現を予測する世界モデリングを拡散トランスフォーマーポリシーに組み込み、模倣学習の性能と汎化を大幅に向上させた手法。
原題: FLARE: Robot Learning with Implicit World Modeling / Ruijie Zheng, Jing Wang, Scott Reed 他
日本語で読む → - 論文VLAロボティクス
Mini Diffuser: 二段階ミニバッチによる高速マルチタスク拡散ポリシー学習
拡散ポリシー学習において、視覚言語条件ごとに複数のノイズ付き行動サンプルを組み合わせる二段階ミニバッチを導入し、情報漏洩を防ぐアーキテクチャ改良により、性能を保ちつつ学習時間とメモリを大幅に削減した。
原題: Mini Diffuser: Fast Multi-task Diffusion Policy Training Using Two-level Mini-batches / Yutong Hu, Pinhao Song, Kehan Wen 他
日本語で読む → - 論文自動運転/VLAロボティクス
X-Driver: 視覚言語モデルによる説明可能な自動運転
マルチモーダル大規模言語モデルとChain-of-Thought推論を組み合わせ、CARLAシミュレータ上の閉ループ自動運転でSOTA性能と解釈性を両立したフレームワーク。
原題: X-Driver: Explainable Autonomous Driving with Vision-Language Models / Wei Liu, Jiyuan Zhang, Binxiong Zheng 他
日本語で読む → - 論文VLAロボティクス
物体中心の行動強化表現によるロボット視覚運動方策学習
Slot AttentionとSOLVモデルを組み合わせ、人間の行動動画で微調整した物体中心エンコーダを提案し、強化学習・模倣学習によるロボット視覚運動方策の性能を向上させた。
原題: Object-Centric Action-Enhanced Representations for Robot Visuo-Motor Policy Learning / Nikos Giannakakis, Argyris Manetas, Panagiotis P. Filntisis 他
日本語で読む → - 論文VLAロボティクス
ChatVLA-2: 事前学習知識を活かしたオープンワールド身体推論を備える視覚-言語-行動モデル
VLMの能力を保持しつつロボット行動に変換するMoE型VLAモデルを提案し、ホワイトボードの数式を読んでカードを選ぶ課題などで数学・OCR・空間推論能力を示した。
原題: ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge / Zhongyi Zhou, Yichen Zhu, Junjie Wen 他
日本語で読む → - 論文VLAロボティクス
基盤モデル搭載の空中・地上ロボットの実環境展開:課題と機会
LLMを活用した自律フレームワークSPINEを実環境のロボットに展開し、数キロ規模の非構造環境での大規模計画やオンボード小型言語モデルによるUAV計画を実証した。
原題: Deploying Foundation Model-Enabled Air and Ground Robots in the Field: Challenges and Opportunities / Zachary Ravichandran, Fernando Cladera, Jason Hughes 他
日本語で読む → - 論文VLAロボティクス
物理推論と力におけるデュアルユースのジレンマについて
VLMがロボットの力強い動作を生成する際の安全対策が、有益な接触操作も抑制してしまうことを事例研究で示し、価値整合とロボット能力のトレードオフを議論した。
原題: On the Dual-Use Dilemma in Physical Reasoning and Force / William Xie, Enora Rice, Nikolaus Correll
日本語で読む → - 論文VLAロボティクス
REFLEX:大規模言語モデルによるロボット計画のためのメタ認知推論
大規模言語モデルにメタ認知学習を組み込み、失敗から自己反省して新しいスキルを合成することで、ゼロショットでのマルチロボット協調計画を改善するフレームワークREFLEXを提案。
原題: REFLEX: Metacognitive Reasoning for Reflective Zero-Shot Robotic Planning with Large Language Models / Wenjie Lin, Jin Wei-Kocsis, Jiansong Zhang 他
日本語で読む → - 論文VLAロボティクス
Interleave-VLA:画像とテキストの交互入力でロボット操作を強化
画像とテキストを交互に与える指示でロボットを学習させ、未知の物体への汎化性能を2倍に高め、手描きスケッチなどの柔軟な指示にも対応できるVLAモデルを提案。
原題: Interleave-VLA: Enhancing Robot Manipulation with Interleaved Image-Text Instructions / Cunxin Fan, Xiaosong Jia, Yihang Sun 他
日本語で読む → - 論文VLAロボティクス
InSpire: 内在的空間推論を備えた視覚-言語-行動モデル
VLAモデルに「物体はロボットから見てどの方向か」という空間推論を組み込むことで、タスク無関係な視覚特徴への誤相関を抑え、汎化性能を高める手法を提案。
原題: InSpire: Vision-Language-Action Models with Intrinsic Spatial Reasoning / Ji Zhang, Shihan Wu, Xu Luo 他
日本語で読む →