論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/10/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
MM-Nav: マルチビューVLAモデルによるマルチエキスパート学習を用いた堅牢な視覚ナビゲーション
360度視野のマルチビューVLAモデルを強化学習エキスパートのデータから教師あり学習し、到達・すり抜け・回避の能力を統合して実世界でも汎化する視覚ナビゲーションを実現した。
原題: MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning / Tianyu Xu, Jiawei Chen, Jiazhao Zhang 他
日本語で読む → - 論文VLAAI
Memo: 強化学習による記憶効率の良い身体性エージェントの訓練
Transformerベースの強化学習において、定期的な要約トークンを入力に挟み込むことで記憶の生成と検索を行い、長期的なタスクを効率的に学習する手法を提案。
原題: Memo: Training Memory-Efficient Embodied Agents with Reinforcement Learning / Gunshi Gupta, Karmesh Yadav, Zsolt Kira 他
日本語で読む → - 論文VLAロボティクス
QuASH: 自然言語ヒューリスティクスによる視覚言語ロボットマップのクエリ
視覚言語モデルの埋め込みを用いたロボットマップに対し、クエリに関連する同義語・反意語を活用して環境をマッチ/非マッチに分類するクエリ手法を提案し、マップと画像のクエリ性能を向上させた。
原題: QuASH: Using Natural-Language Heuristics to Query Visual-Language Robotic Maps / Matti Pekkanen, Francesco Verdoja, Ville Kyrki
日本語で読む → - 論文VLA画像認識
LIBERO-PRO:記憶を超えたVLAモデルの堅牢で公平な評価に向けて
VLAモデル評価用ベンチマークLIBEROを拡張し、物体・初期状態・指示・環境を摂動させて評価したところ、標準評価で90%超の精度が汎化設定では0.0%に崩壊し、モデルがタスク理解ではなく訓練データの丸暗記に依存していることを明らかにした。
原題: LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization / Xueyang Zhou, Yangming Xu, Guiyao Tie 他
日本語で読む → - 論文VLAロボティクス
EBT-Policy:エネルギーが創発的な物理推論能力を解き放つ
拡散ポリシーに代わるエネルギー・ベースのポリシーEBT-Policyを提案し、少ない計算で高精度・高ロバストなロボット制御を実現、失敗からのゼロショット回復などの創発能力を示した。
原題: EBT-Policy: Energy Unlocks Emergent Physical Reasoning Capabilities / Travis Davies, Yiqi Huang, Alexi Gladstone 他
日本語で読む → - 論文VLAロボティクス
Spatial Forcing:視覚-言語-行動モデルのための暗黙的な空間表現アラインメント
3D入力や深度推定器に頼らず、VLAモデルの中間視覚埋め込みを事前学習済み3D基盤モデルの幾何表現に揃えることで、空間理解を暗黙的に獲得させ、行動精度と学習効率を向上させる手法を提案。
原題: Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model / Fuhao Li, Wenxuan Song, Han Zhao 他
日本語で読む → - 論文VLA画像認識
世界モデル拡張VLAのためのデュアルストリーム拡散
視覚・言語・行動モデルに世界モデルを組み合わせ、状態と行動を別ストリームで拡散生成するDUSTを提案し、シミュレーションと実機で性能向上を実証した。
原題: Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model / John Won, Kyungmin Lee, Huiwon Jang 他
日本語で読む → - 論文VLA画像認識
効率的な視覚-言語-行動モデルのサーベイ
視覚-言語-行動モデル(VLA)の効率化に関する初の包括的サーベイであり、モデル設計・学習・データ収集の3つの柱で既存研究を整理し、課題と今後の方向性を示す。
原題: A Survey on Efficient Vision-Language-Action Models / Zhaoshu Yu, Bo Wang, Pengpeng Zeng 他
日本語で読む → - 論文VLAロボティクス
StaMo: コンパクトな状態表現による汎化可能なロボット動作の教師なし学習
軽量エンコーダと事前学習済みDiTデコーダで2トークンの圧縮状態表現を教師なし学習し、その差分が潜在行動として機能することを発見。VLAモデルに統合してLIBEROで14.3%、実世界で30%の性能向上を達成。
原題: StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation / Mingyu Liu, Jiuhe Shu, Hui Chen 他
日本語で読む → - 論文VLAロボティクス
HAMLET: 視覚言語行動モデルを履歴認識ポリシーに切り替える
各時刻の知覚情報を圧縮したモーメントトークンと軽量メモリモジュールで過去の文脈を統合し、VLAモデルを履歴依存タスクに適応させるフレームワークを提案。
原題: HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy / Myungkyu Koo, Daewon Choi, Taeyoung Kim 他
日本語で読む → - 論文VLA画像認識
マルチモーダル言語モデルの身体性能力をスキル単位で評価・診断するベンチマークBEAR
身体性タスクを14の原子スキルに分解してMLLMを細粒度評価するベンチマークBEARを提案し、知覚と時空間モデリングがボトルネックであることを示すとともに、視覚・空間推論ツールを組み込んだBEAR-Agentで性能を改善した。
原題: Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis / Yu Qi, Haibo Zhao, Ziyu Guo 他
日本語で読む → - 論文VLAロボティクス
RoVer: 視覚-言語-行動モデルのためのテスト時検証器としてのロボット報酬モデル
VLAモデルの推論時にロボット過程報酬モデルを検証器として使い、候補行動を生成・評価・選択することで、追加学習なしに性能を向上させるフレームワークを提案。
原題: RoVer: Robot Reward Model as Test-Time Verifier for Vision-Language-Action Model / Mingtong Dai, Lingbo Liu, Yongjie Bai 他
日本語で読む → - 論文自動運転/VLAロボティクス
SimpleVSF: VLMスコアリング融合によるエンドツーエンド自動運転の軌道予測
Vision-Language Modelの認知能力と軌道融合技術を組み合わせ、複雑な状況での意思決定を改善するエンドツーエンド自動運転フレームワークを提案。ICCV 2025 NAVSIM v2チャレンジで最高性能を達成。
原題: SimpleVSF: VLM-Scoring Fusion for Trajectory Prediction of End-to-End Autonomous Driving / Peiru Zheng, Yun Zhao, Zhan Gong 他
日本語で読む → - 論文VLAロボティクス
次世代LLMによるUAV運用:自然言語から自律飛行へ
自然言語指示を解釈し、短・中・長距離のUAVミッションを計画・制御するNeLVシステムを提案し、複数UAVの巡回・配送などのユースケースで実現可能性を示した。
原題: Next-Generation LLM for UAV: From Natural Language to Autonomous Flight / Liangqi Yuan, Chuhao Deng, Dong-Jun Han 他
日本語で読む → - 論文VLAAI
信頼できるCode-as-Policiesに向けて:身体性タスク計画のためのニューロシンボリックフレームワーク
LLMによるコード生成型タスク計画に記号的検証と環境との対話的検証を組み込み、動的・部分観測環境でのタスク成功率と信頼性を向上させた。
原題: Towards Reliable Code-as-Policies: A Neuro-Symbolic Framework for Embodied Task Planning / Sanghyun Ahn, Wonje Choi, Junyong Lee 他
日本語で読む → - 論文VLAロボティクス
HyperVLA:ハイパーネットワークによるVision-Language-Actionモデルの効率的推論
ハイパーネットワークを用いて推論時にタスク特化の小型ポリシーのみを活性化することで、VLAモデルの推論コストを大幅に削減する手法を提案。
原題: HyperVLA: Efficient Inference in Vision-Language-Action Models via Hypernetworks / Zheng Xiong, Kang Li, Zilin Wang 他
日本語で読む → - 論文VLAロボティクス
INSIGHT:Vision-Language-Actionモデルにおけるヘルプ要求トリガー生成のための推論時シーケンス内省
VLAモデルのトークン単位の不確実性信号をTransformerで時系列モデル化し、人間の助けを求めるべきタイミングを予測する学習フレームワークINSIGHTを提案。強弱の監督設定を比較し、時系列モデル化が静的スコアより優れることを示した。
原題: INSIGHT: INference-time Sequence Introspection for Generating Help Triggers in Vision-Language-Action Models / Ulas Berk Karli, Ziyao Shangguan, Tesca FItzgerald
日本語で読む → - 論文VLAロボティクス
ロボティクス向けVision-Language-Actionモデル:実世界応用に向けたレビュー
視覚・言語・行動を統合するVLAモデルについて、アーキテクチャや学習手法からロボットプラットフォーム、データセット、評価ベンチマークまでを網羅的に整理したサーベイ論文。
原題: Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications / Kento Kawaharazuka, Jihoon Oh, Jun Yamada 他
日本語で読む → - 論文VLAロボティクス
言った通りに動け:実行時推論・行動整合性検証による視覚言語行動モデルの誘導
推論型VLAモデルが生成するテキスト計画と実際の行動の不一致を実行時に検証し、シミュレーションとVLMで計画に最も合致する行動を選ぶことで、再学習なしにOOD環境でのロバスト性と新規行動の合成を実現した。
原題: Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification / Yilin Wu, Anqi Li, Tucker Hermans 他
日本語で読む → - 論文VLAロボティクス
Butter-Bench:LLM制御ロボットの実践的知能を評価するベンチマーク
LLMが制御するロボットの実践的知能を評価するベンチマークを提案し、人間とLLMの性能差や空間計画・社会的理解の課題を明らかにした。
原題: Butter-Bench: Evaluating LLM Controlled Robots for Practical Intelligence / Callum Sharrock, Lukas Petersson, Hanna Petersson 他
日本語で読む → - 論文VLAロボティクス
RobotArena ∞: 実機からシミュレーションへの変換によるスケーラブルなロボットベンチマーク
実機の動画デモを生成モデルでシミュレーション環境に自動変換し、VLAポリシーを大規模かつ再現可能に評価するベンチマークフレームワークを提案。
原題: RobotArena $\infty$: Scalable Robot Benchmarking via Real-to-Sim Translation / Yash Jangir, Yidi Zhang, Pang-Chi Lo 他
日本語で読む → - 論文VLAAI
協調型身体性AIにおける協力の改善
LLMを活用した協調型身体性エージェントのフレームワークCoELAに対し、プロンプト手法や音声統合を検証し、協調性能を最大22%向上させた。
原題: Improving Cooperation in Collaborative Embodied AI / Hima Jacob Leven Suprabha, Laxmi Nag Laxminarayan Nagesh, Ajith Nair 他
日本語で読む → - 論文VLAロボティクス
J-ORA: 日本語物体識別・参照解決・行動予測のためのロボット知覚フレームワークとマルチモーダルデータセット
日本語の人間-ロボット対話における物体属性アノテーション付きマルチモーダルデータセットを構築し、物体識別・参照解決・次行動予測の性能評価を行った。
原題: J-ORA: A Framework and Multimodal Dataset for Japanese Object Identification, Reference, Action Prediction in Robot Perception / Jesse Atuhurra, Hidetaka Kamigaito, Taro Watanabe 他
日本語で読む → - 論文VLA画像認識
QDepth-VLA:量子化深度予測を補助監督とする視覚-言語-行動モデル
VLAモデルにVQ-VAEで量子化した深度マップの潜在トークンを予測する補助タスクを追加し、空間推論能力とマニピュレーション性能を向上させた。
原題: QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models / Yixuan Li, Yuhui Chen, Mingcai Zhou 他
日本語で読む → - 論文VLA/LLMプランニングAI
不確実な環境下での意思決定のための情報探索フレームワークInfoSeeker
LLMを用いた意思決定において、内部モデルと実環境のずれを解消するため、行動前に情報を能動的に集める計画手法を提案し、部分観測環境の新ベンチマークで大幅な性能向上を示した。
原題: Information Seeking for Robust Decision Making under Partial Observability / Djengo Cyun-Jyun Fang, Tsung-Wei Ke
日本語で読む → - 論文VLAロボティクス
PFEA: 人間中心AIのためのLLMベース高レベル自然言語計画・フィードバック具現化エージェント
視覚言語モデルを活用し、音声対話・タスク計画・フィードバック評価を統合したロボット操作用エージェントを提案。シミュレーションと実環境で従来手法より28%高いタスク成功率を達成した。
原題: PFEA: An LLM-based High-Level Natural Language Planning and Feedback Embodied Agent for Human-Centered AI / Wenbin Ding, Jun Chen, Mingjia Chen 他
日本語で読む → - 論文VLAロボティクス
チームXiaomi EV-AD VLA:キャプション誘導検索システムによるクロスモーダルドローン航法
ドローンの自然言語誘導画像検索において、VLMで候補画像のキャプションを生成し再ランキングする2段階手法を提案し、ベースラインを5%改善した。
原題: Team Xiaomi EV-AD VLA: Caption-Guided Retrieval System for Cross-Modal Drone Navigation -- Technical Report for IROS 2025 RoboSense Challenge Track 4 / Lingfeng Zhang, Erjia Xiao, Yuchen Zhang 他
日本語で読む → - 論文VLAロボティクス
TIGeR: ロボティクス向け視覚言語モデルにおけるツール統合幾何推論
視覚言語モデルに外部ツールで正確な幾何計算を生成・実行させる枠組みを提案し、ロボット操作に必要なセンチメートル精度を実現した。
原題: TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics / Yi Han, Enshen Zhou, Shanyu Rong 他
日本語で読む → - 論文VLAロボティクス
リンゴを持ってきて、ソファは要らない:VLAモデルにおける身体性AIコマンドの無関係な文脈の影響
VLAモデルが言い換えや無関係な文脈を含む指示に対してどれだけ頑健かを体系的に評価し、意味的・語彙的に類似した文脈で性能が約50%低下することを示した。LLMベースのフィルタリングで元の性能の最大98.5%を回復する手法を提案。
原題: Bring the Apple, Not the Sofa: Impact of Irrelevant Context in Embodied AI Commands on VLA Models / Daria Pugacheva, Andrey Moskalenko, Denis Shepelev 他
日本語で読む → - 論文VLA自然言語
LLMは人間の指示を強化学習エージェントの創発的シンボル表現に翻訳できるか
階層型強化学習で創発する内部シンボル表現へ、GPTやClaudeなどのLLMが人間の自然言語指示を翻訳できるかをAnt Maze環境で評価し、粒度や複雑さへの感度と表現整合の限界を示した。
原題: Can LLMs Translate Human Instructions into a Reinforcement Learning Agent's Internal Emergent Symbolic Representation? / Ziqi Ma, Sao Mai Nguyen, Philippe Xu
日本語で読む →