論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/9/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAAI
MMCD: 知識蒸留を用いたマルチモーダル協調意思決定によるコネクテッド自律走行
複数車両のマルチモーダル観測を融合し、知識蒸留で一部センサー欠如時にも堅牢な意思決定を実現する枠組みを提案。地上車・空陸協調実験で安全性を最大20.7%改善。
原題: MMCD: Multi-Modal Collaborative Decision-Making for Connected Autonomy with Knowledge Distillation / Rui Liu, Zikang Wang, Peng Gao 他
日本語で読む → - 論文VLA自然言語
成長する視点:大規模言語モデルを用いた身体化された視点取得と内的ナラティブ発達のモデリング
LLMとReActを組み合わせ、Selmanの発達段階に沿った視点取得をシミュレートするPerspActシステムを拡張ディレクター課題で評価し、内的ナラティブが協調行動に与える影響を分析した。
原題: Growing Perspectives: Modelling Embodied Perspective Taking and Inner Narrative Development Using Large Language Models / Sabrina Patania, Luca Annese, Anna Lambiase 他
日本語で読む → - 論文VLAロボティクス
RLBind: ロボット知覚のための敵対的摂動に頑健なクロスモーダル統合埋め込み
視覚・音声・熱・動画を統合するマルチモーダルエンコーダに対し、敵対的摂動と自然な劣化に強い埋め込みを学習する2段階のクロスモーダル整合フレームワークを提案し、ゼロショット性能を保ちつつロバスト性を向上させた。
原題: RLBind: Adversarial-Invariant Cross-Modal Alignment for Unified Robust Embeddings / Yuhong Lu
日本語で読む → - 論文VLAロボティクス
AssemMate: グラフベースLLMによるロボット組立支援
知識グラフを入力とするLLMで組立作業の対話支援と把持を実現し、従来比で高精度・高速・短コンテキストを達成した。
原題: AssemMate: Graph-Based LLM for Robotic Assembly Assistance / Qi Zheng, Chaoran Zhang, Zijian Liang 他
日本語で読む → - 論文VLAロボティクス
LLMによるタスク・アフォーダンスレベル探索を用いた強化学習
大規模言語モデルの計画をタスクとアフォーダンスの両レベルで活用し、強化学習の探索を効率化するフレームワークLLM-TALEを提案。把持・配置タスクで成功率とサンプル効率が向上し、実機へのゼロショット転移も示した。
原題: LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning / Jelle Luijkx, Runyu Ma, Zlatan Ajanović 他
日本語で読む → - 論文VLAロボティクス
UnderwaterVLA:自律型水中ナビゲーションのための二重脳型視覚言語行動アーキテクチャ
水中ロボットにVLAモデルを初めて適用し、高レベル推論と低レベル制御を分離した二重脳構成と流体力学を考慮したMPCを組み合わせることで、濁った水中でもナビゲーション精度とタスク完了率を向上させた。
原題: UnderwaterVLA: Dual-brain Vision-Language-Action architecture for Autonomous Underwater Navigation / Zhangyuan Wang, Yunpeng Zhu, Yuqi Yan 他
日本語で読む → - 論文VLAロボティクス
RetoVLA: レジスタトークンを再利用した空間推論対応の軽量VLAモデル
Vision Transformerのレジスタトークンを捨てずに行動計画モジュールへ注入し、パラメータを増やさずに軽量VLAモデルの3D空間推論能力を回復させた。
原題: RetoVLA: Reusing Register Tokens for Spatial Reasoning in Vision-Language-Action Models / Jiyeon Koo, Taewan Cho, Hyunjoon Kang 他
日本語で読む → - 論文VLAロボティクス
DreamNav: 軌道ベースの想像フレームワークによるゼロショット視覚言語ナビゲーション
自己中心視点のみを用いて、軌道レベル計画と能動的想像を統合したゼロショット視覚言語ナビゲーション手法を提案し、VLN-CEと実世界でSOTAを達成した。
原題: DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation / Yunheng Wang, Yuetong Fang, Taowen Wang 他
日本語で読む → - 論文VLA機械学習
自己改善する身体性基盤モデル
ロボット基盤モデルの事後学習を2段階(行動クローン+残りステップ予測のSFT、その後自己改善)で行い、人手を最小限に自律的なスキル獲得と高い成功率を実現した研究。
原題: Self-Improving Embodied Foundation Models / Seyed Kamyar Seyed Ghasemipour, Ayzaan Wahid, Jonathan Tompson 他
日本語で読む → - 論文VLAロボティクス
ViReSkill: 視覚に基づく再計画とスキル記憶によるLLMベースの生涯ロボット学習
LLM/VLMの計画を視覚情報で接地し、失敗時に再計画、成功した計画をスキルとして蓄積・再利用する枠組みを提案。LIBEROやRLBench、実機で成功率を向上させた。
原題: ViReSkill: Vision-Grounded Replanning with Skill Memory for LLM-Based Planning in Lifelong Robot Learning / Tomoyuki Kagaya, Subramanian Lakshmi, Anbang Ye 他
日本語で読む → - 論文VLAロボティクス
I-FailSense: 視覚言語モデルによる汎用的なロボット失敗検出に向けて
視覚言語モデルを微調整し、内部層に軽量な分類ヘッドを付けてアンサンブルすることで、指示と意味的にずれたロボットの失敗を検出するフレームワークを提案。
原題: I-FailSense: Towards General Robotic Failure Detection with Vision-Language Models / Clemence Grislain, Hamed Rahimi, Olivier Sigaud 他
日本語で読む → - 論文VLAロボティクス
PhysiAgent: 実世界で動作する身体性エージェントフレームワーク
VLMとVLAを監視・記憶・自己反省機構とツールボックスで統合し、VLAの能力を最大限に引き出す身体性エージェントフレームワークを提案。複雑な実世界ロボットタスクでの性能向上を実証した。
原題: PhysiAgent: An Embodied Agent Framework in Physical World / Zhihao Wang, Jianxiong Li, Jinliang Zheng 他
日本語で読む → - 論文VLA画像認識
JanusVLN: 二重暗黙メモリで意味と空間を分離する視覚言語ナビゲーション
人間の左右脳のように意味理解と空間認知を別々の固定サイズの暗黙的ニューラルメモリで表現し、冗長な計算を抑えつつ効率的に視覚言語ナビゲーションを行うフレームワークを提案した。
原題: JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation / Shuang Zeng, Dekang Qi, Xinyuan Chang 他
日本語で読む → - 論文VLAAI
ゴールだけでなくステップを評価:VLMによるロボットマニピュレーションのサブゴール評価
ロボット学習の評価を最終的な成功/失敗だけでなく、各サブゴールの成功率で可視化するため、視覚言語モデルを自動判定者として使う評価フレームワークStepEvalの設計原則を提案した論文。
原題: Score the Steps, Not Just the Goal: VLM-Based Subgoal Evaluation for Robotic Manipulation / Ramy ElMallah, Krish Chhajer, Chi-Guhn Lee
日本語で読む → - 論文VLAロボティクス
AnywhereVLA: 言語条件付き探索と移動マニピュレーション
未知の屋内環境で自然言語によるピックアンドプレースを実現するモジュール型移動マニピュレーションフレームワークを提案し、SLAMとVLAを組み合わせてエッジハードウェア上で46%の成功率を達成した。
原題: AnywhereVLA: Language-Conditioned Exploration and Mobile Manipulation / Konstantin Gubernatorov, Artem Voronov, Roman Voronov 他
日本語で読む → - 論文VLAロボティクス
MLA: ロボットマニピュレーションにおけるマルチモーダル理解と予測のためのマルチセンサリー言語行動モデル
2D画像・3D点群・触覚を位置対応で統合し、将来のマルチセンサリー情報を予測する言語行動モデルを提案。接触の多い実世界タスクで従来の2D/3D VLAを大きく上回る。
原題: MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation / Zhuoyang Liu, Jiaming Liu, Jiadong Xu 他
日本語で読む → - 論文VLAロボティクス
LLaDA-VLA:視覚言語拡散アクションモデル
拡散ベースの視覚言語モデルをロボットマニピュレーションに適応させた初のVLAモデルを提案し、特殊トークン分類と階層的アクション復号により従来手法を上回る性能を実現した。
原題: LLaDA-VLA: Vision Language Diffusion Action Models / Yuqing Wen, Hebei Li, Kefan Gu 他
日本語で読む → - 論文VLAロボティクス
世界モデリングによる潜在行動の事前学習
ラベルなし動画から世界モデリングで潜在行動表現を自己教師あり学習し、模倣学習モデルを事前学習するフレームワークLAWMを提案。
原題: Latent Action Pretraining Through World Modeling / Bahey Tharwat, Yara Nasser, Ali Abouzeid 他
日本語で読む → - 論文VLAロボティクス
CollabVLA: 人間と共に夢を見る自己内省型視覚-言語-行動モデル
VLMによる内省的推論と拡散ベースの行動生成を専門家混合設計で統合し、不確実な状況では人間に助言を求める協調的な視覚-言語-行動エージェントを実現した。
原題: CollabVLA: Self-Reflective Vision-Language-Action Model Dreaming Together with Human / Nan Sun, Yongchang Li, Chenxu Wang 他
日本語で読む → - 論文VLAロボティクス
身体構成に同変な視覚-言語-行動ポリシーに向けて
ロボットの身体構成の変化に対して同変性を持つように視覚-言語-行動ポリシーを設計し、新しい機体構成への汎化と効率的なファインチューニングを実現した研究。
原題: Toward Embodiment Equivariant Vision-Language-Action Policy / Anzhe Chen, Yifei Yang, Zhenjie Zhu 他
日本語で読む → - 論文VLAロボティクス
トルク対応VLAモデルの設計空間の解明
トルク信号をVLAモデルに統合する設計空間を体系的に検討し、デコーダへのトルクアダプタ導入と補助出力としてのトルク予測が有効であることを示した。
原題: TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models / Zongzheng Zhang, Haobo Xu, Zhuo Yang 他
日本語で読む → - 論文水中ロボット/VLAロボティクス
DREAM: ドメイン認識推論による効率的な自律型水中モニタリング
VLMを活用し、事前位置情報なしで牡蠣や沈没船などの対象を探索・監視する水中ロボットの自律フレームワークを提案し、従来手法より少ないステップで広範囲をカバーできることを示した。
原題: DREAM: Domain-aware Reasoning for Efficient Autonomous Underwater Monitoring / Zhenqi Wu, Abhinav Modi, Angelos Mavrogiannis 他
日本語で読む → - 論文VLAロボティクス
TrajBooster: 軌道中心学習によるヒューマノイド全身マニピュレーションの強化
車輪型ヒューマノイドの豊富なデータを活用し、エンドエフェクタ軌道を形態非依存のインターフェースとして二足歩行ヒューマノイドのVLAを効率的に学習させるフレームワークを提案。
原題: TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning / Jiacheng Liu, Pengxiang Ding, Qihang Zhou 他
日本語で読む → - 論文VLA画像認識
AsyMoE: モーダル非対称性を活用した大規模視覚言語モデルにおける専門家の特化
視覚と言語の処理の非対称性に着目し、モダリティ特化・双曲線的クロスモーダル・証拠優先の3種の専門家群で構成される新しいMoEアーキテクチャを提案し、精度向上とパラメータ削減を実現した。
原題: AsyMoE: Leveraging Modal Asymmetry for Enhanced Expert Specialization in Large Vision-Language Models / Heng Zhang, Haichuan Hu, Yaomin Shen 他
日本語で読む → - 論文VLAロボティクス
Omni-LIVO: 測光マイグレーションとESIKF融合による堅牢なRGBカラー多カメラ視覚慣性LiDARオドメトリ
多カメラの視覚・慣性・LiDARを密結合し、非重複視野間の測光一貫性を保つ直接位置合わせとESIKFの多視点更新により、広範囲で高精度な自己位置推定と色付き地図生成を実現した研究。
原題: Omni-LIVO: Robust RGB-Colored Multi-Camera Visual-Inertial-LiDAR Odometry via Photometric Migration and ESIKF Fusion / Yinong Cao, Chenyang Zhang, Xin He 他
日本語で読む → - 論文VLAロボティクス
自律走行のための離散拡散による反射型視覚言語行動モデル
離散拡散と言語モデルを活用し、安全な軌道生成のための反射機構を備えた自律走行向けVLAフレームワークを提案。
原題: Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving / Pengxiang Li, Yinan Zheng, Yue Wang 他
日本語で読む → - 論文VLAロボティクス
見るために動き、動くために見る:拡散駆動の知覚-行動相互作用による適応的方策
拡散方策のノイズ予測勾配を行動誘導SDEに組み込み、知覚と行動を循環的に学習させるDP-AGを提案。シミュレーションと実機UR5で既存手法を上回った。
原題: Act to See, See to Act: Diffusion-Driven Perception-Action Interplay for Adaptive Policies / Jing Wang, Weiting Peng, Jing Tang 他
日本語で読む → - 論文VLAAI
ANNIE: ロボットの安全性に注意せよ
視覚言語行動モデルを搭載した身体性AIロボットへの敵対的攻撃の安全性リスクを初めて体系的に研究し、ISO規格に基づく違反分類、評価ベンチマークANNIEBench、攻撃フレームワークANNIE-Attackを提案した。
原題: ANNIE: Be Careful of Your Robots / Yiyang Huang, Zixuan Wang, Zishen Wan 他
日本語で読む → - 論文VLAAI
VehicleWorld: 車載エージェントのための統合マルチデバイス環境
車載システム向けに30モジュール・250 APIを備えた実行可能な環境を構築し、状態を明示的に扱うState-based Function Callを提案して従来手法より高精度・低遅延を実現した。
原題: VehicleWorld: A Highly Integrated Multi-Device Environment for Intelligent Vehicle Interaction / Jie Yang, Jiajun Chen, Zhangyue Yin 他
日本語で読む → - 論文VLAロボティクス
LAD-VF: LLM自動微分による形式手法フィードバックを用いたファインチューニング不要のロボットプランニング
形式検証のフィードバックをプロンプト改善に活用し、モデルの再学習なしでLLMのロボット計画の安全性・仕様遵守を高めるフレームワークを提案。
原題: LAD-VF: LLM-Automatic Differentiation Enables Fine-Tuning-Free Robot Planning from Formal Methods Feedback / Yunhao Yang, Junyuan Hong, Gabriel Jacob Perin 他
日本語で読む →