論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
LIEREx: ロボット探索のための言語-画像埋め込み
CLIPなどの視覚言語基盤モデルと3Dセマンティックシーングラフを統合し、未知環境で目標指向の探索を自律エージェントが行えるようにした研究。
原題: LIEREx: Language-Image Embeddings for Robotic Exploration / Felix Igelbrink, Lennart Niecksch, Marian Renz 他
日本語で読む → - 論文VLAロボティクス
MobileManiBench:モバイルマニピュレーションのためのモデル検証を簡素化するベンチマーク
NVIDIA Isaac Simと強化学習を用いて、多様なモバイルマニピュレーション軌道を自動生成する大規模ベンチマークを構築し、代表的なVLAモデルの性能を評価した。
原題: MobileManiBench: Simplifying Model Verification for Mobile Manipulation / Wenbo Wang, Fangyun Wei, QiXiu Li 他
日本語で読む → - 論文VLAロボティクス
VLAは限界を知っている:ロボットポリシーのための適応的実行ホライズン
フローベースVLAモデルの実行ホライズンを自己注意重みから動的に推定するAutoHorizonを提案し、シミュレーションと実機で性能向上を実証した。
原題: VLA Knows Its Limits: Adaptive Execution Horizons for Robot Policies / Haoxuan Wang, Gengyu Zhang, Yan Yan 他
日本語で読む → - 論文VLAロボティクス
HIMM: 身体性探索と質問応答のための人間に着想を得た長期記憶モデリング
エピソード記憶と意味記憶を分離した非パラメトリック記憶フレームワークを提案し、身体性エージェントの長期観測下での探索と質問応答を改善した。
原題: HIMM: Human-Inspired Long-Term Memory Modeling for Embodied Exploration and Question Answering / Ji Li, Bo Wang, Jing Xia 他
日本語で読む → - 論文VLA画像認識
VLANeXt:強いVLAモデルを構築するためのレシピ
VLA設計空間を統一フレームワークで再検討し、12の知見をまとめた実践的レシピと、LIBEROなどでSOTAを上回るモデルVLANeXtを提案した論文。
原題: VLANeXt: Recipes for Building Strong VLA Models / Xiao-Ming Wu, Bin Fan, Kang Liao 他
日本語で読む → - 論文VLAロボティクス
見て、感じて、動く:大規模一人称視点人間データから能動的知覚を学ぶ
大規模な一人称視点の人間データを活用し、情報を能動的に集めながら操作するVLAフレームワークCoMe-VLAを提案。記憶機構と認知補助により多様な長期タスクで高い適応性を示した。
原題: Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data / Jialiang Li, Yi Qiao, Yunhan Guo 他
日本語で読む → - 論文VLAロボティクス
FAVLA:接触の多いロボットマニピュレーションのための力適応型高速・低速VLAモデル
低速なVLMによる計画と高速なアクションエキスパートを分離し、力覚フィードバックを適応的に活用することで、接触の多いマニピュレーションの反応性と成功率を向上させるVLAモデルを提案。
原題: FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation / Yao Li, Peiyuan Tang, Wuyang Zhang 他
日本語で読む → - 論文VLAロボティクス
より遠く、より賢く見る:VLM政策最適化のための価値誘導マルチパス反射
VLMを用いたロボット操作において、状態評価と行動生成を分離し、ビーム探索で複数の将来経路を探索するテスト時計算フレームワークを提案。信頼度に基づく早期終了で推論遅延を削減し、多段階操作タスクでの性能を向上させた。
原題: Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization / Yanting Yang, Shenyuan Gao, Qingwen Bu 他
日本語で読む → - 論文VLAロボティクス
IG-RFT:長期的ロボット操作におけるVLAモデルのための対話誘導強化学習フレームワーク
流れベースのVLAモデルを対象に、対話状態に応じて探索を調整する強化学習とハイブリッド報酬を組み合わせ、長期タスクでの成功率を大幅に向上させた。
原題: IG-RFT: An Interaction-Guided RL Framework for VLA Models in Long-Horizon Robotic Manipulation / Zhian Su, Weijie Kong, Haonan Dong 他
日本語で読む → - 論文VLAロボティクス
言語運動プリミティブ:ロボット動作における言語モデルの接地
VLMの推論を動的運動プリミティブ(DMP)のパラメータに接地させることで、自然言語指示からゼロショットでロボット操作を実現するフレームワークを提案。
原題: Language Movement Primitives: Grounding Language Models in Robot Motion / Yinlong Dai, Benjamin A. Christie, Daniel J. Evans 他
日本語で読む → - 論文VLAロボティクス
VLAW:視覚-言語-行動ポリシーと世界モデルの反復的相互改善
実ロボットのロールアウトデータで世界モデルの精度を高め、その世界モデルが生成する合成データでVLAモデルを改善する反復手法を提案し、実タスクで成功率を39.2%向上させた。
原題: VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model / Yanjiang Guo, Tony Lee, Lucy Xiaoyang Shi 他
日本語で読む → - 論文VLAロボティクス
不確実性を考慮したポリシーステアリング:行動・質問・学習の判断
VLM検証器の不確実性を較正し、高信頼行動の実行・自然言語での曖昧性解消・介入要求を選択する枠組みを提案。
原題: When to Act, Ask, or Learn: Uncertainty-Aware Policy Steering / Jessie Yuan, Yilin Wu, Andrea Bajcsy
日本語で読む → - 論文VLAロボティクス
曖昧な指示に対するアフォーダンス認識型インタラクティブ意思決定と実行
曖昧な人間の指示に対し、対話的な探索と視覚言語推論を統合した二重ストリーム枠組みAIDEを提案し、ゼロショットでアフォーダンス解析と指示解釈を実現した。
原題: Affordance-Aware Interactive Decision-Making and Execution for Ambiguous Instructions / Hengxuan Xu, Fengbo Lan, Zhixin Zhao 他
日本語で読む → - 論文VLAロボティクス
実時間マルチモーダルLLMとツール呼び出しによる状況依存的具現化対話のための現代システムレシピ
実時間マルチモーダルLLMと注意・能動知覚のためのツール群を組み合わせ、家庭的な6シナリオで対話品質とツール判断精度を評価した。
原題: A Modern System Recipe for Situated Embodied Human-Robot Conversation with Real-Time Multimodal LLMs and Tool-Calling / Dong Won Lee, Sarah Gillet, Louis-Philippe Morency 他
日本語で読む → - 論文VLAロボティクス
長寿命ロボットに向けて:強化学習ファインチューニングによるVLAモデルの継続学習
VLAモデルの下流タスク適応における破滅的忘却とデータ依存を解決するため、オンライン環境フィードバック不要の強化学習ファインチューニング手法LifeLong-RFTを提案し、継続学習でSFT比22%の成功率向上を達成した。
原題: Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning / Yuan Liu, Haoran Li, Shuai Tian 他
日本語で読む → - 論文VLAロボティクス
信頼できる視覚-言語-行動モデルのための行動誤差分布の再形成
連続行動VLAモデルの学習に最小誤差エントロピー(MEE)目的関数を導入し、MSEと組み合わせることで成功率とロバスト性を向上させた研究。
原題: Reshaping Action Error Distributions for Reliable Vision-Language-Action Models / Shuanghao Bai, Dakai Wang, Cheng Chi 他
日本語で読む → - 論文VLAロボティクス
自然言語コマンドの物体グラウンディングのための関係シーングラフ
3Dシーングラフに空間関係を追加することで、LLMが自然言語コマンドから対象物体を正しく特定できるかを検証した研究。
原題: Relational Scene Graphs for Object Grounding of Natural Language Commands / Julia Kuhn, Francesco Verdoja, Tsvetomila Mihaylova 他
日本語で読む → - 論文VLAロボティクス
RoboPaint: 人間の実演から任意のロボット・任意の視点へ
人間の多感覚デモを触覚対応リターゲティングとIsaac Simレンダリングでロボット訓練データに変換するReal-Sim-Realパイプラインを提案し、VLAモデルが80%の成功率を達成した。
原題: RoboPaint: From Human Demonstration to Any Robot and Any View / Jiacheng Fan, Zhiyue Zhao, Yiqian Zhang 他
日本語で読む → - 論文VLAロボティクス
注意が裏切るとき:視覚トークン再構成によるロボットポリシーのバックドア攻撃消去
VLAモデルのバックドアが深層注意を乗っ取る仕組みを解明し、テスト時に異常トークンを検出・マスクしてトリガー除去画像を再構成することで、再学習なしに攻撃を無効化する防御手法Beraを提案した。
原題: When Attention Betrays: Erasing Backdoor Attacks in Robotic Policies by Reconstructing Visual Tokens / Xuetao Li, Pinhan Fu, Wenke Huang 他
日本語で読む → - 論文VLAロボティクス
TOPReward: トークン確率を隠れたゼロショット報酬として用いるロボティクス
事前学習済み動画言語モデルのトークン確率を利用し、タスク指示に対する進捗を密な報酬として推定する訓練不要の手法を提案。実世界の操作ベンチマークで従来の訓練不要手法を上回る性能を示した。
原題: TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics / Shirui Chen, Cole Harrison, Ying-Chun Lee 他
日本語で読む → - 論文VLAナビゲーションロボティクス
LongNav-R1: 長期的VLAナビゲーションのための適応的マルチターン強化学習
VLAモデルによる長期的ナビゲーションを、環境とのマルチターン対話として強化学習する枠組みを提案し、Horizon-Adaptive Policy Optimizationで時間的信用割当を改善、成功率を64.3%から73.0%に向上させた。
原題: LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation / Yue Hu, Avery Xi, Qixin Xiao 他
日本語で読む → - 論文VLAロボティクス
HMVLA: 双曲空間マルチモーダル融合による視覚-言語-行動モデル
視覚・言語・行動モデルにおいて、画像と言語の階層構造を双曲空間に埋め込んで意味的整合を図り、MoE機構で効率化するフレームワークを提案した。
原題: HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models / Kun Wang, Xiao Feng, Mingcheng Qu 他
日本語で読む → - 論文VLAロボティクス
SCALE: 視覚言語行動モデルのための自己不確実性に基づく適応的知覚と行動
VLAモデルの推論時に自己不確実性を利用し、追加学習や検証器なしで視覚知覚と行動を同時に調整する単一パスの手法を提案。
原題: SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models / Hyeonbeom Choi, Daechul Ahn, Youhan Lee 他
日本語で読む → - 論文VLAロボティクス
視覚言語モデルによる意味・物理の二重補正を用いた人間-ロボット協調タスクの再計画
VLMの推論に事前の論理検証と事後の視覚検証を組み合わせ、人間の指示に基づく把持姿勢や道具選択を再計画する枠組みを提案し、ヒューマノイドでの実機実験で有効性を検証した。
原題: Replanning Human-Robot Collaborative Tasks with Vision-Language Models via Semantic and Physical Dual-Correction / Taichi Kato, Takuya Kiyokawa, Namiko Saito 他
日本語で読む → - 論文VLAロボティクス
KEEP: 具現化プランニングのためのKVキャッシュ中心メモリ管理システム
LLMによる長期的な具現化プランニングで、メモリをKVキャッシュとして効率的に管理し、再計算を抑えつつ高速化と精度維持を両立するシステムKEEPを提案。
原題: KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning / Zebin Yang, Tong Xie, Baotong Lu 他
日本語で読む → - 論文自動運転VLA画像認識
SToRM: マルチモーダルLLMのための教師ありトークン削減による効率的なエンドツーエンド自動運転
自動運転向けマルチモーダルLLMの視覚トークンを教師あり学習で削減し、全トークン使用時と同等の性能を保ちつつ計算効率を高めるフレームワークを提案。
原題: SToRM: Supervised Token Reduction for Multi-modal LLMs toward efficient end-to-end autonomous driving / Seo Hyun Kim, Jin Bok Park, Do Yeon Koo 他
日本語で読む → - 論文VLAロボティクス
AgentRob:仮想フォーラムエージェントから物理ロボットのハイジャックまで
オンラインフォーラムとLLMエージェント、物理ロボットをMCPで繋ぎ、フォーラム上の指示でロボットを操作・結果報告する枠組みを提案。
原題: AgentRob: From Virtual Forum Agents to Hijacked Physical Robots / Wenrui Liu, Yaxuan Wang, Xun Zhang 他
日本語で読む → - 論文VLA画像認識
不確実性を考慮した観測再注入による視覚-言語-行動モデルの強化
VLAモデルの言語層の不確実性が高いときに、観測情報を次層のFFNに再注入する訓練不要のプラグインモジュールを提案し、追加データやモジュールなしで行動生成の精度と信頼性を向上させた。
原題: UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models / Jiabing Yang, Yixiang Chen, Yuan Xu 他
日本語で読む → - 論文VLAロボティクス
静的・動的分離による効率的な長期間視覚言語行動モデル
視覚入力を静的・動的トークンに分離し、静的トークンの共有とKVキャッシュ再利用で、長期間のマルチフレーム統合と推論を効率化するVLAフレームワークDyStaを提案。
原題: Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement / Weikang Qiu, Huashuo Lei, Tinglin Huang 他
日本語で読む → - 論文VLAロボティクス
ConLA: 人間動画からの対照的潜在行動学習によるロボットマニピュレーション
人間の動画からロボットの行動を教師なしで学習する際、対照学習で動きと見た目を分離し、実ロボット軌道での事前学習を上回る性能を実現した。
原題: ConLA: Contrastive Latent Action Learning from Human Videos for Robotic Manipulation / Weisheng Dai, Kai Lan, Jianyi Zhou 他
日本語で読む →