論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/2/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
見て、感じて、動く:大規模一人称視点人間データから能動的知覚を学ぶ
大規模な一人称視点の人間データを活用し、情報を能動的に集めながら操作するVLAフレームワークCoMe-VLAを提案。記憶機構と認知補助により多様な長期タスクで高い適応性を示した。
原題: Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data / Jialiang Li, Yi Qiao, Yunhan Guo 他
日本語で読む → - 論文VLAロボティクス
潜在推論VLA:視覚-言語-行動モデルのための潜在思考と予測
Chain-of-Thought推論を連続潜在表現に内部化し、推論時の明示的生成を不要にすることで、最大90%の遅延削減を実現したVLAフレームワーク。
原題: Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models / Shuanghao Bai, Jing Lyu, Wanqi Zhou 他
日本語で読む → - 論文VLAロボティクス
PhysMem: 身体性物理推論のためのテスト時メモリのスケーリング
VLMロボットプランナがテスト時に経験から物理法則を学び、仮説を検証してから適用するメモリフレームワークを提案。実世界の操作タスクで成功率が大幅に向上。
原題: PhysMem: Scaling Test-Time Memory for Embodied Physical Reasoning / Haoyang Li, Yang You, Hao Su 他
日本語で読む → - 論文VLAロボティクス
自然言語コマンドの物体グラウンディングのための関係シーングラフ
3Dシーングラフに空間関係を追加することで、LLMが自然言語コマンドから対象物体を正しく特定できるかを検証した研究。
原題: Relational Scene Graphs for Object Grounding of Natural Language Commands / Julia Kuhn, Francesco Verdoja, Tsvetomila Mihaylova 他
日本語で読む → - 論文VLAロボティクス
VLAW:視覚-言語-行動ポリシーと世界モデルの反復的相互改善
実ロボットのロールアウトデータで世界モデルの精度を高め、その世界モデルが生成する合成データでVLAモデルを改善する反復手法を提案し、実タスクで成功率を39.2%向上させた。
原題: VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model / Yanjiang Guo, Tony Lee, Lucy Xiaoyang Shi 他
日本語で読む → - 論文VLAロボティクス
RADAR: 実世界ダイナミクス・空間物理知能・自律評価による視覚言語行動モデルの汎化ベンチマーク
VLAモデルの実世界汎化を評価するため、物理ダイナミクス・空間推論タスク・3D指標による完全自律評価を統合したベンチマークRADARを提案し、既存モデルを監査した。
原題: RADAR: Benchmarking Vision-Language-Action Generalization via Real-World Dynamics, Spatial-Physical Intelligence, and Autonomous Evaluation / Yuhao Chen, Zhihao Zhan, Xiaoxin Lin 他
日本語で読む → - 論文VLAロボティクス
より遠く、より賢く見る:VLM政策最適化のための価値誘導マルチパス反射
VLMを用いたロボット操作において、状態評価と行動生成を分離し、ビーム探索で複数の将来経路を探索するテスト時計算フレームワークを提案。信頼度に基づく早期終了で推論遅延を削減し、多段階操作タスクでの性能を向上させた。
原題: Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization / Yanting Yang, Shenyuan Gao, Qingwen Bu 他
日本語で読む → - 論文VLAロボティクス
IG-RFT:長期的ロボット操作におけるVLAモデルのための対話誘導強化学習フレームワーク
流れベースのVLAモデルを対象に、対話状態に応じて探索を調整する強化学習とハイブリッド報酬を組み合わせ、長期タスクでの成功率を大幅に向上させた。
原題: IG-RFT: An Interaction-Guided RL Framework for VLA Models in Long-Horizon Robotic Manipulation / Zhian Su, Weijie Kong, Haonan Dong 他
日本語で読む → - 論文VLAロボティクス
実時間マルチモーダルLLMとツール呼び出しによる状況依存的具現化対話のための現代システムレシピ
実時間マルチモーダルLLMと注意・能動知覚のためのツール群を組み合わせ、家庭的な6シナリオで対話品質とツール判断精度を評価した。
原題: A Modern System Recipe for Situated Embodied Human-Robot Conversation with Real-Time Multimodal LLMs and Tool-Calling / Dong Won Lee, Sarah Gillet, Louis-Philippe Morency 他
日本語で読む → - 論文VLAロボティクス
TOPReward: トークン確率を隠れたゼロショット報酬として用いるロボティクス
事前学習済み動画言語モデルのトークン確率を利用し、タスク指示に対する進捗を密な報酬として推定する訓練不要の手法を提案。実世界の操作ベンチマークで従来の訓練不要手法を上回る性能を示した。
原題: TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics / Shirui Chen, Cole Harrison, Ying-Chun Lee 他
日本語で読む → - 論文VLAロボティクス
AgentRob:仮想フォーラムエージェントから物理ロボットのハイジャックまで
オンラインフォーラムとLLMエージェント、物理ロボットをMCPで繋ぎ、フォーラム上の指示でロボットを操作・結果報告する枠組みを提案。
原題: AgentRob: From Virtual Forum Agents to Hijacked Physical Robots / Wenrui Liu, Yaxuan Wang, Xun Zhang 他
日本語で読む → - 論文VLAロボティクス
BusyBox:視覚言語行動モデルのアフォーダンス汎化を評価する物理ベンチマーク
スイッチやスライダーなど6モジュールを交換・回転できる物理ベンチマークBusyBoxを提案し、強いVLAモデルでも見た目が変わるとアフォーダンス汎化が難しいことを実証した。
原題: Benchmarking Affordance Generalization with BusyBox / Dean Fortier, Timothy Adamson, Tess Hellebrekers 他
日本語で読む → - 論文VLAロボティクス
LiLo-VLA: 物体中心ポリシー連携による長期的マニピュレーションの構成
物体中心のVLAポリシーをモジュール化して連結し、未学習の長期的マニピュレーション課題にゼロショットで汎化するフレームワークを提案。
原題: LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies / Yue Yang, Shuo Cheng, Yu Fang 他
日本語で読む → - 論文VLAロボティクス
TIC-VLA:動的環境におけるロボットナビゲーションのための制御内思考型視覚-言語-行動モデル
遅延する意味推論を明示的にモデル化し、非同期推論に適応した視覚-言語-行動モデルを提案。動的環境での言語誘導ナビゲーションをリアルタイム制御で実現する。
原題: TIC-VLA: A Think-in-Control Vision-Language-Action Model for Robot Navigation in Dynamic Environments / Zhiyu Huang, Yun Zhang, Johnson Liu 他
日本語で読む → - 論文VLAロボティクス
ALOE: 視覚言語行動モデルの事後学習のための行動レベルオフポリシー評価
実世界の人間参加型強化学習でVLAモデルを改善するため、現在のポリシーを直接評価するオフポリシー評価フレームワークALOEを提案し、4つの実世界マニピュレーションタスクで検証した。
原題: ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training / Rushuai Yang, Hecheng Wang, Zhichao Wu 他
日本語で読む → - 論文VLAAI
対照的世界モデル:身体エージェントパイプラインにおける行動実行可能性学習
大規模言語モデルを対照学習で微調整し、意味的に似ているが物理的に不可能な行動を識別する行動スコアラーを提案。ScienceWorldベンチマークでSFTより高精度を達成。
原題: CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines / Chayan Banerjee
日本語で読む → - 論文VLAロボティクス
生成型視覚-言語-行動モデルにおける行動ハルシネーション
生成型ロボットポリシーが物理制約に反する行動を生成する「行動ハルシネーション」の構造的原因を分析し、信頼性向上の方向性を示した。
原題: Action Hallucination in Generative Vision-Language-Action Models / Harold Soh, Eugene Lim
日本語で読む → - 論文VLAロボティクス
自動運転における構造化Chain-of-Thoughtの高速化
自動運転のVLAモデル向けに、Chain-of-Thought推論を依存グラフに分解し並列デコードすることで、精度を保ちつつ3〜4倍高速化する手法を提案。
原題: Accelerating Structured Chain-of-Thought in Autonomous Vehicles / Yi Gu, Yan Wang, Yuxiao Chen 他
日本語で読む → - 論文VLAロボティクス
対照的プロンプト統合による適応型クロスエンボディメント視覚運動ポリシーの学習
視覚・時系列行動・テキストの対照学習でプロンプト群を獲得し、観測に応じて動的に統合することで、異なる身体・センサ構成に適応する視覚運動ポリシーを学習する手法CAPOを提案した。
原題: Learning Adaptive Cross-Embodiment Visuomotor Policy with Contrastive Prompt Orchestration / Yuhang Zhang, Chao Yan, Jiaxi Yu 他
日本語で読む → - 論文VLAロボティクス
FAVLA:接触の多いロボットマニピュレーションのための力適応型高速・低速VLAモデル
低速なVLMによる計画と高速なアクションエキスパートを分離し、力覚フィードバックを適応的に活用することで、接触の多いマニピュレーションの反応性と成功率を向上させるVLAモデルを提案。
原題: FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation / Yao Li, Peiyuan Tang, Wuyang Zhang 他
日本語で読む → - 論文VLAロボティクス
STEP: 時空間一貫性予測によるウォームスタート視覚運動ポリシー
拡散ポリシーの推論遅延を、時空間一貫性予測で高品質なウォームスタート行動を生成し、速度対応摂動注入で実行停止を防ぐことで高速化した手法。
原題: STEP: Warm-Started Visuomotor Policies with Spatiotemporal Consistency Prediction / Jinhao Li, Yuxuan Cong, Yingqiao Wang 他
日本語で読む → - 論文VLAロボティクス
潜在的他者視点取得:影響拡張ローカルモデルにおけるシュレーディンガー橋
他者の隠れた心的状態を推論するため、ニューロシンボリックな世界モデルとシュレーディンガー橋による視点変換を組み合わせ、社会的ナビゲーションタスクでモデルベース強化学習を行う手法を提案。
原題: Latent Perspective-Taking via a Schr\"odinger Bridge in Influence-Augmented Local Models / Kevin Alcedo, Pedro U. Lima, Rachid Alami
日本語で読む → - 論文VLAロボティクス
SimVLA:ロボットマニピュレーションのためのシンプルなVLAベースライン
知覚と制御を分離した軽量なVLAモデルを提案し、ロボット事前学習なしで大規模モデルを上回る性能をシミュレーションと実機で示した。
原題: SimVLA: A Simple VLA Baseline for Robotic Manipulation / Yuankai Luo, Woping Chen, Tong Liang 他
日本語で読む → - 論文VLAロボティクス
RDT2:UMIデータのスケーリング限界を探り、ゼロショットのクロスエンボディメント汎化を実現
7BパラメータのVLMを基盤とし、1万時間超のUMIデータと3段階学習で、未知の物体・シーン・指示・ロボット機体にゼロショットで汎化するロボット基盤モデルを構築した。
原題: RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization / Songming Liu, Bangguo Li, Kai Ma 他
日本語で読む → - 論文VLAロボティクス
空中水中ハイブリッド車両のためのクロスドメイン持続モニタリング
空中と水中の両方で活動できるハイブリッド車両に対し、深層強化学習と転移学習を組み合わせ、LiDARとソナー入力を用いた共通ポリシーで持続的モニタリングを実現する手法を提案した。
原題: Cross domain Persistent Monitoring for Hybrid Aerial Underwater Vehicles / Ricardo B. Grando, Victor A. Kich, Alisson H. Kolling 他
日本語で読む → - 論文VLAロボティクス
自己修正VLA:スパースな世界想像によるオンライン行動洗練
VLAモデルに将来予測ヘッドを追加し、予測したスパースな未来状態に基づいて報酬を再形成することで、オンラインで行動を自己修正する手法を提案。シミュレーションと実機で成功率と効率が向上。
原題: Self-Correcting VLA: Online Action Refinement via Sparse World Imagination / Chenyv Liu, Wentao Tan, Lei Zhu 他
日本語で読む → - 論文VLAロボティクス
KEEP: 具現化プランニングのためのKVキャッシュ中心メモリ管理システム
LLMによる長期的な具現化プランニングで、メモリをKVキャッシュとして効率的に管理し、再計算を抑えつつ高速化と精度維持を両立するシステムKEEPを提案。
原題: KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning / Zebin Yang, Tong Xie, Baotong Lu 他
日本語で読む → - 論文VLAロボティクス
検証のスケーリングは視覚-言語-行動の整合性において方策学習のスケーリングより効果的になり得る
視覚-言語-行動モデルの指示と行動のずれを減らすため、テスト時に言い換え指示と行動候補を増やして検証する手法CoVerを提案し、方策事前学習のスケーリングより高い性能を示した。
原題: Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment / Jacky Kwok, Xilun Zhang, Mengdi Xu 他
日本語で読む → - 論文自動運転/VLAロボティクス
SteerVLA:長尾運転シーンで視覚言語行動モデルを操舵する
VLMの常識推論で細かい言語指示を生成し、VLA運転ポリシーを操舵する手法を提案。閉ループベンチマークで長尾シーンの性能を大幅に改善した。
原題: SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios / Tian Gao, Celine Tan, Catherine Glossop 他
日本語で読む → - 論文自動運転VLA画像認識
SToRM: マルチモーダルLLMのための教師ありトークン削減による効率的なエンドツーエンド自動運転
自動運転向けマルチモーダルLLMの視覚トークンを教師あり学習で削減し、全トークン使用時と同等の性能を保ちつつ計算効率を高めるフレームワークを提案。
原題: SToRM: Supervised Token Reduction for Multi-modal LLMs toward efficient end-to-end autonomous driving / Seo Hyun Kim, Jin Bok Park, Do Yeon Koo 他
日本語で読む →