:
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- StrucPhysVideo: 構造化キャプションとロボット行動から物理ダイナミクスを学習する動画世界モデル動画世界モデル2026/9/16
物体の動きや相互作用を記述した構造化キャプションとロボットの行動を条件として、物理的に妥当な動画を生成・予測する動画世界モデルを提案し、Physics-IQで最高性能を達成した。
- 一つのポリシー、多様な身体:異種具現化操作のためのカメラ中心の統一アクション幾何学事前学習VLA2026/8/26
異なるロボット形態やカメラ設定をまたいで操作データを統一するため、カメラで観測可能なアンカー動作を共通のアクション表現として用いる新しいフレームワークUCAG-Pを提案。単一のVLAポリシーで複数のベンチマークを高精度に達成した。
- HiFi-UMI: 高忠実度UMIデータのみから展開可能な操作ポリシーを学習する操作学習2026/7/1
ロボットフリーのUMIデータ収集システムの忠実度を高めることで、実ロボットデータを使わずに直接展開可能な操作ポリシーを学習できることを示した論文。
- RhinoVLA技術報告:エッジSoC向け展開最適化VLAモデルVLA/エッジ展開2026/6/1
エッジSoC上でのリアルタイム展開を目指し、トークン効率的なVLAモデルと専用SoCを共同設計し、10Hzの実時間制御を達成した。
- NVIDIA OmniDreams: 閉ループ自動運転シミュレーションのためのリアルタイム生成ワールドモデル自動運転シミュレーション2026/6/1
自動運転の閉ループシミュレーション向けに、拡散モデルを基盤としたリアルタイム生成ワールドモデルOmniDreamsを提案し、運転行動に応じたセンサ映像を自己回帰的に生成することで、従来の再構成ベースのシミュレータでは困難な長尾シナリオを合成可能にした。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- HY-Embodied-0.5: 実世界エージェントのための具現化基盤モデルVLA2026/4/8
実世界の具現化エージェント向けに設計された基盤モデル群を提案し、空間・時間的視覚知覚と推論能力を強化した。
- Open-H-Embodiment:医療ロボティクスにおける基盤モデルを可能にする大規模データセット医療ロボティクス/データセット/基盤モデル2026/4/1
医療ロボットの自律化を妨げるデータ不足を解決するため、複数のロボットプラットフォームにわたる大規模な医療ロボットビデオと運動学データセットを公開し、基盤モデルの開発を実証した。
- Habilis-β: 高速動作と長時間稼働を実現するオンデバイス視覚言語行動モデルVLA2026/2/1
実環境での連続稼働を想定し、大規模プレイデータでの事前学習と整流フロー蒸留を組み合わせることで、エッジデバイス上で高速かつ長時間安定して動作するVLAモデルを実現した。
- Fauna Sprout:軽量で親しみやすく開発者向けのヒューマノイドロボットヒューマノイド2026/1/1
安全で表現力豊かな人間環境での長期運用を目指し、軽量・柔軟制御・VRテレオペを統合した開発者向けヒューマノイドプラットフォームSproutを提案。
- Isaac Lab:マルチモーダルロボット学習のためのGPU加速シミュレーションフレームワークsim2real2025/11/1
GPU並列物理演算とフォトリアル描画を統合し、強化学習・模倣学習を大規模に実行できるロボット学習用シミュレーションプラットフォームを提案。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。
- Alpamayo-R1: 長尾シナリオにおける汎化可能な自動運転のための推論と行動予測の橋渡し自動運転/VLA2025/11/1
視覚言語行動モデルに因果連鎖推論を組み込み、拡散ベースの軌道デコーダと強化学習を組み合わせることで、長尾の安全臨界シナリオでの自動運転計画精度と推論品質を向上させた研究。
- GR00T N1: 汎用人型ロボットのためのオープン基盤モデルVLA2025/3/1
視覚言語モジュールと拡散トランスフォーマを組み合わせた二重システム構成のVLA基盤モデルを提案し、実機・人間動画・合成データで学習して人型ロボットの両手マニピュレーションを実現した。
- Cosmos-Transfer1:適応的マルチモーダル制御による条件付きワールド生成sim2real2025/3/1
セグメンテーション・深度・エッジなど複数モダリティの空間制御入力を場所ごとに重み付けして世界シミュレーションを生成するモデルを提案し、ロボティクスのSim2Realや自動運転データ拡張への応用とリアルタイム推論を実証した。
- Cosmos-Reason1:物理的常識から身体性推論へVLA2025/3/1
物理世界を理解し、長い思考連鎖を通じて自然言語で身体的行動決定を生成するマルチモーダル大規模言語モデルCosmos-Reason1を提案し、物理的常識と身体性推論のベンチマークで評価した。
- 物理AIのためのCosmos世界基盤モデルプラットフォーム世界モデル2025/1/1
物理AI開発者向けに、カスタマイズ可能な世界モデルを構築するための基盤モデル・動画キュレーション・トークナイザを提供するオープンソースプラットフォーム。
- Design, Manufacturing, and Controls of a Prismatic Quadruped Robot: PRISMA2021/12/1