Yunhao Ge
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboTTT: ロボットポリシーのためのコンテキストスケーリングVLA2026/7/1
ロボットポリシーの視覚運動コンテキストを8Kタイムステップまで拡張し、推論遅延を増やさずに、人間のビデオからのワンショット模倣や長期的タスクの性能向上を実現する手法を提案。
- 空間プロンプトを用いたエゴセントリック操作の視覚軌道予測操作/軌道予測2026/5/19
ロボット操作のタスク指示を空間的なプロンプト(バウンディングボックスや点)で行う新しい設定を提案し、エゴセントリック映像から将来のエンドエフェクタ軌道を予測する手法を開発した。
- スリーステップナビ:ゼロショット視覚言語ナビゲーションのための階層的グローバル・ローカルプランナーナビゲーション2026/4/1
マルチモーダル大規模言語モデルを用いたゼロショット視覚言語ナビゲーションの成功率を向上させるため、前方・現在・後方の3視点で計画する手法を提案した。
- VLA-Thinker: 画像思考による視覚言語行動モデルの性能向上VLA2026/3/1
視覚入力を動的に再参照できる思考フレームワークを導入し、2段階学習でロボット操作性能を大幅に向上させた。
- 世界行動モデルはゼロショット方策であるVLA2026/2/1
動画拡散モデルを基盤に未来の世界状態と行動を予測するWorld Action Model「DreamZero」を提案し、実機でVLAを上回る汎化性能と7Hzのリアルタイム閉ループ制御を実現した。
- Cosmos Policy: 視覚運動制御と計画のための動画モデル微調整VLA2026/1/1
大規模事前学習済み動画モデルを、アーキテクチャ変更なしの一段階の追加学習だけでロボット方策に変換し、行動・将来画像・価値を潜在フレームとして生成して計画も可能にした手法。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。
- Cosmos-Transfer1:適応的マルチモーダル制御による条件付きワールド生成sim2real2025/3/1
セグメンテーション・深度・エッジなど複数モダリティの空間制御入力を場所ごとに重み付けして世界シミュレーションを生成するモデルを提案し、ロボティクスのSim2Realや自動運転データ拡張への応用とリアルタイム推論を実証した。
- 物理AIのためのCosmos世界基盤モデルプラットフォーム世界モデル2025/1/1
物理AI開発者向けに、カスタマイズ可能な世界モデルを構築するための基盤モデル・動画キュレーション・トークナイザを提供するオープンソースプラットフォーム。