Xiaodong Yang
収録論文 11本 ・ フィジカルAI/ロボット学習
VLA自動運転/VLA世界モデル意図予測sim2real
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- Alpamayo-R1: 長尾シナリオにおける汎化可能な自動運転のための推論と行動予測の橋渡し自動運転/VLA2025/11/1
視覚言語行動モデルに因果連鎖推論を組み込み、拡散ベースの軌道デコーダと強化学習を組み合わせることで、長尾の安全臨界シナリオでの自動運転計画精度と推論品質を向上させた研究。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。
- 人間の日常行動における長期的・短期的意図の学習意図予測2025/4/1
家庭用ロボットが人間の長期的意図と短期的意図を予測し、両者の不一致を検出して警告・提案を行うための意図モデルと二段階手法を提案した。
- Cosmos-Transfer1:適応的マルチモーダル制御による条件付きワールド生成sim2real2025/3/1
セグメンテーション・深度・エッジなど複数モダリティの空間制御入力を場所ごとに重み付けして世界シミュレーションを生成するモデルを提案し、ロボティクスのSim2Realや自動運転データ拡張への応用とリアルタイム推論を実証した。
- Cosmos-Reason1:物理的常識から身体性推論へVLA2025/3/1
物理世界を理解し、長い思考連鎖を通じて自然言語で身体的行動決定を生成するマルチモーダル大規模言語モデルCosmos-Reason1を提案し、物理的常識と身体性推論のベンチマークで評価した。
- GEDepth: Ground Embedding for Monocular Depth Estimation2023/9/1
- DistillBEV: Boosting Multi-Camera 3D Object Detection with Cross-Modal Knowledge Distillation2023/9/1
- Transcendental Idealism of Planner: Evaluating Perception from Planning Perspective for Autonomous Driving2023/6/1
- ProphNet: Efficient Agent-Centric Motion Forecasting with Anchor-Informed Proposals2023/3/1
- QML for Argoverse 2 Motion Forecasting Challenge2022/7/1