Diyun Xiang
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Xiaomi-Robotics-1: 10万時間以上の実世界軌道データによる視覚言語行動モデルのスケーリングVLA2026/7/1
10万時間以上の実世界の操作軌跡データを用いて、汎用的な視覚言語行動(VLA)モデルを事前学習し、未見環境での指示追従や少量データでの適応を可能にする基盤モデルを構築した。
- Xiaomi-Robotics-U0: 世界基盤モデルによる統合的身体性合成VLA2026/7/1
ロボットの身体性を考慮した画像・動画生成を統合する380億パラメータのマルチモーダル自己回帰モデルを提案し、マルチビュー一貫性やロボットの身体制約を保ちながら、シーン生成や転移、動画生成を高品質で実現した。
- VAIC: 視覚誘導によるヒューマノイドの俊敏な物体インタラクション制御 - 分離コマンドを用いてヒューマノイド制御2026/6/1
ヒューマノイドロボットが、深度カメラと自己状態のみから、箱運びやスケートボードなどの多様な動的物体操作を単一のポリシーで実行できるようにする、教師-生徒蒸留に基づく制御フレームワークを提案した。
- HAIC: ダイナミクス認識ワールドモデルによるヒューマノイドの俊敏な物体インタラクション制御マニピュレーション2026/2/1
固有受容感覚の履歴のみから物体の速度・加速度を予測し、動的占有マップを構築することで、スケートボードや台車の押し引きなど劣駆動物体との俊敏な全身インタラクションを実現したヒューマノイド制御フレームワーク。
- Xiaomi-Robotics-0:リアルタイム実行可能なオープンソース視覚言語行動モデルVLA2026/2/1
大規模なロボット軌道と視覚言語データで事前学習し、非同期実行のための学習技術と展開時のタイムステップ調整により、民生用GPUで高速かつ滑らかなリアルタイム動作を実現したVLAモデルを提案。
- 何を操作するかを見極める:意味的操作のためのバウンディングボックス誘導方策におけるデータスケーリング則の解明マニピュレーション2026/2/1
バウンディングボックス指示で対象物体を直接指定する拡散方策を提案し、手持ち型セグメンテーションデバイスLabel-UMIで収集した6,400件の実世界デモにより、汎化性能が飽和型のデータスケーリング則に従うことを示した。
- ワンステップ世界モデルによる効率的なマルチモーダルナビゲーションシステムナビゲーション2026/1/1
拡散の多段処理をやめてワンステップ生成と3D U-Netで世界モデルを軽量化し、アンカー初期化の最適化計画と組み合わせてリアルタイムなマルチモーダルゴールナビゲーションを実現した。
- MiMo-Embodied: クロス身体性基盤モデル技術報告VLA2025/11/1
自動運転と身体性AIを統合した初のクロス身体性基盤モデルを開発し、両分野で最先端性能を達成した。
- 検証可能な報酬による実世界ロボット操作のための強化学習型身体性プランニングVLA2025/9/1
VLMに検証可能な報酬で微調整を施し、自然言語指示から長期的操作計画を生成・検証するフレームワークREVERとモデルRoboFarseerを提案した。
- 暗黙的キノダイナミック動作リターゲティングによるスケーラブルな全身動作転移動作リターゲティング2025/9/1
骨格グラフ畳み込みデュアルオートエンコーダと物理情報に基づく洗練により、人間の動作データを高速かつ物理的に実現可能なヒューマノイド動作へ変換する手法を提案した。
- TacRefineNet:エッジが際立つ物体に対する目標条件付き触覚把持微調整触覚2025/9/1
触覚画像のみを用いて、目標の把持姿勢に近づくように手首姿勢を反復修正する方策を学習し、実機の多指ハンドで薄板・円盤・棒の把持を高精度に合わせ込む手法を提案。
- 俊敏な脚式移動のための状態推定トランスフォーマ歩行2024/10/1
四足ロボットの跳躍などの動的動作に向け、過去の状態から高さや速度などの特権状態を予測するTransformerベースの状態推定器SETを提案した。