Nan Sun
Tsinghua University
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SplineWAM: Bスプライン表現によるワールドアクションモデルの適応的行動ホライズンVLA2026/9/30
行動軌道を3次Bスプラインで圧縮し、動作の複雑さに応じて行動チャンクの時間解像度と長さを適応的に変えるワールドアクションモデルを提案。推論呼び出しを削減しつつ成功率を向上させた。
- 4D-WAM: 軌跡フィールドによる世界行動モデルへの時空間認識の注入VLA2026/8/1
ロボットの行動生成と動画予測を統合する世界行動モデルに対し、3D軌跡フィールドからの時空間知識を表現整合で注入する訓練戦略を提案し、空間理解と実行精度を向上させた。
- Xiaomi-Robotics-U0: 世界基盤モデルによる統合的身体性合成VLA2026/7/1
ロボットの身体性を考慮した画像・動画生成を統合する380億パラメータのマルチモーダル自己回帰モデルを提案し、マルチビュー一貫性やロボットの身体制約を保ちながら、シーン生成や転移、動画生成を高品質で実現した。
- Xiaomi-Robotics-1: 10万時間以上の実世界軌道データによる視覚言語行動モデルのスケーリングVLA2026/7/1
10万時間以上の実世界の操作軌跡データを用いて、汎用的な視覚言語行動(VLA)モデルを事前学習し、未見環境での指示追従や少量データでの適応を可能にする基盤モデルを構築した。
- 汎用ロボット操作のための身体化チェーン・オブ・ソートの再考VLA2026/6/1
大規模な身体化CoTデータセットを構築し、VLAモデルにおける効果的なCoTの形式と統合方法を検証。推論をテスト時に使わず表現整形の教師信号として用いるERVLAを提案し、高い汎化性能を達成した。
- SpatialVAM: 空間認識型マルチビュービデオ拡散によるデータ効率的なロボットポリシーVLA/操作2026/4/1
3D空間構造と時間変化を同時に捉えるため、空間認識型のマルチビューヒートマップビデオとRGBビデオを生成する初の3Dビデオ行動モデルを提案し、少数のデモで汎用的な操作を実現した。
- 非同期ノイズ除去によるビデオ事前学習を活用した統合4D世界行動モデリングVLA/世界モデル2026/4/1
ロボットのリアルタイム行動実行と高忠実度な4D世界生成(ビデオ+3D再構成)を単一フレームワークで統合するX-WAMを提案し、非同期ノイズサンプリングにより行動効率と生成品質を両立した。
- モノリシック基盤モデルを身体性マルチエージェントアーキテクチャへ変換し人間-ロボット協調を実現マルチエージェント/人間-ロボット協調2025/12/1
単一の基盤モデルを複数の専門エージェントに分解し、知覚・計画・検証・人間への委任を連携させるLLM駆動フレームワークInteractGenを提案。異種ロボットチームでの3ヶ月実証でタスク成功率と協調性の向上を示した。
- CollabVLA: 人間と共に夢を見る自己内省型視覚-言語-行動モデルVLA2025/9/1
VLMによる内省的推論と拡散ベースの行動生成を専門家混合設計で統合し、不確実な状況では人間に助言を求める協調的な視覚-言語-行動エージェントを実現した。
- AssistantX: LLMを活用した人間共存環境における能動的アシスタントVLA2024/9/1
4つのLLMエージェントからなるマルチエージェント構成で、人間がいる実環境で自律的に動作し、指示への反応や状況に応じた戦略調整、人間への能動的な支援要請を行うアシスタントを提案した。