Nan Xue
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 具身知能のためのMixture-of-Expertsビデオ事前学習のスケーリングVLA2026/7/8
ロボット制御に特化したビデオ生成モデルLingBot-Videoを提案。MoEアーキテクチャとロボット向けデータ、物理合理性を評価する報酬系で、デジタル生成と物理動作の橋渡しを目指す。
- 高密度空間知覚のための視覚事前学習視覚事前学習2026/7/6
境界線と形状の不連続性に着目した自己教師あり学習「マスク境界モデリング」を提案し、深度推定などの空間知覚タスクで性能を向上させる視覚基盤モデルLingBot-Visionを開発した。
- 基盤から応用へ:実践におけるVLAモデルの改善VLA/ロボット基盤モデル2026/7/1
VLA基盤モデルの実用化ギャップを埋めるため、データパイプライン刷新、行動空間拡張、予測ダイナミクスモデリングの3点を改良したLingBot-VLA 2.0を提案し、ベンチマークで効果を実証した。
- 汎用ロボット制御のためのネイティブなビデオ・アクション事前学習VLA2026/7/1
ロボット制御に特化したビデオ・アクション基盤モデルLingBot-VA 2.0を提案。意味的視覚・行動トークナイザ、因果事前学習、スパースMoE、非同期推論により、複雑な操作タスクでの数ショット汎化を実現した。
- AetheRock: 力誘導型視覚触覚学習のための腕装着型ロボット教示システム触覚/ロボット学習2026/6/1
腕に装着する触覚・力覚センサ付きデバイスと、力と視覚で触覚学習を誘導するフレームワークを提案し、接触を伴う操作タスクのデータ収集と学習効率を向上させた。
- FlowSSC:単眼セマンティックシーン補完のためのワンステップ潜在拡散による汎用生成フレームワーク3Dシーン生成2026/1/1
単眼RGB画像からのセマンティックシーン補完を条件付き生成問題として扱い、トリプレーン潜在空間でのショートカットフローマッチングにより1ステップで高品質な3Dシーン生成を実現した。
- ロボット制御のための因果的世界モデリング世界モデル2026/1/1
行動と視覚変化の因果関係を学習する自己回帰拡散フレームワークLingBot-VAを提案し、長期マニピュレーションや実環境での汎化性能を実証した。
- マスク深度モデリングによる空間知覚深度補完2026/1/1
深度センサの不正確さを「マスクされた信号」と捉え、視覚的文脈を活用して深度マップを補完するLingBot-Depthを提案。RGB-Dカメラを上回る精度と画素被覆を実現し、大規模データセットも公開。