Xing Zhu
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Zero-WAM: 人間のビデオからの文脈内世界行動モデリングによるオープンエンドなタスク汎化VLA2026/8/26
人間のビデオを文脈内の指示として用いることで、訓練時に見たことのない操作タスクをゼロショットで実行できるビデオ行動モデルを提案した。
- 具身知能のためのMixture-of-Expertsビデオ事前学習のスケーリングVLA2026/7/8
ロボット制御に特化したビデオ生成モデルLingBot-Videoを提案。MoEアーキテクチャとロボット向けデータ、物理合理性を評価する報酬系で、デジタル生成と物理動作の橋渡しを目指す。
- 高密度空間知覚のための視覚事前学習視覚事前学習2026/7/6
境界線と形状の不連続性に着目した自己教師あり学習「マスク境界モデリング」を提案し、深度推定などの空間知覚タスクで性能を向上させる視覚基盤モデルLingBot-Visionを開発した。
- 汎用ロボット制御のためのネイティブなビデオ・アクション事前学習VLA2026/7/1
ロボット制御に特化したビデオ・アクション基盤モデルLingBot-VA 2.0を提案。意味的視覚・行動トークナイザ、因果事前学習、スパースMoE、非同期推論により、複雑な操作タスクでの数ショット汎化を実現した。
- 基盤から応用へ:実践におけるVLAモデルの改善VLA/ロボット基盤モデル2026/7/1
VLA基盤モデルの実用化ギャップを埋めるため、データパイプライン刷新、行動空間拡張、予測ダイナミクスモデリングの3点を改良したLingBot-VLA 2.0を提案し、ベンチマークで効果を実証した。
- 実用的なVLA基盤モデルVLA2026/1/1
9種類の双腕ロボットから約2万時間の実世界データを収集し、4つのロボットプラットフォームで評価した汎用性の高いVLA基盤モデルLingBot-VLAを開発した。
- マスク深度モデリングによる空間知覚深度補完2026/1/1
深度センサの不正確さを「マスクされた信号」と捉え、視覚的文脈を活用して深度マップを補完するLingBot-Depthを提案。RGB-Dカメラを上回る精度と画素被覆を実現し、大規模データセットも公開。
- ロボット制御のための因果的世界モデリング世界モデル2026/1/1
行動と視覚変化の因果関係を学習する自己回帰拡散フレームワークLingBot-VAを提案し、長期マニピュレーションや実環境での汎化性能を実証した。
- ZeroDexGrasp: プロンプトベース多段階意味推論によるゼロショットタスク指向巧み把持合成マニピュレーション2025/11/1
マルチモーダル大規模言語モデルと把持リファインメントを組み合わせ、ラベル付きデータなしでタスクと物体の意味から人間らしい巧みな把持姿勢を生成するゼロショット手法を提案。