Yinghao Xu
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Zero-WAM: 人間のビデオからの文脈内世界行動モデリングによるオープンエンドなタスク汎化VLA2026/8/26
人間のビデオを文脈内の指示として用いることで、訓練時に見たことのない操作タスクをゼロショットで実行できるビデオ行動モデルを提案した。
- 具身知能のためのMixture-of-Expertsビデオ事前学習のスケーリングVLA2026/7/8
ロボット制御に特化したビデオ生成モデルLingBot-Videoを提案。MoEアーキテクチャとロボット向けデータ、物理合理性を評価する報酬系で、デジタル生成と物理動作の橋渡しを目指す。
- 高密度空間知覚のための視覚事前学習視覚事前学習2026/7/6
境界線と形状の不連続性に着目した自己教師あり学習「マスク境界モデリング」を提案し、深度推定などの空間知覚タスクで性能を向上させる視覚基盤モデルLingBot-Visionを開発した。
- 汎用ロボット制御のためのネイティブなビデオ・アクション事前学習VLA2026/7/1
ロボット制御に特化したビデオ・アクション基盤モデルLingBot-VA 2.0を提案。意味的視覚・行動トークナイザ、因果事前学習、スパースMoE、非同期推論により、複雑な操作タスクでの数ショット汎化を実現した。
- Image2Sim: 生成的ニューラルシミュレータによる身体化ナビゲーションのスケーリングナビゲーション2026/7/1
実画像列から高品質なインタラクティブ環境を生成するニューラルシミュレータを提案し、大規模なナビゲーション訓練データを合成して実世界性能を向上させた。
- RepWAM: 表現型ビジュアル・アクショントークナイザによるワールドアクションモデリングVLA2026/6/11
再構成ではなく意味的な視覚・行動の潜在空間を用いたワールドアクションモデルを提案し、実ロボット操作とシミュレーションで有効性を示した。
- JODA: 関節物体のための合成可能な関節ダイナミクスシミュレーション/関節物体2026/5/1
関節物体の動力学を、保存力・乾燥摩擦・減衰の3チャネル場として表現し、視覚と言語から動力学を推定・編集・最適化できるフレームワークを提案した。
- マスク深度モデリングによる空間知覚深度補完2026/1/1
深度センサの不正確さを「マスクされた信号」と捉え、視覚的文脈を活用して深度マップを補完するLingBot-Depthを提案。RGB-Dカメラを上回る精度と画素被覆を実現し、大規模データセットも公開。
- ロボット制御のための因果的世界モデリング世界モデル2026/1/1
行動と視覚変化の因果関係を学習する自己回帰拡散フレームワークLingBot-VAを提案し、長期マニピュレーションや実環境での汎化性能を実証した。
- 操作インターフェースとしてのフロー:Im2Flow2Actsim2real2024/7/1
物体の動き(フロー)を人間とロボットの共通インターフェースとして使い、人間の動画とシミュレーションのロボットデータだけで実世界の多様な操作スキルを獲得する学習フレームワーク。