Yujun Shen
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Zero-WAM: 人間のビデオからの文脈内世界行動モデリングによるオープンエンドなタスク汎化VLA2026/8/26
人間のビデオを文脈内の指示として用いることで、訓練時に見たことのない操作タスクをゼロショットで実行できるビデオ行動モデルを提案した。
- CameraAnything: 任意のカメラ制御による映像の再撮影映像編集2026/7/27
カメラの内部・外部パラメータを同時に制御できる映像編集の統一フレームワークを提案し、焦点距離や解像度の変更を伴う再撮影を単一の生成プロセスで実現した。
- 具身知能のためのMixture-of-Expertsビデオ事前学習のスケーリングVLA2026/7/8
ロボット制御に特化したビデオ生成モデルLingBot-Videoを提案。MoEアーキテクチャとロボット向けデータ、物理合理性を評価する報酬系で、デジタル生成と物理動作の橋渡しを目指す。
- 高密度空間知覚のための視覚事前学習視覚事前学習2026/7/6
境界線と形状の不連続性に着目した自己教師あり学習「マスク境界モデリング」を提案し、深度推定などの空間知覚タスクで性能を向上させる視覚基盤モデルLingBot-Visionを開発した。
- 基盤から応用へ:実践におけるVLAモデルの改善VLA/ロボット基盤モデル2026/7/1
VLA基盤モデルの実用化ギャップを埋めるため、データパイプライン刷新、行動空間拡張、予測ダイナミクスモデリングの3点を改良したLingBot-VLA 2.0を提案し、ベンチマークで効果を実証した。
- AutoPath: 人間のデモなしで安全なナビゲーションを実現する転移可能な目標条件付き確率的経路事前分布の学習ナビゲーション2026/7/1
ロボットナビゲーションにおいて、障害物を回避する複数の経路をサンプリングできる確率的経路事前分布を学習し、異なるロボットプラットフォーム間で再学習なしに転移可能な安全な経路生成を実現した。
- 汎用ロボット制御のためのネイティブなビデオ・アクション事前学習VLA2026/7/1
ロボット制御に特化したビデオ・アクション基盤モデルLingBot-VA 2.0を提案。意味的視覚・行動トークナイザ、因果事前学習、スパースMoE、非同期推論により、複雑な操作タスクでの数ショット汎化を実現した。
- RepWAM: 表現型ビジュアル・アクショントークナイザによるワールドアクションモデリングVLA2026/6/11
再構成ではなく意味的な視覚・行動の潜在空間を用いたワールドアクションモデルを提案し、実ロボット操作とシミュレーションで有効性を示した。
- AetheRock: 力誘導型視覚触覚学習のための腕装着型ロボット教示システム触覚/ロボット学習2026/6/1
腕に装着する触覚・力覚センサ付きデバイスと、力と視覚で触覚学習を誘導するフレームワークを提案し、接触を伴う操作タスクのデータ収集と学習効率を向上させた。
- 屋内視覚的再位置特定のためのオープンボキャブラリ理解を備えたコンパクトなオブジェクトレベル表現視覚的再位置特定2026/6/1
シーン内のオブジェクト情報を構造化マップに整理し、オブジェクト単位のみでカメラ再位置特定を駆動するシステムOpenReLocを提案。基礎モデルを活用した2D-3Dオブジェクトマッチングと、オブジェクト指向参照フレームによる高精度な位置推定を実現。
- マスク深度モデリングによる空間知覚深度補完2026/1/1
深度センサの不正確さを「マスクされた信号」と捉え、視覚的文脈を活用して深度マップを補完するLingBot-Depthを提案。RGB-Dカメラを上回る精度と画素被覆を実現し、大規模データセットも公開。
- ロボット制御のための因果的世界モデリング世界モデル2026/1/1
行動と視覚変化の因果関係を学習する自己回帰拡散フレームワークLingBot-VAを提案し、長期マニピュレーションや実環境での汎化性能を実証した。
- 実用的なVLA基盤モデルVLA2026/1/1
9種類の双腕ロボットから約2万時間の実世界データを収集し、4つのロボットプラットフォームで評価した汎用性の高いVLA基盤モデルLingBot-VLAを開発した。
- ZeroDexGrasp: プロンプトベース多段階意味推論によるゼロショットタスク指向巧み把持合成マニピュレーション2025/11/1
マルチモーダル大規模言語モデルと把持リファインメントを組み合わせ、ラベル付きデータなしでタスクと物体の意味から人間らしい巧みな把持姿勢を生成するゼロショット手法を提案。
- 予測力注意を伴う適応的視触覚融合による巧みなマニピュレーションマニピュレーション2025/5/1
力誘導注意融合モジュールと自己教師あり未来力予測を導入し、操作段階に応じて視覚と触覚の重みを適応的に調整することで、接触の多い3つの実世界タスクで平均93%の成功率を達成した。