Yukun Shi
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PhysBrain 1.5:視覚言語モデルから物理基盤モデルへVLA2026/9/14
人間のインタラクション動画から身体動作を学習し、行動生成と未来状態予測を統合した8Bの物理基盤モデルを構築、28の身体理解ベンチマークでオープンソース最高性能を達成した。
- FocusGS: 学習済み3Dガウスアセットの局所修復と決定的編集のための空間デルタ層3DGS/編集2026/7/30
3Dガウススプラッティングで学習済みのアセットに対し、局所的な修復と決定的な編集を「空間デルタ」として統一的に行う手法を提案。修復は追加のみ、編集は消去と挿入の組み合わせで実現し、既存手法より高い精度を達成した。
- 未来のレンダリングは未来の表面に等しくない:観測区間を超えた動的表面再構成のためのベンチマークとデータセット動的シーン再構成2026/7/23
動的シーン再構成の評価は通常観測時間内で行われるが、将来の表面(観測時間外の形状)を評価する標準ベンチマークがなかった。本研究では、将来の表面再構成のための制御された診断ベンチマークとデータセット「FutureSurf」を導入し、既存手法が将来予測で大きなギャップを持つことを示した。
- ヒューマノイドVLAにおけるループの閉鎖:検証可能な移動操作のための持続的3DオブジェクトトークンVLA/ヒューマノイド/操作2026/7/1
RGB-D観測から役割インデックス付きの3Dオブジェクト記録を維持し、それをオブジェクトトークンとして行動生成と幾何学的述語チェックの両方に使用することで、検証可能な閉ループ実行を実現するPOT-VLAを提案。実機でベースラインを大幅に上回る成功率を達成。
- EgoPriMo: 対話型ヒューマノイド制御のための自己中心視点動作生成ヒューマノイド制御2026/6/7
自己中心視点の人間デモから全身動作の事前分布を学習し、テキスト指示に基づいて動作の再構築・生成・予測を行う統一フレームワークを提案した。
- ヒューマン・アズ・ヒューマノイド:人間に合わせた身体を持つエゴ・エクソ人間ビデオからのゼロショット人型ロボット学習模倣学習2026/6/1
人間のデモ動画を高自由度ヒューマノイドのVLA学習に使えるように、身体・センシング・行動ラベルを揃えるフレームワークを提案し、実機で検証した。
- PhysBrain 1.0 技術報告書VLA2026/5/1
大規模な人間の一人称視点ビデオから物理的常識を抽出し、視覚言語行動モデルとロボット制御ポリシーに転移する手法を提案し、複数のベンチマークで最高性能を達成した。
- STARRY: ロボット操作のための時空間アクション中心世界モデルVLA/操作2026/4/1
将来の時空間予測とアクション生成を統一拡散プロセスで統合し、幾何学的注意変調により3次元制御を強化する世界モデル拡張型VLAポリシーを提案。
- PhysBrain:自己中心視点データで視覚言語モデルを身体知能へ橋渡しVLA2025/12/1
人間の自己中心視点動画をスキーマ駆動で身体化監督に変換するパイプラインを提案し、大規模データセットE2E-3Mで訓練した身体化脳PhysBrainがロボット制御のサンプル効率と成功率を向上させることを示した。