Pengfei Zhou
Infrec
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- OPIS: ビデオ世界モデルにおけるマルチオブジェクト記憶のための入力接地ベンチマークビデオ世界モデル2026/9/28
ビデオ世界モデルが初期観測の物体をどれだけ記憶できるかを評価するベンチマークOPISを提案し、8モデルで物体の存在・同一性・構造を測定した。
- EgoTSR++: 一人称視点の時空間推論によるタスク進捗理解VLA2026/9/23
一人称視点の2つの観測からタスクの進捗を順序に依存せず判断するフレームワークEgoTSRを提案し、順序バイアスを診断するベンチマークと双方向監督データ、段階的CoTカリキュラムを導入した。
- GE-Act 2.0: ロボット操作のためのワールドアクションモデルの事前学習とスケーリングVLA2026/9/4
操作データのみで生成・行動コンポーネントをゼロから学習するワールドアクションモデルを提案し、大規模データでの事前学習とスケーリングの効果を検証した。
- τ0-VLA: 世界モデル誘導のテスト時計算を備えた階層型ロボット基盤モデルVLA2026/8/17
長期的なロボット操作タスクを、高レベル方策がサブタスク生成時にテスト時計算を追加で行える階層型VLAモデルを提案し、実データで性能向上を実証した。
- τ0-WM: ロボット操作のための統合ビデオ・アクション世界モデルVLA/世界モデル2026/6/1
ロボット操作のための、ポリシー学習・ビデオ予測・行動評価を単一の未来予測フレームワークに統合した世界モデルを提案。実ロボットデータ約27,300時間で訓練し、推論時に候補行動のサンプリングと評価・修正を行うことで、長期的で細かい操作タスクで高い性能を示した。
- Act2Goal: ワールドモデルから汎用ゴール条件付き政策へマニピュレーション2025/12/1
視覚的ゴールと現在の観測から、目標条件付きワールドモデルで中間視覚状態を生成し、マルチスケール時間制御で長期的なマニピュレーションを実現する汎用政策を提案。
- Genie Envisioner:ロボット操作のための統合ワールド基盤プラットフォームVLA2025/8/1
指示条件付き動画拡散モデルを核に、方策学習・評価・シミュレーションを一つの動画生成フレームワークへ統合した基盤を提案し、軽量デコーダで行動軌跡を生成、専用ベンチマークも整備した。
- EWMBench:身体性世界モデルのシーン・動作・意味品質を評価するベンチマーク身体性世界モデル評価2025/5/1
言語指示から物理的に妥当なシーンを生成する身体性世界モデル(EWM)を、視覚的一貫性・動作正確性・意味整合性の3軸で評価するベンチマークを提案した論文。
- EnerVerse-AC: 行動条件付きで身体性環境を想像する世界モデル世界モデル2025/5/1
エージェントの予測行動から将来の視覚観測を生成する行動条件付き世界モデルを提案し、実機や複雑なシミュレーションなしでロボット模倣学習のデータ拡張と評価を可能にした。
- EnerVerse: ロボットマニピュレーションのための身体化未来空間の想像VLA2025/1/1
指示から未来の身体化空間を予測する生成ロボティクス基盤モデルを提案し、4Dガウススプラッティングと組み合わせてシミュレーションと実世界のギャップを縮め、高性能な操作を実現した。