Daquan Zhou
収録論文 6本 ・ フィジカルAI/ロボット学習
VLA身体化事前学習ビデオ生成/物理シミュレーションデータセット動画生成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- トークンを減らして行動を改善:成功率14%向上・トークン65%削減を実現するGPT-6 AstraロボットエージェントVLA2026/10/1
ロボットプリミティブとVLAポリシーをPythonコードとして組み合わせ、必要な観測だけを要求するフレームワークPyRUA-Leanを提案。同一プランナーで成功率を63.1%から71.7%に向上させつつ、入力トークンを65%削減した。
- HumanScale: 身体中心の人間ビデオは実ロボットデータを凌駕する身体化事前学習の可能性身体化事前学習2026/6/18
身体化基盤モデルの事前学習データとして、遠隔操作の実ロボット軌跡と身体中心の人間ビデオを比較し、適切なフィルタリングとラベリング処理を施した人間ビデオが実ロボットデータよりも優れた性能を示すことを発見した。
- PhysisForcing: ロボット操作のための物理強化ワールドシミュレータビデオ生成/物理シミュレーション2026/6/1
ビデオ生成モデルをロボット操作の世界シミュレータとして使う際に、物理的に不自然な動きが生じる問題を解決するため、物理的に重要な領域に注目した学習フレームワークを提案した。
- HumanNet:100万時間の人間中心ビデオ学習のスケーリングデータセット2026/5/1
人間の身体活動を大規模に捉えた100万時間のビデオコーパスを構築し、データキュレーション手法と視覚言語行動モデルの継続学習による有効性を示した論文。
- StableVLA: 追加データなしで堅牢な視覚言語行動モデルを実現VLA2026/5/1
視覚障害に対するVLAモデルの脆弱性を調査し、情報理論に基づく軽量アダプタ(IB-Adapter)を提案。追加データや拡張なしで平均30%の性能向上を達成し、パラメータ増加は10M未満。
- 身体性世界のための動画生成モデルを再考する動画生成2026/1/1
ロボット動画生成を評価するベンチマークRBenchと、400万クリップの大規模データセットRoVid-Xを提案し、物理的に現実的なロボット行動生成の課題を明らかにした。