Fengyuan Hu
収録論文 7本 ・ フィジカルAI/ロボット学習
VLAマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboTTT: ロボットポリシーのためのコンテキストスケーリングVLA2026/7/1
ロボットポリシーの視覚運動コンテキストを8Kタイムステップまで拡張し、推論遅延を増やさずに、人間のビデオからのワンショット模倣や長期的タスクの性能向上を実現する手法を提案。
- 世界行動モデルはゼロショット方策であるVLA2026/2/1
動画拡散モデルを基盤に未来の世界状態と行動を予測するWorld Action Model「DreamZero」を提案し、実機でVLAを上回る汎化性能と7Hzのリアルタイム閉ループ制御を実現した。
- EgoScale:多様な一人称視点ヒューマンデータによる器用なマニピュレーションのスケーリングマニピュレーション2026/2/1
2万時間超の一人称視点ヒューマン動画でVLAモデルを事前学習し、人間データ量と検証損失の対数線形則を発見。軽量な人間-ロボット中間学習により、22自由度ハンドの器用な操作成功率を54%向上させた。
- 残差強化学習によるデータ生成で自己改善する視覚言語行動モデルVLA2025/11/1
VLAモデルの失敗領域を残差RLで探索し、展開分布に沿った軌道を収集・蒸留することで、追加の人間デモなしに性能を自己改善させるフレームワークPLDを提案。
- DreamGen:動画世界モデルでロボット学習の汎化を解き放つVLA2025/5/1
画像から動画を生成するモデルでロボットの疑似行動データを作り、1つのテレオペデータから多様な行動・環境への汎化を実現する4段階パイプラインを提案。
- FLARE: 暗黙的世界モデリングによるロボット学習VLA2025/5/1
将来の観測の潜在表現を予測する世界モデリングを拡散トランスフォーマーポリシーに組み込み、模倣学習の性能と汎化を大幅に向上させた手法。
- GR00T N1: 汎用人型ロボットのためのオープン基盤モデルVLA2025/3/1
視覚言語モジュールと拡散トランスフォーマを組み合わせた二重システム構成のVLA基盤モデルを提案し、実機・人間動画・合成データで学習して人型ロボットの両手マニピュレーションを実現した。