Yu Fang
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GE-Act 2.0: ロボット操作のためのワールドアクションモデルの事前学習とスケーリングVLA2026/9/4
操作データのみで生成・行動コンポーネントをゼロから学習するワールドアクションモデルを提案し、大規模データでの事前学習とスケーリングの効果を検証した。
- DenseReward: 失敗合成によるロボット操作のための高密度報酬学習操作2026/7/1
ロボット操作の強化学習を改善するため、シミュレーションで物理的に現実的な失敗軌道を自動生成し、視覚と言語からフレーム単位の高密度報酬を予測する報酬モデルDenseRewardを提案した。
- SimFoundry: ポリシー学習と評価のためのモジュール式自動シーン生成sim2real2026/6/1
実世界のビデオからシミュレーション用のシーンを自動生成し、多様なバリエーションを作成してロボットポリシーの訓練と評価を行うシステムを提案。シミュレーションでの評価が実世界性能を強く予測し、訓練時のバリエーション追加が成功率を向上させることを示した。
- WatchAct: 行動に基づくロボット操作のベンチマーク操作/ベンチマーク2026/6/1
人間の行動ビデオと言語指示を組み合わせた、ロボット操作のための新しいベンチマークを提案し、シミュレーションと実機で評価した。
- HumanoidMimicGen: 全身計画による移動操作のためのデータ生成データ生成/移動操作2026/5/1
ヒューマノイドの移動と操作を模倣学習で訓練するためのデータを自動生成する手法を提案。少数の実演から全身スキルを適応させ、多様なシーンで安定したデータを生成し、実データのみで訓練した場合より20%性能が向上した。
- 視覚が言語を上書きするとき:VLAにおける反事実的失敗の評価と緩和VLA2026/2/1
VLAモデルが言語指示ではなく視覚的ショートカットに従ってしまう「反事実的失敗」を評価するベンチマークLIBERO-CFを提案し、言語条件付けを正則化する二分岐推論手法CAGで改善する。
- LiLo-VLA: 物体中心ポリシー連携による長期的マニピュレーションの構成VLA2026/2/1
物体中心のVLAポリシーをモジュール化して連結し、未学習の長期的マニピュレーション課題にゼロショットで汎化するフレームワークを提案。
- 動作画像拡散との共同学習によるロボットVLAの性能向上VLA2025/12/1
VLAモデルに将来の動きを予測する動作ヘッドを追加し、動作ヘッドと共同学習することで、推論速度を保ちながら動作推論能力と実環境性能を大幅に向上させた。
- 多段階一貫性統合ショートカットモデルに基づく模倣学習ポリシー模倣学習2025/10/1
フローマッチングの推論速度を改善するため、ショートカットモデルに多段階一貫性損失と適応的勾配配分を導入し、1ステップ推論で高性能を実現した模倣学習手法を提案。
- DreamGen:動画世界モデルでロボット学習の汎化を解き放つVLA2025/5/1
画像から動画を生成するモデルでロボットの疑似行動データを作り、1つのテレオペデータから多様な行動・環境への汎化を実現する4段階パイプラインを提案。
- FLARE: 暗黙的世界モデリングによるロボット学習VLA2025/5/1
将来の観測の潜在表現を予測する世界モデリングを拡散トランスフォーマーポリシーに組み込み、模倣学習の性能と汎化を大幅に向上させた手法。
- ReBot: 実機からシミュレーションを経て実機へ戻るロボット動画合成によるロボット学習のスケーリングsim2real2025/3/1
実機のロボット軌道をシミュレーションで再生して対象物体を多様化し、実背景と合成することで物理的にリアルで時間的一貫性のあるロボット動画を生成し、VLAモデルを対象領域に適応させる手法を提案。
- シミュレーションと実世界の共訓練:視覚ベースロボットマニピュレーションのための簡単なレシピマニピュレーション2025/3/1
シミュレーションと実世界のデータを混合して方策を共訓練する簡単な手法を提案し、ロボットアームとヒューマノイドの多様なタスクで実世界性能を平均38%向上させた。
- GR00T N1: 汎用人型ロボットのためのオープン基盤モデルVLA2025/3/1
視覚言語モジュールと拡散トランスフォーマを組み合わせた二重システム構成のVLA基盤モデルを提案し、実機・人間動画・合成データで学習して人型ロボットの両手マニピュレーションを実現した。
- 動的な2D眼モデルにおける仮想反射が空間参照の識別を改善するヒューマンロボットインタラクション2024/12/1
人工眼モデルに視線に連動した仮想反射を重ねることで、空間参照の識別精度とユーザー体験が向上することをユーザー研究で示した。