Pengfei Yi
収録論文 7本 ・ フィジカルAI/ロボット学習
VLA操作強化学習マニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GigaBrain-0.7:三系統アーキテクチャによる創発的能力へのスケーリングVLA2026/8/16
視覚言語行動モデルのスケーリングとアーキテクチャ改善により、多様なロボットへの汎化を大幅に向上させた基盤モデルを提案。
- アフォーダンスから行動へ:タスク条件付きシーン全体のアフォーダンス接地によるリアルタイム操作操作2026/6/1
タスク条件付き操作のための、シーン全体でタスク関連の機能部位を接地するベンチマーク中心の学習フレームワークを提案。単一領域と複数領域の指示対応をカバーするベンチマークと、エージェント支援のアノテーションパイプラインを構築し、リアルタイムのアフォーダンス接地と操作ポリシーへの応用を示した。
- ViVa: ロボット強化学習のためのビデオ生成価値モデル強化学習2026/4/1
事前学習済みのビデオ生成モデルを価値関数として再利用し、将来の身体状態とスカラー価値を同時に予測することで、ロボット操作タスクにおける価値推定を改善する手法を提案した。
- クリティック・イン・ザ・ループ:堅牢な長時間操作のための三系統VLAフレームワークマニピュレーション2026/3/1
VLMの高次推論とVLAの高速実行を、軽量な視覚クリティックが動的に切り替える階層型フレームワークを提案し、長時間操作の堅牢性を向上させた。
- 視点が重要:マスク付きオートエンコーダによる視覚マニピュレーションのための動的視点最適化マニピュレーション2026/2/1
単一カメラロボットにおいて、事前学習済みマルチビューマスク付きオートエンコーダを活用し、ラベルなしで最も情報量の多い視点を動的に選択するフレームワークMAE-Selectを提案。
- FSAG: 拡散モデルによる人間から多指ハンドへの指先ごとのアフォーダンス接地の強化マニピュレーション2026/1/1
人間の動画から拡散モデルを用いて物体のアフォーダンスを抽出し、多指ハンドの把持生成に活用することで、ハードウェア固有のデータ収集なしに汎用性の高い把持を実現した。
- FoAM: 先読み拡張によるマルチタスク模倣方策マニピュレーション2024/9/1
多様なタスクを単一方策でこなす模倣学習において、行動の視覚的結果を予測する先読み拡張を導入し、未見タスクへの汎化と行動信頼性を高めた手法を提案。