Yifan Zhong
収録論文 6本 ・ フィジカルAI/ロボット学習
器用操作/VLAシステム設計マニピュレーションVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EgoSteer: 自己中心視点ビデオからの操縦可能な器用操作を実現するフルスタックシステム器用操作/VLA2026/7/1
自己中心視点の人間ビデオから大規模な事前学習データを構築し、言語指示に従う器用なロボット操作ポリシーを学習するフルスタックシステムを提案。実ロボットへの適応も効率的で、多様なタスクで高い成功率を達成した。
- 長時間ロボット卓上ゲームにおける内部状態整合性を維持するシステム設計システム設計2026/3/1
ロボットによる長時間の卓上ゲーム(麻雀)で、知覚や実行の小さな誤りが状態を破壊する問題に対し、状態を明示的に分離・監視し、触覚トリガーによる回復機構を備えた統合アーキテクチャを提案・実証した。
- DexKnot: 器用な袋結び操作のための汎化可能な視覚運動ポリシー学習マニピュレーション2026/3/1
袋結びの汎化可能なポリシーを、キーポイントのアフォーダンスと拡散ポリシーを組み合わせて学習するフレームワークを提案した。
- 視覚-言語-行動モデルサーベイ:行動トークン化の観点からVLA2025/7/1
視覚と言語の入力を行動トークンに変換して実行するVLAモデルを、行動トークンの種類(言語記述・コード・アフォーダンス・軌道など)で分類し、各手法の長所と課題を整理したサーベイ。
- Falcon: 部分ノイズ除去による高速視覚運動ポリシーVLA2025/3/1
拡散ポリシーの推論を高速化するため、過去の行動の部分ノイズ除去結果を再利用する学習不要の手法を提案し、性能を維持しつつ2〜7倍の速度向上を実現した。
- DexGraspVLA:汎用器用把持に向けた視覚-言語-行動フレームワークVLA2025/2/1
事前学習済み視覚言語モデルを高レベル計画に、拡散ベースの行動制御器を低レベルに用いた階層型フレームワークで、多様な未見の乱雑シーンでも90%以上の器用把持を実現した。