Yiming Zhong
ShanghaiTech University
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniAfford: トークンルーティング型マルチタスク学習による汎用可能な2D-3Dアフォーダンス知覚アフォーダンス知覚2026/9/29
MLLMを共通の意味ハブとし、タスク別トークンルーターで画像・点群のアフォーダンスクエリを生成することで、2D・3D・統合アフォーダンス知覚を単一枠組みで扱う手法を提案。
- 暗黙的ドリフト方策:条件付き専門家幾何による一段階行動生成模倣学習/行動生成2026/6/1
拡散やフローマッチングに基づく生成行動ポリシーは反復サンプリングが遅いため、一段階生成を提案。訓練時のドリフト補正を明示的なベクトル場推定なしで取り込む暗黙的ドリフト方策(IDP)を導入し、2D・3D・実世界操作タスクで有効性を実証した。
- FastGrasp: 移動マニピュレータによる高速器用把持のための学習ベース全身制御手法マニピュレーション2026/4/1
移動ロボットの高速把持を実現するため、物体点群から把持候補を生成し、移動ベース・アーム・ハンドを協調制御する学習ベースのフレームワークを提案。触覚フィードバックで衝撃や物体のばらつきに適応し、シミュレーションと実機で有効性を実証した。
- ノイズから意図へ:残差ブリッジによる生成的VLAポリシーのアンカリングVLA2026/4/1
生成的VLAポリシーを「ノイズからの生成」から「意図からの精緻化」へと転換し、スペクトル解析で制御を低周波の意図と高周波の残差に分離して、残差拡散ブリッジで局所ダイナミクスを精緻化するResVLAを提案した。
- Affordance-R1: マルチモーダル大規模言語モデルにおける汎化可能なアフォーダンス推論のための強化学習VLA2025/8/1
強化学習(GRPO)と認知Chain-of-Thoughtを統合し、ロボットが物体の操作可能領域を推論するアフォーダンス・グラウンディングをゼロショットで汎化可能にした初の統一フレームワーク。
- FreqPolicy: 連続トークンによる周波数自己回帰型視覚運動ポリシーマニピュレーション2025/6/1
動作を周波数領域で表現し、低周波から高周波へ段階的に自己回帰生成する連続トークン型の視覚運動ポリシーを提案。2D/3D操作ベンチマークで精度と効率を両立。
- DexH2R: 人からロボットへの受け渡しにおける動的な巧みな把持のベンチマークマニピュレーション2025/6/1
巧みなロボットハンドへの人間からの受け渡しを対象に、多様な物体・動き・視覚データと詳細注釈を備えた実世界データセットDexH2Rを構築し、DynamicGrasp手法を提案して既存手法を比較評価した。
- DexGrasp Anything:物理法則を考慮した万能ロボット巧み把持マニピュレーション2025/3/1
拡散モデルの学習とサンプリングに物理制約を組み込み、多様な物体に対する高品質な巧み把持姿勢を生成する手法を提案し、大規模な把持データセットも構築した。