Yifan Han
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- A4A: 人間のデモからの行動指向4Dアフォーダンスのクロスエンボディ転移操作学習/クロスエンボディ転移2026/9/5
人間のデモから行動指向の4Dアフォーダンス(相互作用点の将来軌跡)を学習し、ロボットポリシーの事前学習に利用することで、多様なVLAポリシーの操作性能を向上させる手法を提案した。
- VT-MUSE: 操作のためのマルチモーダル統合シーケンシャル視触覚表現学習視触覚表現学習2026/8/21
視覚と触覚の時系列情報を統合する表現学習フレームワークを提案し、シミュレーションと実世界で操作タスクの成功率を大幅に向上させた。
- アフォーダンスから行動へ:タスク条件付きシーン全体のアフォーダンス接地によるリアルタイム操作操作2026/6/1
タスク条件付き操作のための、シーン全体でタスク関連の機能部位を接地するベンチマーク中心の学習フレームワークを提案。単一領域と複数領域の指示対応をカバーするベンチマークと、エージェント支援のアノテーションパイプラインを構築し、リアルタイムのアフォーダンス接地と操作ポリシーへの応用を示した。
- BORA: オフライン強化学習とオンライン残差適応を橋渡しする実世界巧緻操作VLAモデルVLA/強化学習/巧緻操作2026/5/1
実世界の巧緻操作向けに、オフライン学習で価値関数を構築し、オンラインで人間介入による残差適応を行うVLAモデルの後訓練フレームワークを提案した。
- BridgeACT: 人間のデモンストレーションを統一的なツール・ターゲットのアフォーダンスでロボット動作に橋渡しする操作学習2026/4/1
人間のビデオからロボット操作を直接学習するフレームワークを提案。アフォーダンスを身体非依存の中間表現として使い、把握位置と動作を分解して実ロボットに展開する。
- DexHiL:巧みな操作のための視覚-言語-行動モデル事後学習における人間参加型フレームワークマニピュレーション2026/3/1
腕と多指ハンドの協調操作を可能にする人間参加型フレームワークを提案し、実行中の人間による修正を活用した事後学習で成功率を平均25%向上させた。
- 視点が重要:マスク付きオートエンコーダによる視覚マニピュレーションのための動的視点最適化マニピュレーション2026/2/1
単一カメラロボットにおいて、事前学習済みマルチビューマスク付きオートエンコーダを活用し、ラベルなしで最も情報量の多い視点を動的に選択するフレームワークMAE-Selectを提案。
- FSAG: 拡散モデルによる人間から多指ハンドへの指先ごとのアフォーダンス接地の強化マニピュレーション2026/1/1
人間の動画から拡散モデルを用いて物体のアフォーダンスを抽出し、多指ハンドの把持生成に活用することで、ハードウェア固有のデータ収集なしに汎用性の高い把持を実現した。
- 見て、ズームして、理解する:身体性知覚のためのロボット眼球VLA2025/11/1
言語指示に基づきPTZカメラのパン・チルト・ズームを調整して最適な視野を得るVLAモデルEyeVLAを提案し、500サンプルで実世界適応を実現した。
- SAGE: シーングラフを活用した長期的マニピュレーションタスクの誘導と実行マニピュレーション2025/9/1
シーングラフを構造的表現として用い、VLM/LLMによるタスク計画と画像編集によるサブゴール画像生成を組み合わせ、長期的マニピュレーションタスクを実現するフレームワークを提案。
- Affordance-R1: マルチモーダル大規模言語モデルにおける汎化可能なアフォーダンス推論のための強化学習VLA2025/8/1
強化学習(GRPO)と認知Chain-of-Thoughtを統合し、ロボットが物体の操作可能領域を推論するアフォーダンス・グラウンディングをゼロショットで汎化可能にした初の統一フレームワーク。
- FoAM: 先読み拡張によるマルチタスク模倣方策マニピュレーション2024/9/1
多様なタスクを単一方策でこなす模倣学習において、行動の視覚的結果を予測する先読み拡張を導入し、未見タスクへの汎化と行動信頼性を高めた手法を提案。