Haoqiang Fan
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 球面調和関数による効率的なハイブリッドSE(3)等変ビジュモータフローポリシー:ロボット操作への応用マニピュレーション2026/3/1
球面調和表現を用いてSO(3)等変性を保証しつつ、点群と画像のハイブリッド視覚モダリティを動的に融合する特徴強調モジュールを導入し、高速サンプリングと安定した等変学習を両立するE3Flowを提案した。シミュレーションと実機で有効性を検証し、成功率と推論速度の向上を実証した。
- SeedPolicy: 自己進化型拡散ポリシーによるロボットマニピュレーションの時間軸スケーリングマニピュレーション2026/3/1
ゲート付き注意機構で長期文脈を圧縮する時間モジュールSEGAを拡散ポリシーに統合し、長期的なロボット操作タスクの性能を大幅に向上させた。
- Realtime-VLA V2: VLAを高速・滑らか・正確に実行する学習VLA/制御2026/3/1
VLAモデルを実ロボットに高速展開するための実践的技術群を提案し、軽量アームで人間並みの速度と精度を実現した。
- ロボットシーンクローニング:視覚プロンプト編集による操作タスクのゼロショットシーン適応の推進マニピュレーション2026/3/1
既存のロボット操作軌道を編集してシーン固有の適応を実現する手法を提案し、視覚プロンプトと条件注入モジュールにより正確でシーン整合性のあるサンプル生成を行い、ポリシーの汎化を向上させる。
- DM0: フィジカルAIに向けた身体性ネイティブな視覚-言語-行動モデルVLA2026/2/1
身体性を後付けでなく最初から統合し、大規模事前学習からフローマッチング行動専門家と空間Chain-of-Thoughtで操作とナビゲーションを統一的に学習するVLAフレームワークDM0を提案。
- SpatialActor: ロバストなロボットマニピュレーションのための分離された空間表現の探求マニピュレーション2025/11/1
意味と幾何を明示的に分離し、ノイズの多い深度と専門家事前知識を融合するフレームワークを提案。RLBenchで87.4%を達成し、ノイズ条件下で13.9%〜19.4%の改善を示す。
- VLAをリアルタイム速度で動かすVLA2025/10/1
単一のコンシューマGPU上でpi0級のマルチビューVLAを30Hzのフレームレート・最大480Hzの軌道周波数で動作させる推論最適化手法を提案し、落下するペンを掴むタスクで100%の成功率を達成した。
- RoboChallenge:実機ロボットによる具現化ポリシーの大規模評価VLA2025/10/1
多数のモデルとタスクを実機で評価するオンラインシステムRoboChallengeを構築し、初期ベンチマークTable30で最新VLAモデルを調査した。
- Dexbotic: オープンソース視覚-言語-行動ツールボックスVLA2025/10/1
複数のVLAモデルを単一環境で再現・開発できるPyTorchベースのオープンソースツールボックスを提供し、高性能な事前学習済みモデルも公開した。
- MemoryVLA: ロボット操作のための視覚-言語-行動モデルにおける知覚・認知記憶VLA2025/8/1
人間の作業記憶と海馬の記憶機構に着想を得て、知覚・認知トークンを記憶バンクに蓄え再利用するVLAモデルを提案し、長期的な依存を含む操作タスクで従来手法を上回る成功率を達成した。
- 汎化可能な両腕マニピュレーションのベンチマーク:CVPR 2025 MEISワークショップにおけるRoboTwin両腕協調チャレンジマニピュレーション2025/6/1
RoboTwinシミュレーションと実機ロボットを用いた両腕マニピュレーションの国際コンペを開催し、17タスクで64チームが競い、汎化可能な協調方策の知見をまとめた。
- ROSA: ロボット状態を活用した視覚言語と行動のアライメントVLA2025/6/1
ロボットの状態推定データを自動取得してVLAモデルの訓練に組み込み、視覚言語空間と行動空間のずれを埋めることで、少ないデータでも高性能・高汎化を実現する手法を提案。
- Ross3D: 3D認識を備えた再構成的視覚インストラクションチューニング3Dシーン理解2025/4/1
3Dシーン理解のための大規模データ不足に対処するため、クロスビューとグローバルビューの再構成を訓練に組み込んだ3D認識型視覚インストラクションチューニング手法を提案し、複数のベンチマークで最高性能を達成した。
- BFA: マルチビュー細粒度マニピュレーションのための最良特徴量認識融合マニピュレーション2025/2/1
マルチビュー画像を用いた細粒度マニピュレーションにおいて、各視点の重要度を軽量ネットワークで予測し、再重み付けして融合するプラグアンドプレイ手法を提案。タスク成功率を22-46%向上させた。
- FlowPolicy: 一貫性フローマッチングによる高速で堅牢な3Dフローベース方策模倣学習2024/12/1
3D点群を入力とし、一貫性フローマッチングで速度場の自己整合性を正規化することで、1ステップ推論でロボット操作方策を生成する手法を提案。
- Multi-GraspLLM:多様なロボットハンドのための意味誘導型把持生成マルチモーダルLLMマニピュレーション2024/12/1
自然言語指示に基づき、複数のロボットハンドに対応した把持姿勢を生成する統合フレームワークを提案し、接触注釈付き大規模データセットMulti-GraspSetを構築した。
- RoboMatrix: スキル中心の階層型フレームワークによるオープンワールドでのスケーラブルなロボットタスク計画と実行VLA2024/12/1
多様なタスクから汎用メタスキルを抽出し、LLMによるタスク分解と移動・操作を統合したVLAモデルで未見タスクを遂行するスキル中心の階層型ロボットフレームワークを提案した。
- RoboGSim: 実世界からシミュレーションを経て実世界へ戻るロボット用ガウシアンスプラッティングシミュレータsim2real2024/11/1
3Dガウシアンスプラッティングと物理エンジンを組み合わせ、実世界のロボット操作データを高忠実度でシミュレーションし、実機へのゼロショット転移を可能にするReal2Sim2Realシミュレータを提案。
- SegGrasp: セマンティック・幾何学誘導セグメンテーションによるゼロショットタスク指向把持マニピュレーション2024/10/1
視覚言語モデルと凸分解による幾何情報を組み合わせ、学習なしで対象物の機能部位を狙うゼロショット把持を実現したフレームワーク。
- Towards Self-Supervised Category-Level Object Pose and Size Estimation2022/3/1
- FS6D: Few-Shot 6D Pose Estimation of Novel Objects2022/3/1
- FFB6D: A Full Flow Bidirectional Fusion Network for 6D Pose Estimation2021/3/1
- PVN3D: A Deep Point-wise 3D Keypoints Voting Network for 6DoF Pose Estimation2019/11/1