Hengkai Tan
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Motus2: 巧みな操作のための自己進化型汎用世界モデルマニピュレーション2026/8/31
Motus2は、ポリシー・シミュレータ・評価器を統合した自己進化型の世界モデルで、巧みな操作を実現する。モデルとデータのスケーリングにより、意思決定と学習の閉ループを形成する。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- Motubrain: ロボット制御のための高度な世界行動モデルVLA/世界モデル2026/4/1
視覚・言語・行動を統合した世界行動モデルMotubrainを提案し、動画と行動の同時予測や多様なロボットデータへの対応、高速な実時間推論を実現した。
- RDT2:UMIデータのスケーリング限界を探り、ゼロショットのクロスエンボディメント汎化を実現VLA2026/2/1
7BパラメータのVLMを基盤とし、1万時間超のUMIデータと3段階学習で、未知の物体・シーン・指示・ロボット機体にゼロショットで汎化するロボット基盤モデルを構築した。
- Motus: 統合潜在行動ワールドモデルVLA2025/12/1
理解・映像生成・行動の3エキスパートをMixture-of-Transformerで統合し、光流から潜在行動を学習する統一ワールドモデルを提案。シミュレーションと実世界で既存手法を上回る性能を示した。
- Vidarc: 閉ループ制御のための身体性ビデオ拡散モデルVLA2025/12/1
マスク付き逆動力学モデルを組み合わせた自己回帰的な身体性ビデオ拡散モデルにより、低遅延で高精度なロボットアームの閉ループ制御を実現した研究。
- AnyPos: 双腕マニピュレーションのためのタスク非依存動作の自動生成マニピュレーション2025/7/1
タスクに依存しない動作データを大規模に自動収集し、逆動力学学習で身体ダイナミクスをモデル化することで、様々なタスクやプラットフォームに転用可能な双腕マニピュレーション基盤を構築した研究。
- Vidar: 汎用マニピュレーションのための身体性ビデオ拡散モデルマニピュレーション2025/7/1
インターネット規模で事前学習したビデオ拡散モデルを実機ロボットの軌道で追加学習し、マスク付き逆動力学モデルで適応させることで、未知のロボットでも20分の実演だけで新タスクや背景・視点変化に汎化する手法を提案。
- H-RDT: 人間の操作データで強化した両腕ロボットマニピュレーションマニピュレーション2025/7/1
大規模な一人称視点の人間操作動画と3D手姿勢を事前学習に活用し、拡散トランスフォーマーとフローマッチングでロボットの両腕操作ポリシーを学習する手法を提案。シミュレーションと実機で既存手法を上回る性能を示した。
- ManiBox: スケーラブルなシミュレーションデータ生成による身体性空間汎化の強化sim2real2024/11/1
バウンディングボックスを入力とする学生ポリシーを強化学習教師から蒸留し、シミュレーションでスケールしたデータで実機へのゼロショット転移を実現したフレームワーク。
- RDT-1B:双腕マニピュレーションのための拡散基盤モデルマニピュレーション2024/10/1
双腕ロボット操作のための12億パラメータの拡散ベース基盤モデルRDTを提案し、統一行動空間と大規模マルチロボットデータで事前学習することで、未知物体へのゼロショット汎化や言語指示追従、少数デモからの新スキル学習を実現した。
- 周波数領域で動くロボット制御ネットワークFCNet模倣学習/制御2024/5/1
ロボット軌道の特徴が低周波に集中することに着目し、短時間フーリエ変換で時変特徴を符号化する制御ネットワークFCNetを提案。Transformerより高効率・低遅延で実時間意思決定を実現した。