Di Huang
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PriGo: テスト時プリミティブガイダンスによる拡散・フローポリシーの適応的ロボット操作マニピュレーション2026/7/1
模倣学習ベースの拡散・フローポリシーがタスクや環境の変化に弱い問題を解決するため、観測からプリミティブ分布を予測し、推論時に生成動作を意味的に一貫した方向へ洗練する軽量モジュールを提案。再学習不要で既存ポリシーに統合でき、複数ベンチマークで頑健性と汎化性を向上させた。
- SIMPLE: ヒューマノイドの移動操作のためのシミュレーションベースのポリシー学習と評価ヒューマノイド/シミュレーション2026/6/1
ヒューマノイドの全身移動操作タスクを対象とした、大規模で再現可能な統一シミュレーションテストベッドを提案し、多様なタスクとデータ生成パイプラインを統合して、シミュレーションと実世界の性能相関を示した。
- PrimitiveVLA: 再利用可能な運動プリミティブ学習による効率的で汎用的なロボット操作VLA/操作2026/5/1
VLAモデルのデータ効率と汎化を改善するため、デモを再利用可能な運動プリミティブに分解し、推論時に組み立てるフレームワークを提案した。
- HumDex: ヒューマノイド器用操作を簡単にする遠隔操作/模倣学習2026/3/1
ヒューマノイド全身の器用な操作のためのポータブル遠隔操作システムを提案し、IMUベースのモーショントラッキングと学習ベースのリターゲティングで高品質なデモデータ収集を実現。さらに、多様な人間の動作データでの事前学習とロボットデータでの微調整による模倣学習フレームワークを導入し、汎化性能を向上させた。
- Ψ₀: 汎用人型ロコマニピュレーションに向けたオープン基盤モデルVLA2026/3/1
高品質な一人称視点の人間動画でVLMを事前学習し、人型ロボットの実機データで追加学習する段階的パラダイムにより、少ないデータで人型ロコマニピュレーションを実現するオープン基盤モデルを提案した。
- EgoHumanoid:ロボット不要の一人称デモで実世界ロコマニピュレーションを実現ロコマニピュレーション2026/2/1
人間の一人称視点デモと少量のロボットデータを共訓練し、視点・動作のずれを補正することで、ヒューマノイドの実世界ロコマニピュレーション性能を51%向上させた。
- GraspLDP:潜在拡散による汎化可能な把持ポリシーマニピュレーション2026/2/1
把持姿勢の事前知識を潜在拡散ポリシーに組み込み、模倣学習による把持の精度と物体・空間汎化性能を高める手法を提案。
- 模倣学習によるロボットマニピュレーション:分類、進化、ベンチマーク、課題マニピュレーション2025/8/1
模倣学習を用いたロボットマニピュレーション研究を体系的に分類し、技術的進化やベンチマーク結果を整理して今後の課題をまとめたサーベイ論文。
- スケーラブルなロボットマニピュレーションに多様性は本当に必要か?マニピュレーション2025/7/1
ロボット学習におけるデータ多様性の役割をタスク・身体・専門家の3次元で検証し、タスク多様性が重要である一方、専門家の速度多様性は学習を妨げることを示し、その偏りを補正する手法を提案した。
- EMMA: 自動運転のためのエンドツーエンドマルチモーダルモデル自動運転2024/10/1
マルチモーダル大規模言語モデルを基盤に、カメラ映像から直接運転計画や物体検出、道路グラフを生成する自動運転モデルを提案し、複数タスクの同時学習で性能向上を実証した。
- ドメイン事前知識による6自由度把持検出の汎化マニピュレーション2024/4/1
ロボット把持の物理的制約を正則化として学習に組み込み、接触スコアと投影接触マップで把持姿勢を補正することで、未知物体への6自由度把持検出の汎化性能を向上させた。
- グローバルからローカルへのRGB-D適応によるSim-to-Real把持検出sim2real2024/3/1
RGB-D把持検出のsim-to-real問題をドメイン適応として捉え、自己教師あり回転事前学習とグローバル・ローカルな特徴アラインメント、把持プロトタイプ適応によりシミュレーションから実環境への転移性能を向上させた研究。
- 点群が鍵:ロボット学習における観測空間の影響の再考マニピュレーション2024/2/1
RGB・RGB-D・点群という3つの観測モダリティがロボット学習に与える影響を、2つのシミュレータと125タスクからなるベンチマークOBSBenchで比較し、点群ベースの手法が接触の多い操作タスクで優れた性能と汎化を示すことを明らかにした。
- RGB-D Grasp Detection via Depth Guided Learning with Cross-modal Attention2023/2/1
- Towards Scale Balanced 6-DoF Grasp Detection in Cluttered Scenes2022/12/1
- Double-Dot Network for Antipodal Grasp Detection2021/8/1