Dongyoon Hwang
KAIST AI
収録論文 6本 ・ フィジカルAI/ロボット学習
マニピュレーションVLAVLA/操作歩行スキル発見
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FlashDexRetarget: 多動作リターゲティングによる器用操作データ生成の高速化マニピュレーション2026/10/1
人間の手と物体のデモンストレーションをロボットハンドに転送する強化学習ベースのリターゲティング手法を提案し、50動作で90%の成功率を達成しつつ、学習計算量を最大100倍削減した。
- ロボットのように見る:ロボット中心のポイントマップによる視覚言語行動モデルVLA2026/7/1
視覚言語行動モデル(VLA)がカメラ視点とロボット座標系のずれで性能を落とす問題を、ロボット座標系の3D座標を画素に格納したポイントマップを入力に用いることで解決し、既存VLAに最小限の変更で統合できることを示した。
- 3D HAMSTER: 3D軌道ガイダンスによる階層型視覚言語行動モデルの計画と制御の橋渡しVLA/操作2026/6/1
階層型VLAモデルにおいて、プランナーが直接3D軌道を予測できるようにし、2Dガイダンスの幾何学的歪み問題を解決した。実世界操作で優れた性能を示した。
- PHUMA: 物理的に信頼できるヒューマノイド歩行データセット歩行2025/10/1
物理的な不自然さを除去する2段階パイプラインでモーションキャプチャとネット動画を統合し、73時間のヒューマノイド歩行データセットを構築、実機Unitree G1へのゼロショット転移を実現した。
- 視覚運動制御のための畳み込み注入器による事前学習済みViTの適応VLA2024/6/1
事前学習済みViTに畳み込みを注入する追加モジュールCoInを提案し、視覚運動制御タスクへの適応性能を向上させた。
- やるべきこととやらないこと:指示動画を用いた望ましいスキルの学習スキル発見2024/6/1
指示動画から望ましい行動と望ましくない行動を区別する指示ネットワークを学習し、スキル発見アルゴリズムの報酬を調整することで、複雑な連続制御タスクにおいて安全で望ましいスキルを効率的に獲得する手法を提案。