Huan-ang Gao
収録論文 8本 ・ フィジカルAI/ロボット学習
視線推定VLA/操作データセット/シミュレーションVLAsim2realアフォーダンス推論マニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PAGE: 実用的な人間レベルの視線ターゲット推定に向けて視線推定2026/7/6
視線ターゲット推定の性能を人間レベルに近づけるため、シーンと頭部特徴の相互作用を明示的にモデル化したPaGEを提案し、大規模な未ラベルデータでの蒸留により軽量で実用的なモデルを実現した。
- Dexora: 高自由度両腕巧緻操作のためのオープンソースVLAVLA/操作2026/5/1
両腕・両手の高自由度操作を対象とした初のオープンソースVLAシステムDexoraを提案し、ハイブリッド遠隔操作とデータ品質を考慮した学習手法により、巧緻操作の成功率を大幅に向上させた。
- ManiTwin: データ生成対応デジタルオブジェクトデータセットを10万点に拡張データセット/シミュレーション2026/3/1
単一画像からシミュレーション対応の3Dアセットを自動生成するパイプラインを構築し、10万点の高品質アセットデータセットを提供する論文。
- トルク対応VLAモデルの設計空間の解明VLA2025/9/1
トルク信号をVLAモデルに統合する設計空間を体系的に検討し、デコーダへのトルクアダプタ導入と補助出力としてのトルク予測が有効であることを示した。
- RoboChemist: 長期的・安全基準準拠のロボット化学実験システムVLA2025/9/1
VLMとVLAを組み合わせた二重ループ構成で、危険物や変形物を扱う多段階の化学実験を、安全規範を守りながら実行するロボットシステムを提案した。
- RoboTwin 2.0:強力なドメインランダム化を備えた両腕ロボット操作のためのスケーラブルなデータ生成器とベンチマークsim2real2025/6/1
両腕ロボット操作のための大規模データ生成フレームワークを提案し、マルチモーダル言語モデルによるタスク生成と5軸のドメインランダム化で実世界への転移性能を大幅に向上させた。
- Afford-X: タスク指向操作のための汎化可能で軽量なアフォーダンス推論アフォーダンス推論2025/3/1
大規模データセットLVIS-Affを構築し、動詞注意と双方向融合モジュールを備えた軽量モデルAfford-Xを開発。非LLM手法を上回る性能を達成し、GPT-4Vより約50倍高速にアフォーダンス推論を行う。
- PreAfford: 多様な物体と環境に対応するユニバーサルなアフォーダンスベースの事前把持マニピュレーション2024/4/1
把持しにくい物体に対して、点レベルのアフォーダンス表現とリレー学習を用いた事前把持計画フレームワークを提案し、把持成功率を69%向上させた。