Haojian Huang
The Hong Kong University of Science and Technology (Guangzhou)
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- フロンティアVLMエージェントはロボット汎用istになれるか?Embodied Agent Arenaによる実証研究VLA2026/10/1
VLMのロボット汎用性を評価するベンチマーク「Embodied Agent Arena」を提案し、7つのVLMを幾何推定・空間推論・アフォーダンス・タスク計画・操作の観点で比較した。精密推定は得意だが、協調的な目標指向行動の完遂に課題が残ることを示した。
- ロボットのインコンテキスト学習:手法と応用VLA2026/9/28
ロボットのインコンテキスト学習(ICL)に関する文献レビューであり、文脈条件付き方策、幾何学的実演転移、世界モデルベース制御、スキル・エージェントベース実行の4つのインターフェースに分類し、転移の前提や評価手法を整理する。
- RACaP: 進化可能なロボット学習のためのポリシーとしての推論・行動・コーディングVLA2026/9/24
コード生成を進化フェーズに移し、展開時は凍結された型付きポリシーAPIをReActループで呼び出すエージェント型フレームワークを提案。長期的タスクで成功率と速度を大幅に改善し、小型モデルへの蒸留で実機展開を効率化した。
- Robo-Harness K1: 知覚拡張によるロボット操作エージェントの活用VLA2026/9/24
VLMに深度や空間計測などの知覚ツールを提供し、追加学習なしでロボット操作を実現するエージェントフレームワークを提案。少ない実演データでも高い汎化性能を示す。
- World Action Agent:視覚的アクション空間でのロボット操作を可能にするVLM活用フレームワークVLA2026/9/24
VLMをマルチエージェント構成でロボット操作に活用し、接触ビュー・アクションリハーサル・ビュー内補正を組み合わせた視覚的アクション作業空間を提案。LIBERO-Proで75.6%の成功率を達成。
- WorldLines: 長期的な状態を持つ具現化エージェントのベンチマークとモデリング具現化エージェント/長期記憶/ベンチマーク2026/6/17
長期的な家庭支援のためのベンチマークWorldLinesを構築し、記憶と計画の課題を評価するフレームワークObsMemを提案した。
- RoboStressBench: 身体化シーンにおける物理的視覚ストレスに対するVLMロバスト性のベンチマークVLM/ベンチマーク2026/5/30
視覚言語モデル(VLM)の実環境でのロバスト性を評価するため、物理的レンダリング方程式に基づき、視覚ストレスを材料・視点・照明・幾何の4次元に分解したベンチマークRoboStressBenchを提案した。
- アフォーダンスエージェントハーネス:検証ゲートによるスキルオーケストレーションアフォーダンス接地2026/5/1
オープンワールドでのアフォーダンス接地を改善するため、検証ゲート付きのクローズドループランタイムを提案し、適応的なスキル選択とエビデンス蓄積により精度とコストのトレードオフを向上させた。