Haojie Huang
収録論文 21本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Pix2Act: 等変オーグメンテーションを用いた画像空間操作ポリシーマニピュレーション2026/7/1
カメラ平面上の2D軌跡として操作行動を表現し、三角測量でエンドエフェクタの姿勢を復元する模倣学習手法を提案。観測と行動を同じ座標系に揃えることで等変変換を可能にし、汎化性能を向上させた。
- 戦略的スケールアップ:バイアス認識評価とデータ収集によるロボット操作の構成的汎化学習マニピュレーション2026/7/1
事前学習済みポリシーが指示の一部の要素(色など)に過剰に依存する「指示因子バイアス」を定量化する診断フレームワークを提案し、その結果に基づいてデータ収集を再配分することで、少ないデモ数で汎化性能を向上させる手法を示した。
- Retriever: 閉ループ非同期ロボットプログラムの合成システム/プログラミング2026/7/1
ロボットの長時間タスクを実現するため、異なるクロックと遅延を持つコンポーネントを組み合わせた閉ループパイプラインを、非同期意思決定モデルとプログラミングモデル、ランタイム、パイプライン例として提供する。
- アクションマップポリシー:ピクセル分類による3D閉ループ操作の学習マニピュレーション2026/7/1
ロボットの操作行動をカメラ画像平面上のピクセル位置として分類問題に変換し、高次元で多峰性の行動を効率的に学習する手法を提案。拡散ポリシーより高速で高精度な推論を実現。
- マルチモーダル言語モデルの身体性能力をスキル単位で評価・診断するベンチマークBEARVLA2025/10/1
身体性タスクを14の原子スキルに分解してMLLMを細粒度評価するベンチマークBEARを提案し、知覚と時空間モデリングがボトルネックであることを示すとともに、視覚・空間推論ツールを組み込んだBEAR-Agentで性能を改善した。
- 物体中心表現による汎化可能な階層的スキル学習マニピュレーション2025/10/1
物体中心のスキルプリミティブを介して視覚言語モデルと低次視覚運動ポリシーを橋渡しし、少ないデモでロボット操作の汎化とサンプル効率を大幅に向上させる階層的学習フレームワークを提案。
- クレブシュ・ゴルダン変換器:高速で大域的な同変アテンション同変Transformer2025/9/1
SO(3)の既約表現上でのクレブシュ・ゴルダン畳み込みにより、全次数の同変特徴を扱いつつO(N log N)の大域アテンションを実現したTransformerを提案。n体シミュレーションやロボット把持などで既存手法より高精度・高速・省メモリを達成。
- 同変目標条件付きコントラスティブ強化学習強化学習2025/7/1
目標条件付き操作タスクの回転対称性を活用し、同変制約を導入したコントラスティブ強化学習を提案。サンプル効率と空間汎化を改善し、オフライン設定にも拡張。
- 球面投影による3D同変視覚運動ポリシー学習VLA2025/5/1
単眼RGB画像から球面に特徴を投影し、点群再構成なしでSO(3)同変な拡散ポリシーを学習する手法を提案。
- 等変モデルと把持スコア最適化によるプッシュ・把持方策学習マニピュレーション2025/4/1
SE(2)等変性を取り入れたネットワークと把持スコア最適化により、散らかった環境でのプッシュと把持を統合的に学習する手法を提案し、シミュレーションと実機で成功率を大幅に改善した。
- 粗から細への3Dキーフレームトランスポーターマニピュレーション2025/2/1
キーフレーム模倣学習における双同変対称性を利用し、把持物体とシーンの特徴の相互相関で行動を評価するTransporter Networksベースの手法を提案。粗から細へのSE(3)行動評価により、シミュレーションで10%以上、実機実験で平均55%の性能向上を達成した。
- MATCH POLICY:点群位置合わせから操作ポリシーへのシンプルなパイプラインマニピュレーション2024/9/1
ピック&プレースの対象をデモと点群位置合わせで対応付けることで、学習なしに高精度な操作ポリシーを実現する手法を提案。
- OrbitGrasp: SE(3)同変な把持学習マニピュレーション2024/7/1
点群入力からSE(3)把持姿勢を検出するため、球面調和基底で連続的な把持品質関数を学習するSE(3)同変モデルを提案し、シミュレーションと実機で性能を向上させた。
- 同変拡散ポリシー模倣学習2024/7/1
拡散モデルを用いた模倣学習にSO(2)同変性を導入し、ノイズ除去関数のサンプル効率と汎化性能を向上させる手法を提案。
- ThinkGrasp: 散乱環境での戦略的パーツ把持のための視覚言語システムマニピュレーション2024/7/1
GPT-4oの文脈推論を活用し、散乱環境で対象物を段階的に露出させて把持するプラグアンドプレイの視覚言語把持システムを開発した。
- 想像ポリシー:生成的点群モデルを用いたマニピュレーションポリシーの学習マニピュレーション2024/6/1
目標状態の点群を生成し、剛体動作推定で行動に変換するマルチタスク・キーフレームポリシーを提案。RLbenchで高性能を示し、実機でも検証した。
- テキスト・視覚関連性と同変言語マッピングによる効率的で堅牢な言語条件付きマニピュレーションの学習言語条件付きマニピュレーション2024/6/1
事前学習済み視覚言語モデルと同変言語マッピングを組み合わせ、少ないロボットデータで言語指示に基づく操作を高精度かつ堅牢に実現する手法GEMを提案。
- Fourier Transporter: Bi-Equivariant Robotic Manipulation in 3D2024/1/1
- Leveraging Symmetries in Pick and Place2023/8/1
- Edge Grasp Network: A Graph-Based SE(3)-invariant Approach to Grasp Detection2022/11/1
- Equivariant Transporter Network2022/2/1