Furong Huang
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 何に注目し、何を保持するか:スキル条件付き視触覚表現と進捗誘導型イベントメモリ触覚2026/9/29
スキルごとに視覚と触覚の役割が変わる点に着目し、スキルで条件付けした融合と過去スキルの終端観測を保持する疎なイベントメモリを組み合わせた視触覚表現を提案。接触が重要なタスクで進捗推定の遅延と誤差を大幅に削減した。
- エピソード評価を超えて:連続的身体化質問応答における記憶アーキテクチャのボトルネック身体化AI/記憶アーキテクチャ2026/7/1
身体化質問応答(EQA)を連続的に評価した際、既存の記憶保持だけでは不十分で、視覚的意味情報を保持する構造化された空間的記憶(3D幾何学に基づく)が必要であることを示した論文。
- グアバ:身体的操作のための効果的で普遍的なハーネス操作2026/6/16
言語モデルを外部モジュールと組み合わせるハーネスフレームワーク「Guava」を提案し、反復的な知覚-推論-行動ループ、意味的アクション抽象化、マルチモーダル観測が重要であることを示した。シミュレーションで収集した少数の軌道から4Bモデルへの蒸留を行い、実世界でも高い性能と汎化を達成した。
- μ0: スケーラブルな3Dインタラクショントレース世界モデル世界モデル2026/6/11
ロボット学習のための、物体や手などの相互作用点の3D軌跡を予測する世界モデルを提案。多様なビデオから自動で3D教師信号を抽出し、行動ラベルなしで事前学習可能。
- HumanEgo: 人間の一人称視点動画数分からのゼロショットロボット学習模倣学習2026/5/1
人間の一人称視点動画からロボット操作スキルをゼロショットで転移するフレームワークを提案。手と物体の相互作用をエンティティレベルで表現し、フローマッチングポリシーと補助損失で学習することで、ロボットデータ不要で高効率な学習を実現した。
- DynaFLIP:三モーダル動力学誘導表現によるロボット知覚の再考VLA/表現学習2026/5/1
画像と言語と3Dフローを組み合わせた動力学認識の事前学習フレームワークを提案し、ロボット操作のための視覚表現を向上させた。
- EgoScale:多様な一人称視点ヒューマンデータによる器用なマニピュレーションのスケーリングマニピュレーション2026/2/1
2万時間超の一人称視点ヒューマン動画でVLAモデルを事前学習し、人間データ量と検証損失の対数線形則を発見。軽量な人間-ロボット中間学習により、22自由度ハンドの器用な操作成功率を54%向上させた。
- MomaGraph: 視覚言語モデルによる状態認識統合シーングラフと身体性タスクプランニングVLA2025/12/1
家庭内の移動マニピュレータ向けに、空間的・機能的関係と物体状態を統合したシーングラフ表現MomaGraphと、大規模データセット・評価ベンチマーク・強化学習で訓練した7B視覚言語モデルMomaGraph-R1を提案し、ゼロショットタスクプランニングで最先端性能を達成した。
- TraceGen: 3Dトレース空間での世界モデリングによる異なる身体性の動画からの学習VLA2025/11/1
人間や他ロボットの動画を3Dトレース空間に変換し、少ない実機動画で新タスクを学習できる世界モデルTraceGenを提案。
- GenFlowRL: 生成的オブジェクト中心フローによる視覚強化学習の報酬形成強化学習2025/8/1
多様なロボットデータから学習した生成的オブジェクト中心フローを用いて報酬を形成し、視覚強化学習で汎化性の高い操作方策を獲得する手法を提案。
- 想像・検証・実行:視覚言語モデルによる記憶誘導型エージェント探索VLA2025/5/1
視覚言語モデルでシーンを想像し物理的妥当性を検証してから行動する探索フレームワークIVEを提案し、多様な探索と下流学習の性能向上を実現した。
- FLARE: 暗黙的世界モデリングによるロボット学習VLA2025/5/1
将来の観測の潜在表現を予測する世界モデリングを拡散トランスフォーマーポリシーに組み込み、模倣学習の性能と汎化を大幅に向上させた手法。
- PEnGUiN: サンプル効率の高いマルチエージェント強化学習のための部分的同変グラフニューラルネットワークマルチエージェント強化学習2025/3/1
実環境に存在する非対称性に対応するため、部分的な同変性を扱えるグラフニューラルネットワークPEnGUiNを提案し、非対称なマルチエージェント強化学習タスクで従来手法より優れることを示した。
- TraceVLA:視覚トレースプロンプトで汎用ロボットポリシーの時空間認識を強化VLA2024/12/1
状態行動軌跡を視覚的にエンコードする視覚トレースプロンプトを導入し、VLAモデルの時空間認識を改善。15万件の操作軌跡でOpenVLAを微調整したTraceVLAは、シミュレーションと実機で大幅な性能向上を達成。
- MaxMin-RLHF:多様な人間選好へのアラインメントRLHF2024/2/1
単一報酬モデルのRLHFでは人間選好の多様性を表現できないことを示し、選好分布の混合をEMで学習して平等主義的なMaxMin目的で方策を最適化する手法を提案した論文。
- Premier-TACO:時間的行動駆動型対照損失によるマルチタスク表現の事前学習と少数ショット方策学習少数ショット学習2024/2/1
マルチタスクのオフラインデータから時間的行動対照損失(TACO)を改良して汎用的な視覚表現を事前学習し、少数の専門家デモンストレーションで微調整することで、新しい連続制御タスクの少数ショット模倣学習を効率化する手法を提案。
- Safety Guaranteed Robust Multi-Agent Reinforcement Learning with Hierarchical Control for Connected and Automated Vehicles2023/9/1