Gao Huang
Tsinghua University
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 世界行動モデルの汎化性能を決める要因とは?推論時の未来モデリングに関する実証研究VLA2026/9/28
世界行動モデル(WAM)の汎化性能を環境変化・データ効率・タスク汎化の3軸で評価し、未来表現の条件付けが重要であることを示すとともに、未来生成を1回の順伝播に簡略化したSimple-WAMを提案した。
- 身体性知能のための世界モデル:もっともらしさから制御可能性、そして行動可能性へ世界モデル2026/9/15
身体性知能における世界モデルを、もっともらしさ・制御可能性・行動可能性の3段階の能力レベルで整理し、操作・ナビゲーション・歩行・自動運転などの研究を横断的に調査したサーベイ。
- MemoryVLA++:視覚言語行動モデルにおける記憶と想像による時間的モデリングVLA2026/6/8
ロボット操作のためのVLAモデルに、作業記憶・エピソード記憶・未来想像の仕組みを組み込み、長期的な時間依存タスクを可能にするフレームワークを提案した。
- 潜在誘導フローマッチングによる視覚言語行動ポリシーの改善VLA2026/6/1
視覚言語行動ポリシーに、成功可能性の軌跡を学習する自己誘導型フローマッチングを導入し、外部批評家なしで最良の行動選択を可能にする手法を提案した。
- 視覚プリミティブによる行動生成VLA2026/5/1
視覚言語行動モデルにおいて、視覚プリミティブを介して行動生成を行う新しいアーキテクチャを提案し、実ロボットのピックアンドプレースタスクで成功率を大幅に向上させた。
- 短期的視野を超えて:非マルコフ的シミュレーションベンチマークにおける頑健な長期操作のためのVQメモリ操作2026/3/1
非マルコフ的で長期的な操作タスクを評価する新しいベンチマーク「RuleSafe」を提案し、過去の状態を離散トークンに符号化するVQメモリ表現が、既存のVLAモデルの長期計画と汎化性能を向上させることを示した。
- TwinRL: デジタルツイン駆動強化学習による実世界ロボットマニピュレーションVLA2026/2/1
スマホ撮影から高忠実度デジタルツインを構築し、SFT・ツインRL・実世界RLの3段階でVLAモデルの探索空間を拡張・誘導する協調ポストトレーニング手法を提案。
- MOVE: ロボットマニピュレーションの空間汎化のための運動ベースデータ収集パラダイムマニピュレーション2025/12/1
デモ中に環境内の物体を動かすことで、単一軌道から多様な空間配置データを生成し、模倣学習の空間汎化性能を向上させる手法を提案。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- UltraDP: 力覚対応拡散ポリシーによる汎化可能な頸動脈超音波スキャン医療ロボティクス2025/11/1
超音波画像・手首カメラ・接触力・プローブ姿勢を入力とする拡散ポリシーで頸動脈の自律スキャンを実現し、未見被験者でも95%の成功率を達成した。
- SpatialActor: ロバストなロボットマニピュレーションのための分離された空間表現の探求マニピュレーション2025/11/1
意味と幾何を明示的に分離し、ノイズの多い深度と専門家事前知識を融合するフレームワークを提案。RLBenchで87.4%を達成し、ノイズ条件下で13.9%〜19.4%の改善を示す。
- UltraHiT: 内頸動脈ロボット超音波検査のための階層型トランスフォーマーアーキテクチャ医療ロボティクス2025/9/1
内頸動脈のロボット超音波検査を自動化するため、血管構造の個人差を標準モデルからの形態変異として捉え、高レベル変異評価と低レベル行動決定を統合した階層型トランスフォーマーを提案。大規模データセットで未見被験者への95%の成功率を達成。
- MemoryVLA: ロボット操作のための視覚-言語-行動モデルにおける知覚・認知記憶VLA2025/8/1
人間の作業記憶と海馬の記憶機構に着想を得て、知覚・認知トークンを記憶バンクに蓄え再利用するVLAモデルを提案し、長期的な依存を含む操作タスクで従来手法を上回る成功率を達成した。
- 人間の意図を考慮したコンプライアンスによる安全なロボット超音波スキャンのための統合対話制御フレームワークマニピュレーション2024/11/1
超音波スキャンロボットにおいて、人間の意図的な介入と意図しない衝突の両方に対応し、滑らかに遷移する統合制御フレームワークを提案した。
- DeeR-VLA:ロボット実行のためのマルチモーダル大規模言語モデルの動的推論VLA2024/11/1
ロボットの計算資源制約に対応するため、状況に応じてMLLMの活性化サイズを自動調整する動的早期終了フレームワークを提案し、CALVINベンチマークで効率と性能を両立させた。
- 心臓コパイロット:ワールドモデルによる心エコー検査の自動プローブガイダンス医療ロボティクス2024/6/1
心エコー検査において、経験の浅い検査技師を支援するため、データ駆動型ワールドモデル「Cardiac Dreamer」を用いてリアルタイムのプローブ移動ガイダンスを提供するシステムを提案した。
- Augmenting Unsupervised Reinforcement Learning with Self-Reference2023/11/1
- Multi-Modal Interaction Control of Ultrasound Scanning Robots with Safe Human Guidance and Contact Recovery2023/2/1
- Learning to Estimate 3-D States of Deformable Linear Objects from Single-Frame Occluded Point Clouds2022/10/1