Huayi Zhou
The Chinese University of Hong Kong, Shenzhen
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Praxis: 一人称視点動画から物理的相互作用の事前知識を蒸留し、汎用的な全身マニピュレーションを実現全身マニピュレーション2026/9/25
一人称視点の実演動画から物理的相互作用の事前知識を抽出し、視覚言語誘導ナビゲーション・姿勢キャリブレーション・器用な全身操作を組み合わせることで、タスクごとの再学習なしに多様な物体操作を可能にするフレームワークを提案。
- Navi-Agent: 位置推定不要の単眼ナビゲーションエージェントVLA2026/9/17
座標や幾何学的な自己位置推定を使わず、視覚観測と移動履歴からナビゲーション用トポロジーを構築し、ゼロショットで長期的な視覚言語ナビゲーションを実現するエージェントを提案した。
- VLBiMan++: 視覚言語アンカーによるワンショット両腕マニピュレーションの汎化境界の拡張マニピュレーション2026/9/13
単一の人間デモンストレーションから両腕ロボットの操作スキルを抽出し、視覚言語に基づく幾何適応で再学習なしに多様なタスク・物体・環境・機体へ汎化させるフレームワークを拡張した。
- Dexterity-BEV: 3D世界と行動の整合による汎用ロボットポリシー学習操作学習2026/6/1
2D基盤モデルの限界を克服するため、カメラ校正と深度を用いて2D入力を3D頂点マップに変換し、BEV座標系で入力と行動を整合させることで、視点変化に頑健で汎用的な操作ポリシーを学習する手法を提案した。
- 反応から予測へ:エージェント型タスクグラフによるロボット操作の予防的障害回復マニピュレーション2026/5/1
操作タスクを有向タスクグラフでモデル化し、実行前に予測的リカバリ分岐を追加することで、障害発生時に再計画なしで即座に対応するエージェントシステムAgentChordを提案した。
- 実世界の一例から双腕操作の大規模デモンストレーションを合成するフレームワークマニピュレーション2025/12/1
実世界の1つのデモンストレーションから、接触の多い双腕操作タスクの多様で実行可能なデモを大量に合成する手法を提案し、新規物体姿勢や形状への汎化、クロスエンボディメント転移を実現した。
- BiNoMaP: カテゴリーレベルの両腕非把持マニピュレーションプリミティブの学習マニピュレーション2025/9/1
一人称視点の動画から両腕の非把持動作(押す・つつく・回す・包むなど)を抽出し、幾何学的に最適化してカテゴリーレベルの汎化と異なるロボットへの転移を可能にするRL不要のフレームワークを提案。
- VLBiMan: 視覚言語基盤による一発実演からの汎化可能な両腕ロボット操作マニピュレーション2025/9/1
人間の1回の実演をタスク分解して不変スキルを抽出し、視覚言語モデルで環境変化に適応させることで、再学習なしに多様な両腕操作タスクへ汎化するフレームワークを提案。
- GAT-Grasp: ジェスチャー駆動型アフォーダンス転移によるタスク指向ロボット把持マニピュレーション2025/3/1
人間の手ジェスチャーを手がかりに、大規模な人間-物体インタラクション動画から把持知識を検索・転移し、未知物体や雑然とした環境でもタスクに適した把持姿勢をゼロショットで生成するフレームワーク。
- 一度の教示で両腕ロボット操作を学習:動画デモからのワンショット模倣模倣学習2025/1/1
人間の両手動作を1回のステレオ動画から抽出し、両腕ロボットの多様な長期的タスクを学習する手法YOTOを提案。