Zhenhao Zhang
収録論文 4本 ・ フィジカルAI/ロボット学習
手と物体のインタラクション合成3Dレイアウト生成VLA器用操作/VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PhotoHOI: 単一RGB写真からの3D手と物体のインタラクション合成手と物体のインタラクション合成2026/8/3
単一のRGB写真と自然言語指示から、3Dの手と物体のインタラクションシーケンスを合成する新しい手法を提案。視覚言語モデルでタスクを解析し、接触と把握の事前知識を活用して、実写画像や未知の物体にも一般化する。
- Roomer: 反射的オブジェクト接地モデル編集と修復による3D室内レイアウト合成3Dレイアウト生成2026/8/1
既存の室内レイアウト生成器が残す局所的な違反(衝突、はみ出し、開口部の妨害、動線の遮断)を、オブジェクト単位の修復問題として捉え、視覚言語モデルによる計画と決定的検証を組み合わせて局所編集する修復フレームワークを提案した。
- Event-VLA: アクション条件付きイベント融合によるロバストな視覚言語行動モデルVLA2026/6/1
照明変化に弱い既存のVLAモデルに対し、イベントカメラのストリームをアクションクエリ経由で融合するEvent-VLAを提案し、低照度下での操作成功率を向上させた。
- UniHM: 視覚言語モデルによる統合器用手操作器用操作/VLA2026/3/1
自由形式の言語指示に基づいて物理的に実現可能な器用な手の操作を生成する統合フレームワークを提案。異なる手の形態を共通コードブックにマッピングし、人間の物体操作データのみで学習することで、実世界の遠隔操作データなしに汎用性の高い操作シーケンスを生成する。