Haibin Huang
Institute of Artificial Intelligence (TeleAI), China Telecom
収録論文 9本 ・ フィジカルAI/ロボット学習
VLA世界モデル映像生成シーン生成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FutureDuet: 未来予測監督における観測アクセスの分離VLA2026/9/28
ロボットの行動生成において、メインカメラと手首カメラで異なる未来予測目標を与えることで、精密な操作タスクの成功率を向上させた研究。
- TourPhysics: 物理を世界モデルに導入し、単一画像からの探索と操作を実現世界モデル2026/9/4
単一画像と物理設定から初期化し、シミュレーションとビデオ生成を組み合わせて、長期的な物理的一貫性を保ちながら探索と操作を行うオンラインフレームワークを提案する。
- CineWeaver: トレーニング不要で参照制御可能なマルチショット長編映像生成による映画的ストーリーテリング映像生成2026/7/29
事前学習済みの動画拡散モデルを用いて、再学習なしで複数ショットからなる長編映像を生成する統一フレームワークを提案。位置エンコーディングとアテンション操作で時間的連続性を断ち、ショットごとの参照制御と長期記憶機構を導入した。
- 世界行動モデルから具現化された脳へ:オープンワールド物理知能へのロードマップVLA2026/7/1
本論文は、物理世界で推論・行動できる汎用AIの実現に向けて、世界行動モデル(WAM)の進化を概観し、モデル役割・標準化・システム構成の3つのギャップを整理した上で、具現化された脳を中心とした共進化ロードマップを提案している。
- PhysOmni: 単一画像からの物理基盤マルチオブジェクトシーン生成とリアルタイムインタラクションシーン生成2026/5/19
単一画像から物理的に一貫性のある3Dシーンを再構成し、リアルタイムで操作可能なビデオを生成するトレーニング不要のフレームワークを提案。
- Towards Self-Supervised Category-Level Object Pose and Size Estimation2022/3/1
- FFB6D: A Full Flow Bidirectional Fusion Network for 6D Pose Estimation2021/3/1
- SAM: Squeeze-and-Mimic Networks for Conditional Visual Driving Policy Learning2019/12/1
- PVN3D: A Deep Point-wise 3D Keypoints Voting Network for 6DoF Pose Estimation2019/11/1