Zhuofan Zong
CUHK MMLab
収録論文 3本 ・ フィジカルAI/ロボット学習
音声対話自動運転自動運転/世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MultiTalk: 長時間・多人数・バイリンガル会話への全二重音声モデルの拡張音声対話2026/9/29
長時間・多人数・英中バイリンガルの全二重音声対話モデルを実現するため、57.6k時間の合成データセットと実録音ベースの評価ベンチマークを構築した研究。
- LMGenDrive: マルチモーダル理解と生成的ワールドモデルを統合したエンドツーエンド運転自動運転2026/4/1
本論文は、LLMベースのマルチモーダル理解と生成的ワールドモデルを統合した初のエンドツーエンド自動運転フレームワークLMGenDriveを提案し、将来の運転ビデオと制御信号を同時生成することで、長尾・オープンワールドシナリオへの一般化を向上させる。
- DrivingGen: 自動運転のための生成ビデオ世界モデルの包括的ベンチマーク自動運転/世界モデル2026/1/1
自動運転向けの生成ビデオ世界モデルを評価する初の包括的ベンチマークDrivingGenを提案し、多様なデータセットと新指標で14の最先端モデルを比較した。