Zequn Jie
収録論文 4本 ・ フィジカルAI/ロボット学習
音声映像生成VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Vorch-Omni: 視覚と聴覚のマルチタスク統合オーケストレーション音声映像生成2026/8/6
音声と映像の生成・編集・参照合成を単一モデルで統一的に扱うマルチタスクフレームワークを提案し、条件付けマスクとタスク識別子により多様な入出力構成を柔軟に処理する。
- RoboTron-Drive:自動運転のためのオールインワン大規模マルチモーダルモデルVLA2024/12/1
画像や多視点動画を入力とし、知覚・予測・計画を含む多様な自動運転タスクを単一モデルで実行する汎用大規模マルチモーダルモデルを提案し、複数ベンチマークで最先端性能を達成した。
- FastPillars: A Deployment-friendly Pillar-based 3D Detector2023/2/1
- Modeling Varying Camera-IMU Time Offset in Optimization-Based Visual-Inertial Odometry2018/10/1