Cong Han
収録論文 2本 ・ フィジカルAI/ロボット学習
音声映像生成VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Vorch-Omni: 視覚と聴覚のマルチタスク統合オーケストレーション音声映像生成2026/8/6
音声と映像の生成・編集・参照合成を単一モデルで統一的に扱うマルチタスクフレームワークを提案し、条件付けマスクとタスク識別子により多様な入出力構成を柔軟に処理する。
- AIR: MLLMにおけるコードを用いた適応的インターリーブ推論VLA2026/6/22
マルチモーダル大規模言語モデルに、コードを介した数値計算タスクの適応的推論能力を強化学習で付与する手法を提案。