Danyang Zhang
収録論文 2本 ・ フィジカルAI/ロボット学習
画像編集/VLM動画推論
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- IEA: アマチュア向け対話型画像編集エージェント - 3段階のマルチタスクアライメントによる実現画像編集/VLM2026/6/6
パラメータ化された編集ツールを明示的かつ解釈可能なアクション空間で操作する対話型画像編集エージェントIEAを提案し、3段階のマルチタスク学習で訓練する。
- 超大規模動画推論スイート動画推論2026/2/1
200種類の推論タスクと100万本以上の動画からなる大規模データセットVBVRと、ルールベースで検証可能な評価ベンチマークVBVR-Benchを構築し、動画推論のスケーリング則と未見タスクへの汎化の兆候を示した。