Tonghua Su
収録論文 5本 ・ フィジカルAI/ロボット学習
ビデオ生成ナビゲーションVLA/計画VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CogPortrait: 階層的エージェント計画による肖像アニメーションの微細な眼部制御ビデオ生成2026/5/27
高レベルなラベルから眼部の微細な動きを制御する肖像アニメーション生成フレームワークを提案。MLLMエージェントによるキーポイント計画とDiTベースのビデオ生成を組み合わせ、思考や眠気などの感情を超えた状態も表現可能。
- WorldMAP: 生成的世界モデルを用いた視覚言語ナビゲーション軌道予測のブートストラップナビゲーション2026/4/1
生成的世界モデルが生成した未来映像から教師信号を作り、視覚言語入力から直接ナビゲーション軌道を予測する軽量モデルを訓練する教師-学生フレームワークを提案した。
- GaLa: ハイパーグラフ誘導型視覚言語モデルによる手続き計画VLA/計画2026/4/1
画像中の物体間の暗黙的な空間関係や機能的意味をハイパーグラフで表現し、視覚言語モデルの推論に組み込むことで、複雑なシーンでの手続き計画の精度を向上させるフレームワークを提案した。
- 世界の連鎖:潜在運動における世界モデル思考VLA2026/3/1
視覚言語行動モデルに、潜在運動表現を用いた世界モデルの時間的推論を統合し、効率的なロボット学習を実現する新しいパラダイムを提案した。
- HMVLA: 双曲空間マルチモーダル融合による視覚-言語-行動モデルVLA2026/2/1
視覚・言語・行動モデルにおいて、画像と言語の階層構造を双曲空間に埋め込んで意味的整合を図り、MoE機構で効率化するフレームワークを提案した。