Yuki Mitsufuji
Sony Group Corporation
収録論文 6本 ・ フィジカルAI/ロボット学習
所属歴(論文より): Sony Group Corporation(〜2026) / Sony Corporation of America(〜2026)
世界モデル生成AI・インタラクティブアート全身マニピュレーションVLA動作生成動画音声生成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 何を思い出すべきかを学習する:世界モデルのための適応的マルチキューエピソード記憶世界モデル2026/9/28
世界モデルの予測に役立つ過去の観測を、未来を考慮した予測損失で学習した検索器が、時間・姿勢・視覚・音声などの複数手がかりから自動選択して想起する手法FARを提案。
- 通過:AI生成音と再構成された時空間を巡る終わりなき旅生成AI・インタラクティブアート2026/9/23
単一のモノレール車窓映像を時空間ボリュームとして再構成し、視聴者の存在に応じて非線形に再サンプリングすることで、終わりのない風景とAI生成音を生み出すインタラクティブな視聴覚インスタレーション。
- LYRIC: 言語駆動の物理ベース全身接触リッチ物体インタラクション制御全身マニピュレーション2026/9/17
自由形式の言語指示と目標物体位置から、物理シミュレーション上のキャラクタが全身で接触を伴う物体操作を行うフローマッチング制御器を提案。プランナと行動生成器に分解し、専門家軌道の追従と強化学習の微調整で高い成功率を達成した。
- DynaVieW: スキーマ誘導型ワールドモデリングによる階層的視覚ダイナミクスの理解VLA2026/7/5
マルチモーダルLLMが動画や複数画像の時間的変化を体系的にモデル化できない問題に対し、動的スキーマに基づくワールドモデルDynaVieWを提案。状態遷移系列を学習し、視覚ダイナミクスの予測とシミュレーションを実現する。
- Odoriko: 身体形状を考慮したマルチモーダル拡散による人間動作生成フレームワーク動作生成2026/6/1
性別や体型などの身体形状情報を動作生成に直接反映する、テキスト・音楽・動画を統合した初のマルチモーダル動作生成フレームワークを提案した。
- SoundReactor: フレーム単位のオンライン動画音声生成動画音声生成2025/10/2
未来のフレームを見ずに動画からリアルタイムで音声を自己回帰生成するフレーム単位オンラインV2Aタスクを提案し、因果的Transformerと拡散・一貫性微調整で低遅延・高品質なステレオ音声を実現した。