Jinkun Hao
収録論文 7本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 配置と可動性を超えて:身体化インタラクションのための使用駆動型コードシーンシーン生成2026/8/19
室内シーン生成において、物体の配置や可動性だけでなく、機能的な使用法をモデル化するフレームワークRoomWrightを提案。各アンカーをタスク中心とし、必要な物体とそのアフォーダンスを推論し、コードエージェントがインタラクションをトリガー・条件・効果のルールにコンパイルして因果関係を更新する。
- MetaWorld: 単一視点ビデオデータからのマルチエージェントビデオワールドモデルのスケーリングビデオ生成2026/6/1
単一視点のビデオから、複数エージェントが共有する3D空間で一貫したビデオを生成するマルチエージェントビデオワールドモデルを提案した。カメラ軌跡分解とクロスアテンションによる世界状態整合で、データ不足と視点間の整合性問題を解決する。
- コードとしての部屋:エージェント的コード合成による俯瞰画像からの3D部屋生成3D生成2026/5/18
俯瞰画像から3D部屋を生成するため、MLLMベースのエージェントがBlenderコードを段階的に合成するフレームワークを提案。記憶モジュールで文脈忘却を防ぎ、専用ベンチマークで有効性を検証した。
- STABLE: セマンティクスと物理の二重システムによるシミュレーション対応テーブルトップレイアウト生成シーン生成2026/5/1
タスク指示からシミュレーション可能なテーブルトップシーンを生成するため、意味推論と物理補正を交互に行う二重システムを提案した。
- EgoSim: 身体化インタラクション生成のための自己中心的世界シミュレータシミュレーション/自己中心視点2026/4/1
自己中心視点の動画から3Dシーン状態を更新しながら、空間的に一貫したインタラクション動画を生成する閉ループ型シミュレータを提案。大規模単眼動画からのデータパイプラインと低コスト収集システムも導入。
- RoboVIP: 視覚的アイデンティティプロンプティングによる多視点動画生成でロボットマニピュレーションを強化マニピュレーション2026/1/1
ロボット操作データを拡張するため、見本画像を条件に多視点で時間的に一貫した動画を生成する手法を提案し、模擬環境と実機で方策性能を向上させた。
- MesaTask: 3D空間推論によるタスク駆動型卓上シーン生成シーン生成2025/9/1
タスク指示から物理的に妥当な卓上シーンを生成するため、空間推論チェーンとDPOで強化したLLMフレームワークMesaTaskを提案し、大規模データセットMesaTask-10Kを構築した。