Tianfan Xue
Shanghai AI Laboratory
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- InternW0-Δ: 予測ダイナミクスと行動を橋渡しする20K時間超のオープンデータによるワールドアクションモデルVLA2026/9/25
視覚ダイナミクスと行動生成を統合したワールドアクションモデルを、20,000時間超の異種オープンデータで事前学習し、シミュレーションと実機で従来手法を上回る性能を達成した。
- InternW0: 効率的な実世界インタラクションのための基盤的物理世界モデル世界モデル2026/9/23
上海AI Labが、視覚予測とロボット制御を非対称なvideo-actionアーキテクチャで統合した物理世界モデルInternW0を提案。約7,200時間のデータで学習し、化学合成やピペッティングなどの実世界タスクで評価した。
- RoboSynChallenge: 合成操作スキルの一般化による実世界の巧みな操作の習得操作/ベンチマーク2026/8/1
実世界データ不足を補うため、大規模合成データ生成と標準化された実ロボット評価を統合した操作ポリシーの一般化を競うベンチマークを提案し、未見の実環境での評価を行う。
- 空間制御可能な多視点屋内シーン再照明のための分離照明事前分布再照明2026/7/9
屋内シーンの再照明を、事前学習済み拡散モデルから照明パレットを抽出する段階と、粗い3D形状から目標照明条件を明示的にマッピングする段階に分離し、空間制御と多視点一貫性を両立するフレームワークを提案した。
- ワールドモデルの定義とロードマップワールドモデル2026/7/7
AIの各分野で使われる「ワールドモデル」の定義を明確化し、技術的側面と開発段階のロードマップを提案する視点論文。
- InstantRetouch: バイラテラル空間による効率的で忠実度の高い指示追従画像レタッチ画像編集2026/6/3
言語指示による画像レタッチを、拡散モデルの反復生成ではなくバイラテラルグリッド操作で実現し、忠実度と効率を両立した手法を提案。
- ReactiveBFM: 汎用ヒューマノイド全身制御に向けたリアクティブ閉ループ動作計画ヒューマノイド制御2026/6/1
既存の行動基盤モデルは事前定義された動作しか実行できず環境変化に弱いため、生成型プランナーと追跡制御を閉ループで統合し、曝露バイアスを軽減するリアクティブな全身制御フレームワークを提案した。
- Imagine2Real: ビデオ生成事前知識によるヒューマノイドと物体のゼロショット対話の実現ヒューマノイド操作2026/5/1
3Dデータ不足を補うため、ビデオ生成モデルから得た4D点軌跡と少数の重要点追跡を用いて、幾何モデル不要でヒューマノイドと物体の対話動作をゼロショットで生成するフレームワークを提案した。
- GLEAM: 複雑な3D屋内環境における能動的マッピングのための汎化可能な探索方策の学習能動的マッピング/探索2025/5/1
合成・実スキャンの1,152シーンからなる大規模ベンチマークGLEAM-Benchを構築し、意味表現と長期目標・ランダム化戦略で未知の複雑シーンでも高被覆・高精度に探索する汎化可能な能動的マッピング方策を提案した。
- FuseGrasp: 透明物体把持のためのレーダー・カメラ融合システムマニピュレーション2025/2/1
ミリ波レーダーとカメラを融合し、透明物体の深度補完と把持成功率を向上させるシステムを提案。大規模RGB-Dデータでの事前学習と自作RGB-D-Radarデータでの微調整により、透明物体の材質識別も可能にした。
- GenNBV: 能動的3D再構成のための汎化可能な次善視点ポリシー能動的3D再構成2024/2/1
強化学習を用いて、任意の視点から撮影できるドローンの次善視点ポリシーを学習し、未知の大規模物体でも高い被覆率で3D再構成を自動化した。
- EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI2023/12/1