Shilong Liu
Princeton University
収録論文 8本 ・ フィジカルAI/ロボット学習
視覚グラウンディング世界モデルVLAマニピュレーション任意点追跡点追跡
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GroundAnything: 並列デコーディングと高精度視覚グラウンディングをフラッシュ速度で両立視覚グラウンディング2026/9/30
拡散モデルによる並列デコーディングで視覚グラウンディングを高速化し、4Bモデルで同規模の最先端性能を達成した研究。
- DeepJEPA:内部計算を適応的に配分する世界モデルプランナー世界モデル2026/9/30
各遷移の計算深さをテスト時スケーリング軸として扱い、意思決定に重要な遷移だけを深く推論する重み共有型の世界モデルを提案し、固定深さのプランナーと同等以上の性能を少ない計算量で実現した。
- GroundingPI:視覚プリミティブで物理知能に挑むグラウンディング基盤モデルVLA2026/9/30
点やボックスを量子化座標として生成する4Bのグラウンディング基盤モデルを提案し、ロボット操作や自動運転の視覚バックボーンとして性能を向上させた。
- 汎用ロボットポリシーのためのシンプルなエージェント記憶マニピュレーション2026/9/29
凍結した汎用ロボットポリシーに、訓練不要の記憶層を追加し、履歴に依存する操作タスクの成功率を大幅に向上させた。
- 未来予測を超えて:ロボット制御のための生成的適応としてのデノイジングVLA2026/9/23
事前学習済み生成DiTを制御に適応させる際、未来の視覚予測は不要であり、現在の観測をデノイズする軌跡そのものが制御への有効なインターフェースとなることを示し、学習効率と性能を両立する手法NowWAMを提案した。
- LocateAnything: 並列ボックスデコードによる高速・高品質な視覚言語グラウンディングVLA2026/5/1
視覚言語モデルによる物体検出・グラウンディングを、ボックス座標を並列に一度でデコードする方式に変え、推論速度と精度を両立させた。
- TAPTRv2: 注意に基づく位置更新で任意点追跡を改善任意点追跡2024/7/1
Transformerベースの任意点追跡手法TAPTRを改良し、コストボリュームへの依存を排除する注意ベースの位置更新(APU)を導入して精度を大幅に向上させた。
- TAPTR: 検出としてのTransformerによる任意点追跡点追跡2024/3/1
点追跡を物体検出・追跡と類似とみなし、DETR風のTransformerで各追跡点をクエリとして扱うシンプルで高性能な任意点追跡フレームワークを提案。