Tongtong Cao
Department of Foundation Model, 2012 Labs
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 空間グラフティング:フローマッチングロボットポリシーのための3D特徴の接地VLA2026/9/28
凍結した3D再構成特徴をロボット相対のメートル幾何に結びつけ、クロスアテンションでフローマッチング行動エキスパートに注入する軽量モジュールを提案。複数のVLA/WAMや実機で汎用的に性能を向上させた。
- Faster-WAM: 世界行動モデルに深い行動モジュールは必要か?VLA2026/8/1
ビデオ世界モデルと行動予測を組み合わせたWorld Action Models (WAMs)の計算負荷を減らすため、事前学習済みビデオTransformerを表現ハブとし、軽量な出力ヘッドをドッキングする新しい設計原理DoTを提案し、単層行動ヘッドを30層ビデオバックボーンに接続したFaster-WAMを実装。低遅延で競争力のある性能と汎化を実証した。
- KAM-WM: 潜在世界モデルからの運動学的アフォーダンスマップによるロボット操作マニピュレーション2026/7/1
凍結したビデオ世界モデルから粗い方向性の相互作用手がかりを抽出し、拡散ポリシーを条件付ける運動学的アフォーダンスマップを生成するフレームワークを提案。LIBEROとRoboTwin2.0で高い成功率を達成した。
- RoboHarness: メモリ駆動による異種ロボットポリシーの統合オーケストレーションによる長期的計画長期計画/ポリシー統合2026/7/1
複数の異なるロボット制御システム(VLA、RL、TAMPなど)を再利用可能なスキルとして統合し、実行メモリとオンライン証拠を用いて能力境界を推定し、長期的タスクを能力に応じて分解・ルーティングするフレームワークを提案。ポリシー切り替え時の分布ミスマッチをメモリブリッジで緩和し、ゼロショット長期計画とOOD堅牢性を向上させた。
- 意味論と幾何学的接地の分離:言語条件付き模倣学習のための空間的視覚プロンプト模倣学習2026/6/1
言語条件付きロボット操作において、意味推論と空間制御を分離し、視覚基盤モデルで生成した空間的視覚プロンプトを行動生成器に注入する新しいアーキテクチャSVP-ILを提案。少ないデモデータでも高精度を達成した。
- RePO-VLA: 回復駆動型ポリシー最適化による視覚言語行動モデルVLA2026/5/1
成功軌跡のみの模倣学習では実行時のずれに対処できないため、失敗軌跡を活用して回復行動を学習するフレームワークを提案。成功・回復・失敗の軌跡に役割を割り当て、価値関数で進捗を評価し、ポリシーを改善する。
- 予測に基づくサブゴール生成による長期タスク解決のためのAnticipation-VLAVLA2026/5/1
長期にわたるロボットタスクを解決するため、タスクの進行に応じて適応的にサブゴールを生成する予測モデルを導入し、階層型VLAモデルを提案した。
- ロボットポリシー学習における視点汎化のための効率的なカメラポーズ拡張VLA2026/3/1
3Dガウススプラッティングを用いて、少数の非校正画像から高品質な3Dシーンを再構成し、多様な合成視点を生成することで、視覚運動ポリシーの未知視点への汎化性能を向上させる手法を提案した。
- 世界行動モデルはVLAより汎化するのか?ロバスト性の比較研究VLA2026/3/1
VLAと世界行動モデル(WAM)をLIBERO-PlusやRoboTwin 2.0-Plusで視覚・言語の摂動下に比較し、WAMの高いロバスト性を示した研究。
- H-WM:階層型ワールドモデルによるロボットのタスク・動作計画タスク・動作計画2026/2/1
論理空間と視覚空間の状態遷移を統合的に予測する階層型ワールドモデルを提案し、長期的なロボットタスクの計画と実行を安定化させる。
- CAPE: 近接モード拡張による文脈認識拡散ポリシーと衝突回避マニピュレーション2025/11/1
拡散ポリシーに文脈認識の事前分布と誘導を組み合わせ、推論時に軌道分布のモードを反復的に拡張することで、未知の混雑環境でも衝突を避けつつ目標に到達する軌道を生成する手法を提案。
- UnPose: 不確実性誘導拡散事前分布によるゼロショット姿勢推定姿勢推定2025/8/1
事前学習済み拡散モデルの3D事前分布と不確実性推定を活用し、CADモデル不要で新規物体の6D姿勢推定と3D再構成をゼロショットで行うフレームワークを提案。
- Mem2Ego: グローバル記憶と自己中心視点を統合した長期的身体性ナビゲーションナビゲーション2025/2/1
グローバルな記憶モジュールからタスク関連情報を適応的に取得し、エージェントの自己中心的な視覚入力と統合することで、長期的な物体ナビゲーションの性能を向上させるVLMベースのフレームワークを提案した。
- HIPPo: 画像から3Dへの事前分布を活用したモデルフリーゼロショット6D姿勢推定6D姿勢推定2025/2/1
拡散モデルによる画像から3Dメッシュ生成とオンライン観測の統合により、CADモデルや参照画像なしで未知物体の6D姿勢を推定・追跡するフレームワークを提案。
- SpatialCoT:座標アライメントと思考連鎖による身体性タスク計画の空間推論強化VLA2025/1/1
視覚言語モデルの空間推論能力を高めるため、座標の双方向アライメントと思考連鎖に基づく空間グラウンディングを組み合わせたSpatialCoTを提案し、ナビゲーションとマニピュレーションのタスクで従来手法を上回る性能を示した。
- ET-Plan-Bench: 基盤モデルによる時空間認知に向けた身体性タスクレベル計画ベンチマークタスク計画2024/10/1
LLMによる身体性タスク計画を評価するベンチマークET-Plan-Benchを提案し、空間・時間・因果理解を要するタスクで最先端モデルの性能が大きく低下することを示した。