Philip Torr
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 視覚品質を超えて:ワールドアクションモデルによるテスト時計画の研究VLA2026/9/21
ワールドアクションモデルが生成する行動と予測結果を用いた計画の可能性を検証し、視覚品質や物理整合性に基づく選択では限界があることを示した研究。
- VBVR-Pro: ネイティブ視覚推論のためのスケーラブルで検証可能なスイート視覚推論2026/8/26
視覚生成を推論の媒体として扱うネイティブ視覚推論の研究を進めるため、300の手続き生成タスクからなる閉ループテストベッドVBVR-Proを導入し、検証可能な報酬スコアラと制御されたモダリティ比較を提供する。
- CreFlow: スパース報酬の身体化ビデオ拡散強化学習のための修正リフロービデオ生成RL2026/5/14
ビデオ生成モデルを強化学習で微調整する際、線形時相論理に基づく報酬モデルと、報酬関連領域のみを更新する新しい枠組みを提案し、操作タスクの成功率を向上させた。
- ロボット学習のためのワールドモデル:包括的サーベイサーベイ2026/5/1
ロボット学習におけるワールドモデルの役割と進化を体系的にレビューし、ポリシー学習、シミュレーション、評価への応用や課題を整理したサーベイ論文。
- ELAN4D: 身体中心の4D監視による視覚言語行動モデルのプラグアンドプレイ適応VLA2026/5/1
ロボットのキーポイントの未来の3D軌跡を予測する補助分岐をVLAモデルに追加し、外乱下での汎化性能を向上させるフレームワークを提案した。
- ActionParty: 生成ビデオゲームにおけるマルチサブジェクト行動バインド世界モデル/マルチエージェント2026/4/2
ビデオ拡散モデルで複数のエージェントを同時に制御するための世界モデルを提案し、各被写体の状態トークンを導入して行動と被写体の対応を明確化した。Melting Potベンチマークで最大7プレイヤーを同時制御できる初のビデオ世界モデルを実証した。
- ComSim: 構成シミュレーションによるスケーラブルな実世界ロボットデータ生成sim2real2026/4/1
古典的シミュレーションとニューラルシミュレーションを組み合わせ、少量の実データから多様な実世界データを生成するハイブリッド手法を提案。sim2realギャップを低減し、実世界でのポリシー学習成功率を向上させる。
- エゴから世界へ:強化学習による身体化システムにおける協調的空間推論空間推論2026/3/1
複数のエージェントが異なる視点から環境を認識する問題を扱い、視覚言語モデルが視点を融合して空間推論を行うためのベンチマークE2Wと、強化学習を用いたフレームワークCoRLを提案した。
- TouchGuide: 触覚ガイダンスによる視覚運動ポリシーの推論時ステアリング触覚2026/1/1
事前学習済みの視覚運動ポリシーの生成過程に、触覚に基づく接触物理モデルで介入し、接触を伴う繊細な操作を高精度化する手法を提案。低コストな触覚データ収集系TacUMIも開発した。
- マルチエージェントロボットシステム(MARS)チャレンジの進歩と革新マルチエージェント2026/1/1
NeurIPS 2025ワークショップで開催されたMARSチャレンジを紹介し、VLMを用いたマルチエージェントの計画とロボットマニピュレーションの制御という2領域での取り組みを概説した論文。
- VIKI-R: 強化学習による身体性マルチエージェント協調の実現マルチエージェント協調2025/6/1
視覚言語モデルを微調整と強化学習で訓練し、異なる身体を持つ複数エージェントの視覚に基づく協調を可能にするフレームワークVIKI-Rと、その評価用ベンチマークVIKI-Benchを提案。
- 実世界のドローン動画からカメラ移動制御を学習ビデオグラフィ2024/12/1
オンライン動画から99kのカメラ軌道を自動抽出し、自己回帰トランスフォーマーDVGFormerで次フレームのカメラ移動を予測する手法を提案。
- Select2Plan: VQAとメモリ検索による訓練不要のICLベース計画ナビゲーション2024/11/1
訓練済みの視覚言語モデル(VLM)を活用し、追加学習なしでロボットの高レベル経路計画を行うフレームワークを提案。単眼カメラのみで一人称・三人称視点のナビゲーションに対応する。
- Let's Take This Online: Adapting Scene Coordinate Regression Network Predictions for Online RGB-D Camera Relocalisation2019/6/1