Salman Khan
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 履歴行動軌跡からのスキル学習:世界行動モデルのための行動経験辞書VLA2026/9/30
過去の行動軌跡を共有埋め込みとして辞書化し、操作タスク間でスキルを再利用できるようにした世界行動モデルを提案。
- 現代のVLMにおける強力な画素レベル画像改ざん検出のためのシンプルなドメイン一般化手法画像改ざん検出2026/7/20
現代のVLMによる画像編集に対応するため、バランスの取れたミニバッチサンプリングと後期注入戦略を用いたシンプルで効果的なドメイン一般化トレーニングフレームワークを提案し、画素レベルの改ざん検出性能とOOD堅牢性を大幅に向上させた。
- WorldCache: コンテンツ認識キャッシングによるビデオワールドモデルの高速化ビデオ生成/推論高速化2026/3/23
拡散トランスフォーマーを用いたビデオワールドモデルの推論を高速化するため、動き適応型しきい値やブレンディング・ワーピングによる特徴再利用を導入したトレーニング不要のキャッシング手法を提案。
- 見て、計画して、巻き戻す:進捗認識型視覚言語行動モデルによる堅牢なロボット操作マニピュレーション2026/3/1
ロボット操作のタスク進捗を明示的なマイルストーンで測定し、失敗時に回復可能な状態へ巻き戻すことで堅牢性を高める、進捗認識型の視覚言語行動フレームワークSPRを提案した。
- PixelVLA:視覚言語行動モデルにおけるピクセルレベル理解の推進VLA2025/11/1
ピクセル単位のシーン理解とテキスト・画像のマルチモーダル指示に対応したVLAモデルを提案し、大規模ピクセル注釈データセットで学習することで、低コストながら操作成功率を大幅に向上させた。
- 基盤モデルは段階的な身体性推論においてどれほど優れているか?VLA2025/9/1
身体性環境での段階的推論能力を評価するFoMERベンチマークを提案し、主要な大規模マルチモーダルモデルの性能と限界を分析した。
- トラッキング情報を活用した大規模マルチモーダルモデルによる運転シーン理解VLA2025/3/1
自動運転向けLMMに3Dトラッキング情報を追加入力し、時空間理解を強化する手法を提案。DriveLM-nuScenesで精度9.5%向上を達成。
- DriveLMM-o1: 自動運転シナリオ理解のための段階的推論データセットと大規模マルチモーダルモデルVLA2025/3/1
自動運転の知覚・予測・計画を段階的に推論するVQAデータセット(学習18k・テスト4k超)とベンチマークを構築し、そのデータで微調整した大規模マルチモーダルモデルを提案した論文。
- Open3DTrack: オープンボキャブラリ3D多物体追跡に向けて3D追跡2024/10/1
自動運転向けの3D多物体追跡を、事前定義されたカテゴリに縛られず未知の物体にも対応できるオープンボキャブラリ設定へと拡張し、その手法とデータセット分割を提案した論文。
- ROAD-R: The Autonomous Driving Dataset with Logical Requirements2022/10/1
- ROAD: The ROad event Awareness Dataset for Autonomous Driving2021/2/1
- Visual Affordance and Function Understanding: A Survey2018/7/1