Fahad Shahbaz Khan
収録論文 8本 ・ フィジカルAI/ロボット学習
VLA位置推定ビデオ生成/推論高速化把持3D追跡
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 履歴行動軌跡からのスキル学習:世界行動モデルのための行動経験辞書VLA2026/9/30
過去の行動軌跡を共有埋め込みとして辞書化し、操作タスク間でスキルを再利用できるようにした世界行動モデルを提案。
- HorizonNet: 視覚による地形ナビゲーションのための地平線検出位置推定2026/8/31
この論文は、沿岸域や群島で動作する無人水上艇の位置推定を、360度パノラマ画像から地平線を抽出し、DEMデータと相関を取ることで行う手法を提案している。
- WorldCache: コンテンツ認識キャッシングによるビデオワールドモデルの高速化ビデオ生成/推論高速化2026/3/23
拡散トランスフォーマーを用いたビデオワールドモデルの推論を高速化するため、動き適応型しきい値やブレンディング・ワーピングによる特徴再利用を導入したトレーニング不要のキャッシング手法を提案。
- 基盤モデルは段階的な身体性推論においてどれほど優れているか?VLA2025/9/1
身体性環境での段階的推論能力を評価するFoMERベンチマークを提案し、主要な大規模マルチモーダルモデルの性能と限界を分析した。
- RAGNet:汎用把持に向けた大規模推論ベースのアフォーダンスセグメンテーションベンチマーク把持2025/7/1
人間の指示に基づく物体のアフォーダンスを大規模に学習・評価するためのベンチマークRAGNetと、それを用いた把持フレームワークAffordanceNetを提案し、実世界での汎化性能を示した。
- トラッキング情報を活用した大規模マルチモーダルモデルによる運転シーン理解VLA2025/3/1
自動運転向けLMMに3Dトラッキング情報を追加入力し、時空間理解を強化する手法を提案。DriveLM-nuScenesで精度9.5%向上を達成。
- DriveLMM-o1: 自動運転シナリオ理解のための段階的推論データセットと大規模マルチモーダルモデルVLA2025/3/1
自動運転の知覚・予測・計画を段階的に推論するVQAデータセット(学習18k・テスト4k超)とベンチマークを構築し、そのデータで微調整した大規模マルチモーダルモデルを提案した論文。
- Open3DTrack: オープンボキャブラリ3D多物体追跡に向けて3D追跡2024/10/1
自動運転向けの3D多物体追跡を、事前定義されたカテゴリに縛られず未知の物体にも対応できるオープンボキャブラリ設定へと拡張し、その手法とデータセット分割を提案した論文。