Rajat Aggarwal
収録論文 3本 ・ フィジカルAI/ロボット学習
ビデオワールドモデルデータセット/VLAVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 小売業における外在視点と内在視点の基盤ビデオワールドモデル適応の比較ビデオワールドモデル2026/7/1
小売店舗の同期した外在視点・内在視点ビデオを用いて、事前学習済みビデオ拡散モデルを小売シーンに適応させる際、どの視点のデータが最も効果的かを検証した。外在視点のみの適応が、組み合わせ適応と同等以上の性能を示した。
- SABER: 実世界VLA適応のためのスケーラブルな行動ベース身体データセットデータセット/VLA2026/5/1
小売環境でのロボット操作性能を向上させるため、実際の店舗で100時間以上の自然な映像から構築した高忠実度の行動データセットSABERを提案。頭部カメラと360度カメラを併用し、手先の器用な動作から全身動作までを収録し、VLAモデルの適応に有効なデータを提供する。
- PRISM: 実世界小売環境向け身体性視覚言語モデルのためのマルチビュー・マルチ能力動画データセットVLA2026/3/1
スーパーでの一人称・三人称・360度視点の動画27万サンプルを収集し、空間・物理・身体行動の知識を問う20以上のタスクで視覚言語モデルを微調整するデータセットを構築した。