Ishika Singh
収録論文 8本 ・ フィジカルAI/ロボット学習
VLA/ベンチマークVLAマルチエージェント計画マニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Colosseum V2: 視覚言語行動モデルの汎化性能を評価するベンチマークVLA/ベンチマーク2026/5/1
VLAモデルの汎化性能を体系的に評価する大規模シミュレーションベンチマークColosseum V2を構築し、既存手法の限界を明らかにした。
- PSALM-V: 大規模言語モデルによる対話型視覚環境での記号計画の自動化VLA2025/6/1
視覚環境での試行錯誤を通じて行動の事前・事後条件を自動学習し、LLMで記号計画を立案するシステムを提案。部分的観測下でも計画成功率を37%から74%に向上させた。
- OG-VLA: 正投影画像生成による3D認識型視覚言語行動モデルVLA2025/6/1
多視点RGBD観測を正投影画像に変換し、LLMと拡散モデルでエンドエフェクタの次位置・姿勢を生成する3D認識型VLAを提案。未見環境への汎化性能を大幅に向上。
- 言語モデルは環境フィードバックから記号プランナーの行動意味論を推論できるVLA2024/6/1
LLMと記号プランナーを組み合わせ、環境からの実行結果を基に行動の意味論を自動学習するPSALMを提案。7環境で成功率を36.4%から100%に向上させた。
- TwoStep: 古典的プランナと大規模言語モデルを組み合わせたマルチエージェントタスク計画マルチエージェント計画2024/3/1
LLMで目標をサブゴールに分解し、古典的プランナで各サブゴールを解くことで、マルチエージェント計画を高速かつ実行成功を保証しつつ効率的に行う手法を提案。
- コロッセウム:ロボットマニピュレーションの汎化性能を評価するベンチマークマニピュレーション2024/2/1
環境の色・テクスチャ・照明・カメラ位置など14種類の摂動に対するロボットマニピュレーションの汎化性能を評価するシミュレーションベンチマークを提案し、最先端モデルの成功率が30〜50%低下することを示した。
- ProgPrompt: Generating Situated Robot Task Plans using Large Language Models2022/9/1
- Pre-trained Language Models as Prior Knowledge for Playing Text-based Games2021/7/1