Kaixin Ma
収録論文 2本 ・ フィジカルAI/ロボット学習
VLA物体ナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SO-Bench:マルチモーダルLLMの構造化出力評価ベンチマークVLA2025/11/1
UI画面・自然画像・文書・グラフの4領域で、画像からJSONスキーマに沿った構造化出力を生成する能力を評価するベンチマークSO-Benchを構築し、既存モデルの課題を明らかにした。
- DivScene: 多様なシーンにおける大規模視覚言語モデルによるオープンボキャブラリ物体ナビゲーション物体ナビゲーション2024/10/1
81種類のシーンと5,707種類の物体を含む大規模データセットDivSceneを構築し、視覚言語モデルを微調整することでオープンボキャブラリ物体ナビゲーションの成功率をGPT-4oより20%以上向上させた。