Khoa Vo
収録論文 7本 ・ フィジカルAI/ロボット学習
VLAVLA/モデル圧縮VLA/操作
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- グリッパー認識型視覚言語行動モデルVLA2026/8/25
異なるグリッパー種別に応じた戦略を学習できるよう、5種類のグリッパーを含む大規模データセットと、専用トークナイザーとポリシールーティングを備えたモデルを提案した。
- 視覚言語行動モデルのファインチューニングには、思っているより少ない層で十分であるVLA/モデル圧縮2026/6/1
大規模な視覚言語行動(VLA)モデルには層ごとの冗長性があることを発見し、学習不要の構造圧縮パイプラインを提案。冗長な層を除去してモデルを最大50%圧縮し、ファインチューニング時間を40-50%、推論時間を最大30%削減しつつ、性能はフルモデルと同等以上を達成した。
- CodeGraphVLP: コードによる計画とセマンティックグラフ状態を組み合わせた非マルコフ型視覚言語行動モデルVLA/操作2026/4/1
長期的なロボット操作タスクにおいて、セマンティックグラフ状態とコードベースのプランナーを組み合わせ、視覚言語行動モデルの実行を支援する階層的フレームワークを提案した。
- 物体中心・幾何グラウンディングによる clutter に頑健な VLA モデルVLA2025/12/1
VLA の知覚と行動を分離し、タスク関連物体の領域選択と3D構造の強調を行う知覚モジュールを導入することで、 clutter や背景変化に強い操作を実現した。
- ロボットマニピュレーションにおける記憶状態の進展を再考する:オブジェクト中心の視点VLA2025/11/1
視覚的に類似した物体との連続的な相互作用を要する非マルコフ的タスクにおいて、物体ごとの履歴を保持するスロット中心のVLAフレームワークを提案し、LIBERO-Memベンチマークで評価した。
- SlotVLA: ロボットマニピュレーションにおける物体関係表現のモデリングVLA2025/11/1
物体中心・物体関係表現を用いたスロットアテンション型VLAフレームワークを提案し、物体注釈付きベンチマークLIBERO+を構築した。
- Open-Fusion: Real-time Open-Vocabulary 3D Mapping and Queryable Scene Representation2023/10/1