Zongyuan Ge
収録論文 8本 ・ フィジカルAI/ロボット学習
VLA評価/操作
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LLaVA-OneVision-2:次世代知覚知能に向けてVLA2026/5/25
動画を圧縮ビットストリームとして扱い、適応的な時間グループと空間的証拠の選択によりトークン予算を効率的に配分する新しい視覚言語モデルを提案。大規模なオープン監視データで学習し、動画理解や時間的・空間的接地、操作トレース推論などで高性能を達成。
- 二値的成功を超えて:細粒度操作のための診断的メタ評価フレームワーク評価/操作2026/5/1
細粒度操作の能力を理解・知覚・制御行動の3軸に分解し、従来の二値的成功率では隠れる次元別の失敗を明らかにする診断的メタ評価フレームワークMetaFineを提案した。
- RationalVLA:デュアルシステムを備えた合理的視覚言語行動モデルVLA2025/6/1
曖昧・不可能な指示を拒否しつつ、実行可能な指示に基づくロボットアーム操作を行う二重システムの視覚言語行動モデルを提案し、新ベンチマークRAMAで評価した。
- MoRE: 四足歩行ロボットの視覚-言語-行動モデルにおける強化学習のスケーラビリティを解き放つVLA2025/3/1
四足歩行ロボット向けに、複数の低ランク適応モジュールを専門家として組み込んだスパース活性化の混合エキスパート型VLAモデルを提案し、強化学習で混合品質データから効率的に学習することで多様なタスク性能と汎化性を実現した。
- PD-VLA: 並列デコーディングによるアクションチャンキング統合VLAモデルの高速化VLA2025/3/1
アクションチャンキングを統合したVLAモデルの推論を並列固定点反復で高速化するPD-VLAを提案し、成功率を維持しつつ実行周波数を2.52倍に向上させた。
- SurgicalPart-SAM: Part-to-Whole Collaborative Prompting for Surgical Instrument Segmentation2023/12/1
- Model-less Active Compliance for Continuum Robots using Recurrent Neural Networks2019/2/1
- Adversarial Discriminative Sim-to-real Transfer of Visuo-motor Policies2017/9/1