Zheng Huang
収録論文 3本 ・ フィジカルAI/ロボット学習
視覚言語フォレンジクスVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- OmniVL-Guard Pro: ツール拡張エージェントによる包括的視覚言語フォレンジクス視覚言語フォレンジクス2026/5/16
閉世界前提の既存の偽造検出手法を超え、外部ツール(リアルタイム検索、拡大、セグメンテーション等)を活用するエージェントを提案し、オープンワールドでのフォレンジクス推論を実現する。
- NoTVLA: 物語的行動インターフェースによる意味を保つロボット適応VLA2025/10/1
VLAモデルの破滅的忘却を防ぐため、ロボットエンドエフェクタの軌跡を時間圧縮・空間推論で疎にし、その疎軌跡でファインチューニングするNoTVLAを提案。pi0より大幅に少ない計算量で高性能・高汎化を実現。
- GAE:VLMの物理的ポテンシャルを引き出す汎用アクションエキスパートVLA2025/10/1
VLMが予測した疎な3Dウェイポイントを、汎用アクションエキスパートが密なロボット動作に変換する手法を提案。大規模点群-軌道データで事前学習し、下流タスクへの汎化性能を実現した。