Jungong Han
Tsinghua University
収録論文 5本 ・ フィジカルAI/ロボット学習
VLAVLA/パラメータ効率的ファインチューニング画像操作検出
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Vision-Language-Actionモデル向け分位点ヘッドVLA2026/9/28
VLAモデルの行動ヘッドとして、回帰とフローマッチングを統一的に扱う分位点目的を導入し、1回の順伝播で分位点を予測するQuantile Headを提案。LIBERO系ベンチマークと実機タスクで成功率と効率を改善した。
- PhaseLoRA: 制御フェーズ条件付き低ランク適応による連続動作VLAポリシーVLA/パラメータ効率的ファインチューニング2026/8/15
連続動作の操作タスクにおいて、制御フェーズ(接近、接触、把持など)に応じて適応を変化させる軽量なLoRAパラメータ化を提案し、LIBEROベンチマークで成功率を大幅に向上させた。
- CofactVLA: 反事実的介入による視覚・言語・行動モデルの交絡除去VLA2026/8/5
視覚・言語・行動モデルが言語指示を無視して視覚的な交絡因子に過適合する問題を、反事実的介入を用いて軽減する新しい因果介入フレームワークを提案した。
- Impostor: 現実的なAIGC操作位置特定のためのエージェントキュレーション型ベンチマーク画像操作検出2026/6/3
生成画像編集の進歩に伴い、既存の画像操作検出・位置特定ベンチマークの限界を克服するため、100K枚の操作画像を含む新しいデータセットImpostorを構築し、閉ループエージェントフレームワークCraftAgentで多様で現実的な操作画像を自動生成した。また、局所位相モデリングと意味的フォレンジック一貫性学習を導入したPhaseAware-Netを提案し、既存手法を上回る性能を示した。
- 幾何学的報酬クレジット割当によるPoint-VLMの3D理解の強化VLA2026/4/23
点群と言語を扱うモデルが3D構造を誤って幻覚する問題を、報酬をトークン単位に分解して割り当てる手法と再投影整合性の制約で改善した論文。