Guoheng Sun
University of Maryland, College Park
収録論文 4本 ・ フィジカルAI/ロボット学習
VLA触覚/表現学習VLA/サーベイ
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 階段ポリシー:大規模アクションチャンクを持つ世界行動モデルのストリーミング推論VLA2026/9/29
未来予測に基づく世界行動モデルをストリーミング推論で効率化し、大きなアクションチャンクを段階的に精錬しながら実行することで、長期的なタスクでも高精度・高スループットを実現した研究。
- TacGen: 触覚は物理世界表現に不可欠な次元である -- スケーラブルな視覚-触覚アライメントと生成による触覚データ不足への対処触覚/表現学習2026/6/1
触覚データ不足を解決するため、視覚と触覚のコントラスト学習と潜在空間での視覚から触覚への生成モデルを組み合わせ、RGB画像から触覚表現を合成してデータを拡張する手法を提案した。
- ドロップ・ザン・リカバリー:視覚言語行動モデルはどの程度冗長か?VLA2026/6/1
VLAモデルの冗長性を調べるため、トランスフォーマーブロックを除去して再学習する手法を提案し、言語バックボーンが操作タスクに冗長である一方、視覚・行動経路は重要であることを示した。
- ロボティクスにおける視覚-言語-行動モデル:データセット、ベンチマーク、データエンジンの調査VLA/サーベイ2026/4/1
視覚-言語-行動(VLA)モデルの進歩はデータ基盤に依存するとし、データセット、ベンチマーク、データエンジンの3つの柱に沿ってデータ中心の分析を行い、今後の課題を整理したサーベイ論文。