Wenkang Zhang
Shanghai Jiao Tong University
収録論文 4本 ・ フィジカルAI/ロボット学習
触覚触覚/基盤モデルVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EgoTac: 自己中心視覚からの実環境触覚予測触覚2026/8/15
自己中心視覚映像から触覚情報を予測するモデルEgoTacを提案し、570万以上の画像-触覚ペアで学習して高精度な触覚予測を実現した。
- FTP-1: 触覚センサを横断する接触リッチ操作のための汎用基盤触覚ポリシー触覚/基盤モデル2026/6/1
多様な触覚センサとロボット構成に対応する初の汎用基盤触覚ポリシーFTP-1を提案し、約3000時間のデータで事前学習して未見センサへの転移を実証した。
- LLaVA-OneVision-2:次世代知覚知能に向けてVLA2026/5/25
動画を圧縮ビットストリームとして扱い、適応的な時間グループと空間的証拠の選択によりトークン予算を効率的に配分する新しい視覚言語モデルを提案。大規模なオープン監視データで学習し、動画理解や時間的・空間的接地、操作トレース推論などで高性能を達成。
- OmniVTLA: 触覚知覚を統合した視覚・触覚・言語・行動モデルVLA2025/8/1
触覚センサの異種性に対応する二経路エンコーダと大規模触覚データセットObjTacを構築し、接触を伴う操作タスクで高い成功率を達成したVLAモデルを提案。