Wen Wang
収録論文 7本 ・ フィジカルAI/ロボット学習
VLAハンドモーション予測映像編集3D点群セグメンテーション通信/群制御ナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Iron: 意図整合と回顧的双方向学習による汎用仮想エージェントの性能向上フレームワークVLA2026/8/28
GUIエージェントの訓練において、低レベル行動と高レベル意図の細粒度な整合を実現するステップワイズ循環整合報酬と、失敗軌跡を再利用する回顧的再現メカニズムを導入し、データ効率と性能を向上させた。
- EMPIRE: 明示的操作計画を学習可能な中間表現として用いた自己中心視ハンドモーション予測ハンドモーション予測2026/8/23
自己中心視の映像から将来の両手の動きを予測する際に、操作計画を中間表現として明示的に学習する2段階フレームワークを提案し、大規模データセットを構築してSOTA精度を達成した。
- CameraAnything: 任意のカメラ制御による映像の再撮影映像編集2026/7/27
カメラの内部・外部パラメータを同時に制御できる映像編集の統一フレームワークを提案し、焦点距離や解像度の変更を伴う再撮影を単一の生成プロセスで実現した。
- PointGS: 3Dガウススプラッティングを用いた意味的に一貫した教師なし3D点群セグメンテーション3D点群セグメンテーション2026/5/12
3Dガウススプラッティングを中間表現として用い、2DのSAMセグメンテーション結果を3D点群に蒸留することで、教師なしで意味的に一貫した点群セグメンテーションを実現する手法を提案した。
- ロボティックIoTのための再構成可能知能表面通信/群制御2024/12/1
再構成可能知能表面(RIS)を用いてロボットIoTネットワークの通信・センシング・計算・エネルギー効率を改善する手法を提案し、マルチエージェント強化学習と多目的最適化でビームフォーミングや経路計画などを最適化した。
- 視覚知覚と知識グラフを整合させた物体目標ナビゲーションナビゲーション2024/2/1
物体目標ナビゲーションにおいて、シーン構造を連続的にモデル化し、視覚言語事前学習で言語記述と視覚知覚を整合させることで、ゼロショットナビゲーションを可能にした手法を提案。
- TGRMPT: A Head-Shoulder Aided Multi-Person Tracker and a New Large-Scale Dataset for Tour-Guide Robot2022/7/1