Wenping Wang
Texas A&M University
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- S4VY: フィードフォワード4D視覚幾何におけるセグメントエニシング4Dセグメンテーション2026/9/29
RGB観測からフィードフォワードな4D視覚幾何特徴を抽出し、時空間クエリデコーダで永続的な4Dインスタンスマスクを生成するセグメンテーションモデルを提案。言語指示に基づく4Dグラウンディングも可能。
- MoSAT: 空間オーディオとテキスト記述からの人間動作生成動作生成2026/9/20
空間オーディオと自然言語を条件として全身動作を生成する新タスクを提案し、データセットSTAMと階層的クロスアテンションを用いた潜在フローマッチング手法MoSATを開発した。
- S4R: 剛体の相互貫入を解消するスケーリング手法物理シミュレーション2026/9/17
物体を一度小さく縮めてから徐々に元のサイズに戻すことで、剛体同士のめり込みを解消する手法を提案し、大規模シーンでも高速かつ高精度に処理できることを示した。
- 重要情報の学習:適応的情報理論に基づくロボット探索の目的関数探索2026/5/1
ロボット探索における情報理論的目的関数の設計課題に対し、フィッシャー情報行列の固有空間解析で観測可能なパラメータ方向を特定し、重要方向を強調する適応的目的関数Q-OEDを提案した。シミュレーションと実機のナビゲーション・操作タスクで有効性を検証した。
- MOSPA: 空間オーディオに駆動される人間モーション生成モーション生成2025/7/1
空間オーディオに反応する人間の動きを生成するため、初の空間オーディオ駆動モーション(SAM)データセットを構築し、拡散モデルベースの生成フレームワークMOSPAを提案した。
- SURPRISE3D: 複雑な3Dシーンにおける空間理解と推論のためのデータセット3D空間推論2025/7/1
物体名に頼らず空間関係のみを問う20万件超の視覚言語ペアを構築し、3Dシーンでの空間推論を評価するベンチマークを提案した。
- 群衆内の内部状態を能動的情報収集で推定する手法ヒューマンロボットインタラクション2025/5/1
ロボットが能動的に働きかけて人間の性格特性を推定する手法を提案し、シミュレーションと実ユーザ実験で予測誤差と不確実性を大幅に削減した。
- PanoSLAM: ガウシアンSLAMによるパノプティック3Dシーン再構成SLAM2025/1/1
3Dガウシアンスプラッティングを基盤に、RGB-D動画から幾何・意味・インスタンス情報を統合したパノプティック3D再構成をオンラインで実現するSLAMシステムを提案。
- MotionWavelet: ウェーブレット多様体学習による人体動作予測動作予測2024/11/1
ウェーブレット変換と拡散モデルを組み合わせ、空間周波数領域で人体動作の時系列パターンを学習することで、将来の動作を高精度に予測するフレームワークを提案した。
- 言語拡張型記号プランナによるオープンワールドタスク計画タスク計画2024/7/1
大規模言語モデルを組み合わせて、不完全な知識しかないオープンワールド環境でも記号プランナが動作できるようにし、実行エラーを診断しながら知識を段階的に構築する手法を提案した。
- RealDex:人間らしいロボット巧みな手の把持に向けてマニピュレーション2024/2/1
人間の把持動作を多視点・マルチモーダル視覚データと共に収集したデータセットRealDexを構築し、マルチモーダル大規模言語モデルを活用した把持動作生成フレームワークを提案した。
- Hierarchical Temporal Transformer for 3D Hand Pose Estimation and Action Recognition from Egocentric RGB Videos2022/9/1
- Visual-Tactile Sensing for Real-time Liquid Volume Estimation in Grasping2022/2/1
- TrafficPredict: Trajectory Prediction for Heterogeneous Traffic-Agents2018/11/1
- AutoRVO: Local Navigation with Dynamic Constraints in Dense Heterogeneous Traffic2018/4/1