Wenyao Zhang
Shanghai Jiao Tong University
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniPart: 実世界インタラクションのためのゼロショット言語接地3Dパーツセグメンテーション3Dセグメンテーション2026/9/11
自由なテキスト指示から点群上の機能パーツを切り出すクロスモーダル3D Transformerを提案し、大規模データセット構築によりゼロショット性能と実機把持への転移を実現した。
- HumanTracker:人間の知覚に整合した包括的なモーション追跡ベンチマークモーション追跡2026/8/1
ヒューマノイドのモーション追跡評価を人間の知覚に整合させ、大規模化するためのベンチマークと評価指標を提案した論文。
- GeniWorld: 視覚的アクションによるロボット操作のための汎化可能なインタラクティブワールドモデルワールドモデル2026/8/1
事前学習済みビデオ生成モデルとURDFベースのレンダリングを組み合わせ、数値アクションを視覚的アクション表現に変換することで、未見環境へのロバストなゼロショット汎化を実現するインタラクティブワールドモデルを提案した。
- MaskWAM: マスクプロンプトと予測を統合したワールドアクションモデルVLA2026/6/11
ロボット制御のためのワールドアクションモデルに、マスクを入力と予測の両方に統合する手法を提案し、言語の曖昧さを低減して汎化性能を向上させた。
- Humanoid-GPT: データと構造のスケーリングによるゼロショット動作追跡全身制御2026/6/1
大規模な動作コーパスで事前学習したGPTスタイルのTransformerを用いて、人型ロボットの全身制御とゼロショット動作追跡を実現した論文。
- LIMMT: モーショントラッキングには少ない方が良いモーショントラッキング2026/6/1
物理ベースのヒューマノイドモーショントラッキングにおいて、データ品質(物理的実現可能性、多様性、複雑さ)に基づいてデータを選別することで、全データセットの3%未満のデータでより良い追跡性能を達成できることを示した初のデータ中心的研究。
- ImageWAM: 世界行動モデルは本当にビデオ生成が必要か、それとも画像編集だけで十分か?VLA2026/6/1
ビデオ生成に依存する世界行動モデル(WAM)の課題を指摘し、代わりに画像編集モデルを利用したImageWAMを提案。推論時に画像編集のKVキャッシュを行動予測に活用し、計算コストを大幅削減しつつ性能を向上させた。
- DeformGen: 変形操作ポリシー学習のための動力学に基づくトポロジー拡張変形操作2026/6/1
変形物体の操作学習において、物理的に妥当な状態と軌道を生成する動力学ベースのデータ拡張フレームワークを提案した。
- 前方・逆動力学の事前学習分離によるロボット学習の非絡み合い化VLA2026/4/1
視覚と言語・行動の予測を分離し、前方動力学モデルと逆動力学モデルを別々に事前学習してから統合するフレームワークDeFIを提案し、CALVINやSimplerEnvなどのベンチマークで最先端性能を達成した。
- AIM: 空間価値マップを用いた意図認識型統合世界行動モデリングVLA2026/4/1
事前学習済みのビデオ生成モデルを基盤に、将来の観測と空間価値マップを共同で予測し、意図認識型の注意機構と自己蒸留強化学習によりロボットの行動生成を高精度化する手法を提案した。
- VLA-JEPA:潜在世界モデルで視覚-言語-行動モデルを強化VLA2026/2/1
未来のフレームを教師信号に使い、現在の観測だけから潜在空間で状態予測を学習するJEPA型事前学習で、VLAポリシーの汎化とロバスト性を高めた。
- ReWorld: 身体性ワールドモデルのための多次元報酬モデリングワールドモデル2026/1/1
ロボット学習向け動画ベースのワールドモデルを、物理的忠実性・タスク論理・身体性・視覚品質の多次元報酬で強化学習により人間の選好に整合させるフレームワークを提案。
- Phy-Tac: 物理条件付き触覚目標による人間らしい把持触覚2025/11/1
物理ベースの姿勢選択と触覚予測、力制御を統合し、最小限の力で安定把持を実現する人間模倣の触覚手法を提案。
- MM-Nav: マルチビューVLAモデルによるマルチエキスパート学習を用いた堅牢な視覚ナビゲーションVLA2025/10/1
360度視野のマルチビューVLAモデルを強化学習エキスパートのデータから教師あり学習し、到達・すり抜け・回避の能力を統合して実世界でも汎化する視覚ナビゲーションを実現した。
- DexVLG: 大規模巧みな視覚-言語-把持モデルマニピュレーション2025/7/1
単視点RGBD入力から言語指示に沿った巧みな手の把持姿勢を予測する大規模モデルを提案し、1.7億の把持データで学習してゼロショット汎化性能を実証した。
- DreamVLA: 包括的な世界知識を夢見る視覚-言語-行動モデルVLA2025/7/1
動的・空間・意味情報を統合した世界知識予測により逆動力学モデリングを行い、知覚-予測-行動ループを実現する新しいVLAフレームワークを提案。
- SoFar: 言語に基づく物体の向きが空間推論と物体操作を橋渡しするVLA2025/2/1
自然言語で物体の向きを定義する「意味的向き」を導入し、大規模データセットとゼロショット予測モデルを構築して、6自由度の空間推論とロボット動作生成を可能にした。
- Predict the Rover Mobility over Soft Terrain using Articulated Wheeled Bevameter2022/2/1