Yizhou Wang
Stanford University
収録論文 30本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DualWAM: 非同期グローバル計画と局所修正のためのデュアルシステム世界行動モデルVLA2026/9/21
グローバル計画と手首視点による局所修正を非同期に分離し、高頻度な閉ループ制御を可能にした世界行動モデル。FrankaとGalbotでのゼロショット操作で成功率を平均4.5ポイント向上させ、16.6倍の高速化を実現。
- MINT: スケーラブルなエゴセントリックパイプライン監視によるワールド空間カメラ・手の動き推定の統合モデルエゴセントリックビジョン/手とカメラの軌跡推定2026/9/4
エゴセントリックRGB映像からカメラと両手のワールド空間軌跡を直接推定する初の基盤モデルMINTを提案し、大規模な疑似ラベル生成パイプラインで事前学習して高精度化した。
- WAM-TTT: テスト時に人間のプレイを見てワールドアクションモデルを操縦するVLA2026/7/1
人間の動画を模倣するのではなく、自己教師あり動画予測で凍結したワールドアクションモデルに軽量な適応メモリとして吸収し、テスト時に未ラベルの人間動画だけでロボットの行動を操縦するフレームワークを提案した。
- ロボット行動表現のための意味的アンカリングVLA2026/7/1
VLAモデルの微調整で失われる意味構造を保つため、行動表現を意味多様体に固定するプラグアンドプレイ手法を提案し、実世界で最大+18.7%の成功率向上を達成した。
- 共鳴する心:心の理論を備えた閉ループソーシャルアバターソーシャルAI2026/6/4
認知推論とマルチモーダル生成を統合した閉ループデュアルエージェントフレームワークを提案し、心の理論による社会的推論と感情制御可能な動画生成を組み合わせて、リアルな対話と表情・反応を実現する。
- 自己と他者の区別を可能にする人型ロボットの固有感覚-視覚対応自己認識/人型ロボット2026/6/1
人型ロボットが、自己と他者を区別する能力を、ラベルや運動学モデルなしで固有感覚と視覚の対応から学習できることを示した論文。
- RescueBench: 具身エージェントは現実世界で命を救えるか?ベンチマーク2026/6/1
捜索救助タスクを4段階のパイプラインとして構成した写真リアルな診断ベンチマークを提案し、既存手法の失敗モードを段階別に分析した。
- SUGAR: 人間ビデオ駆動のスケーラブルな汎用ヒューマノイド移動操作学習フレームワーク移動操作2026/5/1
人間のビデオから不完全な動作プリエントを抽出し、物理ベースのリファイナーで修正してから、階層的な自律ポリシーに蒸留することで、タスク固有の報酬設計やテレオペレーションなしにヒューマノイドの移動操作スキルを学習するフレームワークを提案した。
- GazeVLA: ロボット操作のための人間の意図を学習するVLA2026/4/1
人間の視線を意図の代理として学習し、ロボット操作に転移するフレームワークを提案。大規模な人間データで事前学習し、少量のロボットデータで微調整することで、長期的・細かいタスクで高性能を達成。
- 視覚に基づくヒューマノイドエージェントヒューマノイドエージェント2026/4/1
実世界の3Dシーンを再構築し、デジタル人間が視覚情報のみで目標指向の自律行動をとるためのフレームワークを提案した論文。
- AdaTracker: クロスエンボディメント能動的視覚追跡のための適応的インコンテキストポリシー学習視覚追跡/クロスエンボディメント2026/4/1
多様なロボット形態で動作する統一モデルによる能動的視覚追跡を実現するため、エンボディメント固有の制約を文脈として学習し、未知のロボットへゼロショット適応するフレームワークを提案した。
- 散らかった環境における動力学を考慮した方策学習による外在的器用さの創発マニピュレーション2026/3/1
散らかった環境での物体操作に向け、接触による物体動力学を明示的にモデル化して強化学習の方策を条件付けるDAPLフレームワークを提案し、シミュレーションと実世界で従来手法を上回る成功率を達成した。
- LDA-1B:汎用身体データ取り込みによる潜在ダイナミクス行動モデルのスケーリングVLA2026/2/1
異種の身体データからダイナミクス・方策・視覚予測を統合学習する10億パラメータのロボット基盤モデルを提案し、接触・器用・長距離タスクで性能を向上させた。
- UniAct:ヒューマノイドロボットのための統合動作生成とアクションストリーミングヒューマノイド制御2025/12/1
微調整したMLLMと因果的ストリーミングパイプラインを組み合わせ、言語・音楽・軌道などのマルチモーダル指示を500ms未満の遅延でヒューマノイドの全身動作に変換する二段階フレームワークを提案。
- フッケンスリンク機構と柔軟指節を備えた新型ロボットハンド:環境制約下でのすくい取りと自己適応把持マニピュレーション2025/10/1
フッケンス機構と柔軟なシリコン指節を組み合わせ、単一アクチュエータで平行つまみ・非対称すくい・包み込みの3つの把持モードを実現する適応型ロボットハンドを開発し、試作機で検証した。
- 第9回AIシティチャレンジコンピュータビジョン2025/8/1
交通・産業・公共安全分野におけるコンピュータビジョンとAIの実応用を推進する第9回AIシティチャレンジの概要。4つのトラックで245チームが参加し、3Dマルチカメラ追跡や交通安全のビデオQA、倉庫での空間推論、魚眼カメラの物体検出などが競われた。
- 身体性エージェントと人間の適応のための通信効率の良い欲求アラインメントVLA2025/5/1
家庭支援シミュレーション環境HA-Desireを構築し、曖昧な指示からユーザの潜在的な欲求を推論して適応するフレームワークFAMERを提案した。欲求ベースの心的推論と反省ベースの通信モジュールにより、タスク実行と通信効率を大幅に向上させた。
- DyWA: 動力学適応型ワールドアクションモデルによる汎用性の高い非把持マニピュレーションマニピュレーション2025/3/1
物体の質量や摩擦などの物理条件変化に適応しながら未来状態を予測するモデルを提案し、単視点点群のみで非把持マニピュレーションの成功率を大幅に向上させた。
- 人間中心の基盤モデル:知覚・生成・エージェントモデリング基盤モデル2025/2/12
人間中心の基盤モデル(HcFM)を、知覚・生成・統合・エージェントの4つに分類して概観したサーベイ論文。
- AdaManip: 適応的な関節物体操作環境と方策学習マニピュレーション2025/2/1
鍵やドアなど内部状態が見えない関節物体を試行錯誤で操作するための新しいシミュレーション環境と、3D視覚拡散を用いた模倣学習による適応方策を提案した。
- UnrealZoo:身体性AIのためのフォトリアルな仮想世界を拡充sim2real2024/12/1
Unreal Engine上に構築した100以上のフォトリアルな3D仮想世界と多様な操作可能エンティティを提供し、身体性AI研究のためのデータ収集・分散学習・ベンチマーク環境を整備した。
- 人間の意図を考慮した適応的支援ロボットポリシーの学習ヒューマンロボットインタラクション2024/12/1
ロボットが人間の暗黙の選好を対話を通じて推論し、行動予測と効用関数推定により個別化された支援を実現するフレームワークを提案した。
- ScissorBot: シミュレーション・模倣・Sim2Realによる汎用性のあるハサミ裁断スキルの学習sim2real2024/9/1
ロボットアームに取り付けたハサミで紙に描かれた曲線を正確に裁断するタスクに取り組み、行動プリミティブ列による模倣学習とSim2Real技術を組み合わせて実機で人間に匹敵する性能を達成した。
- 未知の関節状態下でのリアルタイム全身ロボット姿勢推定姿勢推定2024/2/1
ロボットの関節角度などの内部状態が未知でも、RGB画像からカメラ・ロボット間の回転や関節パラメータ、キーポイント、ルート深度を単一のフィードフォワード推論でリアルタイムに推定するフレームワークを提案した。
- Nonholonomic Motion Planning as Efficient as Piano Mover's2023/6/1
- RSPT: Reconstruct Surroundings and Predict Trajectories for Generalizable Active Object Tracking2023/4/1
- Learning Semantic-Agnostic and Spatial-Aware Representation for Generalizable Visual-Audio Navigation2023/4/1
- GraspARL: Dynamic Grasping via Adversarial Reinforcement Learning2022/3/1
- Towards Distraction-Robust Active Visual Tracking2021/6/1
- Pose-Assisted Multi-Camera Collaboration for Active Object Tracking2020/1/1