Ruixiang Wang
The Chinese University of Hong Kong, Shenzhen
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- TaskAnchor: 長期的マニピュレーションのための反応型VLAにおけるタスク状態の接地VLA2026/9/20
視覚的に似た観測でも実行段階によって行動が異なる「タスク状態の曖昧さ」を解消するため、実行履歴に基づく軽量アダプタTaskAnchorを提案し、VLAの成功率を大幅に向上させた。
- Vid2WAM: ビデオ拡散事前知識を世界行動モデルへ蒸留するVLA2026/8/1
大規模ビデオ基盤モデルの拡散事前知識を、コンパクトな世界行動モデル(WAM)に蒸留するフレームワークを提案。専門家デモに依存せず、タスク条件付き未来予測と逆動力学モデルによる擬似行動を活用し、限られたデモでも新規タスクへの汎化とデータ効率を向上させる。
- EVA: 逆動力学報酬による実行可能ロボット行動へのビデオ世界モデル整合世界モデル2026/3/1
ビデオ生成モデルをロボットの世界モデルとして使う際、生成映像が物理的に実行可能な行動に変換されるよう、逆動力学モデルを報酬として強化学習で整合させる手法を提案した。
- 拡散モデルによる想像的協調で両手マニピュレーションを実現マニピュレーション2025/7/1
動画予測と行動予測を拡散モデルで統合し、推論時には動画予測を省略できる効率的な両手操作フレームワークを提案。シミュレーションと実機で成功率を大幅に向上させた。
- GAT-Grasp: ジェスチャー駆動型アフォーダンス転移によるタスク指向ロボット把持マニピュレーション2025/3/1
人間の手ジェスチャーを手がかりに、大規模な人間-物体インタラクション動画から把持知識を検索・転移し、未知物体や雑然とした環境でもタスクに適した把持姿勢をゼロショットで生成するフレームワーク。
- ImitDiff: 基盤モデルの事前知識を転移した妨害に頑健な視覚運動模倣ポリシーVLA2025/2/1
視覚言語基盤モデルで指示をピクセル単位の意味マスクに変換し、二重解像度の知覚と拡散トランスフォーマで妨害に強い模倣学習ポリシーを実現した。
- 一度の教示で両腕ロボット操作を学習:動画デモからのワンショット模倣模倣学習2025/1/1
人間の両手動作を1回のステレオ動画から抽出し、両腕ロボットの多様な長期的タスクを学習する手法YOTOを提案。
- リソース格差を埋める:高度な模倣学習モデルを手頃な組み込みプラットフォームへ展開マニピュレーション2024/11/1
Transformerベースの大規模模倣学習モデルを、モデル圧縮とTemporal Ensemble with Dropped Actions(TEDA)によりエッジデバイスへ効率的に展開するパイプラインを提案し、各種マニピュレーションタスクで有効性を示した。