Weihao Yuan
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboDreamer: 予測状態空間モデルによる先読み型ヒューマノイド歩行歩行2026/9/7
観測マスキングと蒸留を用いた2段階教師-学生フレームワークで、不完全なセンシング下でも安定したヒューマノイド歩行を実現する。
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- TouchThinker:大規模データと行動認識表現による触覚常識推論のオープンワールドへの拡張触覚2026/6/10
触覚常識推論をオープンワールドに拡張するため、大規模データセットと行動認識表現を備えた触覚言語フレームワークTouchThinkerを提案した。
- 3DThinkVLA: 潜在3D事前知識を3D思考誘導共学習で視覚言語行動モデルに付与するVLA2026/6/3
視覚言語行動(VLA)モデルに、3D幾何知覚と3D空間推論を分離して潜在空間に注入する共学習フレームワークを提案し、推論時の追加テキスト生成なしに暗黙的な3D空間推論を可能にする。
- UniTacVLA: 視覚言語行動モデルにおける統合触覚理解と予測触覚/操作2026/6/1
接触を伴う器用な操作のために、触覚信号を動的な相互作用の手がかりとして扱い、現在の触覚状態と将来の接触変化を統合的にモデル化するフレームワークを提案。触覚連鎖思考と粗密な将来触覚予測により状態・動態を考慮した事前知識を構築し、実時間と予測触覚を組み合わせた混合制御で高精度な操作を実現。
- FocusVLA: 視覚言語行動モデルにおける視覚情報の焦点化VLA2026/3/1
VLAモデルの性能が視覚表現の質ではなく視覚情報の活用方法に制限されることを示し、注意をタスク関連領域に集中させるFocusVLAを提案した。
- GIC: ガウス情報付き連続体による物性推定とシミュレーションsim2real2024/6/1
3Dガウシアン表現と連続体シミュレーションを組み合わせ、視覚観測から物体の物理特性を推定するハイブリッド手法を提案。
- OV9D: オープンボキャブラリなカテゴリレベル9D物体姿勢・サイズ推定6D姿勢推定2024/3/1
任意の新規カテゴリのテキスト記述から、観測画像中の物体の位置・向き・サイズを推定するオープンセット問題に取り組み、大規模合成データセットOO3D-9DとDinoV2・拡散モデルを活用したNOCS推定フレームワークを提案した。
- Dense RGB SLAM with Neural Implicit Maps2023/1/1
- ${S}^{2}$Net: Accurate Panorama Depth Estimation on Spherical Surface2023/1/1
- MFuseNet: Robust Depth Estimation with Learned Multiscopic Fusion2021/8/1
- Multi-Object Rearrangement with Monte Carlo Tree Search:A Case Study on Planar Nonprehensile Sorting2019/12/1
- Towards Learning to Detect and Predict Contact Events on Vision-based Tactile Sensors2019/10/1
- Reinforcement Learning in Topology-based Representation for Human Body Movement with Whole Arm Manipulation2018/9/1
- Rearrangement with Nonprehensile Manipulation Using Deep Reinforcement Learning2018/3/1