Wentao Yuan
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboVista:多様なロボット応用のための視覚言語モデル評価VLM評価2026/7/1
ロボットの多様な応用における視覚言語モデル(VLM)の能力を評価するためのモジュール型フレームワークとベンチマークを提案し、実ロボット実験でその有効性を示した。
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- GraspGen: オブジェクト把持のための拡散モデルフレームワークマニピュレーション2025/7/1
拡散モデルを用いて6自由度の把持を生成し、識別器でフィルタリングするフレームワークを提案。5300万把持のデータセットを公開し、実機でも高い性能を示した。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- 投票による木探索でLLMタスク計画の実行順序を最適化するVote-Tree-Plannerタスク計画2025/2/1
LLMベースのロボットタスク計画において、計画の木構造を投票で重み付けしながら探索することで、LLMへの問い合わせ回数を削減しつつ成功率と効率を高める手法を提案した。
- AHA: ロボットマニピュレーションの失敗を検出・推論する視覚言語モデルVLA2024/10/1
ロボット操作の失敗を自然言語で検出・説明するオープンソースVLM「AHA」を提案し、シミュレーションで生成した大規模失敗データセットで学習させ、実世界や未見タスクへの汎化性能を示した。
- Manipulate-Anything:視覚言語モデルによる実世界ロボット操作の自動化マニピュレーション2024/6/1
視覚言語モデルを活用し、特権的な状態情報や手設計スキルなしで実世界の任意の静的物体を操作する軌道を自動生成する手法を提案し、既存手法を上回る性能とロバストな模倣学習を実現した。
- RoboPoint: ロボティクス向け空間アフォーダンス予測の視覚言語モデルVLA2024/6/1
合成データで視覚言語モデルをロボット向けに微調整し、言語指示から画像内のキーポイントアフォーダンスを予測するRoboPointを開発。実世界データ不要でスケーラブルに学習でき、ナビゲーションや操作などのタスクで既存手法を上回る。
- M2T2: Multi-Task Masked Transformer for Object-centric Pick and Place2023/11/1
- Evaluating Robustness of Visual Representations for Object Assembly Task Requiring Spatio-Geometrical Reasoning2023/10/1
- TerrainNet: Visual Modeling of Complex Terrain for High-speed, Off-road Navigation2023/3/1
- SORNet: Spatial Object-Centric Representations for Sequential Manipulation2021/9/1
- PCN: Point Completion Network2018/8/1