Guowei Huang
収録論文 7本 ・ フィジカルAI/ロボット学習
マニピュレーション逆運動学VLAナビゲーション姿勢推定
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- KAM-WM: 潜在世界モデルからの運動学的アフォーダンスマップによるロボット操作マニピュレーション2026/7/1
凍結したビデオ世界モデルから粗い方向性の相互作用手がかりを抽出し、拡散ポリシーを条件付ける運動学的アフォーダンスマップを生成するフレームワークを提案。LIBEROとRoboTwin2.0で高い成功率を達成した。
- グラフ拡散による全身逆運動学逆運動学2026/6/1
ロボットの構造をグラフで表現し、拡散モデルを用いて逆運動学を解く新しいフレームワークを提案した。
- ForceFlow: 接触駆動フローマッチングによる感覚と行動の学習マニピュレーション2026/5/1
接触を伴う操作タスクのための力覚対応リアクティブフレームワークを提案。非対称マルチモーダル融合と視覚から力へのハンドオーバー機構により、力と運動の深い結合を実現し、実世界6タスクで成功率を37%向上させた。
- GraphCoT-VLA:曖昧な指示に対応する3D空間認識推論型視覚言語行動モデルVLA2025/8/1
曖昧な指示や未知環境に対応するため、構造化Chain-of-Thought推論とリアルタイム更新可能な3Dポーズ・物体グラフを統合したロボットマニピュレーション向けVLAモデルを提案。
- Mem2Ego: グローバル記憶と自己中心視点を統合した長期的身体性ナビゲーションナビゲーション2025/2/1
グローバルな記憶モジュールからタスク関連情報を適応的に取得し、エージェントの自己中心的な視覚入力と統合することで、長期的な物体ナビゲーションの性能を向上させるVLMベースのフレームワークを提案した。
- SpatialCoT:座標アライメントと思考連鎖による身体性タスク計画の空間推論強化VLA2025/1/1
視覚言語モデルの空間推論能力を高めるため、座標の双方向アライメントと思考連鎖に基づく空間グラウンディングを組み合わせたSpatialCoTを提案し、ナビゲーションとマニピュレーションのタスクで従来手法を上回る性能を示した。
- RoboKeyGen: 拡散モデルによる3Dキーポイント生成を用いたロボット姿勢と関節角度の推定姿勢推定2024/3/1
2Dキーポイント検出と拡散モデルによる3Dキーポイント生成に分けてロボットの姿勢と関節角度を推定し、従来法より高精度・高速に実現するフレームワークを提案。