Gongjie Zhang
収録論文 4本 ・ フィジカルAI/ロボット学習
マニピュレーションVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CodeActionBench:身体性マニピュレーションのためのエージェント型Code-as-Policy評価マニピュレーション2026/9/27
汎用マルチモーダルモデルが実行可能コードを通じて視覚理解と推論を身体性マニピュレーションに変換できるかを評価する25タスクのベンチマークを提案し、9構成・675試行で成功率2.7〜73.3%を報告した。
- 固定カメラから自由カメラへ:キャリブレーション不要の視点ロバストな視覚言語行動モデルVLA2026/7/1
カメラの位置が変わっても、その位置情報を明示的に与えずにロボットが自分で視点を推定して操作できる新しいVLAモデルを提案した。カメラ中心の動作予測と手と目の関係行列の予測を組み合わせ、単眼RGB画像だけで多様な視点で成功率を向上させる。
- GeoProp: ロボット状態を視覚に接地する汎用操作のための手法マニピュレーション2026/7/1
ロボットの状態と視覚特徴を幾何学的に整合させる軽量アダプタを提案し、操作ポリシーの性能を向上させた。
- GP3: マルチビュー画像を用いた3D幾何認識ロボットマニピュレーションポリシーマニピュレーション2025/9/1
マルチビューRGB画像から深度とカメラパラメータを推定し、3Dシーン表現を構築して言語指示に基づく操作を実現するポリシーGP3を提案。シミュレーションで高性能を示し、実機にも少ない微調整で転移可能。