Chenyangguang Zhang
ETH Zürich
収録論文 8本 ・ フィジカルAI/ロボット学習
VLAsim2realマニピュレーションSLAMカメラモーション生成3Dシーン理解物体検出
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ChronoGraph: 視覚言語モデルによる機能的な4Dシーングラフで相互作用理解と接地計画を実現VLA2026/9/30
行動によるシーンの変化を4Dシーングラフとして表現し、視覚言語モデルで理解と計画を統合する手法を提案。グラフを思考連鎖として学習させ、実世界の移動マニピュレーションにも応用した。
- ビールを取ってきて:スムーズなピックアンドプレースのための合成から実への階層型ポリシーsim2real2026/9/16
液体入り容器をこぼさずに運ぶため、流体シミュレーションで検証した合成データと、言語・視覚からSE(3)目標を生成する高レベルモジュール+潜在拡散コントローラの階層型ポリシーを組み合わせた合成→実機フレームワークを提案。
- 3DWay: 3D一貫性ウェイポイントによるロボット操作の一般化マニピュレーション2026/9/8
多視点画像から3D一貫性のあるウェイポイントを予測し、ロボット操作の一般化を向上させる手法を提案した論文。
- Functional-SLAM: オンライン機能シーングラフによるインタラクション認識マッピングSLAM2026/9/7
ロボットの細かいインタラクションに必要な機能関係をモデル化したオンラインSLAMフレームワークを提案し、機能シーングラフをリアルタイムに構築・維持する。
- LIME: 一人称視点ビデオから意図を考慮したカメラモーションを学習するカメラモーション生成2026/7/1
ロボットが自然言語の指示に基づいて次に観察すべきカメラの相対姿勢を生成する手法を提案。一人称ビデオから多様な意図とカメラ動作のペアを学習し、観察利得の予測と連続的なフローマッチングによる姿勢生成を組み合わせる。
- 屋内空間のための階層的かつ全体的なオープンボキャブラリー機能3Dシーングラフ3Dシーン理解2026/5/1
機能的な3Dシーングラフの構築において、テーブルトップ上の密集した物体や多階層の機能関係を扱う新しいパイプラインを提案し、2D視覚グラウンディングと3Dグラフ最適化により頑健なグラフ構造を復元する。
- GFreeDet: ガウシアンスプラッティングと基盤モデルによるモデルフリー未知物体検出物体検出2024/12/1
参照動画からガウシアンスプラッティングで物体を再構成し、CADモデルなしで未知物体を検出する手法を提案。BOP Challenge 2024のモデルフリー2D検出部門で最優秀賞を受賞した。
- GDRNPP: A Geometry-guided and Fully Learning-based Object Pose Estimator2021/2/1