Zhihao Guo
収録論文 4本 ・ フィジカルAI/ロボット学習
VLA空間推論拡散モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DINOv3拡散方策:視覚運動拡散方策学習のための自己教師あり大規模視覚モデルVLA2025/9/1
ロボットマニピュレーションの拡散方策において、自己教師あり視覚バックボーンDINOv3が従来のImageNet教師ありResNet-18と同等以上に機能し、サンプル効率と頑健性を向上させることを示した。
- ロボティクス向け空間関係認識データセット空間推論2025/6/1
Spotロボットで取得した約1000枚の屋内画像に物体属性・位置・空間関係を注釈付けしたデータセットを構築し、シーングラフ生成モデルを評価した。
- 拡散モデルによる動画生成におけるロボットの形状と位置の保持拡散モデル2024/7/1
拡散モデルを用いて、移動ロボットの形状と位置を正確に保持した動画を生成する手法を提案し、衝突検出モデルの学習データ作成を容易にした。
- アシストロボットのための言語粒度とオンザフライ制御VLA2024/6/1
視覚が使えない状況でも言語のみでアシストロボットを制御できるか検討し、異なる粒度の言語指示への応答とオンザフライ制御の必要性・実現可能性をSawyerとTurtlebotで実験した。