Yongchong Gu
収録論文 6本 ・ フィジカルAI/ロボット学習
VLAsim2realマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ActiveVLA: 能動的知覚を視覚-言語-行動モデルに統合した高精度3DロボットマニピュレーションVLA2026/1/1
静的な手首カメラに頼る従来のVLAモデルに対し、重要領域の特定と能動的な視点選択・3Dズームインを行う2段階の枠組みを導入し、長期的・微細な操作精度を向上させた。
- SCOOP'D: Sim2Real生成ポリシーによる混合液固形物のすくい取り学習sim2real2025/10/1
OmniGibsonシミュレータで特権情報を用いたすくい取りデモを収集し、拡散モデルによる生成ポリシーで観測入力から模倣学習することで、実世界でのゼロショットすくい取りを実現した。
- TriVLA: エピソード的世界モデリングを備えた三システム統合型視覚-言語-行動モデルによる汎用ロボット制御VLA2025/7/1
エピソード記憶の概念を取り入れ、VLMによるマルチモーダル理解と動画拡散モデルによる時系列予測、フローマッチングによる行動生成を統合した三システム構成のVLAモデルを提案し、実世界のマニピュレーションタスクで高い性能を示した。
- 片手で複数物体を連続把持するSeqMultiGraspマニピュレーション2025/3/1
4本指のAllegro Handで、1つ目の物体を落とさずに2つ目の物体を連続して把持するシステムを提案。拡散モデルで把持姿勢を生成し、シミュレーションと実機で検証した。
- SparseGrasp: 疎な多視点RGB画像からの3Dセマンティックガウシアンスプラッティングによるロボット把持マニピュレーション2024/12/1
疎な多視点RGB画像から3Dガウシアンスプラッティングと視覚基盤モデルを組み合わせて意味情報付きシーンを構築し、変化する環境でも高速に更新しながら言語指示で物体を把持するシステムを提案した。
- LAC-Net: 遮蔽下での高精度ロボット把持のための線形融合注意誘導畳み込みネットワークマニピュレーション2024/8/1
RGBと深度を線形融合する注意誘導型ネットワークで物体の遮蔽部分を補完し、雑然とした環境でのロボット把持精度を向上させた研究。