Ziyang Gong
収録論文 7本 ・ フィジカルAI/ロボット学習
VLA基盤モデルデータ生成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- OC-VLA++: 単眼幾何ガイドによるクロスビュー一貫性を用いた視点ロバストなロボット操作VLA2026/8/1
カメラ座標系での行動接地に加え、幾何学的に関連する視点ペアからの教師信号とクロスビュー行動等変性を導入し、限られたカメラ視点での未見視点への汎化性能を向上させた。
- ACE-Brain-0.5:物理的エージェントAIのための統合具現化基盤モデルVLA2026/7/1
ロボット知能を空間知覚、意思決定、身体的行動、自己監視、自己改善の5機能に統合した、単一の8Bバックボーンによる閉ループ基盤モデルを提案する。
- ACE-Brain-0: 空間知能を共通の足場とする普遍的身体性知能基盤モデル2026/3/1
多様な身体(自動運転、ロボット、ドローン)を統合する基盤モデルを提案し、空間知能を共通の足場として、専門化と融合を経て高い性能を達成した。
- IGen: オープンワールド画像からのロボット学習のためのスケーラブルなデータ生成データ生成2025/12/1
オープンワールド画像から3Dシーン表現とVLM推論を用いてロボットの視覚運動データを生成し、実世界データに匹敵する性能のポリシー学習を可能にするフレームワークを提案。
- 視覚的身体脳:マルチモーダル大規模言語モデルに空間での知覚・思考・制御をVLA2025/6/1
マルチモーダルLLMをロボット制御に統合するVeBrainを提案し、テキストベースの制御信号を実機の動作ポリシーに変換するアダプタと大規模指示データセットで脚ロボットやアームの適応的な操作を実現した。
- Interleave-VLA:画像とテキストの交互入力でロボット操作を強化VLA2025/5/1
画像とテキストを交互に与える指示でロボットを学習させ、未知の物体への汎化性能を2倍に高め、手描きスケッチなどの柔軟な指示にも対応できるVLAモデルを提案。
- ロボット視覚指示:手描きシンボルによるロボット操作の新パラダイムVLA2025/5/1
手描きの矢印や丸などの2Dシンボルでロボットに3D操作を指示するRoVIを提案し、VLMで解釈して行動に変換するVIEWを実現した。