Xiangyu Zhang
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MemoryVLA++:視覚言語行動モデルにおける記憶と想像による時間的モデリングVLA2026/6/8
ロボット操作のためのVLAモデルに、作業記憶・エピソード記憶・未来想像の仕組みを組み込み、長期的な時間依存タスクを可能にするフレームワークを提案した。
- SpatialEvo: 決定論的幾何環境による自己進化型空間知能空間推論2026/4/15
3次元空間推論の自己進化学習において、モデル合意ではなく幾何学的検証に基づく擬似ラベル生成を提案し、誤りを増幅せずに空間知能を向上させるフレームワークを構築した。
- DM0: フィジカルAIに向けた身体性ネイティブな視覚-言語-行動モデルVLA2026/2/1
身体性を後付けでなく最初から統合し、大規模事前学習からフローマッチング行動専門家と空間Chain-of-Thoughtで操作とナビゲーションを統一的に学習するVLAフレームワークDM0を提案。
- UniMorphGrasp: 形態認識拡散モデルによるクロスエンボディメント巧みな把持生成マニピュレーション2026/2/1
多様なロボットハンドの把持を人間の手の標準ポーズに統一し、ハンド構造をグラフで条件付けた拡散モデルで、未知のハンドにも汎化する把持生成を実現した。
- SpatialActor: ロバストなロボットマニピュレーションのための分離された空間表現の探求マニピュレーション2025/11/1
意味と幾何を明示的に分離し、ノイズの多い深度と専門家事前知識を融合するフレームワークを提案。RLBenchで87.4%を達成し、ノイズ条件下で13.9%〜19.4%の改善を示す。
- MemoryVLA: ロボット操作のための視覚-言語-行動モデルにおける知覚・認知記憶VLA2025/8/1
人間の作業記憶と海馬の記憶機構に着想を得て、知覚・認知トークンを記憶バンクに蓄え再利用するVLAモデルを提案し、長期的な依存を含む操作タスクで従来手法を上回る成功率を達成した。
- Ross3D: 3D認識を備えた再構成的視覚インストラクションチューニング3Dシーン理解2025/4/1
3Dシーン理解のための大規模データ不足に対処するため、クロスビューとグローバルビューの再構成を訓練に組み込んだ3D認識型視覚インストラクションチューニング手法を提案し、複数のベンチマークで最高性能を達成した。
- Glad: 自動運転のためのストリーミングシーン生成器シーン生成2025/3/1
潜在変数伝播とストリーミングサンプラーにより、フレーム単位で時間的一貫性のある運転シーンの動画を生成するフレームワークを提案。
- EffiTune: ロボットナビゲーションにおけるパラメータチューナーの学習非効率を診断・緩和するフレームワークナビゲーション2024/9/1
ロボットナビゲーションのパラメータチューナー学習における非効率と冗長サンプリングを診断し、重要領域を重点的にアップサンプリングすることで、性能と学習効率を大幅に改善する手法を提案。
- SubjectDrive: 被写体制御による自動運転向け生成データのスケーリング自動運転/生成データ2024/3/1
被写体を制御できる生成モデルを開発し、多様な生成データを大量に作ることで自動運転の認識モデルの性能を継続的に向上させられることを示した。
- ADriver-I: A General World Model for Autonomous Driving2023/11/1
- Twin-S: A Digital Twin for Skull-base Surgery2022/11/1
- PHYSFRAME: Type Checking Physical Frames of Reference for Robotic Systems2021/6/1
- Deep Residual Learning for Image Recognition2016/6/1