Zhaoxiang Zhang
NLPR, Institute of Automation, Chinese Academy of Sciences
収録論文 25本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 文脈内ロボット学習の簡素化:マニピュレーションタスクのための民主化レシピマニピュレーション2026/9/29
ロボットの文脈内学習(ICL)の曖昧さを解消する問題定義を提示し、視覚プロンプトエンコーダと低コストデータ収集で構成される再現可能なフレームワークSimpleICLを開発、シミュレーションと実世界で高性能を達成した。
- UniPart: 実世界インタラクションのためのゼロショット言語接地3Dパーツセグメンテーション3Dセグメンテーション2026/9/11
自由なテキスト指示から点群上の機能パーツを切り出すクロスモーダル3D Transformerを提案し、大規模データセット構築によりゼロショット性能と実機把持への転移を実現した。
- BrainWAM: 自動運転のための意味的先行知識と予測ダイナミクスの行動空間協調自動運転2026/8/1
自動運転の計画において、意味的推論(VLA)と予測的ダイナミクス(WAM)を単純に結合すると注意配分の不一致が生じる問題を解決するため、行動空間で両者を協調させるBrainWAMを提案し、NAVSIMで最高性能を達成した。
- ABot-AgentOS: 生涯マルチモーダルメモリを備えた汎用ロボットエージェントOSエージェントOS2026/7/1
低レベル制御の上に推論・記憶・ツール使用・検証・クロス実体実行を提供する汎用ロボットエージェントOSを提案し、実行可能なベンチマークと永続的なマルチモーダルグラフメモリを導入した。
- ワールドパイロット:世界行動事前知識で視覚言語行動モデルを操縦するVLA/操作2026/6/1
視覚言語行動モデルに、世界モデルから得たシーン進化の潜在表現と予測軌道を事前知識として注入し、分布外操作タスクや実ロボットでの成功率を向上させた。
- DexJoCo: MuJoCo上でのタスク指向巧みな操作のためのベンチマークとツールキット巧みな操作2026/5/1
巧みなロボットハンドの操作能力を評価するための、11の機能ベースのタスクとデータ収集システムを含むベンチマークとツールキットを提案し、現代のモデルの性能を分析した。
- WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張ベンチマーク2026/5/1
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
- DynVLA: 自動運転における行動推論のための世界ダイナミクス学習自動運転/VLA2026/3/1
自動運転向けVLAモデルDynVLAを提案し、行動生成前に世界のダイナミクスを予測する新しいCoTパラダイムを導入した。
- WorldArena:身体性世界モデルの知覚と機能的実用性を評価する統合ベンチマーク世界モデル2026/2/1
身体性世界モデルを映像知覚品質と下流タスクでの機能的実用性の両面から評価する統合ベンチマークWorldArenaを提案し、14モデルの実験から知覚と機能の間に大きなギャップがあることを示した。
- MarketGen: 自動生成される実体化スーパーマーケット環境を備えたスケーラブルなシミュレーションプラットフォームsim2real2025/11/1
スーパーマーケット環境を自動生成するシミュレーションプラットフォームMarketGenを提案し、レジ袋詰めと棚からの商品収集という2つのタスクのベンチマークを構築した。
- EmbodiedCoder: コーディングモデルによるパラメータ化された身体性モバイルマニピュレーションモバイルマニピュレーション2025/10/1
コーディングモデルを活用し、追加学習なしで自然言語指示から実行可能なロボット軌道を生成する、解釈性の高いモバイルマニピュレーションのフレームワークを提案した。
- DriveDPO:安全な選好最適化によるエンドツーエンド自動運転の政策学習自動運転2025/9/1
人間模倣とルールベース安全性を統合した選好最適化で運転軌道を学習し、NAVSIMで最高性能を達成した手法。
- SIG-Chat: 空間意図に導かれた対話ジェスチャー生成 — いつ・どのように・どこでジェスチャー生成2025/9/1
音声・言語・空間情報を統合し、対話相手とのインタラクションのタイミングや方向を考慮したジェスチャーを生成するモデルを提案し、ヒューマノイドロボットに実装した研究。
- DexVLG: 大規模巧みな視覚-言語-把持モデルマニピュレーション2025/7/1
単視点RGBD入力から言語指示に沿った巧みな手の把持姿勢を予測する大規模モデルを提案し、1.7億の把持データで学習してゼロショット汎化性能を実証した。
- 統一視覚言語行動モデルVLA2025/6/1
視覚・言語・行動を離散トークン列として自己回帰的にモデル化し、大規模動画から因果ダイナミクスを学習する統合VLAモデルUniVLAを提案。
- Ross3D: 3D認識を備えた再構成的視覚インストラクションチューニング3Dシーン理解2025/4/1
3Dシーン理解のための大規模データ不足に対処するため、クロスビューとグローバルビューの再構成を訓練に組み込んだ3D認識型視覚インストラクションチューニング手法を提案し、複数のベンチマークで最高性能を達成した。
- Voxel Mamba: 点群3D物体検出のためのグループフリー状態空間モデル3D物体検出2024/6/1
3Dボクセルを単一の系列にシリアライズするグループフリーな状態空間モデルを提案し、階層構造と位置エンコーディングで空間的近接性を保ちつつ、3D物体検出の精度と計算効率を向上させた。
- MemoNav: 視覚ナビゲーションのための作業記憶モデル視覚ナビゲーション2024/2/1
画像ゴールナビゲーションにおいて、短期・長期・作業記憶を組み合わせてゴールに関連するシーン特徴を効率的に抽出する新しい記憶モデルを提案し、複数の難易度で従来手法を上回る性能を示した。
- MixSup: Mixed-grained Supervision for Label-efficient LiDAR-based 3D Object Detection2024/1/1
- FSD V2: Improving Fully Sparse 3D Object Detection with Virtual Voxels2023/8/1
- PanoOcc: Unified Occupancy Representation for Camera-based 3D Panoptic Segmentation2023/6/1
- Once Detected, Never Lost: Surpassing Human Performance in Offline LiDAR based 3D Object Detection2023/4/1
- Super Sparse 3D Object Detection2023/1/1
- Fully Sparse 3D Object Detection2022/7/1
- RangeDet:In Defense of Range View for LiDAR-based 3D Object Detection2021/3/1