Zhizheng Zhang
Galbot
収録論文 28本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DualWAM: 非同期グローバル計画と局所修正のためのデュアルシステム世界行動モデルVLA2026/9/21
グローバル計画と手首視点による局所修正を非同期に分離し、高頻度な閉ループ制御を可能にした世界行動モデル。FrankaとGalbotでのゼロショット操作で成功率を平均4.5ポイント向上させ、16.6倍の高速化を実現。
- FoldNet++:ロボットによるTシャツ折り畳み・展開のための大規模合成データセット変形物体マニピュレーション2026/9/11
6種類のロボット、1000枚のTシャツ、12万エピソードを含む合成データセットを構築し、実環境で90%以上の成功率を達成した研究。
- GIF: ロボット学習のための対話的・機能的オブジェクト構成のエージェント生成データ生成2026/9/5
ロボット操作の基盤モデル学習用に、対話的で機能的なオブジェクト構成を自動生成するエージェントフレームワークGIFを提案。2D/3D生成モデルとVLM検証を組み合わせ、衝突率1%未満で高品質なシーン生成を実現し、シミュレーションと実世界でのポリシー学習に有効性を示した。
- ZETA: テーブルトップ操作におけるゼロショット・クロスエンボディメントVLA転移の統制研究VLA/転移学習2026/9/2
異なるロボット形態へのゼロショット転移を体系的に評価するため、厳密な定義と統制ベンチマークを導入し、状態表現・事前学習の多様性・補助学習・対象形態の露出の影響を分析した。
- WAM-TTT: テスト時に人間のプレイを見てワールドアクションモデルを操縦するVLA2026/7/1
人間の動画を模倣するのではなく、自己教師あり動画予測で凍結したワールドアクションモデルに軽量な適応メモリとして吸収し、テスト時に未ラベルの人間動画だけでロボットの行動を操縦するフレームワークを提案した。
- AllDayNav: 実世界強化学習による生涯ナビゲーションナビゲーション2026/6/1
動的環境での生涯ナビゲーションのために、明示的な地図やシーングラフを使わず、大規模モデルに強化学習でシーン動態を暗黙的に符号化し、自己進化するマルチモーダルメモリで長期動作を実現するフレームワークを提案した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- SPAN-Nav: 多様な視覚言語ナビゲーションのための汎用空間認識VLA2026/3/1
RGB動画から占有予測で空間事前知識を学習し、単一トークンで空間手がかりを行動推論に注入する視覚言語ナビゲーション基盤モデルを提案。
- 散らかった環境における動力学を考慮した方策学習による外在的器用さの創発マニピュレーション2026/3/1
散らかった環境での物体操作に向け、接触による物体動力学を明示的にモデル化して強化学習の方策を条件付けるDAPLフレームワークを提案し、シミュレーションと実世界で従来手法を上回る成功率を達成した。
- NavGSim: 大規模ナビゲーションのための高忠実度ガウススプラッティングシミュレータシミュレーション2026/3/1
3Dガウススプラッティングに基づく大規模ナビゲーション向けの高忠実度シミュレータを提案し、実環境でのVLAモデルのナビゲーション性能を向上させる。
- LDA-1B:汎用身体データ取り込みによる潜在ダイナミクス行動モデルのスケーリングVLA2026/2/1
異種の身体データからダイナミクス・方策・視覚予測を統合学習する10億パラメータのロボット基盤モデルを提案し、接触・器用・長距離タスクで性能を向上させた。
- Any3D-VLA:多様な点群によるVLAのロバスト性向上VLA2026/2/1
シミュレータ・センサ・モデル推定の点群を統合して学習し、2D表現と融合することで、VLAモデルの性能とドメインギャップ耐性を高める手法を提案。
- StereoVLA: ステレオ視で視覚言語行動モデルを強化VLA2025/12/1
大規模合成ステレオデータから幾何学的手がかりを取り入れた初のVLAモデルを提案し、精密な空間認識と視点ロバスト性を実現した。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- TrackVLA++:具現化視覚追跡のための推論と記憶能力を引き出すVLAモデルVLA2025/10/1
移動する対象を追跡する具現化視覚追跡において、空間推論と長期記憶のモジュールを導入し、遮蔽や類似物体に強いVLAモデルを提案した。
- UrbanVLA:都市マイクロモビリティのための視覚-言語-行動モデルVLA2025/10/1
都市環境での配達ロボットなどのナビゲーションに向け、経路指示と視覚情報を統合して行動を計画するVLAフレームワークを提案し、シミュレーションと実世界データで二段階学習することで大規模都市ナビゲーションを実現した。
- MM-Nav: マルチビューVLAモデルによるマルチエキスパート学習を用いた堅牢な視覚ナビゲーションVLA2025/10/1
360度視野のマルチビューVLAモデルを強化学習エキスパートのデータから教師あり学習し、到達・すり抜け・回避の能力を統合して実世界でも汎化する視覚ナビゲーションを実現した。
- 身体性ナビゲーション基盤モデルナビゲーション基盤モデル2025/9/1
四足歩行・ドローン・車輪ロボット・車両にまたがる800万件のナビゲーションサンプルで学習し、視覚言語ナビゲーションや物体探索、追跡、自動運転など多様なタスクを単一アーキテクチャでこなす基盤モデルを提案。
- DexVLG: 大規模巧みな視覚-言語-把持モデルマニピュレーション2025/7/1
単視点RGBD入力から言語指示に沿った巧みな手の把持姿勢を予測する大規模モデルを提案し、1.7億の把持データで学習してゼロショット汎化性能を実証した。
- DreamVLA: 包括的な世界知識を夢見る視覚-言語-行動モデルVLA2025/7/1
動的・空間・意味情報を統合した世界知識予測により逆動力学モデリングを行い、知覚-予測-行動ループを実現する新しいVLAフレームワークを提案。
- CLAR: マスク再構成と多段階コントラスト整合を融合したロボットマニピュレーション向け3D表現学習マニピュレーション2025/7/1
マスク付きオートエンコーダとクロスモーダルなコントラスト学習を組み合わせ、局所的な変形可能注意で3D形状と2D視覚特徴を精密に対応付ける3D事前学習フレームワークを提案し、視覚運動ポリシー学習で最高性能を達成した。
- TrackVLA: 実環境における身体性視覚追跡VLA2025/5/1
視覚と言語と行動を統合したVLAモデルで、対象認識と軌道計画を同時に学習し、遮蔽や動きの激しい実環境でも10FPSで頑健に目標を追跡する。
- GraspVLA:10億規模の合成行動データで事前学習した把持基盤モデルVLA2025/5/1
シミュレーションで生成した10億フレームの把持データセットSynGrasp-1Bを用いて、視覚・言語・行動を統合したVLAモデルGraspVLAを事前学習し、実世界でのゼロショット汎化と少数ショット適応を実現した。
- SoFar: 言語に基づく物体の向きが空間推論と物体操作を橋渡しするVLA2025/2/1
自然言語で物体の向きを定義する「意味的向き」を導入し、大規模データセットとゼロショット予測モデルを構築して、6自由度の空間推論とロボット動作生成を可能にした。
- FetchBot: ゼロショットSim2Realによる散らかったシーンでの汎化可能な物体把持sim2real2025/2/1
100万シーンの合成データと50万のデモを用い、RGBから深度を予測して遮蔽物を考慮した行動生成を行うSim2Realフレームワーク。実環境の散らかった場面で平均89.95%の成功率を達成した。
- Code-as-Monitor: 制約認識型ビジュアルプログラミングによるロボットの受動的・能動的障害検出VLA2024/12/1
VLMが生成したコードで時空間制約を評価し、ロボットの予期せぬ失敗の事後検出と予見可能な失敗の事前防止を統一的に実現する手法を提案。
- Uni-NaVid:身体性ナビゲーションタスクを統合する動画ベースの視覚-言語-行動モデルナビゲーション2024/12/1
指示追従・物体探索・質疑応答・人物追跡など多様なナビゲーションタスクを単一モデルで統合し、未知の実環境での長期的な混合タスクを可能にする動画ベースのVLAモデルを提案。
- NaVid: ビデオベースVLMが視覚言語ナビゲーションの次の一歩を計画するVLA2024/2/1
単眼RGBカメラの動画ストリームのみから次の行動を出力するビデオベース大規模視覚言語モデルNaVidを提案し、地図・オドメトリ・深度なしでシミュレーションと実世界の両方で最先端のナビゲーション性能を達成した。