Zheng Zhu
収録論文 41本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GigaBrain-WBC-0.5:環境との相互作用に頑健な全身制御のための行動世界モデル全身制御2026/8/18
ヒューマノイドの全身運動追跡制御において、環境との接触を考慮した行動世界モデルを提案し、不適切なコマンドや外乱に対して頑健な制御を実現した。
- GigaBrain-0.7:三系統アーキテクチャによる創発的能力へのスケーリングVLA2026/8/16
視覚言語行動モデルのスケーリングとアーキテクチャ改善により、多様なロボットへの汎化を大幅に向上させた基盤モデルを提案。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- GigaWorld-1: ロボットポリシー評価のためのワールドモデル構築ロードマップワールドモデル2026/7/1
ロボットポリシーの評価を効率化するため、ワールドモデルの信頼性を体系的に研究し、ベンチマークWMBenchを構築して、7つのビデオワールドモデルと4つの行動表現を比較した。
- Zero2Skill: 自律データ収集・訓練・展開によるロボットスキルのブートストラップマニピュレーション2026/7/1
人間の介入を減らしつつロボット操作スキルを自律的に学習するシステムを提案。修正を記憶して再利用することで、人間の作業時間を大幅に削減し、成功率を向上させた。
- HALO-WA: ハイブリッド注意機構と潜在変数ガイドによるオンライン強化学習を用いた世界行動モデル強化学習/操作2026/7/1
世界行動モデルによる精密操作の失敗を、潜在特徴と行動事前分布を利用した軽量なアクタークリティック適応器とハイブリッド注意機構でオンライン修正する手法を提案し、実機4タスクで成功率を大幅に向上させた。
- GigaWorld-Policy-0.5: AutoResearchによる高速・高精度なWAMの実現VLA2026/7/1
将来の視覚予測を訓練時のみに用い、推論時は行動生成のみで高速化した行動中心のWorld Action Modelを提案し、AutoResearchで最適設定を探索して性能を向上させた。
- R2RDreamer: 空間的に汎化する2次元操作ポリシーのための3次元認識データ拡張操作学習2026/6/15
実デモから3D編集と2Dビデオ補完を組み合わせて、物体位置や視点が変わっても動作する操作ポリシーを学習するためのデータ拡張手法を提案した。
- ScoutVLA:オープンワールド具現化質問応答のためのデュアルエキスパートVLAモデルによるUAV中心の能動知覚VLA2026/6/9
UAVが環境を能動的に知覚して質問に答える空中具現化質問応答(EQA)において、証拠探索に必要な微細な視点調整を可能にするベンチマークFG-EQAと、ミツバチのダンスに着想を得たデュアルエキスパート型VLAモデルScoutVLAを提案した。
- iMaC: 動作と接触画像への変換による具現化ワールドモデルVLA2026/6/8
ロボット操作のための新しい制御パラダイムを提案し、画像をアクション表現として用いることで、従来のベクトルベースのアクションよりも表現力と汎化性を向上させる。
- WAM-Nav: 非対称潜在世界行動モデリングによる統合視覚ナビゲーションナビゲーション2026/6/1
視覚ナビゲーションのための潜在世界行動モデルを提案し、行動生成と視覚予測を共同で学習することで、推論効率を保ちつつ先見的な障害物回避を実現した。
- SKIP: 効率的な具現化ワールドモデルのためのスパースキーフレーム補間パラダイムワールドモデル2026/6/1
ロボット操作動画の生成を、タスク関連のキーフレームのみを生成し、残りを補間することで高速化する手法を提案。
- DVG-WM: 分離型ビデオ生成によるロボット操作のための効率的身体化世界モデル世界モデル2026/6/1
ビデオ生成を動力学学習と視覚合成に分離することで、高品質な予測を高速に実現する身体化世界モデルを提案した。
- SAFE-Pruner: 意味的注意に基づく未来予測型トークンプルーニングによる効率的な視覚言語行動操作VLA/効率化2026/5/1
視覚言語行動モデルの推論を高速化するため、将来の層の注意情報を予測して重要でない視覚トークンを刈り込むプラグアンドプレイ手法を提案した。
- ReplicateAnyScene: テキスト・視覚・空間の整合によるゼロショット動画から3Dシーンへの構成3D再構成2026/4/12
動画から自動で物体を分割し、3Dシーンとして構成するフレームワークを提案。手動プロンプトや追加視覚入力なしで、テキスト・視覚・空間の事前知識を統合し、高品質な構成3Dシーンを生成する。
- VAG: 身体化データ合成のためのデュアルストリーム動画-行動生成VLA2026/4/1
ロボットの基盤モデル学習用に、動画と行動を同時生成する統一フレームワークVAGを提案。動画と行動の整合性を高め、合成データでポリシーの汎化性能を向上させる。
- StableIDM: 時空間リファインメントによるマニピュレータ切断下での逆動力学モデルの安定化ロボット学習/逆動力学モデル2026/4/1
ロボットの視覚観測から動作指令を予測する逆動力学モデル(IDM)が、マニピュレータが画像から切れて見える状況で性能劣化する問題に対し、空間的特徴集約と時間的平滑化を組み合わせたフレームワークを提案し、精度と実ロボット成功率を向上させた。
- DriveDreamer-Policy: 幾何学的基盤を持つ世界行動モデルによる生成と計画の統合自動運転2026/4/1
運転タスク向けに、深度生成・将来ビデオ生成・動作計画を単一アーキテクチャで統合した世界行動モデルを提案し、閉ループ計画と世界生成の両方で高性能を達成した。
- ViVa: ロボット強化学習のためのビデオ生成価値モデル強化学習2026/4/1
事前学習済みのビデオ生成モデルを価値関数として再利用し、将来の身体状態とスカラー価値を同時に予測することで、ロボット操作タスクにおける価値推定を改善する手法を提案した。
- π-StepNFT: フローベースVLAのオンライン強化学習における広い空間には細かいステップが必要VLA/強化学習2026/3/1
フローベースの視覚言語行動モデルに対する新しい強化学習フレームワークを提案し、尤度計算や価値ネットワークを不要にして、単一の順伝播でステップごとのガイダンスを提供する。
- Vega: 自然言語指示による自動運転学習自動運転2026/3/1
多様な運転指示と軌道を含む大規模データセットを構築し、視覚と言語を統合して指示に従った軌道生成と計画を行う統一モデルVegaを提案した。
- SwiftVLA:軽量VLAモデルのための時空間ダイナミクスを最小オーバーヘッドで解き放つVLA2025/12/1
軽量な視覚言語モデルに4D特徴を融合トークンとマスク再構成で組み込み、推論時には4D入力を不要にして高速・省メモリで高性能なVLAモデルを実現した。
- GigaWorld-0:世界モデルをデータエンジンとして具現化AIを強化VLA2025/11/1
視覚・言語・行動(VLA)学習のためのデータ生成エンジンとして、動画生成と3D生成を統合した世界モデルフレームワークを提案し、実世界データなしでロボットの汎化性能とタスク成功率を向上させた。
- GigaBrain-0: ワールドモデルを活用した視覚-言語-行動モデルVLA2025/10/1
ワールドモデルで生成した多様なデータを活用し、実機データへの依存を抑えつつ汎化性能を高めたVLA基盤モデルを提案。RGBD入力と身体性Chain-of-Thoughtで長期的・移動を伴う器用な操作タスクの実世界性能を向上させた。
- VLA-R1:視覚-言語-行動モデルにおける推論能力の強化VLA2025/10/1
検証可能な報酬による強化学習とGRPOを組み合わせ、アフォーダンスや軌道に沿った思考連鎖を学習させることで、VLAモデルの推論と実行精度を高めた研究。
- R2RGEN: 空間的に汎化されたマニピュレーションのための実世界間3Dデータ生成マニピュレーション2025/10/1
点群の観測と行動のペアを直接拡張し、シミュレータやレンダリングを使わずに実世界データを生成するフレームワークを提案。空間的に多様なデータを効率的に生成し、模倣学習による汎化性能を高める。
- EgoDemoGen: ロボットマニピュレーションにおける視点汎化のための自己中心視点デモ生成マニピュレーション2025/9/1
自己中心視点が変化しても動作する模倣学習ポリシーのため、新視点での観測と行動のペアを生成するフレームワークを提案。軌道変換と条件付き動画生成を組み合わせ、シミュレーションと実機で成功率を大幅に改善した。
- EMMA: 生成的視覚転送による実世界ロボットマニピュレーションの汎化VLA2025/9/1
拡散Transformerでロボット操作動画を生成し、実データと混合してVLAポリシーを訓練することで、未知の視覚環境へのゼロショット汎化を実現した。
- MimicDreamer: 人間とロボットのデモンストレーションを統合しスケーラブルなVLA学習を実現VLA2025/9/1
人間の操作動画をロボット視点・動作に変換する映像拡散モデルと視点安定化・動作整合技術を組み合わせ、実機ロボットでの少数ショット実行を可能にするVLA学習フレームワークを提案。
- ヒューマノイド占有:汎用マルチモーダル占有知覚システムの実現占有知覚2025/7/1
ヒューマノイドロボット向けに、マルチモーダル融合と時系列統合を用いた占有グリッド知覚システムを構築し、専用のパノラマ占有データセットを整備した。
- EmbodieDreamer: 身体性ワールドモデリングによるReal2Sim2Real転送の促進sim2real2025/7/1
物理パラメータ最適化と動画拡散モデルでシミュレーションと実世界のギャップを埋め、ロボット政策学習を高精度化するフレームワークを提案。
- ReconDreamer: オンライン修復による走行シーン再構成のための世界モデル構築sim2real2024/11/1
世界モデルの知識を段階的に統合し、オンライン修復でアーティファクトを抑えることで、車線変更などの大規模な操作を含む走行シーンを高品質に再構成する手法を提案。
- 車輪脚変形モジュールを備えた汎用フィールド輸送ロボット移動ロボット2024/10/1
自己ロック式電動プッシュロッドで駆動する変形可能な車輪脚モジュールを備え、不整地や階段など様々な地形で荷物を輸送できる2種類のフィールドロボットを開発し、その設計・制御手法を実証した。
- 惑星探査ロボットのための粒状環境SLAMデータセットTAIL-PlusSLAM2024/4/1
砂浜を惑星表面の模擬環境として、車輪型と四足歩行ロボットにLiDARやRGB-Dカメラなどを搭載し、昼夜にわたる多様な走行データを収集したSLAM用データセットを公開した。
- TAIL: 変形可能な粒状環境におけるロボット移動のための地形認識型マルチモーダルSLAMデータセットSLAM2024/3/1
砂地などの変形可能な地形を走行するロボット向けに、ステレオカメラ・RGB-Dカメラ・3D LiDAR・IMU・RTKを同期したマルチモーダルSLAMデータセットを構築し、車輪型と四足歩行型の走行データを収集して既存SLAM手法を評価した。
- On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving2023/11/1
- Predict the Rover Mobility over Soft Terrain using Articulated Wheeled Bevameter2022/2/1
- The Field-of-View Constraint of Markers for Mobile Robot with Pan-Tilt Camera2019/9/1
- Human Following for Wheeled Robot with Monocular Pan-tilt Camera2019/9/1
- High Performance Visual Object Tracking with Unified Convolutional Networks2019/8/1
- Motion Control on Bionic Eyes: A Comprehensive Review2019/1/1