Jiazhao Zhang
収録論文 33本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 基盤モデルを物理世界エージェントに組み込むことで長期的ナビゲーションの限界を押し広げるナビゲーション2026/8/31
VLMによる推論エージェントとナビゲーション基盤モデルを組み合わせたフレームワークNavMCPを提案し、長期的な探索タスクで高い性能を達成した。
- ReferTrack: 参照してから追跡する身体化視覚追跡手法視覚追跡2026/7/1
身体化視覚追跡において、自然言語で指定された対象をまず画像中のバウンディングボックスから選択し、その選択に基づいて追跡経路を生成する「参照→追跡」パラダイムを提案。時間的な対象情報を保持する工夫と参照QA学習により、単眼カメラで高い追跡成功率を達成し、実ロボットでも有効性を確認した。
- Qwen-RobotManip技術報告:アライメントがロボット操作基盤モデルのスケールを解放するVLA/基盤モデル2026/6/16
ロボット操作のための視覚言語行動基盤モデルQwen-RobotManipを提案し、異種データを統一フレームワークで整列させることで大規模学習を可能にし、ゼロショット汎化やクロスエンボディ転移などの創発的能力を示した。
- Qwen-RobotWorld 技術報告:言語条件付きビデオ生成による身体化世界モデルの統合世界モデル/ビデオ生成2026/6/15
自然言語を統一アクションインターフェースとして用い、現在の観測から物理的に妥当な未来の視覚軌跡を予測する言語条件付きビデオ世界モデルを提案。ロボット操作、自動運転、屋内ナビゲーション、人間からロボットへの転移を統一的に扱い、データ生成・評価環境・計画信号の3つの応用を示す。
- Qwen-RobotNav 技術報告:エージェント型ナビゲーションシステム向けのスケーラブルなナビゲーションモデルナビゲーション2026/6/1
本論文は、推論時に外部から観測戦略を再構成可能なパラメータ化インターフェースを持つスケーラブルなナビゲーションモデルQwen-RobotNavを提案し、複数のタスクモードと観測パラメータを導入して、指示追従や物体探索などの多様なナビゲーション行動を単一モデルで実現する。
- PAIWorld: ロボット操作のための3D整合性を持つ世界基盤モデル世界モデル2026/6/1
複数視点の3D整合性を保つ世界基盤モデルを提案し、ロボット操作のための予測と計画を改善した。
- AllDayNav: 実世界強化学習による生涯ナビゲーションナビゲーション2026/6/1
動的環境での生涯ナビゲーションのために、明示的な地図やシーングラフを使わず、大規模モデルに強化学習でシーン動態を暗黙的に符号化し、自己進化するマルチモーダルメモリで長期動作を実現するフレームワークを提案した。
- DynaMOMA: 動的物体のモバイル操作のための把持姿勢の瞬時予測モバイルマニピュレーション2026/6/1
動的物体を移動しながら把持するために、アンカーベース拡散モデルで短期的な把持軌道を予測し、全身強化学習ポリシーと統合するフレームワークを提案。シミュレーションと実機で有効性を実証。
- Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合VLA2026/5/1
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
- Habitat-GS: 動的ガウシアンスプラッティングを用いた高忠実度ナビゲーションシミュレータシミュレーション2026/4/1
Habitat-Simを拡張し、3Dガウシアンスプラッティングによる高精細なシーン描画と、駆動可能なガウシアンアバターによる動的人間モデリングを統合したナビゲーション用シミュレータを提案した。
- NavGSim: 大規模ナビゲーションのための高忠実度ガウススプラッティングシミュレータシミュレーション2026/3/1
3Dガウススプラッティングに基づく大規模ナビゲーション向けの高忠実度シミュレータを提案し、実環境でのVLAモデルのナビゲーション性能を向上させる。
- SPAN-Nav: 多様な視覚言語ナビゲーションのための汎用空間認識VLA2026/3/1
RGB動画から占有予測で空間事前知識を学習し、単一トークンで空間手がかりを行動推論に注入する視覚言語ナビゲーション基盤モデルを提案。
- LDA-1B:汎用身体データ取り込みによる潜在ダイナミクス行動モデルのスケーリングVLA2026/2/1
異種の身体データからダイナミクス・方策・視覚予測を統合学習する10億パラメータのロボット基盤モデルを提案し、接触・器用・長距離タスクで性能を向上させた。
- ReWorld: 身体性ワールドモデルのための多次元報酬モデリングワールドモデル2026/1/1
ロボット学習向け動画ベースのワールドモデルを、物理的忠実性・タスク論理・身体性・視覚品質の多次元報酬で強化学習により人間の選好に整合させるフレームワークを提案。
- AdaPower: 予測的マニピュレーションのための世界基盤モデルの特化マニピュレーション2025/12/1
汎用世界基盤モデルを推論時適応と記憶持続で軽量に特化させ、事前学習済みVLAを再訓練なしで強化するフレームワークを提案。
- MM-Nav: マルチビューVLAモデルによるマルチエキスパート学習を用いた堅牢な視覚ナビゲーションVLA2025/10/1
360度視野のマルチビューVLAモデルを強化学習エキスパートのデータから教師あり学習し、到達・すり抜け・回避の能力を統合して実世界でも汎化する視覚ナビゲーションを実現した。
- UrbanVLA:都市マイクロモビリティのための視覚-言語-行動モデルVLA2025/10/1
都市環境での配達ロボットなどのナビゲーションに向け、経路指示と視覚情報を統合して行動を計画するVLAフレームワークを提案し、シミュレーションと実世界データで二段階学習することで大規模都市ナビゲーションを実現した。
- TrackVLA++:具現化視覚追跡のための推論と記憶能力を引き出すVLAモデルVLA2025/10/1
移動する対象を追跡する具現化視覚追跡において、空間推論と長期記憶のモジュールを導入し、遮蔽や類似物体に強いVLAモデルを提案した。
- 身体性ナビゲーション基盤モデルナビゲーション基盤モデル2025/9/1
四足歩行・ドローン・車輪ロボット・車両にまたがる800万件のナビゲーションサンプルで学習し、視覚言語ナビゲーションや物体探索、追跡、自動運転など多様なタスクを単一アーキテクチャでこなす基盤モデルを提案。
- DreamVLA: 包括的な世界知識を夢見る視覚-言語-行動モデルVLA2025/7/1
動的・空間・意味情報を統合した世界知識予測により逆動力学モデリングを行い、知覚-予測-行動ループを実現する新しいVLAフレームワークを提案。
- OctoNav: 汎用身体性ナビゲーションに向けてナビゲーション2025/6/1
マルチモーダルで多能力な自由形式指示に従える汎用ナビゲーションエージェントのための大規模ベンチマークOctoNav-Benchと、MLLMをVLA化したOctoNav-R1を提案。
- TrackVLA: 実環境における身体性視覚追跡VLA2025/5/1
視覚と言語と行動を統合したVLAモデルで、対象認識と軌道計画を同時に学習し、遮蔽や動きの激しい実環境でも10FPSで頑健に目標を追跡する。
- LaDi-WM: 予測的マニピュレーションのための潜在拡散ベース世界モデルマニピュレーション2025/5/1
事前学習済み視覚基盤モデルの潜在空間を拡散モデルで予測する世界モデルを提案し、予測状態を活用した拡散ポリシーによりマニピュレーション性能を大幅に向上させた。
- RoboVerse:スケーラブルで汎化可能なロボット学習のための統合プラットフォーム・データセット・ベンチマークsim2real2025/4/1
複数のシミュレータとロボット形態に対応する統合シミュレーション基盤MetaSimと、高品質な合成データセット、模倣学習・強化学習の統一ベンチマークを提供するフレームワークを提案。
- SoFar: 言語に基づく物体の向きが空間推論と物体操作を橋渡しするVLA2025/2/1
自然言語で物体の向きを定義する「意味的向き」を導入し、大規模データセットとゼロショット予測モデルを構築して、6自由度の空間推論とロボット動作生成を可能にした。
- Uni-NaVid:身体性ナビゲーションタスクを統合する動画ベースの視覚-言語-行動モデルナビゲーション2024/12/1
指示追従・物体探索・質疑応答・人物追跡など多様なナビゲーションタスクを単一モデルで統合し、未知の実環境での長期的な混合タスクを可能にする動画ベースのVLAモデルを提案。
- CogNav: LLMによる物体目標ナビゲーションの認知プロセスモデリング物体目標ナビゲーション2024/12/1
大規模言語モデルを用いて人間の物体探索時の認知状態遷移を有限状態機械でモデル化し、未知環境での物体目標ナビゲーションの成功率を向上させた研究。
- GAPartManip:材質に依存しない関節物体操作のための大規模パーツ中心データセットマニピュレーション2024/11/1
透明な蓋や反射する取っ手など深度知覚が難しい家庭内の関節物体を操作するため、材質ランダム化とパーツ単位の操作姿勢注釈を備えた大規模データセットを構築し、頑健な操作を可能にするモジュール型フレームワークを提案した。
- InstruGen: 大規模マルチモーダルモデルによる視覚言語ナビゲーション向け指示文の自動生成VLA2024/11/1
YouTubeの住宅ツアー動画を実環境に近いナビゲーション場面として使い、大規模マルチモーダルモデルで多様で高品質な経路と指示文のペアを自動生成する手法を提案し、未見環境での性能を向上させた。
- NaVid: ビデオベースVLMが視覚言語ナビゲーションの次の一歩を計画するVLA2024/2/1
単眼RGBカメラの動画ストリームのみから次の行動を出力するビデオベース大規模視覚言語モデルNaVidを提案し、地図・オドメトリ・深度なしでシミュレーションと実世界の両方で最先端のナビゲーション性能を達成した。
- GAMMA: Graspability-Aware Mobile MAnipulation Policy Learning based on Online Grasping Pose Fusion2023/9/1
- 3D-Aware Object Goal Navigation via Simultaneous Exploration and Identification2022/12/1
- GraspNeRF: Multiview-based 6-DoF Grasp Detection for Transparent and Specular Objects Using Generalizable NeRF2022/10/1