Chaojun Ni
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GigaWorld-1: ロボットポリシー評価のためのワールドモデル構築ロードマップワールドモデル2026/7/1
ロボットポリシーの評価を効率化するため、ワールドモデルの信頼性を体系的に研究し、ベンチマークWMBenchを構築して、7つのビデオワールドモデルと4つの行動表現を比較した。
- HALO-WA: ハイブリッド注意機構と潜在変数ガイドによるオンライン強化学習を用いた世界行動モデル強化学習/操作2026/7/1
世界行動モデルによる精密操作の失敗を、潜在特徴と行動事前分布を利用した軽量なアクタークリティック適応器とハイブリッド注意機構でオンライン修正する手法を提案し、実機4タスクで成功率を大幅に向上させた。
- GigaWorld-Policy-0.5: AutoResearchによる高速・高精度なWAMの実現VLA2026/7/1
将来の視覚予測を訓練時のみに用い、推論時は行動生成のみで高速化した行動中心のWorld Action Modelを提案し、AutoResearchで最適設定を探索して性能を向上させた。
- NativeMEM: 長期ホライズンのロボット操作のためのネイティブメモリ圧縮VLA/長期メモリ/操作2026/7/1
事前学習済みVLAモデルが高頻度更新で長い視覚履歴を保持できるように、VLA自身の視覚エンコーダを再利用して各フレームを単一トークンに圧縮するメモリ圧縮方式を提案。外部メモリや新規モジュール不要で、シミュレーション成功率を32.4%から84.0%に向上させた。
- 対話型ビデオ世界モデリングに向けて:フロンティア、課題、ベンチマーク、将来動向世界モデリング2026/5/31
本論文は、ユーザーのアクションを条件としたビデオや3D生成による対話型世界モデリングの研究動向、技術的課題、評価ベンチマークを体系的にレビューし、将来の研究方向を提案する。
- VAG: 身体化データ合成のためのデュアルストリーム動画-行動生成VLA2026/4/1
ロボットの基盤モデル学習用に、動画と行動を同時生成する統一フレームワークVAGを提案。動画と行動の整合性を高め、合成データでポリシーの汎化性能を向上させる。
- ViVa: ロボット強化学習のためのビデオ生成価値モデル強化学習2026/4/1
事前学習済みのビデオ生成モデルを価値関数として再利用し、将来の身体状態とスカラー価値を同時に予測することで、ロボット操作タスクにおける価値推定を改善する手法を提案した。
- SwiftVLA:軽量VLAモデルのための時空間ダイナミクスを最小オーバーヘッドで解き放つVLA2025/12/1
軽量な視覚言語モデルに4D特徴を融合トークンとマスク再構成で組み込み、推論時には4D入力を不要にして高速・省メモリで高性能なVLAモデルを実現した。
- GigaWorld-0:世界モデルをデータエンジンとして具現化AIを強化VLA2025/11/1
視覚・言語・行動(VLA)学習のためのデータ生成エンジンとして、動画生成と3D生成を統合した世界モデルフレームワークを提案し、実世界データなしでロボットの汎化性能とタスク成功率を向上させた。
- GigaBrain-0: ワールドモデルを活用した視覚-言語-行動モデルVLA2025/10/1
ワールドモデルで生成した多様なデータを活用し、実機データへの依存を抑えつつ汎化性能を高めたVLA基盤モデルを提案。RGBD入力と身体性Chain-of-Thoughtで長期的・移動を伴う器用な操作タスクの実世界性能を向上させた。
- MimicDreamer: 人間とロボットのデモンストレーションを統合しスケーラブルなVLA学習を実現VLA2025/9/1
人間の操作動画をロボット視点・動作に変換する映像拡散モデルと視点安定化・動作整合技術を組み合わせ、実機ロボットでの少数ショット実行を可能にするVLA学習フレームワークを提案。
- EMMA: 生成的視覚転送による実世界ロボットマニピュレーションの汎化VLA2025/9/1
拡散Transformerでロボット操作動画を生成し、実データと混合してVLAポリシーを訓練することで、未知の視覚環境へのゼロショット汎化を実現した。
- EmbodieDreamer: 身体性ワールドモデリングによるReal2Sim2Real転送の促進sim2real2025/7/1
物理パラメータ最適化と動画拡散モデルでシミュレーションと実世界のギャップを埋め、ロボット政策学習を高精度化するフレームワークを提案。
- ReconDreamer: オンライン修復による走行シーン再構成のための世界モデル構築sim2real2024/11/1
世界モデルの知識を段階的に統合し、オンライン修復でアーティファクトを抑えることで、車線変更などの大規模な操作を含む走行シーンを高品質に再構成する手法を提案。