Jia Zeng
収録論文 29本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GE-Act 2.0: ロボット操作のためのワールドアクションモデルの事前学習とスケーリングVLA2026/9/4
操作データのみで生成・行動コンポーネントをゼロから学習するワールドアクションモデルを提案し、大規模データでの事前学習とスケーリングの効果を検証した。
- RoboInter1.5: 身体性世界モデリングとロボット操作のための包括的中間表現スイート操作/データセット/世界モデル2026/7/1
ロボット操作と身体性世界モデリングのための、多様な中間表現(サブタスク、プリミティブスキル、物体・グリッパー接地、セグメンテーション、アフォーダンス、把持姿勢、接触点、動作軌跡など)を備えた大規模データセット、ベンチマーク、モデル群を構築した。
- KAI: データ効率的な関節物体操作のための運動学的認識インターフェースマニピュレーション2026/7/1
関節物体の運動学的構造を捉えた中間表現KAIを導入し、ポリシー学習に組み込むことで、少ないデモデータでも高い成功率を達成する手法を提案した。
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- EBench: 汎用モバイル操作ポリシーの要素診断ベンチマーク/モバイル操作2026/6/1
単一の成功率スコアを超えて、汎用モバイル操作ポリシーの能力と汎化を多次元で診断するシミュレーションベンチマークを提案し、最新モデルの特性を明らかにした。
- SIM1: 物理整合シミュレータによる変形物体世界でのゼロショットデータ拡張シミュレーション/変形物体操作2026/4/1
変形物体操作のための物理整合型シミュレータを提案し、少数の実デモから合成データを生成してポリシー学習を効率化する。実機で90%のゼロショット成功率を達成した。
- ForceVLA2: 力認識によるハイブリッド力-位置制御で接触を伴う操作を実現VLA/操作2026/3/1
接触を伴う操作のための視覚言語行動モデルに、力認識とハイブリッド力-位置制御を導入し、成功率を大幅に向上させた。
- UltraDexGrasp: 合成データによる双腕ロボットの汎用器用把持の学習把持2026/3/1
双腕ロボットのための多戦略・器用な把持を実現するフレームワークを提案し、大規模合成データセットと単純なポリシーでゼロショットの実機転送に成功した。
- FutureVLA: 視覚言語行動モデルのための統合視覚運動予測VLA2026/3/1
ロボットの行動予測において、視覚と運動の相互作用を捉える新しいアーキテクチャFutureVLAを提案。視覚情報と運動情報を分離しつつ、時間的連続性を保った統合予測を実現する。
- Robo3R: 高精度フィードフォワード3D再構成によるロボットマニピュレーションの強化マニピュレーション2026/2/1
RGB画像とロボット状態から実時間でメートルスケールの3Dシーンを再構成するフィードフォワードモデルを提案し、模倣学習や把持生成などの操作タスクで性能を向上させた。
- Nimbus: 具現化知能向け統合合成データ生成フレームワーク合成データ生成2026/1/1
ナビゲーションとマニピュレーションの合成データ生成パイプラインを統合し、非同期実行と動的スケジューリングでスループットを2〜3倍向上させるフレームワークを提案。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- RoboVIP: 視覚的アイデンティティプロンプティングによる多視点動画生成でロボットマニピュレーションを強化マニピュレーション2026/1/1
ロボット操作データを拡張するため、見本画像を条件に多視点で時間的に一貫した動画を生成する手法を提案し、模擬環境と実機で方策性能を向上させた。
- InternData-A1:汎用ポリシー事前学習のための高忠実度合成データVLA2025/11/1
大規模シミュレーションで生成した63万軌道超の合成データセットInternData-A1を構築し、合成データのみでVLAモデルを事前学習しても実データと同等の性能が得られることを示した。
- X-VLA:ソフトプロンプト付きTransformerによるスケーラブルなクロスエンボディメント視覚言語行動モデルVLA2025/10/1
多様なロボットのデータ源ごとに学習可能なソフトプロンプトを割り当てることで、異なる機体を横断して学習できる汎用VLAモデルX-VLAを提案し、6つのシミュレーションと3体の実機でSOTA性能を示した。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- FastUMI-100K:大規模UMI形式データセットによるデータ駆動型ロボットマニピュレーションの進展マニピュレーション2025/10/1
モジュール型ハードウェアと軽量トラッキングを備えたFastUMIシステムで収集した10万件超の家庭内タスク実演データセットを構築し、多様な模倣学習アルゴリズムで高い成功率を示した。
- F1: 理解と生成を行動に橋渡しする視覚-言語-行動モデルVLA2025/9/1
将来の視覚状態を予測する「視覚的先見」を意思決定に組み込み、それを目標として逆動力学で行動を生成するVLAフレームワークF1を提案し、実世界タスクとシミュレーションで成功率と汎化性能を大幅に向上させた。
- SimpleVLA-RL:強化学習によるVLAモデル訓練のスケーリングVLA2025/9/1
VLAモデル向けの効率的な強化学習フレームワークを提案し、大規模データへの依存を減らしつつLIBEROやRoboTwinで高性能を達成した。
- TeleOpBench:双腕巧みなテレオペレーションのためのシミュレータ中心ベンチマークテレオペレーション2025/5/1
双腕巧みなテレオペレーションの4つの方式(モーションキャプチャ、VR、外骨格、単眼視覚追跡)を30の高忠実度タスクで公平に比較評価するシミュレータベンチマークを提案し、実機実験との相関を確認した。
- 両手ロボット操作のためのインターフェースとしてのグリッパーキーポーズと物体点流マニピュレーション2025/4/1
グリッパーの目標姿勢と物体の点流を予測するインターフェースを連続行動推定と統合し、両手操作の精度と柔軟性を高めるフレームワークPPIを提案した。
- ガウススプラッティングによる新規デモ生成で実現するロバストなワンショットマニピュレーションマニピュレーション2025/4/1
3Dガウススプラッティングで再構成したシーンを直接編集し、多様で視覚的にリアルなデモを生成することで、ワンショット設定での視覚運動政策の汎化性能を大幅に向上させる手法RoboSplatを提案。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- HOMIE: 同型外骨格コックピットによるヒューマノイドの移動・操作遠隔操作2025/2/1
ペダル・同型外骨格アーム・モーションセンシンググローブを統合した半自律遠隔操作システムで、ヒューマノイドの全身移動と器用な物体操作を低コストかつ効率的に実現する。
- 予測的逆動力学モデルによるロボットマニピュレーションのスケーラブル学習マニピュレーション2024/12/1
ロボットの予測視覚状態に基づく逆動力学モデルで行動を予測するPIDMを提案し、大規模データで事前学習したSeerがシミュレーションと実世界で大幅な性能向上を達成した。
- ロボット操作のための相乗的・汎用的・効率的なデュアルシステムに向けてマニピュレーション2024/10/1
汎用ポリシーと専門ポリシーを組み合わせたデュアルシステムRoboDualを提案し、少ない学習データで高精度・高効率なロボット操作を実現した。
- 生成期待を用いた閉ループ視覚運動制御によるロボットマニピュレーションマニピュレーション2024/9/1
テキスト条件付き動画拡散モデルで視覚計画を生成し、誤差を定量化する埋め込み空間とフィードバック制御器を組み合わせて、長期的なロボット操作を閉ループで適応制御するフレームワークCLOVERを提案した。
- 相互作用予測によるマニピュレーション学習マニピュレーション2024/6/1
初期・最終状態と言語指示から遷移フレームと操作対象物体を予測する事前学習手法MPIを提案し、実機・シミュレーションで従来手法を10〜64%上回る性能を達成した。
- Delving into the Devils of Bird's-eye-view Perception: A Review, Evaluation and Recipe2022/9/1