Jiayi Chen
Peking University
収録論文 39本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniWAM:統合された世界行動モデルVLA2026/10/1
物理推論・映像生成・行動予測を統合したモデルで、人間の一人称視点データとロボットデータを活用し、複数の評価でSOTAを達成した。
- 離散フォーシング:連続デノイジングに離散ガイダンスを注入する少数ステップ行動エキスパートVLA2026/9/30
VLAモデルにおいて、離散行動トークンで粗い行動構造を予測し、それを連続行動の精緻化のガイダンスとして用いるフローマッチング手法を提案。パラメータ数を抑えつつ高精度・高速推論を実現した。
- GIF: ロボット学習のための対話的・機能的オブジェクト構成のエージェント生成データ生成2026/9/5
ロボット操作の基盤モデル学習用に、対話的で機能的なオブジェクト構成を自動生成するエージェントフレームワークGIFを提案。2D/3D生成モデルとVLM検証を組み合わせ、衝突率1%未満で高品質なシーン生成を実現し、シミュレーションと実世界でのポリシー学習に有効性を示した。
- ZETA: テーブルトップ操作におけるゼロショット・クロスエンボディメントVLA転移の統制研究VLA/転移学習2026/9/2
異なるロボット形態へのゼロショット転移を体系的に評価するため、厳密な定義と統制ベンチマークを導入し、状態表現・事前学習の多様性・補助学習・対象形態の露出の影響を分析した。
- VISTA: 視覚から推定する空間接触注意による高密度接触操作マニピュレーション2026/8/26
接触を伴う精密操作のため、視覚のみからグリッパの変形を推定し、触覚センサなしで接触情報を獲得する模倣学習フレームワークを提案した。
- 前方予測だけで十分か?JEPAワールドモデルのための物理状態接地ワールドモデル2026/8/1
JEPAベースのワールドモデルに、ロボットの自己受容状態と関節角変化を接地する2つの目的を追加し、潜在表現の識別性と下流タスク性能を向上させる手法を提案した。
- 4D-WAM: 軌跡フィールドによる世界行動モデルへの時空間認識の注入VLA2026/8/1
ロボットの行動生成と動画予測を統合する世界行動モデルに対し、3D軌跡フィールドからの時空間知識を表現整合で注入する訓練戦略を提案し、空間理解と実行精度を向上させた。
- KPGrasp: 器用な把持生成のためのスケーラブルなキーポイントフローマッチングマニピュレーション2026/6/1
接触損失やテスト時の接触ベースの改良に頼らず、大規模データから器用な把持の事前分布を学習するフローマッチングフレームワークを提案した。
- RoboMemArena:ロボット記憶のための包括的で挑戦的なベンチマークベンチマーク/VLA/記憶2026/5/1
ロボットの長期タスクにおける記憶能力を評価するため、26タスク・平均1000ステップ超の大規模ベンチマークRoboMemArenaを構築し、VLMによるサブタスク生成と実世界評価を備えた。さらに、記憶管理と予測符号化を統合したVLAモデルPrediMemを提案し、既存手法を上回る性能を示した。
- 大規模モデルの推論とリアルタイム制御を橋渡しするエージェント型高速・低速計画自動運転/計画2026/4/1
大規模言語モデルの推論と実時間制御を階層的に統合する枠組みを提案し、CARLA実験でMPC単独やA*誘導MPCと比べて外乱下での横偏差を最大45%削減、完了時間を12%以上短縮した。
- BiDexGrasp: 物体の形状とサイズを考慮した協調的な両手巧みな把持マニピュレーション2026/4/1
両手ロボットハンドによる巧みな把持のための大規模データセットと生成モデルを提案し、効率的なデータ合成パイプラインと協調・適応的な把持生成フレームワークを構築した。
- DFM-VLA: 離散フローマッチングによる反復的な行動洗練でロボットマニピュレーションを実現VLA2026/3/1
行動トークンを反復的に洗練する離散フローマッチング型VLAを提案し、初期のトークン誤りを後から修正できるようにしてマニピュレーション精度を向上させた。
- 散らかった環境における動力学を考慮した方策学習による外在的器用さの創発マニピュレーション2026/3/1
散らかった環境での物体操作に向け、接触による物体動力学を明示的にモデル化して強化学習の方策を条件付けるDAPLフレームワークを提案し、シミュレーションと実世界で従来手法を上回る成功率を達成した。
- TacDexGrasp: 触覚フィードバックによる柔軟で堅牢な器用把持器用操作/触覚2026/3/1
触覚フィードバックとSOCP制御器を用いて、多指ハンドによる未知物体の把持安定性を向上させる手法を提案。回転滑りが並進滑りを誘発する性質を利用し、各指の接線力と法線力の比を摩擦係数以下に制御することで、並進・回転滑りを防ぐ。
- GraspADMM: ADMM最適化による巧みな把持合成の改善マニピュレーション2026/3/1
物体上の目標接触点と手の実際の接触位置をADMMで分離し、把持の多様性を保ちながら動的安定性と運動学的実現可能性を両立させる把持合成フレームワークを提案した。
- Fast-dVLA: 離散拡散VLAを実時間性能へ高速化VLA/拡散モデル/ファインチューニング2026/3/1
事前学習済みVLAモデルの性能向上と適応コスト削減を両立するため、補助タスクの能力ベクトルをパラメータ空間で分離・統合する手法を提案し、軽量な正則化で標準SFTと同等の性能を低計算コストで実現した。
- LDA-1B:汎用身体データ取り込みによる潜在ダイナミクス行動モデルのスケーリングVLA2026/2/1
異種の身体データからダイナミクス・方策・視覚予測を統合学習する10億パラメータのロボット基盤モデルを提案し、接触・器用・長距離タスクで性能を向上させた。
- Vision-language-actionモデルの実用性を再考する:包括的ベンチマークと改良ベースラインVLA2026/2/1
VLAモデルの実用性を評価する新ベンチマークCEBenchを提案し、その知見に基づき軽量で実用的なLLaVA-VLAを開発した。
- 基盤モデル時代の身体性ロボットマニピュレーション:計画と学習の視点マニピュレーション2025/12/1
ロボットマニピュレーションの学習ベース手法を、高レベル計画と低レベル制御の統一的な枠組みで整理したサーベイ。言語・コード・動作・アフォーダンス・3D表現の推論や、入力モデリング・潜在表現学習・方策学習の分類を提示し、課題と展望を論じる。
- 統合拡散VLA:離散デノイジング拡散プロセスによる視覚・言語・行動モデルVLA2025/11/1
視覚・言語・行動を単一の離散デノイジング拡散過程で統合し、画像生成と行動予測を同時に最適化するVLAモデルを提案。CALVINやLIBEROなどで最高性能を達成。
- 一般物体に対するロバストな微分可能衝突検出マニピュレーション2025/11/1
凸凹物体に対応した微分可能な衝突検出フレームワークを提案し、距離ベースの平滑化と適応サンプリングで勾配計算を安定化、把持合成に応用した。
- ロボットマニピュレーションの統合的理解に向けて:包括的サーベイマニピュレーション2025/10/1
ロボットマニピュレーション研究を、タスク別ベンチマーク・データセット・手法の統一的分類・ボトルネック・実応用まで幅広く整理した包括的サーベイ。
- ReconVLA:再構成型視覚-言語-行動モデルによる効果的なロボット知覚VLA2025/8/1
視覚的注意を対象領域に正しく向けるため、注視領域を再構成する拡散トランスフォーマを組み込んだVLAモデルを提案し、精密操作と汎化性能を実証した。
- FlowVLA: 視覚的思考連鎖による動作推論を用いた視覚-言語-行動モデルVLA2025/8/1
未来フレーム予測の前にオプティカルフローで動作を推論するVisual CoTを導入し、物理的に妥当な予測と高効率なロボット操作を実現した。
- DexVLG: 大規模巧みな視覚-言語-把持モデルマニピュレーション2025/7/1
単視点RGBD入力から言語指示に沿った巧みな手の把持姿勢を予測する大規模モデルを提案し、1.7億の把持データで学習してゼロショット汎化性能を実証した。
- RationalVLA:デュアルシステムを備えた合理的視覚言語行動モデルVLA2025/6/1
曖昧・不可能な指示を拒否しつつ、実行可能な指示に基づくロボットアーム操作を行う二重システムの視覚言語行動モデルを提案し、新ベンチマークRAMAで評価した。
- CEED-VLA: 早期終了デコーディングを備えた一貫性視覚-言語-行動モデルVLA2025/6/1
視覚-言語-行動モデルの推論を高速化するため、一貫性蒸留と早期終了デコーディングを導入し、4倍以上の加速を実現した。
- GraspVLA:10億規模の合成行動データで事前学習した把持基盤モデルVLA2025/5/1
シミュレーションで生成した10億フレームの把持データセットSynGrasp-1Bを用いて、視覚・言語・行動を統合したVLAモデルGraspVLAを事前学習し、実世界でのゼロショット汎化と少数ショット適応を実現した。
- 大規模視覚モデル誘導制御とクエリ・サービス最適化を統合した機会的協調プランニング自動運転/協調プランニング2025/4/1
自動運転車の未知物体対応のため、ローカルモデルとクラウド上の大規模視覚モデルを適切なタイミングで協調させる機会的協調プランニングを提案し、ナビゲーション時間と成功率を改善した。
- Dexonomy: 把持分類に基づく全巧み把持タイプの合成マニピュレーション2025/4/1
GRASP分類の31種類すべてを含む把持を合成するパイプラインを提案し、1070万物体・950万把持のデータセットを構築、タイプ条件付き生成モデルを学習した。
- PD-VLA: 並列デコーディングによるアクションチャンキング統合VLAモデルの高速化VLA2025/3/1
アクションチャンキングを統合したVLAモデルの推論を並列固定点反復で高速化するPD-VLAを提案し、成功率を維持しつつ実行周波数を2.52倍に向上させた。
- BODex: 二段階最適化によるスケーラブルで効率的なロボット巧み把持合成マニピュレーション2024/12/1
把持合成を二段階最適化問題として定式化し、GPU並列化により毎秒49把持以上を生成する高速システムとMuJoCoベンチマークを開発。生成データで学習モデルの成功率が40%から80%に向上。
- RoboHanger: 多様な衣類へのハンガー挿入を学習する汎化可能なロボットシステムマニピュレーション2024/12/1
平置きされた未知の衣類にハンガーを挿入するタスクを、サブタスク分割と低次元行動パラメータ化、シミュレータでの合成データ生成により学習し、実世界で8種類の未見衣類に対し75%の成功率を達成した。
- DexGraspNet 2.0:大規模合成乱雑シーンでの生成的器用把持の学習マニピュレーション2024/10/1
1319物体・8270シーン・4億2700万把持からなる大規模合成ベンチマークを構築し、局所形状を条件とする拡散モデルによる二段階把持手法を提案。乱雑シーンでの実世界把持成功率90.7%を達成。
- D3RoMa: 素材に依存しないロボットマニピュレーションのための視差拡散ベース深度センシング深度推定2024/9/1
ステレオ画像から拡散モデルで視差マップを予測し、透明・鏡面物体でも高精度な深度推定を実現してロボット操作を改善する手法を提案。
- Task-Oriented Dexterous Hand Pose Synthesis Using Differentiable Grasp Wrench Boundary Estimator2023/9/1
- UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy2023/3/1
- PartManip: Learning Cross-Category Generalizable Part Manipulation Policy from Point Cloud Observations2023/3/1
- DexGraspNet: A Large-Scale Robotic Dexterous Grasp Dataset for General Objects Based on Simulation2022/10/1