Cheng Chi
Renmin University of China
収録論文 50本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- TacDyn-WAM: 異種視触覚ワールドアクションモデルにおける暗黙的触覚ダイナミクスの学習触覚2026/9/30
触覚の未来画像を再構成する代わりに、触覚ダイナミクスを表現空間で予測する視触覚ワールドアクションモデルを提案し、UniVTACで81.5%の成功率を達成した。
- ChunkTrust: 行動専門家の証拠に基づくロボット政策の実行ホライズン適応マニピュレーション2026/9/30
ロボット基盤政策が予測する行動チャンクの実行長を、固定値ではなく行動専門家の証拠から推論する潜在変数として扱い、訓練不要のセレクタと軽量アダプタで適応的に決定する手法を提案。
- RoboHarn-Evo: 階層的物理知識を進化させ自己改善するロボットマニピュレーションマニピュレーション2026/9/29
物理的な試行錯誤からタスク知識と行動知識を階層的に蓄積・修正し、基盤モデルを更新せずにロボット操作の成功率を高めるフレームワークを提案。
- MobileWAM: 世界行動モデルをチェーン・オブ・フォーサイトで移動操作に橋渡しする移動操作2026/8/5
移動操作のための世界行動モデルを提案し、事前学習済みのビデオ拡散トランスフォーマーと軽量な行動エキスパートを融合させ、移動と操作の異種ダイナミクスを扱う。また、中間表現が未来の潜在チャンクを逐次予測するCoFを導入し、実機でも高い性能を示した。
- JEPA-WAM: ロボット操作のためのワールドアクションモデルにおける段階レベル結合埋め込み予測操作2026/8/1
ロボット操作タスクにおいて、短期的な物理的未来と段階的な意味的未来を区別し、後者を予測するStage-JEPAを導入したワールドアクションモデルを提案。50タスクで成功率90.25%を達成し、実行ステップ数を削減した。
- JEPA-WAM: 共同埋め込み世界モデリングによる視覚-言語-行動ポリシーの学習VLA/世界モデル2026/8/1
事前学習済みV-JEPA空間に基づく潜在世界モデルを構築し、遷移予測と行動生成を共有予測器で結合することで、効率的かつ高精度なロボット制御を実現した。
- SaPaVe: ロボットの視覚言語行動モデルにおける能動的知覚と操作の実現VLA/能動的知覚/操作2026/3/1
能動的知覚と操作を統合するエンドツーエンドフレームワークSaPaVeを提案し、カメラと操作の行動を分離しつつ協調学習することで、動的視点下でのロバストな能動的操作を実現した。
- VAMPO: ビデオ行動モデルの視覚ダイナミクスを改善するポリシー最適化VLA2026/3/1
ビデオ行動モデルのノイズ除去を逐次決定過程とみなし、専門家の視覚ダイナミクスに基づく報酬でポリシー最適化を行うことで、操作に重要な視覚ダイナミクスを直接改善するフレームワークを提案。
- PRM-as-a-Judge:ロボットの細粒度監査のための高密度評価パラダイムロボット評価2026/3/1
ロボットの実行品質をバイナリ成功率ではなく、プロセス報酬モデル(PRM)を用いて軌道ビデオから密に評価する新しいパラダイムを提案し、OPD指標体系と診断ベンチマークRoboPulseで検証した。
- 信頼できる視覚-言語-行動モデルのための行動誤差分布の再形成VLA2026/2/1
連続行動VLAモデルの学習に最小誤差エントロピー(MEE)目的関数を導入し、MSEと組み合わせることで成功率とロバスト性を向上させた研究。
- 潜在推論VLA:視覚-言語-行動モデルのための潜在思考と予測VLA2026/2/1
Chain-of-Thought推論を連続潜在表現に内部化し、推論時の明示的生成を不要にすることで、最大90%の遅延削減を実現したVLAフレームワーク。
- 表現の相補性からデュアルシステムへ:VLMと視覚専用バックボーンの協調によるエンドツーエンド運転自動運転VLA2026/2/1
VLMと視覚専用エンコーダの表現を比較し、それぞれが得意な場面が異なることを示した上で、両者を組み合わせた運転モデルHybridDriveVLAを提案した。
- Action-Sketcher: 視覚スケッチを介した長期的ロボット操作のための推論から行動へVLA2026/1/1
ロボットの視界に点・箱・矢印・関係を描く「視覚スケッチ」を中間表現として導入し、See-Think-Sketch-Actのサイクルで長期的な操作を実現するVLAフレームワークを提案。
- RoboBrain 2.5:奥行きを見据え、時間を心に刻むVLA2026/1/1
深度認識に基づく3D空間推論と、時間的な進捗予測を統合した次世代の身体性AI基盤モデルを提案し、複雑なマニピュレーションの精度と実行認識を向上させた。
- 基盤モデル時代の身体性ロボットマニピュレーション:計画と学習の視点マニピュレーション2025/12/1
ロボットマニピュレーションの学習ベース手法を、高レベル計画と低レベル制御の統一的な枠組みで整理したサーベイ。言語・コード・動作・アフォーダンス・3D表現の推論や、入力モデリング・潜在表現学習・方策学習の分類を提示し、課題と展望を論じる。
- フリースタイルはできる?音声制御による表現豊かなヒューマノイド歩行歩行2025/12/1
音声から直接ヒューマノイドのダンスや身振りを生成する統一フレームワークRoboPerformを提案し、低遅延で高忠実な音声同期動作を実現した。
- RoboMirror: 模倣の前に理解する、動画からヒューマノイド歩行への変換VLA2025/12/1
VLMを用いて動画から視覚的な運動意図を抽出し、拡散ポリシーを条件付けることで、ポーズ再構成やリターゲティングなしにヒューマノイドの歩行を生成するフレームワークを提案。
- ロボティクスのための視覚言語モデルにおける推論を伴う空間トレースに向けてVLA2025/12/1
3D空間の参照と計測を統合したVLM「RoboTracer」を提案し、強化学習による多段階の空間推論を実現。大規模データセットとベンチマークも構築し、ロボットの長期的タスク実行に応用した。
- Robo-Dopamine: 高精度ロボットマニピュレーションのための汎用プロセス報酬モデリングマニピュレーション2025/12/1
多視点入力から段階的な進捗を理解する汎用報酬モデルを3400時間超のデータで学習し、理論的に整合した報酬整形で強化学習によるロボット操作を高精度化した。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- PIGEON: VLM駆動の関心点選択による物体ナビゲーション物体ナビゲーション2025/11/1
VLMを関心点(PoI)の選択に用いることで、未見屋内環境での物体ナビゲーションを効率的かつ検証可能にし、ゼロショットで最先端性能を達成した研究。
- 言語から運動へ:動作潜在ガイダンスによるリターゲティング不要なヒューマノイド制御VLA2025/10/1
言語指示から直接ヒューマノイドの動作を生成するフレームワークRoboGhostを提案し、従来の動作デコード・リターゲティングを省略して低遅延かつ高精度な制御を実現した。
- RoboBench:マルチモーダル大規模言語モデルを身体化脳として評価する包括的ベンチマークVLA2025/10/1
マニピュレーションの意思決定を担う「身体化脳」としてのマルチモーダルLLMを、指示理解・知覚推論・汎化計画・アフォーダンス予測・失敗分析の5次元で評価するベンチマークを提案した。
- RoboOS-NeXT:生涯学習・スケーラブル・堅牢なマルチロボット協調のための統合メモリフレームワーク群制御2025/10/1
空間・時間・身体性を統合した共有メモリSTEMを中核に、脳-小脳型の階層構造で異種ロボット群の生涯学習・動的タスク割当・障害復旧を実現するフレームワークを提案。
- TIGeR: ロボティクス向け視覚言語モデルにおけるツール統合幾何推論VLA2025/10/1
視覚言語モデルに外部ツールで正確な幾何計算を生成・実行させる枠組みを提案し、ロボット操作に必要なセンチメートル精度を実現した。
- VCoT-Grasp: 視覚的思考連鎖推論による言語駆動型把持生成のための把持基盤モデルマニピュレーション2025/10/1
視覚的思考連鎖推論を組み込んだエンドツーエンドの把持基盤モデルを提案し、大規模データセットを構築して、実環境での把持成功率と未知物体への汎化性能を向上させた。
- ロボットマニピュレーションの統合的理解に向けて:包括的サーベイマニピュレーション2025/10/1
ロボットマニピュレーション研究を、タスク別ベンチマーク・データセット・手法の統一的分類・ボトルネック・実応用まで幅広く整理した包括的サーベイ。
- RoboBrain 2.0 技術報告VLA2025/7/1
視覚と言語を統合し、実環境での知覚・推論・計画を担う具現化基盤モデルRoboBrain 2.0を提案。7Bと32Bの2種類で、空間理解や時系列意思決定タスクで高い性能を示す。
- RoboRefer: ロボティクス向け視覚言語モデルにおける推論を伴う空間指示VLA2025/6/1
3D空間理解と多段階推論を可能にする視覚言語モデルRoboReferを提案し、大規模データセットRefSpatialとベンチマークRefSpatial-Benchを導入して、空間指示タスクで最先端性能を達成した。
- RoboOS: クロスエンボディメントとマルチエージェント協調のための階層型具現化フレームワークマルチエージェント協調2025/5/1
脳と小脳の階層アーキテクチャに基づき、異なる身体を持つロボット間の協調と長期タスクの計画・実行を可能にするオープンソースの具現化システムを提案。
- Uni-Gaussians: ガウス表現による動的運転シーン向けカメラ・LiDAR統合シミュレーションsim2real2025/3/1
ガウスプリミティブを用いて、画像はラスタライズ、LiDARはガウスレイトレーシングで描画することで、動的運転シーンのカメラとLiDARデータを統一的かつ高速にシミュレーションする手法を提案した論文。
- Code-as-Monitor: 制約認識型ビジュアルプログラミングによるロボットの受動的・能動的障害検出VLA2024/12/1
VLMが生成したコードで時空間制約を評価し、ロボットの予期せぬ失敗の事後検出と予見可能な失敗の事前防止を統一的に実現する手法を提案。
- 適応コンプライアンスポリシー:拡散誘導制御のための近似コンプライアンス学習マニピュレーション2024/10/1
人間のデモから操作タスクに応じて空間的・時間的にシステムのコンプライアンスを動的に調整する枠組みを提案し、接触の多い複雑な操作タスクで従来の視覚運動ポリシーを50%以上上回る性能を達成した。
- ガウス不確かさを考慮した複雑環境向けリスク認識型局所軌道プランナRALTPER軌道計画2024/8/1
動的・静的障害物との衝突リスクを確率的に評価し、非線形最適化で安全かつ効率的な局所軌道を生成する自動運転プランナを提案した。
- 操作インターフェースとしてのフロー:Im2Flow2Actsim2real2024/7/1
物体の動き(フロー)を人間とロボットの共通インターフェースとして使い、人間の動画とシミュレーションのロボットデータだけで実世界の多様な操作スキルを獲得する学習フレームワーク。
- ManiWAV: 実環境の音声・視覚データからロボットマニピュレーションを学習マニピュレーション2024/6/1
手に装着する「耳」型デバイスで人間の実演を音声・視覚同期で収集し、接触の多いロボット操作スキルを実演から直接学習する手法を提案した。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- PaperBot:紙で実世界の道具を設計する学習マニピュレーション2024/3/1
紙を折る・切る・投げる動作を自己教師あり学習で最適化し、紙飛行機や紙グリッパーを実機ロボットで設計・使用する手法を提案。
- Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots2024/2/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- XSkill: Cross Embodiment Skill Discovery2023/7/1
- GICI-LIB: A GNSS/INS/Camera Integrated Navigation Library2023/6/1
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion2023/3/1
- RoboNinja: Learning an Adaptive Cutting Policy for Multi-Material Objects2023/2/1
- Robust Extrinsic Self-Calibration of Camera and Solid State LiDAR2023/2/1
- Cloth Funnels: Canonicalized-Alignment for Multi-Purpose Garment Manipulation2022/10/1
- DextAIRity: Deformable Manipulation Can be a Breeze2022/3/1
- Iterative Residual Policy: for Goal-Conditioned Dynamic Manipulation of Deformable Objects2022/3/1
- GarmentNets: Category-Level Pose Estimation for Garments via Canonical Space Shape Completion2021/4/1
- Occlusion-robust Deformable Object Tracking without Physics Simulation2021/1/1