Ran Cheng
Swancor Advanced Materials Co., Ltd.
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 1500時間のデモからオン方針修正までの両腕家庭操作のスケーリング両腕操作/VLA/データセット2026/9/3
家庭内両腕操作タスクの1500時間のデモデータセットを公開し、VLAモデルXR-2を訓練。データ量とDAgger修正データの増加に伴い成功率が向上するスケーリング傾向を実証した。
- 行動から世界モデリングへの転移可能なダイナミクス事前学習世界モデル/事前学習2026/6/1
ロボット操作データを用いて行動条件付きの世界モデルを事前学習し、そのダイナミクス事前知識をシミュレータとポリシー学習の両方に転移させる手法を提案した。
- VAMPO: ビデオ行動モデルの視覚ダイナミクスを改善するポリシー最適化VLA2026/3/1
ビデオ行動モデルのノイズ除去を逐次決定過程とみなし、専門家の視覚ダイナミクスに基づく報酬でポリシー最適化を行うことで、操作に重要な視覚ダイナミクスを直接改善するフレームワークを提案。
- 実用的なVLA基盤モデルVLA2026/1/1
9種類の双腕ロボットから約2万時間の実世界データを収集し、4つのロボットプラットフォームで評価した汎用性の高いVLA基盤モデルLingBot-VLAを開発した。
- グレートマーチ100:身体性AIエージェント評価のための100の詳細指向タスクVLA評価ベンチマーク2026/1/1
ロボット学習の評価に向けて、多様な相互作用とロングテール行動を網羅する100の詳細設計タスク「GM-100」を提案し、複数のVLAモデルの性能差を明確に評価できることを示した。
- ChatVLA:視覚・言語・行動モデルによるマルチモーダル理解とロボット制御の統合VLA2025/2/1
視覚言語行動モデルにおける「忘却」と「タスク干渉」を解決するため、段階的アライメント訓練とMixture-of-Expertsを組み合わせたChatVLAを提案し、マルチモーダル理解と実ロボット操作の両方で高性能を実現した。
- CoA-VLA: 視覚・テキストのアフォーダンス連鎖による視覚言語行動モデルの改善VLA2024/12/1
ロボットの行動予測に、物体・把持・空間・移動の4種類のアフォーダンスを視覚とテキストで段階的に推論させることで、複雑なタスクでの精度と頑健性を高める手法を提案。
- SHIFTプランナ: IKD-treeを用いた高速ハイブリッド反復場・分割軌道最適化による均一軽量カバレッジカバレッジ計画2024/12/1
単眼カメラ・IMU・GPSと地形情報を統合し、拡散場モデルで環境の汚れや乾燥度に応じて速度と軌道を適応させる、均一カバレッジの計画・ナビゲーション手法を提案した。
- ロボット操作のための10億パラメータへの拡散方策のスケーリング模倣学習2024/9/1
拡散方策のスケーリング問題を解決するため、観測特徴の分解と非因果的注意を用いたスケーラブル拡散トランスフォーマー方策を提案し、10億パラメータまで拡張可能にした。
- TinyVLA: ロボットマニピュレーションのための高速・データ効率的な視覚言語行動モデルVLA2024/9/1
大規模事前学習不要で高速推論が可能なコンパクトな視覚言語行動モデルTinyVLAを提案し、シミュレーションと実機でOpenVLAを上回る速度とデータ効率を実現した。
- Scale jump-aware pose graph relaxation for monocular SLAM with re-initializations2023/7/1
- Rethinking Population-assisted Off-policy Reinforcement Learning2023/5/4
- S3E-GNN: Sparse Spatial Scene Embedding with Graph Neural Networks for Camera Relocalization2022/5/1
- (AF)2-S3Net: Attentive Feature Fusion with Adaptive Feature Selection for Sparse Semantic Segmentation Network2021/2/1
- S3CNet: A Sparse Semantic Scene Completion Network for LiDAR Point Clouds2020/12/1