Congsheng Xu
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VT-MUSE: 操作のためのマルチモーダル統合シーケンシャル視触覚表現学習視触覚表現学習2026/8/21
視覚と触覚の時系列情報を統合する表現学習フレームワークを提案し、シミュレーションと実世界で操作タスクの成功率を大幅に向上させた。
- Orca:世界は心の中にある世界モデル2026/6/29
Orcaは、マルチモーダルな世界信号から統一された世界潜在空間を学習し、テキスト生成・画像予測・身体動作生成などの下流タスクを軽量デコーダで実現する世界基盤モデルである。
- π0-EqM: 閉ループ視覚言語行動制御のための平衡マッチングVLA/操作制御2026/5/1
VLAモデルの行動デコーダを平衡マッチングに置き換え、計算資源を状態に応じて適応的に配分し、ロボット操作の成功率を向上させた。
- BORA: オフライン強化学習とオンライン残差適応を橋渡しする実世界巧緻操作VLAモデルVLA/強化学習/巧緻操作2026/5/1
実世界の巧緻操作向けに、オフライン学習で価値関数を構築し、オンラインで人間介入による残差適応を行うVLAモデルの後訓練フレームワークを提案した。
- Rein3D: パノラマビデオ拡散モデルによる強化学習型3D屋内シーン生成3Dシーン生成2026/4/12
3Dガウススプラッティングとビデオ拡散モデルを組み合わせ、疎な入力から360度の一貫した3D屋内シーンを復元・生成するフレームワークを提案した。
- DexHiL:巧みな操作のための視覚-言語-行動モデル事後学習における人間参加型フレームワークマニピュレーション2026/3/1
腕と多指ハンドの協調操作を可能にする人間参加型フレームワークを提案し、実行中の人間による修正を活用した事後学習で成功率を平均25%向上させた。
- R3DP: 実時間3D認識ポリシーによる身体的操作マニピュレーション2026/3/1
大規模3D視覚モデルの強力な事前知識を、非同期の高速・低速協調モジュールと軽量な時間特徴予測ネットワークで統合し、実時間性能を保ちながら操作ポリシーの成功率を向上させる手法を提案した。
- UniVTAC: 視触覚マニピュレーションのデータ生成・学習・評価を統合するシミュレーションプラットフォーム視触覚/マニピュレーション2026/2/1
3種類の視触覚センサに対応したシミュレーション基盤で接触データを大量生成し、視触覚エンコーダと8タスクのベンチマークを提供して、触覚駆動型マニピュレーションの学習と評価を可能にした。
- HyCodePolicy:身体性エージェントにおけるマルチモーダル監視と意思決定のためのハイブリッド言語コントローラVLA2025/8/1
自然言語指示からコードを生成し、視覚言語モデルによる実行監視とコード修復を組み合わせて、ロボット操作タスクを自己修正しながら遂行するハイブリッド制御フレームワークを提案。
- 汎化可能な両腕マニピュレーションのベンチマーク:CVPR 2025 MEISワークショップにおけるRoboTwin両腕協調チャレンジマニピュレーション2025/6/1
RoboTwinシミュレーションと実機ロボットを用いた両腕マニピュレーションの国際コンペを開催し、17タスクで64チームが競い、汎化可能な協調方策の知見をまとめた。