Chensheng Peng
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CtrlWAM: 意図と予見を整合させた制御可能なワールドアクションモデルVLA2026/10/1
摂動させた行動をシミュレータで実行し、その視覚的結果と対応付けて学習することで、行動予測と映像生成の整合性を高めた制御可能なワールドアクションモデルを提案。
- RoboSTAR: ヒューマノイドロボットのための次スケール自己回帰手話翻訳手話生成2026/9/26
手話モーションを粗い時間解像度から細かく生成し、ヒューマノイドロボットで実行できるよう再ターゲティングするテキスト条件付き手話生成フレームワークを提案。
- 対話型ビデオ世界モデリングに向けて:フロンティア、課題、ベンチマーク、将来動向世界モデリング2026/5/31
本論文は、ユーザーのアクションを条件としたビデオや3D生成による対話型世界モデリングの研究動向、技術的課題、評価ベンチマークを体系的にレビューし、将来の研究方向を提案する。
- DiscreteRTC: 離散拡散ポリシーは自然な非同期実行器である拡散ポリシー/非同期実行2026/4/1
離散拡散ポリシーが本来持つインペインティング能力を活用し、非同期実行を実現する新しいポリシー「DiscreteRTC」を提案。連続的なRTCと比べて、追加コードなしで実装でき、推論コストも削減しつつ、動的タスクでの成功率が向上することを示した。
- スペクトラルスプラット:運転シーンのための外観分離型フィードフォワードガウシアンスプラッティング3D再構成/ガウシアンスプラッティング2026/4/1
運転シーンの3D再構成において、幾何学と外観(照明・天候など)を分離するフィードフォワードガウシアンスプラッティング手法を提案し、外観の転送や再照明を可能にした。
- VER: 基盤モデル蒸留と動的ルーティングによるロボット学習のための視覚エキスパートトランスフォーマーVLA2025/10/1
複数の視覚基盤モデルを蒸留してエキスパートライブラリを構築し、軽量なルーティングネットワークでタスクに応じた専門家を動的に選択することで、17種類のロボットタスクで最先端性能を達成した。
- R3D2: 拡散モデルによる自動運転シミュレーションへのリアルな3Dアセット挿入sim2real2025/6/1
拡散モデルを用いて、自動運転のニューラルレンダリングシーンに影や照明を考慮したリアルな3Dアセットをリアルタイムで挿入する手法を提案。
- BEV-GS: 鳥瞰図におけるフィードフォワードガウススプラッティングによる路面再構成路面再構成/ガウススプラッティング2025/4/1
単一フレームから鳥瞰図パラダイムで路面の形状とテクスチャを推定し、グリッドガウス表現でリアルタイムに高精度な路面再構成と新規視点合成を実現した。
- 事後サンプリングによる歩行者軌道の同時予測軌道予測2024/4/1
歩行者の過去と未来の軌道をまとめて拡散モデルで学習し、事後サンプリングによりノイズや欠損のある入力でも頑健に予測・生成できる手法GFTDを提案した。
- PNAS-MOT: パレート神経アーキテクチャ探索によるマルチモーダル物体追跡物体追跡2024/3/1
NASで追跡用の効率的なアーキテクチャを探索し、マルチモーダル化でロバスト性を高め、エッジデバイス上で低遅延な物体追跡を実現した研究。
- Interactive Multi-scale Fusion of 2D and 3D Features for Multi-object Tracking2022/3/1