Xilin Chen
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EMPIRE: 明示的操作計画を学習可能な中間表現として用いた自己中心視ハンドモーション予測ハンドモーション予測2026/8/23
自己中心視の映像から将来の両手の動きを予測する際に、操作計画を中間表現として明示的に学習する2段階フレームワークを提案し、大規模データセットを構築してSOTA精度を達成した。
- EgoMotion: 一人称視点の視覚言語モーション生成のための階層的推論と拡散モーション生成2026/4/21
一人称視点の映像と言語指示から3D人間動作を生成するタスクを扱い、推論と生成の絡み合い問題を解決するため、認知推論段階と動作生成段階からなる階層的生成フレームワークEgoMotionを提案した。
- GEAR: ガウススプラッティングによる関節物体モデリングのための幾何-運動交互最適化3D再構築2026/4/1
関節物体の高精度な再構築と運動パラメータ推定を実現するため、EMスタイルの交互最適化フレームワークを提案し、幾何と運動を相互依存的にモデル化した。
- Uni-Skill: 汎用ロボット操作のための自己進化型スキルリポジトリの構築マニピュレーション2026/3/1
固定スキルライブラリに依存せず、既存スキルが不十分な場合に新しいスキルを自動生成・追加することで、適応的なプランニングを可能にする統一スキル中心フレームワークを提案した。
- RoboPCA: 人間のデモンストレーションからの姿勢中心のアフォーダンス学習によるロボット操作マニピュレーション2026/3/1
ロボット操作のための、指示に応じた接触領域と接触姿勢を同時に予測する姿勢中心のアフォーダンス予測フレームワークを提案し、人間のデモからデータを自動収集するパイプラインも導入した。
- BitVLA: ロボットマニピュレーションのための1ビット視覚言語行動モデルVLA2025/6/1
全てのパラメータを3値{-1,0,1}に量子化した1ビットVLAモデルを提案し、メモリを11倍削減しつつ全精度ベースラインと同等のマニピュレーション性能を実現した。
- Plan-R1: 言語モデリングとしての安全で実行可能な軌道計画自動運転/軌道計画2025/5/1
大規模言語モデルの手法を応用し、専門家データでの事前学習とルールベース報酬による強化学習(VD-GRPO)を組み合わせて、安全性と快適性を両立した自動運転の軌道計画フレームワークを提案した論文。
- GS-LTS: 長期運用サービスロボットのための3Dガウシアンスプラッティングに基づく適応的モデリングシーン表現/長期運用2025/3/1
3Dガウシアンスプラッティングを用いて、屋内ロボットが動的環境の変化を検出し、自律的に多視点観測を行い、シーン表現を効率的に更新できるシステムを提案した。
- ロボティックプログラマー:動画指示によるロボット操作のためのポリシーコード生成VLA2025/1/1
大規模言語モデルと視覚言語モデルを活用し、動画から実行可能なコードを合成するVideo2Codeを開発。自由形式の指示と視覚情報からゼロショットでロボット操作ポリシーコードを生成する基盤モデルRoboProを提案。