Xiaosong Jia
Fudan University
収録論文 29本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Ego4WAM:ロボット学習のための自己中心的人間データのスケーリングで重要な要素は何か?VLA2026/9/30
自己中心的人間データをロボット学習に活用する際、人間とロボットのアライメント、タスク多様性、行動監督、利用戦略が下流性能に与える影響を体系的に分析し、データ設計の指針を示した。
- Bench2Dex: 多様な器用ハンドにおける視触覚両手マニピュレーションのベンチマークマニピュレーション2026/9/14
12種類の器用ハンドに対応した共通の触覚インターフェースを備えるシミュレーションベンチマークを構築し、26の両手操作タスクと約1.3Kのテレオペデモを提供して視触覚マニピュレーションを評価可能にした。
- HandEdit: 身体性を考慮した人間からロボットへの器用な手の画像編集のための統一ベンチマーク画像編集/ロボティクス2026/8/1
人間の手の画像を様々なロボットハンドに変換する大規模な画像編集データセットとベンチマークを構築し、既存の編集モデルの評価と身体性を考慮した編集モデルの発展を目指した。
- EgoRecovery: 人間の回復デモンストレーションから失敗回復能力を獲得するロボット学習2026/7/1
ロボットの失敗回復行動を学習するために、人間の自己中心視点の回復デモを活用し、ロボットデータと共有する意図空間を介して少数のロボットデモで実行可能な行動に結びつける共学習フレームワークを提案した。
- UniDexTok: 実データからの統合器用手トークナイザ器用手/表現学習2026/6/9
人間とロボットの手の状態を共通の22自由度セマンティックインターフェースにマッピングし、再ターゲティング不要で異種の器用手を統一表現するトークナイザを提案。誤差をセンチメートルからサブミリメートルに大幅削減した。
- EvoMemNav: ゼロショット具現化ナビゲーションのための自己進化型高精細メモリナビゲーション2026/6/2
観測を細粒度で保持する視覚意味メモリグラフを構築し、予算制約付き粗密探索とサブタスク後のリフレクションによるメモリ更新で、ゼロショットの具現化ナビゲーション性能を向上させた。
- ReactSim-Bench: 自動運転における反応的行動ワールドモデルシミュレーションのベンチマーク自動運転/シミュレーション2026/6/1
自動運転シミュレーションのための行動ワールドモデルの反応能力を評価する新しいベンチマークを提案し、エージェントと自動運転車の制御を分離して、ログと異なる自動運転車の行動に対する反応を評価する。
- GuidedVLA: プラグアンドプレイの行動注意特化によるタスク関連因子の指定VLA2026/5/1
VLAモデルの行動デコーダを機能部品として捉え、個々の注意ヘッドに明示的な補助信号でタスク関連因子(物体接地、空間幾何、時間的スキル論理)を学習させるフレームワークを提案し、シミュレーションと実機で汎化性能を向上させた。
- Bench2Drive-Robust:展開時の摂動下でのクローズドループ自動運転のベンチマーク自動運転2026/5/1
実環境展開で生じるシステムレベルの摂動(カメラストリーム障害、自己位置推定誤差、計算遅延)がクローズドループのエンドツーエンド自動運転性能に与える影響を評価する、初のデバイス中心のロバストネスベンチマークを提案した。
- Bench2Drive-VL: 視覚言語モデルを用いたクローズドループ自動運転のベンチマーク自動運転2026/4/1
自動運転における視覚言語モデル(VLM)の評価を、従来のオープンループの静的QAではなく、クローズドループ環境で行うためのベンチマークを提案した論文。
- ユーザーは走行速度を指定できるか? Bench2Drive-Speed: 所望速度条件付き自動運転のためのベンチマークとベースライン自動運転2026/3/1
自動運転において、ユーザーが希望する速度や追い越し可否を指定できるようにするためのベンチマークとデータセット、ベースラインモデルを提案した論文。
- ACE-Brain-0: 空間知能を共通の足場とする普遍的身体性知能基盤モデル2026/3/1
多様な身体(自動運転、ロボット、ドローン)を統合する基盤モデルを提案し、空間知能を共通の足場として、専門化と融合を経て高い性能を達成した。
- Percept-WAM: 知覚強化型世界認識行動モデルによる堅牢なエンドツーエンド自動運転自動運転VLA2025/11/1
2D/3D知覚を単一の視覚言語モデルに統合し、World-PV/World-BEVトークンとグリッド条件付き予測で長尾・遠距離・小物体に強い自動運転モデルを提案。
- ReSim: 自動運転のための信頼性の高い世界シミュレーションsim2real2025/6/1
実世界の運転データにシミュレータ由来の非専門家データを加え、危険な行動も含む多様な運転シナリオを制御可能に生成する世界モデルを構築し、報酬推定モジュールと組み合わせて政策評価性能を向上させた。
- Raw2Drive: 世界モデル整合による強化学習ベースのEnd-to-End自動運転End-to-End自動運転2025/5/1
特権情報で訓練した世界モデルを生センサー世界モデルに蒸留し、強化学習でEnd-to-End自動運転を実現してCARLA v2で最高性能を達成した。
- Interleave-VLA:画像とテキストの交互入力でロボット操作を強化VLA2025/5/1
画像とテキストを交互に与える指示でロボットを学習させ、未知の物体への汎化性能を2倍に高め、手描きスケッチなどの柔軟な指示にも対応できるVLAモデルを提案。
- DriveMoE:自動運転のためのVision-Language-ActionモデルにおけるMixture-of-ExpertsVLA2025/5/1
自動運転向けVLAモデルに視覚と行動のMixture-of-Expertsを導入し、状況に応じたカメラ選択と運転行動の専門化を実現してSOTA性能を達成した。
- DriveTransformer:スケーラブルなエンドツーエンド自動運転のための統合トランスフォーマー自動運転2025/3/1
知覚・予測・計画を並列に統合し、スパース表現とストリーミング処理で累積誤差と計算負荷を抑えたエンドツーエンド自動運転フレームワークを提案。
- Bench2Drive-R: 生成モデルによる実世界データを反応型閉ループ自動運転ベンチマークへ変換自動運転2024/12/1
生成モデルを用いて実世界データから反応型の閉ループ自動運転評価ベンチマークを構築するフレームワークを提案。
- Bench2Drive: 閉ループ自動運転のマルチ能力ベンチマークに向けて自動運転ベンチマーク2024/6/1
CARLA v2上で44の対話シナリオ・23の天候・12の町から収集した200万フレームのデータと閉ループ評価プロトコルを提供し、エンドツーエンド自動運転の多様な能力を公平に評価する初のベンチマークを提案した。
- ActiveAD: 計画指向の能動学習によるエンドツーエンド自動運転能動学習2024/3/1
エンドツーエンド自動運転のデータ効率を高めるため、計画経路の多様性と有用性に基づいてアノテーション対象を選ぶ能動学習手法を提案し、nuScenesの30%データで最先端性能を達成した。
- AMP: 次トークン予測による自己回帰的運動予測の再考運動予測2024/3/1
GPTスタイルの次トークン予測を自動運転の運動予測に導入し、時空間・意味関係を捉える因子化アテンションで自己回帰予測を実現した研究。
- Think2Drive: 潜在世界モデルで思考する準リアル自動運転のための効率的強化学習自動運転/強化学習2024/2/1
CARLA v2の複雑な交通シナリオに対応するため、世界モデルを活用したモデルベース強化学習手法Think2Driveを開発し、単一GPUで3日間の訓練で専門家レベルの運転性能を達成した。
- DriveAdapter: Breaking the Coupling Barrier of Perception and Planning in End-to-End Autonomous Driving2023/8/1
- Planning-oriented Autonomous Driving2022/12/1
- Delving into the Devils of Bird's-eye-view Perception: A Review, Evaluation and Recipe2022/9/1
- Trajectory-guided Control Prediction for End-to-end Autonomous Driving: A Simple yet Strong Baseline2022/6/1
- HDGT: Heterogeneous Driving Graph Transformer for Multi-Agent Trajectory Prediction via Scene Encoding2022/5/1
- IDE-Net: Interactive Driving Event and Pattern Extraction from Human Data2020/11/1