Junchi Yan
Shanghai Jiao Tong University
収録論文 31本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Bench2Dex: 多様な器用ハンドにおける視触覚両手マニピュレーションのベンチマークマニピュレーション2026/9/14
12種類の器用ハンドに対応した共通の触覚インターフェースを備えるシミュレーションベンチマークを構築し、26の両手操作タスクと約1.3Kのテレオペデモを提供して視触覚マニピュレーションを評価可能にした。
- HandEdit: 身体性を考慮した人間からロボットへの器用な手の画像編集のための統一ベンチマーク画像編集/ロボティクス2026/8/1
人間の手の画像を様々なロボットハンドに変換する大規模な画像編集データセットとベンチマークを構築し、既存の編集モデルの評価と身体性を考慮した編集モデルの発展を目指した。
- ACE-Brain-0.5:物理的エージェントAIのための統合具現化基盤モデルVLA2026/7/1
ロボット知能を空間知覚、意思決定、身体的行動、自己監視、自己改善の5機能に統合した、単一の8Bバックボーンによる閉ループ基盤モデルを提案する。
- WorldScape Policy 2.0:推論強化メモリによる操縦可能なワールドアクションモデリングの実現操作2026/7/1
ロボット操作のためのワールドアクションモデルを拡張し、長期・短期メモリと推論強化により、タスク進行の追跡と細かい言語-映像-行動の対応付けを可能にした。
- ReactSim-Bench: 自動運転における反応的行動ワールドモデルシミュレーションのベンチマーク自動運転/シミュレーション2026/6/1
自動運転シミュレーションのための行動ワールドモデルの反応能力を評価する新しいベンチマークを提案し、エージェントと自動運転車の制御を分離して、ログと異なる自動運転車の行動に対する反応を評価する。
- LA4VLA: 視覚なしで行動を学習する言語-行動事前学習VLA2026/6/1
視覚-言語-行動モデルが視覚情報に過度に依存する問題を解決するため、視覚観察なしで言語条件付き行動の事前学習を行うフレームワークを提案し、シミュレーションと実世界で性能向上を確認した。
- GuidedVLA: プラグアンドプレイの行動注意特化によるタスク関連因子の指定VLA2026/5/1
VLAモデルの行動デコーダを機能部品として捉え、個々の注意ヘッドに明示的な補助信号でタスク関連因子(物体接地、空間幾何、時間的スキル論理)を学習させるフレームワークを提案し、シミュレーションと実機で汎化性能を向上させた。
- Evo-Depth: 軽量な深度強化型視覚言語行動モデルVLA2026/5/1
追加センサーや高コストな幾何基盤モデルを使わずに、多視点RGB画像から軽量な暗黙的深度符号化モジュールで深度特徴を抽出し、空間セマンティクスを強化するVLAモデルを提案した。
- Bench2Drive-Robust:展開時の摂動下でのクローズドループ自動運転のベンチマーク自動運転2026/5/1
実環境展開で生じるシステムレベルの摂動(カメラストリーム障害、自己位置推定誤差、計算遅延)がクローズドループのエンドツーエンド自動運転性能に与える影響を評価する、初のデバイス中心のロバストネスベンチマークを提案した。
- ELAN4D: 身体中心の4D監視による視覚言語行動モデルのプラグアンドプレイ適応VLA2026/5/1
ロボットのキーポイントの未来の3D軌跡を予測する補助分岐をVLAモデルに追加し、外乱下での汎化性能を向上させるフレームワークを提案した。
- Bench2Drive-VL: 視覚言語モデルを用いたクローズドループ自動運転のベンチマーク自動運転2026/4/1
自動運転における視覚言語モデル(VLM)の評価を、従来のオープンループの静的QAではなく、クローズドループ環境で行うためのベンチマークを提案した論文。
- ユーザーは走行速度を指定できるか? Bench2Drive-Speed: 所望速度条件付き自動運転のためのベンチマークとベースライン自動運転2026/3/1
自動運転において、ユーザーが希望する速度や追い越し可否を指定できるようにするためのベンチマークとデータセット、ベースラインモデルを提案した論文。
- ACE-Brain-0: 空間知能を共通の足場とする普遍的身体性知能基盤モデル2026/3/1
多様な身体(自動運転、ロボット、ドローン)を統合する基盤モデルを提案し、空間知能を共通の足場として、専門化と融合を経て高い性能を達成した。
- Interleave-VLA:画像とテキストの交互入力でロボット操作を強化VLA2025/5/1
画像とテキストを交互に与える指示でロボットを学習させ、未知の物体への汎化性能を2倍に高め、手描きスケッチなどの柔軟な指示にも対応できるVLAモデルを提案。
- DriveMoE:自動運転のためのVision-Language-ActionモデルにおけるMixture-of-ExpertsVLA2025/5/1
自動運転向けVLAモデルに視覚と行動のMixture-of-Expertsを導入し、状況に応じたカメラ選択と運転行動の専門化を実現してSOTA性能を達成した。
- Raw2Drive: 世界モデル整合による強化学習ベースのEnd-to-End自動運転End-to-End自動運転2025/5/1
特権情報で訓練した世界モデルを生センサー世界モデルに蒸留し、強化学習でEnd-to-End自動運転を実現してCARLA v2で最高性能を達成した。
- RoboFAC: ロボット失敗分析と修正のための包括的フレームワークVLA2025/5/1
ロボット操作の失敗を診断・修正するための大規模データセットと軽量マルチモーダルモデルを構築し、VLA制御の回復性能を向上させた。
- DriveTransformer:スケーラブルなエンドツーエンド自動運転のための統合トランスフォーマー自動運転2025/3/1
知覚・予測・計画を並列に統合し、スパース表現とストリーミング処理で累積誤差と計算負荷を抑えたエンドツーエンド自動運転フレームワークを提案。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- Int2Planner: 意図に基づく統合予測・計画のためのマルチモーダル動作プランナ自動運転計画2025/1/1
経路意図点を活用し、予測と計画を統合したマルチモーダル動作プランナを提案。nuPlanで最先端性能を達成し、実車でも数百kmの自動運転を実証した。
- Bench2Drive-R: 生成モデルによる実世界データを反応型閉ループ自動運転ベンチマークへ変換自動運転2024/12/1
生成モデルを用いて実世界データから反応型の閉ループ自動運転評価ベンチマークを構築するフレームワークを提案。
- 生成期待を用いた閉ループ視覚運動制御によるロボットマニピュレーションマニピュレーション2024/9/1
テキスト条件付き動画拡散モデルで視覚計画を生成し、誤差を定量化する埋め込み空間とフィードバック制御器を組み合わせて、長期的なロボット操作を閉ループで適応制御するフレームワークCLOVERを提案した。
- Bench2Drive: 閉ループ自動運転のマルチ能力ベンチマークに向けて自動運転ベンチマーク2024/6/1
CARLA v2上で44の対話シナリオ・23の天候・12の町から収集した200万フレームのデータと閉ループ評価プロトコルを提供し、エンドツーエンド自動運転の多様な能力を公平に評価する初のベンチマークを提案した。
- AMP: 次トークン予測による自己回帰的運動予測の再考運動予測2024/3/1
GPTスタイルの次トークン予測を自動運転の運動予測に導入し、時空間・意味関係を捉える因子化アテンションで自己回帰予測を実現した研究。
- ActiveAD: 計画指向の能動学習によるエンドツーエンド自動運転能動学習2024/3/1
エンドツーエンド自動運転のデータ効率を高めるため、計画経路の多様性と有用性に基づいてアノテーション対象を選ぶ能動学習手法を提案し、nuScenesの30%データで最先端性能を達成した。
- Think2Drive: Efficient Reinforcement Learning by Thinking in Latent World Model for Quasi-Realistic Autonomous Driving (in CARLA-v2)2024/2/1
- DriveAdapter: Breaking the Coupling Barrier of Perception and Planning in End-to-End Autonomous Driving2023/8/1
- Level 2 Autonomous Driving on a Single Device: Diving into the Devils of Openpilot2022/6/1
- Trajectory-guided Control Prediction for End-to-end Autonomous Driving: A Simple yet Strong Baseline2022/6/1
- HDGT: Heterogeneous Driving Graph Transformer for Multi-Agent Trajectory Prediction via Scene Encoding2022/5/1
- Dynamic Modeling of Hand-Object Interactions via Tactile Sensing2021/9/1