Chen Tang
収録論文 25本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SCAPE: シナリオ条件付きシミュレーション拡張ポリシー評価評価手法2026/8/19
実世界でのポリシー性能を、限られた実機データと大量のシミュレーションデータを組み合わせてシナリオごとに予測する評価フレームワークを提案した。
- TerraTransfer: 専門家のデモなしで学ぶエンドツーエンド運転ポリシー自動運転2026/6/1
ベクトル化シミュレータでの自己対戦により運転ポリシーを事前学習し、視覚バックボーンとの潜在空間を整列させることで、専門家デモなしでエンドツーエンド運転を実現する手法を提案。
- MDrive: エンドツーエンドマルチエージェントシステムのための閉ループ協調運転ベンチマーク自動運転/協調運転/ベンチマーク2026/5/1
V2X通信を用いた協調運転の評価を閉ループで行うベンチマークMDriveを提案し、マルチエージェントシステムの利点と課題を明らかにした。
- DiscreteRTC: 離散拡散ポリシーは自然な非同期実行器である拡散ポリシー/非同期実行2026/4/1
離散拡散ポリシーが本来持つインペインティング能力を活用し、非同期実行を実現する新しいポリシー「DiscreteRTC」を提案。連続的なRTCと比べて、追加コードなしで実装でき、推論コストも削減しつつ、動的タスクでの成功率が向上することを示した。
- シンプルな手法で十分:VLAモデルは強化学習による自然な継続学習者であるVLA2026/3/1
大規模事前学習済みVLAモデルの継続強化学習を体系的に検証し、LoRAを用いた単純な逐次ファインチューニングが破滅的忘却をほとんど起こさず、複雑な継続学習手法を上回ることを示した。
- TIC-VLA:動的環境におけるロボットナビゲーションのための制御内思考型視覚-言語-行動モデルVLA2026/2/1
遅延する意味推論を明示的にモデル化し、非同期推論に適応した視覚-言語-行動モデルを提案。動的環境での言語誘導ナビゲーションをリアルタイム制御で実現する。
- SocialNav-SUB: ソーシャルロボットナビゲーションにおけるシーン理解のためのVLMベンチマークVLA2025/9/1
ソーシャルロボットナビゲーションの実世界シーン理解を評価するVQAデータセットとベンチマークを提案し、最先端VLMが人間やルールベース手法に及ばないことを示した。
- ComposableNav: 合成可能な拡散モデルによる動的環境での指示追従ナビゲーションナビゲーション2025/9/1
拡散モデルで各動作プリミティブを個別に学習し、展開時に並列合成することで、訓練で見ていない指示の組み合わせにも対応できるナビゲーション手法を提案。
- CoopReflect: マルチエージェント学習による自然言語コミュニケーションで協調自動運転を実現V2V協調/マルチエージェント学習2025/5/1
自動運転車同士が自然言語で意思疎通し協調運転できるよう、LLMベースのエージェントとマルチエージェント学習フレームワークCoopReflectを開発し、衝突回避や交通効率化を実現した。
- ロボティクスにおける深層強化学習:実世界での成功に関するサーベイ強化学習2024/8/1
深層強化学習をロボットに応用した実世界での成功事例を調査し、成功要因や未開拓領域、今後の研究方向を整理したサーベイ論文。
- WOMD-Reasoning: 運転シーンにおけるインタラクション推論のための大規模データセットVLA2024/7/1
実世界の運転シーンにおける交通ルールに基づくインタラクションを記述・推論する300万件のQ&Aデータセットを構築し、それを用いた運転動作言語モデルMotion-LLaVAを提案した。
- Residual-MPPI:連続制御のためのオンラインポリシーカスタマイズオンライン計画2024/7/1
学習済みポリシーの行動分布のみを用い、実行時にMPPIで残差行動を計画することで、追加学習なしに新しい性能指標へ数ショット/ゼロショットで適応させる手法を提案。
- MEReQ: 人間の介入からサンプル効率よく方針を整合させる最大エントロピー残差Q逆強化学習模倣学習/逆強化学習2024/6/1
人間の介入フィードバックから、事前方針と人間の報酬の差分を残差報酬として推定し、残差Q学習でサンプル効率よくロボットの方針を人間の好みに整合させる手法を提案。
- BeTAIL: 人間のレーシングゲームプレイからの行動トランスフォーマー敵対的模倣学習模倣学習2024/2/1
人間のレースゲームプレイのデモから学ぶ行動トランスフォーマー方策に、オンライン敵対的模倣学習の残差方策を組み合わせ、環境適応性とサンプル効率を改善した手法を提案。
- Learning Online Belief Prediction for Efficient POMDP Planning in Autonomous Driving2024/1/1
- Guided Online Distillation: Promoting Safe Reinforcement Learning by Offline Demonstration2023/9/1
- Double-Iterative Gaussian Process Regression for Modeling Error Compensation in Autonomous Racing2023/5/1
- Editing Driver Character: Socially-Controllable Behavior Generation for Interactive Traffic Simulation2023/3/1
- Outracing Human Racers with Model-based Planning and Control for Time-trial Racing2022/11/1
- Hierarchical Planning Through Goal-Conditioned Offline Reinforcement Learning2022/5/1
- Interventional Behavior Prediction: Avoiding Overly Confident Anticipation in Interactive Prediction2022/4/1
- Domain Knowledge Driven Pseudo Labels for Interpretable Goal-Conditioned Interactive Trajectory Prediction2022/3/1
- Dealing with the Unknown: Pessimistic Offline Reinforcement Learning2021/11/1
- Grounded Relational Inference: Domain Knowledge Driven Explainable Autonomous Driving2021/2/1
- Zero-shot Deep Reinforcement Learning Driving Policy Transfer for Autonomous Vehicles based on Robust Control2018/12/1