Can Cui
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 学習型軌道スコアリングのための多様なサンプル設計自動運転2026/9/1
自動運転の軌道選択スコアラーを訓練する際、安全な軌道ばかりの提案では境界付近の学習が不十分な問題に対し、人間軌道を横方向・縦方向に摂動させた多様なサンプルを生成して学習データを設計し、スコアリング精度を向上させた。
- GlanceWAM: 世界行動モデルのためのスパースなテスト時想像VLA2026/8/25
ビデオ生成モデルの物理的知識をロボット学習に活用しつつ、制御レートでの同期生成の遅延問題を回避するため、非同期に未来フレームを想像し、潜在空間で直接行動を生成する手法を提案。RoboCasaやLIBEROで高い成功率と高速推論を実現。
- エンドツーエンド自動運転におけるポストトレーニング自動運転2026/7/1
エンドツーエンド自動運転モデルの模倣学習後のポストトレーニング手法を、監督信号の種類に基づいて4つのファミリーに分類し、各手法の能力・限界・課題を体系的に整理したサーベイ論文。
- OmniV2X: 効率的なエンドツーエンド協調運転のための生成的基盤プランナー自動運転/V2X2026/6/1
V2X協調運転のための生成的基盤モデルを提案し、マルチモーダル・マルチエージェント観測を直接解釈して軌道生成を行う。大規模単一エージェントデータで事前学習し、軽量なV2Xトークンで協調環境に適応することで、少ないデータと通信帯域で最先端性能を達成した。
- ICR-Drive: 言語駆動型自動運転のための指示反事実ロバスト性評価自動運転2026/4/7
言語指示に基づく自動運転モデルが、言い換えや曖昧さ、ノイズ、誤解を招く指示などの変種に対してどれほど頑健かを評価する診断フレームワークを提案した。
- SIMSplat: 言語整合4Dガウシアンスプラッティングによる運転シナリオ生成sim2real2025/10/1
外観・運動・位置の意味をガウシアンシーングラフに埋め込み、自然言語で運転シーンを検索・編集・マルチエージェントシミュレーションできるフレームワークを提案。
- ローター故障を考慮したクアッドロータの未知環境飛行耐故障制御/ナビゲーション2025/10/1
ローター故障時の不安定化に対処するため、故障検出・診断と軌道計画・耐故障制御を統合し、未知の複雑環境での自律飛行を実現した。
- VLA-Adapter:小型Vision-Language-Actionモデルのための効果的なパラダイムVLA2025/9/1
大規模VLMへの依存を減らし、0.5Bパラメータのバックボーンと軽量なPolicyモジュールでロボットデータの事前学習なしに高性能なVLAモデルを実現した研究。
- VLM統合型実世界自動運転のための階層的テストプラットフォーム自動運転/VLA2025/6/1
VLMを組み込んだ自動運転システムを実世界の閉鎖コースで評価するため、低遅延ミドルウェアと知覚・計画・制御を分離した階層的テストプラットフォームを提案し、ケーススタディで有効性を示した。
- RationalVLA:デュアルシステムを備えた合理的視覚言語行動モデルVLA2025/6/1
曖昧・不可能な指示を拒否しつつ、実行可能な指示に基づくロボットアーム操作を行う二重システムの視覚言語行動モデルを提案し、新ベンチマークRAMAで評価した。
- OpenHelix: ロボットマニピュレーションのためのデュアルシステムVLAモデルの短いサーベイ、実証分析、オープンソース化VLA2025/5/1
既存のデュアルシステムVLAアーキテクチャを整理・比較し、設計要素を実証評価した上で、低コストなオープンソースモデルを提供するプロジェクト。
- NuPlanQA: マルチモーダル大規模言語モデルによるマルチビュー運転シーン理解のための大規模データセットとベンチマークVLA2025/3/1
運転シーン理解のためのマルチビューVQAデータセットNuPlanQA-1Mと評価ベンチマークNuPlanQA-Evalを構築し、BEV特徴を統合したBEV-LLMを提案した。
- スコア・分布マッチング方策:マッチング蒸留による高速視覚運動方策VLA2024/12/1
拡散方策をスコアマッチングと分布マッチングの二段階最適化で1ステップ生成器に変換し、6倍の推論高速化と高品質な行動生成を両立させた。
- QUART-Online: 四足歩行ロボット学習のための遅延フリー大規模マルチモーダル言語モデルVLA2024/12/1
四足歩行ロボットの視覚-言語-行動タスクにおいて、推論遅延を解消するために行動チャンク離散化を導入し、言語基盤モデルの性能を落とさずにリアルタイム推論を実現した研究。
- 車載ビジョン言語モデルによる個人適応型自動運転の運動制御:システム設計と実車検証VLA2024/11/1
車載向けの軽量VLMとRAGベースの記憶モジュールを組み合わせ、人間のフィードバックから個人の運転嗜好を継続学習して低遅延で個別化された運転を実現し、実車実験でテイクオーバー率を最大76.9%削減した。
- LLM4AD:自動運転のための大規模言語モデル — 概念・レビュー・ベンチマーク・実験・将来動向自動運転2024/10/1
自動運転に大規模言語モデルを応用するLLM4ADの概念を提唱し、既存研究のレビュー、ベンチマーク構築、実車実験を通じて、その可能性と課題を包括的に整理した論文。
- GeRM: 四足歩行ロボットのためのMixture-of-Expertsを用いた汎用ロボットモデルVLA2024/3/1
オフライン強化学習とTransformerベースのVLAネットワーク、Mixture-of-Experts構造を組み合わせ、四足歩行ロボットのマルチタスク学習を効率化する汎用モデルGeRMを提案。自動収集データセットQUARD-Autoも公開。
- Receive, Reason, and React: Drive as You Say with Large Language Models in Autonomous Vehicles2023/10/1
- Asynchronous Multi-View SLAM2021/1/1