Long Chen
China University of Mining and Technology-Beijing
収録論文 69本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- OpenSpace LabによるIROS 2026屋内探索コンペティションへのソリューション探索2026/10/1
事前学習済み地図補完予測と残り時間ベースの探索戦略、および効用駆動型の目標選択により、単一・複数ロボットの屋内探索を効率化し、IROS 2026コンペで入賞した手法を報告する。
- RoboChrono:ストリーミングタスク理解のための実ロボットベンチマークベンチマーク2026/9/29
実ロボットと人手の記録からなる39シナリオ・34,713件のベンチマークを構築し、18の視覚言語モデルのゼロショット性能を評価して、視覚照合と時間順序理解の能力差を明らかにした。
- ピクセルからポーズへ:人間のデモンストレーションによる物体中心のツール操作学習マニピュレーション2026/9/28
人間の動画デモから物体中心の世界モデルを事前学習し、ポーズ認識方策と組み合わせることで、ロボットとの対応データなしに複雑なツール操作を実現した。
- 自己回帰型ワールドアクションモデルの失敗回復のための因果履歴テスト時スケーリングマニピュレーション2026/9/16
自己回帰型ワールドアクションモデルにおいて、失敗回復を因果履歴のテスト時スケーリングとして再定式化し、進捗検知・履歴プレフィックス回復・仮説検証の3段階で訓練なしに回復を実現するフレームワークを提案。
- 宇宙ロボットによる地球外採掘:探査、サンプリング、抽出宇宙探査2026/8/21
宇宙資源の採掘を実現するためのロボット技術を包括的にレビューし、6段階のアーキテクチャを提案した論文。
- SpatioLM: 視覚言語モデルにおける汎用物理空間知能の実現VLA2026/8/3
視覚言語モデルに追加の3D入力や外部エンコーダを使わず、パラメータ効率的なモジュールと擬似深度・カメラ情報の教師信号で空間推論能力を強化し、汎用性能の低下を抑えつつ空間知能を向上させた。
- GeoWorldAD: 自動運転のための幾何学的世界アクションモデル自動運転2026/7/1
自動運転のための行動モデルに、自己中心の3D空間での軌道計画と、潜在的な未来の幾何学トークンによる短期的なシーン進化の予測を組み込んだ手法を提案し、NAVSIMベンチマークで最高性能を達成した。
- OneVLA: 身体性タスクのための統一フレームワークVLA2026/6/1
ナビゲーションと操作を単一のフレームワークに統合したVLAモデルを提案し、タスク固有のアーキテクチャを不要にする統一アクションヘッドと多段階トレーニング戦略を導入。シミュレーションと実環境で最先端の性能を達成した。
- UniviewVLA:世界モデリングを備えた統合マルチビュー視覚言語行動モデルVLA/操作2026/6/1
標準的な2つのカメラ観測のみから、世界モデルを用いてマルチビューの未来シーンを生成し、遮蔽された情報を補完して行動予測を改善するVLAモデルを提案。推論高速化のためのトークン圧縮と、動的な視点選択手法も導入。
- He3-Seeker: 月面ヘリウム3分布マッピングのためのロボット情報計画探査ロボット/情報計画2026/6/1
月面のヘリウム3資源を高精度にマッピングするため、能動的ロボット探査手法He3-Seekerを提案。多点掘削・サンプリング・その場分析に基づき、ロボット情報計画(RIP)で自律航法と能動センシングを導く。シミュレーションで高速かつ高忠実なマッピングを実証した。
- スパイキングニューラルネットワークを用いた視覚言語行動モデルSpikeVLAVLA/スパイキングNN/低消費電力2026/6/1
低消費電力・リアルタイム動作を目指し、視覚エンコーダ・大規模言語モデル・行動ポリシーをすべてスパイキングニューラルネットワークで構成したVLAモデルを提案し、ナビゲーションとロボット制御タスクでエネルギー消費を大幅削減しつつ競争力のある性能を達成した。
- 模倣を超えて:ハードネガティブから学ぶ安全なエンドツーエンド自動運転自動運転2026/5/1
成功事例だけでなく失敗事例も学習に取り入れることで、軌道の安全性を向上させる自動運転の模倣学習フレームワーク「BeyondDrive」を提案した論文。
- テキストと画像で考える:長期的ロボット操作のためのインターリーブ型視覚・言語推論トレース操作2026/5/1
長期的なロボット操作タスクにおいて、テキストによるサブゴールと視覚的なキーフレームを交互に配置した中間表現(トレース)を導入し、これを自己生成して動作デコーダに条件付けする新しいポリシーフレームワークを提案した。
- SpaAct: 空間活性化遷移学習とカリキュラム適応による視覚言語ナビゲーションVLA/ナビゲーション2026/4/30
視覚言語ナビゲーション(VLN)のためのVLM適応フレームワークSpaActを提案。後方行動推論と前方遷移予測の2つの空間活性化タスクと、TriPAカリキュラム学習により動的空間認識を獲得し、VLN-CEベンチマークでSOTAを達成。
- UniDriveVLA:自動運転のための理解・知覚・行動計画の統合自動運転/VLA2026/4/1
自動運転向けのVLAモデルにおいて、空間知覚と意味推論の競合を解消するため、Mixture-of-Transformersによる専門家分離を導入した統合モデルUniDriveVLAを提案し、nuScenesとBench2Driveで最先端性能を達成した。
- 考える前に進む:画像目標ナビゲーションのための階層的推論ナビゲーション2026/4/1
画像目標ナビゲーションを高レベル計画と低レベル実行に分解し、視覚言語モデルで短期的計画を生成して強化学習ポリシーを導く階層的フレームワークHRNavを提案。迷いを減らすペナルティも導入し、シミュレーションと実環境で有効性を実証した。
- DVGT-2: 大規模自動運転のためのビジョン・ジオメトリ・アクションモデル自動運転2026/4/1
自動運転のための新しいVGAパラダイムを提案し、オンライン推論可能なストリーミング型のDVGT-2を導入。密な3Dジオメトリと軌道計画を同時に出力し、多様なカメラ設定で微調整なしに適用可能。
- 一緒に歩こう:人間中心の屋外支援のための長期的社会的ナビゲーションナビゲーション2026/4/1
高レベルの自然言語指示から屋外での長期的な社会的ナビゲーションを実現する、地図不要のフレームワークを提案。GPSと公開地図APIのPOIを用いて目的地を推定し、高レベルVLMと低レベルVLAを状況に応じて切り替えることで、安全で社会的に適切な移動を実現する。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- XEmbodied: 大規模具現環境向けに幾何・物理的手がかりを強化した基盤モデルVLA/基盤モデル2026/4/1
クラウド側でVLMに3次元幾何認識と物理的手がかりを統合し、空間推論や具現化タスクの性能を向上させる基盤モデルを提案した。
- 失敗から学ぶ:テイクオーバーデータを用いた運転VLAのポストトレーニング自動運転/VLA2026/3/1
自動運転のVLAモデルに対し、テイクオーバー(人間介入)データを活用した新しいポストトレーニング手法TakeVLAを提案。介入前の言語指示とシナリオ再構築による強化学習で安全マージンを拡大し、ベンチマークで最高性能を達成した。
- AutoMoT: 非同期Mixture-of-Transformersによる統合型Vision-Language-Actionモデルを用いたエンドツーエンド自動運転VLA2026/3/1
推論と行動生成を単一のVLAモデルに統合し、Mixture-of-Transformersと非同期実行で高速・高精度な自動運転を実現した研究。
- PerlAD: 擬似シミュレーションに基づく強化学習による閉ループエンドツーエンド自動運転の性能向上自動運転2026/3/1
オフラインデータから構築したベクトル空間上の擬似シミュレーションと予測ワールドモデルを用いて、レンダリング不要で効率的な強化学習による閉ループ自動運転を実現した。
- MeanFuser: MeanFlowによる高速ワンショット多様体軌道生成と適応的再構成を用いたエンドツーエンド自動運転自動運転/軌道生成2026/2/1
ガウス混合ノイズとMeanFlowを組み合わせ、離散アンカーに依存せず高速かつロバストに軌道を生成するエンドツーエンド自動運転手法を提案。
- TSC: 相互作用運転のためのトポロジー条件付きシュタッケルベルク型マルチエージェント強化学習マルチエージェント強化学習/自動運転2026/2/1
軌跡の編み込み関係から動的な優先度グラフを抽出し、局所的なリーダー・フォロワー関係に基づくシュタッケルベルク型協調方策をCTDEで学習する、通信不要の分散型自動運転フレームワークを提案。
- DriveWorld-VLA: 自動運転のための視覚-言語-行動と潜在空間世界モデルの統合VLA2026/2/1
VLAと世界モデルを潜在空間で統合し、行動条件付きの想像を特徴量レベルで行う自動運転フレームワークを提案。NAVSIMなどで最高性能を達成。
- 拡散モデルによるエンドツーエンド自動運転の可能性を解き放つ自動運転/拡散モデル2026/2/1
実車データと公道試験を通じて拡散モデルをエンドツーエンド自動運転のプランナーとして大規模に検証し、学習の鍵となる知見と強化学習による事後学習を提案、実車で10倍の性能向上を達成した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- ロボティクスに最適な3Dシーン表現は何か?幾何表現から基盤モデルまで3Dシーン表現2025/12/1
ロボティクスにおける点群・ボクセル・SDF・NeRF・3DGS・基盤モデルなどの3Dシーン表現を、知覚・地図構築・自己位置推定・ナビゲーション・マニピュレーションの5モジュール別に整理・比較したサーベイ。
- 運転視覚幾何Transformer3D再構成2025/12/1
自動運転向けに、カメラパラメータ不要で多視点画像列からメートルスケールの密な3D点群と自車姿勢を推定するTransformerモデルを提案。
- DSBench:車外・車内リスクを評価する包括的ベンチマーク自動運転VLMベンチマーク2025/11/1
自動運転向けVLMの安全性評価のため、車外環境リスクと車内運転行動安全を10カテゴリ28サブカテゴリで統合評価する初のベンチマークDSBenchを構築し、98Kデータでの微調整が安全性を向上させることを示した。
- RoboAfford++: ロボット操作とナビゲーションのためのマルチモーダルアフォーダンス学習向け生成AI強化データセットアフォーダンス2025/11/1
物体の機能部位や配置可能領域などのアフォーダンスを細粒度で注釈付けした87万枚超の画像と200万件のQAペアからなるデータセットを構築し、評価ベンチマークも提案した論文。
- MiMo-Embodied: クロス身体性基盤モデル技術報告VLA2025/11/1
自動運転と身体性AIを統合した初のクロス身体性基盤モデルを開発し、両分野で最先端性能を達成した。
- SimScale: 実世界シミュレーションを大規模に活用した自動運転の学習自動運転/sim2real2025/11/1
既存の走行ログから大規模に未知の状態を合成するシミュレーション基盤を構築し、疑似専門家による行動監督と実データとの共同学習で計画性能の堅牢性と汎化を大幅に向上させた。
- SocialNav-Map: 人間軌道予測を用いた動的マッピングによるゼロショット社会ナビゲーション社会ナビゲーション2025/11/1
人間の軌道予測と占有マップを組み合わせ、環境ごとの追加学習なしで安全に移動できるゼロショット社会ナビゲーション手法を提案。
- 能動的リスク知覚による社会的ナビゲーションの学習社会的ナビゲーション2025/10/1
RGB-Dとオドメトリのみを用い、周囲の人間との衝突リスクを予測する能動的リスク知覚モジュールをFalconに追加し、混雑環境での社会的に配慮したナビゲーションを実現した。
- NanoVLA:軽量汎用ロボットポリシーのための視覚言語理解を分離したルーティングVLA2025/10/1
視覚と言語の融合を後段に分離し、長短アクションチャンキングと動的ルーティングを組み合わせることで、エッジデバイス上で最大52倍高速かつ98%少ないパラメータで動作する軽量VLAモデルを提案した。
- チームXiaomi EV-AD VLA:キャプション誘導検索システムによるクロスモーダルドローン航法VLA2025/10/1
ドローンの自然言語誘導画像検索において、VLMで候補画像のキャプションを生成し再ランキングする2段階手法を提案し、ベースラインを5%改善した。
- DriveMRP: 合成モーションデータによる視覚言語モデルのモーションリスク予測強化自動運転2025/7/1
BEVベースのシミュレーションで高リスクな運転モーションデータを合成し、視覚言語モデルのリスク予測性能を大幅に向上させるフレームワークを提案した。
- ReCogDrive:強化学習型認知フレームワークによるエンドツーエンド自動運転自動運転/VLA2025/6/1
VLMの運転知識を拡散プランナに注入し、DiffGRPOで安全性を強化する自動運転フレームワークを提案。NAVSIMとBench2Driveで最先端性能を達成。
- ReSim: 自動運転のための信頼性の高い世界シミュレーションsim2real2025/6/1
実世界の運転データにシミュレータ由来の非専門家データを加え、危険な行動も含む多様な運転シナリオを制御可能に生成する世界モデルを構築し、報酬推定モジュールと組み合わせて政策評価性能を向上させた。
- EANS:環境適応型ナビゲーション戦略によるUAVのエネルギー消費削減ナビゲーション2025/6/1
UAVのナビゲーション戦略を環境変化に応じて動的に調整し、エネルギー消費を削減する手法を提案。HILシミュレーションと実機実験でベースライン比3.2倍/2.6倍のミッション時間改善、2.4倍/1.6倍のエネルギー改善を達成。
- 不整地を歩く知覚型ヒューマノイドロコモーションの学習歩行2025/3/1
教師-生徒蒸留と変分情報ボトルネックによる世界モデルを組み合わせ、ノイズの多い地形知覚でも頑健に歩行できるヒューマノイド制御器を学習した。実環境で2kmの不整地を自律走行できることを示した。
- WMNav: 視覚言語モデルを世界モデルに統合した物体目標ナビゲーションナビゲーション2025/3/1
視覚言語モデルを用いて世界モデルを構築し、将来状態を予測しながら未知環境で目標物体を探索するナビゲーション手法を提案。HM3DとMP3Dでゼロショットベースラインを上回る性能を達成。
- SimLingo: 言語と行動を整合させた視覚のみの閉ループ自動運転自動運転/VLA2025/3/1
カメラ映像のみを使う視覚言語モデルで、閉ループ運転・視覚言語理解・言語と行動の整合を同時に実現し、CARLAのBench2Driveで最高性能を達成した研究。
- 世界モデル再構成によるヒューマノイド歩行の学習歩行2025/2/1
センサ情報から世界状態を明示的に再構成する推定器を歩行ポリシーと切り離して学習させ、不整地・滑りやすい地形でのブラインドヒューマノイド歩行を実現した研究。
- AdvDiffuser: 誘導拡散による敵対的危険運転シナリオの生成拡散モデル/敵対的シナリオ生成2024/10/1
拡散モデルと軽量ガイドモデルを組み合わせ、自然な周囲車両の挙動を保ちながら様々な自動運転システムに転用可能な危険シナリオを生成する手法を提案。
- CarLLaVA:カメラのみの閉ループ自動運転のための視覚言語モデル自動運転VLA2024/6/1
LLaVAの視覚エンコーダとLLaMAをバックボーンに用い、カメラ入力のみでCARLA自動運転チャレンジ2.0のセンサートラックで1位を獲得した視覚言語モデルを提案。
- LLMを人間のように運転するよう指示する自動運転計画2024/6/1
人間の運転ロジックと交通ルールを指示データとしてLLMを微調整し、解釈可能な推論モジュールで実世界の閉ループ運動計画ベンチマークnuPlanにおいて有効性を示した。
- 自律輸送のためのシナリオエンジニアリング:露天掘り鉱山における新段階自律輸送/シナリオエンジニアリング2024/5/1
露天掘り鉱山の自律輸送システムにシナリオエンジニアリングを統合し、信頼性・堅牢性・効率を高める新パラダイムを提案。2つの実鉱山で有効性を検証した。
- ClothPPO: 観測整合行動空間を持つロボット布操作のための近接方策最適化強化フレームワークマニピュレーション2024/5/1
布の展開タスクにおいて、観測に整合した大規模行動空間で事前学習モデルをPPOにより微調整するフレームワークを提案し、展開性能を向上させた。
- オープンピット鉱山における自律輸送のためのシナリオエンジニアリング自律走行2024/5/1
露天掘り鉱山での自律輸送に向け、シナリオ特徴抽出・知能指標・校正認証・検証検証の4要素からなるシナリオエンジニアリング手法を提案し、極限環境での信頼性と堅牢性を高める。
- 自動運転のための長期・短期制約に基づく安全強化学習安全強化学習2024/3/1
自動運転の意思決定において、短期制約と長期制約を組み合わせた安全強化学習手法を提案し、MetaDriveシミュレータで安全性の向上を実証した。
- LingoQA: Visual Question Answering for Autonomous Driving2023/12/1
- Driving with LLMs: Fusing Object-Level Vector Modality for Explainable Autonomous Driving2023/10/1
- V2X-AHD:Vehicle-to-Everything Cooperation Perception via Asymmetric Heterogenous Distillation Network2023/10/1
- FusionPlanner: A Multi-task Motion Planner for Mining Trucks via Multi-sensor Fusion2023/8/1
- BotanicGarden: A High-Quality Dataset for Robot Navigation in Unstructured Natural Environments2023/6/1
- Milestones in Autonomous Driving and Intelligent Vehicles Part II: Perception and Planning2023/6/1
- Milestones in Autonomous Driving and Intelligent Vehicles Part I: Control, Computing System Design, Communication, HD Map, Testing, and Human Behaviors2023/5/1
- How Simulation Helps Autonomous Driving:A Survey of Sim2real, Digital Twins, and Parallel Intelligence2023/5/1
- Motion Planning for Autonomous Driving: The State of the Art and Future Perspectives2023/3/1
- Milestones in Autonomous Driving and Intelligent Vehicles: Survey of Surveys2023/3/1
- SimNet: Learning Reactive Self-driving Simulations from Real-world Observations2021/5/1
- What data do we need for training an AV motion planner?2021/5/1
- Digital Quadruplets for Cyber-Physical-Social Systems based Parallel Driving: From Concept to Applications2020/7/1
- Defining Digital Quadruplets in the Cyber-Physical-Social Space for Parallel Driving2020/7/1
- One Thousand and One Hours: Self-driving Motion Prediction Dataset2020/6/1
- Deep Learning for Image and Point Cloud Fusion in Autonomous Driving: A Review2020/4/1