Guang Chen
Zhejiang University
収録論文 39本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 検索関連性を超えて:視覚言語運転のためのシーン接地型リスク含意VLA2026/9/28
運転シーンの知覚事実から知識グラフとSWRL推論でリスク関係を導出し、VLMと拡散プランナーの判断を条件付けることで、検索ベースの安全知識より計画安全性を向上させた。
- HINT: 長期的ロボット操作のための人間意図の注入マニピュレーション2026/9/2
本論文は、長期的なロボット操作タスクにおいて、人間の意図を視覚的・注意機構を通じて行動ポリシーに伝達するフレームワークHINTを提案し、意図理解とタスク成功率を向上させる。
- GWM-VLA:視覚言語行動学習のための幾何認識潜在世界モデリングVLA2026/8/1
視覚言語行動モデルの堅牢性を向上させるため、幾何情報を考慮した多視点状態符号化と潜在世界モデルを導入し、手首視点の予測と共有潜在行動表現によりロボット操作性能を高めた。
- GeoWorldAD: 自動運転のための幾何学的世界アクションモデル自動運転2026/7/1
自動運転のための行動モデルに、自己中心の3D空間での軌道計画と、潜在的な未来の幾何学トークンによる短期的なシーン進化の予測を組み込んだ手法を提案し、NAVSIMベンチマークで最高性能を達成した。
- Discrete-WAM: 世界モデルとポリシー学習のための統一離散ビジョン・アクショントークン編集自動運転/世界モデル2026/6/1
自動運転向けに、視覚観測・未来状態・高次決定・自車行動を共通の離散トークン空間で表現し、世界モデルとポリシーを統合学習するフレームワークを提案した。
- UniviewVLA:世界モデリングを備えた統合マルチビュー視覚言語行動モデルVLA/操作2026/6/1
標準的な2つのカメラ観測のみから、世界モデルを用いてマルチビューの未来シーンを生成し、遮蔽された情報を補完して行動予測を改善するVLAモデルを提案。推論高速化のためのトークン圧縮と、動的な視点選択手法も導入。
- 空間認識型ワールドアクションモデルによる身体化ナビゲーションナビゲーション2026/6/1
視覚ナビゲーションのための世界モデルベースのプランナーを改良し、開始と目標のRGB観測から中間のRGB-Dシーケンスと行動軌跡を同時生成するSWAMを提案。単眼RGB入力のみで高精度なナビゲーションを実現した。
- ATHENA: ロボットデータキュレーションのための高速マルチタスク異種影響関数データキュレーション2026/6/1
大規模VLAモデルの模倣学習において、各デモの影響を高速に計算する影響関数フレームワークATHENAを提案し、50%のデータで全データ学習と同等以上の性能を達成した。
- 適応チャンクサイズのアクタークリティックと因果トランスフォーマーQネットワーク強化学習2026/5/1
強化学習における長期的・疎報酬タスク向けに、チャンクサイズを状態に応じて適応的に選択するアクタークリティック法を提案し、オフラインおよびオフラインからオンラインへの設定で最先端性能を達成した。
- 模倣を超えて:ハードネガティブから学ぶ安全なエンドツーエンド自動運転自動運転2026/5/1
成功事例だけでなく失敗事例も学習に取り入れることで、軌道の安全性を向上させる自動運転の模倣学習フレームワーク「BeyondDrive」を提案した論文。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- DriveVA: ビデオ行動モデルはゼロショット運転者である自動運転2026/4/1
自動運転のための世界モデルDriveVAを提案し、将来の映像と行動系列を共有の生成過程で同時に予測することで、ゼロショットでの汎化性能を向上させた。
- UniDriveVLA:自動運転のための理解・知覚・行動計画の統合自動運転/VLA2026/4/1
自動運転向けのVLAモデルにおいて、空間知覚と意味推論の競合を解消するため、Mixture-of-Transformersによる専門家分離を導入した統合モデルUniDriveVLAを提案し、nuScenesとBench2Driveで最先端性能を達成した。
- XEmbodied: 大規模具現環境向けに幾何・物理的手がかりを強化した基盤モデルVLA/基盤モデル2026/4/1
クラウド側でVLMに3次元幾何認識と物理的手がかりを統合し、空間推論や具現化タスクの性能を向上させる基盤モデルを提案した。
- 対話強化型長期間協調視覚言語ナビゲーション DeCoNav群制御2026/4/1
複数ロボットが対話で情報交換し、動的にタスクを再割り当て・再計画しながら長期間の協調ナビゲーションを行う枠組みを提案し、ベンチマークで成功率を大幅に向上させた。
- PerlAD: 擬似シミュレーションに基づく強化学習による閉ループエンドツーエンド自動運転の性能向上自動運転2026/3/1
オフラインデータから構築したベクトル空間上の擬似シミュレーションと予測ワールドモデルを用いて、レンダリング不要で効率的な強化学習による閉ループ自動運転を実現した。
- 拡散モデルによるエンドツーエンド自動運転の可能性を解き放つ自動運転/拡散モデル2026/2/1
実車データと公道試験を通じて拡散モデルをエンドツーエンド自動運転のプランナーとして大規模に検証し、学習の鍵となる知見と強化学習による事後学習を提案、実車で10倍の性能向上を達成した。
- MeanFuser: MeanFlowによる高速ワンショット多様体軌道生成と適応的再構成を用いたエンドツーエンド自動運転自動運転/軌道生成2026/2/1
ガウス混合ノイズとMeanFlowを組み合わせ、離散アンカーに依存せず高速かつロバストに軌道を生成するエンドツーエンド自動運転手法を提案。
- 遮蔽歩行者シナリオにおける能動的推論による人間らしいロボット・人間間のインタラクション自動運転/歩行者予測2026/2/1
遮蔽された歩行者の突然の出現に対処するため、能動的推論に基づく枠組みを提案し、RBPFによる状態推定と信念リセット・仮説注入で人間らしい認知を模倣、CEM強化MPPIで計画を行う。
- 視点汎化可能なロボットマニピュレーションのための幾何学的3D視覚表現学習マニピュレーション2026/1/1
単視点の3D事前学習とマルチステップ蒸留により、多様なカメラ視点に汎化するマニピュレーション方策を学習するフレームワークを提案。
- 二分的拡散方策最適化拡散方策/強化学習2026/1/1
拡散方策の強化学習において、報酬最大化と最小化の二つの方策に分解し、推論時にスコアを線形結合することで安定かつ制御可能な最適化を実現する手法を提案。
- 指し示す場所を意図せよ:視覚的根拠に基づく指示ポリシーVLA2025/12/1
言語指示にバウンディングボックスなどの視覚的手がかりを追加することで、混雑環境や未知物体でも対象を正確に特定できるVLAポリシー「Point-VLA」を提案し、自動データ注釈パイプラインで効率的に学習した。
- MindDrive: オンライン強化学習による自動運転向け視覚言語行動モデルVLA2025/12/1
自動運転VLAの課題を解決するため、LLMに2種類のLoRAを組み合わせ、離散的な言語決定に対してオンライン強化学習を行うフレームワークを提案した。
- MiMo-Embodied: クロス身体性基盤モデル技術報告VLA2025/11/1
自動運転と身体性AIを統合した初のクロス身体性基盤モデルを開発し、両分野で最先端性能を達成した。
- DriveMRP: 合成モーションデータによる視覚言語モデルのモーションリスク予測強化自動運転2025/7/1
BEVベースのシミュレーションで高リスクな運転モーションデータを合成し、視覚言語モデルのリスク予測性能を大幅に向上させるフレームワークを提案した。
- ReCogDrive:強化学習型認知フレームワークによるエンドツーエンド自動運転自動運転/VLA2025/6/1
VLMの運転知識を拡散プランナに注入し、DiffGRPOで安全性を強化する自動運転フレームワークを提案。NAVSIMとBench2Driveで最先端性能を達成。
- AgentThink:自動運転向け視覚言語モデルにおけるツール拡張型思考連鎖推論の統合フレームワークVLA2025/5/1
自動運転向けに、思考連鎖推論と動的なツール呼び出しを統合したフレームワークAgentThinkを提案し、DriveLMM-o1ベンチマークで推論スコアを53.91%向上させた。
- GSGTrack: ガウススプラッティング誘導によるRGB動画からの物体姿勢追跡物体姿勢追跡2024/12/1
単眼RGB動画から未知物体の6DoF姿勢を追跡するため、3Dガウススプラッティングとグラフベース幾何最適化を同時に行い、深度情報なしで高精度な追跡と再構成を実現した。
- 自動運転のためのマルチエージェント強化学習:サーベイマルチエージェント強化学習2024/8/1
自動運転と高度交通システムにおけるマルチエージェント強化学習の研究を、シミュレータの評価指標や環境モデリング、アルゴリズム設計の観点から整理したサーベイ論文。
- イベントとフレームの階層的特徴洗練ネットワークによる物体検出イベントカメラ/物体検出2024/7/1
イベントカメラと通常カメラの異種モダリティを粗から細への適応的特徴洗練モジュールで融合し、物体検出の性能とロバスト性を大幅に向上させた論文。
- GarchingSim: An Autonomous Driving Simulator with Photorealistic Scenes and Minimalist Workflow2024/1/1
- SUPS: A Simulated Underground Parking Scenario Dataset for Autonomous Driving2023/2/1
- A Human-Centered Safe Robot Reinforcement Learning Framework with Interactive Behaviors2023/2/1
- Gaussian Process-Based Model Predictive Control for Overtaking2021/1/1
- Efficient Pig Counting in Crowds with Keypoints Tracking and Spatial-aware Temporal Response Filtering2020/5/1
- Neuromorphic Visual Odometry System for Intelligent Vehicle Application with Bio-inspired Vision Sensor2019/9/1
- Globally optimal vertical direction estimation in Atlanta World2019/4/1
- Self-Localization of Parking Robots Using Square-Like Landmarks2018/12/1
- An Efficient L-Shape Fitting Method for Vehicle Pose Detection with 2D LiDAR2018/12/1