Xinhu Zheng
収録論文 24本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 報酬誘導型選好最適化による自動運転のための効率的マルチモーダル計画自動運転計画2026/9/30
スパースアンカーとオフセット精緻化を組み合わせたマルチモーダル軌道計画手法を提案し、報酬誘導型ファインチューニングで安全性を高め、NAVSIMベンチマークで精度と効率の両立を実現した。
- SLIP-VLA: 視覚言語行動モデルのための単一ステップ潜在想像による方策学習VLA2026/9/27
VLAモデルに1回のデノイズ更新で未来の潜在表現を生成する「単一ステップ潜在想像」を導入し、幾何・意味特徴との整合と行動条件付き世界モデルで未来を考慮した行動予測を効率化した手法。
- ActiveScale:モデル・データ・ハードウェアを横断したロボットの能動的知覚のスケーリングVLA2026/9/16
視点変更を伴う操作タスクのための能動的知覚フレームワークを提案し、カメラ姿勢を考慮したVLAモデル、1000時間の一人称視点データによる中間学習、単一操作者で遠隔操作可能な移動マニピュレーションプラットフォームを統合した。
- LIRA: 視覚言語行動デコーディングのための局所クロスレイヤー情報ルーティングVLA2026/8/1
VLAモデルにおいて、VLMの中間特徴をアクションデコーダにルーティングする新しい機構LIRAを提案。深さを考慮した局所ウィンドウで情報を集約し、既存のバックボーンや学習手法を変えずに性能を向上させる。
- 風の不確実性下におけるトラック支援型マルチUAV配送のためのエネルギー認識型耐風ルーティング配送/経路計画2026/8/1
風の不確実性を考慮し、UAVのエネルギー消費と帰還可能性を安全に管理するオンライン経路計画手法を提案した。
- PLAN-S: 潜在スタイルダイナミクスと計画を橋渡しする自動運転ワールドモデル自動運転2026/6/1
自動運転の潜在ワールドモデルにおいて、運転スタイルを条件付けた4チャンネルのセマンティックコストマップを復号し、計画モジュールに統合することで、リスクや運転スタイルの明示的な制御を可能にする新しいブリッジ手法を提案した。
- 拡散モデルに基づくUAV群の4D軌道予測と分散制御群制御2026/6/1
UAV群の安全で効率的な運用のため、粗密な軌道予測と不確実性を考慮した分散非線形モデル予測制御を統合したフレームワークを提案し、軌道追従誤差を10-15%削減した。
- 潜在誘導フローマッチングによる視覚言語行動ポリシーの改善VLA2026/6/1
視覚言語行動ポリシーに、成功可能性の軌跡を学習する自己誘導型フローマッチングを導入し、外部批評家なしで最良の行動選択を可能にする手法を提案した。
- 風の不確実性環境下における空陸協調マルチUAV配送のためのロバストなエネルギー考慮型ルーティング配送/ルーティング2026/4/1
風の影響を考慮したエネルギー消費モデルに基づき、UAV配送の帰還可能性をリアルタイムに評価するオンライン計画フレームワークを提案し、シミュレーションで成功率を向上させた。
- P$^{3}$Nav: 視覚と言語によるナビゲーションのためのエンドツーエンドの知覚・予測・計画ナビゲーション2026/3/1
視覚と言語によるナビゲーション(VLN)タスクにおいて、知覚・予測・計画を統合したエンドツーエンドのフレームワークを提案し、シーン理解を強化してナビゲーション成功率を向上させた。
- Fast-dVLA: 離散拡散VLAを実時間性能へ高速化VLA/拡散モデル/ファインチューニング2026/3/1
事前学習済みVLAモデルの性能向上と適応コスト削減を両立するため、補助タスクの能力ベクトルをパラメータ空間で分離・統合する手法を提案し、軽量な正則化で標準SFTと同等の性能を低計算コストで実現した。
- CoIn3D:構成不変なマルチカメラ3D物体検出の再考3D物体検出2026/3/1
マルチカメラ3D物体検出モデルが未知のカメラ構成にうまく一般化できない問題を解決するため、空間事前情報を明示的に組み込んだCoIn3Dフレームワークを提案した。
- 物体・シーン・カメラの分解と再構成によるデータ効率的な単眼3D物体検出単眼3D物体検出2026/2/1
訓練画像を物体・背景・カメラ姿勢に分解し、毎エポックで新たな組み合わせの画像を再構成することで、単眼3D物体検出モデルのデータ効率と汎化性能を高める手法を提案。
- 工事区間におけるVLM軌道計画の課題:緩和策と堅牢な自動運転に向けて自動運転/VLM2025/10/1
VLMによる工事区間の軌道計画を初めて体系的に調査し、失敗パターンを特定した上で、RAGを統合したREACT-Driveを提案して精度と推論速度を改善した。
- 混在交通環境における異種動的協調を考慮した意図駆動型車線変更フレームワーク自動運転/車線変更2025/9/1
人間ドライバーの運転スタイルをリアルタイム認識し、協調スコアとBC・IRL・MPCを組み合わせて、混在交通下での安全で社会的に調和した車線変更を実現する枠組みを提案した。
- FlowVLA: 視覚的思考連鎖による動作推論を用いた視覚-言語-行動モデルVLA2025/8/1
未来フレーム予測の前にオプティカルフローで動作を推論するVisual CoTを導入し、物理的に妥当な予測と高効率なロボット操作を実現した。
- SkyVLN:都市環境におけるUAVのための視覚言語ナビゲーションとNMPC制御VLA2025/7/1
大規模言語モデルを活用して自然言語指示と視覚情報からUAVを都市環境でナビゲートする枠組みを提案し、NMPCによる障害物回避と軌道追従を統合した。
- RationalVLA:デュアルシステムを備えた合理的視覚言語行動モデルVLA2025/6/1
曖昧・不可能な指示を拒否しつつ、実行可能な指示に基づくロボットアーム操作を行う二重システムの視覚言語行動モデルを提案し、新ベンチマークRAMAで評価した。
- 物理情報に基づくエンドツーエンド占有グリッド運動計画フレームワーク運動計画2025/5/1
人工ポテンシャル場を物理的制約として組み込んだエンドツーエンドの占有予測により、自律走行車の運動計画の安全性と汎化性能を向上させる手法を提案した。
- データ軽量逆強化学習による自動運転車の異文化展開自動運転2025/4/1
走行文化の異なる地域でも、現地データをほとんど使わずに逆強化学習で自動運転車を適応させる手法を提案し、独・中・米のデータで有効性を検証した。
- 脳に着想を得たスパイキングニューラルネットワークによる展開しやすい車線変更意図予測自動運転予測2025/2/1
スパイキングニューラルネットワークを用いて車両の車線変更意図を予測し、精度を保ちつつ学習時間を75%短縮、メモリ使用量を99.9%削減した。
- CAV-AHDV-CAV:新しい車間追従構造と強化学習によるCAVの交通振動抑制VLA2024/7/1
2台のCAVに挟まれたHDV列を1つの実体として扱う車間追従フレームワークを提案し、深層強化学習で混合交通の停止・発進振動を抑制する。
- EditFollower: カスタマイズ可能な適応型クルーズコントロールのための調整可能な車両追従モデル自動運転/車両追従モデル2024/7/1
運転の「礼儀のなさ」レベルを調整できるデータ駆動型の車両追従モデルを提案し、LSTMとTransformerに多様な礼儀計算手法を統合して、HighDとWaymoデータセットで精度とスタイル制御性を実証した。
- LIV-GaussMap: LiDAR-Inertial-Visual Fusion for Real-time 3D Radiance Field Map Rendering2024/1/1