Wenchao Ding
Fudan University
収録論文 41本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- TacDyn-WAM: 異種視触覚ワールドアクションモデルにおける暗黙的触覚ダイナミクスの学習触覚2026/9/30
触覚の未来画像を再構成する代わりに、触覚ダイナミクスを表現空間で予測する視触覚ワールドアクションモデルを提案し、UniVTACで81.5%の成功率を達成した。
- CAP: 学習型ノイズ除去による連続適応型知覚ブラインドヒューマノイド歩行歩行2026/9/10
劣化した深度入力を学習型デノイザで復元しつつ固有感覚も併用することで、知覚が不確実な環境でも途切れずに歩行できるヒューマノイド制御ポリシーを提案した。
- 潜在アクションを意図として用いた効率的な未来想像による世界行動モデルVLA2026/8/25
ロボット制御のための世界行動モデルにおいて、テスト時の未来観測生成の遅延を削減するため、潜在アクションを意図の表現として用いるLAWAを提案。将来の観測を生成せずに効率的な未来想像を実現し、少ないデモデータや分布外シナリオでの性能を向上させた。
- JEPA-WAM: ロボット操作のためのワールドアクションモデルにおける段階レベル結合埋め込み予測操作2026/8/1
ロボット操作タスクにおいて、短期的な物理的未来と段階的な意味的未来を区別し、後者を予測するStage-JEPAを導入したワールドアクションモデルを提案。50タスクで成功率90.25%を達成し、実行ステップ数を削減した。
- VT-WAM: 接触を伴う操作のための視覚-触覚ワールドアクションモデルマニピュレーション2026/7/1
接触を伴う操作タスク向けに、視覚予測・触覚変形予測・行動予測を統合したフレームワークを提案し、実世界6タスクで高い成功率を達成した。
- AutoSpeed: 注釈不要の段階適応型動作速度学習によるロボット操作マニピュレーション2026/7/1
操作タスクの各段階の難易度に応じて動作速度と予測時間を適応させる学習フレームワークを提案し、注釈なしで速度を調整し、タスク実行時間を短縮し成功率を向上させる。
- TacForeSight: 接触豊富な操作のための力誘導型触覚ワールドモデル触覚/操作2026/6/1
接触を伴う操作タスクにおいて、力覚と触覚の非対称な時空間的役割を考慮し、触覚潜在ダイナミクスを予測する軽量な触覚ワールドモデルと、予測結果を活用するポリシーを提案。実機実験で動的接触外乱下での優位性を示した。
- 部分観測環境における自動運転のための統合リスクマップ学習自動運転/リスクマップ2026/5/1
自動運転における遮蔽によるリスクを、交通流リスクと衝突リスクを統合したリスクマップとしてモデル化・学習し、拡散モデルによる敵対的シナリオ生成も組み合わせて、部分観測下でのリスク認識計画を実現した。
- 潜在空間での高周波連続アクションチャンク学習ロボット制御2026/5/1
高周波(60Hzなど)のロボット制御において、アクション空間ではなくVAEによる潜在空間でアクション学習を行うことで、時間的・空間的一貫性を向上させ、さらにチャンク間の連続性を改善する手法を提案した。
- エンドツーエンド自動運転におけるナビゲーション理解の驚くべき有効性の解明自動運転2026/4/1
エンドツーエンド自動運転システムが局所シーン理解に過度に依存し、大域ナビゲーション情報を活用できていない問題を指摘し、実世界のナビゲーションパターンに基づく逐次ナビゲーションガイダンス(SNG)フレームワークと、それを用いたVQAデータセットおよびモデルSNG-VLAを提案して、ナビゲーション追従性能を向上させた。
- PokeVLA: 包括的な世界知識の指導によるポケットサイズの視覚言語行動モデルの強化VLA2026/4/1
この論文は、ロボット操作のための軽量な視覚言語行動モデルPokeVLAを提案し、2段階のトレーニングと新しいアクションエキスパートにより、LIBERO-Plusベンチマークと実世界で高い性能を達成した。
- Flash-Mono: フィードフォワード高速化によるガウススプラッティング単眼SLAMSLAM2026/4/1
単眼3DガウススプラッティングSLAMの時間効率・幾何精度・多視点一貫性の問題を解決するため、フィードフォワード型の予測フロントエンドと2Dガウスサーフェルを用いた高速SLAMシステムを提案した。
- VistaBot: 時空間認識ビュー合成による視点ロバストなロボット操作マニピュレーション2026/4/1
カメラ視点の変化にロバストなロボット操作を実現するため、幾何モデルとビデオ拡散モデルを統合したフレームワークVistaBotを提案。テスト時のカメラ校正不要で、シミュレーションと実世界で性能を検証した。
- 身体性ナビゲーションのためのエージェント的自己進化的再計画ナビゲーション2026/3/1
複雑環境での身体性ナビゲーションの失敗に対処するため、ロボット自身を実行時学習で進化させる自己進化的再計画法(SERP)を提案。適応的機能調整とグラフ上のLLM推論により、成功率向上とトークン消費削減を実現。
- OmniVTA: 接触を伴うロボット操作のための視覚-触覚世界モデル操作2026/3/1
接触を伴う操作タスクのために、大規模な視覚-触覚-行動データセットと、触覚信号を予測・閉ループ制御に活用する世界モデルベースのフレームワークを提案した論文。
- Rhythm: 双ヒューマノイドのインタラクティブ全身制御学習全身制御2026/3/1
人間の動作データから2体のヒューマノイドが抱擁やダンスなどの全身協調動作を実機で行えるようにする統合フレームワークを提案。
- CMoE: 人型ロボットの運動制御と地形適応のための対比混合エキスパート歩行2026/3/1
混合エキスパートのゲーティングが地形ごとに均一化する問題を、対比学習で専門化を促すことで解決し、複雑な地形を歩行できる人型ロボット制御手法を提案した。
- 適応的ワーキングメモリ再符号化によるロボットマニピュレーションの状態曖昧性解消マニピュレーション2025/12/1
人間のワーキングメモリ再符号化に着想を得て、適応的ワーキングメモリを備えた視覚運動ポリシーPAMを提案し、長い履歴窓でも高速推論を維持しながら状態曖昧性を解消する。
- その手の中の世界:実環境での人間中心マニピュレーション学習のための大規模オープンソースエコシステムマニピュレーション2025/12/1
実環境で収集した1000時間超の人間のマニピュレーションデータとウェアラブル収集キット、ベンチマークをオープンソースで提供し、ロボットのマニピュレーション成功率を8%から60%に向上させた。
- CSMapping: 自動運転のためのスケーラブルなクラウドソーシング意味地図構築とトポロジー推論自動運転地図構築2025/12/1
低コストセンサのノイズに頑健な生成事前分布と制約付き最適化を用いて、クラウドソーシングデータから高精度な意味地図と道路中心線を生成するシステムを提案。
- 局所3D占有予測と汎用グローバル占有マッピングの協調学習3D占有予測2025/4/1
過去の走行で得たグローバル占有マップを事前情報として活用し、局所的な3D占有予測を高精度化すると同時に、新しい観測でグローバルマップを更新するプラグアンドプレイ型フレームワークを提案。
- 回廊を走れ:回廊学習と計画によるエンドツーエンド自動運転の安全性向上自動運転/エンドツーエンド計画2025/4/1
自動運転の安全性向上のため、障害物のない時空間領域「回廊」を中間表現として予測し、軌道最適化の制約に組み込むエンドツーエンド学習手法を提案。nuScenesで衝突を大幅削減。
- マルチビークル相互作用のためのトポロジー駆動型軌道最適化軌道最適化/群制御2025/3/1
トポロジカルプランニングに着想を得た微分可能な局所ホモトピー不変量メトリックを制約として組み込み、同一初期値から複数の相互作用軌道を生成し、制御可能な相互作用を実現する軌道最適化フレームワークを提案した。
- VINGS-Mono: 大規模シーンにおける単眼視覚慣性ガウススプラッティングSLAMSLAM2025/1/1
単眼カメラと慣性センサを用い、ガウススプラッティングで大規模屋外環境をリアルタイムに地図構築・自己位置推定するSLAMフレームワークを提案。
- シミュレーションによる計画:自動運転のための学習ベース並列シナリオ予測を用いた動作計画自動運転/動作計画2024/11/1
自動運転において、自車の計画が他車の予測に与える影響を考慮し、モンテカルロ木探索と学習ベースの並列シナリオ予測を組み合わせて安全な軌道を計画する手法を提案した。
- Dual-AEB: ルールベースとマルチモーダル大規模言語モデルを融合した緊急ブレーキシステム自動運転2024/10/1
マルチモーダル大規模言語モデルによるシーン理解と従来のルールベースAEBを組み合わせ、開放的な状況でも迅速に緊急ブレーキを判断できるシステムを提案した。
- HGS-Planner: 3Dガウシアンスプラッティングを用いた能動的シーン再構成のための階層的計画フレームワーク能動的再構成/3DGS2024/9/1
3Dガウシアンスプラッティングを活用し、完成度と品質の向上を評価しながら大域・局所計画を統合することで、未知環境を高速かつ高精細に能動再構成する階層的計画手法を提案した。
- OccLLaMA: 自動運転のための占有・言語・行動生成ワールドモデルVLA2024/9/1
意味的占有を視覚表現として用い、視覚・言語・行動を自己回帰モデルで統合した自動運転向け生成ワールドモデルを提案し、4D占有予測・運動計画・視覚質問応答で競争力のある性能を示した。
- 能動的知覚による遮蔽対応意思決定の学習自動運転2024/9/1
強化学習と予測を統合したPad-AIフレームワークを提案し、動的・静的遮蔽環境での自動運転意思決定を効率的に学習する。
- DeepPointMap: Advancing LiDAR SLAM with Unified Neural Descriptors2023/12/1
- FlowMap: Path Generation for Automated Vehicles in Open Space Using Traffic Flow2023/5/1
- EPSILON: An Efficient Planning System for Automated Vehicles in Highly Interactive Environments2021/8/1
- Learning to Predict Vehicle Trajectories with Model-based Planning2021/3/1
- FP-Stereo: Hardware-Efficient Stereo Vision for Embedded Applications2020/6/1
- PiP: Planning-informed Trajectory Prediction for Autonomous Driving2020/3/1
- Efficient Uncertainty-aware Decision-making for Automated Driving Using Guided Branching2020/3/1
- Safe Trajectory Generation for Complex Urban Environments Using Spatio-temporal Semantic Corridor2019/6/1
- An Efficient B-spline-Based Kinodynamic Replanning Framework for Quadrotors2019/6/1
- Trajectory Replanning for Quadrotors Using Kinodynamic Search and Elastic Optimization2019/3/1
- Predicting Vehicle Behaviors Over An Extended Horizon Using Behavior Interaction Network2019/3/1
- Online Vehicle Trajectory Prediction using Policy Anticipation Network and Optimization-based Context Reasoning2019/3/1