Ke Wang
CUHK MMLab
収録論文 24本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ECoMEM: 記憶依存型ロボット制御のための明示的概念メモリVLA2026/9/30
タスクに関連する過去の情報を「概念」として明示的に記録・更新し、それをVLAポリシーの条件付けに使うメモリ機構を提案。長期的タスクや実機タスクで高い成功率を達成した。
- MultiTalk: 長時間・多人数・バイリンガル会話への全二重音声モデルの拡張音声対話2026/9/29
長時間・多人数・英中バイリンガルの全二重音声対話モデルを実現するため、57.6k時間の合成データセットと実録音ベースの評価ベンチマークを構築した研究。
- GNNロバスト性の分離解析フレームワーク:相転移からシステム崩壊までGNNロバスト性2026/9/15
ラベルノイズと特徴分布シフトを別々に操作できる合成グラフ回帰ベンチマークを構築し、GNNが中程度のラベルノイズには耐えるが深刻な分布シフトで劇的に性能劣化することを示した。
- EvoHIL: 自己進化型報酬とフローマッチングによるポリシー最適化を用いた堅牢な人間参加型強化学習強化学習2026/8/1
人間参加型強化学習において、報酬モデル・行動生成・視覚ドメインの3つの限界を同時に適応させる統一フレームワークEvoHILを提案し、照明変化下の6つの操作タスクで性能を向上させた。
- nuTruck: 分散電動駆動トラックの自動運転計画のベンチマーク自動運転/ベンチマーク2026/7/1
分散電動駆動トラック(DET)向けに、高精度な非線形車両モデルと閉ループ評価を備えた初のベンチマークnuTruckを提案し、学習ベースのプランナーの性能を評価した。
- Ego-Pi: 自己中心視点の人間・ロボットデータによるVLAファインチューニングVLA2026/6/6
ロボット操作のデータ不足を解決するため、自己中心視点の人間データを活用してVLAモデルをファインチューニングし、ロボットが新しいタスクの意味を学習し、既存スキルを組み合わせて新行動を生み出せることを示した論文。
- LEGS: 具現化ガウススプラッティング世界における遠隔操作不要のVLA微調整による人型ロコ操作VLA/シミュレーション/人型ロボット2026/6/1
人型ロボットの移動操作タスク向けに、遠隔操作デモなしで合成データを生成し、VLAポリシーを微調整するハイブリッドシミュレータLEGSを提案。3DGS背景とメッシュ前景を組み合わせ、実機で遠隔操作デモと同等以上の性能を達成した。
- 照明変化に頑健な人間参加型ロボット強化学習強化学習2026/5/1
照明変化による視覚分布のずれで性能が落ちる問題に対し、追加の実ロボット操作なしで、画像の再照明と忘却防止機構を組み合わせたオフライン微調整フレームワークRoHILを提案した。
- ロックインの打破:低データVLA後訓練における操縦性の維持VLA2026/4/1
低データでの後訓練後にVLAポリシーが新しい指示に応答しなくなる「ロックイン」現象を特定し、視覚的接地の維持とテスト時の対照的プロンプトガイダンスによりこれを緩和するDeLockを提案した。
- 物理情報を組み込んだ二重分岐エンコーダによる深層混合クープマン車両ダイナミクスモデル:分散電動駆動トラック向け車両ダイナミクスモデリング2026/3/1
分散電動駆動トラックの複雑な非線形ダイナミクスを、クープマン作用素理論と二重分岐エンコーダを用いて線形埋め込み空間で高精度にモデル化する手法を提案した。
- SG-Reg: 汎用性と効率性を備えたシーングラフ位置合わせシーングラフ位置合わせ2025/4/1
複数の意味的シーングラフを位置合わせするため、意味・トポロジー・形状特徴を統合したノード表現と粗から細へのマッチング、ロバスト姿勢推定を組み合わせた手法を提案。視覚基盤モデルによるデータ生成も導入し、SLAMベンチマークで有効性を示した。
- 膝なし二足歩行ロボットSLIDERのための拡張ハイブリッドゼロダイナミクス歩行2025/4/1
膝なし二足歩行ロボットSLIDERのハードウェアを改良し、拡張ハイブリッドゼロダイナミクスと深層強化学習を組み合わせて、MPCベースの手法より150%高速な歩行制御を実現した。
- SplatPose:3Dガウシアンスプラッティングによる単一RGB画像からの幾何認識6自由度姿勢推定姿勢推定2025/3/1
3Dガウシアンスプラッティングと二分岐ニューラルネットを組み合わせ、単一RGB画像のみから高精度な6自由度姿勢推定を実現するフレームワークを提案。
- FM-Fusion: 視覚言語基盤モデルで強化されたインスタンス認識セマンティックマッピングセマンティックマッピング2024/2/1
視覚言語基盤モデルから得られるオープンセットな検出結果を確率的に融合し、過分割を統合することで、ゼロショットで汎用的なインスタンス認識セマンティックマップを構築する手法を提案。
- Poly-MOT: A Polyhedral Framework For 3D Multi-Object Tracking2023/7/1
- Online Multi-Contact Receding Horizon Planning via Value Function Approximation2023/6/1
- Grid-Centric Traffic Scenario Perception for Autonomous Driving: A Comprehensive Review2023/3/1
- When and Where to Step: Terrain-Aware Real-Time Footstep Location and Timing Optimization for Bipedal Robots2023/2/1
- Fast Online Optimization for Terrain-Blind Bipedal Robot Walking with a Decoupled Actuated SLIP Model2021/9/1
- A Unified Model with Inertia Shaping for Highly Dynamic Jumps of Legged Robots2021/9/1
- Salient Bundle Adjustment for Visual SLAM2020/12/1
- Approaches, Challenges, and Applications for Deep Visual Odometry: Toward to Complicated and Emerging Areas2020/9/1
- Asynchronous Real-Time Optimization of Footstep Placement and Timing in Bipedal Walking Robots2020/7/1
- FlowNorm: A Learning-based Method for Increasing Convergence Range of Direct Alignment2019/10/1