Kai Wang
Institute of Automation, Chinese Academy of Sciences
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DiFF: ドップラー情報を活用したフローマッチングによる人間動作フロー推定動作推定2026/9/30
4Dミリ波レーダーの点群から人間の非剛体動作フローを推定するため、ドップラー速度の事前情報とKANベースの条件付きフローマッチングを組み合わせた生成フレームワークDiFFを提案。
- ゴーストタック:物理的接触なしに触覚センサーを操作するセキュリティ/触覚2026/8/21
電磁干渉を用いて触覚センサーの出力を遠隔から操作する攻撃手法を提案し、ロボットの触覚認識を欺くことを実証した。
- HarnessWAM:世界行動モデルにおける予測と熟考の橋渡しVLA2026/8/1
世界行動モデル(WAM)の予測と実行のギャップを埋めるエージェントフレームワークを提案。視覚言語モデルによるタスク管理とイベント駆動の二重タイムスケールフィードバックで、複雑なタスクの計画・実行・失敗回復を実現する。
- XEWorld:行動条件付きワールドモデルは未知のロボット形態に汎化できるか?ワールドモデル2026/8/1
ロボット操作のための行動条件付きワールドモデルが、未見のロボット形態に対して物理ダイナミクスを捉えているかを検証するため、クロスエンボディメントテストベッドXEWorldを導入し、既存モデルの限界を分析した。
- FlowWAM: オプティカルフローを世界行動モデルの統一アクション表現として用いるVLA2026/7/1
事前学習済みビデオ生成モデルを活用する世界行動モデル(WAM)において、アクション表現としてオプティカルフローを用いることで、制御精度と世界モデリング性能を向上させる手法を提案した。
- GigaWorld-Policy-0.5: AutoResearchによる高速・高精度なWAMの実現VLA2026/7/1
将来の視覚予測を訓練時のみに用い、推論時は行動生成のみで高速化した行動中心のWorld Action Modelを提案し、AutoResearchで最適設定を探索して性能を向上させた。
- SymTRELLIS: 対称性を強制するボクセル潜在表現による3D生成3D生成2026/6/2
3D生成モデルに任意の点群対称性(回転・鏡映・多面体)を、再学習なしで強制する手法を提案。潜在空間での変換を線形演算子で近似し、ODEステップで速度を対称化する。
- 構造化された段階とキーフレーム監視による視覚言語行動モデルのファインチューニング改善VLA2026/6/1
ロボット操作のVLAモデルにおいて、グリッパーイベント遷移に失敗が集中する問題を解決するため、デモのグリッパー状態から自動的に段階分類器とキーフレーム予測器を補助ヘッドとして学習し、ベースポリシーを変えずに性能を向上させるStaKeフレームワークを提案した。
- DiM-WAM: 多様な履歴イベントメモリを用いた世界行動モデリングVLA2026/6/1
長期依存タスク向けに、多スケールの履歴コンテキストとタスク進捗を統合したメモリ拡張型世界行動モデルを提案し、ロボット操作の成功率を大幅に向上させた。
- WAM-Nav: 非対称潜在世界行動モデリングによる統合視覚ナビゲーションナビゲーション2026/6/1
視覚ナビゲーションのための潜在世界行動モデルを提案し、行動生成と視覚予測を共同で学習することで、推論効率を保ちつつ先見的な障害物回避を実現した。
- LaWAM: 効率的なダイナミクス認識ロボットポリシーのための潜在世界行動モデルVLA2026/6/1
ロボットの行動がシーンをどう変えるかを予測する潜在空間の世界モデルを導入し、ピクセル単位の動画生成を避けつつ、高成功率と低遅延を実現した。
- 大規模基盤モデルにおける音声視覚知能マルチモーダル2026/5/5
音声と視覚の統合的理解・生成・対話を大規模基盤モデルの観点から体系的に整理した初のサーベイ論文。
- 推論時適応アクションチャンキングによる視覚言語行動モデルの性能向上VLA2026/4/1
VLAモデルにおいて、アクションのチャンクサイズを予測のエントロピーに基づいて適応的に決定する戦略を提案し、シミュレーションと実世界の操作タスクで性能を向上させた。
- 不確実性を考慮した観測再注入による視覚-言語-行動モデルの強化VLA2026/2/1
VLAモデルの言語層の不確実性が高いときに、観測情報を次層のFFNに再注入する訓練不要のプラグインモジュールを提案し、追加データやモジュールなしで行動生成の精度と信頼性を向上させた。
- BridgeV2W: 身体マスクで動画生成モデルを身体性世界モデルへ橋渡し世界モデル2026/2/1
座標空間の行動をURDFとカメラパラメータから描画した身体マスクに変換し、ControlNet風に動画生成モデルへ注入することで、視点や身体構造に依存しない統一的な身体性世界モデルを実現した。
- EgoDemoGen: ロボットマニピュレーションにおける視点汎化のための自己中心視点デモ生成マニピュレーション2025/9/1
自己中心視点が変化しても動作する模倣学習ポリシーのため、新視点での観測と行動のペアを生成するフレームワークを提案。軌道変換と条件付き動画生成を組み合わせ、シミュレーションと実機で成功率を大幅に改善した。
- iLearnRobot:対話から継続的に学習するマルチモーダルロボットVLA2025/7/1
非専門家との自然な対話を通じてロボットが継続的に学習・改善するMLLMベースの対話型ロボットシステムを提案し、質問連鎖と二重モダリティ検索で同じミスの繰り返しを防ぐ。
- 視覚障害者向け大規模視覚言語モデルによる環境認識システムVLA2025/4/1
RGB画像のセグメンテーション結果を外部知識としてLVLMに入力し、幻覚を抑えつつ視覚障害者が周囲環境を理解できるウェアラブルシステムを提案した。
- 拡散ポリシーのための効率的なオンライン強化学習強化学習2025/2/1
拡散ポリシーをオンライン強化学習で効率的に学習するため、損失関数を再重み付けしたReweighted Score Matchingを提案し、DPMDとSDACの2アルゴリズムを開発した。
- ν-DBA: ニューラル陰的密バンドル調整による画像のみの走行シーン再構成SLAM/3D再構成2024/4/1
3Dニューラル陰的表面で地図を表現し、密オプティカルフローに導かれた幾何誤差で軌跡と地図を同時最適化する密バンドル調整フレームワークを提案し、走行シーンの軌跡推定と密再構成精度を向上させた。
- NGEL-SLAM: Neural Implicit Representation-based Global Consistent Low-Latency SLAM System2023/11/1
- Scenario Diffusion: Controllable Driving Scenario Generation With Diffusion2023/11/1
- Implementation and Evaluation of Networked Model Predictive Control System on Universal Robot2023/7/1
- Deep Learning based Wearable Assistive System for Visually Impaired People2019/8/1
- Vision-based Robotic Grasping From Object Localization, Object Pose Estimation to Grasp Estimation for Parallel Grippers: A Review2019/5/1
- Deep Learning Based Robot for Automatically Picking up Garbage on the Grass2019/4/1