Jie Wang
University of Science and Technology of China
収録論文 28本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CogWAM: イベント駆動型インターフェースによる意味認知と世界行動モデリングの整合VLA2026/9/29
タスク推論と世界行動学習の間に持続的な意味状態を介した明示的なインターフェースを設け、進捗条件付きクエリで未来予測と行動生成を整合させる認知誘導型世界行動モデルを提案。
- 公共空間におけるRoboCafé:長期的な人間とロボットのインタラクションにおける継続性人間ロボットインタラクション2026/9/23
大学の建物で12日間、自律型会話コーヒーロボットを運用し、繰り返しの注文や集団の変化に対応するためのインタラクション継続性の設計要件を導出した。
- 分離断面構成則によるトリムヘリコイド柔軟アームのCosseratモデリング柔軟ロボットモデリング2026/9/21
トリムヘリコイド柔軟アームの荷重を支える螺旋領域が分離している構造を考慮し、各領域を局所座標で評価して背骨に引き戻す分離断面構成則を提案し、動的Cosseratモデルに組み込んで高精度な位置予測と高速計算を実現した。
- AXIS:拡張可能なロボット操作のためのコミュニティ駆動型データエンジンデータエンジン/操作学習2026/7/1
ブラウザベースの遠隔操作で大規模なデモ収集を可能にし、タスクの自動生成・検証とデータ品質向上を組み合わせた、拡張可能なロボット操作学習用データエンジンとベンチマークを提案。
- Flux-Guard: 拡散モデルを用いた顔認証プライバシー保護顔認証/プライバシー保護/拡散モデル2026/6/16
顔編集とプライバシー保護を統合した生成フレームワークを提案し、敵対的攻撃により不正な顔認証を防ぎつつ編集品質を維持する。
- SI-Diff: 力領域拡散ポリシーによる探索と高精度挿入の学習フレームワークマニピュレーション2026/5/1
力覚情報を用いた拡散ポリシーにより、単一モデルで探索と高精度挿入の両タスクを学習するフレームワークを提案。モード条件付けと教師ポリシーにより、位置ずれ許容範囲を拡大し、未知形状へのゼロショット転移も実現。
- Xiaomi OneVL: ワンステップ潜在推論と視覚言語説明によるプランニング自動運転/VLA2026/4/1
自動運転のVLAモデルにおいて、潜在推論を視覚世界モデルで強化し、明示的CoTを超える精度を実現しつつ、推論速度を回答のみの予測と同等に高速化したフレームワークを提案した。
- TiPToP: 計画を行うモジュラーなオープン語彙ロボットマニピュレーションシステムマニピュレーション2026/3/1
事前学習済み基盤モデルとGPU加速タスク・モーションプランナを組み合わせ、RGB画像と言語から直接ロボット操作を計画・実行するモジュラーシステムを提案。訓練データ不要でVLAを上回る成功率と速度を達成。
- OmniGuide:汎用ロボットポリシーを強化する万能ガイダンス場VLA2026/3/1
3D基盤モデルやVLMなどの多様なガイダンスを微分可能なエネルギー関数として表現し、VLAモデルの行動サンプリングを誘導することで、複雑な操作タスクの成功率と安全性を向上させるフレームワーク。
- 浅瀬からマリアナ海溝まで:生体模倣型水中ソフトロボットのサーベイソフトロボティクス2026/1/1
水中の極限環境に適応する生体模倣型ソフトロボットの最近の研究を、設計思想や環境要因ごとに整理し、実用化への課題と次世代への展望をまとめたサーベイ論文。
- 実世界強化学習による能動的知覚行動の獲得マニピュレーション2025/12/1
訓練時のみ利用可能な特権センサを活用した非対称アドバンテージ重み付き回帰(AAWR)を提案し、部分観測下で情報収集する能動的知覚行動を実ロボットで効率的に学習させる手法を実証した。
- 一歩先へ:フィードスルーと配置を考慮した直交フロアプランナフロアプランニング2025/7/1
チップ設計のフロアプランニングにおいて、フィードスルーとモジュール内配置を考慮した3段階の直交フロアプランナFloraを提案し、HPWLやフィードスルーを削減した。
- RoboArena:汎用ロボットポリシーの分散型実世界評価ロボット評価/ベンチマーク2025/6/1
評価者ネットワークが自由にタスクと環境を選び、ペア比較の二重盲検評価を集約することで、汎用ロボットポリシーをスケーラブルかつ公平にランキングする手法を提案し、7機関・600以上の実機評価で有効性を示した。
- DeepSeekは外科医のように推論できるか?ロボット支援手術における視覚言語理解の実証評価VLA2025/3/1
DeepSeekモデルをロボット手術の視覚言語タスク(単語QA・視覚QA・詳細記述)で評価し、汎用マルチモーダルモデルより優れるが臨床要件には未達であることを示した実証研究。
- ZeroMimic: Web動画からロボット操作スキルを蒸留模倣学習2025/3/1
人間の一人称視点動画データセットから、多様な物体や未知の環境で即時展開可能な画像ゴール条件付き操作スキルポリシーを生成するシステムを提案。
- VTD: ドライバー状態と行動知覚のための視覚・触覚データベースマルチモーダル知覚2024/12/1
運転シミュレータ上で疲労・注意散漫状態のマルチモーダルデータを収集し、視覚と触覚を統合したドライバー状態・行動知覚用のデータセットを構築した。
- 分散データベースとマルチモーダル知覚によるリアルタイム車車間通信ネットワーク協調制御システム:交差点での実証V2V通信/協調制御2024/10/1
車車間通信と分散データベース、マルチモーダル知覚を統合した協調制御システムを開発し、実車両プラットフォームと交差点環境で衝突回避と交通計画の有効性を実証した。
- ロボット手術におけるSAM 2:手術映像セグメンテーションの堅牢性と汎化性能の実証評価手術映像セグメンテーション2024/8/1
セグメンテーションモデルSAM 2を手術映像にゼロショット適用し、点・ボックスプロンプトでの精度や画像劣化への堅牢性をEndoVisベンチマークで評価した。
- Surgical-LVLM:手術支援のための視覚的質問応答に適応する大規模視覚言語モデルVLA2024/5/1
手術動画の視覚的質問応答と領域特定のため、大規模視覚言語モデルにVP-LoRAとToken-Interactionモジュールを組み込み、複雑な手術シーンでの性能を向上させた。
- ガウス過程学習ベースモデル予測制御のチュートリアル制御/GP-MPC2024/4/1
ガウス過程とモデル予測制御を統合したGP-MPCについて、平均・分散伝播の近似を含む体系的な数式定式化を初めて示し、ロボット制御への応用例を解説したチュートリアル論文。
- 歩行を超えて:多様な状況でのシームレスな義足制御のための膝角度学習義足制御2024/4/1
全身の動きを入力とするTransformerベースの確率的フレームワークを提案し、歩行以外の多様な状況でも高精度に膝角度を推定して義足のシームレスな制御を実現した。
- 混合交通の安全性向上:学習ベースの人間運転車両モデリングと効率的制御自動運転/制御2024/4/1
人間運転車両の挙動を第一原理モデルとガウス過程学習でモデル化し、不確実性を考慮したモデル予測制御で自動運転車両の安全な車間制御を実現した。
- OSSAR: Towards Open-Set Surgical Activity Recognition in Robot-assisted Surgery2024/2/1
- Learning-Based Modeling of Human-Autonomous Vehicle Interaction for Improved Safety in Mixed-Vehicle Platooning Control2023/3/1
- Improving safety in mixed traffic: A learning-based model predictive control for autonomous and human-driven vehicle platooning2022/11/1
- Jointly Learning Agent and Lane Information for Multimodal Trajectory Prediction2021/11/1
- An Intuitive Tutorial to Gaussian Process Regression2020/9/1
- Autonomous Locomotion Mode Transition in Quadruped Track-Legged Robots: A Simulation-Based Analysis for Step Negotiation2019/5/1