Qi Dou
The Chinese University of Hong Kong
収録論文 41本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 強化学習ファインチューニングによる協調マルチエージェント視覚言語行動モデルVLA2026/9/29
事前学習済みVLAを3段階の強化学習ファインチューニングでマルチロボット協調に適応させ、初期化対応データ収集・オフライン信用フィルタリング・潜在空間オンラインRLにより成功率を大幅に向上させた。
- 手術の世界行動モデリングに向けて:手術動作計画のための視覚・軌道同時予測の予備的検討手術計画2026/8/20
手術映像と器具の軌跡を同時に予測する新しいモデルを提案し、将来の視覚状態と動作軌道の一貫性を評価する。
- SurgAM: ロボット自律性のための多モーダル特徴融合による手術アフォーダンスマップ予測手術ロボティクス2026/7/1
手術映像から吸引・クリッピング・牽引などの基本動作に適した領域を予測するアフォーダンスマップ手法を提案し、自己教師ありビジョントランスフォーマーと生成モデルの特徴を適応的に融合、階層的プロンプト学習とシーン誘導デコーダで精度を向上させた。公開データセットから新規データセットを構築し、ファントム実験で実用性も検証した。
- 行動生成はどこから始めるべきか?生成ロボットポリシーのための学習可能なソース事前分布生成ポリシー2026/6/16
生成ロボットポリシーの初期ノイズ分布を、 proprioception に基づく学習可能な対角ガウス分布に置き換える LeaP を提案し、15の操作タスクで成功率を向上させた。
- 周波数認識フローマッチングによる連続かつ一貫したロボット動作生成動作生成2026/6/1
離散的な動作チャンクに依存せず、周波数領域でフローマッチングを行うことで、異なる制御周波数や時間的不整合に頑健な連続動作を生成する手法を提案した。
- 基礎特徴量の幾何誘導モデリングによる一般化可能な物体形状変形学習3D再構成2026/5/28
単眼画像から3D物体形状を復元するため、カテゴリレベルのテンプレートを変形させる枠組みを提案し、基礎特徴量にテンプレートのトポロジーを組み込む幾何誘導機構と視点適応型特徴集約により、未知カテゴリや多視点への頑健な一般化を実現した。
- SSP: 行動制約と空間制約の同時最適化による安全性保証付き手術ポリシー手術ロボティクス2026/3/1
強化学習や模倣学習で得た手術ポリシーに、不確実性を考慮した制御バリア関数を組み合わせ、行動制約と空間制約を満たしつつ安全性を保証するフレームワークを提案した。
- 内視鏡下シーンにおける単眼2D/3Dリアルタイム知覚による柔軟ロボット内視鏡器具の制御医療ロボティクス2026/2/1
単眼内視鏡画像から柔軟器具の位置・姿勢と組織との距離をリアルタイムに推定する2D/3D学習ベース知覚アルゴリズムを提案し、物理シミュレータでデータを生成して連続体ロボットの制御性能を評価した。
- 条件付き拡散モデルによる接触マップ転送で汎用性の高い巧みな把持を生成マニピュレーション2025/11/1
形状テンプレートから新規物体へ高品質な把持を転送するため、接触マップ生成を条件付き拡散モデルで定式化し、パートマップと方向マップも連鎖的に転送する枠組みを提案した。
- RobustVLA: マルチモーダル摂動に対する視覚-言語-行動モデルのロバスト性VLA2025/10/1
VLAモデルの17種類の摂動に対するロバスト性を評価し、行動が最も脆弱であることを発見。出力と入力の両方に対するロバスト化手法を提案し、LIBEROで大幅な性能向上を達成。
- 信頼性の高いAR誘導手術ナビゲーションに向けて:データ駆動型生体力学とプロンプトを用いた対話的変形モデリング手術ナビゲーション2025/6/1
術前モデルと術中解剖のずれを補正するため、FEM精度を保ちつつ高速なデータ駆動型生体力学アルゴリズムを提案し、さらに外科医が対話的にプロンプトを与えて誤整列を修正する仕組みを導入した。公開データセットで平均誤差3.42mm、プロンプト併用で2.78mmを達成した。
- 手術ロボット自動操作のための拡散安定化ポリシー手術ロボット/模倣学習2025/3/1
不完全な軌道データでも学習できる拡散モデルベースのポリシー学習フレームワークを提案し、手術ロボットの自動操作における性能とロバスト性を向上させた。
- 幾何モデリングによる単眼内視鏡シーンのスケール対応深度推定の強化深度推定2024/8/1
単眼内視鏡画像のみから、器具の3D姿勢を幾何学的に推定してスケールを復元し、スケール対応の深度推定を可能にするフレームワークを提案した。
- SegSTRONG-C: 非敵対的生成劣化に対する手術器具のロバストセグメンテーション — EndoVis'24チャレンジセグメンテーション2024/7/1
手術器具セグメンテーションの深層学習モデルが、出血・煙・低照度などの現実的な画像劣化に対してどれだけ頑健かを評価するEndoVis'24チャレンジを開催し、ベースラインと参加手法を比較した。
- SimEndoGS: ロボット手術動画からの物理埋め込み3Dガウシアンによる効率的なデータ駆動型シーンシミュレーションsim2real2024/5/1
ステレオ内視鏡動画から3Dガウシアンを用いて手術シーンを再構成し、マテリアルポイント法で物理変形をシミュレートする手法を提案。数分で再構成でき、リアルタイムに近い速度で変形を生成できる。
- 目標条件付きGPTベース決定トランスフォーマーによる手術ロボットタスク自動化のための多目的クロスタスク学習手術ロボット/クロスタスク学習2024/5/1
GPTベースの目標条件付き決定トランスフォーマーとクロスタスク事前学習を組み合わせ、手術ロボットの長期的な目標達成タスクを自動化する学習フレームワークを提案した。
- 疎なFBG計測による高柔軟手術マニピュレータの形状と力の同時推定触覚2024/4/1
単一コアFBGファイバの疎なひずみ計測から、深層学習を用いて高柔軟な手術ロボットの形状と接触力を同時に推定する手法を提案した。
- Efficient Physically-based Simulation of Soft Bodies in Embodied Environment for Surgical Robot2024/2/1
- Any-point Trajectory Modeling for Policy Learning2024/1/1
- Interactive Navigation in Environments with Traversable Obstacles Using Large Language and Vision-Language Models2023/10/1
- RGBManip: Monocular Image-based Robotic Manipulation through Active Object Pose Estimation2023/10/1
- Visual-Kinematics Graph Learning for Procedure-agnostic Instrument Tip Segmentation in Robotic Surgeries2023/9/1
- Value-Informed Skill Chaining for Policy Learning of Long-Horizon Tasks with Surgical Robot2023/7/1
- End-to-End Learning of Deep Visuomotor Policy for Needle Picking2023/3/1
- Two-Stage Grasping: A New Bin Picking Framework for Small Objects2023/3/1
- Demonstration-Guided Reinforcement Learning with Efficient Exploration for Task Automation of Surgical Robot2023/2/1
- Autonomous Intelligent Navigation for Flexible Endoscopy Using Monocular Depth Guidance and 3-D Shape Planning2023/2/1
- Human-in-the-loop Embodied Intelligence with Interactive Simulation Environment for Surgical Robot Learning2023/1/1
- Distilled Visual and Robot Kinematics Embeddings for Metric Depth Estimation in Monocular Scene Reconstruction2022/11/1
- StereoPose: Category-Level 6D Transparent Object Pose Estimation from Stereo Images via Back-View NOCS2022/11/1
- Learning Deep Nets for Gravitational Dynamics with Unknown Disturbance through Physical Knowledge Distillation: Initial Feasibility Study2022/10/1
- FBG-Based Online Learning and 3-D Shape Control of Unmodeled Continuum and Soft Robots in Unstructured Environments2022/9/1
- Sim-to-Real 6D Object Pose Estimation via Iterative Self-training for Robotic Bin Picking2022/4/1
- 3D Perception based Imitation Learning under Limited Demonstration for Laparoscope Control in Robotic Surgery2022/4/1
- Integrating Artificial Intelligence and Augmented Reality in Robotic Surgery: An Initial dVRK Study Using a Surgical Education Scenario2022/1/1
- SurRoL: An Open-source Reinforcement Learning Centered and dVRK Compatible Platform for Surgical Robot Learning2021/8/1
- Domain Adaptive Robotic Gesture Recognition with Unsupervised Kinematic-Visual Data Alignment2021/3/1
- Relational Graph Learning on Visual and Kinematics Embeddings for Accurate Gesture Recognition in Robotic Surgery2020/11/1
- Data-driven Holistic Framework for Automated Laparoscope Optimal View Control with Learning-based Depth Perception2020/11/1
- A Learning-Driven Framework with Spatial Optimization For Surgical Suture Thread Reconstruction and Autonomous Grasping Under Multiple Topologies and Environmental Noises2020/7/1
- Automatic Gesture Recognition in Robot-assisted Surgery with Reinforcement Learning and Tree Search2020/2/1