Guankun Wang
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SurgLAT: 深度認識ロボット腹腔鏡制御のための外科的潜在注意追跡手術ロボティクス/カメラ制御2026/8/8
本論文は、動的な手術シーンにおける外科医の意図を潜在的な注意状態として追跡し、自律的な腹腔鏡カメラ制御を行うフレームワークSurgLATを提案する。凍結DINOv3エンコーダと状態条件付きトークンミキサーを用いて注意をモデル化し、RCM制約を考慮したロボット展開を実現する。
- 信頼性の高い双腕手術サブタスク操作のための軌道発散ホライズン決定手術ロボティクス2026/8/1
手術用VLAモデルの固定長オープンループ動作による累積誤差を軽減するため、軌道発散に基づく適応的実行ホライズン決定手法を提案し、実機で検証した。
- GeoCFNet: ロボット支援内視鏡的粘膜下層剥離術のための幾何学認識信頼度フィールドネットワーク手術ロボティクス2026/6/11
内視鏡手術中の動的なシーンにおいて、煙やハイライト、組織変形などの課題に対処しつつ、解剖ガイドのための信頼度フィールドを幾何学的に推定するネットワークを提案した。
- 推論能力は内視鏡手術におけるAIコパイロットロボットをどう強化するか手術ロボット2026/5/1
内視鏡手術のAIコパイロットロボット(VLAモデルベース)において、推論能力が未活用であることを指摘し、推論によりマルチモーダル統合や手術意図の解釈、組織動態の推測が可能となり、ロボットを受動的実行から認知的協働者へ変革できると論じた論文。
- Open-H-Embodiment:医療ロボティクスにおける基盤モデルを可能にする大規模データセット医療ロボティクス/データセット/基盤モデル2026/4/1
医療ロボットの自律化を妨げるデータ不足を解決するため、複数のロボットプラットフォームにわたる大規模な医療ロボットビデオと運動学データセットを公開し、基盤モデルの開発を実証した。
- TMR-VLA:三脚シリコーン製ソフトロボットの磁気運動制御のための視覚-言語-行動モデルソフトロボティクス2026/3/1
磁気駆動の三脚ソフトロボットの動作を、言語指示と視覚情報から直接電圧制御するエンドツーエンドのマルチモーダルシステムを提案した。
- GeoLanG: 幾何学認識と統合RGB-Dマルチモーダル学習による言語誘導把持マニピュレーション2026/2/1
CLIPを基盤に視覚と言語を統合し、深度情報を幾何学的事前知識として活用することで、雑然とした環境でも言語指示に基づく把持を実現するエンドツーエンド手法を提案。
- Geo-RepNet: 内視鏡的粘膜下層剥離術における手術フェーズ認識のための幾何情報を考慮した表現学習手術フェーズ認識2025/7/1
内視鏡手術の深度情報を活用し、RGB画像と組み合わせることで手術フェーズ認識の精度を高める幾何情報考慮型フレームワークを提案。
- 敵対的特徴分離による頑健な手術ワークフロー認識のためのマルチモーダルグラフ表現学習マルチモーダル認識2025/5/1
視覚と運動学データをグラフ表現で統合し、敵対的特徴分離でモダリティ間のギャップを埋めることで、データ破損やドメインシフトに頑健な手術ワークフロー認識手法を提案した。
- EndoVLA: 内視鏡自律追従のための二段階視覚-言語-行動モデルVLA2025/5/1
消化管内視鏡の連続体ロボット向けに、術者の指示に従いポリープや病変部、円周切開マーカーを自律追従する視覚-言語-行動モデルを提案し、教師あり微調整と強化学習微調整の二段階戦略で性能とゼロショット汎化を向上させた。
- DeepSeekは外科医のように推論できるか?ロボット支援手術における視覚言語理解の実証評価VLA2025/3/1
DeepSeekモデルをロボット手術の視覚言語タスク(単語QA・視覚QA・詳細記述)で評価し、汎用マルチモーダルモデルより優れるが臨床要件には未達であることを示した実証研究。
- ETSM: ロボット支援内視鏡的粘膜下層剥離術における剥離軌道提案と信頼度マップに基づく安全マージン予測の自動化手術ロボティクス2024/11/1
ロボット支援ESD向けに1849クリップのデータセットETSMを構築し、最適剥離軌道予測と信頼度マップによる安全マージン予測を統合したフレームワークと回帰型ネットワークRCMNetを提案した。
- Surgical-VQLA++: ロボット手術における校正済みロバスト視覚質問局所回答のための敵対的対照学習VLA2024/8/1
手術画像に対する質問応答で、回答とともに関連領域を局所化するVQLAタスクを提案し、マルチモーダル情報を統合する校正済み共注意ゲート付き視覚言語埋め込みと敵対的対照学習で性能とロバスト性を向上させた。
- Surgical-LVLM:手術支援のための視覚的質問応答に適応する大規模視覚言語モデルVLA2024/5/1
手術動画の視覚的質問応答と領域特定のため、大規模視覚言語モデルにVP-LoRAとToken-Interactionモジュールを組み込み、複雑な手術シーンでの性能を向上させた。
- OSSAR: Towards Open-Set Surgical Activity Recognition in Robot-assisted Surgery2024/2/1
- Domain Adaptive Sim-to-Real Segmentation of Oropharyngeal Organs Towards Robot-assisted Intubation2023/5/1