Huxin Gao
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EndoLIFT: 言語で曖昧性を解消する潜在条件付き整流フローによる双方向内視鏡制御医療ロボティクス2026/8/20
内視鏡検査の双方向制御において、同じ視覚情報でも逆の動作が必要となる「意図の曖昧性」を解決するため、言語指示と軌跡潜在変数を組み合わせた視覚言語行動ポリシーを提案した。
- EndoWAM: 汎用内視鏡ナビゲーションのための接地された世界行動モデル医療ロボティクス2026/8/1
内視鏡ナビゲーションのための世界行動モデルを初めて提案し、将来の目標領域予測と行動生成を統合することで、変形や視点変化に対するロバスト性を向上させた。
- 信頼性の高い双腕手術サブタスク操作のための軌道発散ホライズン決定手術ロボティクス2026/8/1
手術用VLAモデルの固定長オープンループ動作による累積誤差を軽減するため、軌道発散に基づく適応的実行ホライズン決定手法を提案し、実機で検証した。
- CrossScope: 役割非対称な世界モデルによる二視野同時手術映像予測映像予測2026/8/1
内視鏡手術の二つの視点(母視点と子視点)の映像を、役割に応じて非対称に情報をやり取りしながら未来予測する世界モデルを提案した。
- GeoCFNet: ロボット支援内視鏡的粘膜下層剥離術のための幾何学認識信頼度フィールドネットワーク手術ロボティクス2026/6/11
内視鏡手術中の動的なシーンにおいて、煙やハイライト、組織変形などの課題に対処しつつ、解剖ガイドのための信頼度フィールドを幾何学的に推定するネットワークを提案した。
- BiliVLA: 強化学習を用いた自律的胆道内視鏡ナビゲーションのためのシーン認識型視覚言語行動モデル医療ロボティクス/VLA2026/6/1
胆道内視鏡ナビゲーションを指示条件付き視覚運動学習問題として定式化し、シーン認識型のVLAフレームワークを提案。対象カテゴリ、接地バウンディングボックス、3自由度モーターコマンドを予測し、2段階訓練で性能を向上させた。
- GeoLanG: 幾何学認識と統合RGB-Dマルチモーダル学習による言語誘導把持マニピュレーション2026/2/1
CLIPを基盤に視覚と言語を統合し、深度情報を幾何学的事前知識として活用することで、雑然とした環境でも言語指示に基づく把持を実現するエンドツーエンド手法を提案。
- 深層強化学習による柔軟ロボット内視鏡の接触支援ナビゲーション:動的胃環境への適用医療ロボティクス2025/9/1
変形する胃壁との接触力を活用し、深層強化学習で柔軟ロボット内視鏡を目標位置まで高精度に誘導する手法を提案。物理シミュレーションで訓練し、静的・動的環境で100%の成功率を達成した。
- Geo-RepNet: 内視鏡的粘膜下層剥離術における手術フェーズ認識のための幾何情報を考慮した表現学習手術フェーズ認識2025/7/1
内視鏡手術の深度情報を活用し、RGB画像と組み合わせることで手術フェーズ認識の精度を高める幾何情報考慮型フレームワークを提案。
- EndoVLA: 内視鏡自律追従のための二段階視覚-言語-行動モデルVLA2025/5/1
消化管内視鏡の連続体ロボット向けに、術者の指示に従いポリープや病変部、円周切開マーカーを自律追従する視覚-言語-行動モデルを提案し、教師あり微調整と強化学習微調整の二段階戦略で性能とゼロショット汎化を向上させた。
- ETSM: ロボット支援内視鏡的粘膜下層剥離術における剥離軌道提案と信頼度マップに基づく安全マージン予測の自動化手術ロボティクス2024/11/1
ロボット支援ESD向けに1849クリップのデータセットETSMを構築し、最適剥離軌道予測と信頼度マップによる安全マージン予測を統合したフレームワークと回帰型ネットワークRCMNetを提案した。
- OSSAR: Towards Open-Set Surgical Activity Recognition in Robot-assisted Surgery2024/2/1
- A Miniature 3-DoF Flexible Parallel Robotic Wrist Using NiTi Wires for Gastrointestinal Endoscopic Surgery2022/7/1