Hongliang Ren
収録論文 62本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- StenoVLA-3D: 消化管狭窄ナビゲーションのための3D認識推論VLAVLA2026/9/21
点群マップを統合した3D認識VLAフレームワークを提案し、狭窄領域の内視鏡ナビゲーションと病変報告を実現した。
- EndoLIFT: 言語で曖昧性を解消する潜在条件付き整流フローによる双方向内視鏡制御医療ロボティクス2026/8/20
内視鏡検査の双方向制御において、同じ視覚情報でも逆の動作が必要となる「意図の曖昧性」を解決するため、言語指示と軌跡潜在変数を組み合わせた視覚言語行動ポリシーを提案した。
- SurgLAT: 深度認識ロボット腹腔鏡制御のための外科的潜在注意追跡手術ロボティクス/カメラ制御2026/8/8
本論文は、動的な手術シーンにおける外科医の意図を潜在的な注意状態として追跡し、自律的な腹腔鏡カメラ制御を行うフレームワークSurgLATを提案する。凍結DINOv3エンコーダと状態条件付きトークンミキサーを用いて注意をモデル化し、RCM制約を考慮したロボット展開を実現する。
- 信頼性の高い双腕手術サブタスク操作のための軌道発散ホライズン決定手術ロボティクス2026/8/1
手術用VLAモデルの固定長オープンループ動作による累積誤差を軽減するため、軌道発散に基づく適応的実行ホライズン決定手法を提案し、実機で検証した。
- CrossScope: 役割非対称な世界モデルによる二視野同時手術映像予測映像予測2026/8/1
内視鏡手術の二つの視点(母視点と子視点)の映像を、役割に応じて非対称に情報をやり取りしながら未来予測する世界モデルを提案した。
- EndoWAM: 汎用内視鏡ナビゲーションのための接地された世界行動モデル医療ロボティクス2026/8/1
内視鏡ナビゲーションのための世界行動モデルを初めて提案し、将来の目標領域予測と行動生成を統合することで、変形や視点変化に対するロバスト性を向上させた。
- SAM3のパラメータ効率的適応によるプロンプト駆動手術領域分割医用画像分割2026/7/26
手術画像の領域分割のために、SAM3のプロンプトエンコーダ等にLoRAを注入し、全パラメータの0.98%のみを最適化する軽量適応手法を提案した。
- ロボット超音波のためのスパースな手術デモ注釈からの階層的気管解剖理解の学習医療ロボティクス2026/7/1
気管切開の正確な切開位置特定を目的に、YOLOv8nとSAM2を組み合わせた2段階の認識パイプラインを提案し、スパースな注釈から高精度な気管解剖セグメンテーションを実現した。
- GeoCFNet: ロボット支援内視鏡的粘膜下層剥離術のための幾何学認識信頼度フィールドネットワーク手術ロボティクス2026/6/11
内視鏡手術中の動的なシーンにおいて、煙やハイライト、組織変形などの課題に対処しつつ、解剖ガイドのための信頼度フィールドを幾何学的に推定するネットワークを提案した。
- BiliVLA: 強化学習を用いた自律的胆道内視鏡ナビゲーションのためのシーン認識型視覚言語行動モデル医療ロボティクス/VLA2026/6/1
胆道内視鏡ナビゲーションを指示条件付き視覚運動学習問題として定式化し、シーン認識型のVLAフレームワークを提案。対象カテゴリ、接地バウンディングボックス、3自由度モーターコマンドを予測し、2段階訓練で性能を向上させた。
- 解剖学的ランドマーク誘導による深層強化学習を用いた自律的胃内ナビゲーション医療ロボティクス2026/5/1
カプセル内視鏡の胃内ナビゲーションを、解剖学的ランドマークを利用した深層強化学習で自律化し、シミュレーションと実環境で高い被覆率と短時間化を達成した。
- 推論能力は内視鏡手術におけるAIコパイロットロボットをどう強化するか手術ロボット2026/5/1
内視鏡手術のAIコパイロットロボット(VLAモデルベース)において、推論能力が未活用であることを指摘し、推論によりマルチモーダル統合や手術意図の解釈、組織動態の推測が可能となり、ロボットを受動的実行から認知的協働者へ変革できると論じた論文。
- Open-H-Embodiment:医療ロボティクスにおける基盤モデルを可能にする大規模データセット医療ロボティクス/データセット/基盤モデル2026/4/1
医療ロボットの自律化を妨げるデータ不足を解決するため、複数のロボットプラットフォームにわたる大規模な医療ロボットビデオと運動学データセットを公開し、基盤モデルの開発を実証した。
- LiDAR-EVS: 擬似LiDAR監視による3Dガウススプラッティングの外挿視点合成の強化自動運転シミュレーション2026/3/1
自動運転シミュレーションにおいて、訓練軌道外の外挿視点でのLiDAR合成を可能にする軽量フレームワークLiDAR-EVSを提案。多フレームLiDAR融合と空間的制約付きドロップアウト正則化により、未見の走行経路でも頑健なLiDARシミュレーションを実現する。
- TMR-VLA:三脚シリコーン製ソフトロボットの磁気運動制御のための視覚-言語-行動モデルソフトロボティクス2026/3/1
磁気駆動の三脚ソフトロボットの動作を、言語指示と視覚情報から直接電圧制御するエンドツーエンドのマルチモーダルシステムを提案した。
- 生体模倣キリガミカプセルロボットによる低侵襲消化管生検医療ロボティクス2026/2/1
キリガミ構造の展開式フィルムをカム機構で駆動し、消化管内で安全に組織を採取できる飲み込み型カプセルロボットを開発した。
- GeoLanG: 幾何学認識と統合RGB-Dマルチモーダル学習による言語誘導把持マニピュレーション2026/2/1
CLIPを基盤に視覚と言語を統合し、深度情報を幾何学的事前知識として活用することで、雑然とした環境でも言語指示に基づく把持を実現するエンドツーエンド手法を提案。
- セグメンテーションを超えて:ロボット手術におけるSAM 3のセグメンテーション・3D知覚・再構成のベンチマーク評価医療画像/セグメンテーション2025/12/1
ロボット支援手術を対象に、SAM 3のゼロショットセグメンテーションとSAM 3Dの深度再構成をEndoVisやSCAREDなどのベンチマークで評価し、空間プロンプトでは改善が見られる一方、言語プロンプトや動的手術シーンには課題が残ることを示した。
- 変形可能な連続体ロボットの動的腔内ナビゲーションのためのヤコビアン探索的二段階強化学習連続体ロボット/強化学習2025/9/1
変形連続体ロボットの制御において、局所探索でヤコビアンを推定し状態表現を拡張する二段階強化学習を提案し、収束速度・ナビゲーション効率・未知環境への汎化性能を向上させた。
- 深層強化学習による柔軟ロボット内視鏡の接触支援ナビゲーション:動的胃環境への適用医療ロボティクス2025/9/1
変形する胃壁との接触力を活用し、深層強化学習で柔軟ロボット内視鏡を目標位置まで高精度に誘導する手法を提案。物理シミュレーションで訓練し、静的・動的環境で100%の成功率を達成した。
- Transformerによる再帰的行動信頼度チャンキングで低接触自律経鼻気管挿管を実現医療ロボティクス2025/8/1
経鼻気管挿管を自律化するため、力センサ内蔵の模型とTransformerベースのRACCTモデルを開発し、手動よりピーク挿入力66%削減を達成した。
- 磁気誘導変態材料における剛性勾配効果の連続体シミュレーションと検証磁気ソフトロボティクス2025/8/1
磁気誘導変態材料を用いた連続体ロボットに剛性勾配設計を導入し、4つのパラメータを考慮した数値モデルを構築して実験で検証した。さらに高効率な曲げ予測モデルを訓練し、予測ライブラリを構築した。
- Geo-RepNet: 内視鏡的粘膜下層剥離術における手術フェーズ認識のための幾何情報を考慮した表現学習手術フェーズ認識2025/7/1
内視鏡手術の深度情報を活用し、RGB画像と組み合わせることで手術フェーズ認識の精度を高める幾何情報考慮型フレームワークを提案。
- CapsDT: カプセルロボット操作のための拡散トランスフォーマーVLA2025/6/1
胃内で動作するカプセル内視鏡ロボットを、視覚と言語指示から拡散トランスフォーマーで制御する手法を提案し、シミュレータで評価した。
- 曲がりくねった管腔内で空気圧回転生検機構と階層的空気流制御によりその場で全方向に組織穿刺を調整する医療ロボティクス2025/6/1
曲がりくねった管腔内でカテーテルをねじらずに空気圧で生検方向を調整し、低流量で方向制御・高流量で針を展開してその場で全方向の組織サンプリングを可能にするロボットカテーテルを提案・試作した。
- 敵対的特徴分離による頑健な手術ワークフロー認識のためのマルチモーダルグラフ表現学習マルチモーダル認識2025/5/1
視覚と運動学データをグラフ表現で統合し、敵対的特徴分離でモダリティ間のギャップを埋めることで、データ破損やドメインシフトに頑健な手術ワークフロー認識手法を提案した。
- EndoVLA: 内視鏡自律追従のための二段階視覚-言語-行動モデルVLA2025/5/1
消化管内視鏡の連続体ロボット向けに、術者の指示に従いポリープや病変部、円周切開マーカーを自律追従する視覚-言語-行動モデルを提案し、教師あり微調整と強化学習微調整の二段階戦略で性能とゼロショット汎化を向上させた。
- DeepSeekは外科医のように推論できるか?ロボット支援手術における視覚言語理解の実証評価VLA2025/3/1
DeepSeekモデルをロボット手術の視覚言語タスク(単語QA・視覚QA・詳細記述)で評価し、汎用マルチモーダルモデルより優れるが臨床要件には未達であることを示した実証研究。
- 2Dガウシアンスプラッティングによる表面法線を考慮した内視鏡SLAMSLAM/内視鏡2025/1/1
内視鏡手術向けに、2Dガウシアンスプラッティングと表面法線を活用したリアルタイムSLAMシステムを提案し、高精度な深度・表面再構成を実現した。
- SurgSora: 物体認識拡散モデルによる制御可能な手術動画生成動画生成2024/12/1
単一フレームとユーザ指定の動きキューから、物体特徴と深度情報を活用して高精細かつ動きを制御できる手術動画を生成する拡散モデルフレームワーク。
- V²-SfMLearner:振動信号を統合したマルチモーダルカプセル内視鏡の単眼深度・自己運動学習マルチモーダル/医療ロボティクス2024/12/1
カプセル内視鏡の視覚信号に振動信号を融合し、振動ノイズを除去しながら深度とカプセル運動を教師なしで推定するマルチモーダル手法を提案。
- ETSM: ロボット支援内視鏡的粘膜下層剥離術における剥離軌道提案と信頼度マップに基づく安全マージン予測の自動化手術ロボティクス2024/11/1
ロボット支援ESD向けに1849クリップのデータセットETSMを構築し、最適剥離軌道予測と信頼度マップによる安全マージン予測を統合したフレームワークと回帰型ネットワークRCMNetを提案した。
- マーカーレスARによる神経介入術前計画・頭部装着型ロボット針刺入トレーニングのための自動スケーリングとリアルタイム頭部追跡AR/手術支援2024/11/1
MediaPipeとReact Three Fiberを用いたマーカーレスWeb ARアプリを開発し、頭部解剖の自動スケーリングとリアルタイム頭部追跡により、神経介入の術前計画・教育を支援する。
- デュアルステレオビジョンによるミリメートルスケールソフト連続ロボットの三次元形態再構成ソフトロボティクス/3D再構成2024/8/1
2台の対向するステレオカメラで撮影した点群を、既知の形状を参照にKD木で位置補正し、直径3.5mmのノッチ付き管状連続ロボットの3D形態を再構成する手法を提案した。
- ロボット手術におけるSAM 2:手術映像セグメンテーションの堅牢性と汎化性能の実証評価手術映像セグメンテーション2024/8/1
セグメンテーションモデルSAM 2を手術映像にゼロショット適用し、点・ボックスプロンプトでの精度や画像劣化への堅牢性をEndoVisベンチマークで評価した。
- Surgical-VQLA++: ロボット手術における校正済みロバスト視覚質問局所回答のための敵対的対照学習VLA2024/8/1
手術画像に対する質問応答で、回答とともに関連領域を局所化するVQLAタスクを提案し、マルチモーダル情報を統合する校正済み共注意ゲート付き視覚言語埋め込みと敵対的対照学習で性能とロバスト性を向上させた。
- ロボット手術における変形組織の3次元再構成技術のレビュー3D再構成2024/8/1
ロボット手術の内視鏡映像から変形する組織を3次元再構成するNeRFや3Dガウシアンスプラッティングなどの最新手法をレビューし、2つのデータセットで評価した。
- SegSTRONG-C: 非敵対的生成劣化に対する手術器具のロバストセグメンテーション — EndoVis'24チャレンジセグメンテーション2024/7/1
手術器具セグメンテーションの深層学習モデルが、出血・煙・低照度などの現実的な画像劣化に対してどれだけ頑健かを評価するEndoVis'24チャレンジを開催し、ベースラインと参加手法を比較した。
- 内視鏡手術のためのニューラル4Dガウシアンの位置合わせ医療画像/4D再構成2024/7/1
4Dガウシアンスプラッティングで手術シーンを再構成し、動的なシーン同士を高精度に位置合わせする手法を提案した論文。
- ASI-Seg: 音声駆動による術者意図を理解する手術器具セグメンテーション手術支援/マルチモーダル2024/7/1
術者の音声コマンドを解析し、意図に沿った手術器具だけをセグメンテーションするマルチモーダルフレームワークを提案。
- 非線形システムのオンライン時間情報付きキノダイナミック運動計画運動計画2024/7/1
深層学習とKoopman作用素理論を組み合わせ、非線形制御システムの時間情報付き集合をオンラインで近似し、時間最適な運動計画を高速化する手法を提案した。
- Surgical-LVLM:手術支援のための視覚的質問応答に適応する大規模視覚言語モデルVLA2024/5/1
手術動画の視覚的質問応答と領域特定のため、大規模視覚言語モデルにVP-LoRAとToken-Interactionモジュールを組み込み、複雑な手術シーンでの性能を向上させた。
- OSSAR: Towards Open-Set Surgical Activity Recognition in Robot-assisted Surgery2024/2/1
- Deep Reinforcement Learning in Surgical Robotics: Enhancing the Automation Level2023/9/1
- Landmark Detection using Transformer Toward Robot-assisted Nasal Airway Intubation2023/8/1
- Revisiting Distillation for Continual Learning on Visual Question Localized-Answering in Robotic Surgery2023/7/1
- CAT-ViL: Co-Attention Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery2023/7/1
- LLCaps: Learning to Illuminate Low-Light Capsule Endoscopy with Curved Wavelet Attention and Reverse Diffusion2023/7/1
- Deep Reinforcement Learning-Based Control for Stomach Coverage Scanning of Wireless Capsule Endoscopy2023/5/1
- Surgical-VQLA: Transformer with Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery2023/5/1
- Domain Adaptive Sim-to-Real Segmentation of Oropharyngeal Organs Towards Robot-assisted Intubation2023/5/1
- SAM Meets Robotic Surgery: An Empirical Study in Robustness Perspective2023/4/1
- Bioinspired soft robotics: How do we learn from creatures?2023/2/1
- Task-Aware Asynchronous Multi-Task Model with Class Incremental Contrastive Learning for Surgical Scene Understanding2022/11/1
- A Miniature 3-DoF Flexible Parallel Robotic Wrist Using NiTi Wires for Gastrointestinal Endoscopic Surgery2022/7/1
- Surgical-VQA: Visual Question Answering in Surgical Scenes using Transformer2022/6/1
- Global-Reasoned Multi-Task Learning Model for Surgical Scene Understanding2022/1/1
- ST-MTL: Spatio-Temporal Multitask Learning Model to Predict Scanpath While Tracking Instruments in Robotic Surgery2021/12/1
- RASEC: Rescaling Acquisition Strategy with Energy Constraints under SE-OU Fusion Kernel for Active Trachea Palpation and Incision Recommendation in Laryngeal Region2021/11/1
- Learning Domain Adaptation with Model Calibration for Surgical Report Generation in Robotic Surgery2021/3/1
- Real-Time Instrument Segmentation in Robotic Surgery using Auxiliary Supervised Deep Adversarial Learning2020/7/1
- Novel Force Estimation-based Bilateral Teleoperation applying Type-2 Fuzzy logic and Moving Horizon Estimation2018/5/1