Long Bai
収録論文 33本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SAM3のパラメータ効率的適応によるプロンプト駆動手術領域分割医用画像分割2026/7/26
手術画像の領域分割のために、SAM3のプロンプトエンコーダ等にLoRAを注入し、全パラメータの0.98%のみを最適化する軽量適応手法を提案した。
- GeoCFNet: ロボット支援内視鏡的粘膜下層剥離術のための幾何学認識信頼度フィールドネットワーク手術ロボティクス2026/6/11
内視鏡手術中の動的なシーンにおいて、煙やハイライト、組織変形などの課題に対処しつつ、解剖ガイドのための信頼度フィールドを幾何学的に推定するネットワークを提案した。
- 推論能力は内視鏡手術におけるAIコパイロットロボットをどう強化するか手術ロボット2026/5/1
内視鏡手術のAIコパイロットロボット(VLAモデルベース)において、推論能力が未活用であることを指摘し、推論によりマルチモーダル統合や手術意図の解釈、組織動態の推測が可能となり、ロボットを受動的実行から認知的協働者へ変革できると論じた論文。
- TMR-VLA:三脚シリコーン製ソフトロボットの磁気運動制御のための視覚-言語-行動モデルソフトロボティクス2026/3/1
磁気駆動の三脚ソフトロボットの動作を、言語指示と視覚情報から直接電圧制御するエンドツーエンドのマルチモーダルシステムを提案した。
- GeoLanG: 幾何学認識と統合RGB-Dマルチモーダル学習による言語誘導把持マニピュレーション2026/2/1
CLIPを基盤に視覚と言語を統合し、深度情報を幾何学的事前知識として活用することで、雑然とした環境でも言語指示に基づく把持を実現するエンドツーエンド手法を提案。
- セグメンテーションを超えて:ロボット手術におけるSAM 3のセグメンテーション・3D知覚・再構成のベンチマーク評価医療画像/セグメンテーション2025/12/1
ロボット支援手術を対象に、SAM 3のゼロショットセグメンテーションとSAM 3Dの深度再構成をEndoVisやSCAREDなどのベンチマークで評価し、空間プロンプトでは改善が見られる一方、言語プロンプトや動的手術シーンには課題が残ることを示した。
- EndoIR: 劣化に依存しないノイズ対応ルーティング拡散による内視鏡画像のオールインワン復元画像復元2025/11/1
内視鏡画像の多様な劣化を単一モデルで復元する拡散ベースのフレームワークを提案し、複数の劣化シナリオで最先端性能を達成した。
- Geo-RepNet: 内視鏡的粘膜下層剥離術における手術フェーズ認識のための幾何情報を考慮した表現学習手術フェーズ認識2025/7/1
内視鏡手術の深度情報を活用し、RGB画像と組み合わせることで手術フェーズ認識の精度を高める幾何情報考慮型フレームワークを提案。
- CapsDT: カプセルロボット操作のための拡散トランスフォーマーVLA2025/6/1
胃内で動作するカプセル内視鏡ロボットを、視覚と言語指示から拡散トランスフォーマーで制御する手法を提案し、シミュレータで評価した。
- 敵対的特徴分離による頑健な手術ワークフロー認識のためのマルチモーダルグラフ表現学習マルチモーダル認識2025/5/1
視覚と運動学データをグラフ表現で統合し、敵対的特徴分離でモダリティ間のギャップを埋めることで、データ破損やドメインシフトに頑健な手術ワークフロー認識手法を提案した。
- EndoVLA: 内視鏡自律追従のための二段階視覚-言語-行動モデルVLA2025/5/1
消化管内視鏡の連続体ロボット向けに、術者の指示に従いポリープや病変部、円周切開マーカーを自律追従する視覚-言語-行動モデルを提案し、教師あり微調整と強化学習微調整の二段階戦略で性能とゼロショット汎化を向上させた。
- DeepSeekは外科医のように推論できるか?ロボット支援手術における視覚言語理解の実証評価VLA2025/3/1
DeepSeekモデルをロボット手術の視覚言語タスク(単語QA・視覚QA・詳細記述)で評価し、汎用マルチモーダルモデルより優れるが臨床要件には未達であることを示した実証研究。
- 2Dガウシアンスプラッティングによる表面法線を考慮した内視鏡SLAMSLAM/内視鏡2025/1/1
内視鏡手術向けに、2Dガウシアンスプラッティングと表面法線を活用したリアルタイムSLAMシステムを提案し、高精度な深度・表面再構成を実現した。
- V²-SfMLearner:振動信号を統合したマルチモーダルカプセル内視鏡の単眼深度・自己運動学習マルチモーダル/医療ロボティクス2024/12/1
カプセル内視鏡の視覚信号に振動信号を融合し、振動ノイズを除去しながら深度とカプセル運動を教師なしで推定するマルチモーダル手法を提案。
- SurgSora: 物体認識拡散モデルによる制御可能な手術動画生成動画生成2024/12/1
単一フレームとユーザ指定の動きキューから、物体特徴と深度情報を活用して高精細かつ動きを制御できる手術動画を生成する拡散モデルフレームワーク。
- ETSM: ロボット支援内視鏡的粘膜下層剥離術における剥離軌道提案と信頼度マップに基づく安全マージン予測の自動化手術ロボティクス2024/11/1
ロボット支援ESD向けに1849クリップのデータセットETSMを構築し、最適剥離軌道予測と信頼度マップによる安全マージン予測を統合したフレームワークと回帰型ネットワークRCMNetを提案した。
- マーカーレスARによる神経介入術前計画・頭部装着型ロボット針刺入トレーニングのための自動スケーリングとリアルタイム頭部追跡AR/手術支援2024/11/1
MediaPipeとReact Three Fiberを用いたマーカーレスWeb ARアプリを開発し、頭部解剖の自動スケーリングとリアルタイム頭部追跡により、神経介入の術前計画・教育を支援する。
- GOPT: Transformerベース深層強化学習による汎化可能なオンライン3Dビンパッキングマニピュレーション2024/9/1
Transformerベースの深層強化学習を用いて、異なるビン寸法の環境にも汎化できるオンライン3Dビンパッキング手法GOPTを提案し、実機ロボットでの有効性も示した。
- Surgical-VQLA++: ロボット手術における校正済みロバスト視覚質問局所回答のための敵対的対照学習VLA2024/8/1
手術画像に対する質問応答で、回答とともに関連領域を局所化するVQLAタスクを提案し、マルチモーダル情報を統合する校正済み共注意ゲート付き視覚言語埋め込みと敵対的対照学習で性能とロバスト性を向上させた。
- ロボット手術におけるSAM 2:手術映像セグメンテーションの堅牢性と汎化性能の実証評価手術映像セグメンテーション2024/8/1
セグメンテーションモデルSAM 2を手術映像にゼロショット適用し、点・ボックスプロンプトでの精度や画像劣化への堅牢性をEndoVisベンチマークで評価した。
- ロボット手術における変形組織の3次元再構成技術のレビュー3D再構成2024/8/1
ロボット手術の内視鏡映像から変形する組織を3次元再構成するNeRFや3Dガウシアンスプラッティングなどの最新手法をレビューし、2つのデータセットで評価した。
- SegSTRONG-C: 非敵対的生成劣化に対する手術器具のロバストセグメンテーション — EndoVis'24チャレンジセグメンテーション2024/7/1
手術器具セグメンテーションの深層学習モデルが、出血・煙・低照度などの現実的な画像劣化に対してどれだけ頑健かを評価するEndoVis'24チャレンジを開催し、ベースラインと参加手法を比較した。
- ASI-Seg: 音声駆動による術者意図を理解する手術器具セグメンテーション手術支援/マルチモーダル2024/7/1
術者の音声コマンドを解析し、意図に沿った手術器具だけをセグメンテーションするマルチモーダルフレームワークを提案。
- 内視鏡手術のためのニューラル4Dガウシアンの位置合わせ医療画像/4D再構成2024/7/1
4Dガウシアンスプラッティングで手術シーンを再構成し、動的なシーン同士を高精度に位置合わせする手法を提案した論文。
- Surgical-LVLM:手術支援のための視覚的質問応答に適応する大規模視覚言語モデルVLA2024/5/1
手術動画の視覚的質問応答と領域特定のため、大規模視覚言語モデルにVP-LoRAとToken-Interactionモジュールを組み込み、複雑な手術シーンでの性能を向上させた。
- OSSAR: Towards Open-Set Surgical Activity Recognition in Robot-assisted Surgery2024/2/1
- Landmark Detection using Transformer Toward Robot-assisted Nasal Airway Intubation2023/8/1
- CAT-ViL: Co-Attention Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery2023/7/1
- LLCaps: Learning to Illuminate Low-Light Capsule Endoscopy with Curved Wavelet Attention and Reverse Diffusion2023/7/1
- Revisiting Distillation for Continual Learning on Visual Question Localized-Answering in Robotic Surgery2023/7/1
- Deep Reinforcement Learning-Based Control for Stomach Coverage Scanning of Wireless Capsule Endoscopy2023/5/1
- Surgical-VQLA: Transformer with Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery2023/5/1
- Domain Adaptive Sim-to-Real Segmentation of Oropharyngeal Organs Towards Robot-assisted Intubation2023/5/1