Baoru Huang
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Endo-TSR: 内視鏡再構成のための時空間スペクトルモデリング内視鏡再構成2026/9/26
内視鏡シーン再構成において、変形ガウスモデルにフーリエ色残差と並進残差を導入し、組織の動きと外観変化を時空間的にモデル化する手法を提案。EndoNeRFとStereoMISで最高PSNRを達成。
- グリッパー認識型視覚言語行動モデルVLA2026/8/25
異なるグリッパー種別に応じた戦略を学習できるよう、5種類のグリッパーを含む大規模データセットと、専用トークナイザーとポリシールーティングを備えたモデルを提案した。
- 視覚的把持を超えて:検出から実行までの複雑な把持のベンチマーキング把持/ベンチマーク2026/7/1
複雑な実世界の把持タスクを評価するための新しいベンチマークGCA-Benchを提案し、従来の視覚ベースの把持検出を超えて、シーン推論と意味的制約を含むタスクでの大規模基盤モデルの性能を評価した。
- CoMo3R-SLAM: 学習型3D再構成事前知識を用いた屋外マルチエージェント向け協調単眼高密度SLAMSLAM2026/5/1
単眼RGBカメラのみで、学習型の3D再構成事前知識を活用し、複数エージェントが協調して高密度で一貫した3D地図を構築するSLAMシステムを提案した。
- MAGS-SLAM: 単眼マルチエージェント・ガウススプラッティングSLAMによる幾何・光度整合的な再構成SLAM2026/5/1
RGBカメラのみを用いた複数エージェントによる3DガウススプラッティングSLAMを提案し、各エージェントが局所サブマップを構築して圧縮情報を交換することで、深度センサなしで協調的な高品質3D再構成を実現した。
- EndoWave: 内視鏡再構成のための有理ウェーブレット4Dガウススプラッティング4D再構成/内視鏡2025/10/1
内視鏡動画から非剛体組織の3D再構成を行うため、オプティカルフローによる幾何制約と多解像度有理ウェーブレットを組み込んだ4Dガウススプラッティング手法を提案し、手術データセットで高精度な再構成を実現した。
- ASC-SW: エッジモバイルロボット向けの軽量Atrousストリップ畳み込みによるDLOセグメンテーションセグメンテーション2025/7/1
床ケーブルなどの変形可能な線状物体(DLO)をモバイルロボットの斜め視点から検出するため、軽量で幾何学的なASCNetと時間的スライディングウィンドウを組み合わせたセグメンテーション手法を提案し、エッジデバイス上で高精度・高速に動作することを示した。
- GraspMAS: マルチエージェントシステムによるゼロショット言語駆動型把持検出マニピュレーション2025/6/1
複雑な言語指示や混雑環境に対応するため、Planner・Coder・Observerの3エージェントで把持を計画・実行・評価するゼロショット言語駆動型把持検出フレームワークを提案。
- 身体性行動連鎖推論とマルチモーダル基盤モデルによるヒューマノイドのゼロショット移動操作エージェントVLA2025/4/1
基盤モデルの推論と身体性行動連鎖(CoA)機構を組み合わせ、人間の指示を移動・操作のプリミティブ列に分解することで、ヒューマノイドのゼロショット移動操作を実現したフレームワーク。
- RoboDesign1M:ロボット設計理解のための大規模データセットデータセット2025/3/1
科学論文から収集した100万件のマルチモーダルデータでロボット設計理解のための大規模データセットを構築し、設計生成や質問応答などのタスクでベンチマークを提供した。
- ロボット支援放射線誘導手術における放射性トレーサ局在化のためのハイブリッド深層強化学習医療ロボティクス2025/3/1
深層強化学習と適応的グリッドスキャンを組み合わせ、ロボット支援手術でプローブを放射性標的に自律的に誘導する手法を提案。シミュレーションで95%、実機(dVRK)で80%の成功率を達成した。
- SplineFormer:血管内自律ナビゲーションのための説明可能なTransformerベース手法医療ロボティクス2025/1/1
ガイドワイヤの形状をスプラインとして予測するTransformerアーキテクチャを提案し、実機で血管内ナビゲーションを自律実行した研究。
- Robotic-CLIP: ロボット応用のための行動データによるCLIPの微調整VLA2024/9/1
大規模な行動動画データでCLIPを対照学習により微調整し、動的な行動理解を可能にしたRobotic-CLIPを提案。言語駆動型ロボットタスクで既存CLIPモデルを上回り、実世界の把持タスクでも有効性を示した。
- マスク誘導アテンションによる言語駆動型把持検出マニピュレーション2024/7/1
セグメンテーションマスクと言語指示をTransformerのアテンションで統合し、遮蔽に強い言語駆動型の把持検出を実現した研究。
- 条件付き一貫性モデルによる軽量な言語駆動型把持検出マニピュレーション2024/7/1
拡散モデルを軽量化した一貫性モデルと言語プロンプトを組み合わせ、高速推論を実現する言語駆動型把持検出法を提案し、実機実験で有効性を示した。
- ネガティブプロンプト誘導を用いた言語駆動型6自由度把持検出マニピュレーション2024/7/1
自然言語の指示に基づき、散らかった点群の中から目的の物体を6自由度で把持する手法を提案。大規模データセットGrasp-Anything-6Dと、不要物体を避けるネガティブプロンプト誘導拡散モデルを導入した。
- Autonomous Catheterization with Open-source Simulator and Expert Trajectory2024/1/1
- Language-Conditioned Affordance-Pose Detection in 3D Point Clouds2023/9/1
- Open-Vocabulary Affordance Detection using Knowledge Distillation and Text-Point Correlation2023/9/1
- Grasp-Anything: Large-scale Grasp Dataset from Foundation Models2023/9/1
- Deep Imitation Learning for Automated Drop-In Gamma Probe Manipulation2023/4/1
- CathSim: An Open-source Simulator for Endovascular Intervention2022/8/1
- Dual-arm Coordinated Manipulation for Object Twisting with Human Intelligence2021/8/1