Bin Li
Shenzhen University
収録論文 39本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 鋭い目から専門家の頭脳へ:改ざんテキスト検出のためのMLLMへの専門知識の内部化マルチモーダルLLM2026/9/28
改ざんテキスト検出において、専門家モデルの細粒度な知覚能力をマルチモーダル大規模言語モデル(MLLM)に段階的に内部化する手法を提案し、ドメイン内外での検出性能を向上させた。
- 実演動画から明示的な行動意味論を蒸留する世界モデルVIDEAS世界モデル2026/9/27
ロボット操作動画を離散的な行動軌跡に分解し、VLMと事前知識ガイド付きシミュレーションで行動の前提条件と効果を構造化知識として抽出、言語ベース世界モデルを学習する枠組み。
- Sim-to-real強化学習による速度適応型股関節外骨格制御ポリシーの学習外骨格/強化学習/sim2real2026/9/23
シミュレーションで歩行速度に応じたアシストタイミングを強化学習し、実機の股関節外骨格に転移させ、オンライン選好学習でアシスト強度を個人適応させるフレームワークを提案した。
- 疎な報酬強化学習のための位相・初到達VLMフィードバック:手術操作への応用強化学習/手術操作2026/9/7
手術操作の疎な報酬強化学習において、失敗した試行から部分的な成功段階を再利用できるよう、VLMを用いて各エピソードの到達段階とその初到達時刻を特定するフィードバック手法を提案し、シミュレーションと実機で有効性を示した。
- テキスト中心画像フォレンジックのための証拠誘導型検出・位置特定・説明システム画像フォレンジック2026/9/2
テキスト改ざん画像の真偽判定、改ざん領域の特定、証拠に基づく説明を統合したシステムを提案し、ACM Multimedia 2026のチャレンジで2位を獲得した。
- Xiaomi-Robotics-1: 10万時間以上の実世界軌道データによる視覚言語行動モデルのスケーリングVLA2026/7/1
10万時間以上の実世界の操作軌跡データを用いて、汎用的な視覚言語行動(VLA)モデルを事前学習し、未見環境での指示追従や少量データでの適応を可能にする基盤モデルを構築した。
- ForensicsTok: フォレンジック誘導トークン化モデリングによる画像改ざん位置特定画像フォレンジック2026/6/23
画像改ざん位置特定を自己回帰シーケンス生成として再構成し、トークンを直接マスクに変換する新しいデコーダと階層的専門家融合を導入して、MLLMベースの手法の精度を向上させた。
- 仮想点に基づく一般化絶対位置姿勢問題の解法位置姿勢推定2026/6/8
複数の投影中心を持つカメラシステムの位置姿勢推定を、仮想点を用いて標準PnP問題に変換し、既存のPnPソルバーを一般化姿勢ソルバーとして利用できるようにする手法を提案した。
- 非同期微分SfMによる全自由度運動推定のための最小解法運動推定2026/6/8
イベントカメラの非同期データから、角速度と線速度を同時に推定する全自由度の自己運動推定フレームワークを提案し、5点を用いた最小解法を初めて導出した。
- 単機および複数UAVによる方位のみの目標位置特定における軌道最適化UAV/軌道最適化2026/6/1
UAVの方位のみを用いた目標位置特定精度を高めるため、フィッシャー情報行列と改良PSOを用いた軌道最適化手法を提案した。
- SCRIPT: 言語駆動の物理ベース人型ロボット制御のための多段階学習によるスケーラブル拡散ポリシー人型ロボット制御2026/5/1
自然言語指示で物理ベースの人型ロボットを制御するための、多段階学習フレームワークを備えた拡散ポリシーを提案。行動・状態・テキストを統合するトランスフォーマーと強化学習による後段学習で、指示追従性と動作品質を向上させた。
- MIND: テキスト駆動の物理ベース人型ロボット制御のためのマルチスケール意図拡散人型ロボット制御2026/5/1
テキスト指示から物理ベースの人型ロボットを制御する新しいエンドツーエンド拡散フレームワークを提案し、行動意図を意味的橋渡しとして用いることで、テキストと低レベル行動のギャップを解消する。
- インタラクション推論ベンチマーク(COIN):推論と身体化インタラクションの融合ベンチマーク/操作2026/4/1
部分観測下での長期的なインタラクション推論を評価する新しいベンチマークCOINを提案し、ロボット操作タスクにおける既存手法の限界を明らかにした。
- 双腕ロボットにおける座標変換と運動学パラメータの統合キャリブレーションフレームワークキャリブレーション2026/3/1
双腕ロボットの座標変換と運動学パラメータをリー代数に基づく単一の誤差モデルで統合的に校正する新しいフレームワークを提案した。
- DTP: 視覚言語行動モデルのための簡便かつ効果的な妨害トークン枝刈りフレームワークVLA2026/1/1
VLAモデルがタスク無関係領域の画像トークンに過剰に注意する問題を解決するため、動的に検出・枝刈りするプラグアンドプレイのDTPフレームワークを提案し、タスク成功率を改善した。
- DV-VLN: LLMベース視覚言語ナビゲーションのための信頼性の高い二重検証VLA2026/1/1
LLMによる視覚言語ナビゲーションで、生成した行動候補を真偽検証とマスク実体検証の二重チャネルで検証し、信頼性を高めるフレームワークを提案。
- LogicEnvGen: タスク論理に基づく多様な具現化AI向けシミュレーション環境の生成sim2real2026/1/1
LLMを用いてエージェントのタスク実行論理を解析し、論理的に多様なシミュレーション環境をテストケースとして自動生成する手法を提案。
- 時不変な空間整合と多目的方策改善による自己回帰型エンドツーエンド計画自動運転/エンドツーエンド計画2025/9/1
自動運転のエンドツーエンド計画において、未来の各時点で自己中心座標系に環境特徴を整合させるモジュールと、DPOによる多目的な事後学習を導入し、NAVSIMで自己回帰モデル中最良の性能を達成した。
- 手術ロボットのための世界モデルを用いた視覚運動把持マニピュレーション2025/8/1
手術ロボットにおける把持を自動化するため、世界モデルベースの視覚運動学習フレームワークGASv2を提案し、単一ステレオカメラのみで多様な未見物体への把持を実現した。
- 自己回帰メタアクションによる統合的な制御可能軌道生成自動運転/軌道生成2025/5/1
自動運転の軌道生成において、従来の固定区間メタアクションをフレーム単位に分解し、自己回帰的にメタアクション予測と軌道生成を交互に行うことで、両者の時間的整合性を高める手法を提案した。
- DRoPE: エージェント相互作用モデリングを効率化する方向性回転位置埋め込み軌道生成2025/3/1
自然言語処理由来のRoPEを改良し、回転角をエージェントの進行方向に揃える方向性回転位置埋め込みを提案。軌道生成の精度・時間・メモリ効率を同時に改善した。
- 電気インピーダンス・トモグラフィによるロボット用マルチタッチ・曲げ知覚触覚2025/3/1
EITを用いた触覚センサで、深層学習と動的適応参照により接触と曲げ変形を分離し、曲げ角度推定とマルチタッチ位置検出を高精度に実現した。
- GSGTrack: ガウススプラッティング誘導によるRGB動画からの物体姿勢追跡物体姿勢追跡2024/12/1
単眼RGB動画から未知物体の6DoF姿勢を追跡するため、3Dガウススプラッティングとグラフベース幾何最適化を同時に行い、深度情報なしで高精度な追跡と再構成を実現した。
- BeSimulator: 大規模言語モデルによるテキストベース行動シミュレータ行動シミュレーション2024/9/1
ロボットの行動論理を検証するため、LLMを用いてテキスト環境で意味レベルの行動シミュレーションを行うフレームワークを提案し、ベンチマークで性能向上を示した。
- 幾何モデリングによる単眼内視鏡シーンのスケール対応深度推定の強化深度推定2024/8/1
単眼内視鏡画像のみから、器具の3D姿勢を幾何学的に推定してスケールを復元し、スケール対応の深度推定を可能にするフレームワークを提案した。
- KiGRAS: 運動学駆動型生成モデルによるリアルなエージェントシミュレーション自動運転/軌道生成2024/7/1
自動運転の軌道生成において、状態空間ではなく運動学モデルに基づく行動空間で生成する手法を提案し、冗長性を削減して物理的に実現可能な軌道を生成、Waymoのリーダーボードで1位を獲得した。
- 汎用手術把持のためのワールドモデルマニピュレーション2024/5/1
ワールドモデルベースの深層強化学習により、多様な手術対象物を把持できる視覚運動ポリシーを学習し、実機で平均成功率69%を達成した。
- 疎なFBG計測による高柔軟手術マニピュレータの形状と力の同時推定触覚2024/4/1
単一コアFBGファイバの疎なひずみ計測から、深層学習を用いて高柔軟な手術ロボットの形状と接触力を同時に推定する手法を提案した。
- A Study on Training and Developing Large Language Models for Behavior Tree Generation2024/1/1
- End-to-End Learning of Deep Visuomotor Policy for Needle Picking2023/3/1
- Demonstration-Guided Reinforcement Learning with Efficient Exploration for Task Automation of Surgical Robot2023/2/1
- Autonomous Intelligent Navigation for Flexible Endoscopy Using Monocular Depth Guidance and 3-D Shape Planning2023/2/1
- Distilled Visual and Robot Kinematics Embeddings for Metric Depth Estimation in Monocular Scene Reconstruction2022/11/1
- Open-source High-precision Autonomous Suturing Framework With Visual Guidance2022/10/1
- TODE-Trans: Transparent Object Depth Estimation with Transformer2022/9/1
- What You See is What You Grasp: User-Friendly Grasping Guided by Near-eye-tracking2022/9/1
- 3D Perception based Imitation Learning under Limited Demonstration for Laparoscope Control in Robotic Surgery2022/4/1
- SurRoL: An Open-source Reinforcement Learning Centered and dVRK Compatible Platform for Surgical Robot Learning2021/8/1
- Data-driven Holistic Framework for Automated Laparoscope Optimal View Control with Learning-based Depth Perception2020/11/1