Xuesong Li
Beijing Institute of Technology
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ActiveWAM: 世界行動モデルのための証拠認識型能動視覚マニピュレーション2026/10/1
カメラとエンドエフェクタを同時に制御し、タスクに重要な証拠を保持しつつ新たな視点を取得する能動視覚マニピュレーションを、世界モデルと行動モデルを統合した枠組みで学習する手法を提案。
- 想像しながらスキャン:ロボット超音波ナビゲーションのためのシーングラフ世界モデル医療ロボティクス2026/9/26
解剖構造をシーングラフで表現し、プローブ動作に伴う将来の視野変化を予測する世界モデルを提案。CTから学習データを生成し、胆嚢・膵臓の目標視野への自律ナビゲーションを実現した。
- SparkVLA: 長期的操作のための適応アクションチャンクを備えた停止認識型階層VLAVLA/操作2026/8/17
階層型VLAシステムにおけるサブタスクの停止タイミングとアクションチャンク長の相互依存関係を単一のランキング問題として定式化し、統一候補セットから最適解を選択する新しい手法を提案した。
- ViTaR: 基盤VLA操作のための視触覚残差適応VLA/触覚/操作2026/8/16
接触を伴う操作タスクで、凍結したVLAモデルに触覚情報に基づく小さな残差補正を加える手法を提案し、既存の触覚ベースラインを上回る成功率を達成した。
- RGB基盤モデルの階層的監督による熱画像深度推定への転用深度推定2026/8/1
熱画像からの深度推定において、RGB基盤モデルの階層的表現を活用するフレームワークRGB-HSを提案し、複数レベルでの特徴整合と品質検証により性能を向上させた。
- 未来を保持し、ロールアウトを捨てる:ワールドアクションモデルのためのRIFTVLA2026/8/1
ロボットの行動生成に使われるワールドアクションモデル(WAM)において、反復的なビデオロールアウトを必要とせず、学習された予測トークンを用いて将来のキャッシュを一回のパスで構築する手法RIFTを提案し、遅延を大幅に削減しつつ成功率を維持できることを示した。
- GeoHAT: 移動操作のための幾何適応型ハイブリッド行動変換器移動操作2026/6/1
移動操作タスクにおいて、信頼できる幾何情報のみを注入し、必要な箇所にのみ注意を向けるという原理に基づく、エンドツーエンドの拡散ベースフレームワークGeoHATを提案。軽量なフーリエ空間エンコーダとゲート付き融合、およびアームとベースを分離したハイブリッド行動デコーダにより、シミュレーションベンチマークで高い成功率を達成した。
- VLALeaks: 視覚言語行動モデルに対するメンバーシップ推論攻撃プライバシー/攻撃2026/6/1
VLAモデルが訓練データを記憶することによるプライバシー漏洩リスクに着目し、注意の差異に基づくメンバーシップ推論攻撃を提案した。
- DGSG-Mind: 長期シーン理解とグラウンディングのための動的3Dガウシアンシーングラフ3Dシーン理解2026/5/1
動的な3Dシーン表現にオープンボキャブラリの意味情報を統合し、インスタンス認識型の3Dガウシアン動的シーングラフと推論エージェントを構築した。
- EvoScene-VLA: アクションデコーダ内でシーン信念を進化させ、チャンク化ロボット制御を実現VLA2026/5/1
ロボットのアクションによって変化するシーン状態を、チャンク間で持続的に更新するVLAポリシーを提案し、シミュレーションと実機で成功率を向上させた。
- ReMAP-DP: 再投影マルチビュー整列ポイントマップによる拡散ポリシー拡散ポリシー/3D認識/操作2026/3/1
2D視覚表現に基づく汎用ロボットポリシーに明示的な3D空間認識を組み込むため、標準化された透視再投影と画素整列されたPointMapsを融合した二重ストリーム拡散ポリシーを提案し、シミュレーションと実世界の操作タスクで高い性能とデータ効率を実証した。
- 一日中動けるカンフーアスリートボット:高ダイナミック・バランス挑戦動作データセットと自律的転倒回復トラッキングヒューマノイド動作生成2026/2/1
プロの武術家の訓練動画から高ダイナミックな動作データセットを構築し、単一ポリシーで高ダイナミック動作追従と転倒回復を同時に学習する枠組みを提案した。
- 振動ベースのエネルギー指標による自律ロボット超音波における針位置合わせの復元医療ロボティクス2025/8/1
超音波画像で針が見えない場合でも、針を振動させてそのエネルギーを指標にすることで、超音波プローブと針の位置ずれを検出し、自動で位置合わせを復元する手法を提案した。
- 動的シーン再構成のための運動軌跡場を備えた3Dガウス表現動的シーン再構成2025/8/1
単眼動画から動的シーンを再構成するため、3Dガウススプラッティングに運動軌跡場を組み合わせ、動的物体と静的背景を分離して複雑な動きを高精度に復元する手法を提案した。
- 不整地における階層型強化学習による四足ロボットの動的ボール操作マニピュレーション2025/4/1
四足ロボットが不整地でボールをドリブルするため、高レベル方策が事前学習済みの低レベルスキルを切り替える階層型強化学習フレームワークを提案し、実機実験で有効性を示した。
- DynamicGSG: 環境適応のための動的3Dガウシアンシーングラフシーングラフ2025/2/1
ガウシアンスプラッティングを用いて動的で高忠実度なオープンボキャブラリのシーングラフを構築し、環境変化に応じて局所的に更新することでロボットの長期的な環境適応を可能にするシステムを提案。
- 点群ストリームと時系列バウンディングボックスの勾配降下法による位置合わせ点群位置合わせ2024/9/1
点群と時系列バウンディングボックスの位置合わせを、サイズ・形状・時間情報を活用した目的関数の勾配降下法で最適化し、IoUを40%改善した手法を提案。
- GANを用いた針セグメンテーション:ロボット超音波における細径器具の可視性回復医療ロボティクス2024/7/1
ロボット支援超音波画像で針が視野から外れた際に、GANベースのセグメンテーションとプローブの自動再配置により針の可視性を回復する手法を提案した。
- ロボット肋間超音波撮像における自律的US-CT位置合わせのためのクラス認識軟骨セグメンテーション超音波ロボティクス2024/6/1
患者ごとの肋骨形状をクラス認識セグメンテーションで抽出し、グラフベースの非剛体位置合わせでCTテンプレートから個別の肋間スキャン経路を高精度にマッピングする手法を提案した。
- Thoracic Cartilage Ultrasound-CT Registration using Dense Skeleton Graph2023/7/1
- Skeleton Graph-based Ultrasound-CT Non-rigid Registration2023/5/1
- Efficient and accurate object detection with simultaneous classification and tracking2020/7/1
- Real-time 3D object proposal generation and classification under limited processing resources2020/3/1