Zhen Li
収録論文 24本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- OpenFlyScan:民生ドローン向け品質誘導型空中再構成システムsim2real2026/9/21
3Dガウシアンスプラッティングの再構成品質を予測し、不足領域を補う追加撮影を計画・実行する民生ドローン向けシステムを提案。
- MaskVLA: 視覚マスキングによるVision-Language-Actionモデルの軌道過学習の抑制VLA2026/9/20
VLAモデルの微調整時にメインカメラの視覚情報をランダムに一部マスクすることで、手首カメラ情報の活用を促し、軌道過学習を防いで汎化性能とタスク成功率を向上させる手法を提案。
- AlayaWorld: 長時間・プレイ可能なビデオワールド生成ビデオ生成2026/7/7
ゲームワールドを自動生成するためのフルスタックのオープンソースフレームワークを提案し、リアルタイムでのインタラクションと多様なアクションを可能にする。
- ReFPO: フローマッチングポリシー勾配のためのリフロー正則化強化学習/生成ポリシー2026/6/1
フローマッチングポリシー勾配法に明示的なリフロー正則化を追加したオンライン強化学習手法を提案し、生成ポリシーの学習安定性と性能を向上させた。
- 弾性クエリ強化学習:VLAモデルの自己認識型ポリシー実行VLA/強化学習2026/6/1
VLAモデルの推論・再計画スケジュールを固定せず、状態の難易度に応じてクエリの入力・ノイズ除去予算・アクション長を動的に調整する枠組みEQRLを提案。軽量な適応器と批評家の不一致による難易度信号で計算資源を効率的に配分し、シミュレーションと実機で推論コストを削減しつつ成功率を維持・向上させた。
- 解剖学的ランドマーク誘導による深層強化学習を用いた自律的胃内ナビゲーション医療ロボティクス2026/5/1
カプセル内視鏡の胃内ナビゲーションを、解剖学的ランドマークを利用した深層強化学習で自律化し、シミュレーションと実環境で高い被覆率と短時間化を達成した。
- Open-H-Embodiment:医療ロボティクスにおける基盤モデルを可能にする大規模データセット医療ロボティクス/データセット/基盤モデル2026/4/1
医療ロボットの自律化を妨げるデータ不足を解決するため、複数のロボットプラットフォームにわたる大規模な医療ロボットビデオと運動学データセットを公開し、基盤モデルの開発を実証した。
- HyPerNav: 未知環境における物体指向ナビゲーションのためのハイブリッド知覚ナビゲーション2025/10/1
VLMを活用し、自己中心的なRGB-D観測とトップダウンマップを統合して未知環境で目標物体へナビゲートする手法を提案し、シミュレーションと実機で最先端性能を達成した。
- SQS: 自動運転におけるクエリベーススプラッティングによるスパース知覚モデルの強化自動運転知覚2025/9/1
スパースクエリから3Dガウシアンを予測する自己教師ありスプラッティング事前学習を導入し、占有予測や3D物体検出などの自動運転知覚タスクの性能を向上させた研究。
- 拡張現実で強化したロボット遠隔操作によるユーザーデモンストレーション収集遠隔操作2025/9/1
ARと点群レンダリングを組み合わせた遠隔操作システムを提案し、ABBの産業用・協働ロボットで実証。点群表示により作業精度が28%、SUSスコアが12%向上した。
- RoboMemory: 物理エンボディドシステムにおける対話型環境学習のための脳に着想を得たマルチメモリエージェントフレームワークVLA2025/8/1
脳に着想を得て空間・時間・エピソード・意味記憶を統合したフレームワークを提案し、長期的な計画と対話型学習を実現してEmbodiedBenchで成功率を26.5%向上させた。
- SkyVLN:都市環境におけるUAVのための視覚言語ナビゲーションとNMPC制御VLA2025/7/1
大規模言語モデルを活用して自然言語指示と視覚情報からUAVを都市環境でナビゲートする枠組みを提案し、NMPCによる障害物回避と軌道追従を統合した。
- CLEA: 動的環境におけるタスク実行を強化する閉ループ型身体性エージェントVLA2025/3/1
4つのオープンソースLLMを機能分離して組み合わせ、環境記憶に基づく対話型タスク計画とマルチモーダル実行批評による階層的再計画を備えた閉ループ身体性エージェントを提案し、実環境で成功率と完了率を大幅に改善した。
- OpenFly: 空中視覚言語ナビゲーションのための包括的プラットフォームVLA2025/2/1
空中視覚言語ナビゲーションのための多様なレンダリングエンジンと自動データ収集ツールチェーンを統合したプラットフォームを提案し、10万軌道の大規模ベンチマークとキーフレーム重視のナビゲーションモデルを構築した。
- 2Dガウシアンスプラッティングによる表面法線を考慮した内視鏡SLAMSLAM/内視鏡2025/1/1
内視鏡手術向けに、2Dガウシアンスプラッティングと表面法線を活用したリアルタイムSLAMシステムを提案し、高精度な深度・表面再構成を実現した。
- V²-SfMLearner:振動信号を統合したマルチモーダルカプセル内視鏡の単眼深度・自己運動学習マルチモーダル/医療ロボティクス2024/12/1
カプセル内視鏡の視覚信号に振動信号を融合し、振動ノイズを除去しながら深度とカプセル運動を教師なしで推定するマルチモーダル手法を提案。
- ETSM: ロボット支援内視鏡的粘膜下層剥離術における剥離軌道提案と信頼度マップに基づく安全マージン予測の自動化手術ロボティクス2024/11/1
ロボット支援ESD向けに1849クリップのデータセットETSMを構築し、最適剥離軌道予測と信頼度マップによる安全マージン予測を統合したフレームワークと回帰型ネットワークRCMNetを提案した。
- VisionPAD: 自動運転のための視覚中心の事前学習パラダイム自動運転/自己教師あり学習2024/11/1
画像のみを教師信号に3Dガウシアンスプラッティングで多視点表現を再構成し、ボクセル速度推定と多フレーム測光整合性で自動運転向け視覚モデルを自己教師あり事前学習する手法。
- 単眼画像に基づくケーブル駆動ソフトロボットの三次元力推定手法触覚2024/9/1
単眼画像と駆動情報を融合したエンドツーエンドネットワークにより、ソフトロボットの3次元接触力を高精度に推定する手法を提案した。
- 変形環境下におけるロボットカテーテルのための実演学習に基づくロバスト経路計画経路計画/模倣学習2024/2/1
血管壁との相互作用や変形を考慮し、カリキュラム生成敵対的模倣学習(C-GAIL)を用いてカテーテルの経路計画を実演から学習する手法を提案し、従来法より高い成功率と精度を達成した。
- Autonomous Navigation for Robot-assisted Intraluminal and Endovascular Procedures: A Systematic Review2023/5/1
- Design and Control of a Variable Aerial Cable Towed System2020/1/1
- BARNet: Bilinear Attention Network with Adaptive Receptive Fields for Surgical Instrument Segmentation2020/1/1
- Attention-Guided Lightweight Network for Real-Time Segmentation of Robotic Surgical Instruments2019/10/1