Ye Li
収録論文 21本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GE-Act 2.0: ロボット操作のためのワールドアクションモデルの事前学習とスケーリングVLA2026/9/4
操作データのみで生成・行動コンポーネントをゼロから学習するワールドアクションモデルを提案し、大規模データでの事前学習とスケーリングの効果を検証した。
- GE-Sim 2.0: ロボット操作のための包括的クローズドループ映像世界シミュレータへのロードマップシミュレーション2026/5/1
ロボット操作のためのクローズドループ映像世界シミュレータGE-Sim 2.0を提案。実ロボットデータで再学習し、状態デコーダ、世界判定器、高速化モジュールを追加して、映像シミュレーションからポリシー学習へのループを閉じる。
- ElegantVLA: 効率的な視覚言語行動モデルのための思考タイミング学習VLA2026/5/1
VLAモデルの計算コストを削減するため、制御ステップごとに計算量を動的に調整するプラグイン型の位相適応推論フレームワークを提案。
- RoboStream: 視覚言語モデルに時空間推論と記憶を統合したロボット操作フレームワークVLA2026/3/1
視覚言語モデルに時空間融合トークンと因果時空間グラフを導入し、長期ロボット操作における幾何学的定位と行動による状態変化の記憶を訓練なしで実現する。
- 無人水上艇による自律探査のための可変解像度仮想地図探査/USV2026/3/1
無人水上艇の自律探査において、GNSS劣化や計算資源の制約に対応するため、適応的四分木を用いた可変解像度の仮想地図を提案し、地図不確実性の表現と探査計画の効率を向上させた。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- Sparse ActionGen: リアルタイム枝刈りによる拡散ポリシーの高速化拡散ポリシー2026/1/1
拡散ポリシーの多段ノイズ除去を、観測に応じて動的に枝刈り・キャッシュ再利用することで最大4倍高速化し、リアルタイム制御を可能にした手法。
- コーナーケースを走る:エンドツーエンド自動運転のための実世界敵対的閉ループ評価プラットフォーム自動運転評価2025/12/1
フローマッチングで実世界画像を生成し、敵対的な周辺車両ポリシーと組み合わせて、実世界データで学習したエンドツーエンド自動運転モデルを危険なコーナーケースで閉ループ評価するプラットフォームを提案した。
- 少数の実演から学ぶ人型ロボットの転倒安全統合ポリシー転倒安全/ヒューマノイド2025/11/1
少数の人間の実演と強化学習を組み合わせ、転倒防止・衝撃緩和・素早い起き上がりを一つのポリシーに統合し、シミュレーションとUnitree G1で実機転移を実証した研究。
- ニューラルネットワーク制御器の高速初期化手法:マルチコプタ迎撃における画像ベースビジュアルサーボ制御の事例研究ビジュアルサーボ/強化学習2025/9/1
システムモデルに基づき安定条件を満たすデータセットを構築することで、ニューラルネットワーク制御方策の初期訓練を高速化する手法を提案し、マルチコプタ迎撃の画像ベースビジュアルサーボ制御で有効性を検証した。
- ハエトリグサの捕食機構に着想を得たパーチングドローンの設計と制御パーチング/バイオミメティクス/制御2025/9/1
ハエトリグサの高速捕食機構を模倣した柔軟パーチング機構を開発し、100ms未満で対象に止まれるドローンを実現。外乱を推定・補償するカスケードEHGO制御で風や着地衝撃への耐性も向上させた。
- 空間ポリシー:空間認識モデリングと推論による視覚運動ロボット操作の誘導マニピュレーション2025/8/1
空間認識能力を欠く既存の視覚中心階層型モデルを改善するため、空間条件付き動画生成とフロー型行動予測、空間推論フィードバックを統合した操作フレームワークを提案し、23タスクで大幅な性能向上を達成した。
- 拡散ポリシー高速化のためのブロック単位適応キャッシュVLA2025/6/1
拡散ポリシーの推論を、ブロック単位で中間特徴を適応的にキャッシュ・再利用することで、学習不要で高速化する手法を提案。
- RGBSQGrasp: 単眼RGB画像からの局所スーパークアドリック推定による把持可能領域を考慮したビンピッキングマニピュレーション2025/3/1
単眼RGB画像から基礎モデルで物体の点群を推定し、スーパークアドリック形状を当てはめて把持姿勢を生成する、深度センサー不要のビンピッキング手法を提案。
- ノイズを含む動画からのロバストな自己運動推定と3D再構成のためのスケーラブルなベンチマークと学習3D再構成2025/1/1
ノイズの多い動画でも高精度な自己運動推定と3D再構成を実現するため、ノイズ合成パイプラインとベンチマークRobust-Ego3Dを構築し、テスト時適応手法CorrGSを提案した。
- 完全からノイズ世界シミュレーションへ:SLAMロバスト性ベンチマークのためのカスタマイズ可能な身体性マルチモーダル摂動SLAM2024/6/1
RGB-D SLAMモデルのロバスト性評価のため、センサ・運動摂動を体系的に分類し合成するパイプラインと大規模ベンチマークNoisy-Replicaを提案した。
- 共有RGB-Dフィールドの学習:LiDAR-カメラ3D知覚のためのラベル効率の良い統一自己教師あり事前学習VLA2024/5/1
LiDARとカメラの3D知覚モデル向けに、NeRFを活用して両モダリティを統一的にマスク再構成する自己教師あり事前学習手法NS-MAEを提案し、ラベル効率の良いファインチューニングで従来手法を上回る性能を示した。
- LiDAR配置は3Dシーン理解に最適化されているか?LiDAR配置最適化2024/3/1
複数LiDARの配置を最適化する指標M-SOGと最適化戦略を提案し、悪天候やセンサ故障を含む大規模データセットで3D物体検出とセマンティックセグメンテーションの性能向上を示した。
- Customizable Perturbation Synthesis for Robust SLAM Benchmarking2024/2/1
- Influence of Camera-LiDAR Configuration on 3D Object Detection for Autonomous Driving2023/10/1
- AVM-SLAM: Semantic Visual SLAM with Multi-Sensor Fusion in a Bird's Eye View for Automated Valet Parking2023/9/1