Lei Yang
収録論文 37本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MomWorld: 長期自律走行のための運動量を考慮した潜在ワールドモデル自動運転2026/9/27
過去の観測からシーンの運動傾向を抽出し、潜在的な運動量を未来へ伝播させることで、長期的な計画の一貫性を高め衝突率を削減する自律走行用ワールドモデルを提案。
- 視覚基盤モデルによる堅牢なマルチモーダル3D物体検出3D物体検出2026/9/20
自動運転向けにSAMを微調整したSAM-ADとLiDAR特徴を融合し、ノイズや悪天候下でも堅牢な3D物体検出を実現するRoboDistillを提案。
- PV-WM: 歩行者と車両の連成ロールアウトのための異種マイクロ・マクロ世界モデル予測/世界モデル2026/9/7
歩行者の関節動作と車両の剛体運動を統合した世界モデルを提案し、履歴のみから将来の歩行者・車両状態を再帰的に予測する。
- VBVR-Pro: ネイティブ視覚推論のためのスケーラブルで検証可能なスイート視覚推論2026/8/26
視覚生成を推論の媒体として扱うネイティブ視覚推論の研究を進めるため、300の手続き生成タスクからなる閉ループテストベッドVBVR-Proを導入し、検証可能な報酬スコアラと制御されたモダリティ比較を提供する。
- GaussianDream++: ロボット操作のための効率的な3Dガウス世界モデリングVLA/3Dガウス/世界モデル2026/8/26
VLAポリシーに世界状態トークンと世界予測トークンを挿入し、訓練時のみ3Dガウス表現で現在と未来の世界を監督することで、推論時の追加コストなしに操作性能を向上させる手法を提案。
- MomADv2: エンドツーエンド自動運転のための信頼性の高い時間的記憶自動運転2026/8/24
運転コマンドの変化に応じて履歴情報を選択的に活用し、コマンドと矛盾する記憶を抑制する信頼性の高い状態空間記憶フレームワークを提案。長期的な計画の一貫性を向上させ、衝突率を低減した。
- すべての履歴が役立つわけではない:長期的なエンドツーエンド自動運転のための速度認識型選択的メモリ自動運転2026/8/16
自動運転の長期計画において、過去の自己予測状態が古くなったり現在の運動段階と矛盾したりする問題を解決するため、選択的メモリと運動段階学習を導入したStableDriveを提案し、衝突率やL2誤差を大幅に改善した。
- DeepSight: 潜在状態予測による長期的世界モデリングを用いたエンドツーエンド自動運転自動運転2026/5/1
自動運転のための世界モデルを提案し、BEV空間で将来フレームの潜在意味特徴を並列予測することで長期的な状態予測を行い、さらに適応的なテキスト推論で長尾シナリオの性能を向上させ、閉ループベンチマークでSOTAを達成した。
- 次世代SLAMに向けて:性能・ロバスト性・将来展望に焦点を当てた3DGS-SLAMサーベイSLAM2026/2/1
3Dガウシアンスプラッティング(3DGS)とSLAMの統合に関する研究を、描画品質・追跡精度・再構築速度・メモリ消費の4軸で整理し、動的環境やモーションブラーへのロバスト性向上策と今後の課題をまとめたサーベイ。
- 超大規模動画推論スイート動画推論2026/2/1
200種類の推論タスクと100万本以上の動画からなる大規模データセットVBVRと、ルールベースで検証可能な評価ベンチマークVBVR-Benchを構築し、動画推論のスケーリング則と未見タスクへの汎化の兆候を示した。
- 視覚なしロボットによる協調組立の政策学習マニピュレーション2025/11/1
視覚を持たないロボットと人間が協力してボードをフレームに挿入するタスクにおいて、アドミタンス制御を活用した強化学習により、成功率と作業時間を改善する手法を提案した。
- マルチモーダル基盤モデルによる空間知能のスケーリングVLA2025/11/1
800万件の多様な空間データでマルチモーダル基盤モデルを訓練し、空間知能ベンチマークで大幅な性能向上を達成するとともに、データスケーリングや創発的汎化の兆候を分析した。
- 観測前のリスクを見抜く:視覚言語モデルによる自動運転の潜在的リスク推論VLA2025/11/1
自動運転における「まだ観測されていない潜在的リスク」を推論するための視覚言語データセットPotentialRiskQAと、それに基づく推論フレームワークPR-Reasonerを提案した。
- ロボットによる布の展開把持選択のためのデータセットとベンチマーク:ICRA 2024布コンペティションマニピュレーション2025/8/1
空中でのロボット布展開における把持姿勢選択を評価するベンチマークとICRA 2024コンペティションを開催し、679回の実世界デモンストレーションを含むデータセットを公開した。
- 安全クリティカルな自動運転のための進化的Bird's Eye View知覚:包括的サーベイ自動運転知覚2025/8/1
自動運転におけるBird's Eye View知覚を安全性の観点から、単一モダリティ車載・マルチモーダル車載・マルチエージェント協調の3段階で体系的にレビューし、データセットや課題、将来方向を整理したサーベイ。
- マルチモーダルLLMの空間知能を包括的に評価するEASI空間知能評価2025/8/1
GPT-5など最先端マルチモーダルモデルの空間理解・推論能力を、統一的なタスク分類に基づく8つのベンチマークで大規模に評価し、人間との差や限界を明らかにした。
- DIVER: 強化学習と拡散モデルで模倣学習の限界を突破するエンドツーエンド自動運転自動運転2025/7/1
拡散モデルによる多様な軌道生成と強化学習による安全性・多様性の誘導を組み合わせ、単一専門家の模倣学習が抱えるモード崩壊を解消するエンドツーエンド自動運転フレームワークを提案した。
- S2R-Bench: 自動運転のためのSim-to-Real評価ベンチマークsim2real2025/5/1
実世界の多様な道路・天候・照明条件で収集したセンサ異常データを用い、自動運転の知覚アルゴリズムのロバスト性を評価する初の実環境ベースの腐敗ロバスト性ベンチマークを提案した。
- 群衆内の内部状態を能動的情報収集で推定する手法ヒューマンロボットインタラクション2025/5/1
ロボットが能動的に働きかけて人間の性格特性を推定する手法を提案し、シミュレーションと実ユーザ実験で予測誤差と不確実性を大幅に削減した。
- BEV-GS: 鳥瞰図におけるフィードフォワードガウススプラッティングによる路面再構成路面再構成/ガウススプラッティング2025/4/1
単一フレームから鳥瞰図パラダイムで路面の形状とテクスチャを推定し、グリッドガウス表現でリアルタイムに高精度な路面再構成と新規視点合成を実現した。
- GauSS-MI: ガウススプラッティングとシャノン相互情報量による能動的3次元再構成能動的3次元再構成2025/4/1
3Dガウススプラッティングの各ガウスに確率モデルを導入し、シャノン相互情報量で視覚的不確かさを評価して次に撮影すべき視点を選ぶ能動的3次元再構成手法を提案した。
- ハンドルを振るな:エンドツーエンド自動運転におけるモメンタムを考慮した計画自動運転計画2025/3/1
過去の軌道と知覚の履歴を活用して軌道予測を安定化させるMomADを提案し、nuScenesで長期的な一貫性と衝突率の改善を達成した。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- SMPLest-X:表現豊かな人体姿勢・形状推定のための究極のスケーリング人体姿勢推定2025/1/1
人体・手・顔の動きを統合的に捉えるEHPSにおいて、40のデータセットと最大ViT-Hugeのモデルを用いてスケーリング則を調査し、汎用基盤モデルを構築した研究。
- SOLAMI:3D自律キャラクターとの没入型インタラクションのための社会的視覚-言語-行動モデリングVLA2024/11/29
3Dキャラクターが人間と社会的に交流できるよう、視覚・言語・行動を統合した初のエンドツーエンドVLAフレームワークを提案し、合成データセットとVRインターフェースを開発した。
- 会場マップを活用した看板認識型オープンワールド探索探索2024/10/1
拡散モデルによる看板テキスト認識と会場マップを組み合わせ、未知のショッピングモール内で目的の店舗を効率的に探索するロボットシステムを提案した。
- 言語拡張型記号プランナによるオープンワールドタスク計画タスク計画2024/7/1
大規模言語モデルを組み合わせて、不完全な知識しかないオープンワールド環境でも記号プランナが動作できるようにし、実行エラーを診断しながら知識を段階的に構築する手法を提案した。
- 一振りでゴールへ:環境認識型ダイナミクスによる目標条件付き布投げ操作変形物体マニピュレーション2024/6/1
布の形状や物性、環境との相互作用を考慮したグラフベースのダイナミクスモデルを学習し、1回の高速投げ操作で目標状態に到達させる制御手法を提案した。
- WHAC: 世界座標系に基づく人間とカメラの統合推定人体姿勢推定2024/3/1
単眼動画からSMPL-X人体モデルとカメラ姿勢を世界座標系で同時推定するフレームワークWHACを提案し、新規合成データセットWHAC-A-Moleも公開する。
- Evaluating Explanation Methods for Vision-and-Language Navigation2023/10/1
- Target-free Extrinsic Calibration of Event-LiDAR Dyad using Edge Correspondences2023/5/1
- S$^2$MAT: Simultaneous and Self-Reinforced Mapping and Tracking in Dynamic Urban Scenariosorcing Framework for Simultaneous Mapping and Tracking in Unbounded Urban Environments2023/4/1
- Polymer-Based Self-Calibrated Optical Fiber Tactile Sensor2023/3/1
- Hierarchical Temporal Transformer for 3D Hand Pose Estimation and Action Recognition from Egocentric RGB Videos2022/9/1
- Intelligent Amphibious Ground-Aerial Vehicles: State of the Art Technology for Future Transportation2022/7/1
- Visual-Tactile Sensing for Real-time Liquid Volume Estimation in Grasping2022/2/1
- Edge Computing Assisted Autonomous Flight for UAV: Synergies between Vision and Communications2020/12/1