Wei Xu
ByteDance Seed
収録論文 46本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 離散VLAモデルによるヒューマノイドの移動操作VLA2026/9/28
ヒューマノイドの全身動作を部位ごとの離散トークンに分解し、言語モデルの語彙を拡張して学習・リアルタイム制御を可能にしたVLAモデルHolo-Mを提案。
- SiMDex: 類似する自己中心視点動画のマイニングによるクロスエンボディ器用操作データ選択/器用操作/VLA2026/8/1
ロボットの器用操作のためのVLAモデル訓練に有効な人間の自己中心視点動画を、類似性に基づくデータマイニングで選別するフレームワークを提案。約3200万サンプルから1.49百万件を選び、成功率を47.7%から61.1%に向上させた。
- EmbodiedGen V2: 具身知能のためのエージェント型・シミュレーション対応3Dワールドエンジンシミュレーション環境生成2026/7/1
シミュレーション対応の3Dアセットを自動で組み立て、操作・ナビゲーションなどのタスク環境を生成できる世界エンジンを提案。生成環境での強化学習により、シミュレーション成功率と実ロボット成功率を大幅に向上させた。
- 安全危機状況における蒸留視覚言語モデルを用いたイベント適応型動作計画ナビゲーション2026/6/1
安全が重要な場面で、視覚言語モデルを連続制御に使うと遅延が生じる問題を解決するため、異常イベント時のみモデルを起動するフレームワークを提案し、高次推論と低次制御を統合して動的安全マージンを向上させた。
- ハンド・イン・ザ・ループ:シームレスな手と腕の介入による巧みな操作のためのVLAポリシー改善マニピュレーション2026/5/1
高自由度ロボットハンドの巧みな操作において、人間の介入時に発生する「ジェスチャージャンプ」を防ぐため、人間の修正意図と自律ポリシー実行をブレンドする介入手法HandITLを提案し、介入ジッタや把持失敗を大幅に低減した。
- RankQ: 自己教師ありアクションランキングによるオフラインからオンラインへの強化学習強化学習2026/5/1
オフラインからオンラインへの強化学習において、時間差学習に自己教師ありのランキング損失を追加し、アクションの相対的な好みを学習することで、価値関数の過大評価を抑えつつ、より高品質な行動への改善を促進する手法RankQを提案した。
- 生成3D世界によるロボットVLAのSim-to-Real強化学習のスケーリングVLA2026/3/1
生成3Dモデルと言語駆動シーン設計で多様なシミュレーション環境を自動生成し、VLAモデルの強化学習をスケールさせて実世界への転移性能を大幅に向上させた。
- GR-Dexter 技術報告書VLA2025/12/1
両手デクスタラスハンドロボットで言語条件付き長期操作を実現するVLAフレームワークを提案し、ハードウェア・データ収集・学習手法を統合した。
- 脚式移動マニピュレータによる多段階ピックアンドプレースの学習マニピュレーション2025/9/1
四足歩行ロボットによる移動マニピュレーションの多段階ピックアンドプレースタスクをシミュレーションで視覚運動ポリシーとして学習し、実世界で約80%の成功率を達成した。
- ガウススプラッティングとクロスレイヤ最適化による通信効率の良いロボット複合現実複合現実/通信最適化2025/8/1
ロボットの姿勢からガウススプラッティングモデルで画像を生成し、画像アップロードを削減するGSMRを提案。さらに通信と電力配分を最適化するGSCLOで超低通信コストの複合現実を実現。
- 多関節工具を多指ハンドで操作するための階層型強化学習マニピュレーション2025/7/1
ピンセットやハサミのような形が変わる多関節工具を多指ロボットハンドで巧みに操るため、低レベルと高レベルの2層からなる階層型ゴール条件付き強化学習フレームワークを提案し、実機で多様な物体把持に成功した。
- 人間の動作リターゲティングによる20自由度ByteDexterハンドの巧みなテレオペレーションテレオペレーション2025/7/1
20自由度のロボットハンドと腕のテレオペレーションシステムを開発し、人間の手の動きをリアルタイムで高忠実に再現することで、巧みな操作のデモデータを生成できることを示した。
- モータ計画・学習・制御応用のための人間中心型共有自律共有自律2025/6/1
上肢バイオシグナルを用いたマシンインターフェースとモータ制御系における人間中心の共有自律AIフレームワークをレビューし、BCI・リハビリ・支援ロボティクス・LLMの応用と課題を整理した。
- 大規模視覚モデル誘導制御とクエリ・サービス最適化を統合した機会的協調プランニング自動運転/協調プランニング2025/4/1
自動運転車の未知物体対応のため、ローカルモデルとクラウド上の大規模視覚モデルを適切なタイミングで協調させる機会的協調プランニングを提案し、ナビゲーション時間と成功率を改善した。
- ガウススプラッティングによるグリーンなロボティック複合現実複合現実2025/4/1
ロボット複合現実システムにおいて、ガウススプラッティングで環境をモデル化し、画像アップロードを削減することで通信エネルギーを10分の1以下に抑える手法を提案した。
- SLIM: 長期的視覚運動学習によるシミュレーションから実機への脚式指示マニピュレーションsim2real2025/1/1
低コストな四足歩行ロボットとアーム、単眼カメラを用い、シミュレーションのみで強化学習を行い、探索・移動・把持・運搬・配置を含む長期的タスクを実世界で約80%の成功率で達成するシステムを開発した。
- 時間的最適輸送報酬によるロボット方策学習模倣学習2024/10/1
専門家の動画デモからロボットの方策を学ぶ際、最適輸送に時間順序情報を組み込んだ報酬を提案し、Meta-worldベンチマークで有効性を示した。
- MFCalib: マルチ特徴エッジに基づくターゲットレス環境でのLiDAR-カメラ単一ショット自動外部キャリブレーションキャリブレーション2024/9/1
ターゲット不要の環境で、LiDARとRGBカメラの外部キャリブレーションを1回のデータ取得で自動的に行う手法を提案。深度連続・不連続エッジと輝度不連続エッジを組み合わせ、LiDARビームモデルでエッジ膨張を抑制し、高精度なキャリブレーションを実現した。
- 局所一貫性を考慮した複数点群のロバストな確率ベース統合位置合わせ位置合わせ2024/9/1
複数点群の統合位置合わせにおいて、各点群をガウス混合モデルからのサンプルとみなし、局所一貫性を最適化に組み込むことでノイズや外れ値に頑健な手法を提案した。
- FAST-LIVO2: 高速・直接法によるLiDAR-慣性-視覚オドメトリSLAM2024/8/1
LiDAR・IMU・カメラをESIKFで統合し、生データを直接使う高速なSLAMオドメトリを提案。単一ボクセルマップ上で幾何と画像を融合し、機上リアルタイム動作を実現した。
- スケーラブルな生成モデルによる動作計画タスクの解決自動運転2024/7/1
運転シーンのダイナミクスを学習する生成モデルを提案し、シミュレーション・計画・オンライン学習に活用できることを示した。
- 局所一貫性ガウス混合モデルによるロボット検査のためのロバスト点群位置合わせ点群位置合わせ2024/7/1
ロボット検査で生じるノイズや外れ値に強い点群位置合わせ手法を提案し、隣接点の事後分布の類似性を制約するガウス混合モデルで回転・並進を推定、RMSEを20%低減した。
- 自動運転のための同期・合成統合によるシームレスな仮想現実自動運転2024/3/1
自動運転向けVRデータエンジンにおいて、低レベルの同期設計と高レベルの合成設計を統合したIS2を提案し、VRの不整合を軽減してシームレスな協調世界を実現した。
- Swashplateless-elevon Actuation for a Dual-rotor Tail-sitter VTOL UAV2023/9/1
- Perch a quadrotor on planes by the ceiling effect2023/7/1
- Imitation with Spatial-Temporal Heatmap: 2nd Place Solution for NuPlan Challenge2023/6/1
- Efficient Multi-Task and Transfer Reinforcement Learning with Parameter-Compositional Framework2023/6/1
- PaCo: Parameter-Compositional Multi-Task Reinforcement Learning2022/10/1
- Swarm-LIO: Decentralized Swarm LiDAR-inertial Odometry2022/9/1
- Deployment of long distance multi-moving robots for underground pipe inspection2022/8/1
- FAST-LIVO: Fast and Tightly-coupled Sparse-Direct LiDAR-Inertial-Visual Odometry2022/3/1
- Do You Need the Entropy Reward (in Practice)?2022/1/1
- Towards Safe Reinforcement Learning with a Safety Editor Policy2022/1/1
- Natural Language for Human-Robot Collaboration: Problems Beyond Language Grounding2021/10/1
- FAST-LIO2: Fast Direct LiDAR-inertial Odometry2021/7/1
- Model Predictive Control for Trajectory Tracking on Differentiable Manifolds2021/6/1
- TAAC: Temporally Abstract Actor-Critic for Continuous Control2021/4/1
- MetaView: Few-shot Active Object Recognition2021/3/1
- Avoiding dynamic small obstacles with onboard sensing and computating on aerial robots2021/3/1
- Kalman Filters on Differentiable Manifolds2021/2/1
- R2LIVE: A Robust, Real-time, LiDAR-Inertial-Visual tightly-coupled state Estimator and mapping2021/2/1
- ikd-Tree: An Incremental K-D Tree for Robotic Applications2021/2/1
- FAST-LIO: A Fast, Robust LiDAR-inertial Odometry Package by Tightly-Coupled Iterated Kalman Filter2020/10/1
- An Empowerment-based Solution to Robotic Manipulation Tasks with Sparse Rewards2020/10/1
- Robots State Estimation and Observability Analysis Based on Statistical Motion Models2020/10/1
- Guided Feature Transformation (GFT): A Neural Language Grounding Module for Embodied Agents2018/5/1