Sixu Yan
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Bridge3D:Vision-Language-Actionモデルに3D空間での知覚と行動を可能にするVLA2026/9/21
2D中心のVLAモデルに3D基盤モデルの特徴と3Dセマンティックフィールドを組み込み、3D空間での精密なマニピュレーションを実現した。
- 適応的視覚言語把持:構成可能な基盤事前知識と汎化可能な把持合成による実現マニピュレーション2026/9/3
本論文は、ロボットハンドの種類に依存せず汎用的に把持を合成できるAdaRoboVLGフレームワークを提案し、物理的把持合成とタスク依存の理解を分離することで、基盤モデルの進歩を直接把持能力の向上に結び付ける手法を示した。
- UniDriveVLA:自動運転のための理解・知覚・行動計画の統合自動運転/VLA2026/4/1
自動運転向けのVLAモデルにおいて、空間知覚と意味推論の競合を解消するため、Mixture-of-Transformersによる専門家分離を導入した統合モデルUniDriveVLAを提案し、nuScenesとBench2Driveで最先端性能を達成した。
- OmniTrack: 物理的に整合した参照動作による汎用モーショントラッキングモーショントラッキング2026/2/1
人間の動作データをロボットで追従させる際、体格差やノイズによる物理的に不可能な参照動作を、シミュレーション上の特権方策で実行可能な動作に変換してから追従方策を学習する枠組みを提案。実機で長時間安定した追従やアクロバティック動作を実現。
- ReCogDrive:強化学習型認知フレームワークによるエンドツーエンド自動運転自動運転/VLA2025/6/1
VLMの運転知識を拡散プランナに注入し、DiffGRPOで安全性を強化する自動運転フレームワークを提案。NAVSIMとBench2Driveで最先端性能を達成。
- DiffusionDrive:切り詰め拡散モデルによるエンドツーエンド自動運転自動運転2024/11/1
拡散モデルのノイズ除去ステップを切り詰め、マルチモードアンカーを導入することで、自動運転の行動生成を2ステップで多様かつ高品質にし、リアルタイム速度を実現した。
- M2Diffuser: 3Dシーンにおけるモバイルマニピュレーションのための拡散ベース軌道最適化モバイルマニピュレーション2024/10/1
ロボット中心の3Dスキャンから移動と操作を統合した全身軌道を拡散モデルで生成し、推論時に物理制約とタスク目的を最適化する手法を提案。20以上のシーンで既存手法を上回り、実機転移も成功。
- M3Bench:3Dシーンにおけるモバイルマニピュレーションの全身動作生成ベンチマークモバイルマニピュレーション2024/10/1
3Dシーンで物体を並べ替える全身動作軌道を生成するモバイルマニピュレーションの新ベンチマークM3Benchを提案し、自動データ生成ツールと物理シミュレーション評価を提供する。