Yuhao Zhang
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- マルチロボット軌道のノイズ除去計画群制御2026/9/28
拡散・ノイズ除去に基づくD4ormを基盤に、分離型・オンライン・分散型のマルチロボット軌道計画手法を開発し、実機ドローンや大規模シミュレーションで有効性を示した。
- M²Tok: 視覚言語行動モデルのためのマルチヘッド・マルチコードブック離散行動トークン化VLA2026/9/16
連続的な行動信号を複数のヘッドと独立したコードブックで離散トークン化し、再構成誤差を抑えつつVLAモデルの性能を向上させる手法を提案。
- Hilti-Trimble-Oxfordデータセット:フロアプラン事前情報を用いた360度視覚慣性SLAMと位置推定のベンチマークSLAM/位置推定2026/7/1
建設現場で収集した360度カメラとIMUによる視覚慣性データセットを提供し、SLAMとフロアプラン参照位置推定のベンチマークを評価した論文。
- 暗黙的ドリフト方策:条件付き専門家幾何による一段階行動生成模倣学習/行動生成2026/6/1
拡散やフローマッチングに基づく生成行動ポリシーは反復サンプリングが遅いため、一段階生成を提案。訓練時のドリフト補正を明示的なベクトル場推定なしで取り込む暗黙的ドリフト方策(IDP)を導入し、2D・3D・実世界操作タスクで有効性を実証した。
- ScaRF-SLAM: フィードフォワードモデルと古典的ビジュアルSLAMによるスケール一貫再構成SLAM2026/6/1
古典的な特徴ベースSLAMでロバストなトラッキングを行い、幾何基盤モデル(GFM)はマッピング専用に用いる分離型フレームワークを提案。スケール最適化とサブマップ更新により高精度な稠密再構成を実現した。
- RedVLA: 視覚言語行動モデルに対する物理的レッドチーミング安全性2026/4/1
VLAモデルの物理的安全性リスクを事前検出するため、リスクシナリオ合成とリスク増幅の2段階からなるレッドチーミングフレームワークRedVLAを提案し、生成データで軽量ガードSimpleVLA-Guardも構築した。
- R3DP: 実時間3D認識ポリシーによる身体的操作マニピュレーション2026/3/1
大規模3D視覚モデルの強力な事前知識を、非同期の高速・低速協調モジュールと軽量な時間特徴予測ネットワークで統合し、実時間性能を保ちながら操作ポリシーの成功率を向上させる手法を提案した。
- VLA-Arena: 視覚言語行動モデルを評価するためのオープンソースベンチマークフレームワークVLA2025/12/1
VLAモデルの能力限界と失敗モードを定量化するため、タスク構造・言語・視覚の3軸で難易度を設計した170タスクのベンチマークを提案し、最先端モデルの汎化不足や安全性軽視を明らかにした。
- MM-ACT: マルチモーダル並列生成から行動を学習する統合VLAモデルVLA2025/12/1
テキスト・画像・行動を共有トークン空間で統合し、並列デコードで生成するVLAモデルを提案。LIBEROや実機Franka、RoboTwin2.0で高い成功率を達成した。
- SimpleVLA-RL:強化学習によるVLAモデル訓練のスケーリングVLA2025/9/1
VLAモデル向けの効率的な強化学習フレームワークを提案し、大規模データへの依存を減らしつつLIBEROやRoboTwinで高性能を達成した。
- 汎化可能な両腕マニピュレーションのベンチマーク:CVPR 2025 MEISワークショップにおけるRoboTwin両腕協調チャレンジマニピュレーション2025/6/1
RoboTwinシミュレーションと実機ロボットを用いた両腕マニピュレーションの国際コンペを開催し、17タスクで64チームが競い、汎化可能な協調方策の知見をまとめた。
- SafeVLA:制約付き学習による視覚言語行動モデルの安全アラインメントVLA2025/3/1
視覚言語行動モデル(VLA)に制約付きマルコフ決定過程を用いた安全強化学習を適用し、タスク成功率を維持しつつ安全違反コストを大幅に削減する手法を提案した。
- D4orm: 動力学を考慮した拡散ノイズ除去変形によるマルチロボット軌道生成群制御2025/3/1
拡散モデルのノイズ除去を利用し、ロボットの動力学モデルと適合度関数のみから、衝突のない実行可能なマルチロボット軌道を最適化する手法を提案。最大16台のロボットでMPPIより高速に高品質解を発見し、8機のドローンで実機展開を示した。
- SLAMシステムの再現可能なベンチマークと性能診断のためのフレームワークSLAM2024/10/1
Dockerで環境を統一し、データセットの摂動に対するSLAMアルゴリズムの頑健性をファジングで評価するオープンソースのベンチマーク基盤SLAMFuseを提案した。
- NGD-SLAM: GPU不要のリアルタイム動的SLAMSLAM2024/5/1
深層学習によるマスク生成とカメラ追跡を分離し、CPUのみで60FPSのリアルタイム動的SLAMを実現した。
- Falsification of a Vision-based Automatic Landing System2023/7/1