Zhenjie Yang
The University of Hong Kong
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HACo: 力覚対応の巧みな操作のための触覚アクティブコンプライアンス学習マニピュレーション2026/9/29
指尖触覚と関節トルクを統合し、接触力を調整しながら動作する巧みな操作ポリシーを学習する手法を提案。実機で摩擦・回転トルク・変形物体操作など多様なタスクにおいて83%の平均成功率を達成した。
- Bench2Dex: 多様な器用ハンドにおける視触覚両手マニピュレーションのベンチマークマニピュレーション2026/9/14
12種類の器用ハンドに対応した共通の触覚インターフェースを備えるシミュレーションベンチマークを構築し、26の両手操作タスクと約1.3Kのテレオペデモを提供して視触覚マニピュレーションを評価可能にした。
- MINT: スケーラブルなエゴセントリックパイプライン監視によるワールド空間カメラ・手の動き推定の統合モデルエゴセントリックビジョン/手とカメラの軌跡推定2026/9/4
エゴセントリックRGB映像からカメラと両手のワールド空間軌跡を直接推定する初の基盤モデルMINTを提案し、大規模な疑似ラベル生成パイプラインで事前学習して高精度化した。
- OC-VLA++: 単眼幾何ガイドによるクロスビュー一貫性を用いた視点ロバストなロボット操作VLA2026/8/1
カメラ座標系での行動接地に加え、幾何学的に関連する視点ペアからの教師信号とクロスビュー行動等変性を導入し、限られたカメラ視点での未見視点への汎化性能を向上させた。
- HandEdit: 身体性を考慮した人間からロボットへの器用な手の画像編集のための統一ベンチマーク画像編集/ロボティクス2026/8/1
人間の手の画像を様々なロボットハンドに変換する大規模な画像編集データセットとベンチマークを構築し、既存の編集モデルの評価と身体性を考慮した編集モデルの発展を目指した。
- WorldScape Policy 2.0:推論強化メモリによる操縦可能なワールドアクションモデリングの実現操作2026/7/1
ロボット操作のためのワールドアクションモデルを拡張し、長期・短期メモリと推論強化により、タスク進行の追跡と細かい言語-映像-行動の対応付けを可能にした。
- ワールドエンジン:自動運転におけるポストトレーニング時代に向けて自動運転2026/6/1
実世界のログから高忠実度のインタラクティブ環境を再構築し、安全上重要な長尾シナリオを合成的に生成して、事前学習済みの自動運転モデルを強化学習でポストトレーニングする枠組みを提案。これにより、実世界のリスクを回避しつつ安全性を向上させる。
- GuidedVLA: プラグアンドプレイの行動注意特化によるタスク関連因子の指定VLA2026/5/1
VLAモデルの行動デコーダを機能部品として捉え、個々の注意ヘッドに明示的な補助信号でタスク関連因子(物体接地、空間幾何、時間的スキル論理)を学習させるフレームワークを提案し、シミュレーションと実機で汎化性能を向上させた。
- Bench2Drive-VL: 視覚言語モデルを用いたクローズドループ自動運転のベンチマーク自動運転2026/4/1
自動運転における視覚言語モデル(VLM)の評価を、従来のオープンループの静的QAではなく、クローズドループ環境で行うためのベンチマークを提案した論文。
- DriveMoE:自動運転のためのVision-Language-ActionモデルにおけるMixture-of-ExpertsVLA2025/5/1
自動運転向けVLAモデルに視覚と行動のMixture-of-Expertsを導入し、状況に応じたカメラ選択と運転行動の専門化を実現してSOTA性能を達成した。
- Raw2Drive: 世界モデル整合による強化学習ベースのEnd-to-End自動運転End-to-End自動運転2025/5/1
特権情報で訓練した世界モデルを生センサー世界モデルに蒸留し、強化学習でEnd-to-End自動運転を実現してCARLA v2で最高性能を達成した。
- EgoFSD: 不確実性デノイジングと反復的洗練による効率的なEnd-to-End自動運転のための自己中心的全スパースパラダイムEnd-to-End自動運転2024/9/1
自己中心的な全スパース表現を用いて知覚・予測・計画を統合し、不確実性モデリングと反復的洗練により効率的なEnd-to-End自動運転を実現する手法を提案。
- Bench2Drive: 閉ループ自動運転のマルチ能力ベンチマークに向けて自動運転ベンチマーク2024/6/1
CARLA v2上で44の対話シナリオ・23の天候・12の町から収集した200万フレームのデータと閉ループ評価プロトコルを提供し、エンドツーエンド自動運転の多様な能力を公平に評価する初のベンチマークを提案した。