Kevin Zhang
収録論文 16本 ・ フィジカルAI/ロボット学習
VLAマニピュレーションVLA/世界モデル安全強化学習/VLA世界モデル評価触覚世界モデル音響3D再構成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Token-World: 視覚言語モデルのトークン空間におけるロボット操作のための世界モデリングVLA2026/9/30
VLAモデルの視覚トークンを圧縮した状態空間で未来のダイナミクスを予測する世界モデルを提案し、操作ベンチマークで予測精度と方策整合性を向上させた。
- 確率的ニューラル符号付き掃引体積によるリアルタイムチャンス制約付き軌道最適化マニピュレーション2026/9/18
ロボットの掃引体積の符号付き距離関数を確率的場として学習し、認識ノイズや不確実性を考慮したチャンス制約付き軌道最適化を実現する手法を提案。
- TrAct: ロボット制御と視覚予測を視覚トラックで橋渡しするVLA/世界モデル2026/8/25
ロボットの行動と画像変化の弱い対応を補うため、視覚トラックを中間表現として用いる世界モデルベースの意思決定フレームワークTrActを提案。シミュレーションと実機で成功率を大幅に向上させた。
- SafeDojo: インタラクティブワールドモデルによるVLAのための安全強化学習安全強化学習/VLA2026/6/1
視覚言語行動(VLA)ポリシー向けに、ワールドモデルベースの想像を通じて安全な行動を学習する初のモデルベース安全強化学習フレームワークを提案。
- Wow, wo, val! 具現化世界モデル評価のためのチューリングテスト世界モデル評価2026/1/1
ロボット操作データ609件を用い、動画基盤モデルを世界モデルとして評価する5能力・22指標のベンチマークを提案し、人間の選好との相関0.93超を達成した。
- ロボットハンドのためのマルチモーダル触覚指先設計:器用な操作の向上触覚2025/10/1
低コストで作りやすいマルチモーダル触覚センサ内蔵の指先を開発し、視覚が使えない状況でも紙コップの積み下ろしなどを高精度に操作できることを示した。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。
- 姿勢ドリフト下での音響ニューラル3D再構成音響3D再構成2025/3/1
ソナー画像からの3D再構成において、センサ姿勢を学習可能なパラメータとしてニューラル表現と同時に最適化し、姿勢ドリフトがあっても高精度な再構成を実現する手法を提案した。
- Towards Autonomous Crop Monitoring: Inserting Sensors in Cluttered Environments2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- DELTAHANDS: A Synergistic Dexterous Hand Framework Based on Delta Robots2023/10/1
- Mission-level Robustness with Rapidly-deployed, Autonomous Aerial Vehicles by Carnegie Mellon Team Tartan at MBZIRC 20202021/7/1
- Playing with Food: Learning Food Item Representations through Interactive Exploration2021/1/1
- A Modular Robotic Arm Control Stack for Research: Franka-Interface and FrankaPy2020/11/1
- Leveraging Multimodal Haptic Sensory Data for Robust Cutting2019/9/1
- Learning Semantic Embedding Spaces for Slicing Vegetables2019/4/1