Kaichen Zhou
収録論文 9本 ・ フィジカルAI/ロボット学習
VLA触覚マニピュレーション組立/自己修正
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GEM-4D: ロボット操作のための幾何学強化ビデオワールドモデルVLA2026/5/1
ビデオ生成モデルに4次元対応関係の教師信号を注入し、外観と幾何構造を同時に学習させることで、物理的に一貫した未来予測とロボット操作への直接適用を可能にした。
- OpenTouch: 実世界インタラクションに全手触覚をもたらす触覚2025/12/1
一人称視点の動画と全手の触覚・姿勢を同期した初の実世界データセットを構築し、触覚が把持理解やクロスモーダル alignment に有効であることを示した。
- MLA: ロボットマニピュレーションにおけるマルチモーダル理解と予測のためのマルチセンサリー言語行動モデルVLA2025/9/1
2D画像・3D点群・触覚を位置対応で統合し、将来のマルチセンサリー情報を予測する言語行動モデルを提案。接触の多い実世界タスクで従来の2D/3D VLAを大きく上回る。
- SR3D: 単視点3D再構成で透明・鏡面物体の把持を実現マニピュレーション2025/5/1
単視点のRGB-D画像から外部の視覚モデルで物体メッシュを再構成し、視点・キーポイントマッチングで元のシーンに位置合わせすることで、透明・鏡面物体の把持を可能にする学習不要のフレームワークを提案。
- TARGO: 遮蔽環境下でのターゲット駆動型物体把持のベンチマークマニピュレーション2024/7/1
遮蔽のある散らかった環境でのターゲット物体把持に焦点を当てた新ベンチマークTARGOを構築し、既存手法の限界を示すとともに、形状補完モジュールを備えたTransformerベースのTARGO-Netを提案した。
- AIC MLLM:ロボットマニピュレーションのための自律対話型修正マルチモーダル大規模言語モデルマニピュレーション2024/6/1
関節物体操作における低レベル接触姿勢の失敗を、視覚マスクとテキスト指示を用いてMLLMが自律的に認識・修正する手法を提案。
- SCANet: 自己修正組立ネットワークによるLEGO組立誤りの修正組立/自己修正2024/3/1
LEGO組立の誤りを検出・修正する自己修正ネットワークSCANetを提案し、誤り修正用データセットLEGO-ECAを構築した。MEPNetの組立結果を修正し、正確性を大幅に向上させた。
- RGBGrasp: Image-based Object Grasping by Capturing Multiple Views during Robot Arm Movement with Neural Radiance Fields2023/11/1
- Sample, Crop, Track: Self-Supervised Mobile 3D Object Detection for Urban Driving LiDAR2022/9/1