Zhengtong Xu
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 残差潜在アクションによる視覚特徴ベース世界モデルの学習世界モデル2026/5/1
視覚特徴ベースの世界モデルにおいて、DINO残差から学習可能な新しい潜在アクション表現(RLA)を導入し、フローマッチングで予測することで、既存手法より高速かつ高精度な未来予測を実現した。さらに、ロボット学習への応用として、アクションなし動画からの行動学習や、オフライン動画のみで学習する視覚RLフレームワークを開発した。
- 触覚を活用した四脚ロボットの移動操作ポリシー学習移動操作/触覚/強化学習2026/4/1
四脚ロボットの移動操作において、視覚と自己受容感覚に加えて触覚情報を活用する階層的ポリシー学習手法を提案。実世界の人間デモから触覚条件付き高レベルポリシーを学習し、シミュレーションでの大規模強化学習により全身制御ポリシーを獲得し、実世界へゼロショット転送する。接触を伴うタスクで平均28.54%の性能向上を達成。
- チューブ拡散ポリシー:接触を伴う操作のための反応的視覚触覚ポリシー学習模倣学習/操作2026/4/1
接触を伴う操作において、視覚と触覚のフィードバックに基づいて即座に適応できるよう、拡散モデルとチューブベースのフィードバック制御を組み合わせた新しいポリシー学習フレームワークを提案した。
- 剛性コパイロット:接触の多い遠隔操作のためのインピーダンスポリシー遠隔操作2026/3/1
接触の多い遠隔操作において、操作者がロボットの姿勢を指示し、視覚ベースのポリシーがオンラインでロボットのインピーダンスを調整する共有制御手法を提案。シミュレーションで方向依存の剛性行列を学習し、それを用いて軽量な視覚ポリシーを教師あり学習することで、実画像へのゼロショット転移を実現した。
- TacVLA: 接触認識型触覚融合による堅牢な視覚言語行動操作VLA/触覚/操作2026/3/1
視覚と言語に依存するVLAモデルに触覚を統合し、接触検出時のみ触覚トークンを活性化するゲーティング機構を導入して、細かい操作や視覚遮蔽下での性能を向上させた。
- MuxGel:空間多重化と深層再構成による視覚・触覚の同時デュアルモーダルセンシング触覚2026/3/1
チェッカーボード状の被膜で触覚領域と透明窓を交互に配置し、単一カメラで外部視覚と接触触覚を同時取得するGelSight型センサを提案。U-Net再構成で密な視覚・触覚信号を復元する。
- 接触接地型方策:生成的接触接地による巧みな視触覚方策マニピュレーション2026/3/1
多点接触の未来状態と触覚フィードバックを拡散モデルで予測し、接触整合マッピングでコンプライアンス制御器の目標状態に変換する視触覚方策を提案。
- PLanAR: 計画言語に基づくエージェント推論によるロボットマニピュレーションマニピュレーション2026/2/1
VLMの推論空間を計画言語で定義し、各行動後にシンボリックな効果を検証して失敗検出と再計画を行う、長期的なオープンボキャブラリ操作のためのロボットエージェントフレームワーク。
- UNIC: 統合マルチモーダル外因性接触推定の学習触覚2026/1/1
カメラキャリブレーションや事前知識なしに、視覚・固有感覚・触覚を統合して把持物体と環境の接触を推定するマルチモーダル手法を提案。
- 正準ポリシー:SE(3)同変ポリシーのための正準3D表現学習模倣学習2025/5/1
3D点群を正準表現にまとめることで、物体・配置・視点の変化に強いSE(3)同変な模倣学習ポリシーを実現した研究。
- ManiFeel: 視触覚マニピュレーション方策学習のベンチマークと理解視触覚マニピュレーション2025/5/1
接触が多い・視覚的に難しい操作タスク向けに、視触覚方策学習を体系的に評価できる再現可能なシミュレーションベンチマークManiFeelを提案し、触覚が方策性能をどう高めるかを実験的に示した。
- ChicGrasp: 繊細で不規則な生体物を操作するための模倣学習に基づくカスタム双顎グリッパ制御マニピュレーション2025/5/1
鶏の脚を把持して吊り下げコンベアに載せる作業を自動化するため、双顎空気圧グリッパと条件付き拡散ポリシーを組み合わせたシステムを開発し、50回の遠隔操作デモから学習して40.6%の成功率を達成した。
- DiffOG: 汎化可能な微分可能ポリシー軌道最適化マニピュレーション2025/4/1
模倣学習による視覚運動ポリシーの出力軌道を、Transformerを用いた微分可能な最適化層で滑らかかつ制約遵守的に改善する手法を提案し、シミュレーション11タスクと実機2タスクで有効性を示した。
- VILP: 潜在動画プランニングによる模倣学習模倣学習2025/2/1
潜在動画拡散モデルで時間的に整合した予測動画を生成し、それを用いた模倣学習によりロボット方策を効率的に学習する手法を提案した論文。
- UniT: 未知物体にも汎化するデータ効率の良い触覚表現学習触覚2024/8/1
単一の簡単な物体から得た触覚画像のみでVQGANベースの触覚表現を学習し、未知物体へのゼロショット転移や操作方策学習で高い性能を示した手法。
- LeTac-MPC:触覚反応型把持のためのモデル予測制御の学習触覚2024/3/1
視覚ベース触覚センサGelSightと微分可能なMPC層を組み合わせ、物体の物性に応じて把持を適応制御する学習型モデル予測制御を提案。標準ブロックのみで学習しながら多様な日用品に汎化し、動的・力相互作用タスクで高い性能を示した。
- LeTO: Learning Constrained Visuomotor Policy with Differentiable Trajectory Optimization2024/1/1