Kaifeng Zhang
Columbia University
収録論文 25本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 人間の実演からの視覚・触覚・行動の統合モデリングによる巧みなマニピュレーションマニピュレーション2026/9/28
人間の触覚データを活用し、視覚・触覚・行動を統合的に学習するモデルを構築して、巧みなロボットマニピュレーションの性能を向上させた。
- TacBPM: 触覚条件付き行動事前モデルによる巧みな再配向マニピュレーション2026/9/16
触覚と固有感覚の履歴を条件とする潜在行動事前モデルを学習し、残差潜在行動で下流方策を効率的に訓練することで、多様な物体の巧みな手内再配向と把持・運搬タスクを実現した。
- PointZero: 転移可能な3Dダイナミクス学習のための3D点追跡補完3Dダイナミクス/事前学習2026/9/16
ロボットの行動ラベルなしで、RGB-D観測と部分的な3D軌跡から全点の未来軌跡を予測する事前学習手法を提案し、下流のダイナミクス予測や模倣学習で有効性を示した。
- 手先内での物体の6D姿勢到達を学習するマニピュレーション2026/9/12
把持した物体を指の協調動作で手のひら基準の目標6D姿勢へ移動させる強化学習フレームワークPOISEを提案し、シミュレーションと実機で有効性を示した。
- 生成動画プランをシミュレーションで接地し多様な器用操作コントローラを実現マニピュレーション2026/9/9
生成された手と物体のインタラクション動画をシミュレーションで接地し、多様な把持や操作を実行できる器用なロボットハンドコントローラを学習する手法を提案。
- Dex-X: シミュレーションによるインタラクションを用いた人間のビデオからの視覚-触覚器用操作学習マニピュレーション2026/9/7
人間のビデオデモから、シミュレーションで触覚情報を補完し、視覚と触覚を統合した器用な操作ポリシーを学習するフレームワークを提案。実機へのゼロショット転送を達成した。
- R2S-Eval: 視覚言語モデルによる実機からシミュレーションへのキャリブレーションを用いたロボット評価評価2026/9/3
ロボット操作ポリシーの評価を、実機からシミュレーションへのキャリブレーションと視覚言語モデルによる選好評価を組み合わせて行うパイプラインを提案し、実機評価の不安定性やコストを低減する。
- BoxTwin: ビデオから弾塑性関節物体の動力学を学習する変形物体操作2026/7/1
ビデオから弾塑性関節物体の動力学を学習するデジタルツインフレームワークを提案し、手動折りたたみや双腕操作実験で長期的な塑性変形挙動を正確に再現した。
- エージェント型Real2Sim:視覚言語エージェントによる物理ベースの世界モデリングsim2real2026/7/1
ロボットと物体の相互作用の実世界記録を、物理シミュレーション可能な双子モデルに自動変換するフレームワークを提案。視覚言語エージェントが幾何・物理パラメータ・軌道などを自律的に推定し、剛体操作から変形物体、人型動作までを統一的に扱う。
- 物理誘導残差ダイナミクスによる変形物体シミュレーションの学習シミュレーション2026/7/1
物理ベースと学習ベースを組み合わせたハイブリッドな変形物体シミュレーション手法を提案し、実世界の多様な物体で精度を向上させた。
- FTP-1: 触覚センサを横断する接触リッチ操作のための汎用基盤触覚ポリシー触覚/基盤モデル2026/6/1
多様な触覚センサとロボット構成に対応する初の汎用基盤触覚ポリシーFTP-1を提案し、約3000時間のデータで事前学習して未見センサへの転移を実証した。
- UniLab: GPU中心パラダイムを超えたロボット強化学習のためのヘテロジニアスアーキテクチャ強化学習/システムアーキテクチャ2026/5/1
CPUシミュレーションとGPU学習を分離したヘテロジニアスな強化学習システムUniLabを提案し、GPUシミュレーションに依存せずに3〜10倍の学習効率向上を実証した。
- DexEMG: EMG2Pose汎化による器用な遠隔操作システムの実現遠隔操作2026/3/1
表面筋電位(sEMG)とMoCapグローブのデータから手の動きを予測するEMG2Poseを学習し、ロボットハンドへのリアルタイムリターゲティングを組み合わせた軽量で低コストな遠隔操作システムを提案した。
- RL強化テレオペレーションと巧みな専門家混合VLAによる人間らしい操作の実現VLA/巧緻操作/触覚2026/3/1
高自由度の両手巧緻操作を可能にするため、RLで訓練した原子スキルによるデータ収集支援と、触覚・力覚を統合したVLAアーキテクチャを提案し、接触を伴う複雑タスクで成功率を2倍に向上させた。
- ManipulationNet:物理的スキル課題と身体化マルチモーダル推論を備えた実世界ロボット操作のベンチマーク基盤ベンチマーク2026/3/1
実世界のロボット操作タスクを標準化されたハードウェアキットと統一ソフトウェアクライアントで提供し、物理スキルと身体化推論の2トラックで評価する持続可能なベンチマーク基盤を提案した。
- Tacmap: 幾何学的に一貫した貫入深さマップによる触覚のsim-to-realギャップの橋渡し触覚2026/2/1
体積的な貫入深さに基づく高忠実・高効率な触覚シミュレーションを提案し、シミュレーションと実世界を共通の変形マップ表現で統合することで触覚のsim-to-realギャップを低減、実機へのゼロショット転移を実現した。
- ガウススプラッティングによる軟体相互作用のReal-to-Simロボット方策評価sim2real2025/11/1
実世界の動画から軟体のデジタルツインを構築し、3Dガウススプラッティングでフォトリアルに描画するReal-to-Sim評価フレームワークを提案。ぬいぐるみ詰め込みやロープ通しなどの変形操作タスクで、シミュレーション結果が実機性能と強く相関することを示した。
- 空間的に固定された触覚認識による堅牢な巧みな操作触覚2025/10/1
触覚信号を手の運動学的座標系に固定して扱うことで、物体モデルや姿勢推定なしにサブミリ精度の巧みな操作を可能にする方策フレームワークSaTAを提案した。
- ViTacFormer:視触覚クロスモーダル表現による巧みなマニピュレーションマニピュレーション2025/6/1
視覚と触覚をクロスアテンションで融合し、将来の触覚信号を予測する自己回帰ヘッドを備えた表現学習手法を提案。多指ハンドの模倣学習に応用し、実世界タスクで成功率を約50%向上させ、11段階・2.5分の長期的操作を自律遂行した。
- RGB-D動画から変形可能物体モデルを学習する粒子-グリッドニューラルダイナミクス変形可能物体モデリング2025/6/1
粒子と空間グリッドを組み合わせたハイブリッド表現で、ロボットと物体の相互作用を撮影したRGB-D動画から、ロープや布などの変形可能物体のダイナミクスを学習し、モデルベース計画に応用する手法を提案。
- PhysTwin: 動画からの物理情報に基づく変形可能物体の再構成とシミュレーションsim2real2025/3/1
動的物体の少数視点動画から、ばね-質量モデルとガウシアンスプラッティングを組み合わせて物理的にリアルなデジタルツインを再構成し、リアルタイム対話型シミュレーションやロボット動作計画を可能にするフレームワーク。
- グラフベース神経力学モデリングのための動的3Dガウシアントラッキングsim2real2024/10/1
多視点RGB動画から3Dガウシアン表現とグラフニューラルネットワークを用いて物体の力学モデルを学習し、ロボット動作に条件付けられた将来予測や操作計画を可能にするフレームワークを提案。
- AdaptiGraph: 材料適応型グラフベースニューラルダイナミクスによるロボットマニピュレーションマニピュレーション2024/7/1
物理特性が未知の多様な変形可能物体に対し、グラフニューラルネットワークによる動力学モデルを数ショットで適応させ、予測と操作を可能にする手法を提案。
- スパース失敗ガイダンスとロボット連鎖思考による操作スキルの学習マニピュレーション2024/5/1
VLMを用いてタスクをサブタスクに分解し、より細かい報酬ガイダンスと自己模倣学習でロボットの操作スキルを効率的に学習させる手法を提案した。
- Self-Supervised Geometric Correspondence for Category-Level 6D Object Pose Estimation in the Wild2022/10/1