Zifan Wang
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboGesture: 人間型ロボットのためのリアルタイム意味整合型共話ジェスチャ生成ヒューマノイド/ジェスチャ生成2026/8/27
人間型ロボットが音声に同期し意味的に適切なジェスチャをリアルタイム生成するフレームワークを提案。データセット構築、モデル設計、安全制御を統合し、実機で検証した。
- SOLO: 安定した全地形・長距離知覚ヒューマノイド歩行歩行2026/8/27
長距離歩行で累積する知覚・制御誤差による不安定化を解決するため、地形再構成の鮮明化と時間的クレジット割り当てを改善した統合フレームワークを提案。シミュレーションと実機で高い成功率を達成した。
- MotionWAM: 実時間ヒューマノイド移動操作のための基盤ワールドアクションモデルヒューマノイド/移動操作2026/6/1
本論文は、ビデオワールドモデルの中間特徴を利用して、単一の行動空間で全身動作を予測する実時間ヒューマノイド移動操作モデルMotionWAMを提案し、実機で高い成功率を達成した。
- 知覚行動基盤モデル:人間の動作プリエントをロボット中心の地形に適応させるヒューマノイド制御2026/6/1
人間の動作データを基盤としたヒューマノイド制御モデルを、ロボットの周囲地形に適応させるフレームワークを提案。地形に合わせた参照動作を合成し、教師-学生学習で実ロボットに展開する。
- UniLab: GPU中心パラダイムを超えたロボット強化学習のためのヘテロジニアスアーキテクチャ強化学習/システムアーキテクチャ2026/5/1
CPUシミュレーションとGPU学習を分離したヘテロジニアスな強化学習システムUniLabを提案し、GPUシミュレーションに依存せずに3〜10倍の学習効率向上を実証した。
- GS-Playground: 視覚に基づくロボット学習のための高スループット写実的シミュレータシミュレーション2026/4/1
3Dガウススプラッティングと並列物理エンジンを統合した高速写実シミュレータを開発し、視覚ベースの強化学習を大規模に加速する。
- DiT4DiT: ビデオダイナミクスと行動の統合モデリングによる汎用ロボット制御VLA2026/3/1
ビデオ生成と行動予測を統合したエンドツーエンドのVideo-Actionモデルを提案し、シミュレーションと実機で高い成功率とサンプル効率を達成した。
- MeshMimic: 3Dシーン再構成による幾何学認識型ヒューマノイド動作学習ヒューマノイド/動作生成/sim2real2026/2/1
動画から3Dシーンと人間の動きを再構成し、地形との接触を保ったままヒューマノイドロボットの動作を学習させるフレームワークを提案。
- 効率的なUAV軌道予測:マルチモーダル深層拡散フレームワークUAV軌道予測2026/2/1
LiDARとミリ波レーダーの点群を双方向クロスアテンションで融合し、UAVの軌道予測精度をベースライン比40%向上させた研究。
- SparScene: スパースグラフ学習による大規模交通シーン表現と軌道生成の効率化軌道予測2025/12/1
車線グラフのトポロジーを利用してエージェント間・エージェント-地図間のスパースな接続を構築し、軽量なグラフエンコーダで大規模交通シーンの軌道生成を高速かつ高効率に実現した研究。
- FGGS-LiDAR: 3DGSモデルからLiDARへ超高速GPUシミュレーションsim2real2025/9/1
事前学習済み3DGSアセットをメッシュ化し、GPU加速レイキャスティングで500FPS超のLiDARシミュレーションを実現するフレームワークを提案。
- 生LiDAR点群から直接制御する人型ロボットの安全で快適な歩行ポリシー歩行2025/8/1
生のLiDAR点群を直接モータ指令に変換するエンドツーエンド歩行ポリシーを提案し、制約付きMDPと制御バリア関数を組み合わせて安全性を保証、快適性報酬で人間に配慮した動きを実現、実機へ転移した。
- DISCOVERSE: 複雑で高忠実度な環境における効率的なロボットシミュレーションsim2real2025/7/1
3DガウススプラッティングとMuJoCoを組み合わせ、実世界の複雑な環境を高精細に再現してロボット学習を行うオープンソースのReal2Sim2Realシミュレーションフレームワークを提案し、模倣学習におけるゼロショットSim2Real転移で最先端性能を示した。
- GLOVER++:人間の行動からアフォーダンス学習を解き放ちロボットマニピュレーションへマニピュレーション2025/5/1
50万枚のアフォーダンス注釈付き大規模データセットHOVA-500Kを構築し、人間のデモからロボット操作へアフォーダンス知識を転移するグローバル・トゥ・ローカル学習フレームワークGLOVER++を提案した。
- 未見タスクへの汎化に挑む視覚-言語-行動マニピュレーションの限界探索VLA2025/5/1
VLAモデルのクロスタスク汎化を評価する新ベンチマークAGNOSTOSを提案し、文脈内デモンストレーションで未見タスクの行動を予測するX-ICM手法を導入した。
- 全方位知覚:動的環境における脚式移動のための全方向衝突回避歩行2025/5/1
生のLiDAR点群を直接処理して3D空間認識と全方向衝突回避を実現する脚式ロボットのエンドツーエンド移動ポリシーを提案し、高忠実度LiDARシミュレータで訓練して実環境でも検証した。
- MobileH2R: スケーラブルな合成データのみから移動ロボットへの汎化可能な人間からの受け渡しを学習sim2real2025/1/1
シミュレータ上で生成した多様な合成全身人間動作データと4D模倣学習を用い、実世界のデモなしに移動ロボットが人間から物体を受け取る汎化可能なスキルを学習するフレームワークを提案した。
- GLOVER: タスク指向把持のための汎用オープン語彙アフォーダンス推論マニピュレーション2024/11/1
大規模言語モデルを微調整してRGB画像から把持可能な部位のアフォーダンスを推論し、実世界で高速・高精度にタスク指向把持を実現するフレームワークを提案。
- 選好整合拡散プランナによる四足歩行制御歩行2024/10/1
報酬ラベルなしの専門家データで拡散プランナをオフライン学習し、弱い選好ラベリングを用いたオンライン強化学習でロバスト性を高め、四足歩行の速度追従と実機ゼロショット転移を実現した。
- ロボット操作のための視覚事前学習における人間-ロボットドメインギャップの緩和マニピュレーション2024/6/1
人間とロボットのペア動画を用いたコントラスティブ学習で、人間の活動データで事前学習した視覚モデルをロボット領域に適応させ、操作タスクの成功率を向上させた研究。
- 言語指示に基づくマルチタスクロボット操作のための対照的模倣学習模倣学習2024/6/1
言語指示と視覚観察から多様な操作タスクを実行するエンドツーエンド模倣学習エージェントSigma-Agentを提案し、対照的学習とマルチビューTransformerで性能を向上させた。
- 車輪脚ロボットの移動操作のためのアーム制約付きカリキュラム学習移動操作2024/3/1
車輪脚ロボットにマニピュレータを搭載し、アーム制約付き強化学習と報酬対応カリキュラム学習で動的把握タスクを実現した。
- GenH2R: Learning Generalizable Human-to-Robot Handover via Scalable Simulation, Demonstration, and Imitation2024/1/1