Zekun Qi
Tsinghua University
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboGesture: 人間型ロボットのためのリアルタイム意味整合型共話ジェスチャ生成ヒューマノイド/ジェスチャ生成2026/8/27
人間型ロボットが音声に同期し意味的に適切なジェスチャをリアルタイム生成するフレームワークを提案。データセット構築、モデル設計、安全制御を統合し、実機で検証した。
- HumanTracker:人間の知覚に整合した包括的なモーション追跡ベンチマークモーション追跡2026/8/1
ヒューマノイドのモーション追跡評価を人間の知覚に整合させ、大規模化するためのベンチマークと評価指標を提案した論文。
- DeformGen: 変形操作ポリシー学習のための動力学に基づくトポロジー拡張変形操作2026/6/1
変形物体の操作学習において、物理的に妥当な状態と軌道を生成する動力学ベースのデータ拡張フレームワークを提案した。
- LIMMT: モーショントラッキングには少ない方が良いモーショントラッキング2026/6/1
物理ベースのヒューマノイドモーショントラッキングにおいて、データ品質(物理的実現可能性、多様性、複雑さ)に基づいてデータを選別することで、全データセットの3%未満のデータでより良い追跡性能を達成できることを示した初のデータ中心的研究。
- ImageWAM: 世界行動モデルは本当にビデオ生成が必要か、それとも画像編集だけで十分か?VLA2026/6/1
ビデオ生成に依存する世界行動モデル(WAM)の課題を指摘し、代わりに画像編集モデルを利用したImageWAMを提案。推論時に画像編集のKVキャッシュを行動予測に活用し、計算コストを大幅削減しつつ性能を向上させた。
- Humanoid-GPT: データと構造のスケーリングによるゼロショット動作追跡全身制御2026/6/1
大規模な動作コーパスで事前学習したGPTスタイルのTransformerを用いて、人型ロボットの全身制御とゼロショット動作追跡を実現した論文。
- 前方・逆動力学の事前学習分離によるロボット学習の非絡み合い化VLA2026/4/1
視覚と言語・行動の予測を分離し、前方動力学モデルと逆動力学モデルを別々に事前学習してから統合するフレームワークDeFIを提案し、CALVINやSimplerEnvなどのベンチマークで最先端性能を達成した。
- 不完全な人間のモーションデータから学ぶアスリート級ヒューマノイドテニススキルヒューマノイド/模倣学習/sim2real2026/3/1
不完全な人間のテニス動作断片からヒューマノイドがテニススキルを学習し、実機で人間とラリーを続けられるようにするシステムを提案した。
- VLA-JEPA:潜在世界モデルで視覚-言語-行動モデルを強化VLA2026/2/1
未来のフレームを教師信号に使い、現在の観測だけから潜在空間で状態予測を学習するJEPA型事前学習で、VLAポリシーの汎化とロバスト性を高めた。
- ReWorld: 身体性ワールドモデルのための多次元報酬モデリングワールドモデル2026/1/1
ロボット学習向け動画ベースのワールドモデルを、物理的忠実性・タスク論理・身体性・視覚品質の多次元報酬で強化学習により人間の選好に整合させるフレームワークを提案。
- Switch-JustDance:家庭用ゲーム機で全身運動追従コントローラを評価するベンチマーク全身制御ベンチマーク2025/11/1
Nintendo Switchの『Just Dance』を利用し、ゲーム内の振り付けをロボットの動作に変換して、ヒューマノイドの全身制御コントローラを実機で評価する低コストで再現可能なベンチマーク手法を提案した。
- MM-Nav: マルチビューVLAモデルによるマルチエキスパート学習を用いた堅牢な視覚ナビゲーションVLA2025/10/1
360度視野のマルチビューVLAモデルを強化学習エキスパートのデータから教師あり学習し、到達・すり抜け・回避の能力を統合して実世界でも汎化する視覚ナビゲーションを実現した。
- DreamVLA: 包括的な世界知識を夢見る視覚-言語-行動モデルVLA2025/7/1
動的・空間・意味情報を統合した世界知識予測により逆動力学モデリングを行い、知覚-予測-行動ループを実現する新しいVLAフレームワークを提案。
- DexVLG: 大規模巧みな視覚-言語-把持モデルマニピュレーション2025/7/1
単視点RGBD入力から言語指示に沿った巧みな手の把持姿勢を予測する大規模モデルを提案し、1.7億の把持データで学習してゼロショット汎化性能を実証した。
- SoFar: 言語に基づく物体の向きが空間推論と物体操作を橋渡しするVLA2025/2/1
自然言語で物体の向きを定義する「意味的向き」を導入し、大規模データセットとゼロショット予測モデルを構築して、6自由度の空間推論とロボット動作生成を可能にした。