Kui Jia
The Chinese University of Hong Kong, Shenzhen
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- TaskAnchor: 長期的マニピュレーションのための反応型VLAにおけるタスク状態の接地VLA2026/9/20
視覚的に似た観測でも実行段階によって行動が異なる「タスク状態の曖昧さ」を解消するため、実行履歴に基づく軽量アダプタTaskAnchorを提案し、VLAの成功率を大幅に向上させた。
- VLBiMan++: 視覚言語アンカーによるワンショット両腕マニピュレーションの汎化境界の拡張マニピュレーション2026/9/13
単一の人間デモンストレーションから両腕ロボットの操作スキルを抽出し、視覚言語に基づく幾何適応で再学習なしに多様なタスク・物体・環境・機体へ汎化させるフレームワークを拡張した。
- ViTacPhys: 人間の視覚・触覚デモから物体の物理特性を推定し適応的把持を実現するフレームワーク把持/物理特性推定/視覚触覚融合2026/8/21
人間の操作デモから物体の質量・摩擦係数・剛性を推定し、その物理特性に基づいてロボットの把持ポリシーを適応させる視覚・触覚融合フレームワークを提案した。
- Vid2WAM: ビデオ拡散事前知識を世界行動モデルへ蒸留するVLA2026/8/1
大規模ビデオ基盤モデルの拡散事前知識を、コンパクトな世界行動モデル(WAM)に蒸留するフレームワークを提案。専門家デモに依存せず、タスク条件付き未来予測と逆動力学モデルによる擬似行動を活用し、限られたデモでも新規タスクへの汎化とデータ効率を向上させる。
- RoboSynChallenge: 合成操作スキルの一般化による実世界の巧みな操作の習得操作/ベンチマーク2026/8/1
実世界データ不足を補うため、大規模合成データ生成と標準化された実ロボット評価を統合した操作ポリシーの一般化を競うベンチマークを提案し、未見の実環境での評価を行う。
- Dexterity-BEV: 3D世界と行動の整合による汎用ロボットポリシー学習操作学習2026/6/1
2D基盤モデルの限界を克服するため、カメラ校正と深度を用いて2D入力を3D頂点マップに変換し、BEV座標系で入力と行動を整合させることで、視点変化に頑健で汎用的な操作ポリシーを学習する手法を提案した。
- 反応から予測へ:エージェント型タスクグラフによるロボット操作の予防的障害回復マニピュレーション2026/5/1
操作タスクを有向タスクグラフでモデル化し、実行前に予測的リカバリ分岐を追加することで、障害発生時に再計画なしで即座に対応するエージェントシステムAgentChordを提案した。
- EVA: 逆動力学報酬による実行可能ロボット行動へのビデオ世界モデル整合世界モデル2026/3/1
ビデオ生成モデルをロボットの世界モデルとして使う際、生成映像が物理的に実行可能な行動に変換されるよう、逆動力学モデルを報酬として強化学習で整合させる手法を提案した。
- PAct: 部分分解による単視点関節物体生成関節物体生成2026/2/1
単一画像から関節物体を部分ごとに分解し、形状・構成・関節運動を生成するフィードフォワード手法を提案。
- 実世界の一例から双腕操作の大規模デモンストレーションを合成するフレームワークマニピュレーション2025/12/1
実世界の1つのデモンストレーションから、接触の多い双腕操作タスクの多様で実行可能なデモを大量に合成する手法を提案し、新規物体姿勢や形状への汎化、クロスエンボディメント転移を実現した。
- 進化を受け入れよ:身体と制御の共設計による具現化ヒューマノイドロボットの提案ヒューマノイド/共設計2025/10/1
ヒューマノイドロボットの制御と身体構造を共設計する枠組みを提唱し、その方法論や応用、課題を議論したポジションペーパー。
- ヒューマノイドの脳と身体の協調設計:転倒復帰のための制御と形態の同時最適化ヒューマノイド/協調設計2025/10/1
制御方策と身体形態を反復的に同時最適化するフレームワークRoboCraftを提案し、7種の公開ヒューマノイドで平均44.55%の性能向上を達成した。
- BiNoMaP: カテゴリーレベルの両腕非把持マニピュレーションプリミティブの学習マニピュレーション2025/9/1
一人称視点の動画から両腕の非把持動作(押す・つつく・回す・包むなど)を抽出し、幾何学的に最適化してカテゴリーレベルの汎化と異なるロボットへの転移を可能にするRL不要のフレームワークを提案。
- ImaginationPolicy:汎化可能で高精度かつ信頼性の高いロボットマニピュレーションのためのエンドツーエンド方策マニピュレーション2025/9/1
ロボット操作のための新しい行動表現「Chain of Moving Oriented Keypoints (CoMOK)」を提案し、エンドツーエンドで学習可能な汎化・高精度・信頼性の高い操作方策を実現した。
- VLBiMan: 視覚言語基盤による一発実演からの汎化可能な両腕ロボット操作マニピュレーション2025/9/1
人間の1回の実演をタスク分解して不変スキルを抽出し、視覚言語モデルで環境変化に適応させることで、再学習なしに多様な両腕操作タスクへ汎化するフレームワークを提案。
- SignBot: 人とヒューマノイド間の手話インタラクションを学習するヒューマノイド/手話インタラクション2025/5/1
手話データをロボットの動作に変換し、学習ベースの制御と生成モジュールを組み合わせて、ヒューマノイドロボットが手話で人と自然にコミュニケーションできるフレームワークを提案した。
- 生成的スキル獲得のための身体性推論のリアルタイム検証VLA2025/5/1
身体性エージェントのスキル学習に検証モデルを導入し、手動の報酬設計なしで高密度報酬を自動生成するVERGSAを提案。タスク成功率を21%向上させた。
- GAT-Grasp: ジェスチャー駆動型アフォーダンス転移によるタスク指向ロボット把持マニピュレーション2025/3/1
人間の手ジェスチャーを手がかりに、大規模な人間-物体インタラクション動画から把持知識を検索・転移し、未知物体や雑然とした環境でもタスクに適した把持姿勢をゼロショットで生成するフレームワーク。
- HWC-Loco:階層型全身制御による堅牢なヒューマノイド歩行歩行2025/3/1
ヒューマノイドの歩行制御をロバスト最適化問題として定式化し、安全性と目標追従のトレードオフを階層型ポリシーで動的に解決する手法を提案。多様な地形・機体・タスクで優れた性能を示した。
- 衝突を考慮した微分可能ロボットレンダリングsim2real2025/3/1
微分可能レンダリングにニューラル衝突分類器を組み込み、静的環境や自己との衝突を避ける行動最適化を可能にした。Eikonal正則化で勾配を安定化し、既存フレームワークに統合可能。
- 一度の教示で両腕ロボット操作を学習:動画デモからのワンショット模倣模倣学習2025/1/1
人間の両手動作を1回のステレオ動画から抽出し、両腕ロボットの多様な長期的タスクを学習する手法YOTOを提案。
- W-PoseNet: Dense Correspondence Regularized Pixel Pair Pose Regression2019/12/1