Ke Yang
Harbin Institute of Technology (Shenzhen)
収録論文 4本 ・ フィジカルAI/ロボット学習
動画理解VLAsim2real歩行
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ShallowStream: 浅い層で索引し、深い層で答えるストリーミング動画理解動画理解2026/9/2
動画ストリーミング理解の計算コストを削減するため、MLLMの浅い層でフレームの索引を構築し、質問時には浅い層の注意スコアで関連フレームを選択して深い層で回答するフレームワークを提案した。
- 自由形式の言語でヒューマノイドを操作する:統一動作語彙を持つ大規模言語行動モデルVLA2025/11/1
自然言語コマンドをヒューマノイドの全身動作に直接変換する大規模言語行動モデルHumanoid-LLAを提案し、人間とヒューマノイドの動作語彙を統合して物理的安定性を確保した。
- DexCtrl: 適応的コントローラ学習によるsim-to-real器用さの実現sim2real2025/5/1
軌道とコントローラの履歴から行動と制御パラメータを同時に学習し、実行中に制御パラメータを自動調整することで、手動調整なしにシミュレーションから実機への転移ギャップを軽減する枠組みを提案した。
- DreamPolicy:スケーラブルなヒューマノイド歩行のための統合ワールドモデルポリシー歩行2025/5/1
拡散ベースの地形認識ワールドモデルとオフラインデータを統合し、単一のポリシーで未知の複合地形へのゼロショット転移を実現したヒューマノイド歩行フレームワーク。