Chaoyang Zhao
Institute of Automation, Chinese Academy of Sciences
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ワールドモデルからワールドアクションモデルへ:次状態予測の再考VLA2026/9/28
次状態の表現をRGBや単一特徴に固定せず、視覚・意味・幾何・相互作用の複数投影を動的にサンプリングして統合学習するCF-WAMを提案し、人間とロボットの経験を共有遷移学習に活かして制御性能と汎化を向上させた。
- 物体中心条件付けによる視覚運動フローマッチングマニピュレーション2026/9/21
シーンを物体ごとの意味特徴と空間手がかりに分離し、フローマッチング方策の条件付けに用いることで、視覚的妨害や位置ずれに頑健なマニピュレーションを実現した。
- 時間的強制:視覚・言語・行動モデルのための4D表現アライメントVLA2026/8/31
VLAモデルに履歴パスを導入し、4D基盤モデルの幾何特徴と整列させることで、時間情報を活用した操作性能を向上させた。
- Mind-VLA: 指示認識型空間表現アライメントによる視覚言語行動モデルVLA2026/8/1
言語指示で指定された対象物体の3D幾何に焦点を当て、VLAモデルの表現をアライメントする手法を提案。LIBEROやCALVINで高精度を達成し、実ロボットの遮蔽タスクでも大幅な性能向上を示した。
- HarnessWAM:世界行動モデルにおける予測と熟考の橋渡しVLA2026/8/1
世界行動モデル(WAM)の予測と実行のギャップを埋めるエージェントフレームワークを提案。視覚言語モデルによるタスク管理とイベント駆動の二重タイムスケールフィードバックで、複雑なタスクの計画・実行・失敗回復を実現する。
- E-TTS:ロボット操作のための新しい具現化テスト時スケーリングフレームワークマニピュレーション2026/6/1
ロボット操作タスクにおいて、推論と行動の両方を履歴情報を活用して反復的に洗練する、モジュール式でプラグアンドプレイなテスト時スケーリングフレームワークを提案した。
- UniBYD: 人間の模倣を超えた多様なロボットハンドの操作学習のための統合フレームワークマニピュレーション2025/12/1
ロボットと人間の身体差を超え、多様なロボットハンド形態に適応する操作方策を強化学習で獲得する統合フレームワークUniBYDを提案。動的PPOと影エンジンにより人間模倣を超えた適応的探索を実現。
- LightPlanner:軽量LLMの推論能力を引き出すタスクプランナータスク計画2025/3/1
軽量な大規模言語モデルでも複雑なタスク計画をこなせるよう、パラメータ化された関数呼び出しと階層的深層推論、記憶モジュールを組み合わせたプランナーを提案し、専用データセットで1.5Bモデルを訓練した。
- PhysVLM: 視覚言語モデルにロボットの物理的可到達性を理解させるVLA2025/3/1
ロボットの可到達性を汎用的に表現するS-Pマップを導入し、それを視覚言語モデルに組み込むことで、実環境での embodied 推論精度を向上させた研究。