Sicheng Xu
収録論文 3本 ・ フィジカルAI/ロボット学習
タスク推論VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- TaskGround: 全シーン家庭内推論のための構造化実行可能タスク推論タスク推論2026/5/1
家庭内エージェントが完全なシーンと状況依頼から実行可能なタスク構造を推論するための、訓練不要でモデル非依存のフレームワークを提案し、新評価スイートFullHomeで効果を実証した。
- 実生活の人間活動動画を用いたロボットマニピュレーション向け視覚-言語-行動モデルのスケーラブル事前学習VLA2025/10/1
人間の手の日常動画を自動解析してロボットのVLA学習データに変換し、100万エピソード規模のデータセットでモデルを事前学習することで、未知環境でのゼロショット性能と実機微調整時の成功率・汎化性能を向上させた。
- CogACT: 認知と行動を融合するロボット操作のための基盤的視覚-言語-行動モデルVLA2024/11/1
VLMの出力を条件とする専用の拡散行動トランスフォーマーを組み込んだ新しいVLAアーキテクチャを提案し、ロボット操作の成功率と汎化性能を大幅に向上させた。