Yichi Zhang
ByteDance
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EgoTools: 実世界の一人称視点動画における道具中心の推論に向けて一人称視点/道具使用推論2026/9/30
道具を使う一人称視点動画の大規模データセット(100時間)と、知覚・幾何・手順・因果推論を問う1,000問のベンチマークを構築し、既存の動画マルチモーダルモデルが道具使用の理解に苦戦することを示した。
- SimLife:長期的な人間とエージェントの協調のためのパターン理解長期記憶・パターン理解2026/9/17
家庭生活を長期シミュレーションするSimLifeを構築し、数週間〜数ヶ月の観察から潜在的な行動規則を推論する能力を評価するベンチマークSimLife-BPを提案した。
- PRM-as-a-Judge 1.5: ロボットプロセス評価のためのツールキット評価指標2026/8/14
ロボットの動作動画から詳細な進捗曲線を生成し、失敗側の進捗や回復能力、成功側の実行品質など複数の細かい指標を導出する評価ツールキットを提案した。
- Orca:世界は心の中にある世界モデル2026/6/29
Orcaは、マルチモーダルな世界信号から統一された世界潜在空間を学習し、テキスト生成・画像予測・身体動作生成などの下流タスクを軽量デコーダで実現する世界基盤モデルである。
- UniTacVLA: 視覚言語行動モデルにおける統合触覚理解と予測触覚/操作2026/6/1
接触を伴う器用な操作のために、触覚信号を動的な相互作用の手がかりとして扱い、現在の触覚状態と将来の接触変化を統合的にモデル化するフレームワークを提案。触覚連鎖思考と粗密な将来触覚予測により状態・動態を考慮した事前知識を構築し、実時間と予測触覚を組み合わせた混合制御で高精度な操作を実現。
- LACE: クロスエンボディメント学習のための潜在視覚表現視覚表現学習2026/5/1
人間とロボットの視覚表現を潜在空間で整列させるフレームワークを提案し、ロボットのデモデータが少ない場合でも人間のデモデータを活用できるようにした。
- SafetyALFRED:マルチモーダル大規模言語モデルの安全意識計画の評価VLA/安全性評価2026/4/1
SafetyALFREDは、ALFREDベンチマークに6種類のキッチン危険を追加し、マルチモーダル大規模言語モデルの危険認識と能動的なリスク軽減計画を評価する。実験では、QA設定での認識は高いが、身体化計画での緩和成功率が低いというギャップを示し、身体化文脈での是正行動を重視するベンチマークへの転換を提唱する。
- FocusVLA: 視覚言語行動モデルにおける視覚情報の焦点化VLA2026/3/1
VLAモデルの性能が視覚表現の質ではなく視覚情報の活用方法に制限されることを示し、注意をタスク関連領域に集中させるFocusVLAを提案した。
- ロボット制御に必要なのはピクセルモーション拡散であるVLA2025/9/1
高レベルな運動意図と低レベルなロボット動作をピクセルモーション表現で橋渡しする拡散モデルベースの統合フレームワークDAWNを提案し、CALVINやMetaWorldで高性能を示すとともに実機への転移も実証した。
- AimBot: 視覚運動ポリシーの空間認識を高める簡易補助視覚キューVLA2025/8/1
多視点RGB画像に照準線とスコープを重ねてエンドエフェクタの状態を明示し、視覚運動ポリシーの性能を向上させる軽量な視覚拡張手法を提案。
- Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond2023/10/1
- DANLI: Deliberative Agent for Following Natural Language Instructions2022/10/1