Haochen Zhang
Carnegie Mellon University
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 文脈的観察者接地:視覚言語モデルにおける状況的空間推論の評価VLA/空間推論2026/9/7
ロボットなどの身体化タスクで、話者の視点に基づく空間関係の理解を評価するベンチマークPOVBenchを構築し、最新の視覚言語モデルが文脈から観察者の視点を推論して対象を特定できるかを検証した。
- 統合ロボット学習に向けて:表現、視覚言語行動、世界モデルの橋渡しサーベイ2026/9/3
ロボット学習における表現学習、VLAモデル、世界モデルの3つのパラダイムを統一的に整理し、それらの相互作用と課題を分析したサーベイ論文。
- 平坦性が視覚言語行動モデルの指示追従を維持するVLA2026/6/1
視覚言語行動モデルの微調整時に平坦性を保つ最適化を適用し、指示無視の失敗を大幅に改善した。
- ロボット操作における帰納的一般化マニピュレーション2026/6/1
視覚運動ポリシーの一般化能力を、従来の分布内シフトではなく、より困難な分布外タスク変種で評価する「帰納的一般化」プロトコルを提案し、既存のVLAモデルがこのテストに失敗することを示した論文。
- FAST-EQA: グローバル・ローカル領域関連性を活用した効率的な身体性質問応答身体性質問応答2026/2/1
質問に関連する領域を特定して探索を効率化し、視覚メモリ上のChain-of-Thought推論で高速に回答する身体性質問応答フレームワークを提案。
- SORT3D: 大規模言語モデルを用いたゼロショット3Dグラウンディングのための空間オブジェクト中心推論ツールボックス3Dグラウンディング2025/4/1
2Dの物体属性とヒューリスティックな空間推論ツールボックスをLLMの逐次推論能力と組み合わせ、テキスト-3Dデータなしで未知環境にゼロショット適用できる3Dグラウンディング手法を提案。
- IRef-VLA: 不完全な言語指示を用いた3Dシーンにおける対話的参照グラウンディングのベンチマークVLA2025/3/1
不完全・曖昧な自然言語指示で3D屋内をナビゲートするタスク向けに、11.5Kの3Dスキャン部屋と470万件の参照文を含む大規模ベンチマークデータセットを構築し、既存モデルの性能評価基盤を提供した。
- VLA-3D: 3D意味理解とナビゲーションのための大規模データセットナビゲーション2024/11/1
屋内3Dシーンにおける言語指示ナビゲーション向けに、11.5K以上のスキャン済み部屋、2350万の物体間意味関係、970万の参照文を含む最大規模の実世界データセットを構築し、最先端モデルのベースライン性能を評価した。