Yuhao Dong
収録論文 7本 ・ フィジカルAI/ロボット学習
一人称視点/道具使用推論ロボット知覚ベンチマーク3DグラウンディングVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EgoTools: 実世界の一人称視点動画における道具中心の推論に向けて一人称視点/道具使用推論2026/9/30
道具を使う一人称視点動画の大規模データセット(100時間)と、知覚・幾何・手順・因果推論を問う1,000問のベンチマークを構築し、既存の動画マルチモーダルモデルが道具使用の理解に苦戦することを示した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- 3EED: あらゆる場所のあらゆるものを3Dでグラウンディング3Dグラウンディング2025/11/1
車・ドローン・四足歩行ロボットのRGBとLiDARデータを統合した大規模3D視覚グラウンディングベンチマークを構築し、クロスプラットフォーム評価手法を提案した。
- イベントカメラによる視覚的グラウンディングVLA2025/9/1
イベントカメラデータを用いた言語駆動型物体グラウンディングのための大規模ベンチマークTalk2Eventを構築し、動的環境でのマルチモーダル知覚を可能にした。
- Talk2Event: イベントカメラによる動的シーンの言語接地理解VLA2025/7/1
イベントカメラの非同期ストリームを言語と結びつける大規模ベンチマークTalk2Eventを構築し、属性を考慮した接地フレームワークEventReferを提案した。
- VLMは自動運転に本当に使えるのか?信頼性・データ・評価指標の観点からの実証研究VLA2025/1/1
自動運転向けVLMの信頼性を17設定・約2万フレームで評価するベンチマークDriveBenchを構築し、VLMが視覚ではなく一般知識やテキスト手がかりに依存しがちであることを明らかにした。
- Octopus: Embodied Vision-Language Programmer from Environmental Feedback2023/10/1