Minghui Hou
収録論文 1本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MMDrive: マルチ表現融合による視覚を超えた対話的シーン理解VLA2025/12/1
占有マップ・LiDAR点群・テキスト記述を統合し、質問に応じて適応的に融合する自動運転向けマルチモーダル視覚言語モデルを提案。DriveLMとNuScenes-QAで高精度を達成。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
占有マップ・LiDAR点群・テキスト記述を統合し、質問に応じて適応的に融合する自動運転向けマルチモーダル視覚言語モデルを提案。DriveLMとNuScenes-QAで高精度を達成。