据站长之家 12 月 22 日报道,近期的 Gemini-Pro 评测报告显示其在多模态领域取得了显著的进展,与 GPT-4V 不相上下,甚至在某些方面表现更为出色。首先,在多模态专有基准 MME 上的综合表现中,Gemini-Pro 以 1933.4 的高分超越了 GPT-4V,展现出在感知和认知方面的全面优势。
其次,在 37 个视觉理解任务中,Gemini-Pro 在文本翻译、颜色/地标/人物识别、OCR 等任务中表现突出,而 GPT-4V 在名人识别任务上得分为 0。在高级认知、挑战性视觉任务和各种专家能力领域,Gemini-Pro 展现了强大的视觉感知和理解能力,但在位置识别任务上表现都不佳。
领取专属 10元无门槛券
私享最新 技术干货