详细介绍
MMBench简介
MMBench是一个综合性的多模态基准测试平台,由上海人工智能实验室携手南洋理工大学、香港中文大学、新加坡国立大学及浙江大学的研究团队共同发布。该基准旨在通过从感知到认知的逐级细分,对模型的20项细粒度能力进行全面评估。其数据集包含约3000道单项选择题,源自互联网及权威基准库。与传统基于规则匹配选项的评测方式不同,MMBench采用循环打乱选项的策略来验证输出结果的一致性,并利用ChatGPT精准匹配模型回复与选项,从而确保评估的准确性。涵盖视觉问答、图像描述生成等多种任务类型,MMBench基于多维度指标为模型提供全方位的性能画像。其公开的排行榜直观展示了各模型的表现,有助于研究者和开发者把握多模态技术的发展现状,进而推动领域内的技术创新。

MMBench核心功能
- 细粒度能力拆解:将多模态能力划分为感知、推理等多个维度,针对每个维度定制相关问题,实现对模型细粒度能力的深度评估。
- 海量多模态数据:提供约3000个多项选择题,覆盖20种能力维度,支持在多样化场景下对模型性能进行充分测试。
- 创新评估机制:引入“循环评估”策略,通过多次循环推理检验模型的稳定性,有效降低噪声干扰,确保评估结果更加可靠。
- 双语环境支持:提供英文和中文版本的数据集,能够评估模型在不同语言环境下的理解与处理能力。
- 数据可视化展示:支持对数据样本进行可视化处理,帮助用户更直观地理解数据结构及具体内容。
- 官方评估套件:提供VLMEvalKit工具,支持对多模态模型进行标准化评估,并可提交测试结果以获取准确率数据。
- 基准排名系统:通过排行榜展示不同模型在MMBench数据集上的性能表现,为研究人员提供有价值的参考依据。

MMBench使用教程
- 环境依赖安装:首先需安装必要的工具和库。MMBench官方推荐使用其评估工具VLMEvalKit。可通过以下命令完成安装:
pip install vlmevalkit- 获取数据集:访问MMBench官方GitHub仓库:https://github.com/open-compass/mmbench/下载数据集。根据实际需求选择VLMEvalKit格式或Legacy格式。例如,下载MMBench-Dev数据集:
wget <Download Link (VLMEvalKit)> -O MMBench_DEV_EN.zip
unzip MMBench_DEV_EN.zip- 数据加载与预览:利用VLMEvalKit提供的脚本加载并查看数据样本。示例代码如下:
from vlmeval.dataset import ImageMCQDataset
from vlmeval.smp import mmqa_display
# 加载 MMBench 开发集
dataset = ImageMCQDataset('MMBench_DEV_EN')# 查看第 0 个样本
dataset.display(0)# 构建多模态提示
item = dataset.build_prompt(0)print(item)- 执行模型推理:使用您的多模态模型对数据集进行推理。以下是使用
llava_v1.5_7b模型进行推理的示例命令:
python run.py --model llava_v1.5_7b --data MMBench_DEV_EN --mode infer- 运行结束后,推理结果将保存为Excel文件,例如:
llava_v1.5_7b/MMBench_DEV_EN.xlsx。
- 运行结束后,推理结果将保存为Excel文件,例如:
- 性能评估:使用VLMEvalKit对模型的预测结果进行评估。该工具将依据MMBench标准计算准确率等各项指标。
- 提交评测结果:
- 若需在MMBench领先榜上提交结果,请遵循以下步骤:
- 使用测试集数据进行推理,生成预测结果文件(如
llava_v1.5_7b/MMBench_TEST_EN.xlsx)。 - 登录MMBench领先榜页面上传预测结果文件。
- 系统将自动计算并展示模型在各能力维度上的具体表现。
- 若需在MMBench领先榜上提交结果,请遵循以下步骤:
MMBench应用场景
- 模型效能评估:MMBench提供全面的多模态基准测试平台,能够对视觉语言模型在不同任务及能力维度上的表现进行精细化评估,帮助研发人员清晰识别模型的优势与不足,指明优化方向。
- 学术研究辅助:研究人员可利用MMBench数据集进行新型模型的开发与验证,促进多模态技术前沿领域的探索与研究。
- 工业落地应用:在企业环境中,MMBench有助于评估和筛选适合特定产品的多模态模型,确保所选模型在实际应用中具备足够的性能与稳定性,从而提升产品的市场竞争力。
- 教育教学资源:作为优质的教学资源,MMBench帮助学生和研究人员深入理解多模态模型的评估方法及应用场景,通过实践项目和课程练习增强对多模态技术的掌握与应用能力。
- 跨领域融合应用:MMBench的多模态数据集覆盖文化、科学、医疗等多个领域。例如,CCBench(中国文化相关基准测试)可专门评估模型在特定文化背景下的表现,助力文化研究与跨文化交流的发展。
查看更多
最新文章
tuozi工具箱下载安装安全吗?下载来源、版本字段与包名核对
从产品站入口、Android 支持范围、包名和开发者字段出发,说明 tuozi 工具箱安装前如何核对来源
冷白星尘手机壁纸用微粒密度控制OLED夜景层次
用深色底、冷白星尘和稀疏高光做一组适合OLED锁屏的手机壁纸,重点说明微粒密度、主体位置、留白和纵向裁切
Go tls.Config复用后修改字段造成并发数据竞争的处理
Go tls.Config可以并发复用,但传给TLS函数后不得继续修改。本文说明只读快照、Clone浅复
动漫岛网页端和APP怎么选?追番列表、离线下载与弹幕提醒说明
动漫岛产品站同时展示网页端导航和APP功能。本文按页面可见信息梳理搜索、今日新更、追番列表与移动端离线下
租赁设备归还延期时如何保留押金、验收和责任节点
设备归还延期后不要覆盖原归还日期,应新增延期确认单,分别记录设备状态、验收结果、押金结算和责任事项。本文
Go os.ReadDir按文件名排序并限制目录批量读取的实现
Go 目录读取要同时处理排序、批量和内存边界:os.ReadDir 适合一次读取并按文件名排序,File

