Redis HyperLogLog用近似结构估算去重计数的实现方法
做日活、活动触达人数或设备去重时,直接把每个用户 ID 放进 Redis Set 很直观,但内存会随成员数增长,而且跨天、跨分片合并时还要处理大量明细。Redis HyperLogLog 用固定上限的概率结构保存基数估计:官方文档给出的标准误差是 0.81%,最坏约占 12 KB。它适合“人数趋势”和“覆盖规模”这类允许小误差的指标,不适合订单金额、余额或必须列出成员的业务。
官方地址:https://redis.io/docs/latest/develop/data-types/probabilistic/hyperloglogs/
PFADD写入观测值,PFCOUNT读取近似去重数。- 多个分片不能直接相加,应使用
PFMERGE处理交集重复。 - 0.81% 是标准误差,不是每一次结果都保证正负 0.81%。
先把 HyperLogLog 的适用边界定清楚
Set 保存真实成员,能回答“这个用户是否出现过”和“列出全部成员”;HyperLogLog 只保留用于估算基数的内部状态,不能反查具体用户。两者的选择取决于结果用途:如果报表只需要“约有多少个独立访客”,HLL 可以用很小且稳定的空间换取近似结果;如果要导出名单、做精确风控或按成员删除,就必须保留明细结构。
| 需求 | 推荐结构 | 原因 |
|---|---|---|
| 统计独立访客规模 | HyperLogLog | 空间上限稳定,读取基数方便 |
| 判断成员并导出名单 | Set | 保留真实元素 |
| 订单、余额、结算 | 精确数据表 | 不能接受统计误差 |

用 PFADD 和 PFCOUNT 完成单个周期的去重估算
实践中可以按日期或业务维度拆 key,例如 uv:20260920。同一个用户在同一个 HLL 中重复写入不会按成员列表累加;PFADD 返回 1 只表示内部寄存器发生了变化,返回 0 不等同于“这个值一定已经被精确记录”。读取时使用 PFCOUNT:
# 用日期隔离统计窗口;同一用户重复出现仍由 HLL 近似去重
PFADD uv:20260920 user:1001 user:1002 user:1001
# 读取当前窗口的近似独立用户数
PFCOUNT uv:20260920
# 返回值是近似基数,不要把它当成用户明细或精确财务数字
工程上要先统一输入口径:同一个用户应先映射为稳定的业务 ID,不能今天写手机号、明天写设备临时 ID,否则统计的是不同实体。日期 key 也要配合过期策略或归档策略,避免业务已经结束但 key 永久增长。
多分片合并要用 PFMERGE,不能直接相加
假设上午和下午、华东和华南各有一个 HLL,两个集合可能包含同一批用户。直接把两个 PFCOUNT 相加,会把重复用户算两次。PFMERGE 会把多个 HLL 的内部状态合并到目标 key,再由 PFCOUNT 读取整体近似值:
# 两个来源各自记录用户,不在应用层保存成员明细
PFADD uv:morning user:1001 user:1002 user:1003
PFADD uv:evening user:1002 user:1004
# 目标 key 独立保存合并结果,避免覆盖来源窗口
PFMERGE uv:all uv:morning uv:evening
# 结果应接近 4,而不是两个局部计数的简单相加
PFCOUNT uv:all
官方命令参考把单 key 的 PFCOUNT 标为平均常数时间,把多 key 统计和 PFMERGE 标为随 key 数量增长的操作。因此分片很多时,更稳妥的方式是按小时或批次合并到固定的汇总 key,而不是每次请求都把所有历史 key 作为参数传入。源 key 与目标 key 还应采用明确命名,避免把不同口径的用户 ID 混在一起。

上线前用误差和业务结果做最后判断
HyperLogLog 的“0.81%”应理解为长期统计意义上的标准误差,不能拿一次小样本的输出反推固定误差上下限。上线前可以保留一小段低流量样本,用 Set 或离线精确集合做对照,观察趋势和误差是否满足业务容忍度;生产主链路仍使用 HLL,避免为全量流量保存明细。
- 能接受近似:UV、去重设备数、内容覆盖人数、活动触达规模。
- 不能接受近似:扣款、库存、积分、审计清单、需要按成员删除的集合。
- 要注意合并:统一用户标识、周期口径和 key 命名,先合并再计数。
常见问题
HyperLogLog 能查询某个用户是否存在吗?
不能。它保存的是估算基数所需的状态,不提供成员枚举和可靠的单成员查询;需要这类能力时选择 Set 或明细存储。
PFADD 返回 0 是不是说明用户重复?
只能说明这次写入没有改变内部寄存器,不能把它当成精确的成员存在性证明。业务判断应以基数指标为主。
多个 HyperLogLog 可以直接把 PFCOUNT 相加吗?
不建议。来源之间存在重复时会重复计数;用 PFMERGE 合并后再 PFCOUNT,结果仍是近似值但口径正确。
LibTV适不适合多镜头AI视频制作?先看四个控制点
- 上一篇
- LibTV适不适合多镜头AI视频制作?先看四个控制点
- 下一篇
- Go 泛型约束为切片算法定义最小约束的实践方案
-
- 数据库 · Redis | 2小时前 |
- Redis Pub/Sub重连后恢复订阅关系的实现方法
- 309浏览 收藏
-
- 数据库 · Redis | 3小时前 |
- Redis Pipeline区分批量发送与命令执行错误的实现方法
- 354浏览 收藏
-
- 数据库 · Redis | 5小时前 | Redis · redis maxmemory maxmemory-policy evicted_keys INFO stats
- Redis 内存淘汰变更策略后观察淘汰计数的实现方法
- 223浏览 收藏
-
- 数据库 · Redis | 7小时前 | 数据安全 · 性能排查 · appendfsync AOF重写 BGREWRITEAOF Redis AOF Redis持久化 Redis延迟排查
- Redis AOF理解重写期间的磁盘与延迟的实现方法
- 218浏览 收藏
-
- 数据库 · Redis | 4天前 |
- Redis Cluster key slot用 CRC16 解释跨槽排查的实现方法
- 436浏览 收藏
-
- 数据库 · Redis | 4天前 | Redis · 脚本 · lua · eval Redis Lua redis.call redis.pcall
- Redis Lua 脚本返回结构化状态码避免业务歧义的实现方法
- 493浏览 收藏
-
- 数据库 · Redis | 4天前 | redis zset 游标分页 Sorted Set ZRANGEBYSCORE Redis分页
- Redis ZSET 分页用游标实现稳定范围分页的实现方法
- 440浏览 收藏
-
- 数据库 · Redis | 4天前 | Redis · BCAST 客户端缓存 Prefix Redis CLIENT TRACKING
- Redis CLIENT TRACKING用 BCAST 接收客户端缓存失效通知的实现方法
- 361浏览 收藏
-
- 数据库 · Redis | 4天前 |
- Redis 客户端连接池 timeout 与命令执行超时如何区分
- 340浏览 收藏
-
- 数据库 · Redis | 4天前 | Redis · 故障排查 · 内存优化 · redis 内存排查 INFO memory MEMORY DOCTOR MEMORY STATS
- Redis MEMORY DOCTOR 输出如何转成排查顺序
- 277浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- PubMedQA
- 深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
- 124次使用
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 196次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 141次使用
-
- HELM
- 深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
- 114次使用
-
- CMMLU
- 深入了解CMMLU中文评估基准,涵盖67个学科主题,提供数据集下载、Zero-shot/Five-shot评估方法及排行榜,助力优化中文语言模型性能。
- 102次使用
-
- Redis Stream XTRIM 如何避免消费组积压无限增长
- 2026-09-12 501浏览
-
- Redis AOF rewrite 期间如何判断磁盘与内存压力
- 2026-09-12 501浏览
-
- Redis RDB 和 AOF 怎么按可接受数据丢失量选择
- 2026-09-08 501浏览
-
- Redis XAUTOCLAIM 之后为什么仍有 pending:JUSTID、PEL 与消息删除边界
- 2026-08-29 501浏览
-
- Redis SET 的 GET 与 KEEPTTL 怎么一起验收:旧值返回、续期与回滚边界
- 2026-08-20 501浏览

