当前位置:首页 > 文章列表 > Golang > Go问答 > Go fuzz 测试的 seed corpus 怎么保留可复现输入

Go fuzz 测试的 seed corpus 怎么保留可复现输入

来源:17golang原创 2026-09-10 09:44:28 0浏览 收藏

Go fuzz 测试想要稳定复现,关键不是保存某次 fuzz 运行产生的全部文件,而是把“可提交的 seed corpus”和“本机生成的 fuzz corpus”分开。少量固定样例可以写进 F.Add,需要长期保留的失败输入放到 testdata/fuzz/FuzzX$GOCACHE/fuzz 下的生成输入则只用于继续探索。这样换机器、跑 CI 或只执行 go test 时,输入集合仍然可预期。

要点速览
  • F.Addtestdata/fuzz/FuzzX 都属于默认会执行的 seed corpus。
  • 真正修复过的失败输入应提交到仓库;生成 corpus 留在 fuzz 缓存中,不要整包纳入版本控制。
  • 种子参数类型必须与 F.Fuzz 的 fuzz 参数一致,目标函数还要尽量快速、确定。
要保留可复现输入,就提交少量能代表边界和已修复缺陷的 seed;不要把一次长时间 fuzz 产生的全部缓存误当成回归测试集。

先分清 F.Add、testdata 和生成缓存

原生 fuzz 有三类容易混淆的输入。F.Add 是测试代码中的固定样例;testdata/fuzz/FuzzX 是与具体 fuzz 函数绑定的文件样例;fuzz 引擎在运行中为了扩大覆盖率产生的输入,会写到构建缓存中的 fuzz 目录。前两者会在普通测试中作为 seed corpus 执行,缓存里的生成输入主要服务于继续 fuzz。

来源是否默认执行适合怎么处理
F.Add少量、清晰、稳定的初始边界样例
testdata/fuzz/FuzzX已确认的回归输入,随代码提交
$GOCACHE/fuzz仅 fuzz 探索使用临时生成物,按缓存管理
package parser

import "testing"

func FuzzParseLine(f *testing.F) {
    // 只放少量有代表性的固定输入,避免把随机样本伪装成回归资产。
    f.Add("name=value")
    f.Add("=")
    f.Add("")

    f.Fuzz(func(t *testing.T, line string) {
        // fuzz 目标要快速且确定;失败时 t 记录的输入可继续沉淀为种子。
        _, _ = ParseLine(line)
    })
}
Go testing.F、F.Add、testdata fuzz 目录与 GOCACHE fuzz 生成缓存的静态关系图
图1:区分代码种子、目录种子和生成缓存,才能决定哪些输入应随仓库保存。

用 F.Add 建立最小可复现入口

F.Add 必须写在 F.Fuzz 之前,传入参数的类型和数量也要与 fuzz 目标一致。它适合放几条读者一眼能理解的边界:空字符串、最短合法格式、分隔符缺失或已经修复过的最小样例。不要把每次随机运行得到的输入都复制进来,否则测试会变慢,种子的意图也会消失。

func FuzzParsePair(f *testing.F) {
    // 种子类型必须和下面的 string 参数对应,样例保持可读并可复查。
    f.Add("left:right")
    f.Add(":right")

    f.Fuzz(func(t *testing.T, input string) {
        // 这里验证“不应 panic”的契约,不依赖时间、网络或共享可变状态。
        if err := ParsePair(input); err != nil {
            t.Logf("输入未通过解析:%q,错误:%v", input, err)
        }
    })
}

普通执行 go test 时,固定种子会被跑一遍;只有使用匹配的 -fuzz 参数时,测试才会在这些种子基础上继续变异。要复查某个 fuzz 测试,可以先用 go test -run=^FuzzParsePair$,把问题限定在固定输入,减少“这次没复现”的干扰。

失败输入如何变成长期回归样例

帮助读者理解失败输入、持久化 corpus 文件与 go test 回放之间的静态依赖。
图2:把已确认的失败输入落到对应 corpus 目录,再由普通测试和 fuzz 探索分别消费。

当 fuzz 发现失败输入并且你已经修复了代码,不要只依赖本机缓存。把该输入作为对应 fuzz 测试的 corpus 文件保存在 testdata/fuzz/FuzzParsePair/。文件由 Go 的 corpus 格式承载,目录名必须和 fuzz 函数名对应;这样 CI 的普通 go test 也能再次执行它。

# 先只回放固定 seed,确认修复没有依赖长时间随机探索。
go test -run='^FuzzParsePair$' ./...

# 再给 fuzz 一个有限时长,继续寻找新的覆盖路径。
go test -fuzz='^FuzzParsePair$' -fuzztime=30s ./...

提交前建议把失败样例缩到仍能触发问题的最小输入,并在代码审查里说明它覆盖的边界。修复后的 corpus 是回归资产,不等于测试已经覆盖所有变体;它只负责固定曾经失败的那一个输入,后续探索仍需要合理的 fuzz 时间和目标约束。

一份不容易失控的 corpus 检查清单

检查项通过标准
命名目录名与 fuzz 函数一致,样例能说明输入边界
稳定性目标不依赖当前时间、网络顺序或共享全局状态
体积只提交初始样例和已确认回归输入,不提交整个 fuzz 缓存
CI先用 go test -run 回放,再按需要安排 -fuzztime

相关问题

F.Add 和 testdata/fuzz 需要二选一吗?

不需要。两者都会进入 seed corpus;通常把少量通用样例写进 F.Add,把已修复的失败输入放进目录,便于审查和长期积累。

为什么只跑 go test 也会执行 fuzz 函数?

未开启随机 fuzz 时,Go 仍会用固定种子调用 fuzz 目标,所以普通测试可以承担回归检查;它不会替你完成持续变异探索。

可以把 GOCACHE/fuzz 提交到 Git 吗?

不建议。那是引擎维护的生成 corpus,体积和内容会随运行变化。应挑出能复现且已经修复的问题输入,转成对应的持久化 seed。

Fuzz 目标里能调用 F.Add 吗?

不能把它当作运行期追加入口。F.Add 应在调用 F.Fuzz 前完成;进入 fuzz 目标后使用 *testing.T 记录失败。

把 seed corpus 当成“稳定输入契约”管理,Go fuzz 才能同时承担探索和回归两种职责:固定样例负责可复现,目录文件负责保存已修复缺陷,生成缓存负责继续寻找新路径。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
PHP readonly 属性赋值失败时怎么判断初始化位置PHP readonly 属性赋值失败时怎么判断初始化位置
上一篇
PHP readonly 属性赋值失败时怎么判断初始化位置
Go 类型集合中的近似元素符号怎么影响底层类型匹配
下一篇
Go 类型集合中的近似元素符号怎么影响底层类型匹配
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    61次使用
  • SuperCLUE中文大模型评测基准:功能、能力维度与应用指南
    SuperCLUE
    SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
    216次使用
  • C-Eval中文评测基准:大语言模型多学科能力评估指南
    C-Eval
    深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
    145次使用
  • AI Prompt Library:免费AI提示词库,助力ChatGPT高效创作与营销
    AI Prompt Library
    探索AI Prompt Library免费资源库,涵盖营销、写作及多场景AI提示词。兼容ChatGPT、Claude等工具,一键复制优化输出,提升工作效率。
    79次使用
  • Generrated:DALL·E 2/3 AI绘画提示词灵感库与图像对比平台
    Generrated
    Generrated汇集9300+张DALL·E生成图像及对应提示词,支持查看完整图集、对比DALL·E 2与3版本差异,是AI绘图新手学习Prompt设计与获取创作灵感的实用工具。
    55次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码