Go Scanner 遇到超长日志返回 token too long 怎么办
用 bufio.NewScanner 逐行读日志时,如果某一行超过默认缓冲,循环会提前结束,随后 scanner.Err() 返回 bufio.Scanner: token too long。偶发的长行可以在第一次 Scan 前调用 Scanner.Buffer;如果日志行大小不可控,则应改用 bufio.Reader 分片读取。
- 默认最大 token 缓冲是 64 KiB,实际可用上限还可能需要容纳换行符。
Buffer必须放在循环前;第二个参数是字节上限,不是字符数。- 超大且不可预测的单行,用
Reader.ReadLine逐片拼接更容易控制内存和错误。
为什么 Scanner 会在超长日志上报错
Scanner 默认使用 ScanLines,一个 token 通常就是一整行。标准库的 MaxScanTokenSize 是 64 * 1024,因此一行 JSON、堆栈或压缩字段只要超过这个范围,Scan 就会返回 false,错误要到 Err 才能看到。
这里有个容易漏掉的细节:扫描停止后并不会自动从超长行恢复。不要只看循环结束就当作正常 EOF,也不要在同一个 Scanner 上继续调用 Scan 期待它跳过坏行。
日志行大小可估计时,先调大 Scanner.Buffer
如果业务能给日志行设定上限,例如最大约 2 MiB,继续用 Scanner 会更简单。缓冲设置必须位于第一次 Scan 之前;初始缓冲可以小一些,第二个参数决定 Scanner 最多扩容到多少字节。
package main
import (
"bufio"
"fmt"
"io"
"strings"
)
func scanLog(r io.Reader) error {
scanner := bufio.NewScanner(r)
// 预留常见行大小,并把单行硬上限设为 2 MiB。
scanner.Buffer(make([]byte, 64*1024), 2*1024*1024)
for scanner.Scan() {
// Text 会复制当前 token,适合交给不会长期持有的处理函数。
fmt.Println(len(scanner.Text()))
}
// Scan=false 可能是 EOF,也可能是 token 太大或底层读取失败。
return scanner.Err()
}
func main() {
// 这里只构造输入示意;生产代码通常传入打开的日志文件。
if err := scanLog(strings.NewReader("small line\n")); err != nil {
fmt.Println("read log:", err)
}
}
不要把第二个参数随手写成很大的数来“保证不报错”。它是单个 token 的内存上限,面对外部输入时应结合日志格式、并发量和进程内存预算设置;超过业务上限的行,最好明确记录并拒绝或转入异常处理。

单行大小不可控时,改用 Reader 分片读取

官方文档把 bufio.Reader 推荐给需要更大 token 或更细错误控制的程序。ReadLine 返回一段内容和 isPrefix 标记;标记为 true 时说明这一行还没结束。每次读取后立刻 append 到自己的切片,避免下一次读操作覆盖 Reader 的内部缓冲。
package main
import (
"bufio"
"errors"
"fmt"
"io"
)
func readLongLines(r io.Reader, handle func([]byte) error) error {
reader := bufio.NewReaderSize(r, 64*1024)
var line []byte
for {
fragment, isPrefix, err := reader.ReadLine()
if err != nil {
// 没有换行的最后一行会在前一次调用中返回;这里仅处理真正的结束。
if errors.Is(err, io.EOF) {
return nil
}
return err
}
// ReadLine 的片段只在下一次读取前有效,这里必须复制到自有切片。
line = append(line, fragment...)
if isPrefix {
continue
}
if err := handle(line); err != nil {
return err
}
// 复用容量,减少连续长行带来的重复分配。
line = line[:0]
}
}
func printLine(line []byte) error {
// 这里按完整行处理,也可以改成流式解析 JSON 或字段。
fmt.Println(len(line))
return nil
}
这个方案仍然可能在业务处理阶段保留一整行,所以“分片读取”不等于“永远零内存增长”。如果连完整行都不应进入内存,就在拿到每个片段时直接做增量解析,并设计跨片段的状态机;如果只是不想受 Scanner 的固定 token 上限影响,以上写法已经足够。
上线前按行大小和内存预算选方案
| 场景 | 建议 | 重点检查 |
|---|---|---|
| 行大小有明确上限 | Scanner.Buffer | 设置在首次 Scan 前;max 用字节计算 |
| 偶发大行但需要完整文本 | Reader.ReadLine 拼接 | 复制片段,并限制业务侧累计长度 |
| 输入可能恶意膨胀 | Reader 分片加硬上限 | 超限时停止接收,避免无界 append |
| 只需解析字段,不必保留整行 | Reader 分片增量解析 | 维护跨片段状态,正确处理换行和 EOF |
排查时先确认错误来源:只有 scanner.Err() 明确是 token too long,才需要调整 token 策略;如果是文件权限、网络读取或自定义 SplitFunc 错误,盲目增大 Buffer 不会解决根因。另一个常见坑是保存 scanner.Bytes() 的切片后继续 Scan:它可能在下一次扫描时被覆盖,需要长期保存时复制一份。
常见问题
Scanner.Buffer 的 max 写成 2*1024*1024 就一定能读 2 MiB 吗?
不一定。token 还要容纳分隔符等额外字节,实际可用大小可能略小;把 max 当作安全上限,而不是精确的正文长度。
可以在 Scan 返回 false 后重新调用 Buffer 吗?
不建议。Buffer 必须在扫描开始前调用;扫描已经开始后调用会触发 panic。应在创建 Scanner 后立即完成配置。
为什么不直接把 Scanner 换成 ReadString?
ReadString 更直接,但同样会把分隔符前的数据组成一个字符串。若行长不可控,使用 ReadLine 的片段标记,或直接做增量解析,更容易设置内存上限。
仓储盘点出现差异时先核对哪些入库出库记录
- 上一篇
- 仓储盘点出现差异时先核对哪些入库出库记录
- 下一篇
- 珊瑚橙日落海面手机壁纸怎么安排顶部留白
-
- Golang · Go问答 | 31分钟前 |
- Go database/sql 查询上下文取消后为什么还占连接
- 416浏览 收藏
-
- Golang · Go问答 | 45分钟前 | 连接池 · 故障排查 · database/sql · Go问答 · 资源释放 · Go 数据库连接池 QueryContext rows.Close Rows.Err sql.Rows
- Go sql.Rows 忘记 Close 为什么连接池逐渐耗尽
- 386浏览 收藏
-
- Golang · Go问答 | 56分钟前 |
- Go bufio.Writer 忘记 Flush 为什么文件内容不完整
- 103浏览 收藏
-
- Golang · Go问答 | 1小时前 | 容器 Go 文件权限 os.OpenFile umask
- Go os.OpenFile 权限参数在容器里为何看起来无效
- 366浏览 收藏
-
- Golang · Go问答 | 1小时前 | 并发 · Go问答 · atomic.Value · Go atomic.Value 并发初始化 配置快照
- Go atomic.Value 首次 Store 与 Load 前初始化有什么区别
- 314浏览 收藏
-
- Golang · Go问答 | 1小时前 | go · race detector · 并发排查 ·
- Go race detector 没报错但数据仍不一致该查什么
- 479浏览 收藏
-
- Golang · Go问答 | 2小时前 |
- Go RWMutex 读锁升级为写锁为什么会死锁
- 120浏览 收藏
-
- Golang · Go问答 | 2小时前 |
- Go Mutex 复制后为什么解锁异常
- 189浏览 收藏
-
- Golang · Go问答 | 2小时前 |
- Go sync.WaitGroup 如何用计数快照避免 Add 竞态
- 441浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 104次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 18次使用
-
- OpenCompass
- OpenCompass是上海AI实验室推出的开源大模型评测平台,提供CompassKit、CompassHub和CompassRank三大核心组件,支持LLM及多模态模型的一站式标准化评估与排行榜查询。
- 31次使用
-
- AGI-Eval
- AGI-Eval是由上海交大等高校联合发布的大模型评测社区,提供公正透明的LLM能力榜单、多领域评测集及Data Studio数据服务,助力AI模型性能评估与NLP科研开发。
- 20次使用
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 257次使用
-
- 用Nginx反向代理部署go写的网站。
- 2023-01-17 502浏览
-
- GoLand调式动态执行代码
- 2023-01-13 502浏览
-
- Go select 用 time.After 做超时有什么资源代价
- 2026-09-10 501浏览
-
- Go 取 range 变量地址为什么得到重复指针
- 2026-09-07 501浏览
-
- Go net.Conn 写入超时为何仍会卡住:SetWriteDeadline、部分写入与连接复用检查
- 2026-08-30 501浏览

