Go bufio.Scanner只返回前一部分内容的上限排查
Go 里用 bufio.Scanner 按行读取日志,前面的短行正常,遇到一条很长的 JSON 或堆栈信息后,后面的内容就像“只返回前一部分”。先不要截取字符串补救:很多时候是 Scan() 已经停止,而代码没有检查 scanner.Err()。如果单个 token 确实超过默认上限,应在第一次调用 Scan() 前设置 Buffer;如果输入可能大到无法设置合理上限,则换用 bufio.Reader。
Scanner的限制针对单个 token,不是整个文件大小;默认最大缓冲约为 64 KiB,换行等分隔内容也可能占用空间。Buffer必须在第一次Scan()前调用,第二个参数是硬上限,单位是字节。- 每次扫描结束都要检查
Err();超大 token、底层读取错误和业务提前停止不能混为一谈。
先确认是不是 Scanner 提前停止
Scan() 返回 false 时,可能是正常到达 EOF,也可能是 token 太大或底层 Reader 报错。只读取 Text() 并不能判断原因。把错误检查放在循环之后,先把“读到一半”变成可以定位的结果:
package main
import (
"bufio"
"fmt"
"strings"
)
func readLines(input string) error {
scanner := bufio.NewScanner(strings.NewReader(input))
for scanner.Scan() {
// 每次 Scan 成功才读取当前 token,避免使用失效的中间状态。
fmt.Println(scanner.Text())
}
// false 既可能是 EOF,也可能是 token 太大或底层读取失败。
if err := scanner.Err(); err != nil {
return fmt.Errorf("扫描输入失败: %w", err)
}
return nil
}
如果长行之后循环结束,并且 Err() 返回类似 bufio.Scanner: token too long 的错误,根因就是单个 token 超出可用缓冲。没有错误则优先检查调用方是否在循环中主动 break,或是否把一条记录误当成了多条输入。

在第一次 Scan 前提高单个 token 上限
对“绝大多数行不长,偶尔有一条几百 KiB”的日志,仍然可以使用 Scanner。关键是提前设置一个符合业务边界的最大值,而不是无限制地把缓冲调大:
package main
import (
"bufio"
"fmt"
"io"
)
func scanLargeLines(r io.Reader) error {
scanner := bufio.NewScanner(r)
// 初始缓冲服务于常见行;最大值限制单行内存,单位是字节。
scanner.Buffer(make([]byte, 64*1024), 2*1024*1024)
for scanner.Scan() {
line := scanner.Bytes()
// 当前 token 只在下一次 Scan 前使用,需长期保存时应复制它。
fmt.Printf("收到 %d 字节\n", len(line))
}
// 上限之外的行会让扫描停止,不能把部分 token 当成完整记录。
if err := scanner.Err(); err != nil {
return fmt.Errorf("读取长行失败: %w", err)
}
return nil
}
Buffer 的第二个参数是单个 token 的最大字节数,不是“先读多少字节”。设置为 2 MiB 后,超过这个值的单行仍会失败;初始缓冲写成 64 KiB 也不会把每一行都预分配成 2 MiB。这个组合通常比盲目使用超大初始切片更稳妥。
用字节边界而不是字符感觉来定 max
Scanner 的缓冲和 len 都以字节计。中文、Emoji 或混合编码文本的字符数与字节数并不相同,配置上限时应以输入协议中的最大字节长度为准。如果一行最多允许 512 KiB,就把上限写成 512*1024,并为分隔符和解析后的结构预留合理余量。
| 现象 | 先看什么 | 处理方式 |
|---|---|---|
| 扫描在长行处停止 | scanner.Err() | 提高 Buffer 的 max,或拒绝超限记录 |
| 只有多字节文本更容易失败 | 输入的字节数而非字符数 | 按协议字节上限配置,不按字符数猜测 |
| 单行可能极大且不能设硬上限 | 是否需要分片处理 | 改用 bufio.Reader 的 ReadString、ReadBytes 或 ReadLine |
还要注意,默认的 ScanLines 会去除行尾换行,并且最后一行即使没有换行也会返回。因而“没有末尾换行”不是长内容只返回一部分的充分证据。

超大记录改用 Reader,避免把内存上限伪装成修复
官方文档明确提示,Scanner 在 token 太大时会不可恢复地停止;需要更强错误控制或处理大 token 时,应考虑 bufio.Reader。例如用 ReadString('\n') 可以得到一整行和错误,但要考虑超大行会形成较大的字符串;用 ReadLine 则可以按片段接收,并根据 isPrefix 逐步拼接。
生产代码的选择可以按这个顺序:有清晰单行上限就用 Scanner 加 Buffer;输入大小不可控但可以拒绝超限记录,就保留 max 并记录指标;必须处理任意长记录,就用 Reader 分片,同时限制累计内存、记录长度和取消条件。不要只删除 Err() 检查,否则失败会被误报为“文件读完”。
常见问题
Buffer 应该在循环里调用吗?
不应该。它应在第一次 Scan() 之前调用;扫描开始后再改缓冲不会修复已经开始的读取过程。
把 max 设置成文件大小就一定安全吗?
不一定。文件大小只是总量,Scanner 约束的是单个 token。更合理的做法是依据协议限制单行,并配合拒绝、指标和资源预算。
Scanner.Bytes() 返回的内容能长期保存吗?
不能直接依赖。下一次扫描可能复用缓冲;需要异步处理或跨循环保存时,复制这段字节,或者使用 scanner.Text() 形成独立字符串。
排查这类问题的最短路径是:先看 Scan() 是否结束,再看 Err(),然后按单个 token 的字节边界选择 Buffer 或 Reader。这样既能恢复合理长度的日志行,也不会用无限增大的缓冲掩盖输入协议问题。
Java Stream并行收集器保持结果顺序的设计
- 上一篇
- Java Stream并行收集器保持结果顺序的设计
- 下一篇
- Python sqlite3事务提交与异常回滚的上下文写法
-
- Golang · Go问答 | 51分钟前 |
- Go io.Copy遇到短写但无错误时的写入语义说明
- 145浏览 收藏
-
- Golang · Go问答 | 1小时前 | go · 数据校验 · Go compress/gzip close ErrChecksum gzip.Reader
- Go gzip.Reader读取完整后仍需Close的原因与实践
- 229浏览 收藏
-
- Golang · Go问答 | 1小时前 |
- Go zip.File.Open未关闭导致压缩条目资源滞留的排查
- 149浏览 收藏
-
- Golang · Go问答 | 1小时前 | go ·
- Go tar.Header.Name包含相对路径时的安全判断方法
- 253浏览 收藏
-
- Golang · Go问答 | 1小时前 |
- Go filepath.Clean不能阻止路径越界时的防护边界
- 265浏览 收藏
-
- Golang · Go问答 | 2小时前 |
- Go 文件跨盘迁移采用临时文件加校验的实现方案
- 115浏览 收藏
-
- Golang · Go问答 | 2小时前 |
- Go os.Stat跟随符号链接导致文件类型判断偏差的处理方案
- 350浏览 收藏
-
- Golang · Go问答 | 2小时前 | 错误处理 · go · 文件读取 · Go 文件权限 os.ReadFile PathError
- Go os.ReadFile遇到权限错误时的定位顺序
- 472浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- PubMedQA
- 深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
- 135次使用
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 200次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 146次使用
-
- HELM
- 深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
- 125次使用
-
- CMMLU
- 深入了解CMMLU中文评估基准,涵盖67个学科主题,提供数据集下载、Zero-shot/Five-shot评估方法及排行榜,助力优化中文语言模型性能。
- 111次使用
-
- Go微服务项目配置文件的定义和读取示例详解
- 2023-01-08 298浏览
-
- Go HTTP 客户端超时实战:别让默认 Client 拖垮 goroutine
- 2026-06-04 205浏览
-
- Go HTTP 响应体忘记关闭:连接占用与 Goroutine 增长的排查修复
- 2026-07-13 201浏览
-
- Go JSON 严格解码上线后请求变 400:DisallowUnknownFields 的兼容性故障复盘
- 2026-07-26 174浏览
-
- Go iter.Pull 怎么安全消费迭代器:停止时机、资源释放与 goroutine 泄漏排查
- 2026-08-26 423浏览

