当前位置:首页 > 文章列表 > Golang > Go问答 > Go Scanner 遇到超长日志返回 token too long 怎么办

Go Scanner 遇到超长日志返回 token too long 怎么办

来源:17golang原创 2026-09-12 16:59:41 0浏览 收藏

bufio.NewScanner 逐行读日志时,如果某一行超过默认缓冲,循环会提前结束,随后 scanner.Err() 返回 bufio.Scanner: token too long。偶发的长行可以在第一次 Scan 前调用 Scanner.Buffer;如果日志行大小不可控,则应改用 bufio.Reader 分片读取。

要点速览
  • 默认最大 token 缓冲是 64 KiB,实际可用上限还可能需要容纳换行符。
  • Buffer 必须放在循环前;第二个参数是字节上限,不是字符数。
  • 超大且不可预测的单行,用 Reader.ReadLine 逐片拼接更容易控制内存和错误。

为什么 Scanner 会在超长日志上报错

Scanner 默认使用 ScanLines,一个 token 通常就是一整行。标准库的 MaxScanTokenSize64 * 1024,因此一行 JSON、堆栈或压缩字段只要超过这个范围,Scan 就会返回 false,错误要到 Err 才能看到。

这里有个容易漏掉的细节:扫描停止后并不会自动从超长行恢复。不要只看循环结束就当作正常 EOF,也不要在同一个 Scanner 上继续调用 Scan 期待它跳过坏行。

日志行大小可估计时,先调大 Scanner.Buffer

如果业务能给日志行设定上限,例如最大约 2 MiB,继续用 Scanner 会更简单。缓冲设置必须位于第一次 Scan 之前;初始缓冲可以小一些,第二个参数决定 Scanner 最多扩容到多少字节。

package main

import (
    "bufio"
    "fmt"
    "io"
    "strings"
)

func scanLog(r io.Reader) error {
    scanner := bufio.NewScanner(r)
    // 预留常见行大小,并把单行硬上限设为 2 MiB。
    scanner.Buffer(make([]byte, 64*1024), 2*1024*1024)
    for scanner.Scan() {
        // Text 会复制当前 token,适合交给不会长期持有的处理函数。
        fmt.Println(len(scanner.Text()))
    }
    // Scan=false 可能是 EOF,也可能是 token 太大或底层读取失败。
    return scanner.Err()
}

func main() {
    // 这里只构造输入示意;生产代码通常传入打开的日志文件。
    if err := scanLog(strings.NewReader("small line\n")); err != nil {
        fmt.Println("read log:", err)
    }
}

不要把第二个参数随手写成很大的数来“保证不报错”。它是单个 token 的内存上限,面对外部输入时应结合日志格式、并发量和进程内存预算设置;超过业务上限的行,最好明确记录并拒绝或转入异常处理。

Go Scanner 超长日志示意:ScanLines、Scanner.Buffer、token 和 ErrTooLong 的静态关系
图1:Scanner 缓冲边界操作示意图,展示日志输入、分行函数、最大缓冲和 token 错误之间的静态关系。

单行大小不可控时,改用 Reader 分片读取

帮助读者理解 Reader.ReadLine 返回片段、isPrefix 与业务完整行之间的静态关系。
图2:Reader 分片读取结果示意图,展示片段必须复制到业务切片后才能交给完整行处理函数。

官方文档把 bufio.Reader 推荐给需要更大 token 或更细错误控制的程序。ReadLine 返回一段内容和 isPrefix 标记;标记为 true 时说明这一行还没结束。每次读取后立刻 append 到自己的切片,避免下一次读操作覆盖 Reader 的内部缓冲。

package main

import (
    "bufio"
    "errors"
    "fmt"
    "io"
)

func readLongLines(r io.Reader, handle func([]byte) error) error {
    reader := bufio.NewReaderSize(r, 64*1024)
    var line []byte
    for {
        fragment, isPrefix, err := reader.ReadLine()
        if err != nil {
            // 没有换行的最后一行会在前一次调用中返回;这里仅处理真正的结束。
            if errors.Is(err, io.EOF) {
                return nil
            }
            return err
        }
        // ReadLine 的片段只在下一次读取前有效,这里必须复制到自有切片。
        line = append(line, fragment...)
        if isPrefix {
            continue
        }
        if err := handle(line); err != nil {
            return err
        }
        // 复用容量,减少连续长行带来的重复分配。
        line = line[:0]
    }
}

func printLine(line []byte) error {
    // 这里按完整行处理,也可以改成流式解析 JSON 或字段。
    fmt.Println(len(line))
    return nil
}

这个方案仍然可能在业务处理阶段保留一整行,所以“分片读取”不等于“永远零内存增长”。如果连完整行都不应进入内存,就在拿到每个片段时直接做增量解析,并设计跨片段的状态机;如果只是不想受 Scanner 的固定 token 上限影响,以上写法已经足够。

上线前按行大小和内存预算选方案

场景建议重点检查
行大小有明确上限Scanner.Buffer设置在首次 Scan 前;max 用字节计算
偶发大行但需要完整文本Reader.ReadLine 拼接复制片段,并限制业务侧累计长度
输入可能恶意膨胀Reader 分片加硬上限超限时停止接收,避免无界 append
只需解析字段,不必保留整行Reader 分片增量解析维护跨片段状态,正确处理换行和 EOF

排查时先确认错误来源:只有 scanner.Err() 明确是 token too long,才需要调整 token 策略;如果是文件权限、网络读取或自定义 SplitFunc 错误,盲目增大 Buffer 不会解决根因。另一个常见坑是保存 scanner.Bytes() 的切片后继续 Scan:它可能在下一次扫描时被覆盖,需要长期保存时复制一份。

常见问题

Scanner.Buffer 的 max 写成 2*1024*1024 就一定能读 2 MiB 吗?

不一定。token 还要容纳分隔符等额外字节,实际可用大小可能略小;把 max 当作安全上限,而不是精确的正文长度。

可以在 Scan 返回 false 后重新调用 Buffer 吗?

不建议。Buffer 必须在扫描开始前调用;扫描已经开始后调用会触发 panic。应在创建 Scanner 后立即完成配置。

为什么不直接把 Scanner 换成 ReadString?

ReadString 更直接,但同样会把分隔符前的数据组成一个字符串。若行长不可控,使用 ReadLine 的片段标记,或直接做增量解析,更容易设置内存上限。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
仓储盘点出现差异时先核对哪些入库出库记录仓储盘点出现差异时先核对哪些入库出库记录
上一篇
仓储盘点出现差异时先核对哪些入库出库记录
珊瑚橙日落海面手机壁纸怎么安排顶部留白
下一篇
珊瑚橙日落海面手机壁纸怎么安排顶部留白
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    104次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    18次使用
  • OpenCompass大模型评测体系详解:功能、使用指南与应用场景
    OpenCompass
    OpenCompass是上海AI实验室推出的开源大模型评测平台,提供CompassKit、CompassHub和CompassRank三大核心组件,支持LLM及多模态模型的一站式标准化评估与排行榜查询。
    31次使用
  • AGI-Eval大模型评测平台:权威榜单、数据集与人机协同评测方案
    AGI-Eval
    AGI-Eval是由上海交大等高校联合发布的大模型评测社区,提供公正透明的LLM能力榜单、多领域评测集及Data Studio数据服务,助力AI模型性能评估与NLP科研开发。
    20次使用
  • SuperCLUE中文大模型评测基准:功能、能力维度与应用指南
    SuperCLUE
    SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
    257次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码