当前位置:首页 > 文章列表 > Golang > Go教程 > Go json.Decoder.Token 怎么流式遍历超大数组

Go json.Decoder.Token 怎么流式遍历超大数组

来源:17golang原创 2026-09-27 19:14:31 0浏览 收藏

处理几百 MB 甚至更大的 JSON 数组时,真正容易出问题的不是语法,而是把整个数组一次性放进内存。更稳妥的方式是让 json.Decoder 从 io.Reader 读取:先用 Token() 确认数组边界,再用 More() 判断是否还有元素,用 Decode() 消费当前这一条。这样业务层只保留当前元素,不需要建立完整切片。

数组流式遍历的固定骨架是“读 [ → 循环 More() 并 Decode → 读 ]”。Token() 负责结构边界,Decode() 负责把单条记录落到具体类型。
要点速览
  • Token() 返回分隔符、字符串、数字、布尔值和 null,并保证数组、对象分隔符正确嵌套。
  • 规则稳定的数组优先使用 More()+Decode(),比手动拆每个字段更易维护。
  • 金额、ID 等数字需要原样保留时,先调用 UseNumber(),并把字段接成 json.Number。

先把超大数组拆成“边界”和“元素”

json.Unmarshal 适合已经在内存里的完整 JSON;它会把目标数组组织成完整切片。流式处理则把输入看成连续字节,解码器内部会自行缓冲,但调用者不必把所有记录收集起来。这里的关键不是把 JSON 变成“更小的 JSON”,而是每次只把一个元素交给业务代码。

读取数组时不要直接假定第一个 token 一定正确。先检查它是不是 json.Delim('['),这样当接口误返回对象、错误文本或空内容时,可以在入口处给出明确错误。下面的结构体只表达文章场景,业务项目中可以替换成自己的字段。

Go json.Decoder Token 从数组开始分隔符到单条 Decode 再到结束分隔符的流式关系说明图
图1:Go json.Decoder 数组边界与单条记录消费的静态说明图,不是运行截图。

用 More 加 Decode 按条处理记录

官方示例采用的组合很适合超大数组:读入开始分隔符后,在 dec.More() 为真时解码一个元素;循环结束,再读取关闭分隔符。处理函数应尽量在循环体内完成写入、校验或投递,不要把 Event 追加到一个无限增长的切片。

package main

import (
	"encoding/json"
	"fmt"
	"io"
	"log"
	"strings"
)

type Event struct {
	ID   string `json:"id"`
	Kind string `json:"kind"`
}

func main() {
	input := strings.NewReader(`[{"id":"a-1","kind":"login"},{"id":"a-2","kind":"logout"}]`)
	dec := json.NewDecoder(input)

	// 先确认输入确实从数组开始,避免把错误响应当成业务数据。
	tok, err := dec.Token()
	if err != nil {
		log.Fatal(err)
	}
	if delim, ok := tok.(json.Delim); !ok || delim != '[' {
		log.Fatalf("expected array start, got %v", tok)
	}

	count := 0
	for dec.More() {
		var event Event
		// 每轮只解码一条记录;处理完即可交给下游,不累积完整数组。
		if err := dec.Decode(&event); err != nil {
			log.Fatalf("decode item %d: %v", count, err)
		}
		fmt.Printf("%s %s\n", event.ID, event.Kind)
		count++
	}

	// More 返回 false 只代表当前数组没有更多元素,仍要消费结束分隔符。
	tok, err = dec.Token()
	if err != nil && err != io.EOF {
		log.Fatal(err)
	}
	if tok != json.Delim(']') {
		log.Fatalf("expected array end, got %v", tok)
	}
	fmt.Println("processed:", count)
}

这里的内存优势来自“不保存全量结果”,不是来自 Token() 会自动限制单条元素大小。如果数组中的某一项本身就是一个巨大的嵌套对象,Decode 到结构体时仍要为这一个对象分配空间;需要进一步控制时,要把字段拆开处理或重新设计输入格式。

需要动态结构时再逐个读取 Token

数组元素结构不稳定、只想筛选某个键,或者需要记录解析偏移时,可以直接读取 token。Token() 会返回 json.Delim、字符串、布尔值、null,以及默认的 float64 数字;逗号和冒号不会单独返回。嵌套对象不能只看一层 token,要用深度计数或把完整元素交给 Decode。

// scanNumbers 展示动态数组中保留数字文本的做法。
func scanNumbers(r io.Reader) error {
	dec := json.NewDecoder(r)
	// UseNumber 避免默认 float64 造成大整数精度损失。
	dec.UseNumber()

	start, err := dec.Token()
	if err != nil {
		return err
	}
	if start != json.Delim('[') {
		return fmt.Errorf("not an array: %v", start)
	}
	for dec.More() {
		tok, err := dec.Token()
		if err != nil {
			return err
		}
		// json.Number 保留输入形式,业务层再决定 Int64 或 Decimal 解析策略。
		if number, ok := tok.(json.Number); ok {
			fmt.Println("number:", number.String())
		}
	}
	_, err = dec.Token()
	return err
}

如果元素是对象,直接连续读取 token 会同时遇到字段名、值和嵌套分隔符,代码很快会变成手写解析器。可维护的取舍通常是:外层用 Token 控制数组,元素内部仍用 Decode;只有确实需要动态字段或原始数字文本时,才下沉到 token 级别。

Go json.Decoder 流式输入、Token 边界、UseNumber 与下游处理之间的内存关系说明图
图2:Token、UseNumber 与下游处理之间的静态结构图,强调单条元素边界,不是运行截图。

结束分隔符、错误和输入边界怎么处理

现象判断方式处理建议
输入不是数组首个 token 不是 [在入口返回格式错误,不进入业务循环
数组读完More() 为 false继续读取并检查 ]
输入结束顶层读取返回 io.EOF仅在确认顶层值已完整结束后接受
单条记录损坏Decode 返回语法或类型错误记录元素序号;按业务选择停止、跳过或进入隔离队列

Token() 对不匹配的数组、对象分隔符会返回错误,因此不要为了“继续处理后面的数据”而无条件忽略 error。另一个容易忽略的边界是 NewDecoder 可能提前从底层 Reader 读取更多字节;如果同一个 Reader 后面还有别的协议内容,只有在明确理解 Buffered() 语义后再拼接剩余数据。

相关问题

Token 和 Decode 能在同一个 Decoder 中交替使用吗

可以。外层用 Token 读取数组边界,数组元素用 Decode 读取完整值,是官方流式数组示例采用的方式。关键是保持当前 JSON 层级,不要跳过未消费的结束分隔符。

为什么遍历大数组后内存仍然上涨

常见原因是业务代码仍在保存所有元素,或者单条元素本身很大。先检查是否不断 append,再看下游缓存、批量提交和日志是否有无界队列。

什么时候应该不用 Token

如果输入体量可控、结构固定且需要完整随机访问,直接 Decode 到结构体或切片更简单。Token 适合流式边界、动态结构和增量处理,不是所有 JSON 都要手动拆成 token。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
喵次元永久下载页怎么用?长期更新、入口迁移与页面收藏说明喵次元永久下载页怎么用?长期更新、入口迁移与页面收藏说明
上一篇
喵次元永久下载页怎么用?长期更新、入口迁移与页面收藏说明
Figma Variables 怎么为组件切换主题模式
下一篇
Figma Variables 怎么为组件切换主题模式
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • PubMedQA数据集详解:生物医学问答基准、功能与应用指南
    PubMedQA
    深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
    239次使用
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    287次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    254次使用
  • 斯坦福HELM:大语言模型Holistic Evaluation整体评估框架详解
    HELM
    深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
    236次使用
  • MMBench详解:多模态大模型基准测试、功能特点与使用指南
    MMBench
    MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
    45次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议 和 隐私政策
返回登录
  • 重置密码