当前位置:首页 > 文章列表 > Golang > Go教程 > Go 怎么流式解析超大 JSON 数组而不一次读入内存

Go 怎么流式解析超大 JSON 数组而不一次读入内存

来源:17golang原创 2026-09-07 00:13:57 0浏览 收藏

如果接口返回的是几百万条记录,先用 io.ReadAll 读完,再把 []byte 交给 json.Unmarshal,内存里至少会同时出现原始字节、数组切片和一批结构体。更稳妥的做法是让 json.Decoder 直接从 io.Reader 读取顶层数组,每次只把一个元素解码到复用的结构体中。

下面的写法只处理“顶层是数组”的 JSON。它不会让整个数组常驻内存,但单个数组元素仍要完整放进 Item;如果某一项本身特别大,还要额外限制输入总字节数或拆分上游格式。

要点速览
  • Decoder.Token 确认数组开始,用 More 判断是否还有元素。
  • 循环里只调用 Decode(&item),处理完后立即释放或覆盖该项引用。
  • 流式解析不等于无限制:输入上限和单项大小都要在业务层明确。

为什么 json.Unmarshal 会把大数组变成内存压力

json.Unmarshal 接收的是已经存在内存里的字节切片。目标如果是 []Item,解码器还会不断扩容切片并保留所有元素,方便后续随机访问。这种方式适合中小型配置文件,却不适合“读取一项、处理一项、处理完就丢掉”的导入任务。

流式方案把边界改成了三层:输入来自 io.Readerjson.Decoder 维护 JSON 游标,业务只持有当前的 Item。因此峰值内存主要跟解码器缓冲、当前元素和业务处理逻辑有关,而不是跟数组总条数线性增长。

用 json.Decoder 逐项消费数组

Go json.Decoder 从 io.Reader 读取 JSON 数组并逐项得到 Item 的静态结构框图
图1:数组游标边界把 io.Reader、json.Decoder、More 判断和单个 Item 分开,理解后即可避免把整个数组放进切片。

关键顺序是先读数组开始符,再循环解码,最后读数组结束符。More 只用于当前数组或对象内部,不能拿它判断一个任意 JSON 流是否还有下一段数据。

package main

import (
    "encoding/json"
    "fmt"
    "io"
    "strings"
)

type Item struct {
    ID    string `json:"id"`
    Name  string `json:"name"`
    Price int64  `json:"price"`
}

func streamItems(r io.Reader) error {
    dec := json.NewDecoder(r)

    // 顶层必须先出现数组开始符,避免把对象误当成数组处理。
    start, err := dec.Token()
    if err != nil {
        return fmt.Errorf("读取数组开始符失败: %w", err)
    }
    if delim, ok := start.(json.Delim); !ok || delim != '[' {
        return fmt.Errorf("期望 JSON 数组,实际得到 %v", start)
    }

    var item Item
    for dec.More() {
        item = Item{}
        // 每轮只覆盖当前元素,处理函数不要把 item 的地址长期保存。
        if err := dec.Decode(&item); err != nil {
            return fmt.Errorf("解码数组元素失败: %w", err)
        }
        fmt.Printf("处理 %s: %s\\n", item.ID, item.Name)
    }

    // 读取数组结束符,确认数组结构完整闭合。
    end, err := dec.Token()
    if err != nil {
        return fmt.Errorf("读取数组结束符失败: %w", err)
    }
    if delim, ok := end.(json.Delim); !ok || delim != ']' {
        return fmt.Errorf("数组没有正常结束: %v", end)
    }
    return nil
}

func main() {
    input := `[{"id":"a-1","name":"键盘","price":199},{"id":"a-2","name":"鼠标","price":89}]`
    if err := streamItems(strings.NewReader(input)); err != nil {
        fmt.Println(err)
    }
}

这里的复用变量不是为了追求极限优化,而是为了让生命周期清楚:循环体结束后不把 &item 放进全局切片、异步队列或缓存。若业务必须异步处理,应复制需要的字段,或把所有权交给明确的任务对象。

把单项大小和输入边界控制好

Go JSON 流式解析中 Response Body、LimitReader、Decoder、Item 与处理函数的边界关系
图2:输入总量由 LimitReader 约束,Decoder 只负责语法读取,Item 和处理函数各自承担单项数据与业务生命周期。

面对 HTTP 上传或外部文件,建议先决定“最多接收多少字节”。io.LimitReader 限制的是整个输入,不是单个数组元素;它适合防止请求体无限增长。单个元素仍然可能很大,应该通过结构设计、字段长度限制或上游分页来解决。

func importBody(body io.Reader, maxBytes int64) error {
    // 总输入超过上限时,解码过程会在读到边界后报错或提前结束。
    limited := io.LimitReader(body, maxBytes)
    dec := json.NewDecoder(limited)

    token, err := dec.Token()
    if err != nil {
        return fmt.Errorf("读取输入失败: %w", err)
    }
    if delim, ok := token.(json.Delim); !ok || delim != '[' {
        return fmt.Errorf("输入必须是顶层数组")
    }

    var item Item
    for dec.More() {
        item = Item{}
        if err := dec.Decode(&item); err != nil {
            return fmt.Errorf("输入超过上限或 JSON 损坏: %w", err)
        }
        // 在这里写入数据库、发送消息或更新统计,不累积整个数组。
        if err := handleItem(item); err != nil {
            return fmt.Errorf("处理 %s 失败: %w", item.ID, err)
        }
    }
    _, err = dec.Token()
    return err
}

func handleItem(item Item) error {
    // 示例业务函数只保留同步处理边界,不保存 item 的指针。
    return nil
}

如果输入来自网络,读取循环还应配合请求超时、连接关闭和错误日志;如果来自文件,最好让上游按页输出数组,或改成一行一个 JSON 对象。Decoder 解决的是“不要一次物化整个数组”,不会替你完成限流、事务批次和失败重试。

常见坑:空数组、尾部数据与对象过大

现象原因处理方式
空数组没有进入循环More()[] 直接返回 false仍要读取最后的 ]
解码后还有奇怪内容只读完数组,没有检查顶层尾部需要严格单文档时,再读取并确认后续是 io.EOF
单条记录仍占满内存流式只拆数组,不拆元素限制字段、拆分对象或调整上游协议

严格接口还可以在读取结束后检查尾部是否只有空白。要注意,Decoder 允许连续解码多个 JSON 值,所以“数组已经闭合”不必然等于“整个输入只有一个数组”。是否拒绝尾部对象,应由协议决定,而不是默默忽略。

最后,别把 json.RawMessage 当成自动省内存方案:它会保留原始 JSON 片段,适合延迟解码,不适合把超大元素永久挂在内存里。真正需要降峰时,优先让上游分页,或者让每个对象独立成行并逐行消费。

相关问题

流式解析后还能统计数组总数吗?

可以,在循环中维护计数器;不要为了获取总数再把元素收集到切片。若响应头或协议能提供总数,优先使用协议字段。

能不能直接用 dec.Decode(&items)?

可以,但目标是 []Item 时仍会把数组完整装入内存,失去逐项处理的主要收益。

一个元素很大时该怎么做?

先从协议层拆小对象或分页,再配合输入总量限制;仅把 Unmarshal 换成 Decoder,不能限制单个 JSON 对象的大小。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
漫狐支持安卓和 iPhone 吗?双平台入口与安装前核对说明漫狐支持安卓和 iPhone 吗?双平台入口与安装前核对说明
上一篇
漫狐支持安卓和 iPhone 吗?双平台入口与安装前核对说明
MySQL 窗口函数排序并列时怎么只保留一条结果
下一篇
MySQL 窗口函数排序并列时怎么只保留一条结果
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • SuperCLUE中文大模型评测基准:功能、能力维度与应用指南
    SuperCLUE
    SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
    167次使用
  • C-Eval中文评测基准:大语言模型多学科能力评估指南
    C-Eval
    深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
    93次使用
  • AI Prompt Library:免费AI提示词库,助力ChatGPT高效创作与营销
    AI Prompt Library
    探索AI Prompt Library免费资源库,涵盖营销、写作及多场景AI提示词。兼容ChatGPT、Claude等工具,一键复制优化输出,提升工作效率。
    15次使用
  • LangGPT提示词框架:结构化Prompt设计方法与开源工具指南
    LangGPT
    LangGPT是一种受编程语言启发的结构化提示词设计工具,提供双层框架、模块化模板及变量功能,帮助用户高效编写高质量Prompt。该项目已在GitHub免费开源,适用于内容创作、编程辅助等多场景。
    28次使用
  • ClickPrompt:AI提示词生成与优化工具,支持Stable Diffusion、ChatGPT及代码辅助
    ClickPrompt
    ClickPrompt是一款专为AI提示词编写者设计的开源在线工具,支持Stable Diffusion绘图、ChatGPT对话及GitHub Copilot代码辅助。提供Prompt自动生成、一键运行、社区分享及可视化优化功能,帮助用户高效获取精准AI输出。
    58次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码