当前位置:首页 > 文章列表 > Golang > Go教程 > Go 怎么逐行读取大 CSV 文件并记录错误行

Go 怎么逐行读取大 CSV 文件并记录错误行

来源:17golang原创 2026-09-05 11:11:18 0浏览 收藏

Go 读取大 CSV 文件时,核心不是把文件拆成很多字符串,而是让 encoding/csv.Reader 按记录流式消费:每次调用 Read() 只拿当前记录,遇到坏数据就把行号和列号写入错误日志,然后决定跳过还是停止。这样既不会像 ReadAll() 一样把全部内容放进内存,也不会因为一条脏记录丢掉整批数据。

固定列的导入任务建议使用 Read 循环并保留默认的字段数检查;错误处理用 errors.As 取出 *csv.ParseError,记录 StartLineLineColumn。只有明确接受不规范 CSV 时,才考虑 LazyQuotes

先把大文件变成一条条记录

csv.NewReader 接受任意 io.Reader,文件可以直接传入,也可以外面包一层缓冲读取器。真正的循环要单独处理 io.EOF,它代表没有下一条记录,不是失败。

package main

import (
    "encoding/csv"
    "errors"
    "fmt"
    "io"
    "os"
)

func readCSV(path string) error {
    f, err := os.Open(path)
    if err != nil {
        return err
    }
    defer f.Close()

    r := csv.NewReader(f)
    // 默认值 0:第一条记录决定后续期望的列数。
    for {
        record, err := r.Read()
        if err == io.EOF {
            return nil
        }
        if err != nil {
            var pe *csv.ParseError
            if errors.As(err, &pe) {
                fmt.Printf("CSV 解析错误:开始行=%d,错误行=%d,列=%d,原因=%v\n",
                    pe.StartLine, pe.Line, pe.Column, pe.Err)
                continue
            }
            return err
        }

        if err := consume(record); err != nil {
            return err
        }
    }
}

func consume(record []string) error {
    fmt.Println(record[0])
    return nil
}

这个循环的内存特点是“当前记录大小”而不是“整个文件大小”。但 Read 返回的切片是否可复用,取决于 ReuseRecord 配置;默认情况下每次返回新的数据,若为了减少分配开启复用,就不能把 record 直接保存到循环外。

Go encoding/csv 读取器、文件流、记录和消费函数的静态关系框图
图 1:外层文件流进入 csv.Reader,再形成当前记录并交给消费函数;这里看的是组件关系,不是运行截图。

列数规则决定“错误行”的含义

FieldsPerRecord 有三种典型选择。保持默认的 0 时,第一条记录读完后会把列数固定下来,后续少列或多列都会返回 ErrFieldCount。设置为正数可以跳过表头后明确规定列数;设置为负数则完全不检查列数,适合字段确实不稳定的日志型 CSV,但业务字段校验要由自己的代码完成。

场景建议原因
有固定表头的导入读表头后设为正数列数错误尽早暴露
每行字段可变设为 -1让 Reader 只负责解析,不误判列数
不确定供应方格式保留 0 并记录坏行第一条记录作为基本契约

如果分隔符不是逗号,可以在第一次 Read 前设置 r.Comma = ';'。空白是否属于字段、注释行是否跳过,也分别受 CSV 的字段和 Comment 配置影响,不能用字符串切割简单替代。

用 ParseError 记录真实发生位置

错误处理最容易犯的错是手动维护一个“第几条记录”计数器,然后把它当成文件行号。CSV 的引号字段允许包含换行,因此一条记录可能跨越多行。ParseError.StartLine 是记录开始行,Line 是错误发生行,Column 是从 1 开始的字节列号;记录这些字段,排查时才能回到原始文件的正确位置。

func logParseError(err error) {
    var pe *csv.ParseError
    if !errors.As(err, &pe) {
        fmt.Printf("CSV 非解析错误:%v\n", err)
        return
    }
    switch {
    case errors.Is(pe.Err, csv.ErrFieldCount):
        fmt.Printf("列数不符:记录起始行=%d,检查行=%d\n", pe.StartLine, pe.Line)
    default:
        fmt.Printf("格式错误:行=%d,字节列=%d,原因=%v\n", pe.Line, pe.Column, pe.Err)
    }
}

列数错误和引号错误的处理策略通常不同:前者可以把原始记录放入隔离文件,后者可能连完整记录都无法得到。不要把一个错误统一包装成“第 N 条失败”,否则多行字段会让错误定位产生偏差。

CSV 记录边界、ParseError 行列信息和错误隔离记录的静态关系框图
图 2:正常记录与错误记录共享同一个 Reader,但错误分支保留 StartLine、Line、Column 和错误原因,便于隔离处理。

需要缓存记录时处理 ReuseRecord

对大文件来说,ReuseRecord 可以降低循环中创建切片的次数,但它改变了所有权语义:

r.ReuseRecord = true
for {
    record, err := r.Read()
    if err == io.EOF {
        break
    }
    if err != nil {
        // 这里按前面的 ParseError 规则处理
        continue
    }

    // 要异步发送或放入队列,必须复制一份。
    saved := append([]string(nil), record...)
    enqueue(saved)
}

如果记录只在当前循环中同步消费,可以复用;如果会交给 goroutine、批量缓存或下一层异步处理,就复制字段切片。另一方面,InputOffset() 返回当前输入位置:它表示最近一次成功读取的记录末尾、下一条记录开头,可用于日志和恢复点,但不要把它误当成字符位置。

什么时候不要打开 LazyQuotes

LazyQuotes 会放宽未加引号字段中的引号规则,也允许带引号字段出现非成对引号。它适合“先尽可能读取,再由清洗规则修复”的场景,不适合财务、订单等必须保证字段边界的导入。严格导入应保留默认值,遇到解析错误就把原文件位置、供应方文件名和错误原因写入隔离日志;宽松导入也要单独标注,避免下游误以为数据已经通过格式校验。

最后检查三个边界:关闭文件的错误是否需要上报;consume 失败时是否应停止;以及错误行是否需要原文留存。这样,CSV 读取器只负责可靠解析,业务校验和重试策略留在更清晰的上层。

常见问题

大 CSV 能不能直接用 ReadAll? 小文件可以,几十万行以上通常应使用 Read 循环,避免把全部记录同时留在内存。

为什么错误行号和我计数的记录号不一致? 引号字段可以跨行,ParseError 报的是文件行位置;记录计数只能说明第几条逻辑记录。

列数不固定是不是必须开启 LazyQuotes? 不是。列数由 FieldsPerRecord 控制,错误引号由 LazyQuotes 控制,两者是不同问题。

参考:Go encoding/csv 标准库文档

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
venera漫画项目停止维护后还能用吗?归档仓库、兼容范围与问题反馈说明venera漫画项目停止维护后还能用吗?归档仓库、兼容范围与问题反馈说明
上一篇
venera漫画项目停止维护后还能用吗?归档仓库、兼容范围与问题反馈说明
qooapp账号怎么同步和管理权限?登录、通知与设备切换说明
下一篇
qooapp账号怎么同步和管理权限?登录、通知与设备切换说明
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • SuperCLUE中文大模型评测基准:功能、能力维度与应用指南
    SuperCLUE
    SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
    145次使用
  • C-Eval中文评测基准:大语言模型多学科能力评估指南
    C-Eval
    深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
    65次使用
  • ClickPrompt:AI提示词生成与优化工具,支持Stable Diffusion、ChatGPT及代码辅助
    ClickPrompt
    ClickPrompt是一款专为AI提示词编写者设计的开源在线工具,支持Stable Diffusion绘图、ChatGPT对话及GitHub Copilot代码辅助。提供Prompt自动生成、一键运行、社区分享及可视化优化功能,帮助用户高效获取精准AI输出。
    35次使用
  • PromptHero官网:AI提示词搜索、优化与学习平台,支持Midjourney/Stable Diffusion
    PromptHero
    PromptHero是专业的AI提示词搜索引擎与优化平台,支持Stable Diffusion、Midjourney等主流模型。提供海量提示词库、分类搜索、在线课程及社区互动,助力用户高效生成高质量AI图像与文本。
    8次使用
  • OpenArt免费开源指南:Stable Diffusion Prompt Book提示词手册详解
    Stable Diffusion Prompt Book
    深入解析OpenArt推出的Stable Diffusion Prompt Book,这本免费的开源提示词指南涵盖从基础语法到高级技巧,提供风格化词库与参数建议,助您优化AI绘画生成效果。
    21次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码