当前位置:首页 > 文章列表 > Golang > Go教程 > Go archive/tar 怎么读取归档头

Go archive/tar 怎么读取归档头

来源:17golang原创 2026-09-13 02:12:14 0浏览 收藏

读取 tar 文件时,真正要先拿到的不是正文,而是当前条目的归档头。Go 标准库的 archive/tartar.NewReader 创建读取器,再反复调用 Next();每次返回一个 *tar.Header,从中可以取得文件名、大小、类型、权限和时间。确认条目是普通文件后,才把当前正文交给 io.Copy 或其他写入器。

要点速览
  • Next() 负责移动到下一个条目并返回 Header,当前正文由同一个 Reader 读取。
  • Header.Size 决定当前文件正文的可读范围;目录、链接等特殊条目不要按普通文件复制。
  • 循环中的 io.EOF 是正常结束,其他错误要返回;落盘前还要检查名称和路径边界。

先把 tar 输入变成可遍历的 Reader

archive/tar 不要求输入一定来自磁盘文件,只要实现了 io.Reader 就可以读取。因此本地文件、内存缓冲区、网络响应体都能走同一条解析路径。文件句柄用完要关闭,解析器则负责按 tar 条目的边界推进。

package main

import (
    "archive/tar"
    "fmt"
    "io"
    "os"
)

func listHeaders(path string) error {
    // 打开 tar 输入;文件句柄只负责提供连续字节流。
    file, err := os.Open(path)
    if err != nil {
        return fmt.Errorf("open tar: %w", err)
    }
    defer file.Close() // 函数结束时释放文件描述符。

    reader := tar.NewReader(file)
    for {
        header, err := reader.Next()
        if err == io.EOF {
            // 没有更多条目是正常结束,不要把它当成失败。
            return nil
        }
        if err != nil {
            return fmt.Errorf("read tar header: %w", err)
        }

        // 这里先只读取元数据,正文仍留在 reader 的当前位置。
        fmt.Printf("name=%q size=%d type=%q mode=%o modtime=%s format=%s\n",
            header.Name, header.Size, header.Typeflag,
            header.Mode, header.ModTime.Format("2006-01-02 15:04:05"),
            header.Format)
    }
}

这段函数的关键是“Next 读取头,reader 读取当前条目正文”。如果上一条正文没有读完,下一次 Next 会自动丢弃当前条目的剩余数据和填充区,所以不要再自己按 512 字节猜边界。

调用 Next 读取当前归档头

Header 可以看成当前条目的身份证:Name 是归档内名称,Size 是正文长度,Typeflag 区分普通文件、目录、链接等类型,ModeModTime 用于保留权限与时间信息,Format 则是读取器对格式的尽力判断。

Go archive/tar Reader Next 返回归档头并提供 Name Size Typeflag ModTime Format 字段的结构示意图
图1:archive/tar 读取归档头的结构示意,Next 返回当前条目的 Header;这不是实际运行截图。

读取归档头时,先记录这些字段,再决定是否读取正文。若文章只是做目录索引,读到 Header 后可以直接进入下一轮;若要转换内容,才在同一轮中消费当前条目的数据。

按条目类型处理正文

最容易出错的地方是把每个条目都当成有正文的普通文件。目录通常只需要创建目录或记录名称;普通文件才适合复制正文;符号链接、硬链接和设备条目则应根据业务策略单独处理。下面的例子只把普通文件转换到写入器,并把目录明确跳过。

func copyRegularEntries(input io.Reader, output io.Writer) error {
    // Reader 会根据每个 Header.Size 限制当前条目的可读范围。
    reader := tar.NewReader(input)
    for {
        header, err := reader.Next()
        if err == io.EOF {
            return nil // 归档正常结束。
        }
        if err != nil {
            return fmt.Errorf("next tar entry: %w", err)
        }

        switch header.Typeflag {
        case tar.TypeDir:
            // 目录没有需要复制的正文,保留名称即可。
            continue
        case tar.TypeReg, tar.TypeRegA:
            // 只在普通文件分支消费正文,io.Copy 会读到当前条目结束。
            if _, err := io.Copy(output, reader); err != nil {
                return fmt.Errorf("copy %q: %w", header.Name, err)
            }
        default:
            // 链接和特殊文件不在本例的转换范围内。
            continue
        }
    }
}

示例里的 output 可以是另一个文件、缓冲区或哈希计算器。要分别保存多个归档条目时,应该在每个 Next 后按 header.Name 创建对应的目标写入器,而不是把所有正文无条件拼成一个文件。

Go archive/tar 按 TypeDir TypeReg 和 io.EOF 区分正文处理边界的结果示意图
图2:tar 条目类型与正文读取边界的结果示意,目录不复制正文;这不是实际运行截图。

处理 EOF、格式错误和路径边界

错误处理可以先分成三类:io.EOF 表示归档结束;tar.ErrHeader 等解析错误表示输入可能损坏或格式不被接受;复制阶段的错误则来自底层输入或输出。不要用“读到任何错误就结束”的写法,否则坏包会被误报成成功。

如果要把条目写入磁盘,Header.Name 不能直接与输出根目录拼接。当前官方文档还说明,在 GODEBUG=tarinsecurepath=0 时,遇到非本地名称,Next 会返回带有 tar.ErrInsecurePath 的 Header。生产代码应先拒绝绝对路径、父目录跳转和不符合业务规则的名称,再决定是否创建文件;链接目标也要单独制定策略。

返回或字段含义处理建议
Header当前归档条目的元数据先判断类型,再决定是否读正文
Header.Size当前普通文件正文长度不要跨条目读取,复制结果要检查错误
io.EOF没有更多条目正常返回
ErrHeader归档头解析失败返回错误并保留输入问题
ErrInsecurePath名称不满足本地路径约束时的提示落盘前拒绝或按明确策略处理

常见问题

1. 只想列出文件名,需要读取正文吗?

不需要。每次 Next() 成功后读取 Header.Name 等字段即可;下一次 Next() 会推进到下一个条目。

2. 为什么目录也能拿到 Header?

tar 的每个条目都先以 Header 描述,目录只是 Typeflag 不同。它通常没有要复制的正文,所以应在目录分支跳过。

3. 读取一个条目后忘记 io.Copy 会卡在下一个条目吗?

不会。Next() 会自动丢弃当前条目的未读部分,但显式读取正文仍有助于完成转换、校验或统计,逻辑更清楚。

4. Header.Size 是整个 tar 文件大小吗?

不是。它只描述当前条目的正文大小;整个归档由多个 Header、正文和格式填充区组成。

把流程记成一句话即可:先用 Next 拿 Header,再按 Typeflag 决定如何读取当前正文,最后把 io.EOF 当作正常结束,并在落盘前检查归档名称。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Go assert 如何限定接口范围Go assert 如何限定接口范围
上一篇
Go assert 如何限定接口范围
Lovart灵感与技能管理结果怎么检查?质量、格式与权限清单
下一篇
Lovart灵感与技能管理结果怎么检查?质量、格式与权限清单
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    110次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    24次使用
  • OpenCompass大模型评测体系详解:功能、使用指南与应用场景
    OpenCompass
    OpenCompass是上海AI实验室推出的开源大模型评测平台,提供CompassKit、CompassHub和CompassRank三大核心组件,支持LLM及多模态模型的一站式标准化评估与排行榜查询。
    44次使用
  • AGI-Eval大模型评测平台:权威榜单、数据集与人机协同评测方案
    AGI-Eval
    AGI-Eval是由上海交大等高校联合发布的大模型评测社区,提供公正透明的LLM能力榜单、多领域评测集及Data Studio数据服务,助力AI模型性能评估与NLP科研开发。
    23次使用
  • SuperCLUE中文大模型评测基准:功能、能力维度与应用指南
    SuperCLUE
    SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
    264次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码