当前位置:首页 > 文章列表 > 文章 > python教程 > Python tarfile 解压时如何检查成员路径

Python tarfile 解压时如何检查成员路径

来源:17golang原创 2026-09-12 18:59:04 0浏览 收藏

tarfile.extractall() 解压外部上传的 tar 包时,不要只判断文件名是否以目标目录开头。更稳妥的做法是:先把成员名按归档路径规则检查一遍,拒绝绝对路径、..、驱动器路径和不需要的链接;真正解压时再显式使用 Python 3.12+ 的 filter='data',并把输出放进新的临时目录。

要点速览
  • TarInfo.name 是归档提供的输入,不能直接拼接到业务目录。
  • 预检解决“名称是否越界”,filter='data' 负责抽取过程中的路径和元数据边界。
  • 过滤器不是资源隔离:文件数量、展开总大小和临时目录仍需要单独控制。

先把成员名当作不可信输入

归档里的成员名可能是 docs/readme.txt,也可能是 ../outside.txt/etc/config 或 Windows 风格的 C:/temp/a.txt。如果直接执行 root / member.name,字符串看起来在目录内,不等于最终写入位置一定在目录内;符号链接还可能影响后续成员。

Python tarfile 归档成员名经过相对路径和越界检查后进入目标目录的结构示意图
图1:tarfile 成员路径检查的结构示意图,先拦截越界名称,再把通过检查的成员交给受控目录。

因此检查规则要针对归档语义,而不是只做一次字符串前缀比较。这里采用保守策略:把反斜杠按分隔符处理,拒绝空字节、绝对路径、盘符路径和任意 .. 组件;业务不需要链接时,符号链接与硬链接也一并拒绝。

预检普通路径与链接成员

先遍历 TarInfo,把通过检查的对象保存下来。预检阶段不写磁盘,只回答“这个包的成员是否符合我的输入策略”。

from pathlib import PurePosixPath
import re
import tarfile

DRIVE_PATH = re.compile(r"^[A-Za-z]:/")

def check_member(member: tarfile.TarInfo) -> None:
    # 归档路径统一按 POSIX 分隔符解析,避免漏掉跨平台写法。
    name = member.name.replace("\\", "/")
    if "\x00" in name:
        raise ValueError("成员名包含空字节")

    path = PurePosixPath(name)
    # 绝对路径、盘符路径和父目录跳转都可能越出目标目录。
    if path.is_absolute() or DRIVE_PATH.match(name) or ".." in path.parts:
        raise ValueError(f"拒绝越界成员: {member.name}")
    # 不需要保留链接时,拒绝链接可以减少后续成员被重定向的风险。
    if member.issym() or member.islnk():
        raise ValueError(f"拒绝链接成员: {member.name}")

def inspect_tar(tar_path: str) -> list[tarfile.TarInfo]:
    # getmembers() 只读取归档目录,不会把内容写入目标目录。
    with tarfile.open(tar_path, "r:*") as archive:
        members = archive.getmembers()
        for member in members:
            check_member(member)
        return members

这里没有把 member.name 直接交给 os.path.abspath() 就结束检查,因为链接成员和抽取时的文件系统状态仍然需要由抽取过滤器处理。若业务必须支持链接,至少要为链接目标单独设置允许范围,并在隔离目录中解压。

用 data 过滤器做最后一道边界

Python 3.12 为 extract()extractall() 增加了 filter 参数。官方文档提供的 data 过滤器会限制绝对路径、父目录越界以及危险的 Unix 元数据;Python 3.14 起,在没有显式指定过滤器时默认也会转向 data。生产代码仍建议显式传参,让策略在代码审查中可见。

from pathlib import Path
import shutil
import tarfile
import tempfile

def extract_archive(tar_path: str, output_root: str) -> Path:
    # 新目录避免归档利用目标目录里原有的链接或残留文件。
    output = Path(tempfile.mkdtemp(prefix="tar-extract-", dir=output_root))
    try:
        with tarfile.open(tar_path, "r:*") as archive:
            # data 会在每个成员真正处理前再次应用路径和元数据限制。
            archive.extractall(output, filter="data")
        return output
    except Exception:
        # 失败时清理部分解压结果,避免调用方误用半成品。
        shutil.rmtree(output, ignore_errors=True)
        raise

如果需要兼容没有过滤器参数的旧解释器,不能把预检误认为完整等价替代;应优先升级 Python,或者把解压放在权限受限的外部沙箱中。还要注意,过滤器拒绝成员时归档可能已经部分解压,调用方必须处理清理。

Python tarfile data 过滤器对普通文件、目录、符号链接和父目录路径的允许与拒绝结果示意图
图2:Python tarfile 的结果示意图,data 过滤器保留普通数据成员并拒绝越界或危险链接。

把解压放进临时目录并限制资源

filter='data' 主要解决“写到哪里”和“保留哪些元数据”,不能阻止归档炸弹、超大单文件或大量小文件带来的拒绝服务。上线前至少加上下面这张检查清单:

检查项建议原因
成员名拒绝绝对路径、..、空字节、盘符路径避免目标目录外写入
链接不需要就拒绝;需要时单独校验目标避免重定向后续写入
输出位置每次使用新的临时目录隔离已有文件和链接
资源限制成员数、总展开字节数和单文件大小降低资源耗尽风险

最后才把临时目录中的业务文件移动到正式位置,并在移动前再次确认文件类型、数量和总大小。这样即使归档被拒绝,外部输入也不会直接污染应用的工作目录。

相关问题

只检查 member.name 是否以目标目录开头可以吗?

不建议。绝对路径、父目录组件、不同路径分隔符和符号链接都会让简单前缀判断失真;应使用路径组件检查并配合 filter='data'

Python 3.14 还需要显式写 filter="data" 吗?

仍建议显式写。默认值会随解释器版本变化,而显式参数能表达当前业务策略,也方便兼容不同版本。

过滤器能防止归档炸弹吗?

不能。它不是 CPU、内存、磁盘或文件数量配额;这些限制要在解压前后由应用或外部运行环境补充。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Go plugin 在不同编译环境加载失败如何判断原因Go plugin 在不同编译环境加载失败如何判断原因
上一篇
Go plugin 在不同编译环境加载失败如何判断原因
Go archive/zip 如何只读取压缩包中央目录信息
下一篇
Go archive/zip 如何只读取压缩包中央目录信息
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    105次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    21次使用
  • OpenCompass大模型评测体系详解:功能、使用指南与应用场景
    OpenCompass
    OpenCompass是上海AI实验室推出的开源大模型评测平台,提供CompassKit、CompassHub和CompassRank三大核心组件,支持LLM及多模态模型的一站式标准化评估与排行榜查询。
    31次使用
  • AGI-Eval大模型评测平台:权威榜单、数据集与人机协同评测方案
    AGI-Eval
    AGI-Eval是由上海交大等高校联合发布的大模型评测社区,提供公正透明的LLM能力榜单、多领域评测集及Data Studio数据服务,助力AI模型性能评估与NLP科研开发。
    22次使用
  • SuperCLUE中文大模型评测基准:功能、能力维度与应用指南
    SuperCLUE
    SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
    259次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码