当前位置:首页 > 文章列表 > 文章 > python教程 > Python tarfile extraction_filter 怎么阻止危险路径

Python tarfile extraction_filter 怎么阻止危险路径

来源:17golang原创 2026-09-27 05:22:06 0浏览 收藏

如果 tar 包来自上传接口、构建产物或外部依赖,解包时不要只写 extractall(target)。更稳妥的做法是显式传入 filter="data":它会限制绝对路径、目录穿越、越界链接、设备文件和一部分危险元数据。业务还有文件数量、目录深度等要求时,再在官方过滤器之上增加一个 callable。

先记住三个结论
  • 不可信归档优先使用 filter="data",不要把 fully_trusted 当默认安全方案。
  • extraction_filter 是 TarFile 的可调用默认策略,不能写成字符串。
  • 过滤器抛错后可能已经留下部分文件,必须使用临时目录并在失败时清理。
tarfile data_filter 限制归档成员到目标目录的静态结构说明图
图1:说明图,展示归档成员经过 data_filter 后进入目标目录的安全边界。

一、先显式选择 data 过滤器

Python 的过滤器能力在 Python 3.12 引入,并在部分旧版本中以安全更新形式回补。对跨版本程序,优先用能力检测;对明确支持该能力的运行环境,直接传入命名过滤器即可。

import tarfile
from pathlib import Path

archive_path = Path("incoming/bundle.tar.gz")
target = Path("work/extracted")
target.mkdir(parents=True, exist_ok=True)

# data 过滤器限制绝对路径、越界链接和设备文件等风险
with tarfile.open(archive_path, "r:gz") as tar:
    tar.extractall(target, filter="data")

fully_trusted 适合你完全信任归档,或已经实现复杂检查的场景;它不是上传文件解包的通用安全选项。Python 3.12 和 3.13 在未明确设置过滤器时会发出弃用警告,Python 3.14 起默认趋向 data,但应用仍应把策略写在调用点,避免依赖运行时默认值。

二、data_filter 到底阻止了什么

过滤器会在每个成员真正写入磁盘前收到 TarInfo 和目标路径。它可以返回调整后的成员、返回 None 跳过成员,或抛出异常终止流程。data 策略重点是把归档当作跨平台数据包:链接不能指向目标目录外,设备文件和管道不应被释放,属主信息也不会原样带入。

这解决的是“归档成员携带危险语义”的问题,不等于替应用完成所有资源限制。大归档仍可能耗尽磁盘,合法文件也可能造成过深目录、过多小文件或业务目录污染,所以还要增加应用自己的上限。

import tarfile

try:
    with tarfile.open("incoming/bundle.tar", "r") as tar:
        # 显式传入 data,避免跟随不同 Python 版本的默认行为
        tar.extractall("work/extracted", filter="data")
except tarfile.FilterError as exc:
    # 记录被拒绝的成员名,日志中不要写入归档内容本身
    member_name = getattr(exc.member, "name", "unknown")
    print(f"拒绝归档成员: {member_name}")

三、用自定义过滤器补上业务限制

不要重新手写路径规范化逻辑来替换官方过滤器。更可靠的顺序是先调用 tarfile.data_filter,再对返回的 TarInfo 增加业务限制。例如,导入包只允许有限层级和少数扩展名;超过边界就抛出 FilterError,让调用方知道这不是普通文件读取失败。

tarfile 自定义过滤器叠加文件层级和类型限制的静态结构说明图
图2:结构图,展示官方 data_filter 与业务限制叠加后的决策边界。
import tarfile

ALLOWED_SUFFIXES = {".json", ".yaml", ".txt"}

def import_filter(member: tarfile.TarInfo, destination: str) -> tarfile.TarInfo | None:
    # 先复用官方策略,避免遗漏链接、设备文件等危险语义
    safe_member = tarfile.data_filter(member, destination)
    name = safe_member.name

    # 业务包只接受有限目录深度和配置类文件
    if name.count("/") > 6:
        raise tarfile.FilterError("目录层级超过导入上限")
    if safe_member.isfile() and safe_member.name.lower().endswith(tuple(ALLOWED_SUFFIXES)) is False:
        return None  # 跳过不需要导入的普通文件
    return safe_member

with tarfile.open("incoming/config.tar", "r") as tar:
    # 过滤器按成员调用,返回 None 的成员不会写入目标目录
    tar.extractall("work/config", filter=import_filter)

如果业务需要统计成员数量或总大小,可以把计数器放在可调用对象中,而不是把状态藏在全局变量里。过滤器抛出异常时,extractall 可能已经完成前面的成员,因此目标目录应位于一次性临时目录;全部成功后再原子替换到正式位置。

四、兼容版本与发布检查

需要兼容旧解释器时,用 hasattr(tarfile, "data_filter") 检测能力,而不要只按版本号猜测,因为部分安全更新可能回补了过滤器。若能力不存在,应明确告警并阻止处理不可信归档,或把解包任务隔离到专门的低权限环境。

最后检查四件事:是否显式传入过滤器;失败目录是否会删除;日志是否保留拒绝成员名与归档标识;目标目录是否使用最小权限。过滤器只解决成员语义,不能替代磁盘配额、进程隔离和来源校验。

相关问题

可以直接把 extraction_filter 设成 data 吗?

不能把字符串写入 TarFile.extraction_filter。这个属性需要可调用对象,例如 tarfile.data_filter;字符串形式应传给 extractall(filter="data")。

FilterError 发生后需要重新打开归档吗?

通常不需要为了“继续解包”而重试同一归档。先记录拒绝成员并删除部分输出,再让上层返回清晰错误;盲目重试不会改变归档内容,反而可能重复写入已存在的文件。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
artworkout安卓能用吗?官网入口、Google Play与设备支持说明artworkout安卓能用吗?官网入口、Google Play与设备支持说明
上一篇
artworkout安卓能用吗?官网入口、Google Play与设备支持说明
人类基准反应测试和瞄准训练有什么区别?反射速度与手眼协调入口说明
下一篇
人类基准反应测试和瞄准训练有什么区别?反射速度与手眼协调入口说明
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • PubMedQA数据集详解:生物医学问答基准、功能与应用指南
    PubMedQA
    深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
    231次使用
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    276次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    246次使用
  • 斯坦福HELM:大语言模型Holistic Evaluation整体评估框架详解
    HELM
    深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
    226次使用
  • MMBench详解:多模态大模型基准测试、功能特点与使用指南
    MMBench
    MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
    24次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议 和 隐私政策
返回登录
  • 重置密码