Python tarfile extraction_filter 怎么阻止危险路径
如果 tar 包来自上传接口、构建产物或外部依赖,解包时不要只写 extractall(target)。更稳妥的做法是显式传入 filter="data":它会限制绝对路径、目录穿越、越界链接、设备文件和一部分危险元数据。业务还有文件数量、目录深度等要求时,再在官方过滤器之上增加一个 callable。
- 不可信归档优先使用
filter="data",不要把fully_trusted当默认安全方案。 extraction_filter是 TarFile 的可调用默认策略,不能写成字符串。- 过滤器抛错后可能已经留下部分文件,必须使用临时目录并在失败时清理。

一、先显式选择 data 过滤器
Python 的过滤器能力在 Python 3.12 引入,并在部分旧版本中以安全更新形式回补。对跨版本程序,优先用能力检测;对明确支持该能力的运行环境,直接传入命名过滤器即可。
import tarfile
from pathlib import Path
archive_path = Path("incoming/bundle.tar.gz")
target = Path("work/extracted")
target.mkdir(parents=True, exist_ok=True)
# data 过滤器限制绝对路径、越界链接和设备文件等风险
with tarfile.open(archive_path, "r:gz") as tar:
tar.extractall(target, filter="data")
fully_trusted 适合你完全信任归档,或已经实现复杂检查的场景;它不是上传文件解包的通用安全选项。Python 3.12 和 3.13 在未明确设置过滤器时会发出弃用警告,Python 3.14 起默认趋向 data,但应用仍应把策略写在调用点,避免依赖运行时默认值。
二、data_filter 到底阻止了什么
过滤器会在每个成员真正写入磁盘前收到 TarInfo 和目标路径。它可以返回调整后的成员、返回 None 跳过成员,或抛出异常终止流程。data 策略重点是把归档当作跨平台数据包:链接不能指向目标目录外,设备文件和管道不应被释放,属主信息也不会原样带入。
这解决的是“归档成员携带危险语义”的问题,不等于替应用完成所有资源限制。大归档仍可能耗尽磁盘,合法文件也可能造成过深目录、过多小文件或业务目录污染,所以还要增加应用自己的上限。
import tarfile
try:
with tarfile.open("incoming/bundle.tar", "r") as tar:
# 显式传入 data,避免跟随不同 Python 版本的默认行为
tar.extractall("work/extracted", filter="data")
except tarfile.FilterError as exc:
# 记录被拒绝的成员名,日志中不要写入归档内容本身
member_name = getattr(exc.member, "name", "unknown")
print(f"拒绝归档成员: {member_name}")
三、用自定义过滤器补上业务限制
不要重新手写路径规范化逻辑来替换官方过滤器。更可靠的顺序是先调用 tarfile.data_filter,再对返回的 TarInfo 增加业务限制。例如,导入包只允许有限层级和少数扩展名;超过边界就抛出 FilterError,让调用方知道这不是普通文件读取失败。

import tarfile
ALLOWED_SUFFIXES = {".json", ".yaml", ".txt"}
def import_filter(member: tarfile.TarInfo, destination: str) -> tarfile.TarInfo | None:
# 先复用官方策略,避免遗漏链接、设备文件等危险语义
safe_member = tarfile.data_filter(member, destination)
name = safe_member.name
# 业务包只接受有限目录深度和配置类文件
if name.count("/") > 6:
raise tarfile.FilterError("目录层级超过导入上限")
if safe_member.isfile() and safe_member.name.lower().endswith(tuple(ALLOWED_SUFFIXES)) is False:
return None # 跳过不需要导入的普通文件
return safe_member
with tarfile.open("incoming/config.tar", "r") as tar:
# 过滤器按成员调用,返回 None 的成员不会写入目标目录
tar.extractall("work/config", filter=import_filter)
如果业务需要统计成员数量或总大小,可以把计数器放在可调用对象中,而不是把状态藏在全局变量里。过滤器抛出异常时,extractall 可能已经完成前面的成员,因此目标目录应位于一次性临时目录;全部成功后再原子替换到正式位置。
四、兼容版本与发布检查
需要兼容旧解释器时,用 hasattr(tarfile, "data_filter") 检测能力,而不要只按版本号猜测,因为部分安全更新可能回补了过滤器。若能力不存在,应明确告警并阻止处理不可信归档,或把解包任务隔离到专门的低权限环境。
最后检查四件事:是否显式传入过滤器;失败目录是否会删除;日志是否保留拒绝成员名与归档标识;目标目录是否使用最小权限。过滤器只解决成员语义,不能替代磁盘配额、进程隔离和来源校验。
相关问题
可以直接把 extraction_filter 设成 data 吗?
不能把字符串写入 TarFile.extraction_filter。这个属性需要可调用对象,例如 tarfile.data_filter;字符串形式应传给 extractall(filter="data")。
FilterError 发生后需要重新打开归档吗?
通常不需要为了“继续解包”而重试同一归档。先记录拒绝成员并删除部分输出,再让上层返回清晰错误;盲目重试不会改变归档内容,反而可能重复写入已存在的文件。
artworkout安卓能用吗?官网入口、Google Play与设备支持说明
- 上一篇
- artworkout安卓能用吗?官网入口、Google Play与设备支持说明
- 下一篇
- 人类基准反应测试和瞄准训练有什么区别?反射速度与手眼协调入口说明
-
- 文章 · python教程 | 4小时前 |
- Python pathlib.Path.walk 怎么剪枝目录遍历
- 159浏览 收藏
-
- 文章 · python教程 | 7小时前 | python · SQLite · Python sqlite3 autocommit isolation_level SQLite事务
- Python sqlite3 autocommit 与 isolation_level 怎么配合
- 378浏览 收藏
-
- 文章 · python教程 | 11小时前 | 并发 · 异步编程 · Python教程 · Python 任务调度 asyncio eager_task_factory
- Python asyncio eager task factory 什么时候会改变执行顺序
- 497浏览 收藏
-
- 文章 · python教程 | 14小时前 |
- Python zoneinfo部署时区数据缺失的兼容处理
- 378浏览 收藏
-
- 文章 · python教程 | 1天前 |
- Python functools.cache与lru_cache按场景选择的参数清单
- 211浏览 收藏
-
- 文章 · python教程 | 2天前 | python ·
- Python multiprocessing共享状态与进程安全队列的选择
- 316浏览 收藏
-
- 文章 · python教程 | 3天前 |
- Python re用分组字典解析可选日志字段的实现
- 470浏览 收藏
-
- 文章 · python教程 | 3天前 | JSON · python · Python NaN json.loads Infinity parse_constant
- Python json.loads解析非标准数字的容错边界
- 267浏览 收藏
-
- 文章 · python教程 | 6天前 |
- Python csv.DictReader处理缺失列与额外列的办法
- 105浏览 收藏
-
- 文章 · python教程 | 6天前 |
- Python logging按请求注入上下文字段的过滤器方案
- 324浏览 收藏
-
- 文章 · python教程 | 6天前 | Python教程 · Python 泛型 callable typing.Protocol 结构化子类型
- Python typing.Protocol配合泛型描述可调用对象的方式
- 355浏览 收藏
-
- 文章 · python教程 | 6天前 |
- Python sqlite3事务提交与异常回滚的上下文写法
- 357浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- PubMedQA
- 深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
- 231次使用
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 276次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 246次使用
-
- HELM
- 深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
- 226次使用
-
- MMBench
- MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
- 24次使用
-
- zap接收gin框架默认的日志并配置日志归档示例
- 2023-01-07 335浏览
-
- go格式“占位符”输入输出 类似python的input
- 2023-01-19 346浏览
-
- Golang如何调用Python代码详解
- 2023-01-07 235浏览
-
- Go archive/tar 怎么保留目录结构解包到指定目录
- 2026-09-07 136浏览
-
- Go tar.Reader 如何跳过目录条目后解压文件
- 2026-09-12 189浏览

