Python pathlib.Path.rglob 如何排除隐藏目录:递归扫描与过滤边界
用 pathlib.Path.rglob() 扫描项目目录时,最容易踩的坑不是“能不能递归”,而是隐藏目录会不会被一起带进结果。稳妥做法是先让 rglob() 产生路径,再按每个路径的 parts 过滤隐藏目录;如果只想排除目录、保留 .env.example 这类隐藏文件,就不要只检查文件名开头。
rglob()本身不会替你定义“隐藏目录”的业务规则。把路径拆成parts,在结果层排除任意祖先目录以点号开头的路径,边界最清楚。
- 先递归,再过滤,别把匹配模式当成目录策略。
- 用
path.is_file()区分目录和文件。 - 检查相对路径的
parts[:-1],排除任意层级隐藏目录。 - 需要保留
.env.example时,把隐藏目录和隐藏文件拆成两条规则。
rglob 返回什么,决定了过滤应该放在哪里
Path.rglob('*.py') 返回的是匹配到的 Path 对象,不是只包含文件名的字符串。它会从起点目录向下查找,匹配模式负责“找什么”,却不负责表达你的目录策略。
from pathlib import Path
root = Path('demo-project')
for path in root.rglob('*.py'):
print(path)
如果目录结构里有 .venv/lib/python3.12/site.py 或 .cache/generated.py,这些路径仍可能出现在匹配结果里。此时再用 path.name.startswith('.') 过滤不够,因为它只能看最后一级名称,挡不住隐藏祖先目录。

按 parts 排除任意层级的隐藏目录
下面的函数保留普通目录中的 Python 文件,同时跳过路径中任意一级以点号开头的目录。path.parts 让规则不依赖操作系统的路径分隔符,过滤条件也能直接读出来。
from pathlib import Path
def visible_python_files(root: Path) -> list[Path]:
files = []
for path in root.rglob('*.py'):
if path.is_file() and not any(part.startswith('.') for part in path.parts):
files.append(path)
return files
这里有一个容易忽略的细节:如果 root 本身是 .workspace,它也会出现在 path.parts 中,于是所有结果都会被排除。更适合通用工具的写法,是只检查相对于根目录的部分。
def visible_python_files(root: Path) -> list[Path]:
files = []
for path in root.rglob('*.py'):
relative = path.relative_to(root)
hidden_parent = any(
part.startswith('.') for part in relative.parts[:-1]
)
if path.is_file() and not hidden_parent:
files.append(path)
return files

想保留隐藏文件时,目录和文件必须分开判断
例如项目里有 .env.example,它是隐藏文件,不一定应该被排除。过滤祖先目录时使用 relative.parts[:-1],故意不检查最后一个文件名,就能保留它:
root = Path('demo-project')
for path in root.rglob('*'):
relative = path.relative_to(root)
in_hidden_dir = any(part.startswith('.') for part in relative.parts[:-1])
if path.is_file() and not in_hidden_dir:
print(path)
若需求变成“隐藏目录和隐藏文件都不要”,再额外增加 not path.name.startswith('.')。不要把两种规则揉成一个模糊的正则,否则后面很难解释为什么配置样例被过滤掉。
符号链接、根目录和结果验收
扫描工具还要明确是否跟随符号链接、根目录是否允许是隐藏目录,以及结果是否需要排序。目录规模较大时,建议先把路径转成相对路径,再排序后交给后续打包或分析逻辑:
def scan(root: Path) -> list[Path]:
result = []
for path in root.rglob('*.py'):
relative = path.relative_to(root)
if path.is_file() and not any(
part.startswith('.') for part in relative.parts[:-1]
):
result.append(relative)
return sorted(result)
验收时至少准备三组样本:普通目录中的文件、隐藏目录中的文件、普通目录中的隐藏文件。预期分别是保留、排除、保留。这样测试的是过滤边界,而不是只证明 rglob() 能递归。
常见问题
path.name.startswith('.') 能替代 parts 判断吗?
不能。它只判断当前路径最后一级名称,无法排除 .cache/generated.py 这样的隐藏祖先目录。
为什么示例要先 relative_to(root)?
这样不会把隐藏的根目录名称误当成子目录规则,过滤范围只针对根目录之下的相对路径。
是否应该直接用字符串拼接路径?
不建议。Path 的 parts、relative_to() 和 is_file() 能把平台差异和文件类型判断写得更明确。
小结
rglob() 负责递归匹配,隐藏目录是否跳过应由调用方定义。以根目录为基准取得相对路径,检查 parts[:-1],再结合 is_file(),既能跳过任意层级的隐藏目录,也能按需保留 .env.example 这类隐藏文件。
Go iter.Pull2 如何安全提前停止:双序列拉取与退出回收边界
- 上一篇
- Go iter.Pull2 如何安全提前停止:双序列拉取与退出回收边界
- 下一篇
- Go os.File.WriteAt 能否并发写入:独立偏移、短写处理与文件验收
-
- 文章 · python教程 | 2小时前 |
- Python contextlib.ExitStack 怎么管理动态资源:批量打开与异常回收
- 441浏览 收藏
-
- 文章 · python教程 | 5小时前 | 并发 · 缓存 · 性能 · python · Python 并发缓存 functools.lru_cache cache_info
- Python functools.lru_cache 的并发语义:缓存命中与重复计算边界
- 168浏览 收藏
-
- 文章 · python教程 | 10小时前 |
- Python asyncio TaskGroup 如何收口异常:取消传播与部分结果处理
- 446浏览 收藏
-
- 文章 · python教程 | 13小时前 | 日志 · 调试 · python · 多线程 · QueueListener Python QueueHandler 日志递归 队列日志
- Python logging.handlers.QueueHandler 为什么会递归:队列日志、线程边界与安全配置
- 306浏览 收藏
-
- 文章 · python教程 | 16小时前 | 数据校验 · Python教程 · dataclasses · 类型标注 · Python 数据类 dataclasses InitVar __post_init__
- Python dataclasses InitVar 如何把初始化参数传给 __post_init__:字段边界、校验顺序与序列化
- 147浏览 收藏
-
- 文章 · python教程 | 17小时前 | 日志 · 调试 · 异常处理 · python · 错误报告 异常链 Python traceback.TracebackException capture_locals
- Python traceback.TracebackException 怎么生成可控错误报告:异常链、局部变量与日志边界
- 179浏览 收藏
-
- 文章 · python教程 | 18小时前 | 缓存 · 性能优化 · python · Python 内存 lru_cache functools.cache
- Python functools.cache 与 lru_cache(maxsize=None) 的内存增长:命中率之外怎么做上限验收
- 391浏览 收藏
-
- 文章 · python教程 | 19小时前 | 日志 · python · 运维 · logging · RotatingFileHandler · 多进程日志 日志滚动 Python logging.handlers RotatingFileHandler 备份数量
- Python logging.handlers 如何按大小滚动日志:备份数量、编码设置与多进程边界
- 458浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- ljg-skills
- ljg-skills 是李继刚开源的 AI 技能与提示词集合,面向大模型使用者整理了一批可复用的 prompt、角色设定和任务技能模板,适合用于学习提示词设计、搭建个人 AI 工作流和沉淀团队常用智能体能力。
- 5313次使用
-
- MELO音乐
- MELO音乐是一站式AI视频与音乐制作助手,对标suno, udio的高品质体验。提供伴奏生成、原创写词、无损导出、哼唱识曲、混音变声等全套音频与短视频编辑工具。无论是流行Kpop、电音说唱、民谣古风、摇滚儿歌还是商用轻音乐,MELO为你免费谱曲,轻松做同款!
- 4831次使用
-
- UniScribe
- UniScribe 是一款 AI 音视频转文字与内容整理工具,支持上传音频、视频文件或粘贴 YouTube 链接,自动生成转写文本、摘要、思维导图和关键问题,并支持多格式导出,适合会议记录、课程学习、访谈整理和内容创作复盘。
- 4771次使用
-
- 剧云
- 剧云是专业中文剧本创作平台,安全稳定运行十余年,集成AI编剧、剧本医生审核、人物小传、剧情关系图、大纲编写、多人协作、Word导入导出、版权管控功能,数据安全防护,轻松高效创作剧本。
- 5032次使用
-
- 万象有声
- 万象有声,一个专为有声创作者打造的新一代智能有声内容创作平台。平台提供专业的智能拆章、智能画本编辑、AI配音、AI生成音效、后期制作、智能对轨、智能审听等有声创作全流程工具,可以帮助创作者高效、低成本创作出引人入胜的有声作品。立即体验,让有声书制作更简单!
- 4978次使用
-
- go格式“占位符”输入输出 类似python的input
- 2023-01-19 346浏览
-
- Golang如何调用Python代码详解
- 2023-01-07 235浏览
-
- HTTP 的 response 中的响应体和头部是分开发送的吗?
- 2023-01-28 387浏览
-
- B站等视频网站的弹幕用的是 websocket 还是轮询?
- 2023-02-16 447浏览
-
- Linux 下有什么命令行工具以时序显示 CPU 占用率?
- 2023-01-13 360浏览

