当前位置:首页 > 文章列表 > 文章 > python教程 > Python pathlib 批量整理文件实战:按扩展名归档和冲突重命名

Python pathlib 批量整理文件实战:按扩展名归档和冲突重命名

来源:17golang原创 2026-06-13 02:56:38 0浏览 收藏

下载目录、导出报表目录、截图目录,用久了以后很容易堆成一片:PDF、图片、压缩包、Excel、临时文件混在一起。手动整理不难,但重复做就很烦,而且容易误拖文件。

Python 的 pathlib 很适合写这类小工具。它把路径当成对象来处理,比拼字符串更清晰。本文用一个“按扩展名整理下载目录”的场景,演示如何扫描文件、创建目录、处理同名冲突、移动文件并记录日志。

摘要

本文会从混乱目录的整理问题讲起,用 pathlib.Path 获取文件列表,根据后缀映射到分类目录,再用安全重命名避免覆盖已有文件,最后把每次移动记录到日志中,方便回查。

适合人群

  • 想用 Python 写本地文件整理脚本的初中级开发者。
  • 经常处理下载目录、报表目录、截图目录的办公自动化用户。
  • 已经掌握基础 Python 语法,希望熟悉 pathlib 的读者。

目录

  1. 先明确整理规则
  2. 用 pathlib 扫描目录
  3. 按扩展名映射目标目录
  4. 处理同名文件冲突
  5. 移动文件并写入日志
  6. 常见坑和总结

一、先明确整理规则

脚本动文件之前,先把规则写清楚。比如下载目录里常见的文件可以这样分类:

  • .png.webp.gif 放到 images
  • .pdf.docx.xlsx 放到 documents
  • .zip.tar.gz 放到 archives
  • 未知后缀放到 others

如果不先定义规则,脚本很容易写成“看到什么处理什么”,后面维护起来会很乱。

下载目录文件混杂导致手动整理容易出错的逻辑图

二、用 pathlib 扫描目录

Path.iterdir() 可以列出目录下的直接子项。我们只处理文件,跳过目录。

from pathlib import Path

source_dir = Path.home() / "Downloads"

for item in source_dir.iterdir():
    if item.is_file():
        print(item.name, item.suffix.lower())

suffix 会返回文件后缀,例如 .pdf。这里统一转成小写,是为了让 .PNG.png 使用同一套规则。

三、按扩展名映射目标目录

把分类规则写成字典,脚本会更容易改:

from pathlib import Path

CATEGORY_MAP = {
    ".png": "images",
    ".webp": "images",
    ".gif": "images",
    ".pdf": "documents",
    ".docx": "documents",
    ".xlsx": "documents",
    ".zip": "archives",
    ".tar": "archives",
    ".gz": "archives",
}

def target_folder(file_path: Path) -> str:
    suffix = file_path.suffix.lower()
    return CATEGORY_MAP.get(suffix, "others")

如果以后要新增 .csv.pptx,只需要改字典,不需要改移动逻辑。

四、处理同名文件冲突

移动文件前必须处理同名冲突。比如 report.pdf 已经在目标目录里,新的 report.pdf 不能直接覆盖。

from pathlib import Path

def unique_path(target: Path) -> Path:
    if not target.exists():
        return target

    stem = target.stem
    suffix = target.suffix
    parent = target.parent

    index = 1
    while True:
        candidate = parent / f"{stem}-{index}{suffix}"
        if not candidate.exists():
            return candidate
        index += 1

这段函数会把冲突文件改成 report-1.pdfreport-2.pdf 这样的形式,避免覆盖历史文件。

Python pathlib 扫描文件、分类目录、冲突重命名和记录日志的流程图

五、移动文件并写入日志

下面把扫描、分类、重命名和日志串起来:

from pathlib import Path
import shutil
from datetime import datetime

def organize_files(source_dir: Path) -> None:
    log_path = source_dir / "organize.log"

    with log_path.open("a", encoding="utf-8") as log:
        for item in source_dir.iterdir():
            if not item.is_file():
                continue
            if item.name == log_path.name:
                continue

            folder_name = target_folder(item)
            target_dir = source_dir / folder_name
            target_dir.mkdir(exist_ok=True)

            target = unique_path(target_dir / item.name)
            shutil.move(str(item), str(target))

            now = datetime.now().strftime("%Y-%m-%d %H:%M:%S")
            log.write(f"{now} | {item.name} -> {target.relative_to(source_dir)}\n")

if __name__ == "__main__":
    organize_files(Path.home() / "Downloads")

日志大致会长这样:

2026-06-13 10:20:01 | report.pdf -> documents/report.pdf
2026-06-13 10:20:01 | report.pdf -> documents/report-1.pdf
2026-06-13 10:20:02 | demo.png -> images/demo.png

有了日志,后续发现移动结果不符合预期时,至少能快速知道每个文件去了哪里。

六、常见坑和总结

1. 先在测试目录跑

批量移动文件前,建议复制一小份样例目录测试规则,确认分类、重命名和日志都符合预期后,再对真实目录运行。

2. 不要处理脚本自己的日志文件

日志文件通常放在源目录里,如果不跳过它,脚本可能把日志移动到 others,后续记录就乱了。

3. 后缀不是文件类型的绝对保证

本文按后缀归类,适合普通整理场景。如果涉及安全校验,还需要结合文件头、MIME 或业务规则进一步判断。

4. 移动前保留可回查信息

批量整理不是一次性动作,日志和冲突重命名都很重要。它们能降低误覆盖和误移动带来的损失。

总结一下,pathlib 能让本地路径处理更清楚:扫描用 iterdir,后缀用 suffix,目录创建用 mkdir,路径拼接用 /。再加上冲突重命名和日志记录,一个实用的批量文件整理脚本就比较稳了。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Go JSON 配置解析实战:结构体标签、默认值和未知字段检查Go JSON 配置解析实战:结构体标签、默认值和未知字段检查
上一篇
Go JSON 配置解析实战:结构体标签、默认值和未知字段检查
Redis 热 Key 治理实战:发现访问倾斜、拆分缓存和本地兜底
下一篇
Redis 热 Key 治理实战:发现访问倾斜、拆分缓存和本地兜底
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • PubMedQA数据集详解:生物医学问答基准、功能与应用指南
    PubMedQA
    深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
    183次使用
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    239次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    193次使用
  • 斯坦福HELM:大语言模型Holistic Evaluation整体评估框架详解
    HELM
    深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
    174次使用
  • CMMLU中文大模型评估基准:功能、使用教程与应用场景解析
    CMMLU
    深入了解CMMLU中文评估基准,涵盖67个学科主题,提供数据集下载、Zero-shot/Five-shot评估方法及排行榜,助力优化中文语言模型性能。
    163次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码