Python csv.DictReader 遇到重复列名时怎么保存数据
CSV 导入最容易被忽略的一类脏数据,就是首行出现两个同名列。例如表头是 name,score,score,但业务上两个分数分别代表平时成绩和考试成绩。直接使用 csv.DictReader 时,两个值不会自动变成列表,后一个 score 会覆盖前一个。要保存完整数据,先判断业务语义:需要保留列的原始位置,就用 csv.reader 按下标收集;只需要继续以字典取值,就先把表头改成唯一名称。
DictReader的键来自fieldnames,普通字典不能同时保存两个同名键。- 审计、对账等场景应保留同名列的值列表;固定业务字段则适合生成稳定后缀。
restkey和restval只能处理列数不齐,不能解决重复表头本身。
先看默认行为:重复键会被后面的值覆盖
处理带有重复列名的CSV文件时,Python标准库自带的csv.DictReader默认只会保留重复列最后一个字段的值,前面同名列的内容会被直接覆盖掉,想要完整留存所有同名列的数据,可以通过修改fieldnames的生成逻辑,自动给重复的列名加有序后缀做区分,也可以重写DictReader的字段映射规则,把同名列对应的多个值直接存入列表结构里。处理重复列名的CSV无需引入第三方依赖,只用标准库的原生能力就能覆盖绝大多数场景,改完的逻辑可以兼容正常无重复列的普通CSV文件,不会产生额外的适配成本。
DictReader 没有提供“重复表头自动聚合”开关。未传入 fieldnames 时,它把第一行作为字段名;每条数据按字段名和值配对后形成一个 dict。因此相同的 score 只能留下一个键,读取结果看起来正常,却已经少了一列。
import csv from io import StringIO csv_text = "name,score,score\nAlice,80,92\n" reader = csv.DictReader(StringIO(csv_text)) # 先查看表头,再观察同名键的覆盖结果 print(reader.fieldnames) print(next(reader))
这个例子中,fieldnames 仍会显示两个 score,但记录是字典,最终只能通过一个 score 访问。问题不在 CSV 解析器把列读少了,而在列名被用作字典键后发生了覆盖。
用 csv.reader 保留重复列名的每个值
如果两个同名列都重要,建议先用 csv.reader 读取原始列序,再建立“表头到下标列表”的映射。这样既保留列的顺序,也能把 score 变成 ["80", "92"]。对于对账、追溯和数据清洗,这种结构比擅自命名更稳妥。

import csv
from io import StringIO
csv_text = "name,score,score\nAlice,80,92\n"
rows = csv.reader(StringIO(csv_text))
headers = next(rows)
# 为每个表头记录所有出现位置,不让重复键互相覆盖
positions = {}
for index, header in enumerate(headers):
positions.setdefault(header, []).append(index)
for values in rows:
record = {
header: [values[i] if i
输出里的 score 是值列表。若业务还需要区分“第一个 score”和“第二个 score”,可以继续使用下标,或把映射保存为元数据,不要在导入阶段凭猜测改写含义。
预处理表头再交给 DictReader
如果下游代码习惯写 row["score_2"],可以在创建 DictReader 前规范化表头。传入自定义 fieldnames 后,原始表头行会被当作普通数据行,所以要先用 csv.reader 消费它,再交给 DictReader。

import csv
from io import StringIO
def unique_headers(headers):
seen = {}
result = []
for raw in headers:
name = raw.strip() or "unnamed"
seen[name] = seen.get(name, 0) + 1
# 第一次保留原名,后续出现使用可预测的序号后缀
result.append(name if seen[name] == 1 else f"{name}_{seen[name]}")
return result
csv_text = "name,score,score\nAlice,80,92\n"
stream = StringIO(csv_text)
raw_headers = next(csv.reader(stream))
fieldnames = unique_headers(raw_headers)
reader = csv.DictReader(stream, fieldnames=fieldnames,
restkey="_extra", restval="")
for row in reader:
print(row["score"], row["score_2"])
这个方案的关键不是简单加后缀,而是保证规则稳定:同一份数据每次都得到相同字段名,并把空表头变成可识别的 unnamed。如果字段名来自外部文件,后续还应把最终 fieldnames 记录到导入日志。
列数不齐时,再用 restkey 和 restval 做边界处理
重复表头与列数不齐是两种问题。DictReader 的 restkey 会接住一行里多出来的值,restval 会填补字段名多于数据值的缺口。它们不能让两个同名键共存,因此不能替代表头规范化或按下标保存。
| 输入情况 | 建议检查 | 保存策略 |
|---|---|---|
| 同名列都有业务含义 | 记录每个列下标 | csv.reader + 值列表 |
| 下游依赖字典键 | 规范化后表头是否稳定 | fieldnames + 唯一后缀 |
| 多余或缺失列 | _extra 与缺省值 | 记录异常并决定拒绝或修复 |
生产导入前可以先检查空表头、重复字段和每行列数;发现不符合契约时,把文件标为待处理比静默吞掉数据更安全。打开文件时记得使用 newline="",必要时显式指定 encoding,避免换行和编码问题掩盖真正的列结构问题。
常见问题
重复列名能不能直接让 DictReader 返回列表?
不能直接配置。要返回列表,先用 csv.reader 按列位置聚合,或者自行生成唯一的 fieldnames 后再读取。
只修改 fieldnames 就够了吗?
不够。传入 fieldnames 时首行不会自动丢弃,会作为第一条数据返回,所以必须先消费原始表头。
后缀应该用数字还是原始业务名?
没有统一答案。若文件来源稳定,可以映射为 score_written、score_exam;无法判断语义时使用 score_2 并保留原始表头,避免编造业务含义。
选择原则可以压缩成一句话:要数据完整性就保留列位置,要兼容字典代码就先生成唯一键;无论哪种方式,都要把重复表头当成输入契约的一部分显式处理。
Go time.ParseDuration 解析小时分钟混合值失败怎么办
- 上一篇
- Go time.ParseDuration 解析小时分钟混合值失败怎么办
- 下一篇
- Go http.Cookie MaxAge 设为负数时浏览器怎么处理删除
-
- 文章 · python教程 | 2小时前 |
- Python sqlite3 事务提交后游标还能不能继续使用
- 181浏览 收藏
-
- 文章 · python教程 | 4小时前 | 缓存 · python · dataclasses · dataclass default_factory frozen=True
- Python dataclass frozen=True 里怎么保存可变缓存
- 256浏览 收藏
-
- 文章 · python教程 | 6小时前 |
- Python pathlib.glob 怎么排除隐藏目录并保持递归
- 142浏览 收藏
-
- 文章 · python教程 | 10小时前 | python · logging · 结构化日志 · Python logging LoggerAdapter
- Python logging 多模块共享上下文时怎么用 LoggerAdapter
- 215浏览 收藏
-
- 文章 · python教程 | 11小时前 |
- Python frozen dataclass 里怎么保存派生字段
- 213浏览 收藏
-
- 文章 · python教程 | 12小时前 |
- Python dataclass 如何用 InitVar 接收临时构造参数
- 264浏览 收藏
-
- 文章 · python教程 | 13小时前 |
- Python sqlite3 多线程共享连接时报错怎么改
- 264浏览 收藏
-
- 文章 · python教程 | 15小时前 |
- Python sqlite3 with 代码块退出后为什么没有提交数据
- 488浏览 收藏
-
- 文章 · python教程 | 16小时前 | 并发 · 日志 · Python教程 · 多进程 · 排障 · Python Fork multiprocessing 多进程日志 spawn QueueHandler QueueListener
- Python 多进程日志互相交错时怎么设计输出
- 300浏览 收藏
-
- 文章 · python教程 | 17小时前 |
- Python multiprocessing spawn 下子进程重复导入怎么处理
- 107浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 29次使用
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 184次使用
-
- C-Eval
- 深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
- 120次使用
-
- AI Prompt Library
- 探索AI Prompt Library免费资源库,涵盖营销、写作及多场景AI提示词。兼容ChatGPT、Claude等工具,一键复制优化输出,提升工作效率。
- 46次使用
-
- Generrated
- Generrated汇集9300+张DALL·E生成图像及对应提示词,支持查看完整图集、对比DALL·E 2与3版本差异,是AI绘图新手学习Prompt设计与获取创作灵感的实用工具。
- 27次使用
-
- go格式“占位符”输入输出 类似python的input
- 2023-01-19 346浏览
-
- Golang如何调用Python代码详解
- 2023-01-07 235浏览
-
- HTTP 的 response 中的响应体和头部是分开发送的吗?
- 2023-01-28 387浏览
-
- B站等视频网站的弹幕用的是 websocket 还是轮询?
- 2023-02-16 447浏览
-
- Linux 下有什么命令行工具以时序显示 CPU 占用率?
- 2023-01-13 360浏览

