当前位置:首页 > 文章列表 > 文章 > python教程 > Polars 中如何对结构体列的字段进行前向/后向填充并重置外层空值?

Polars 中如何对结构体列的字段进行前向/后向填充并重置外层空值?

2026-08-20 19:45:32 0浏览 收藏

在 Polars 中,直接对 struct 列使用 with_fields() 无法消除外层 null —— 即使内部字段已填充,整个 struct 仍可能为 null;正确做法是用 pl.struct() 重建列,显式指定已填充的字段,从而重置外层空值状态。

Polars 中如何对结构体列的字段进行前向/后向填充并重置外层空值?

在 Polars 里,如果直接对 struct 列调用 `with_fields()`,外层的 null 状态其实不会被顺手清掉。也就是说,哪怕里面的字段已经补齐了,整个 struct 依然可能还是 null。更稳妥、也更正确的处理方式,是用 `pl.struct()` 把这列重新构建一遍,明确传入那些已经填充好的字段,这样才能真正把外层的空值状态重置掉。

在 Polars 里处理嵌套结构,比如 struct 列时,如果想对里面某些字段(像 "a" 或 "b")做 forward_fill() 和 backward_fill(),很多人都会先踩到一个坑:直接使用 .struct.with_fields()。问题在于,这个方法只会更新 struct 内部各字段的值,但并不会改掉 struct 列本身的 nullability。也就是说,某一行的 struct 如果原本就是 null,哪怕通过 with_fields() 把它的所有子字段都“补齐”了,这一行最终依旧还是 null,原因很简单——struct 外层这个空值状态,根本没有被真正移除。

这正是原代码输出中仍存在 null 的根本原因:

# ❌ 错误:仅更新字段,不解决外层 null
pl.col("df1").struct.with_fields(
pl.field("a").forward_fill().backward_fill(),
pl.field("b").forward_fill().backward_fill(),
)

✅ 正确解法是完全重建 struct 列:提取各字段、分别填充、再用 pl.struct() 组合成新列。这样 Polars 会基于新字段的值推断外层 null 状态,从而真正实现“全列填充”。

以下是修复后的完整示例:

import polars as pl

df1 = pl.LazyFrame({
"dt": ["2024-08-30", "2024-08-02", "2024-09-03", "2024-09-04"],
"df1": {"a": [0.1, 0.2, 0.3, 0.1], "b": [0, -1, 2, 1]},
}).with_columns(pl.col("dt").str.to_datetime("%Y-%m-%d"))

df2 = pl.LazyFrame({
"dt": ["2024-08-29", "2024-08-30", "2024-09-02", "2024-09-03"],
"df2": {"a": [100, 120, -80, 20], "b": [1, -2, 0, 0]},
}).with_columns(pl.col("dt").str.to_datetime("%Y-%m-%d"))

df = pl.concat([df1, df2], how="align")

# ✅ 正确:重建 struct 列,重置外层 null
df_filled = df.with_columns(
*[
pl.struct(
pl.col(c).struct.field("a").forward_fill().backward_fill().alias("a"),
pl.col(c).struct.field("b").forward_fill().backward_fill().alias("b"),
).alias(c)
for c in ["df1", "df2"]
]
)

result = df_filled.collect()
print(result)

输出将严格匹配预期:

┌─────────────────────┬───────────┬───────────┐
│ dt┆ df1 ┆ df2 │
│ --- ┆ --- ┆ --- │
│ datetime[μs]┆ struct[2] ┆ struct[2] │
╞═════════════════════╪═══════════╪═══════════╡
│ 2024-08-02 00:00:00 ┆ {0.2,-1}┆ {100,1} │
│ 2024-08-29 00:00:00 ┆ {0.2,-1}┆ {100,1} │
│ 2024-08-30 00:00:00 ┆ {0.1,0} ┆ {120,-2}│
│ 2024-09-02 00:00:00 ┆ {0.1,0} ┆ {-80,0} │
│ 2024-09-03 00:00:00 ┆ {0.3,2} ┆ {20,0}│
│ 2024-09-04 00:00:00 ┆ {0.1,1} ┆ {20,0}│
└─────────────────────┴───────────┴───────────┘

? 进阶提示:若只需填充某一字段(如仅 "a"),可保留另一字段原值,避免冗余计算:

pl.struct(
pl.col("df1").struct.field("a").forward_fill().backward_fill().alias("a"),
pl.col("df1").struct.field("b").alias("b"),# 不填充 b 字段
).alias("df1")

⚠️ 注意事项:

  • forward_fill() / backward_fill() 默认按行顺序填充,不依赖时间索引;若需按时间对齐填充(如按 dt 排序后填充),请先 .sort("dt");
  • pl.struct(...).alias(c) 是关键:它创建全新列,绕过旧列的 null mask;
  • LazyFrame 下操作高效,.collect() 仅在最后触发计算。

掌握这一模式,即可精准控制 struct 列中任意字段的填充行为,同时确保整列逻辑一致性。

Numpy索引与切片深度解析:理解基础索引、高级索引及维度广播规则Numpy索引与切片深度解析:理解基础索引、高级索引及维度广播规则
上一篇
Numpy索引与切片深度解析:理解基础索引、高级索引及维度广播规则
如何将多个来源的网站列合并为单一列并保留其他字段信息
下一篇
如何将多个来源的网站列合并为单一列并保留其他字段信息
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • PubMedQA数据集详解:生物医学问答基准、功能与应用指南
    PubMedQA
    深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
    338次使用
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    397次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    392次使用
  • 斯坦福HELM:大语言模型Holistic Evaluation整体评估框架详解
    HELM
    深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
    355次使用
  • MMBench详解:多模态大模型基准测试、功能特点与使用指南
    MMBench
    MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
    181次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议 和 隐私政策
返回登录
  • 重置密码