大模型批量输入为什么要设置 padding 和 attention_mask
把多条文本一起送进大模型时,最容易混淆的是 padding 和 attention_mask:前者解决“每条文本长度不同,张量无法对齐”,后者解决“补出来的位置不能被模型当成真实内容”。两者通常由 tokenizer 一起返回,再原样传给模型。
padding=True让一个 batch 内的序列变成规则矩阵,但不会截断超长文本。attention_mask中通常用 1 表示有效 token、0 表示 padding 位置;不要只传input_ids。truncation、max_length和padding_side分别处理长度上限与补齐方向,需按模型类型确认。
把不等长文本整理成可计算的批次
单条调用时,token 序列可以各自保持长度;批量调用则通常要组成形如 [batch_size, sequence_length] 的规则张量。例如一条输入被切成 6 个 token,另一条被切成 10 个 token,它们不能直接堆成同一个二维矩阵。padding=True 会把较短样本补到当前 batch 的最长长度;padding="max_length" 则补到显式指定的 max_length。
这里的 padding token 只是占位符,不代表文本真的多了几个词。批量效率和显存占用也会受到补齐长度影响:把一批长短差异很大的文本放在一起,短文本会产生更多无效位置。

让 attention_mask 标出真正有效的位置
补齐之后,模型还需要知道哪些位置应该参与注意力。tokenizer 返回的 attention_mask 通常与 input_ids 形状一致:真实 token 位置为 1,padding 位置为 0。不同模型对额外 mask 的具体处理可能不同,但“补齐位置不应被当成有效输入”是批处理的核心约束。
from transformers import AutoTokenizer, AutoModelForSequenceClassification
# 使用同一个 tokenizer 处理整个 batch,确保 input_ids 与 mask 一一对应
tokenizer = AutoTokenizer.from_pretrained("bert-base-chinese")
texts = ["这个接口返回很快", "批量输入的长度可能不同"]
batch = tokenizer(
texts,
padding=True, # 补到当前 batch 的最长序列
truncation=True, # 超过上限时按 max_length 截断
max_length=32,
return_tensors="pt"
)
# 将 tokenizer 生成的 attention_mask 一起交给模型
model = AutoModelForSequenceClassification.from_pretrained("bert-base-chinese")
outputs = model(**batch)
print(batch["input_ids"].shape)
print(batch["attention_mask"].shape)
示例中的 **batch 会把 input_ids 和 attention_mask 一起传入;如果某个模型还需要 token_type_ids,tokenizer 也可能将它放入同一个字典。排查时先检查这些键的形状是否一致,再看模型文档要求哪些输入。

同时处理超长输入与生成方向
padding 只负责“补短”,不能让超出模型最大输入长度的文本自动变短。因此通常把 truncation=True 与 max_length 一起考虑。max_length 应根据模型可接受长度、任务需要和显存预算设置;截断前要确认被舍弃的是哪一段,避免把关键指令或标签截掉。
补齐方向由 padding_side 控制,可选 "right" 或 "left"。编码任务常见右侧补齐,因而有效 token 从序列开头开始;部分自回归生成场景会采用左侧补齐,让不同样本的最新 token 对齐。但这不是可以对所有模型统一套用的规则,应查看目标模型和 tokenizer 的配置。
| 参数 | 解决的问题 | 常见边界 |
|---|---|---|
padding | 让 batch 内长度对齐 | 会增加占位 token,不负责截断 |
attention_mask | 标出有效与补齐位置 | 必须和 input_ids 同批、同形状传递 |
truncation | 处理超过上限的输入 | 可能丢失文本,需明确截断策略 |
padding_side | 决定从左侧还是右侧补齐 | 生成模型要按模型要求确认 |
把批处理配置接到模型调用和排查清单
一个稳定的批量推理封装,至少要固定 tokenizer、最大长度、补齐策略和返回张量类型,并把这些配置写入日志。出现“单条正常、批量异常”时,可以按下面顺序排查:
- 先确认是否真的传入了
attention_mask,不要手工用全 1 mask 覆盖 tokenizer 的结果。 - 比较
input_ids.shape与attention_mask.shape,两者的 batch 和序列维度必须对应。 - 确认 tokenizer 是否有可用的
pad_token;没有时不要随意拿普通词元代替,应按目标模型的官方配置处理。 - 记录
padding=True还是padding="max_length",并核对max_length是否造成过度补齐或意外截断。
如果任务是训练而不是推理,还要额外区分输入的 attention_mask 与标签的 loss mask:前者告诉模型哪些输入位置有效,后者决定哪些标签位置参与损失计算,不能因为名字相似就混用。
常见问题
padding=True 和 padding="max_length" 有什么区别?
前者默认补到当前 batch 的最长序列,通常更省无效计算;后者补到指定的 max_length,形状更固定,但可能产生更多 padding。
attention_mask 可以不传吗?
如果没有 padding,某些模型可能可以推断全 1 mask;但批量输入一旦包含补齐位置,就应优先传 tokenizer 返回的 mask,并以目标模型文档为准。
为什么设置了 padding 仍然报长度错误?
因为 padding 只会补短,不会缩短长文本。检查是否同时设置了合适的 truncation=True 和 max_length,并确认该长度不超过模型限制。
记住一句话:padding 负责把形状排整齐,attention_mask 负责告诉模型哪些位置算数;长度上限和补齐方向则是模型与任务共同决定的配置。
Go PathEscape 和 QueryEscape 有什么区别
- 上一篇
- Go PathEscape 和 QueryEscape 有什么区别
- 下一篇
- Go 正则表达式怎么提取命名分组
-
- 科技周边 · 人工智能 | 2小时前 | 人工智能 · transformers · 文本处理 · Transformers 文本分段 tokenizer max_length stride
- Transformers 文本超过最大长度怎么分段处理
- 286浏览 收藏
-
- 科技周边 · 人工智能 | 13小时前 |
- Embedding 向量归一化后应该用点积还是余弦相似度
- 103浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 |
- 多家模型 API 参数各不相同:用 LiteLLM 虚拟 Key 做路由和配额隔离
- 299浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 | oauth · 人工智能 · mcp · Agent 工程 · resource MCP OAuth 2.1 RFC 8707 token audience 远程 MCP
- MCP 远程服务器授权为什么必须带 resource:OAuth 2.1 受众绑定的最小实现
- 123浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 |
- MCP 无状态服务如何避免把业务会话塞回连接:句柄关联与请求级扩展设计
- 119浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 | API · 人工智能 · 智能体 · Responses API Open Responses agent loop Chat Completions
- Open Responses 的 agent loop 为什么不等于 Chat Completions:输入输出对象的迁移边界
- 293浏览 收藏
-
- 科技周边 · 人工智能 | 2天前 | 异步任务 · mcp · 协议扩展 · MCP Tasks io.modelcontextprotocol/tasks tasks/get tasks/update
- MCP Tasks 的异步结果怎么收口:任务句柄、轮询状态与恢复条件
- 260浏览 收藏
-
- 科技周边 · 人工智能 | 2天前 | Gemini API · AI检索 · File Search · 多模态检索 Gemini File Search media_id page_number
- Gemini File Search 多模态检索怎么留证:media_id 与 page_numbers 的引用边界
- 377浏览 收藏
-
- 科技周边 · 人工智能 | 2天前 | gemini · 上下文缓存 · API优化 · Gemini API 隐式缓存 total_cached_tokens
- Gemini API 隐式缓存怎么提高命中:公共前缀与 total_cached_tokens 核对法
- 398浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 155次使用
-
- C-Eval
- 深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
- 85次使用
-
- ClickPrompt
- ClickPrompt是一款专为AI提示词编写者设计的开源在线工具,支持Stable Diffusion绘图、ChatGPT对话及GitHub Copilot代码辅助。提供Prompt自动生成、一键运行、社区分享及可视化优化功能,帮助用户高效获取精准AI输出。
- 45次使用
-
- PromptHero
- PromptHero是专业的AI提示词搜索引擎与优化平台,支持Stable Diffusion、Midjourney等主流模型。提供海量提示词库、分类搜索、在线课程及社区互动,助力用户高效生成高质量AI图像与文本。
- 25次使用
-
- Stable Diffusion Prompt Book
- 深入解析OpenArt推出的Stable Diffusion Prompt Book,这本免费的开源提示词指南涵盖从基础语法到高级技巧,提供风格化词库与参数建议,助您优化AI绘画生成效果。
- 28次使用
-
- Python 调用大模型时如何用结构化输出校验 JSON:从解析失败到可重试
- 2026-08-29 501浏览
-
- AI写作工具免费版安装教程(含豆包Clawdbot)
- 2026-05-30 501浏览
-
- WPS AI能自动生成PPT吗?输入主题一键制作演示文稿
- 2026-05-27 501浏览
-
- Canva手机闪退解决方法及适配指南
- 2026-05-25 501浏览
-
- Hermes Agent依赖的工具链有哪些 必备工具链介绍
- 2026-05-05 501浏览

