AI Agent 记忆如何区分用户事实和临时对话
AI Agent 的“记忆”最好不要理解成一张把所有聊天都塞进去的表。真正可维护的做法是分三层:当前会话保存临时上下文,任务记录保存本次工作需要的中间状态,用户档案只保存经过确认、下次仍然有价值的事实和偏好。这样既能回答“用户刚才说了什么”,也不会把一次性的猜测变成永久事实。
官方地址:https://platform.openai.com/docs/guides/conversation-state
- 先按生命周期和归属划分 memory scope,再决定是否写入。
- 长期记忆必须带来源、置信度、有效期和可撤回信息。
- 冲突不静默覆盖,保留新旧证据;高影响变化交给用户确认。
先把记忆拆成会话、用户档案和任务记录
会话记忆的有效期通常只有当前对话,适合保存“上一条回答里的变量”或用户刚刚给出的文件名;任务记忆服务于一个明确目标,例如一次排查、一次旅行规划或一个订单处理流程;用户档案才适合保存“偏好使用中文”“默认时区是 Asia/Shanghai”这类跨任务复用的信息。三者的删除、权限和检索规则都不同,混在一起后,清理和纠错都会变得困难。

OpenAI 的会话状态文档描述的是 API 层面的多轮上下文;应用自己的长期用户记忆仍应由业务系统单独建模。这个区分很重要:API 能帮你延续会话,不等于它替你判断哪些内容值得永久保存。
用证据、范围和过期时间描述一条事实
一条可复用记忆至少要能回答五个问题:它属于谁,内容是什么,从哪里来,可信度多高,什么时候失效。不要只存一行“用户喜欢咖啡”,而应把事实拆成可解释字段:
| 字段 | 作用 | 示例 |
|---|---|---|
| scope | 决定可见范围 | session / task / user |
| source | 记录证据来源 | user-explicit / tool-result |
| confidence | 区分确认与推测 | 0.95 或 pending |
| expires_at | 避免旧事实永久有效 | 季度偏好可复核 |
from dataclasses import dataclass
from datetime import datetime
@dataclass
class MemoryItem:
# scope 控制检索边界,source 让每条事实可追溯。
scope: str
subject: str
value: str
source: str
confidence: float | None
expires_at: datetime | None
def reusable(item: MemoryItem) -> bool:
# 只有用户范围、明确来源且未过期的事实才进入长期检索。
return (item.scope == "user"
and item.source == "user-explicit"
and item.confidence is not None
and (item.expires_at is None or item.expires_at > datetime.now()))
字段不必一开始就做得很复杂,但 `source` 和 `scope` 不建议省略。没有这两个字段,后续很难回答“这句话为什么会影响当前用户”。
只让稳定且可确认的信息进入长期记忆
写入门槛可以按三档设计:用户明确说“以后都用中文”,可进入 user scope;用户在多个独立任务中重复表达同一偏好,可以进入待确认队列;模型根据语气猜出的年龄、职业或购买意向,不应直接落库。一次性计划、临时文件名、当前错误堆栈则留在 session 或 task scope,任务结束后自动清理。
写入前可采用一个简单决策表:
| 信号 | 默认处理 | 原因 |
|---|---|---|
| 用户明确声明 | 写入待复核的 user 事实 | 来源清楚,可撤回 |
| 工具返回结果 | 写入 task 事实 | 可能只对本次任务有效 |
| 模型推测 | 不写长期记忆 | 推测不是用户授权的事实 |
长期记忆还应提供删除和修改入口。尤其是身份、健康、财务等高影响信息,即使模型认为置信度很高,也应该要求更明确的确认和更严格的权限。
生成回复时分层检索,别把整库塞进上下文
检索顺序建议从近到远:先读当前会话,再读当前 task 的必要记录,最后按用户、租户和权限过滤长期事实。每一层都设置上限,并给记忆附上“仅供参考”的来源标记;当前用户的新指令优先级高于旧偏好,安全规则和业务权限又高于二者。
拼装提示词时不要把数据库原文整段注入。可以先把记忆压缩成少量键值,例如“语言=中文(用户明确,长期)”“项目=demo(当前任务)”,再让模型回答。OpenAI 文档也区分了 `previous_response_id`、conversation 与应用状态的存储边界,工程上同样应该把“延续对话”和“跨任务事实”分成两个决策。
排查错误时重点看三项:是否检索了错误 scope,是否把已过期项当成有效项,是否让旧事实覆盖了当前用户指令。很多所谓“模型记错了”,根因其实是检索层没有带过滤条件。
发生冲突时保留新旧证据并请求确认
当用户说“我现在改用英文”而旧档案仍是“偏好中文”时,不要直接删除旧记录。先保留两个版本,分别记录时间、来源和有效期;若变化只影响当前任务,就让 task scope 覆盖本次回答;若要改变长期偏好,则标记为待确认或要求用户明确说“以后都这样”。

可以把冲突记录成事件而不是覆盖字段:旧事实仍可审计,新陈述拥有新的版本号,待确认状态决定它是否进入长期检索。这样当用户纠正错误时,系统只需追加一条可信事件,不必猜测哪一行曾经被模型改写。
相关问题
会话记忆和用户记忆必须使用不同数据库吗?
不一定,但必须有清晰的 scope、权限和过期策略。即使共用数据库,也要让清理任务能单独删除会话和任务记录。
向量数据库能自动判断什么该长期保存吗?
不能。向量检索解决“相似内容找回来”,不负责事实授权、生命周期和冲突裁决,这些仍是应用层规则。
用户没有明确确认时能否保存偏好?
可以先放入短期待确认区,但不要当成稳定事实注入后续所有任务;在高影响场景中应再次询问。
Go TestMain 初始化失败后如何让测试退出
- 上一篇
- Go TestMain 初始化失败后如何让测试退出
- 下一篇
- Go crypto/rand 如何生成不可预测的随机字节
-
- 科技周边 · 人工智能 | 8小时前 | API · 错误处理 · 人工智能 · 工程实践 · 函数调用 · 参数校验 工具调用 Function Calling 幂等重试 strict Schema
- 工具调用参数校验失败后怎样安全重试
- 215浏览 收藏
-
- 科技周边 · 人工智能 | 9小时前 | API · 人工智能 · json schema · 结构化输出 · 排错 · enum 结构化输出 JSON Schema 模型API 响应校验
- 结构化输出如何处理模型返回的枚举值错误
- 345浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 |
- 本地模型量化时怎么比较 4-bit 与 8-bit 代价
- 481浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 |
- 语音转写带说话人分离时如何处理重叠发言
- 115浏览 收藏
-
- 科技周边 · 人工智能 | 1天前 |
- 扩散模型固定 seed 后为什么仍有细节差异
- 457浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 107次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 22次使用
-
- OpenCompass
- OpenCompass是上海AI实验室推出的开源大模型评测平台,提供CompassKit、CompassHub和CompassRank三大核心组件,支持LLM及多模态模型的一站式标准化评估与排行榜查询。
- 33次使用
-
- AGI-Eval
- AGI-Eval是由上海交大等高校联合发布的大模型评测社区,提供公正透明的LLM能力榜单、多领域评测集及Data Studio数据服务,助力AI模型性能评估与NLP科研开发。
- 23次使用
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 260次使用
-
- Go语言并发编程基础上下文概念详解
- 2022-12-27 109浏览
-
- Go语言上下文context底层原理
- 2023-01-22 175浏览
-
- 使用Golang的Context管理上下文的方法
- 2023-01-19 316浏览
-
- Go语言中的上下文取消操作详解
- 2022-12-28 481浏览
-
- CodeGeeX for Jetbrains IDEs正式上线!
- 2023-01-17 284浏览

