直接回答:参照认知科学分三层:工作记忆即当前上下文窗口(系统提示、最近对话、中间结果),靠 prompt 组织;短期记忆跨会话内多轮任务的中间状态(已做步骤、暂存结论),用摘要或结构化状态对象维护;长期记忆跨会话的用户偏好、历史经验、领域事实,落向量库或 KV 存储按需检索注入。

展开解析:工程实现要点:工作记忆是稀缺资源,核心是“什么该留在上下文”——系统指令常驻,中间结果滚动摘要(每 N 步把历史压缩成进展小结),工具返回做裁剪只留相关字段。短期记忆防跑偏:多步任务显式维护一个 state 对象(目标、已完成、待办、关键发现),每步更新并注入上下文,模型就不会“忘了之前干过什么”。长期记忆两条路:语义检索(embedding 召回相关记忆片段,注意召回质量差会污染上下文)与结构化档案(用户画像、偏好键值对,精确可控)。记忆的写入比读取更难:什么值得记(用户明确说的偏好 > 单次行为推断)、何时记(会话结束异步提炼)、如何更新(冲突时新覆盖旧还是保留多版本)。评测记忆系统看两条:该记住的召回率、不该记的干扰率——塞一堆不相关记忆比没记忆更糟。

追问方向:记忆检索失败如何兜底?多 Agent 之间记忆如何共享与隔离?

(约 460 字)