Fri Jul 24 2026 08:00:00 GMT+0800 (China Standard Time)·2 min readAI Architecture吃透 AI Agent 开发
Context Engineering 与 Memory
上下文压缩:在信息完整和成本之间取平衡
长对话处理的关键不是简单截断,而是保留任务状态、关键事实和未完成动作。
#Context#Compression#Cost
上下文快满时直接删除最早消息,可能丢掉用户约束;直接让模型总结,又可能把关键数字和工具结果总结错。压缩策略必须知道当前任务状态,而不是只按消息长度处理。
分层压缩
保留当前目标、待办、最近工具结果和关键事实;将历史对话压缩成带来源的摘要;把可检索的细节移入知识库。摘要应该带时间和置信度,后续发现冲突时允许覆盖。
项目落点
售前咨询保留商品规格、用户预算和当前订单状态,把闲聊内容降级为摘要。共享记忆服务将长期用户画像和短期会话状态分开,避免一条超长对话拖垮每次调用。
结论
上下文压缩的目标不是变短,而是在有限窗口内保留下一步决策真正需要的信息。