徐强
Fri Jul 24 2026 08:00:00 GMT+0800 (China Standard Time)·2 min readAI Architecture吃透 AI Agent 开发

Context Engineering 与 Memory

Cache 与成本:不要把不同缓存混成一个概念

KV Cache、Prompt Cache、业务结果缓存和上下文压缩分别解决不同问题,成本优化需要先分清边界。

#Cache#Cost#LLM

缓存的命中对象不同,收益也不同。模型侧缓存减少重复计算,Prompt Cache 复用稳定前缀,业务缓存复用相同输入的结果,摘要压缩则直接减少上下文长度。

成本账本

每次调用都应记录模型、输入输出 Token、缓存命中、耗时、租户和业务场景。批量任务要有队列和配额,重复商品描述、分类和翻译可以用输入哈希缓存,动态价格等事实不能盲目复用。

项目落点

售前 Agent 使用稳定系统指令和商品知识前缀降低首字延迟,内容运营根据任务复杂度做模型路由。共享网关统一计量 Token 和成本,业务方可以看到一条功能到底消耗了多少资源。

结论

成本优化不是换一个更便宜的模型,而是让每次调用都能解释“为什么必须发生”。