Fri Jul 24 2026 08:00:00 GMT+0800 (China Standard Time)·2 min readAI Architecture吃透 AI Agent 开发
Loop Engine
模型调用失败后的恢复策略
生产级容错需要区分超时、限流、供应商故障和业务拒答,再决定重试、降级或人工接管。
#Reliability#LLM#Observability
模型 API 出错时,简单重试可能让限流更严重,也可能让一个有副作用的工具被重复执行。可靠策略首先要给错误分类,再决定是否允许重试。
恢复边界
读取类请求可以采用指数退避和供应商切换;写入订单、发消息和设备控制必须使用幂等键;无法判断结果的超时请求要进入待确认状态,而不是直接当作失败。
项目落点
共享 LLM 网关统一处理超时、配额、路由和 Trace。商品 Agent 的工具调用会记录调用意图和结果,人工接管时可以看到最后一个可信状态,不需要重新猜测系统做到了哪一步。
结论
容错不是给每个函数加 try-catch,而是把“能否安全重做”纳入业务状态设计。