20981854770b2fca34d58a05f41cf96a563225ed
现象:访客在公开页问客服,等约 9.5 秒后报「客服响应超时」。 根因不在链路快慢 —— Agent Worker 没在跑,run 一直停在 queued, 前端把「没人处理」呈现成了「超时」。 启动 Worker 后实测同一条链路(受理 0.05s + 意图分类 + 知识检索 + 落库): 4.11s / 4.09s / 4.82s,三条全部 succeeded。模型已经是 deepseek-flash, 延迟主要来自一次意图分类加一次 embedding,不是模型选型问题。 不过原来的轮询参数余量确实偏薄:350ms 后首次、之后每 700ms 一次、共 14 次, 约 9.5 秒封顶,后端稍一抖动就撞上;而且平均要多等半个轮询周期才看到结果。 改为 300ms 后首次、之后每 500ms 一次、共 40 次(约 20 秒): 感知延迟压到半秒内,同时给模型与检索抖动留出余量。 超时文案也从「客服响应超时,请稍后重试」改为「客服繁忙,暂时没能给出答复」, 不再暗示是响应慢。代码注释里写明:若仍然超时,先确认 Agent Worker 已启动。
Description
番茄炒蛋组
18 MiB
Languages
Python
99.9%