## 现象
客服对「r1到r5分别代表什么」走兜底 + 转人工;「基金申购后多久能确认」用户以为也不答。
## 排查结论(详见 docs/演示用/知识库问答诊断-2026-09-14.md)
- 向量库**有**内容、检索也命中:申购确认那一问 top1 = **0.8468**(高置信,本来就答得出,
库里留着 23:59:06 那次完整问答);R1–R5 那一问 top1 = **0.6621**、次优 0.6412。
- 判定规则:高置信(≥0.75)不看 gap;中置信(0.55–0.75)必须领先次优 ≥0.07
(`customer_service.py:148-150`)。R1–R5 只领先 0.021 → 判"候选并列"。
- 根因是**同一主题多来源 + 命中块太长**:高频问答对(0.6621)、适当性指南第十一条三块
(0.6412/0.5771/0.5520)、产品手册 1.4 节(0.4983) 分数天然挤在一起;
而我先前上传的长条目(488 字切两块)被稀释到 0.6622,**改了两次才找到有效形态**:
短条目 + 标题与问法逐字对齐 → **0.7384 / gap 0.0761 → 可答**。
## 本次改动
- 新增知识正文 `data/knowledge/faq_r1r5.md`(口径取自 `suitability_service.MATRIX_ALLOWED` /
`MATRIX_NEEDS_DISCLOSURE`,避开禁用词)。
- 新增幂等工具 `tools/seed_knowledge_r1r5_faq.py`:默认 dry-run,`--apply` 上传;
已存在同源未过期知识则跳过,并自动复测检索评分。
- 真机执行:删除 3 个试验块(200/201/202)→ 上传 id 203 → 端到端验证。
## 验证
- `tools/seed_knowledge_r1r5_faq.py`(幂等路径)→ `top1=0.7384 次优=0.6623 gap=0.0761 可答`
- 端到端(登录客户 + 访客两条路径):「r1到r5分别代表什么」给出五级含义 +
C1–C5 对应关系;「基金申购后多久能确认」给出 T+1/T+2 确认规则
- 回归 4 条同类问题仍高置信直接答:费率 0.8111 / 场内场外 0.7871 / 最小买多少 0.8289 /
赎回到账 0.8480
## 顺带查清(登记为已知问题,未擅自改)
1. **向量与元数据严重不一致**:Milvus 159/397/297 个向量 vs MySQL 41/161/**0** 行;
答得最好的 `faq/高频问答对.txt`(含 FAQ-0015)与两套政策文件**只在向量里、MySQL 无行**。
⇒ 这**推翻**了我先前"检索按 active 过滤"的建议(会把孤儿但有用的内容一起杀掉),
已在文档里明确撤回。
2. **检索层不看知识状态**:`knowledge_search_service.py` 里 `status` 出现 0 次 →
已 expired 的历史副本照样参与排序(费率这类会变的内容有被答旧值的风险)。
3. **重复与测试垃圾在抢答,且没有清理入口**:产品手册被种了 7 遍(199 行里只有 24 active)、
FAQ 集合 41 行里 38 行是上传链路测试残留;而 `DELETE /api/v1/knowledge/{id}` 对已 expired 行
一律 404「知识文档不存在」→ 清理历史副本目前无入口。
591 B
591 B
r1到r5分别代表什么
问:r1到r5分别代表什么?R1到R5分别代表什么?R1、R2、R3、R4、R5 是什么意思?
答:R1 低风险(货币基金);R2 中低风险(纯债、债券基金);R3 中风险(混合基金); R4 中高风险(股票型、指数增强);R5 高风险(商品、原油、QDII)。等级越高,净值波动与 本金损失的可能性越大。测评等级与产品等级不匹配时下单会被拦截:C1 可买 R1-R2; C2 可买 R1-R3;C3 可买 R1-R4(R4 需签风险揭示书);C4、C5 可买 R1-R5(R5 需签)。