Files
group_fqcd_jr/开发文档
张胜宇 be085c5f18 docs(W27-3): D2.6 §11 补「阈值是否可靠」三条追问 · D2.10 §8.1/§7.3/§7.4 补行情与闲聊 · D1.1 §35 留痕
承接 W27-2(279a632)。本轮做**答辩现场直接会被问到、但文档里还没有答案**的三件事。

## 一、D2.6 §11「答辩现场速答」新增 3 条追问(核心)
甲方原话提的那个问题,之前 `D2.6` 只能靠 `D3.9` 间接回答,现场不一定翻得到。现在直接进速答表:
1. **「分级回退的阈值凭什么保证一定精确检索到答案?」** —— 答:**这个判据本身就站不住**。实测「应当直答」的 26 条
   `score ∈ [0.6115, 1.0]`、「明确不许直答」的 20 条 `∈ [0.5049, 0.8226]`,**两段重叠 ⇒ 单点阈值不存在**;
   `W27` 因此把精确性从**分数阈值**迁到 **`L0` 表层判定 + 实体锚点 + 证据结构**,分数只留作**安全下限**。
   证据 `_eval_harness/threshold_calibration.json`,见 `D3.9` §2.1 / §3.3—§3.4。
2. **「那回退之后降低阈值岂不就不精准了?」** —— 答:**对,而且这条规则在代码中根本不存在**。
   `FALLBACK_COLLECTIONS` 是死代码(`knowledge_search_service.py:41` 定义无人调用);实测若真接上,跨集合余弦分
   **量纲不可比**会撞坏 `MIN_GAP`,`M-1` 从 **100% 掉到 91.3%** ⇒ 不做。现在的回退只在**同一档位内**
   `E5a → E5b → E5c` **单向降级**,降的是**答复完整度**、**不是证据门槛**(`FR-CS-008` ① 已作废,见 `D3.9` §3.5)。
3. **「意图识别是不是不准?为什么闲聊会触发检索?」** —— 答:旧实现把意图分类当**路由器**用且闲聊与业务问句同路;
   `W27` 把意图分类**降级为「增益 + 兜底」**,前面插一层 `L0` **确定性表层判定** ——
   「闲聊不再进检索」靠的是**少让模型参与判定**,不是调准模型。

## 二、D2.10 端到端答辩文档
- §8.1 速答表同步上述 3 条;§6.1 首行计数改为「金标已扩容到 55 条,两个分母都报」。
- §4.2 的 `MIN_GAP` 踩坑块补「并读 §4.1 口径更新」:`MIN_GAP` 仍是有效**结构判据之一**,
  但整套精确性**不能**押在它或任一分数阈值上。
- §7.3 客服线台词表新增 3 行(`E6` 走势 / `E6` 无数据源如实告知 / 闲聊零检索),§7.4 演示顺序加「行情与闲聊」一项,
  §7.5 时间分配把现场演示条目改为「+ 行情 1 条 + 闲聊 1 条(各 5 秒内出结果)」。

## 三、D2.5 / D1.1
- `D2.5` §4 标题「7 组台词」→「**8 组台词**」(新增 §4.8 之后同步)。
- `D1.1` 新增 **§35(第三十一轮)**留痕:本轮改了什么、**为什么只加横幅不改历史**、
  四份 HTML 为何**不重跑生成器**、以及三条**诚实未做**(`D1.6` 留痕待补 / `D2.1` 看板未逐项回填 /
  历史段「五出口」**有意保留**——全文替换会把「当时的决策」改成「现在的结论」,反而失真);头部 **v1.18 → v1.19**(计数不变)。

## 四、验证
- `_sync_check.py`:**0 缺失 / 0 不一致**。
- 5 份 HTML(`D2.10` / `D2.2` / `D2.4` / `D3.1` / `D3.2`)`blockquote` / `table` / `tr` / `td` 开闭标签**逐项配平**。
- 本轮 11 份变更**全部是 `.md` / `.html`**,无代码改动 ⇒ 不影响已绿的 `pytest 2094 passed / 3 skipped`。
2026-09-21 22:46:16 +08:00
..