docs(W27-2): 出口口径统一为「七出口 + L0」· D2.5 新增行情/闲聊实测台词 · 金标计数对齐 55 条

本轮只改文档(12 份,无代码改动),把 `W27` 的代码实绩(`L0` 表层判定层 + 出口 `E6` 行情)在**全部交付面文档**上对齐。
此前工程侧已入库(3e24033),但答辩面文档仍留「五出口 / 六出口」旧口径,是最容易被评委当场戳到的自相矛盾点。

## 一、口径统一:五出口 → 七出口 + `L0`
- `D3.6`(被多处引为「五出口权威定义」):加**口径更新横幅**(列明 `W20` 六出口、`W27` 七出口 + `L0` 的演进线,
  并写明「不变的」——转人工仍只是 `E5c`、白名单仍 4 类、`INV-1`~`INV-5` 一条没改);§3 标题加「起步定义」;
  **新增 §3.0**说明 §3.1—§3.4 的适用范围;本页 `D3.7` 配套行的金标计数 46→55、10→11 项指标。
- `D1.1`:7 处索引/清单行对齐(`D2.6` / `D2.10` / `D3.6` 的描述与计数),其余「五出口」全部保留为**历史记录**。
- `D2.6`:配套行补 `D3.9` 指向;**新增 `W27` 状态更新段**(金标扩容到 55 条 + 第七个出口 + 三处真缺陷修复),
  并显式声明「上一条 `W24` 的『六个出口』口径已由本条扩为七个」。
- `D3.7`:性质行/读法/§0 计数对齐(46 → 55、十项 → 十一项指标);**§4 增补 `W27` 扩容后的分母口径表**
  (`M-1`/`M-4`/`M-5`/`M-6`/`M-10` = 55、`M-2` = 33、`M-2b` = 20、`M-3` 明示「考检索的 C 组」,门槛不变)。
- `D2.9`:引用表新增 `D3.9` 行;判分输入件由 `cases_46.json` 更新为 **`cases_55.json`**(附两个分母的产物名)。
- `D2.8`:`W27` 判定补充行(前批已入库,本轮核对通过)。

## 二、HTML 规格文档:只声明口径,不重写历史
`D3.1`(需求开发文档)/ `D3.2`(知识库方案)/ `D2.2`(需求收敛版)/ `D2.4`(知识库收敛版)
四处 `§0.1` 之前各加一段 `callout-warn` 口径更新:说明「五出口」是 v1.x/v2.x 时点的**起步定义**、
现行是「七出口 + `L0`」,并明确**语义与安全结论全部有效、只是不再是全集**,指向 `D3.9` 与 `D2.6` §3。
(`_build` 已标注「已过期·请勿重新生成」,故直接在成品上改,不重跑生成器。)

## 三、`D2.10`(端到端答辩文档)
`六出口` → **七出口 + `L0`**(徽标 / meta / Mermaid / S8 表 / 时间分配 / 文档关系表,共 5 处);
§3.8 出口表**新增 `E6` 行情行**,正文补 `L0` 段落;§4.1 阈值表后**新增口径更新块**
(区间重叠 ⇒ 单点阈值不存在;阈值降为安全下限;「跨集合回退 0.65」在代码中不存在);
§6.1 标题与「两个分母都报」的实测块对齐 55 条;§11 补 `D3.9` 与 `W27` 证据文件。

## 四、`D2.5` 演示脚本(答辩当天照着念的那份)
**新增 §4.8「行情走势与闲聊」**——针对上轮被点名的两类,全部用 **2026-09-21 真 HTTP 实跑**的答复:
- `159382这只ETF最近走势怎么样?` → `E6`,给出近 5/20/60/120 个净值日涨跌 + 区间高低 + 数据区间;
- `南方稳健增利债券A最近走势怎么样?` → `E6-miss`,如实说「查不到公开的净值序列」,**拒绝编造**;
- `你好呀` / `谢谢你` / `在吗` → 闲聊,**零检索**;
- **反向守卫**「在吗,想问下南方稳健增利债券A的起投金额是多少?」→ 必须走知识作答(证明 `L0` 判的是整句);
- 附「口径细节」:`E6` **不调模型**(固定模板 + 纯函数,数字全部来自 `fin_nav_history`),
  闲聊**调模型但完全不查库**(新跑 `_w27_probe_guard.py` 单独验证反向守卫,另有 `_w27_probe_trend/chat.txt`)。
§6 表补两行(闲聊不再进检索 / 走势是算出来的),金标计数行改为 55 条并附两个分母的指标表。

## 五、验证
- `_sync_check.py`:权威目录 → 仓库镜像 **0 缺失 / 0 不一致**(13 份同步)。
- `git diff --name-only`:12 份变更**全部是 `.md` / `.html`**,**无任何代码改动** ⇒ 不影响已绿的
  `pytest 2094 passed / 3 skipped`(3e24033 已复跑)。
- 本轮实测证据保留在 `D:\桌面\金融\_w27_probe_guard.py` / `.txt`(答辩后勿删)。
This commit is contained in:
张胜宇
2026-09-21 22:43:46 +08:00
parent 3e24033f72
commit 279a6327e3
12 changed files with 172 additions and 39 deletions
@@ -3,15 +3,16 @@
> **体系编号**:`D3.7` · 域:三、现行权威·完整版与专项 · 编号体系见 `D1.1` §4.0
> **编号**:CS-EVAL-2026-022 | **版本**:v1.1 | **日期**:2026-09-17 | **状态**:**现行(活文档:每次跑评测后回填 §6 实测列)**
> **性质**:**评测输入件**。它把 `D3.6` 的「五出口架构」变成**可证伪的验收依据**。它**不是**需求来源、**不是**任务来源。
> **读法**:§0(结论)→ §1(前置阻塞:**不修这 4 项,本集跑不了**)→ §2(46 条金标)→ §3(问法分级:哪些才是"智能"考点)→ §4(十项指标)→ §5(判分规则与门槛)→ §6(实测回填表)。
> **性质**:**评测输入件**。它把 `D3.6` 的「五出口架构」(**起步定义**;现行七出口 + `L0`,见 `D3.9`)变成**可证伪的验收依据**。它**不是**需求来源、**不是**任务来源。
> **读法**:§0(结论)→ §1(前置阻塞:**不修这 4 项,本集跑不了**)→ §2(基线 46 条 + `W27` 扩容 9 条 = 55 条金标)→ §3(问法分级:哪些才是"智能"考点)→ §4(十一项指标)→ §5(判分规则与门槛)→ §6(实测回填表)。
> **依据**:① 本仓知识源(`D6.1.1`—`D6.4.x`)与 `knowledge\_chunks.jsonl` 实测;② `D3.6`(架构)与 `D3.5`(检索);③ 公开评测规范(见 §7)。
---
## 0. 一句话结论
金标集**不是"抄 50 个问题"**,而是 **46 条带「期望出口 + 期望证据 + 期望事实 + 禁止出现」四要素的判据**,覆盖 `D3.6` 的五个出口 `E1`—`E5`,并有 **10 项可证伪指标 + 4 项零容忍红线**(禁忌 / 越权 / 无出处数字 / 引用不可解析)。
金标集**不是「抄 50 个问题」**,而是 **基线 46 条 + `W27` 扩容 9 条 = 55 条**、带「期望出口 + 期望证据 + 期望事实 + 禁止出现」四要素的判据,覆盖 `D3.6` 的五个原始出口 `E1`—`E5` **以及 `W27` 新增的 `E6` 行情与 `L0-a` 闲聊出口**,并有 **11 项可证伪指标(其中 4 项为零容忍红线)**(禁忌 / 越权 / 无出处数字 / 引用不可解析)。
> 📌 **46 条与 55 条的关系**:46 条是**可比基线**(`W7` 起口径冻结,历次复跑逐项对照);`W27` 追加的 9 条(`Q-01`—`Q-05` / `C-10`—`C-13`)考的是本轮新增能力。两个分母都报,避免「扩容后看起来变好 / 变差」的误读。
> 🔴 **最重要的一条设计原则**:**「正确地转人工」也算失败。** 除 §4.3 白名单 4 类以外,任何一条金标落到转人工,**都计为不通过**。这正是答辩老师说的"不智能"的量化口径。
@@ -191,7 +192,7 @@
---
## 4. 十项指标(含 4 项零容忍)
## 4. 十一项指标(含 4 项零容忍)
命名对齐公开评测规范(`ragas`:`Faithfulness` / `Response Relevancy` / `Context Precision` / `Context Recall` / `Noise Sensitivity` / `Tool Call Accuracy`,见 §7):
@@ -211,6 +212,8 @@
> **M-7 ~ M-10 是零容忍**:任一非零即**整体不通过**,不看加权分。理由:金融场景下"答错""越权""编数字"不可接受,与 `D3.6` `INV-2`/`INV-3` 一致。
>
> 📌 **`W27` 扩容后的分母口径(与上表并列,两个分母都报)**:上表分母是**基线 46 条口径**。金标扩容到 **55 条**后 —— `M-1` / `M-4` / `M-5` / `M-6` / `M-10` 的分母 = **55**;`M-2` 的分母 = **33**(55 条里带「期望证据家族」的条目数);`M-2b` 的分母 = **20**;`M-3` 的分母仍明示为「**考检索的 `C` 组条目**」(`W27` 给 `C` 组追加闲聊项后此组已不同质)。**门槛值不变**。实测见 §6.4。
>
> 🆕 **`M-9` 取证面补正(`W27`)**:判据是「数字**不可解析到出处**」,出处 = 检索命中的 `title`+`content` + **受控数据工具的原始载荷** + 品牌常量 + **用户原话**。`E2` 族**整体豁免**(数字是受控参数的纯函数输出,与代码里 `_ungrounded_numbers` 只作用于 `E4` 生成文本同口径)。`W27` 新增 `E6` 后,评分器补上「工具原始载荷」这一取证面并把比对改为**数值化**(`16.00%` 与载荷里的 `16.0` 是同一个数);否则行情答复里的 26 个净值数字会被整片误判 —— 那是**评分器口径**问题,不是产品缺陷。
---