Files
group_fqcd_jr/tools/knowledge_corpus_gate.py
T
张胜宇 5d0becb67d 客服 Agent 重构收口:五出口决策链 + 知识库档位隔离 + 前端入参边界(答辩演示版本)
一、客服 Agent 智能增强(正面回应"不智能、动不动就转人工")
- 决策链由 2 个出口扩到 5 个:E1 澄清 / E2 计算型 / E3 知识直返 / E4 证据约束生成 / E5 分级回退
- 转人工从"默认动作"降为最后一档 E5c,只保留 4 类白名单:
  P0 反诈 / P1 账户与个人数据 / P2 写操作与争议 / 用户明确要求人工
- 46 条金标实测(修复前 → 修复后):
  转人工率 43.5% → 10.9%;出口准确率 45.7% → 100%;事实正确率 69.6% → 100%
  禁忌违反 1 → 0;档位越权 / 无出处数字 / 误拒 四项零容忍全 0
- 安全不变量 INV-1~INV-5;零容忍规则未删,改的是挂载点
  (输出侧字面黑名单 → 检索层档位隔离 + 判定层合规词表 + 输出守护)

二、知识库:档位单点化与物理隔离
- 新增 app/core/knowledge_tier.py 作为档位规则唯一落点(G-03),
  knowledge_contracts.py 原定义块改为显式再导出(X as X,非副本)
- 档位过滤由 bool 默认值(fail-open)改为 tiers 必填集合(缺参即 TypeError)
- Milvus 侧四集合按 visibility 分区键物理隔离;双 schema 收敛为一套
- 新增 app/core/actor.py:访客三元组与匿名判定的唯一构造/判定点(G-01/G-01b)
- 新增 app/core/fund_fee_rules.py:费率计算纯函数

三、前端入参边界对齐(本轮 W11 新修,4 处"校验宽于存储")
- message 加 max_length=8000(与浮窗 widget.js 的 maxlength 一致)
- session_id 加 1—64;idempotency_key 上限 128 → 64(对齐列宽 String(64))
- feedback_type 加 max_length=32(对齐列宽 String(32))
- 8 条路径参数补 min_length=1 + max_length=64 + 字符集正则
  ({session_id} / {run_id} / {handover_id})
- 改前超限值会落到 MySQL 才失败(500);改后一律 422 AGENT_INPUT_INVALID + 字段级定位
- 新增 tests/unit/api/test_frontend_boundaries.py(33 例),含"端点表 ↔ OpenAPI 全量对照"

四、投顾模块整体清除(D4.4 / D4.5)
- 删除投顾相关 controller / schema / model / repository / service 及门户页面
- tools/portal_api_check.py 同步作废 AD003/AD005/AD011/A047 四条用例与 advisor_t 登录
  (端点与账号均已不存在,此前稳定报 3 条假红)

五、验证(提交前实测)
- pytest -q:1856 passed / 2 skipped / 0 failed
- ruff check app tools tests:19(= 基线);mypy app:2(= 基线)
- 前端接口契约体检 portal_api_check.py:38 项,通过 34,失败 0,跳过 4
- 全链路冒烟 e2e_smoke_test.py --read-only:31/31
- HTTP 全链路探针 http_probe.py:11/11 succeeded
- 跨文档一致性 _consistency.py:GATE PASS
- 真机边界复验 12 条:12/12 符合预期

六、纪律与文档
- 可改文件白名单 A-09(docs/46)与底座会签申请单 A-10(docs/47,组 1—组 4 全部受理)
- 零 DDL:未新增/修改任何表结构,89 张业务表与基线一致
- 证据留痕:docs/evidence/**(含 46 条金标 score、快照、清除与重建记录)
- 未提交(刻意排除,见提交说明):仓库内 客服agent/ 与 开发文档/ 是 2026-09-16 前的
  过期副本(Todolist 440 行 vs 权威 D2.1 1167 行),权威正本在仓库外;
  _chunks_report.txt 是 tools/build_knowledge_chunks.py 生成的本地产物
2026-09-20 14:33:30 +08:00

87 lines
5.0 KiB
Python
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
"""语料入库门禁(B-01 四查,`DEC-16` / `乙-18`)。
**为什么单独成模块**:原先这段写在 `tools/build_knowledge_chunks.py` 里,而该脚本
一 import 就会重写 `knowledge/_chunks.jsonl` —— 单测没法安全地 import 它来验证门禁,
于是门禁本身成了"只有跑构建时才顺带执行、谁也没测过"的代码。抽出来之后两侧都可测:
构建脚本 import 它,单测也 import 它。
**为什么放在写入前**:这四个条件一旦漏掉,错误会以「检索出来的答案」的形式出现在客户面前,
而不是以报错的形式出现在构建日志里。所以宁可中止构建、并报出块号。
四查:
1. **占位符**:`400-XXX-XXXX` / `XX科技` / `TBD` 这类没填完的值 —— 一眼假。
2. **品牌位**:以「南方」开头的机构名必须落在白名单里,域名必须是 `nffund.com`;
另显式列出已知**错值**(`南方财富`、`南方科技`、`nanfangwm.com`、
少一个「股份」的 `南方基金管理有限公司`)。白名单值**只用 `南方基金` + `nffund.com`**:
旧的 `南方财富` + `nanfangwm.com` 会把**错误品牌**放行,等于门禁白做。
第三方机构(华泰证券、厦门国际信托等)不以「南方」开头,不参与品牌位判定 ——
它们是**股东/交易对手**,不是本平台品牌;`南方东英` / `南方资本` 是真实存在的
境内外子公司,用负向断言显式排除。
3. **禁止类目**:内部管理类源文件(新人指南、反洗钱、薪酬考勤)不进客户侧知识库。
4. **档位显式声明**:每块必须有非空 `visibility`,缺省即拒绝写入 —— 堵住
`milvus_knowledge_writer` 的 `FIELD_DEFAULTS` 把缺省当 `public` 的 fail-open。
另有一条**不在「四查」里但必须一起守**的检查:`doc_id` 唯一性。2026-09-19 实测踩到过 ——
两个新源文件若共用同一个 `prefix`,生成的 doc_id 会**整体重号**,灌库时后一份按 `upsert`
直接**覆盖**前一份,而构建日志一切正常(块数、档位都对),只有在下游检索里才发现
"有一半内容不存在"。
"""
import re
from collections.abc import Mapping, Sequence
PLACEHOLDER_PATTERN = re.compile(r"400-XXX-XXXX|XXX-XXXX-XXXX|XX科技|xxtech|待填|TBD|TODO")
BRAND_SLOT_PATTERN = re.compile(
r"南方(?!基金|东英|资本)[\u4e00-\u9fa5]{0,8}(?:基金|财富|科技|证券|资产管理|银行|信托|保险)"
r"(?:管理)?(?:股份)?(?:有限)?公司"
)
DOMAIN_PATTERN = re.compile(r"(?:[A-Za-z0-9][A-Za-z0-9-]*\.)+(?:com|cn|net|org)")
ALLOWED_BRAND_DOMAINS = ("nffund.com",)
BANNED_BRAND_LITERALS = ("南方财富", "南方科技", "nanfangwm.com", "南方基金管理有限公司")
FORBIDDEN_SOURCE_KEYWORDS = ("新人指南", "反洗钱", "薪酬", "考勤", "晋升", "绩效")
def corpus_gate_problems(records: Sequence[Mapping[str, object]]) -> list[str]:
"""返回违规清单(空列表 = 通过)。分离出来是为了让单测能逐条断言命中原因。"""
problems: list[str] = []
seen_doc_ids: set[str] = set()
for record in records:
doc_id = str(record.get("doc_id", ""))
content = str(record.get("content", ""))
if doc_id in seen_doc_ids:
problems.append(f"{doc_id}: doc_id 重复(两个源的 prefix 撞了,后写的会覆盖前一份)")
seen_doc_ids.add(doc_id)
if not str(record.get("visibility") or "").strip():
problems.append(f"{doc_id}: 未显式声明 visibility")
placeholder = PLACEHOLDER_PATTERN.search(content)
if placeholder:
problems.append(f"{doc_id}: 含占位符 {placeholder.group(0)!r}")
for banned in BANNED_BRAND_LITERALS:
if banned in content:
problems.append(f"{doc_id}: 含错误品牌值 {banned!r}")
slot = BRAND_SLOT_PATTERN.search(content)
if slot:
problems.append(f"{doc_id}: 品牌位出现白名单外的机构名 {slot.group(0)!r}")
for domain in DOMAIN_PATTERN.findall(content):
if not any(
domain == allowed or domain.endswith("." + allowed)
for allowed in ALLOWED_BRAND_DOMAINS
):
problems.append(f"{doc_id}: 域名 {domain!r} 不在白名单内")
source_file = str(record.get("source_file") or "")
for keyword in FORBIDDEN_SOURCE_KEYWORDS:
if keyword in source_file:
problems.append(f"{doc_id}: 源文件 {source_file!r} 落在禁止类目({keyword})")
return problems
def assert_corpus_gate(records: Sequence[Mapping[str, object]]) -> None:
"""B-01 四查;任一不满足即中止构建,绝不写出半成品 jsonl。"""
problems = corpus_gate_problems(records)
if problems:
detail = "\n".join(f" - {line}" for line in problems[:20])
raise SystemExit(
f"B-01 语料入库门禁未通过({len(problems)} 处):\n{detail}\n已中止,未写入 jsonl。"
)