一、客服 Agent 智能增强(正面回应"不智能、动不动就转人工")
- 决策链由 2 个出口扩到 5 个:E1 澄清 / E2 计算型 / E3 知识直返 / E4 证据约束生成 / E5 分级回退
- 转人工从"默认动作"降为最后一档 E5c,只保留 4 类白名单:
P0 反诈 / P1 账户与个人数据 / P2 写操作与争议 / 用户明确要求人工
- 46 条金标实测(修复前 → 修复后):
转人工率 43.5% → 10.9%;出口准确率 45.7% → 100%;事实正确率 69.6% → 100%
禁忌违反 1 → 0;档位越权 / 无出处数字 / 误拒 四项零容忍全 0
- 安全不变量 INV-1~INV-5;零容忍规则未删,改的是挂载点
(输出侧字面黑名单 → 检索层档位隔离 + 判定层合规词表 + 输出守护)
二、知识库:档位单点化与物理隔离
- 新增 app/core/knowledge_tier.py 作为档位规则唯一落点(G-03),
knowledge_contracts.py 原定义块改为显式再导出(X as X,非副本)
- 档位过滤由 bool 默认值(fail-open)改为 tiers 必填集合(缺参即 TypeError)
- Milvus 侧四集合按 visibility 分区键物理隔离;双 schema 收敛为一套
- 新增 app/core/actor.py:访客三元组与匿名判定的唯一构造/判定点(G-01/G-01b)
- 新增 app/core/fund_fee_rules.py:费率计算纯函数
三、前端入参边界对齐(本轮 W11 新修,4 处"校验宽于存储")
- message 加 max_length=8000(与浮窗 widget.js 的 maxlength 一致)
- session_id 加 1—64;idempotency_key 上限 128 → 64(对齐列宽 String(64))
- feedback_type 加 max_length=32(对齐列宽 String(32))
- 8 条路径参数补 min_length=1 + max_length=64 + 字符集正则
({session_id} / {run_id} / {handover_id})
- 改前超限值会落到 MySQL 才失败(500);改后一律 422 AGENT_INPUT_INVALID + 字段级定位
- 新增 tests/unit/api/test_frontend_boundaries.py(33 例),含"端点表 ↔ OpenAPI 全量对照"
四、投顾模块整体清除(D4.4 / D4.5)
- 删除投顾相关 controller / schema / model / repository / service 及门户页面
- tools/portal_api_check.py 同步作废 AD003/AD005/AD011/A047 四条用例与 advisor_t 登录
(端点与账号均已不存在,此前稳定报 3 条假红)
五、验证(提交前实测)
- pytest -q:1856 passed / 2 skipped / 0 failed
- ruff check app tools tests:19(= 基线);mypy app:2(= 基线)
- 前端接口契约体检 portal_api_check.py:38 项,通过 34,失败 0,跳过 4
- 全链路冒烟 e2e_smoke_test.py --read-only:31/31
- HTTP 全链路探针 http_probe.py:11/11 succeeded
- 跨文档一致性 _consistency.py:GATE PASS
- 真机边界复验 12 条:12/12 符合预期
六、纪律与文档
- 可改文件白名单 A-09(docs/46)与底座会签申请单 A-10(docs/47,组 1—组 4 全部受理)
- 零 DDL:未新增/修改任何表结构,89 张业务表与基线一致
- 证据留痕:docs/evidence/**(含 46 条金标 score、快照、清除与重建记录)
- 未提交(刻意排除,见提交说明):仓库内 客服agent/ 与 开发文档/ 是 2026-09-16 前的
过期副本(Todolist 440 行 vs 权威 D2.1 1167 行),权威正本在仓库外;
_chunks_report.txt 是 tools/build_knowledge_chunks.py 生成的本地产物
87 lines
5.0 KiB
Python
87 lines
5.0 KiB
Python
"""语料入库门禁(B-01 四查,`DEC-16` / `乙-18`)。
|
||
|
||
**为什么单独成模块**:原先这段写在 `tools/build_knowledge_chunks.py` 里,而该脚本
|
||
一 import 就会重写 `knowledge/_chunks.jsonl` —— 单测没法安全地 import 它来验证门禁,
|
||
于是门禁本身成了"只有跑构建时才顺带执行、谁也没测过"的代码。抽出来之后两侧都可测:
|
||
构建脚本 import 它,单测也 import 它。
|
||
|
||
**为什么放在写入前**:这四个条件一旦漏掉,错误会以「检索出来的答案」的形式出现在客户面前,
|
||
而不是以报错的形式出现在构建日志里。所以宁可中止构建、并报出块号。
|
||
|
||
四查:
|
||
|
||
1. **占位符**:`400-XXX-XXXX` / `XX科技` / `TBD` 这类没填完的值 —— 一眼假。
|
||
2. **品牌位**:以「南方」开头的机构名必须落在白名单里,域名必须是 `nffund.com`;
|
||
另显式列出已知**错值**(`南方财富`、`南方科技`、`nanfangwm.com`、
|
||
少一个「股份」的 `南方基金管理有限公司`)。白名单值**只用 `南方基金` + `nffund.com`**:
|
||
旧的 `南方财富` + `nanfangwm.com` 会把**错误品牌**放行,等于门禁白做。
|
||
第三方机构(华泰证券、厦门国际信托等)不以「南方」开头,不参与品牌位判定 ——
|
||
它们是**股东/交易对手**,不是本平台品牌;`南方东英` / `南方资本` 是真实存在的
|
||
境内外子公司,用负向断言显式排除。
|
||
3. **禁止类目**:内部管理类源文件(新人指南、反洗钱、薪酬考勤)不进客户侧知识库。
|
||
4. **档位显式声明**:每块必须有非空 `visibility`,缺省即拒绝写入 —— 堵住
|
||
`milvus_knowledge_writer` 的 `FIELD_DEFAULTS` 把缺省当 `public` 的 fail-open。
|
||
|
||
另有一条**不在「四查」里但必须一起守**的检查:`doc_id` 唯一性。2026-09-19 实测踩到过 ——
|
||
两个新源文件若共用同一个 `prefix`,生成的 doc_id 会**整体重号**,灌库时后一份按 `upsert`
|
||
直接**覆盖**前一份,而构建日志一切正常(块数、档位都对),只有在下游检索里才发现
|
||
"有一半内容不存在"。
|
||
"""
|
||
|
||
import re
|
||
from collections.abc import Mapping, Sequence
|
||
|
||
PLACEHOLDER_PATTERN = re.compile(r"400-XXX-XXXX|XXX-XXXX-XXXX|XX科技|xxtech|待填|TBD|TODO")
|
||
BRAND_SLOT_PATTERN = re.compile(
|
||
r"南方(?!基金|东英|资本)[\u4e00-\u9fa5]{0,8}(?:基金|财富|科技|证券|资产管理|银行|信托|保险)"
|
||
r"(?:管理)?(?:股份)?(?:有限)?公司"
|
||
)
|
||
DOMAIN_PATTERN = re.compile(r"(?:[A-Za-z0-9][A-Za-z0-9-]*\.)+(?:com|cn|net|org)")
|
||
ALLOWED_BRAND_DOMAINS = ("nffund.com",)
|
||
BANNED_BRAND_LITERALS = ("南方财富", "南方科技", "nanfangwm.com", "南方基金管理有限公司")
|
||
FORBIDDEN_SOURCE_KEYWORDS = ("新人指南", "反洗钱", "薪酬", "考勤", "晋升", "绩效")
|
||
|
||
|
||
def corpus_gate_problems(records: Sequence[Mapping[str, object]]) -> list[str]:
|
||
"""返回违规清单(空列表 = 通过)。分离出来是为了让单测能逐条断言命中原因。"""
|
||
problems: list[str] = []
|
||
seen_doc_ids: set[str] = set()
|
||
for record in records:
|
||
doc_id = str(record.get("doc_id", ""))
|
||
content = str(record.get("content", ""))
|
||
if doc_id in seen_doc_ids:
|
||
problems.append(f"{doc_id}: doc_id 重复(两个源的 prefix 撞了,后写的会覆盖前一份)")
|
||
seen_doc_ids.add(doc_id)
|
||
if not str(record.get("visibility") or "").strip():
|
||
problems.append(f"{doc_id}: 未显式声明 visibility")
|
||
placeholder = PLACEHOLDER_PATTERN.search(content)
|
||
if placeholder:
|
||
problems.append(f"{doc_id}: 含占位符 {placeholder.group(0)!r}")
|
||
for banned in BANNED_BRAND_LITERALS:
|
||
if banned in content:
|
||
problems.append(f"{doc_id}: 含错误品牌值 {banned!r}")
|
||
slot = BRAND_SLOT_PATTERN.search(content)
|
||
if slot:
|
||
problems.append(f"{doc_id}: 品牌位出现白名单外的机构名 {slot.group(0)!r}")
|
||
for domain in DOMAIN_PATTERN.findall(content):
|
||
if not any(
|
||
domain == allowed or domain.endswith("." + allowed)
|
||
for allowed in ALLOWED_BRAND_DOMAINS
|
||
):
|
||
problems.append(f"{doc_id}: 域名 {domain!r} 不在白名单内")
|
||
source_file = str(record.get("source_file") or "")
|
||
for keyword in FORBIDDEN_SOURCE_KEYWORDS:
|
||
if keyword in source_file:
|
||
problems.append(f"{doc_id}: 源文件 {source_file!r} 落在禁止类目({keyword})")
|
||
return problems
|
||
|
||
|
||
def assert_corpus_gate(records: Sequence[Mapping[str, object]]) -> None:
|
||
"""B-01 四查;任一不满足即中止构建,绝不写出半成品 jsonl。"""
|
||
problems = corpus_gate_problems(records)
|
||
if problems:
|
||
detail = "\n".join(f" - {line}" for line in problems[:20])
|
||
raise SystemExit(
|
||
f"B-01 语料入库门禁未通过({len(problems)} 处):\n{detail}\n已中止,未写入 jsonl。"
|
||
)
|