feat(model-gateway)+docs(W19): embedding 端点唯一性配置守卫 + 三份完整版/收敛版索引口径补注 + 门槛口径更正 + D3.7 难例口径统一
一、代码(2 文件 + 2 工具脚本注记)
* app/service/model_gateway.py:DatabaseModelEndpointResolver.resolve() 加配置守卫
—— required == "embedding" 且 len(matched) > 1 时 logger.warning(只告警、不改行为)。
多个 embedding 端点会让索引向量与查询向量可能来自不同模型(维度同为 1024、不报错),
COSINE 相似度整体失真,表现为"越答越差"的哑故障。顺手删掉重复的 return endpoints(死代码)。
* tests/unit/service/test_model_gateway.py:新增 2 条单测(多端点告警且返回顺序不变 / 单端点静默)。
* tools/configure_embedding_endpoint.py:加「已废弃,勿重跑」标注 —— 它写的是
qwen-embedding / qwen3.7-text-embedding-flash,与现役端点 knowledge-embedding-qwen-v3 /
text-embedding-v3 不一致,重跑会凭空多出一个 embedding 端点。
* tools/build_knowledge_chunks.py:删掉与新口径冲突的注释「不泄露档位与门槛」,
改为「registered 的依据是权益明细而非门槛;门槛属公开宣传口径」。
二、文档(8 份;D-1 选乙 + D-3 统一为 18)
* D2.4 v1.6 → v1.7:§4.4 + 附录B 更正「门槛金额不再单独构成 registered 的理由」
(public 的 FAQ-0014 已完整给出五档门槛、FAQ-0050 含钻石门槛);
HNW-004—HNW-007 保持 registered,依据收窄为"各层级权益明细";HNW-* 档位不动(分区键)。
* D3.1 v2.5 → v2.6:§5.3 加索引口径落地注(覆盖 §2.5 决策表 / FR-CS-007 / 排期 T4)
+ 补「字段表同属初稿」(实库 18 字段全 NOT NULL、doc_id 主键、无 metadata JSON)。
* D3.2 v1.2 → v1.6:§4.1 加同口径注 + 版本位追平(顶栏 v1.1 / doc-meta v1.2 落后于自身记录 v1.5)。
* D2.2 v2.6 → v2.7:§1.4.2 域 B 加注(TopK / 阈值 / 度量 / 集合选择均未变 ⇒ 不影响验收)。
* D3.7:§3 难例口径统一 —— 难例 32 条(改写 8 + 口语 16 + 多轮 4 + 禁忌 4)为定义式总数,
M-2b 分母 = 其中带期望证据家族的 18 条;并补正 §3 初稿表格条数(以 cases_46.json 为准)。
* D1.1 v1.8 → v1.9:新增 §28;四处版本位同步;顺带修正两处历史遗留
(D2.4 版本位长期停在 v1.3、D2.2 日期列停在 2026-09-17)。
* D1.6:新增 §4.47(含自我失误留痕)。
* D2.1 v6.33 → v6.34:新增本轮修订要点段。
三、实测门口(本机)
* tests/unit/service/test_model_gateway.py:10 passed
* pytest -q -p no:cacheprovider(全量,跑前已停 Worker):1917 passed / 3 skipped / 0 failed
* tools/check_authoritative_docs.py:54 文档无编号冲突(exit 0)
* _consistency.py:失效锚点 0、交叉引用全 ✅(exit 0)
* _fe_boundary_http.py(重建件):12/12 符合预期
* 服务已重启:/internal/health/ready 三依赖全绿(mysql / redis / milvus)
四、如实留痕(自我失误)
本轮清理临时文件时删除判据过宽,误删 _consistency.py(已原样恢复)、
_legacy_customer_service.py(已按 f72a545 逐字节重建,40,554 字节)、
_fe_boundary_http.py(原件不可恢复,已按既有判据重建并实跑 12/12)与若干历史轮次原始日志。
详见 D1.6 §4.47 五。
This commit is contained in:
@@ -147,3 +147,54 @@ async def test_resolve_skips_endpoints_without_declared_capabilities(
|
||||
agent_type="customer_service", task_type="chat"
|
||||
)
|
||||
assert [e.endpoint_code for e in resolved] == ["chat-primary"]
|
||||
|
||||
|
||||
@pytest.mark.asyncio
|
||||
async def test_resolve_warns_when_multiple_embedding_endpoints_declared(
|
||||
monkeypatch: pytest.MonkeyPatch, caplog: pytest.LogCaptureFixture
|
||||
) -> None:
|
||||
"""声明 `embedding` 能力的 active 端点超过一个时必须告警(配置守卫,只告警不改行为)。
|
||||
|
||||
为什么要守:Milvus 集合的向量维度是固定的,索引侧与查询侧必须用**同一个**模型。
|
||||
两个 embedding 端点共存时,`ModelDispatchService.embed` 只试前 `max(1, max_attempts)`
|
||||
(默认 2)个端点,实际用哪个取决于表的行顺序 —— 一旦索引与查询落到不同模型,
|
||||
`COSINE` 相似度整体失真却**不会报任何错**,表现为“越答越差”的哑故障。
|
||||
"""
|
||||
from app.service import model_gateway
|
||||
|
||||
rows = [
|
||||
_endpoint("embedding-primary", ["embedding"]),
|
||||
_endpoint("embedding-shadow", ["embedding"]),
|
||||
_endpoint("chat-primary", ["chat"]),
|
||||
]
|
||||
monkeypatch.setattr(model_gateway, "SessionFactory", lambda: _FakeScalarSession(rows))
|
||||
|
||||
with caplog.at_level("WARNING"):
|
||||
resolved = await model_gateway.DatabaseModelEndpointResolver().resolve(
|
||||
agent_type="customer_service", task_type="embedding"
|
||||
)
|
||||
|
||||
# 只告警不改行为:仍返回全部声明 embedding 的端点,且顺序与表行顺序一致。
|
||||
assert [e.endpoint_code for e in resolved] == ["embedding-primary", "embedding-shadow"]
|
||||
warnings = [r for r in caplog.records if r.levelname == "WARNING"]
|
||||
assert warnings, "多 embedding 端点时必须留下 WARNING 痕迹"
|
||||
assert "embedding-shadow" in warnings[-1].getMessage()
|
||||
|
||||
|
||||
@pytest.mark.asyncio
|
||||
async def test_resolve_is_silent_with_single_embedding_endpoint(
|
||||
monkeypatch: pytest.MonkeyPatch, caplog: pytest.LogCaptureFixture
|
||||
) -> None:
|
||||
"""恰有一个 embedding 端点(现网配置)时不得产生告警噪音。"""
|
||||
from app.service import model_gateway
|
||||
|
||||
rows = [_endpoint("embedding-primary", ["embedding"]), _endpoint("chat-primary", ["chat"])]
|
||||
monkeypatch.setattr(model_gateway, "SessionFactory", lambda: _FakeScalarSession(rows))
|
||||
|
||||
with caplog.at_level("WARNING"):
|
||||
resolved = await model_gateway.DatabaseModelEndpointResolver().resolve(
|
||||
agent_type="customer_service", task_type="embedding"
|
||||
)
|
||||
|
||||
assert [e.endpoint_code for e in resolved] == ["embedding-primary"]
|
||||
assert [r for r in caplog.records if r.levelname == "WARNING"] == []
|
||||
|
||||
Reference in New Issue
Block a user