检测原理与评分规则

本页公开综合评分(composite_score,0–100)的计算逻辑:探针加权平均、跳过项权重再分配、硬上限 cap、风险等级映射。任何检测报告里的分数都可以由这些规则反推,分数只由客观检测决定,认证与付费不影响评分。

总体流程

  1. 多探针并行采样:协议合规、身份一致、能力验证、内容完整、安全性、性能等维度同时检测。
  2. 加权平均:被跳过的探针不计分,其权重按比例重新分配给参与项。
  3. 应用硬上限(cap):出现严重异常时对总分设上限,避免被高分维度平均稀释。
  4. 映射风险等级:最终分映射为推荐 / 良好 / 一般 / 不建议 / 不可用等中性标签。
base_score      = Σ(score × effective_weight) / Σ(effective_weight)
composite_score = min(base_score, min(cap_value))

硬上限 cap 规则(固化在探针代码,后台不可改)

规则上限触发条件
d1_offline0协议层连续失败 ≥4 轮(持续宕机);即时检测现场探不通亦直接触发
d1_offline_short40连续失败 2–3 轮(短时中断),恢复后自动解除
d3_mismatch30明确判定模型身份不匹配
d3_suspect60判定模型身份可疑
d2_schema_broken40响应结构覆盖率 < 30%
s2_canary_leak60system 提示 nonce canary 泄露
s3_system_ignored50非 Anthropic 通道 system 完全不被遵循
s4_error_leak70错误响应泄露上游信息 ≥2 次
d17_signature_invalid40响应关键签名(id / stop_reason / finish_reason)失败

滚动窗口 + 时间衰减

所有维度分基于时间衰减加权计算,最近样本权重最大:60m 窗口半衰期 20 分钟、24h 窗口 8 小时、7d 窗口 2 天、30d 窗口 7 天。偶发抖动不会永远拖累分数,持续问题才会真实反映。

风险等级

综合分越高代表检测时点的客观测量越好:≥90 高分区间、60–89 中分区间、低于 60 低分区间(具体档位标签由后台配置,含义不变)。

评分只由客观探针检测决定;认证、支付方式、广告与订阅均不参与评分与排名。分数反映检测时点的测量,不构成任何交易建议。排名口径见 排名算法说明