本页公开综合评分(composite_score,0–100)的计算逻辑:探针加权平均、跳过项权重再分配、硬上限 cap、风险等级映射。任何检测报告里的分数都可以由这些规则反推,分数只由客观检测决定,认证与付费不影响评分。
base_score = Σ(score × effective_weight) / Σ(effective_weight)
composite_score = min(base_score, min(cap_value))
| 规则 | 上限 | 触发条件 |
|---|---|---|
| d1_offline | 0 | 协议层连续失败 ≥4 轮(持续宕机);即时检测现场探不通亦直接触发 |
| d1_offline_short | 40 | 连续失败 2–3 轮(短时中断),恢复后自动解除 |
| d3_mismatch | 30 | 明确判定模型身份不匹配 |
| d3_suspect | 60 | 判定模型身份可疑 |
| d2_schema_broken | 40 | 响应结构覆盖率 < 30% |
| s2_canary_leak | 60 | system 提示 nonce canary 泄露 |
| s3_system_ignored | 50 | 非 Anthropic 通道 system 完全不被遵循 |
| s4_error_leak | 70 | 错误响应泄露上游信息 ≥2 次 |
| d17_signature_invalid | 40 | 响应关键签名(id / stop_reason / finish_reason)失败 |
所有维度分基于时间衰减加权计算,最近样本权重最大:60m 窗口半衰期 20 分钟、24h 窗口 8 小时、7d 窗口 2 天、30d 窗口 7 天。偶发抖动不会永远拖累分数,持续问题才会真实反映。
综合分越高代表检测时点的客观测量越好:≥90 高分区间、60–89 中分区间、低于 60 低分区间(具体档位标签由后台配置,含义不变)。
评分只由客观探针检测决定;认证、支付方式、广告与订阅均不参与评分与排名。分数反映检测时点的测量,不构成任何交易建议。排名口径见 排名算法说明。