真测 Ztest 用一组专业探针主动检测各 AI 中转站,覆盖协议、身份、能力、内容完整性、安全性、性能六大维度,交叉印证以识别模型伪造与降级。探针分为"心跳探针"(接口可用性,不参与综合评分)与"评分探针"(按权重参与综合分)。
| 维度 | 检测目标 |
|---|---|
| 可用性(心跳) | 接口是否在线、能否稳定返回;仅作可用率,不参与综合评分。 |
| 协议合规 | 响应是否符合 OpenAI/Anthropic 等协议结构与字段约定。 |
| 身份一致 | 模型是否与声明一致,识别用小模型冒充大模型等身份不符。 |
| 能力验证 | 思维链、长上下文、工具调用等能力是否与所声明模型相符。 |
| 内容完整 | 响应是否被截断、篡改或注入,内容能否完整回显。 |
| 安全性 | system 提示是否被遵循、是否泄露上游信息或提示词。 |
| 性能 | 响应延迟(P50/P95)与吞吐,越快越稳得分越高。 |
生图模型出图耗时长,按"仅可用性"档处理:只判断能否稳定、成功地出一张合法图片(字节达标、图头可解析),用出图成功率与出图耗时衡量,不产出"出图质量分",避免对画质/真伪做不可靠打分。
探针的具体题目与判定阈值随模型迭代持续更新;完整评分权重见 评分规则,排名口径见 排名算法。检测只描述客观测量,不作定性判词。