Por qué confiar en el veredicto
Un falso positivo cuesta la conversación entera
Este motor se afinó contra cinco productos inventados. El primer contacto con catálogos reales dio 54% de falsos positivos. Lo que se hizo después es la mayor parte del trabajo, y es lo único que hace que un reporte sobre el feed de un desconocido valga algo.
- Un corpus real, congelado
- 4830 productos de seis feeds reales y 4188 filas de cinco catálogos de Shopify, con sha256 fijado. Cada check corre contra todos y su tasa de disparo queda registrada.
- Techo de disparo
- Si un check dispara en más del 20% del corpus, se para y se lee la evidencia. Al 100% es un bug, sin excepciones: los dos peores falsos positivos que este motor llegó a poner en producción disparaban en 4319 de 4319 items. Esa limpieza bajó el total de 19.209 hallazgos a 4.505.
- Grupo de control
- Hay productos correctos en el fixture. Que ningún check dispare sobre ellos es una condición de build, no un objetivo: si dispara, el build falla.
- Cuatro estados de red, no dos
- Una URL puede estar verificada, no encontrada, no verificable (timeout, 403, DNS) o no intentada. Solo la segunda puede volverse un hallazgo. Ese cuarto estado existe porque una versión anterior le dijo a un merchant «intentamos verificar estas y no pudimos» sobre 3987 URLs que nunca había pedido. Una afirmación falsa sobre tu feed es mala; una sobre nuestro propio trabajo es peor, porque no puedes comprobarla.
- Severidad medida, no supuesta
- 16 checks tienen su severidad confirmada contra la respuesta real de Google. El resto siguen siendo hipótesis, y el reporte no las presenta como otra cosa. También dice qué no miró y por qué.
Y nunca hablamos de dinero. Magnitud y mecanismo sí; cualquier cifra de facturación sería inventada, y una cifra inventada quema credibilidad más rápido que un falso positivo.