CounterProof

Medimos nuestro propio método, y no justificó su coste

Dos comparaciones preregistradas y puntuadas a ciegas entre nuestro dispositivo de revisión completo y una sola pasada económica, con auditorías profesionales públicas como plantilla de respuestas. El dispositivo perdió una diana con claridad; en la otra activó su propio umbral de precisión solo eliminando los hallazgos que el auditor había dictaminado reales (0–1 de 4, según el puntuador). Qué cambiamos, qué volvimos a medir, y los agujeros que una auditoría posterior encontró en la medición misma.

En agosto de 2026 ejecutamos el experimento que nuestro propio informe de caso debía desde hacía meses: ¿justifica su coste el dispositivo de revisión completo que construimos frente a una sola pasada económica? Lo preregistramos, lo puntuamos a ciegas y usamos auditorías profesionales públicas como plantilla de respuestas. Perdió una diana con claridad y en la otra no pudo ser declarado vencedor. Después, en septiembre, una auditoría retrospectiva de las ejecuciones halló que la comparación no era tan limpia como habíamos dicho. Esta nota lo recoge todo, porque la regla que esta práctica vende (una práctica que no puede mostrar dónde se equivocó no tiene autoridad donde dice acertar) se aplica primero a nosotros.

Qué hicimos

Dos dianas, ambas código público con una auditoría profesional pública en un commit declarado, de modo que la plantilla de respuestas existía antes de empezar y no era nuestra:

  • Diana 1, BDK (bitcoindevkit/bdk_wallet en 775e4aee, v1.0.0-beta.2), frente a la auditoría de Wizardsardine de diciembre de 2024: doce hallazgos como denominador. Ejecución el 14 de agosto.
  • Diana 2, ZF FROST (ZcashFoundation/frost en 5fa17ed, v0.6.0, frost-core), frente a la evaluación de NCC Group de octubre de 2023: cuatro hallazgos como denominador. Ejecución los días 22 y 23 de agosto.

Dos brazos en cada una. Brazo A, el nivel económico: una pasada de un solo linaje de modelos externo, con autocomprobación integrada de sus propias citas. Brazo B, el dispositivo completo: un panel de linajes buscadores, después una instancia «abogado del diseñador» que defiende los supuestos de confianza previstos por el código, después una comprobación adversarial de alcanzabilidad, y después un control final. Ambos brazos trabajaron sobre el código anterior a la corrección, con las mismas reglas de intervención neutrales respecto a los hallazgos, y nunca se les dijo qué había encontrado la auditoría. Los denominadores y la regla de coincidencia (mismo sumidero y mismo mecanismo) se congelaron por escrito antes de puntuar. Cada informe fue puntuado después por un analista a ciegas que no había ejecutado ninguno de los dos brazos y que verificó cada afirmación contra el código fuente. La regla de decisión estaba fijada de antemano: el dispositivo justifica su coste si recupera al menos dos hallazgos del auditor adicionales, o si el brazo económico entrega al menos dos afirmaciones adicionales refutadas por el código fuente.

Qué encontramos

Nivel económicoDispositivo completo
Diana 1, recuperados de los 12 hallazgos del auditor86 (5 en lectura estricta)
Diana 1, afirmaciones refutadas por el código, entregadas0 de 251 de 39
Diana 2, recuperados de los 4 hallazgos del auditor40–1 (depende del puntuador, véase más abajo)
Diana 2, afirmaciones refutadas por el código, entregadas3 de 111 de 7 (0 con el segundo puntuador)

En la primera diana el dispositivo fue sencillamente peor: menos hallazgos recuperados, una afirmación falsa más, unas seis veces más llamadas a modelos, dos instancias caídas. En la segunda hizo justo lo que nuestra hipótesis predecía, reduciendo las afirmaciones falsas en un entorno ruidoso (se activó su umbral de precisión preregistrado); y lo pagó eliminando los hallazgos que el auditor había dictaminado reales (los cuatro con un puntuador, tres de cuatro con otro), después de que su propio panel buscador los hubiera encontrado los cuatro. La regla preregistrada no tenía forma de sopesar una ganancia de precisión frente a un desplome de los hallazgos recuperados, y por eso no pudo nombrar vencedor; nosotros no llamamos a eso una victoria.

El mecanismo fue el mismo en ambas dianas, y no fueron los buscadores. El abogado y la comprobación de alcanzabilidad retiran cualquier candidato que descanse en «un supuesto que el código documenta, o una parte en la que el modelo de amenazas confía». Esa prueba la satisfacen tanto los falsos positivos (que se pueden retirar sin riesgo) como los hallazgos reales cuyo sentido entero es que el supuesto documentado no se impone. En FROST, los comentarios del propio código decían que quien llama valida las entradas; el auditor había dictaminado que precisamente esa asignación era el defecto; nuestro abogado creyó a los comentarios. Los rechazos, uno a uno, eran lecturas defendibles. El error fue zanjar la cuestión en silencio, por eliminación.

Qué cambiamos

  • Los filtros anotan; ya no eliminan. Una instancia que descartaría un hallazgo por motivos de supuesto, intención o confianza ahora lo marca y lo deja en el informe para que lo resuelva una persona.
  • Reensamblamos en ese modo los veredictos conservados de la diana 2, contra una prueba preregistrada (23 de agosto; los veredictos existentes de los filtros pasaron a ser marcas, un cambio de etiqueta y no una ejecución nueva, puntuados esta vez por un solo puntuador a ciegas sobre los 24 candidatos). Los hallazgos recuperados volvieron a 4 de 4, mecánicamente, porque no se eliminó nada. La cifra interesante era la marca: cada una de las siete afirmaciones falsas llevaba marca, y ninguno de los siete elementos sin marcar era falso; en esta única diana la marca funcionó como criba. Pero diez de los diecisiete elementos marcados eran reales, seis de ellos los del propio auditor. Como veredicto, la misma marca es destructiva. La marca le dice qué mirar, no qué tirar: y lo que le cuesta a un revisor resolver diecisiete elementos marcados, o si una persona con un plazo encima resiste eliminar sobre la marca, no se ha puesto a prueba.
  • El nivel económico es el valor por defecto: una decisión de política basada en dos ejecuciones, provisional, y mantenida después de que la auditoría de más abajo redujera la comparación a su diferencia de precisión. El panel pesado queda reservado a superficies con una tasa bruta de falsos positivos realmente alta, donde una persona resolverá las marcas.
  • Una «victoria de precisión» ya no cuenta por sí sola. En la diana 2 el umbral de precisión se activó porque el mismo filtro había hundido los hallazgos recuperados; el preregistro trataba ambos como mandos independientes, y el primer borrador de nuestro propio informe llegó a inventar una ponderación después de ver el resultado; un control de revisión lo detectó. En adelante, una ganancia de precisión solo cuenta si los hallazgos recuperados por el dispositivo quedan como mucho uno por debajo de los del brazo económico.

Después, la medición no superó su propia auditoría

El 13 de septiembre, una auditoría retrospectiva de cada sesión de instancia almacenada (1.385 en total) halló que el brazo económico no era tan ciego como decía el protocolo. Sus sesiones habían consultado, entre otras páginas, los propios gestores de incidencias de las dianas: incidencias que nombran precisamente las funciones y los objetos tras varios hallazgos del auditor. Ninguna de esas páginas enuncia los mecanismos de la auditoría, así que nadie leyó una plantilla de respuestas; pero la frase del protocolo según la cual los brazos ven «solo el código fuente fijado» era falsa, y la comprobación de contaminación que habíamos ejecutado era una sonda de memoria en frío, incapaz de detectar una consulta en tiempo de ejecución. Las sesiones del brazo del dispositivo habían sido purgadas por su propio controlador; su exposición es, por tanto, imposible de establecer.

Un seguimiento el mismo día procedió hallazgo por hallazgo. En BDK, dos de las ocho filas acreditadas al brazo económico caen sobre la función que nombran las incidencias consultadas; las otras seis no muestran solapamiento registrado. En FROST, tres de las cinco filas acreditadas caen sobre el parámetro exacto del que trata la única incidencia consultada: un impacto temático directo, y no mera alcanzabilidad, aunque la incidencia no enuncia en ningún momento el mecanismo. Incluso acreditando al brazo económico solo las filas no correlacionadas (seis de ocho, dos de cinco), sigue recuperando al menos tanto como el dispositivo en ambas dianas: el sentido del resultado se sostiene, el margen no. Y el seguimiento no pudo completarse: los registros de sesión del brazo económico habían sido podados por la propia rutina de limpieza de la herramienta en cuestión de horas tras la primera auditoría, y el texto en bruto de sus hallazgos nunca se había guardado; las listas completas de consultas y la cronología hallazgo por hallazgo son ya irrecuperables.

Lo que eso derriba: las cifras del nivel económico como cifras limpias. Lo que no derriba: que la medición ocurrió, que los oráculos eran externos, que el preregistro y la puntuación a ciegas eran reales, y (el hallazgo que importa) que las instancias filtrantes del dispositivo eliminaron hallazgos que un auditor profesional había dictaminado reales. Eso se estableció leyendo los rechazos de las propias instancias, no mediante los recuentos de hallazgos recuperados. Ambas auditorías las ejecutó el mismo proveedor de modelos que el orquestador; constan en el expediente con esa etiqueta.

Cinco debilidades más que el expediente recoge, la mayoría encontradas por instancias de revisión y no por nosotros: el puntuador a ciegas era del mismo proveedor de modelos que el orquestador y que la instancia de fusión del dispositivo, obligado por la disponibilidad y mitigado por la verificación contra el código, pero un canal de correlación en un experimento sobre descorrelación; el mismo linaje externo que ejecutó el brazo económico ocupó también el puesto de verificador de alcanzabilidad del dispositivo en ambas dianas, así que parte de la diferencia en hallazgos recuperados es un linaje en desacuerdo consigo mismo según el papel; el brazo económico tal como se ejecutó era más escueto que el preregistrado (sin comprobación separada del gestor de incidencias ni suite de controles separada), y en la diana 1 el resultado de la sonda de memoria nunca se escribió en el registro de ejecución; el dispositivo funcionó con dos linajes buscadores frente a un mínimo preregistrado de tres, de modo que una versión a plena potencia podría hacerlo mejor, aunque las pérdidas vinieron de los filtros, que un tercer buscador no cambiaría; y un tercer puntuador a ciegas, al repuntuar los siete hallazgos del dispositivo en la diana 2, coincidió en seis e invirtió el decisivo, que es la razón de que esa casilla diga 0–1 y no 0.

Qué le aporta esto

Nada en esta página es una afirmación sobre tasas de detección; es lo contrario. Lo que sí es: la capacidad de ejecutar esta medición, preregistrada, puntuada a ciegas, contra una auditoría pública, con una comprobación de contaminación que examina lo que una instancia consultó en lugar de lo que recuerda, y que copia el registro de sesión a un almacenamiento duradero en el momento de puntuar, porque los registros que había detrás de esta auditoría desaparecieron el mismo día. Se adopta en la misma revisión de nuestro informe de caso que publica esta medición, y lo primero que midió fuimos nosotros. Cuando rastreamos el mercado en septiembre de 2026 no encontramos ninguna otra práctica de revisión que publique una comparación controlada de su propio producto, y menos aún una que haya perdido. Es una afirmación sobre lo que consta en el expediente, no sobre quién es mejor; la próxima pasada económica quizá vuelva a ganarnos, y si lo hace, lo leerá aquí.


Los límites que corresponden aquí: dos dianas, una de ellas con un denominador de cuatro filas; las cifras del brazo económico están contaminadas por consulta y la exposición del brazo del dispositivo es imposible de establecer; el puntuador era del mismo proveedor; los costes se contaron en llamadas a modelos, lo que favorece al nivel económico (su única pasada en la diana 1 fue la llamada medida más cara); el análisis de qué aciertos del brazo económico siguieron a una página consultada es parcial y ya no puede completarse. La afirmación de nuestro informe de caso de que no se había ejecutado ninguna comparación controlada era cierta cuando se escribió y quedó obsoleta el 14 de agosto; la revisión de biblioteca publicada junto a esta nota recoge la medición y ambas auditorías. Si algo aquí es incorrecto, lo corregimos por escrito en esta página.

← Todas las notas