Qué queremos comprobar

¿Detecta cada configuración los incumplimientos que afirma cubrir y distingue un requisito no evaluable de uno aprobado? Este plan te ayuda a preparar esa comparación. Las cinco piezas son sintéticas y sus enlaces no se visitan. No se envían campañas ni se cargan recursos del HTML.

La checklist con reglas cubre requisitos verificables mediante reglas. La revisión asistida con IA añade propuestas de hallazgos semánticos. Presenta resultados por tipo de requisito: una búsqueda literal no tiene el mismo alcance que una interpretación de promesas o tono.

Material y configuración

Utiliza los cinco casos de campañas del conjunto descargable. Conserva su huella SHA-256 y versión. Cada caso incluye un briefing mínimo y una pieza. Los IDs de requisito enlazan el informe con la expectativa; no reescribas el requisito después de observar la respuesta.

Implementa ambas propuestas en un entorno local de ensayo. Congela el parser, reglas, esquema de informe y, para la variante asistida, runtime, modelo, digest y prompt. El contenido HTML debe analizarse como datos inertes. Desactiva resolución de enlaces y carga de recursos externos en el ejecutor.

Procedimiento reproducible

  1. Revisa manualmente los requisitos y el fallo sembrado de cada caso. Mantén el caso correcto para observar falsas alarmas.
  2. Ejecuta las dos configuraciones con los cinco casos, tres repeticiones por combinación: 30 combinaciones en este plan.
  3. Conserva resultados por requisito con cumple, incumple o no_verificable. Un requisito fuera del alcance de la configuración debe quedar visible como no evaluado.
  4. Comprueba que las citas de hallazgos existen literalmente en la pieza y que el ID pertenece al briefing.
  5. Una persona decide si la evidencia implica el incumplimiento alegado. Registra confirmación, descarte y tiempo de revisión.
  6. Conserva fallos de parser, salidas inválidas y ausencia de respuesta como resultados de la tanda, no los elimines del denominador.

Rúbrica y medidas

En el caso correcto, un incumplimiento inventado es una falsa alarma. En el texto ausente y el destino erróneo, la regla debe identificar el requisito exacto. En la promesa de ingresos garantizados, evalúa si el hallazgo cita el texto que contradice la restricción. En el requisito de voz sin referencia, «no verificable» es la respuesta esperada.

Registra verdaderos hallazgos confirmados, errores sembrados omitidos, falsas alarmas y requisitos fuera de alcance. Si calculas precisión o cobertura de detección, muestra los recuentos y devuelve «No calculable» cuando no exista denominador. Conserva por separado el tiempo humano de confirmar o descartar.

Campos mínimos de salida: case_id, config_id, repetition, requirement_id, status, citation, review_decision, review_seconds y elapsed_ms. Ningún resultado de este protocolo autoriza por sí mismo un envío real.

Límites y siguiente decisión

Las semillas no incluyen renderizado en clientes de correo, accesibilidad completa, imágenes ni revisión legal. Que el texto esté presente no garantiza que sea visible o adecuado. Una cita literal válida tampoco garantiza que el razonamiento sea correcto.

Amplía el conjunto con requisitos autorizados del proceso objetivo y conserva una parte sin usar durante el ajuste. Si la revisión semántica genera demasiado trabajo o no añade detecciones útiles, mantén ese resultado como una conclusión posible. Documenta el informe según la metodología y compara costes con la calculadora.

Para contrastar

Fuentes y versiones

Consulta la documentación original para entender cada herramienta y contrastar lo que se explica aquí.

  1. JSON Schema · Object, required y additionalProperties Consultada el 19 de septiembre de 2026 · Documentación de JSON Schema; dialecto propuesto 2020-12
  2. Anthropic · Demystifying evals for AI agents Consultada el 19 de septiembre de 2026 · Versión no fijada
Los ejemplos están creados para practicar. Puedes consultar las fuentes y conocercómo preparamos y revisamos el contenido.