Empieza por la unidad de trabajo
Una tarea original es una petición de negocio con identidad propia: preparar el registro de una solicitud, revisar una campaña o responder una pregunta. Una llamada a un modelo es un recurso que puede utilizarse para resolverla. Si una petición genera un reintento, no ha aparecido una nueva tarea original.
La aceptación también necesita una definición. En CRM puede significar «borrador utilizable tras la revisión acordada»; en procedimientos, «respuesta cuyas afirmaciones están sustentadas». No compares esos resultados entre sí como si fueran la misma unidad. La comparación útil mantiene tarea, alcance y criterio de aceptación.
Esta guía propone un modelo contable sencillo para explorar escenarios. Las fórmulas y cifras ilustrativas permiten seguir el cálculo paso a paso. La referencia sobre evaluación de sistemas de Anthropic ayuda a distinguir resultados de ejecuciones; no aporta los precios ni valida los supuestos del ejemplo.
Separa las nueve entradas
La calculadora local pide tareas originales al mes, intentos medios por tarea y coste variable por intento. Un intento puede agrupar las llamadas necesarias para una pasada completa. Elige una definición y úsala tanto en el contador como en el coste unitario.
Las siguientes entradas son porcentaje final aceptado, porcentaje de tareas revisadas, minutos por tarea revisada y coste por hora. El tiempo de revisión debe recoger el trabajo total por tarea revisada, incluidas segundas comprobaciones si las hay. No multipliques además esa partida por los intentos.
Por último, imputa infraestructura y mantenimiento mensuales. El reparto entre proyectos debe ser explícito: por horas, por uso medido o por otra regla documentada. Si el coste variable ya incorpora un recurso, no lo vuelvas a incluir como infraestructura.
| Entrada | Unidad | Qué incluye |
|---|---|---|
| Volumen | Tareas originales/mes | Peticiones únicas, no llamadas |
| Intentos medios | Intentos/tarea | Primer intento y reintentos |
| Variable | €/intento | Todos los recursos variables de esa pasada |
| Aceptación final | % de tareas | Tras la política de corrección acordada |
| Revisión | % de tareas y minutos/tarea revisada | Trabajo humano total sobre ese subconjunto |
| Infraestructura y mantenimiento | €/mes | Costes fijos imputados una sola vez |
Aplica las fórmulas sin redondear antes de tiempo
variable = tareas × intentos medios × coste por intento
revisión = tareas × (% revisado / 100) × (minutos / 60) × €/hora
total = variable + revisión + infraestructura + mantenimiento
aceptadas = tareas × (% aceptado / 100)
coste por aceptada = total / aceptadas
Los porcentajes se convierten a proporciones una sola vez. Los minutos se convierten a horas dividiendo entre 60. Conserva la precisión durante el cálculo y redondea al presentar los importes. Un volumen aceptado fraccional puede aparecer en una proyección mensual; representa una expectativa, no una fracción de una tarea ejecutada.
Si no hay tareas aceptadas, el coste unitario es «No calculable». El gasto mensual puede seguir existiendo. Mostrar cero euros por tarea en esa situación ocultaría un proceso que no produce resultados aceptados.
Un escenario ilustrativo, paso a paso
Supongamos 1.000 tareas al mes, 1,2 intentos por tarea y 0,03 € por intento. El porcentaje final aceptado es 85 %. Se revisa el 20 % de las tareas, con tres minutos en total por cada una y un coste de 25 €/hora. Imputamos 40 € de infraestructura y 100 € de mantenimiento mensual.
Estos valores son arbitrarios para explicar la herramienta: no son un benchmark, un resultado observado ni tarifas actuales de proveedores. El cálculo da 36 € de variable y 250 € de revisión. El total mensual es 426 €, con 850 tareas aceptadas estimadas. El coste por tarea aceptada es aproximadamente 0,5012 €, mostrado como 0,50 €.
Si mantienes el mismo gasto y reduces la aceptación al 50 %, el coste unitario sube a 0,852 €. Esa variación matemática no predice el comportamiento real: una caída de aceptación podría cambiar también los intentos y la revisión. La calculadora permite introducir esas dependencias manualmente; no las inventa.
Explora qué supuesto cambia la decisión
Prueba primero los parámetros menos conocidos: minutos de revisión, aceptación y mantenimiento. Guarda los supuestos junto a su procedencia. Una estimación de una persona no debe confundirse con un cronometraje; una factura de una prueba corta no necesariamente representa la infraestructura mensual.
Para comparar una solución de reglas con una extracción asistida, utiliza el mismo conjunto de tareas y el mismo umbral de aceptación. Un flujo que rechaza casos difíciles puede parecer barato por llamada y costoso por tarea útil. Añade también la carga de resolver fuera del flujo las peticiones rechazadas si entra en el alcance de tu comparación.
Qué no resuelve este modelo
El cálculo no demuestra retorno de inversión, calidad del resultado ni capacidad para operar un servicio. Tampoco convierte tiempo potencialmente liberado en ahorro monetario. El coste inicial de implementación, una migración o un incidente excepcional necesitan una imputación explícita si quieres incluirlos en mantenimiento.
En el Atlas no se precargan mediciones ficticias. Todas las métricas están como null. Cuando existan ejecuciones revisadas, podrás sustituir los supuestos por valores trazables conservando el período, la moneda, el criterio de aceptación y los límites. Esa trazabilidad importa más que mostrar muchos decimales.
Para contrastar
Fuentes y versiones
Consulta la documentación original para entender cada herramienta y contrastar lo que se explica aquí.
- Anthropic · Demystifying evals for AI agents Consultada el 19 de septiembre de 2026 · Versión no fijada