Una revisión que termina con dos respuestas
Imagina una revisión de campaña. Un agente afirma que el texto respeta el briefing; otro señala una promesa incompatible con sus requisitos. El coordinador tiene que preparar un informe para la persona responsable. Resumir ambas respuestas en «la campaña parece correcta» haría desaparecer el problema que debía revisar.
Empieza por comprobar qué ha recibido cada participante. Quizá uno leyó el briefing anterior, otro analizó una pieza distinta o los dos interpretaron de forma diferente el mismo requisito. Son causas distintas y necesitan resoluciones distintas. El número de respuestas coincidentes no aclara por sí solo ninguna de ellas.
En esta guía proponemos un contrato para conservar ese desacuerdo. La práctica descargable utiliza informes inventados para comprobar la fusión; no ejecuta agentes ni acredita que una arquitectura multiagente revise mejor las campañas.
Decide si necesitas dividir el trabajo
Para una solicitud corta con cuatro campos, una extracción seguida de validación puede ser suficiente. Dividirla entre varios agentes añade entregas que coordinar y no tiene una ventaja demostrada para esa tarea. La guía sobre reglas, workflows y agentes ayuda a elegir el punto de partida.
Puede tener sentido repartir tareas con fronteras claras: comprobar requisitos textuales, revisar enlaces o investigar fuentes distintas. Algunas de esas partes se resuelven con funciones convencionales. Define primero qué trabajo independiente existe y qué información deberá reunirse al final.
Anthropic describe una arquitectura de coordinador y trabajadores para su sistema de investigación, junto con problemas de delegación y coordinación. Es una experiencia de ese producto: sus resultados no demuestran una mejora equivalente en campañas, CRM o en cualquier combinación de modelos.
Entrega afirmaciones que se puedan comparar
«Todo bien» es una salida difícil de revisar. Una entrega útil debe indicar qué pregunta responde, sobre qué material y con qué soporte. Esta es una propuesta de contrato para un informe de campaña:
| Elemento | Ejemplo sintético | Qué permite comprobar |
|---|---|---|
| Identidad de tarea | campana-ejemplo-01 |
Que los informes pertenecen al mismo encargo. |
| Requisito | REQ-03 |
Que se está comparando la misma restricción. |
| Versiones | brief-v2, pieza-v4 |
Que las respuestas se refieren al mismo material. |
| Resultado | incumple |
Qué afirma el participante. |
| Evidencia | ID, sección y fragmento | Dónde contrastar la afirmación. |
| Límites | no_evalua_diseno_visual |
Qué queda fuera de su revisión. |
Acuerda también salidas para información ausente o no evaluable. Forzar una respuesta binaria cuando falta el briefing produce una apariencia de decisión. El coordinador debe poder devolver «falta material» sin convertir esa ausencia en conformidad.
El laboratorio siguiente implementa una versión reducida de este contrato. Solo agrupa por clave, compara valores y comprueba que las referencias pertenezcan a un registro. Los campos de ámbito y versiones de la tabla son una ampliación propuesta, no controles ya implementados en ese código.
Reproduce la fusión de informes
Descarga la práctica de coordinación. Descomprime el archivo y ejecuta estos comandos desde su directorio con Python 3.10 o posterior:
python3 casos_coordinacion.py --output salida.json
python3 -m unittest -v test_agentic_lab.CoordinationTests
El ejemplo construye tres informes sobre cumple_brief. Dos contienen true y uno false. Los IDs de sus fuentes son ficticios y están declarados como tales. La función deja la clave discutida fuera de las afirmaciones coincidentes y conserva las tres posiciones en conflicts, con estado needs_review.
También incluye un caso de acuerdo: cuando coinciden los valores, conserva las referencias de los participantes. Un tercer caso provoca el rechazo de una fuente cuyo ID no existe en el registro. Puedes revisar las entradas y salidas completas en resultado.json dentro del paquete.
La política de conservar un conflicto es una decisión de diseño de esta práctica. Para otra tarea puede ser razonable una resolución automática si existe una regla verificable y acordada. Debe quedar visible qué regla se aplicó y qué información descartó.
Un acuerdo todavía necesita comprobación
Dos participantes pueden copiar el mismo dato desactualizado o compartir una interpretación equivocada. Tampoco basta con que una referencia exista: hay que comprobar si sostiene la afirmación y si corresponde a la versión evaluada.
El estado merged del ejemplo significa que los valores coinciden. No significa que se haya comprobado su verdad. La función no abre documentos, no verifica la independencia de las fuentes y no autentica a los participantes. Son límites del código entregado, relevantes antes de reutilizarlo.
Conserva también qué material vio cada participante. Una discrepancia entre versiones no debe resolverse como si ambos hubieran respondido a la misma pregunta. Si falta ese contexto, la siguiente acción útil suele ser obtenerlo o repetir una revisión acotada.
Define cómo salir del desacuerdo
Para el caso de campaña proponemos este recorrido:
- Comprobar identidad de tarea, requisito y versiones. Si difieren, alinear el material antes de comparar.
- Mostrar ambas conclusiones con sus fragmentos de soporte. Si falta una referencia, solicitarla o marcar la afirmación como no sustentada.
- Aplicar una regla determinista cuando la pregunta sea verificable de ese modo, como la presencia de un texto obligatorio.
- Si persiste una diferencia de interpretación, presentar la discrepancia a la persona responsable con una pregunta concreta.
- Registrar resolución y motivo; conservar las posiciones originales para poder evaluar el proceso.
Una nueva ronda de agentes solo tiene sentido si puede aportar información distinta. Establece un límite de rondas y una salida de escalado. Repetir la misma pregunta con el mismo material puede consumir recursos sin resolver la causa.
Evalúa el proceso completo
El siguiente ensayo con agentes reales debería comparar un proceso sencillo y otro repartido sobre los mismos casos y requisitos. Antes de ejecutarlo, fija versiones, presupuesto, política de desacuerdos y criterios de revisión. En IA en Uso esa ejecución queda pendiente para el equipo de laboratorio Evo-X2.
Registra errores omitidos, falsas alarmas, conflictos detectados, conflictos resueltos con evidencia y tiempo humano necesario. Un desacuerdo detectado puede ser un resultado útil; una respuesta unánime puede seguir siendo incorrecta. La evaluación debe contrastar ambas con la referencia y sus límites.
Las trazas del proceso permiten localizar dónde se produjo la discrepancia. La revisión humana define quién puede resolverla. Mantén separados esos controles de la conclusión sobre calidad: este laboratorio comprueba una forma de combinar informes, no la eficacia de los agentes que podrían producirlos.
Para contrastar
Fuentes y versiones
Consulta la documentación original para entender cada herramienta y contrastar lo que se explica aquí.
- Anthropic · How we built our multi-agent research system Consultada el 19 de septiembre de 2026 · Experiencia del sistema Research; publicada el 13-06-2025
- Anthropic · Building effective agents Consultada el 19 de septiembre de 2026 · Versión no fijada
- Anthropic · Demystifying evals for AI agents Consultada el 19 de septiembre de 2026 · Versión no fijada