20260910 #2 — Optimizar el Harness
Dos formas de mejorar lo que hace un agente —ajustar el prompt o coordinar varios agentes en un harness— con sus ejemplos estándar y su costo en tokens.
Corrí un skill de investigación llamado deep-research y, sin buscarlo, disparé 109 agentes en cadena: una sola corrida se comió media sesión de tokens. Salió bien, pero me dejó una pregunta concreta: cuando quiero que un agente rinda más, ¿me conviene afinar el prompt o montar un harness de varios agentes? Son dos caminos con costos muy distintos. Acá los comparo.
Prompt engineering: optimizar por líneas
El primer camino es barato: mejorar las instrucciones que recibe un solo agente. Los ejemplos estándar son conocidos —un buen system prompt que fija el rol, few-shot (dos o tres ejemplos resueltos), chain-of-thought para que razone paso a paso, y reglas de proyecto en un archivo como CLAUDE.md. Todo esto es determinístico y casi gratis en tokens: escribís una vez, corre siempre.
Tiene un techo. El antipattern más común es acumular reglas: cada "no hagas esto" que agregás al .md es una línea más que el modelo tiene que recordar en cada paso. Pasado cierto punto, más instrucciones no mejoran el resultado; lo ensucian. Cuando llegás a ese punto, afinar el prompt ya no alcanza.
Harness multi-agente: optimizar por orquestación
El segundo camino es partir el trabajo entre varios agentes coordinados. Los patrones estándar: orchestrator-workers (un coordinador reparte subtareas a trabajadores), map-reduce sobre documentos (cada agente lee una parte, otro sintetiza), y el que disparé yo, un harness de investigación. En deep-research, los 109 agentes se reparten así: 1 define el alcance, 5 atacan la pregunta desde ángulos distintos, 27 buscan fuentes, 75 verifican cada afirmación (25 afirmaciones × 3 votos) y 1 sintetiza. La verificación —la mayoría de los agentes— es lo que evita la alucinación prolija.
Token budget: cuánto cuesta cada uno
Acá está la diferencia dura. Afinar el prompt no mueve la aguja del gasto. Un harness sí: Anthropic reporta que un sistema multiagente consume alrededor de 15 veces más tokens que una conversación normal. Lo que sorprende es que ese gasto no es derroche —en sus mediciones, cuánto se gasta en tokens explica cerca del 80% de la diferencia de calidad entre una respuesta y otra. Traducido: tirar más cómputo al problema mejora el resultado de verdad, pero solo se paga solo en tareas de alto valor.
Cuándo usar cada uno
La regla que me quedó es simple. Si la tarea es acotada o secuencial —cada paso depende del anterior— optimizá por líneas de prompt: es barato y suele alcanzar. Si la tarea es amplia y paralelizable —se parte en pedazos independientes que se recombinan limpio, como buscar en muchas fuentes a la vez— y el resultado justifica la factura, ahí conviene el harness.
Los 109 agentes fueron un buen recordatorio de que la pregunta no es "¿cuántos agentes puedo levantar?" sino "¿esta tarea necesita orquestación, o solo un mejor prompt?". Casi siempre, la respuesta barata —afinar el prompt— es la que corresponde primero.
Fuentes: Effective context engineering for AI agents (Anthropic) · When to use multi-agent systems (Claude/Anthropic).
Comentarios
Los comentarios no están disponibles en este momento.
- Cargando comentarios…
Para comentar, entrá o registrate.