20260910 #2 — Optimizar el Harness

Dos formas de mejorar lo que hace un agente —ajustar el prompt o coordinar varios agentes en un harness— con sus ejemplos estándar y su costo en tokens.

Corrí un skill de investigación llamado deep-research y, sin buscarlo, disparé 109 agentes en cadena: una sola corrida se comió media sesión de tokens. Salió bien, pero me dejó una pregunta concreta: cuando quiero que un agente rinda más, ¿me conviene afinar el prompt o montar un harness de varios agentes? Son dos caminos con costos muy distintos. Acá los comparo.

Prompt engineering: optimizar por líneas

El primer camino es barato: mejorar las instrucciones que recibe un solo agente. Los ejemplos estándar son conocidos —un buen system prompt que fija el rol, few-shot (dos o tres ejemplos resueltos), chain-of-thought para que razone paso a paso, y reglas de proyecto en un archivo como CLAUDE.md. Todo esto es determinístico y casi gratis en tokens: escribís una vez, corre siempre.

Tiene un techo. El antipattern más común es acumular reglas: cada "no hagas esto" que agregás al .md es una línea más que el modelo tiene que recordar en cada paso. Pasado cierto punto, más instrucciones no mejoran el resultado; lo ensucian. Cuando llegás a ese punto, afinar el prompt ya no alcanza.

Harness multi-agente: optimizar por orquestación

El segundo camino es partir el trabajo entre varios agentes coordinados. Los patrones estándar: orchestrator-workers (un coordinador reparte subtareas a trabajadores), map-reduce sobre documentos (cada agente lee una parte, otro sintetiza), y el que disparé yo, un harness de investigación. En deep-research, los 109 agentes se reparten así: 1 define el alcance, 5 atacan la pregunta desde ángulos distintos, 27 buscan fuentes, 75 verifican cada afirmación (25 afirmaciones × 3 votos) y 1 sintetiza. La verificación —la mayoría de los agentes— es lo que evita la alucinación prolija.

Token budget: cuánto cuesta cada uno

Acá está la diferencia dura. Afinar el prompt no mueve la aguja del gasto. Un harness sí: Anthropic reporta que un sistema multiagente consume alrededor de 15 veces más tokens que una conversación normal. Lo que sorprende es que ese gasto no es derroche —en sus mediciones, cuánto se gasta en tokens explica cerca del 80% de la diferencia de calidad entre una respuesta y otra. Traducido: tirar más cómputo al problema mejora el resultado de verdad, pero solo se paga solo en tareas de alto valor.

Cuándo usar cada uno

La regla que me quedó es simple. Si la tarea es acotada o secuencial —cada paso depende del anterior— optimizá por líneas de prompt: es barato y suele alcanzar. Si la tarea es amplia y paralelizable —se parte en pedazos independientes que se recombinan limpio, como buscar en muchas fuentes a la vez— y el resultado justifica la factura, ahí conviene el harness.

Los 109 agentes fueron un buen recordatorio de que la pregunta no es "¿cuántos agentes puedo levantar?" sino "¿esta tarea necesita orquestación, o solo un mejor prompt?". Casi siempre, la respuesta barata —afinar el prompt— es la que corresponde primero.


Fuentes: Effective context engineering for AI agents (Anthropic) · When to use multi-agent systems (Claude/Anthropic).

Tags: prompt engineering · harness multiagente · token budget · deep-research · cuándo usar prompt vs harness

Comentarios

Suscribirse

Dejá tu mail y te aviso cuando publique algo nuevo.

Te vamos a mandar un email cuando publique algo nuevo. Podés darte de baja cuando quieras desde el link que incluye cada envío. Más detalle en privacidad.