Qué es un harness en IA y por qué ya no basta con el modelo
En agentes, el harness es el andamiaje que conecta al modelo con herramientas, contexto y bucles de ejecución. Explicamos qué es, para qué sirve y por qué cada vez pesa tanto como el propio LLM.

Si trabajas con agentes, acabas oyendo harness casi tanto como LLM. No es un modelo nuevo ni un producto con nombre de marketing. En la práctica suele referirse al andamiaje que convierte un chat model en un sistema que puede actuar: herramientas, prompts de sistema, control de flujo, memoria de sesión, trazas y, muy a menudo, un banco de pruebas.
-IA Crew dice: El modelo habla. El harness decide qué puede tocar, cuántas veces y con qué criterio se da por bueno el resultado.-
No hay una única definición formal
En ingeniería de software clásica, un test harness es el armazón que ejecuta un programa bajo prueba, le pasa entradas y recoge salidas. En agentes se hereda esa idea y se amplía. Un harness de agente acopla el modelo a herramientas, prompts y un bucle de control para que deje de ser solo una conversación y pase a completar tareas.
Ese acoplamiento no es cosmético. Un mismo LLM puede comportarse de forma muy distinta si cambia el formato de las llamadas a herramientas, el número de turnos permitidos o la forma de recuperar contexto. Por eso hablar solo del modelo suele quedarse corto cuando el trabajo real es multi-paso.
Qué piezas suele incluir
Aunque cada equipo lo recorta a su manera, un harness de agentes suele reunir varias capas. El bucle de ejecución decide cuándo el modelo pide una herramienta, cuándo responde y cuándo se detiene. Encima van los adaptadores: terminal, navegador, buscador, APIs o un MCP.
También hay una capa de observabilidad. Las trazas no son un extra elegante: permiten ver qué hizo el agente, en qué orden y dónde se rompió. Sin ellas, depurar un agente es adivinar.
En entornos más maduros el harness incluye evals. Escenarios, jueces y criterios de paso. Databricks, por ejemplo, describe su metodología coSTAR como un ciclo en el que el test runner ejecuta el agente, produce trazas y los jueces hacen de suite de pruebas. La analogía con el desarrollo clásico no es solo didáctica: es la forma en que organizan el trabajo.
Por qué importa tanto como el modelo
Hay un debate abierto —y sano— sobre cuánto pesa el harness frente al modelo. Un preprint reciente de 2026, Harness or Model?, mide contrastes con el mismo modelo bajo harnesses distintos en tareas de programación. El resultado no corona un ganador universal: el efecto cambia según el tipo de tarea, y las medias pueden quedar casi empatadas aunque por debajo haya diferencias grandes.
Eso no anula la intuición de mucha gente de producto. Si el harness limita mal las herramientas, pierde el hilo o evalúa mal, un modelo fuerte se ve mediocre. Si el harness encaja con el tipo de trabajo, un modelo más barato puede rendir de forma sorprendente.
-IA Crew dice: Cuando alguien dice «este modelo no vale para agentes», a veces lo que no vale es el armazón que lo rodea.-
Cómo reconocerlo en el día a día
Si usas un SDK de agente, un runner de evals o una plataforma que orquesta herramientas y juzga resultados, estás dentro de un harness aunque nadie lo llame así. Claude Code, Codex, LangGraph, CrewAI o un MCP propio son, en este uso del término, variantes de ese armazón.
La pregunta útil no es si «existe el harness definitivo». Es más modesta y más práctica: ¿este sistema deja al modelo usar herramientas, mantener contexto y comprobar si de verdad terminó la tarea? Si la respuesta es sí, ya no estás hablando solo de un chatbot.
Glosario
Harness — En agentes, el andamiaje de software que conecta el modelo con herramientas, control de flujo, contexto y, a menudo, evaluación.
LLM — Modelo de lenguaje de gran tamaño; el motor que genera texto y decide llamadas, pero no el sistema completo.
Evals — Pruebas sistemáticas —escenarios, jueces, criterios de paso— para medir si un agente hace bien una tarea.
MCP — Protocolo para exponer herramientas y contexto a un agente de forma estructurada.

