¿Qué es la ventana de contexto en IA?
La ventana de contexto es el tope de tokens que un modelo puede atender en una sola petición. No es memoria eterna. Es la mesa de trabajo: lo que no cabe encima, para esa inferencia no existe.

La ventana de contexto es la cantidad máxima de información que un modelo puede tener delante de una sola vez mientras genera una respuesta. Se mide en tokens, no en páginas ni en “memoria de elefante”. Todo lo que entra en esa petición —instrucciones, historial, archivos, herramientas y la propia respuesta— compite por el mismo presupuesto.
La metáfora útil es una mesa de trabajo, no un archivo histórico. Lo que cabe encima de la mesa, el modelo puede atenderlo ahora. Lo que se cayó al suelo no existe para esa inferencia, salvo que alguien lo vuelva a poner: un resumen, una búsqueda, un documento recuperado. La ventana no es el entrenamiento ni un disco duro interno.
-IA Crew dice: “Se acuerda de mí” suele significar “esta conversación todavía cabe”. El día que el chat se pone vago, a menudo la mesa se ha llenado de migas.-
Tokens, no palabras
Los modelos no leen caracteres como nosotros. Un tokenizador parte el texto en piezas: palabras frecuentes enteras, trozos de palabras raras, signos, código. En inglés se usa la regla tosca de que 100 tokens son unos 75 palabras. En español, en código o en tablas, la cuenta empeora: el mismo documento “gasta” más ventana.
Por eso un fabricante anuncia “128k” o “1M” y no “300 páginas”. Esas cifras son el techo combinado. Si el sistema reserva sitio para la respuesta, las herramientas y un prompt de sistema largo, el espacio real para tu PDF es menor que el número de la ficha.
También cambia el precio. Muchas APIs cobran por token de entrada y de salida. Una ventana enorme no solo permite pegar más texto; encarece cada llamada si la llenas por costumbre. Cabe ≠ conviene.
Qué entra en la cuenta
En un producto real la ventana no es solo tu mensaje. Suelen colarse el prompt de sistema, los turnos anteriores, fragmentos de RAG, esquemas de herramientas, resultados de esas herramientas y los tokens que el modelo está generando. Anthropic lo dice con claridad en su documentación: la salida también cuenta para el límite.
Eso explica rarezas cotidianas. Un chat “se olvida” del dato del mensaje 12 no porque sea maleducado, sino porque el cliente resumió o recortó historia para no reventar el techo. Un agente con muchas herramientas gasta contexto en describirlas. El usuario ve una caja de texto; el modelo ve un buffet que ya estaba medio servido.
Cuando el texto supera la ventana, el sistema recorta, comprime o rechaza la petición. Ninguna de las tres opciones es gratuita. Recortar por el principio o por el medio puede tirar justo el párrafo que importaba. Más contexto disponible no garantiza que se use bien.
-IA Crew dice: Pegar la empresa entera en el prompt es el equivalente digital de llegar a una reunión con doce archivadores y preguntar “¿por dónde vamos?”.-
Grande no significa atento
A mediados de esta década las ventanas pasaron de unos pocos miles de tokens a cientos de miles o un millón. Google llegó a evaluar recuperación en contextos enormes. Eso permite contratos, bases de código y reuniones enteras en una sola llamada. El marketing se quedó en el número; la letra pequeña está en la atención.
El paper Lost in the Middle documentó un fenómeno incómodo: muchos modelos atienden mejor el principio y el final que el centro de un contexto largo. Puedes caber y, aun así, perder la cláusula que estaba en la página 40. Capacidad de entrada y calidad de uso no son la misma métrica.
Por eso siguen existiendo resúmenes, índices y RAG. No es nostalgia de 2023. Es admitir que un millón de tokens mal puestos es un trastero. La ventana amplia reduce la necesidad de recortar; no sustituye a decidir qué merece estar encima de la mesa.
Cómo usarla sin marearte
Para un documento corto, pégalo. Para una base viva, recupera lo pertinente. Para un chat eterno, acepta que el cliente va a resumir. Y cuando compares modelos, mira la ventana junto al precio, al tope de salida y a si el fabricante publica evaluaciones de contexto largo. El número gordo de la ficha es un techo, no una promesa de comprensión uniforme.
En el diccionario: la ventana de contexto es la memoria de trabajo de esta petición. Se mide en tokens y se llena con todo lo que el sistema mete, no solo con lo que escribes. Si algo no está dentro, para el modelo no ha ocurrido —hasta que se lo vuelves a contar.
-IA Crew dice: Pedir “lee esto y lo de la semana pasada” en un chat que ya va por el token 200.000 es fe. La ventana es grande. No es un trastero con conserje.-
Diccionario de la Crew
Ventana de contexto — Límite de tokens que un modelo puede atender a la vez en una petición, incluyendo entrada y, habitualmente, la salida.
Token — Unidad en la que el modelo parte el texto; no coincide exactamente con una palabra.
RAG — Técnica que recupera fragmentos relevantes y los inserta en la ventana en lugar de pegar todo el archivo.
Fuentes
Wikipedia — Context window | https://en.wikipedia.org/wiki/Context_window
McKinsey — What is a context window? | https://www.mckinsey.com/featured-insights/mckinsey-explainers/what-is-a-context-window


