jueves, 8 de octubre de 2026
IA crew

Inteligencia artificial con contexto.
Hecho por IA para Humanos.

Diccionario IA

¿Qué es un modelo multimodal en IA?

·2 fuentes

Por IA Crew Editorial · Criterios editoriales y correcciones

Un modelo multimodal de IA procesa texto, imágenes, audio o vídeo. Aprende qué modalidades admite y cómo evaluar sus capacidades, límites y costes.

Texto, Polaroid, auriculares y tira de película alrededor de un cuaderno IA Crew: distintas señales para un solo modelo.

Un modelo multimodal es un modelo de IA entrenado para entender —y a veces generar— más de un tipo de dato en el mismo sistema: texto, imagen, audio, vídeo. McKinsey lo resume como inteligencia que procesa distintas formas de información a la vez. NVIDIA habla de omni-model cuando esa unión vive en una sola arquitectura, no en tres productos pegados con cinta. No es “un chat que también tiene un botón de foto”. Es un modelo que trata esas señales como parte del mismo razonamiento.

GPT-4o (“o” de omni), Gemini y variantes de Claude con visión son la cara pública. Unos aceptan imagen y contestan en texto. Otros oyen, ven un clip y responden de voz. La etiqueta multimodal cubre un abanico. Conviene preguntar qué entra y qué sale, no si el folleto dice “omni”.

-IA Crew dice:Pegar una captura no convierte cualquier modelo en multimodal. Si por debajo un sistema aparte “describe la foto” y otro lee el párrafo, tienes un pipeline. No un modelo.-

Qué significa “varias modalidades”

Una modalidad es un canal: letras, píxeles, onda, fotogramas. Un modelo solo de texto tokeniza palabras. Uno multimodal convierte también la imagen en parches —trozos que se vuelven tokens— y los sienta en la misma ventana de contexto. Una foto a alta resolución puede costar cientos o miles de tokens. Ver no es gratis. Come presupuesto.

En la arquitectura clásica hay un encoder por canal, una fusión y un decoder. En las familias “nativas” el entrenamiento ya mezcla esas señales, no las traduce tarde a un resumen. La diferencia se nota cuando el modelo relaciona lo que oye con lo que ve, no cuando describe la foto en tres frases y sigue como si nada.

Generar en varias modalidades es otro piso. Entender un PDF con tablas no es lo mismo que devolver una imagen o un clip. Muchos sistemas son multimodales de entrada y monomodal de salida: ven y contestan por escrito. Omni de marketing no es any-to-any de laboratorio.

Lo que no arregla

No elimina alucinación. Un modelo que “ve” el ticket puede inventar el IVA con la misma cara seria con la que describe el logo. Tampoco lee derecho como un humano: el texto pequeño, el sello torcido y el vídeo de dos horas siguen siendo terreno resbaladizo según la familia. Multimodal reduce un tipo de ceguera. No otorga vista de notario.

Hay costes ocultos. El audio y el vídeo hinchan contexto y factura. Un producto que acepta un MP4 de cuarenta minutos no siempre lo “entiende”: a veces muestrea, resume o se pierde el minuto diecisiete. Capacidad de entrada no es capacidad de atención.

Y no todos los modelos multimodales son iguales entre sí. Claude prioriza documento e imagen. Gemini aprieta vídeo largo. GPT-4o vende la conversación de voz. Elegir “el multimodal” sin decir el canal es elegir un cajón.

-IA Crew dice:“Míralo tú” dicho a un modelo es un encargo. Si no precisas qué debe leer en la foto —cifra, sello, cara—, leerá lo que le dé la gana y lo narrará con oficio.-

Relación con asistentes y generación

Un asistente de IA multimodal es el producto: el chat que acepta la captura y el PDF. El modelo es el motor. La generación de imágenes o de vídeo puede vivir en el mismo sistema o en un primo conectado. Comparten marca. No siempre comparten pesos.

Para un agente, la multimodalidad es percepción: leer una pantalla, un plano, un ticket. Sin herramientas, sigue siendo un comentarista. Con herramientas, esa percepción alimenta un clic o un archivo. Ver no es actuar. Es el primer sensor.

Cómo leer la ficha

Pregunta modalidades de entrada y de salida, cómo tokeniza una imagen, si el vídeo es nativo o un resumen, y qué pasa con datos sensibles en una foto de DNI. Si la respuesta es “lo entiende todo”, no es una ficha. Es un eslogan.

Para el diccionario: un modelo multimodal procesa —y a veces produce— más de un tipo de señal dentro de un mismo sistema. El salto no es tener ojos. Es razonar con lo que entra por más de un canal, sin convertirlo antes en un párrafo huérfano.

-IA Crew dice:La gente descubre que el modelo es multimodal el día que le enseña la pizarra y acierta el esquema. Y que no lo es tanto el día que le enseña el ticket y se inventa el CIF.-

Diccionario de la Crew

Modelo multimodal — Modelo capaz de entender o generar más de una modalidad (texto, imagen, audio, vídeo) en un mismo sistema.

Modelo de IA — Sistema entrenado que estima una salida a partir de una entrada; el multimodal es una especie, no un sinónimo.

Ventana de contexto — Presupuesto donde también caben los tokens de una imagen o de un clip; ver ocupa sitio.

Fuentes consultadas

También te puede interesar