xAI lanza Grok Voice Transcribe 2.0 con el doble de precisión
xAI libera Grok Voice Transcribe 2.0, su modelo speech-to-text que duplica la precisión de la versión anterior manteniendo el mismo precio. Lidera el ranking de Artificial Analysis en streaming y actualiza automáticamente las integraciones existentes.

xAI ha presentado Grok Voice Transcribe 2.0, la nueva versión de su modelo de speech-to-text. Según la compañía, duplica la precisión de la versión 1.0 sin modificar el precio: 0,10 dólares por hora en modo batch y 0,20 dólares por hora en streaming.
El modelo lidera actualmente el ranking de Artificial Analysis entre 32 sistemas de streaming evaluados. La mejora se nota especialmente en entornos ruidosos y con acentos diversos, según las métricas internas publicadas.
Qué incluye la versión 2.0
Grok Voice Transcribe 2.0 mantiene compatibilidad completa con batch y streaming. Incorpora de forma nativa diarización de hablantes, timestamps precisos y soporte para keyterms personalizados. Las integraciones existentes se actualizan de forma automática sin necesidad de cambios en el código del cliente.
La documentación técnica detalla que el modelo está orientado tanto a transcripción de reuniones largas como a aplicaciones en tiempo real. El precio se mantiene estable a pesar del salto de rendimiento.
Por qué importa en el ecosistema multimedia
La transcripción de voz se ha convertido en una pieza básica de muchos flujos de trabajo con agentes y asistentes. Un modelo que reduce a la mitad la tasa de error mientras mantiene el coste abre la puerta a usos más exigentes. Subtítulos en vivo, análisis de llamadas o documentación automática dejan de ser un lujo frágil.
xAI enfatiza que la actualización es transparente para los desarrolladores que ya estaban usando la versión anterior. No hace falta migrar endpoints ni reescribir clientes; el sistema simplemente entrega mejores resultados.
Contexto competitivo
El mercado de speech-to-text está saturado de opciones, desde los grandes proveedores cloud hasta modelos open-weight. Liderar el ranking de Artificial Analysis en streaming es una señal medible, no solo un eslogan de producto.
La compañía no ha publicado todavía comparativas detalladas frente a Whisper o a las soluciones de Google y Amazon. Aun así, mantener precio y duplicar precisión es una combinación poco habitual en este segmento.
-IA Crew dice: Duplicar la precisión manteniendo el precio es la clase de anuncio que los desarrolladores quieren oír. Ahora toca ver si el liderazgo en el ranking se traduce en adopción real fuera del ecosistema Grok.
Diccionario de la Crew
Speech-to-text — Tecnología que convierte audio hablado en texto escrito de forma automática.
Diarización — Proceso de identificar y separar quién habla en una grabación con varios interlocutores.