Cómo medir la precisión de los subtítulos automáticos en español en 10 minutos
Todas las herramientas de subtítulos dicen que aciertan casi todo. El único número que importa es lo que aciertan en tu audio, con tu jerga y tu acento. Se puede medir en diez minutos, con un minuto de vídeo y una división.

Cómo medir la precisión de los subtítulos automáticos en español en 10 minutos
Respuesta corta: toma 60 segundos de tu propio vídeo, transcríbelos a mano, pasa ese mismo minuto por la herramienta y cuenta cuántas palabras cambió, se comió o inventó. Divide entre el número de palabras que realmente se dijeron. Eso es la tasa de error por palabra (WER), la métrica estándar del reconocimiento de voz, y con ella comparas cualquier herramienta en el único audio que importa: el tuyo.
Lo escribo como alguien que vende una herramienta de subtítulos. Cut.Pro afirma acertar más del 99% de las palabras. Esa es nuestra cifra, y la idea de este artículo es que no tienes por qué creerla, ni la nuestra ni la de nadie. La prueba de abajo sirve también para nosotros.
Por qué el número de la web no dice nada de tu vídeo
Un porcentaje de precisión sin el audio detrás es casi decorativo. Depende de tres cosas que casi nadie cuenta.
Qué audio se usó. Una lectura en estudio y un directo de seis horas con el juego a todo volumen son problemas distintos. En español además hay un factor extra: un sistema puede ir muy bien con el acento neutro de doblaje y tropezar con el rioplatense, el caribeño o el andaluz.
Cómo se normalizó el texto. Antes de comparar, el texto se limpia: minúsculas, puntuación, "diez" o "10". El artículo de Whisper, de OpenAI, registra que en algunos conjuntos de prueba el WER bajó hasta un 50% solo por corregir diferencias de formato, como contracciones separadas por un espacio en la transcripción de referencia (Radford et al., 2022). La mitad del "error" era estilo, no reconocimiento.
Qué errores se contaron. La métrica trata todas las palabras igual. Cambiar "el" por "un" cuesta lo mismo que escribir mal el nombre del invitado. La propia definición de la métrica lo reconoce: no tiene en cuenta el efecto que cada tipo de error tiene sobre el resultado (Wikipedia, Word error rate).
Así que la prueba correcta es pequeña, con tu material, y con un segundo recuento para los errores que duelen.
Qué es el WER, en una línea
WER = (S + D + I) / N
- S (sustitución): una palabra dicha que se convirtió en otra.
- D (omisión): una palabra dicha que desapareció.
- I (inserción): una palabra que nadie dijo y apareció.
- N: total de palabras de la transcripción correcta.
El recuento usa el menor número de ediciones para convertir un texto en el otro, la misma lógica de la distancia de Levenshtein aplicada a palabras. Un detalle que sorprende: el WER puede pasar del 100%, cuando la herramienta inventa más palabras de las que acierta (Wikipedia).
La "precisión" de marketing suele ser 1 menos el WER. Un WER del 5% se vende como "95% de precisión".
La prueba de 10 minutos, paso a paso
1. Elige tu peor minuto (1 minuto de trabajo)
No elijas el tramo más limpio. Elige el que representa tu problema real:
- jerga y groserías tal como salen en directo ("wey", "boludo", "tío", "pana");
- un acento marcado, o dos acentos distintos en la misma charla;
- dos personas hablando encima;
- música o audio del juego de fondo;
- nombres de personas, juegos y marcas, sobre todo en inglés dentro de una frase en español.
Si cortas pódcast, toma el momento en que tres personas se ríen y hablan a la vez. Si cortas directos de videojuegos, el tramo de tensión con el juego alto. Ahí es donde el subtítulo se rompe de verdad.
2. Transcribe a mano (4 a 5 minutos)
Con auriculares, escribe exactamente lo que se dijo. No lo que debería haberse dicho.
Tres reglas para no sabotear la prueba:
- Escribe el habla como es: "pa'", "o sea", "¿viste?". Si corriges la gramática en la referencia, castigas a la herramienta por ser fiel.
- Decide antes cómo tratar los números ("diez" o "10") y aplica la misma regla a los dos textos.
- Si ni tú entiendes una palabra, márcala y sácala de la prueba. Si tú no la oyes, no se puede juzgar a la herramienta ahí.
3. Genera los subtítulos (2 minutos)
Sube el mismo minuto, recortado igual, y exporta texto plano (TXT o SRT). Si comparas dos herramientas, usa exactamente el mismo archivo en las dos.
4. Normaliza los dos textos
Todo en minúsculas, sin puntuación, sin saltos de línea. Decide también qué hacer con las tildes: o las dejas en ambos textos o las quitas en ambos. Así evitas la trampa de Whisper: quieres medir reconocimiento, no formato.
5. Cuenta (2 minutos)
Con los textos lado a lado, marca cada cambio, cada ausencia y cada palabra de más. Un ejemplo corto, solo para ver la cuenta:
| Texto | |
|---|---|
| Dicho | wey se aventó de la silla como nunca lo había visto |
| Subtítulo | buey se aventó de la silla como nunca había visto |
Son 11 palabras dichas. El subtítulo cambió "wey" por "buey" (1 sustitución) y se comió el "lo" (1 omisión). WER = 2 / 11 = 18,2%, o "81,8% de precisión". En una frase con jerga, dos tropiezos pequeños bastan para hundir el número. Por eso una frase no prueba nada y un minuto entero prueba bastante.
Si prefieres no contar a ojo, la biblioteca abierta jiwer, en Python, lo hace en dos líneas: pip install jiwer y wer(referencia, subtitulo). Como herramienta de referencia del sector, el NIST mantiene SCTK, con el evaluador sclite.
El segundo recuento: los errores que de verdad duelen
El WER te da el promedio. Un subtítulo de clip no se juzga por el promedio, se juzga por el peor error que aparece en pantalla. En el mismo minuto, lleva una lista aparte con cuatro columnas:
- Nombre propio mal escrito. El invitado, el streamer, el juego. Parece descuido y trae comentarios corrigiéndote.
- Cifra equivocada. Un precio, un marcador, un año. Cambia el sentido.
- Palabra clave equivocada. La que sostiene el chiste o el gancho. Si sale mal, el clip pierde su razón de ser.
- Sincronía. Elige tres puntos del minuto y mira si la palabra resaltada coincide con el sonido. Un subtítulo correcto medio segundo tarde cansa a quien mira sin sonido.
Por experiencia, dos herramientas con un WER parecido pueden tener perfiles muy distintos en esta segunda lista. Una falla en artículos y preposiciones que nadie nota. La otra falla justo en nombres y jerga, que todo el mundo nota. La segunda lista es la que decide.
Cómo convertir el resultado en una decisión
La prueba no sirve para coronar un ganador absoluto. Responde una pregunta práctica: ¿cuánto tiempo voy a pasar corrigiendo subtítulos por clip?
Una forma de pensarlo que uso: cuenta cuántas pantallas de subtítulo tiene un clip de 60 segundos y cuántas necesitaron corrección en la prueba. Si corriges una de cada tres, ese coste cae en tu flujo cada día, en cada clip. Si corriges una de cada veinte, la herramienta se está ganando lo que cuesta.
Y repite la prueba cuando cambie tu material. Un canal de pódcast tranquilo y un canal de directos con el chat gritando son dos pruebas distintas, aunque uses la misma herramienta.
Qué cambia al elegir herramienta
Tres conclusiones que sacaría antes de mirar el precio:
Compara siempre en el mismo fragmento. Número de la web contra número de la web no dice nada. El mismo minuto en dos herramientas dice mucho.
Pesa más los errores de nombres y jerga. Son los que acaban en los comentarios.
Mira el editor de corrección. Todas las herramientas fallan en algo. La diferencia entre corregir en diez segundos o en dos minutos está en poder tocar la palabra, cambiarla y que el subtítulo se reacomode solo.
Si quieres hacer la prueba en Cut.Pro, el plan gratuito incluye 15 créditos al mes, y un crédito es un minuto de vídeo analizado: el minuto de la prueba entra de sobra. Los subtítulos salen en más de 40 idiomas y el estilo lo defines en el editor. Compáralo con lo que usas hoy, en el mismo fragmento, y quédate con la que falle menos en lo que le importa a tu canal.
Cuando la precisión esté resuelta, mira cómo el estilo de subtítulo cambia la retención. Si dudas entre las dos herramientas de subtítulos más usadas por quien edita en el móvil, la comparativa Submagic o CapCut aplica este mismo razonamiento. Y si el siguiente paso es publicar en otros idiomas, el artículo sobre subtítulos traducidos en tres idiomas empieza donde este termina: una buena traducción depende de una buena transcripción.
Lo esencial
- La precisión anunciada no vale para tu audio. Mide tu peor minuto.
- WER = (cambios + omisiones + inserciones) / palabras dichas. Puede pasar del 100%.
- Normaliza antes de contar, tildes incluidas. El formato por sí solo movió el error hasta un 50% en pruebas publicadas.
- Lleva una segunda lista con nombres, cifras, palabra clave y sincronía.
- Decide por el tiempo de corrección por clip, no por el promedio.
Diez minutos de prueba ahorran meses de corregir subtítulos a mano. Y desde entonces lees cualquier "99%" con la pregunta correcta: ¿medido en qué?
Fuentes: Wikipedia, Word error rate · Radford et al., Robust Speech Recognition via Large-Scale Weak Supervision (Whisper), 2022 · jiwer, biblioteca de evaluación de reconocimiento de voz · NIST SCTK


