Como medir a precisão da legenda automática em português em 10 minutos
Toda ferramenta de legenda diz que acerta quase tudo. O único número que importa é o que ela acerta no seu áudio, com a sua gíria e o seu sotaque. Dá para medir isso em dez minutos, com um minuto de vídeo, papel e uma conta de divisão.

Como medir a precisão da legenda automática em português em 10 minutos
Resposta curta: pegue 60 segundos do seu próprio vídeo, transcreva à mão, gere a legenda na ferramenta e conte quantas palavras ela trocou, esqueceu ou inventou. Divida pelo número de palavras que foram ditas. Isso é a taxa de erro por palavra (WER), a métrica padrão de reconhecimento de fala, e com ela você compara qualquer ferramenta no único áudio que interessa: o seu.
Escrevo isso como alguém que vende uma ferramenta de legenda. A Cut.Pro afirma acertar mais de 99% das palavras. Esse é o número da empresa, e o ponto deste post é justamente que você não precisa acreditar nele, nem no de ninguém. O teste abaixo serve para nós também.
Por que o número do site não diz nada sobre o seu vídeo
Porcentagem de precisão sem o áudio junto é quase decorativa. Ela depende de três coisas que quem publica raramente conta:
Que áudio foi usado. Leitura de texto em estúdio e live de seis horas com chat gritando são problemas diferentes. Um sistema pode ir muito bem no primeiro e mal no segundo.
Como o texto foi normalizado. Antes de comparar, o texto passa por uma limpeza: minúsculas, pontuação, número escrito por extenso ou em algarismo. O artigo do Whisper, da OpenAI, registra que em alguns conjuntos de teste a taxa de erro caiu até 50% só por ajustar diferenças de formatação, como contrações separadas por espaço na transcrição de referência (Radford et al., 2022). Ou seja: metade do erro podia ser estilo, não reconhecimento.
Qual erro foi contado. A métrica trata toda palavra igual. Trocar "o" por "um" e trocar o nome do convidado valem o mesmo ponto. A própria definição da métrica admite essa limitação: ela não considera o efeito que cada tipo de erro tem no resultado (Wikipedia, Word error rate).
Então o teste certo é pequeno, no seu material, e com uma segunda contagem para os erros que doem.
O que é WER, em uma linha
WER = (S + D + I) / N
- S (substituição): palavra dita que virou outra.
- D (deleção): palavra dita que sumiu.
- I (inserção): palavra que ninguém disse e apareceu.
- N: total de palavras da transcrição correta.
A contagem é feita pelo menor número de edições que transforma um texto no outro, a mesma lógica da distância de Levenshtein aplicada a palavras. Um detalhe que surpreende: WER pode passar de 100%, quando a ferramenta inventa mais palavras do que acerta (Wikipedia).
"Precisão" de marketing costuma ser 1 menos o WER. Um WER de 5% vira "95% de precisão".
O teste de 10 minutos, passo a passo
1. Escolha o pior minuto (1 minuto de trabalho)
Não pegue o trecho mais limpo. Pegue o que representa o seu problema real:
- gíria e palavrão do jeito que saem na live;
- sotaque forte, ou dois sotaques diferentes;
- duas pessoas falando por cima;
- música ou jogo ao fundo;
- nome de gente, de jogo, de marca.
Se você corta podcast, pegue a hora em que três pessoas riem e falam junto. Se corta live de jogo, pegue o momento de tensão com o áudio do jogo alto. É onde a legenda vai quebrar no mundo real.
2. Transcreva à mão (4 a 5 minutos)
Ouça com fone e escreva exatamente o que foi dito. Não o que deveria ter sido dito.
Três regras para não sabotar o teste:
- Escreva a fala como ela é: "tá", "pra", "né", "mano". Se você corrigir a gramática na referência, vai punir a ferramenta por ser fiel.
- Decida antes como tratar número ("dez" ou "10") e use a mesma regra nos dois textos.
- Onde você mesmo não entende a palavra, marque e tire do teste. Se nem você entende, a ferramenta não pode ser julgada ali.
3. Gere a legenda na ferramenta (2 minutos)
Suba o mesmo minuto, sem cortar nada diferente, e exporte o texto puro (TXT ou SRT). Se for comparar duas ferramentas, use exatamente o mesmo arquivo nas duas.
4. Normalize os dois textos
Tudo em minúsculas, sem pontuação, sem quebra de linha. É isso que evita a armadilha do Whisper: você quer medir reconhecimento, não formatação.
5. Conte (2 minutos)
Com os dois textos lado a lado, marque cada troca, cada ausência e cada palavra a mais. Um exemplo curto, só para ilustrar a conta:
| Texto | |
|---|---|
| Dito | mano o cara deu um pulo da cadeira que eu nunca vi |
| Legenda | mano o cara deu um pulo na cadeira que nunca vi |
São 12 palavras ditas. A legenda trocou "da" por "na" (1 substituição) e comeu o "eu" (1 deleção). WER = 2 / 12 = 16,7%, ou "83,3% de precisão". Numa frase com gíria, basta duas escorregadas pequenas para o número desabar. Por isso uma frase não prova nada e um minuto inteiro prova bastante.
Se preferir não contar no olho, a biblioteca aberta jiwer, em Python, faz a conta com duas linhas: pip install jiwer e wer(referencia, legenda). Para quem quer a ferramenta de referência do setor, o NIST mantém o SCTK, com o avaliador sclite.
A segunda contagem: os erros que realmente doem
O WER te dá a média. Legenda de corte não é julgada pela média, é julgada pelo pior erro que aparece na tela. Então, no mesmo minuto, faça uma lista à parte com quatro colunas:
- Nome próprio errado. O nome do convidado, do streamer, do jogo. Erro aqui parece desleixo e rende comentário de correção.
- Número errado. Valor, placar, ano. Muda o sentido.
- Palavra-chave do trecho errada. A palavra que carrega a piada ou o gancho. Se ela sai errada, o corte perde o motivo de existir.
- Sincronia. Escolha três pontos do minuto e veja se a palavra destacada na tela bate com o som. Legenda certa atrasada meio segundo cansa quem assiste no mudo.
Na minha experiência, duas ferramentas com WER parecido podem ter perfis muito diferentes nessa segunda lista. Uma erra artigos e preposições, que ninguém nota. A outra erra justamente nomes e gírias, que todo mundo nota. A segunda lista é a que decide.
Como transformar o resultado em decisão
O teste não serve para achar um vencedor absoluto. Serve para responder uma pergunta prática: quanto tempo eu vou gastar corrigindo legenda por corte?
Uma forma de pensar que eu uso: conte quantas telas de legenda um corte de 60 segundos tem e quantas delas precisaram de correção no teste. Se você corrige uma a cada três telas, o custo está no seu fluxo, todo dia, em todo corte. Se corrige uma a cada vinte, a ferramenta está pagando o que custa.
E repita o teste quando o seu material mudar. Canal de podcast calmo e canal de live de jogo com chat gritando são dois testes diferentes, mesmo com a mesma ferramenta.
O que isso muda na escolha de ferramenta
Três conclusões que eu tiraria antes de olhar preço:
Compare no mesmo trecho, sempre. Número de site contra número de site não diz nada. O mesmo minuto em duas ferramentas diz muito.
Pese os erros de nome e de gíria mais que o resto. São os que aparecem no comentário.
Olhe o editor de correção. Toda ferramenta erra alguma coisa. A diferença entre corrigir em dez segundos e em dois minutos está em conseguir clicar na palavra e trocar, com a legenda se reencaixando sozinha.
Se quiser rodar o teste na Cut.Pro, o plano gratuito tem 15 créditos por mês, e um crédito é um minuto de vídeo analisado: o minuto do teste cabe com folga. A legenda sai em mais de 40 idiomas, e o estilo você define no editor. Compare com o que você usa hoje, no mesmo trecho, e fique com o que errar menos no que importa para o seu canal.
Para escolher o estilo depois de resolver a precisão, veja como o estilo de legenda muda a retenção. Se você está entre as duas ferramentas de legenda mais usadas por quem edita no celular, o comparativo Submagic ou CapCut aplica esse raciocínio. E se o próximo passo é publicar em outros idiomas, o post sobre legenda traduzida em três idiomas começa exatamente onde este termina: tradução boa depende de transcrição boa.
Resumindo
- Precisão anunciada não vale para o seu áudio. Meça no seu pior minuto.
- WER = (trocas + omissões + inserções) / palavras ditas. Pode passar de 100%.
- Normalize antes de contar. Formatação sozinha já moveu o erro em até 50% em testes publicados.
- Faça uma segunda lista com nome, número, palavra-chave e sincronia.
- Decida pelo tempo de correção por corte, não pela média.
Dez minutos de teste economizam meses de legenda corrigida na mão. E, de quebra, você passa a ler qualquer "99%" com a pergunta certa: medido em quê?
Fontes: Wikipedia, Word error rate · Radford et al., Robust Speech Recognition via Large-Scale Weak Supervision (Whisper), 2022 · jiwer, biblioteca de avaliação de reconhecimento de fala · NIST SCTK


