Como medir a precisão da legenda automática em português em 10 minutos

Toda ferramenta de legenda diz que acerta quase tudo. O único número que importa é o que ela acerta no seu áudio, com a sua gíria e o seu sotaque. Dá para medir isso em dez minutos, com um minuto de vídeo, papel e uma conta de divisão.

Como medir a precisão da legenda automática em português em 10 minutos

Como medir a precisão da legenda automática em português em 10 minutos

Resposta curta: pegue 60 segundos do seu próprio vídeo, transcreva à mão, gere a legenda na ferramenta e conte quantas palavras ela trocou, esqueceu ou inventou. Divida pelo número de palavras que foram ditas. Isso é a taxa de erro por palavra (WER), a métrica padrão de reconhecimento de fala, e com ela você compara qualquer ferramenta no único áudio que interessa: o seu.

Escrevo isso como alguém que vende uma ferramenta de legenda. A Cut.Pro afirma acertar mais de 99% das palavras. Esse é o número da empresa, e o ponto deste post é justamente que você não precisa acreditar nele, nem no de ninguém. O teste abaixo serve para nós também.

Por que o número do site não diz nada sobre o seu vídeo

Porcentagem de precisão sem o áudio junto é quase decorativa. Ela depende de três coisas que quem publica raramente conta:

Que áudio foi usado. Leitura de texto em estúdio e live de seis horas com chat gritando são problemas diferentes. Um sistema pode ir muito bem no primeiro e mal no segundo.

Como o texto foi normalizado. Antes de comparar, o texto passa por uma limpeza: minúsculas, pontuação, número escrito por extenso ou em algarismo. O artigo do Whisper, da OpenAI, registra que em alguns conjuntos de teste a taxa de erro caiu até 50% só por ajustar diferenças de formatação, como contrações separadas por espaço na transcrição de referência (Radford et al., 2022). Ou seja: metade do erro podia ser estilo, não reconhecimento.

Qual erro foi contado. A métrica trata toda palavra igual. Trocar "o" por "um" e trocar o nome do convidado valem o mesmo ponto. A própria definição da métrica admite essa limitação: ela não considera o efeito que cada tipo de erro tem no resultado (Wikipedia, Word error rate).

Então o teste certo é pequeno, no seu material, e com uma segunda contagem para os erros que doem.

O que é WER, em uma linha

WER = (S + D + I) / N

  • S (substituição): palavra dita que virou outra.
  • D (deleção): palavra dita que sumiu.
  • I (inserção): palavra que ninguém disse e apareceu.
  • N: total de palavras da transcrição correta.

A contagem é feita pelo menor número de edições que transforma um texto no outro, a mesma lógica da distância de Levenshtein aplicada a palavras. Um detalhe que surpreende: WER pode passar de 100%, quando a ferramenta inventa mais palavras do que acerta (Wikipedia).

"Precisão" de marketing costuma ser 1 menos o WER. Um WER de 5% vira "95% de precisão".

O teste de 10 minutos, passo a passo

1. Escolha o pior minuto (1 minuto de trabalho)

Não pegue o trecho mais limpo. Pegue o que representa o seu problema real:

  • gíria e palavrão do jeito que saem na live;
  • sotaque forte, ou dois sotaques diferentes;
  • duas pessoas falando por cima;
  • música ou jogo ao fundo;
  • nome de gente, de jogo, de marca.

Se você corta podcast, pegue a hora em que três pessoas riem e falam junto. Se corta live de jogo, pegue o momento de tensão com o áudio do jogo alto. É onde a legenda vai quebrar no mundo real.

2. Transcreva à mão (4 a 5 minutos)

Ouça com fone e escreva exatamente o que foi dito. Não o que deveria ter sido dito.

Três regras para não sabotar o teste:

  • Escreva a fala como ela é: "tá", "pra", "né", "mano". Se você corrigir a gramática na referência, vai punir a ferramenta por ser fiel.
  • Decida antes como tratar número ("dez" ou "10") e use a mesma regra nos dois textos.
  • Onde você mesmo não entende a palavra, marque e tire do teste. Se nem você entende, a ferramenta não pode ser julgada ali.

3. Gere a legenda na ferramenta (2 minutos)

Suba o mesmo minuto, sem cortar nada diferente, e exporte o texto puro (TXT ou SRT). Se for comparar duas ferramentas, use exatamente o mesmo arquivo nas duas.

4. Normalize os dois textos

Tudo em minúsculas, sem pontuação, sem quebra de linha. É isso que evita a armadilha do Whisper: você quer medir reconhecimento, não formatação.

5. Conte (2 minutos)

Com os dois textos lado a lado, marque cada troca, cada ausência e cada palavra a mais. Um exemplo curto, só para ilustrar a conta:

Texto
Dito mano o cara deu um pulo da cadeira que eu nunca vi
Legenda mano o cara deu um pulo na cadeira que nunca vi

São 12 palavras ditas. A legenda trocou "da" por "na" (1 substituição) e comeu o "eu" (1 deleção). WER = 2 / 12 = 16,7%, ou "83,3% de precisão". Numa frase com gíria, basta duas escorregadas pequenas para o número desabar. Por isso uma frase não prova nada e um minuto inteiro prova bastante.

Se preferir não contar no olho, a biblioteca aberta jiwer, em Python, faz a conta com duas linhas: pip install jiwer e wer(referencia, legenda). Para quem quer a ferramenta de referência do setor, o NIST mantém o SCTK, com o avaliador sclite.

A segunda contagem: os erros que realmente doem

O WER te dá a média. Legenda de corte não é julgada pela média, é julgada pelo pior erro que aparece na tela. Então, no mesmo minuto, faça uma lista à parte com quatro colunas:

  1. Nome próprio errado. O nome do convidado, do streamer, do jogo. Erro aqui parece desleixo e rende comentário de correção.
  2. Número errado. Valor, placar, ano. Muda o sentido.
  3. Palavra-chave do trecho errada. A palavra que carrega a piada ou o gancho. Se ela sai errada, o corte perde o motivo de existir.
  4. Sincronia. Escolha três pontos do minuto e veja se a palavra destacada na tela bate com o som. Legenda certa atrasada meio segundo cansa quem assiste no mudo.

Na minha experiência, duas ferramentas com WER parecido podem ter perfis muito diferentes nessa segunda lista. Uma erra artigos e preposições, que ninguém nota. A outra erra justamente nomes e gírias, que todo mundo nota. A segunda lista é a que decide.

Como transformar o resultado em decisão

O teste não serve para achar um vencedor absoluto. Serve para responder uma pergunta prática: quanto tempo eu vou gastar corrigindo legenda por corte?

Uma forma de pensar que eu uso: conte quantas telas de legenda um corte de 60 segundos tem e quantas delas precisaram de correção no teste. Se você corrige uma a cada três telas, o custo está no seu fluxo, todo dia, em todo corte. Se corrige uma a cada vinte, a ferramenta está pagando o que custa.

E repita o teste quando o seu material mudar. Canal de podcast calmo e canal de live de jogo com chat gritando são dois testes diferentes, mesmo com a mesma ferramenta.

O que isso muda na escolha de ferramenta

Três conclusões que eu tiraria antes de olhar preço:

Compare no mesmo trecho, sempre. Número de site contra número de site não diz nada. O mesmo minuto em duas ferramentas diz muito.

Pese os erros de nome e de gíria mais que o resto. São os que aparecem no comentário.

Olhe o editor de correção. Toda ferramenta erra alguma coisa. A diferença entre corrigir em dez segundos e em dois minutos está em conseguir clicar na palavra e trocar, com a legenda se reencaixando sozinha.

Se quiser rodar o teste na Cut.Pro, o plano gratuito tem 15 créditos por mês, e um crédito é um minuto de vídeo analisado: o minuto do teste cabe com folga. A legenda sai em mais de 40 idiomas, e o estilo você define no editor. Compare com o que você usa hoje, no mesmo trecho, e fique com o que errar menos no que importa para o seu canal.

Para escolher o estilo depois de resolver a precisão, veja como o estilo de legenda muda a retenção. Se você está entre as duas ferramentas de legenda mais usadas por quem edita no celular, o comparativo Submagic ou CapCut aplica esse raciocínio. E se o próximo passo é publicar em outros idiomas, o post sobre legenda traduzida em três idiomas começa exatamente onde este termina: tradução boa depende de transcrição boa.

Resumindo

  • Precisão anunciada não vale para o seu áudio. Meça no seu pior minuto.
  • WER = (trocas + omissões + inserções) / palavras ditas. Pode passar de 100%.
  • Normalize antes de contar. Formatação sozinha já moveu o erro em até 50% em testes publicados.
  • Faça uma segunda lista com nome, número, palavra-chave e sincronia.
  • Decida pelo tempo de correção por corte, não pela média.

Dez minutos de teste economizam meses de legenda corrigida na mão. E, de quebra, você passa a ler qualquer "99%" com a pergunta certa: medido em quê?

Fontes: Wikipedia, Word error rate · Radford et al., Robust Speech Recognition via Large-Scale Weak Supervision (Whisper), 2022 · jiwer, biblioteca de avaliação de reconhecimento de fala · NIST SCTK

Compartilhar

Continue lendo

Mais insights e tutoriais pra você crescer como criador de conteúdo.