O Whisper é uma família de modelos de reconhecimento de fala de código aberto lançados pela OpenAI. Ele transcreve áudio falado em texto e pode traduzir fala de muitos idiomas diretamente para o inglês. Os pesos são publicados sob a permissiva licença MIT, então você pode baixá-los e executá-los no seu próprio hardware.
O lançamento aberto atual é o large-v3-turbo, um modelo destilado apresentado em outubro de 2024. Ele mantém quase toda a precisão do large-v3 completo, mas roda cerca de 8x mais rápido, o que o torna bem mais prático para trabalhos em lote e uso quase em tempo real. O checkpoint completo large-v3 continua disponível quando você quer a maior qualidade possível.
Além dos modelos abertos, a OpenAI agora oferece transcrição hospedada por meio da sua API. O endpoint clássico é o whisper-1, ao qual se juntaram modelos baseados no GPT-4o: o gpt-4o-transcribe e o mais barato gpt-4o-mini-transcribe, que acrescentam opções como diarização de falantes. Segundo relatos, uma variante em streaming, o gpt-realtime-whisper, chegou por volta de maio de 2026 e devolve trechos da transcrição ao vivo enquanto você fala.
Os preços se dividem em duas trilhas. Os modelos de código aberto são gratuitos: você paga apenas pela sua própria computação. A API hospedada é cobrada por uso: whisper-1 e gpt-4o-transcribe custam US$ 0,006 por minuto (US$ 0,36/h), o gpt-4o-mini-transcribe custa US$ 0,003 por minuto (US$ 0,18/h) e o gpt-realtime-whisper ao vivo fica em torno de US$ 0,017 por minuto.
A precisão varia bastante conforme o idioma. O Whisper foi treinado em cerca de 99 idiomas, mas a qualidade é maior para línguas com muitos dados, como o inglês, e cai visivelmente nas menos comuns. Rodar os modelos grandes localmente também exige uma GPU potente, e o modelo pode ocasionalmente alucinar texto durante silêncios longos.
O Whisper é uma boa escolha se você quer um motor de transcrição gratuito e auto-hospedável, precisa de ampla cobertura multilíngue ou prefere uma API gerenciada sem montar seu próprio pipeline. Escolha os modelos GPT-4o hospedados se precisar de diarização ou streaming ao vivo prontos de fábrica.
Deixar avaliação
As avaliações são publicadas após moderação. Não compartilhamos seu email.