Whisper est une famille de modèles de reconnaissance vocale open source publiés par OpenAI. Il transcrit l'audio parlé en texte et peut traduire la parole de nombreuses langues directement vers l'anglais. Les poids sont diffusés sous la licence permissive MIT, vous pouvez donc les télécharger et les exécuter sur votre propre matériel.
La version ouverte actuelle est large-v3-turbo, un modèle distillé présenté en octobre 2024. Il conserve presque toute la précision du large-v3 complet tout en tournant environ 8 fois plus vite, ce qui le rend bien plus pratique pour le traitement par lots et les usages quasi temps réel. Le checkpoint complet large-v3 reste disponible lorsque vous voulez la meilleure qualité possible.
En plus des modèles ouverts, OpenAI propose désormais la transcription hébergée via son API. Le point d'accès classique est whisper-1, rejoint depuis par des modèles basés sur GPT-4o : gpt-4o-transcribe et le moins cher gpt-4o-mini-transcribe, qui ajoutent des options comme la diarisation des locuteurs. Selon certains rapports, une variante en streaming, gpt-realtime-whisper, est arrivée vers mai 2026 et renvoie des fragments de transcription en direct au fil de la parole.
La tarification se divise en deux voies. Les modèles open source sont gratuits : vous ne payez que votre propre calcul. L'API hébergée est facturée à l'usage : whisper-1 et gpt-4o-transcribe coûtent 0,006 $ la minute (0,36 $/h), gpt-4o-mini-transcribe coûte 0,003 $ la minute (0,18 $/h), et le gpt-realtime-whisper en direct revient à environ 0,017 $ la minute.
La précision varie beaucoup selon la langue. Whisper a été entraîné sur environ 99 langues, mais la qualité est la meilleure pour les langues à fortes ressources comme l'anglais et chute nettement pour les moins courantes. Exécuter les grands modèles en local exige aussi un GPU performant, et le modèle peut parfois halluciner du texte pendant les longs silences.
Whisper convient bien si vous voulez un moteur de transcription gratuit et auto-hébergeable, si vous avez besoin d'une large couverture multilingue, ou si vous préférez une API gérée sans construire votre propre pipeline. Choisissez les modèles GPT-4o hébergés si vous avez besoin de diarisation ou de streaming en direct clés en main.
Laisser un avis
Les avis sont publiés après modération. Nous ne partageons pas votre email.