Blog · transcription
Transcription vidéo en français : comparatif des IA en 2026 (Whisper, Deepgram, AssemblyAI)
La transcription automatique en français a fait un bond en 2 ans. Mais tous les modèles ne se valent pas sur les accents régionaux, la ponctuation et les termes métier. On a testé les 4 principaux pour Castli.
Whisper (OpenAI) : la référence qualité/prix
Modèle open-source, disponible via l'API OpenAI (0,006 $/minute). Excellente précision sur le français standard, gère bien les accents (parisien, méridional, québécois). Faiblesse : ponctuation parfois hasardeuse sur les longs monologues.
Chez Castli, on utilise Whisper Large-v3 avec un prompt spécialisé français qui injecte le vocabulaire métier de l'utilisateur.
Deepgram Nova-3 : le plus rapide
Le plus rapide en temps réel (<200 ms de latence). Bon en français mais moins précis que Whisper sur les mots techniques. Prix ~0,0043 $/minute. Utile si tu fais du live captioning.
AssemblyAI Universal-2
Bon équilibre entre précision et fonctionnalités (speaker diarization, sentiment analysis, résumés). Prix ~0,015 $/minute, plus cher. Pertinent si tu as besoin de features avancées au-delà du transcript brut.
Google Speech-to-Text
Bonne précision, mais interface d'API vieillissante et prix élevé (~0,024 $/minute). À réserver si tu es déjà dans l'écosystème GCP.
Verdict pour un usage screencast async
Pour un enregistrement vidéo de 3-10 minutes destiné à être partagé, Whisper Large-v3 offre le meilleur rapport qualité/prix. C'est ce que Castli utilise, avec un pipeline maison qui injecte le vocabulaire perso de l'utilisateur pour éviter les fautes sur les noms propres et le jargon métier.
Teste la transcription Castli gratuitement. Whisper FR inclus dès 15 €/mois.