Transcrire un audio en texte gratuitement : le comparatif
· 4 min
Oui, on peut transformer une réunion, une interview ou un mémo vocal en texte sans dépenser un centime. Trois familles de solutions tiennent la route en français : le modèle Whisper installé sur votre propre ordinateur, les formules gratuites des services en ligne, et quelques détours malins comme les sous-titres automatiques de YouTube. Le bon choix dépend de la durée de vos fichiers et de la sensibilité de leur contenu.
Les solutions gratuites qui marchent en français
La référence s’appelle Whisper. Ce modèle de reconnaissance vocale publié par OpenAI est téléchargeable gratuitement et fonctionne entièrement hors ligne, avec de très bons résultats en français. Nul besoin d’être informaticien : des applications comme Vibe (Windows, Mac, Linux) ou MacWhisper l’enrobent d’une interface simple où l’on glisse son fichier, choisit la langue et récupère le texte.
Deuxième famille, les services en ligne spécialisés, comme TurboScribe, Notta ou Happy Scribe, qui offrent chacun un volume gratuit avant de passer à la caisse. On peut y ajouter les assistants généralistes : la version gratuite de Gemini accepte les fichiers audio et les transcrit si on le lui demande explicitement.
Restent deux astuces sans installation. La saisie vocale de Google Docs transcrit ce que capte le micro, ce qui oblige à rejouer l’enregistrement au haut-parleur. Et YouTube génère des sous-titres automatiques sur toute vidéo mise en ligne, même non répertoriée : il suffit ensuite de les exporter.
Le test sur un vrai enregistrement
Pour comparer honnêtement, rien ne vaut un enregistrement imparfait : une réunion captée au téléphone, deux voix qui se coupent, un fond sonore de bureau. C’est le quotidien des indépendants et des petites équipes, loin des démonstrations en studio.
Sur ce type de fichier, Whisper s’en sort remarquablement : texte quasi complet, ponctuation correcte, hésitations souvent lissées. Les erreurs se concentrent sur les noms propres, les sigles et le vocabulaire technique. Les services en ligne, souvent bâtis sur des modèles comparables, donnent des résultats du même ordre, avec en prime la distinction des interlocuteurs chez certains.
Gemini transcrit correctement, mais il a tendance à résumer si la consigne manque de clarté : précisez bien « mot à mot ». La saisie vocale de Google Docs, pensée pour la dictée en direct, décroche vite sur un enregistrement rejoué. Les sous-titres YouTube, honnêtes sur les mots, ignorent la ponctuation et mélangent les voix.
Plafonds et limites de chaque plan gratuit
Whisper en local ne connaît aucun plafond : vous transcrivez des heures d’audio sans payer. La seule limite est la puissance de votre machine. Les grands modèles, plus précis, peuvent être lents sur un ordinateur ancien ; les petits vont vite, au prix de quelques fautes supplémentaires.
Les services en ligne, eux, dosent leur générosité. À la date de publication, les formules gratuites limitent généralement la durée de chaque fichier, autour d’une demi-heure, ainsi que le nombre de fichiers par jour ou par mois ; l’export en format traitement de texte ou sous-titres est parfois réservé aux abonnés. Ces quotas évoluent souvent : vérifiez avant d’en faire une habitude de travail.
Quant aux assistants généralistes, leur version gratuite plafonne l’usage global et rechigne sur les fichiers très longs. Découper l’audio en tronçons fonctionne, mais devient vite fastidieux pour un besoin régulier.
Nettoyer et exploiter la transcription
Une transcription brute est un verbatim : les « euh », les répétitions et les faux départs y figurent en bonne place. Avant de la partager, un passage de nettoyage s’impose.
C’est là que les assistants comme ChatGPT, Claude ou Gemini deviennent précieux : collez le texte et demandez une version ponctuée, découpée en paragraphes, débarrassée des tics de langage. En fournissant la liste des noms propres et des sigles maison, vous corrigez d’un coup les écorchures du modèle. Dans la foulée, le même outil produit un compte rendu, un relevé de décisions ou les citations clés.
Un réflexe pour finir : relisez contre l’audio toute phrase que vous comptez attribuer à quelqu’un. La transcription automatique reste faillible, et un mot déformé peut changer le sens d’un propos.
Confidentialité : où part votre audio ?
La transcription locale gagne haut la main sur ce terrain : avec Whisper via Vibe ou MacWhisper, rien ne quitte votre ordinateur. C’est l’option à retenir pour un entretien d’embauche, un rendez-vous médical ou un dossier client.
Avec un service en ligne, votre fichier part sur les serveurs de l’éditeur, parfois hors d’Europe, et certaines formules gratuites se réservent le droit d’exploiter les données pour améliorer leur outil. Lisez la politique de confidentialité avant d’envoyer autre chose que des propos anodins.
Enfin, un enregistrement contient la voix et les paroles d’autres personnes, c’est-à-dire des données personnelles au sens du RGPD. Informer les participants est la base, et pour un usage professionnel régulier, les recommandations de la CNIL (cnil.fr) restent la référence à consulter avant de choisir son outil.