Transcrire un Audio en Texte

Gratuit, avec Whisper large-v3. Données hébergées dans l'UE, supprimées après 30 jours.

DeluxeScribe transcrit un audio en texte français avec Whisper large-v3 — MP3, M4A, WAV, OPUS, OGG et plus. Avec horodatage et export en SRT, VTT, TXT, DOCX ou PDF. Audio stocké sur AWS UE (Francfort) et supprimé automatiquement après 30 jours. 60 minutes gratuites à vie, sans carte bancaire.
  • 60 minutes gratuites à vie
  • Sans carte bancaire
  • 100+ langues
  • Données sur AWS UE, supprimées après 30 jours

Dernière vérification : 16 août 2026

Comment transcrire un audio en texte en 3 étapes

En bref : DeluxeScribe transcrit un audio en texte français avec Whisper large-v3. Compatible MP3, M4A, WAV, OPUS, OGG. 60 minutes gratuites à vie — sans facturation mensuelle cachée. Audio stocké sur AWS UE (Francfort) et supprimé automatiquement après 30 jours.

  1. Envoyez votre fichier— glissez-déposez MP3, WAV, M4A, MP4 ou tout format courant. Vous pouvez aussi coller l'URL d'un audio en ligne.
  2. Choisissez le françaiscomme langue (ou laissez « détection automatique » si l'audio est multilingue).
  3. Téléchargez le texte — en quelques secondes, vous avez la transcription avec horodatage. Exportez en TXT, DOCX, PDF, SRT ou VTT.

Aucune installation. Tout se passe dans le navigateur.

Transcrire, convertir ou transformer un audio ?

En français, on utilise trois verbes différents pour la même opération : transcrire, convertir et transformer un audio en texte. Tous les trois désignent la même chose quand on parle du passage parole → texte écrit. Notre outil répond aux trois recherches de la même manière.

Attention à « convertir »

« Convertir » dans d'autres contextes peut signifier changer de format de fichier (MP3 → WAV, par exemple). Nous ne faisons pas de conversion de format — nous faisons de la reconnaissance vocale (ASR — Automatic Speech Recognition). Si vous avez un MP3 et voulez le texte de ce qui est dit à l'intérieur, vous êtes au bon endroit, quel que soit le verbe que vous avez cherché. Si vous voulez changer un MP3 en WAV (ou l'inverse), cherchez « convertisseur audio » — c'est un type d'outil différent.

Nuances entre les trois verbes

  • Transcrire : le terme le plus précis et le plus utilisé en contexte professionnel (journalisme, recherche, droit). Implique une restitution fidèle de la parole.
  • Convertir :plus général, souvent utilisé dans les recherches grand public. Attention à l'ambiguïté avec la conversion de format.
  • Transformer : variante moins fréquente mais utilisée. Neutre sur le contexte.

Formats audio supportés

MP3, WAV, M4A, MP4, OGG, OPUS, FLAC, AAC et WebM. Les fichiers vidéo (MP4, MOV, AVI) fonctionnent aussi — l'audio est extrait et transcrit automatiquement.

  • MP3 — le format le plus courant pour enregistrements et podcasts
  • M4A — format natif des enregistrements iPhone (Dictaphone) et QuickTime Mac
  • OPUS — format utilisé par WhatsApp pour les messages vocaux
  • WAV — audio non compressé, qualité maximale
  • MP4 / MOV — vidéo avec audio (seul l'audio est transcrit)

Transcrire un audio long — podcast, cours, entretien

Les fichiers longs sont le point fort de DeluxeScribe. Sur le forfait Pro (10 $/mois), chaque fichier peut durer jusqu'à 4 heures ou peser 2 Go ; sur Premium (29 $/mois), jusqu'à 10 heures ou 5 Go. Un épisode de podcast d'une heure se traite en général en 2-5 minutes. Un cours de 2 heures, entre 5 et 10 minutes.

Conseils pour audios longs :si l'audio contient plusieurs intervenants, préférez un enregistrement avec un micro par personne (ou au moins des intervenants bien séparés). Le modèle transcrit même avec de l'audio d'ambiance, mais la précision baisse en cas de superposition de voix ou de bruit de fond important. Pour des entretiens de recherche qualitative, enregistrer en WAV préserve la qualité maximale.

Comment convertir MP3, WAV et M4A en texte

MP3 en texte

MP3 est le format le plus courant pour les enregistrements. Fonctionne avec n'importe quel bitrate — 128 kbps pour enregistrements légers, 192 ou 256 kbps pour podcasts, 320 kbps pour qualité maximale. DeluxeScribe traite le fichier directement, sans besoin de conversion préalable. La précision dépend de la qualité de l'audio d'origine, pas du bitrate — un MP3 propre à 128 kbps se transcrit aussi bien qu'un WAV.

  • Usage typique : épisodes de podcast, entretiens enregistrés au smartphone, audios téléchargés de YouTube ou Spotify, enregistrements radio, messages vocaux exportés.
  • Origine fréquente : dictaphone de smartphone, DAW exportant en MP3 (Audacity, GarageBand, Reaper), YouTube-DL.
  • Quand ce n'est PAS optimal : si l'audio est déjà compressé à très faible bitrate (moins de 64 kbps) ou avec des artefacts audibles, la transcription héritera de ces erreurs. Enregistrez toujours à la meilleure qualité possible dès la source.

WAV en texte

WAV est de l'audio non compressé — la qualité maximale possible. Utilisé pour enregistrements professionnels de studio, podcasts multi-micros, sessions de recherche qualitative où chaque mot compte. Les fichiers sont volumineux (environ 10 Mo par minute d'audio stéréo à 44,1 kHz), mais DeluxeScribe les traite à la même vitesse qu'un MP3.

  • Usage typique : entretiens académiques pour thèse, enregistrements de studio, transcriptions juridiques, sessions de thérapie enregistrées avec consentement, livres audio en production.
  • Avantage réel vs MP3 : moins d'artefacts de compression = moins d'erreurs sur mots à consonnes sifflantes (« s », « ch ») ou chuchotés. Pour une conversation normale à 192+ kbps, la différence est presque imperceptible.

M4A en texte

M4A est le format natif des enregistrements iPhone (application Dictaphone, appels enregistrés via des apps compatibles) et des enregistrements QuickTime sur Mac. Utilisé aussi dans l'export audio depuis iMovie ou GarageBand. Se transcrit comme un MP3 sans conversion préalable. Le codec interne est AAC, qui à bitrate égal sonne mieux que MP3 — un M4A iPhone à 64 kbps se transcrit donc bien même si le fichier est petit.

  • Usage typique : mémos vocaux iPhone, enregistrements de réunion avec l'app Dictaphone, audio exporté depuis iMovie/GarageBand.
  • Workflow iPhone : Dictaphone → sélectionnez l'enregistrement → Partager → Enregistrer dans Fichiers → uploadez sur DeluxeScribe depuis le navigateur.

Usage professionnel : réunions, entretiens, recherche

Réunions (Zoom, Meet, Teams)

Enregistrez la réunion avec la fonction native de Zoom, Google Meet ou Microsoft Teams (toutes exportent en MP4 ou M4A). Envoyez le fichier à DeluxeScribe après l'appel. Une réunion d'une heure sort transcrite en 2-5 minutes, avec horodatage. Partagez le résumé avec les personnes absentes, ou utilisez le texte pour rédiger un compte-rendu dans votre modèle habituel (Notion, Google Docs, Word). DeluxeScribe ne génère pas de compte-rendu formaté automatiquement — si vous en avez besoin, Notta ou Fireflies conviennent mieux.

Transcription d'entretien (journalisme)

Pour le journalisme, la transcription littérale avec horodatage permet de citer les mots exacts et de revenir au moment précis de l'audio pour vérifier ton et contexte. Enregistrez avec une app de qualité correcte (Dictaphone iPhone, Enregistreur Android ou un enregistreur dédié) et envoyez le fichier. Les .m4a d'iPhone se traitent directement. Pour les articles où vous allez citer littéralement, revérifiez toujours la transcription mot à mot contre l'audio d'origine avant publication — aucune transcription automatique n'est 100 % exacte, surtout sur les noms propres, accents régionaux et jargon technique.

Recherche qualitative (thèse, mémoire, doctorat)

Thèses, mémoires et projets de recherche qualitative exigent des transcriptions précises d'entretiens et de focus groups. DeluxeScribe accélère la première étape (obtenir le texte), mais l'analyse qualitative nécessite une révision manuelle — surtout pour les codes thématiques et les nuances de sens que le modèle ne marque pas automatiquement. Pour des enregistrements sensibles (données personnelles de participants, thèmes médicaux réglementés), lisez la section Confidentialité et RGPDavant d'envoyer. Si votre comité d'éthique exige un DPA signé, ce n'est pas l'outil approprié.

Podcasts et contenu audio

Publier la transcription d'un épisode à côté de l'audio améliore le SEO (Google indexe le texte), l'accessibilité (personnes sourdes, personnes qui préfèrent lire) et la découvrabilité interne (vous pouvez rechercher dans quel épisode vous avez parlé d'un sujet). Exportez en SRT si vous voulez des sous-titres synchronisés pour YouTube ou un lecteur web.

Précision en français

Sur audio propre avec un seul locuteur, Whisper large-v3 — le modèle utilisé par DeluxeScribe — atteint un taux d'erreur mots (WER) proche de 5 % sur le benchmark FLEURS French de Google. C'est proche du niveau d'un transcripteur humain attentif. Pour mieux comprendre comment Whisper mesure sa précision, voir notre guide sur la précision de Whisper.

Français de France, Québec, Belgique, Suisse

Les modèles actuels ont été entraînés sur du français de multiples régions — France métropolitaine, Québec, Belgique, Suisse romande, Afrique francophone. La précision est bonne sur les variantes standards de chaque région. Les accents régionaux très marqués (québécois joual, marseillais fermé, wallon profond, ch'ti) peuvent générer plus d'erreurs sur des mots spécifiques, mais la compréhension générale reste haute.

Quand la précision augmente

  • Environnement silencieux (pas de musique de fond, TV allumée, climatisation bruyante)
  • Locuteur proche du micro (au smartphone, à moins de 30 cm de la bouche)
  • Un seul locuteur, ou deux avec tours de parole clairs (sans superposition)
  • Débit normal (évitez de parler très vite ou en chuchotant)
  • Vocabulaire standard (mots d'usage quotidien et professionnel courant)

Quand la précision baisse

  • Accents régionaux très marqués (québécois joual, marseillais fermé)
  • Noms propres peu courants, patronymes, marques locales
  • Jargon technique très spécifique que le modèle n'a pas vu durant l'entraînement
  • Superposition de voix (plusieurs personnes parlant en même temps)
  • Musique ou bruit de fond fort
  • Audios très compressés (moins de 64 kbps) ou avec écho

Comparaison avec Whisper local

DeluxeScribe utilise les modèles de la famille Whisper — la même technologie de fond que TurboScribe, HappyScribe et Notta. La différence entre les services se fait sur la vitesse, l'éditeur et les formats d'export disponibles dans l'offre gratuite. Whisper large-v3 exécuté localement (CLI OpenAI ou whisper.cpp) produit exactement le même résultat sur le modèle — mais exige une machine avec GPU correct ou beaucoup de patience en CPU, et vous n'avez pas d'interface web ni d'export en un clic.

Confidentialité et RGPD

Les audios uploadés sur DeluxeScribe sont transmis chiffrés en TLS et stockés chiffrés sur AWS UE (région de Francfort) — pas aux États-Unis. Audio et transcriptions sont supprimés automatiquement après 30 jours. Vous pouvez aussi supprimer manuellement à tout moment depuis le tableau de bord. Nous n'utilisons jamais votre audio pour entraîner des modèles d'IA.

Vos données ne quittent pas l'UE. C'est un point important pour les entreprises, cabinets et particuliers français ou européens qui veulent garder la maîtrise du lieu de traitement — la plupart des concurrents (Notta, TurboScribe, Otter, Vidnoz) hébergent les données aux États-Unis sans le dire clairement.

DPA (article 28 RGPD) : non proposé

Nous ne proposons pas actuellement de contrat formel de sous-traitance de données au sens de l'article 28 du RGPD. Si votre organisation — hôpital, cabinet d'avocats, entreprise traitant des données sensibles réglementées (santé, justice, données de mineurs) — exige un DPA signé, DeluxeScribe n'est pas encore l'outil adapté. Dans ce cas, considérez un fournisseur avec DPA ou installez Whisper localement (open source, gratuit, tourne hors ligne).

Quand notre configuration convient

  • Usage individuel, freelance, ou petite structure
  • Entreprise dont la politique interne autorise les services cloud standard
  • Contenu sans données personnelles sensibles au sens du RGPD article 9
  • Besoin de garder les données dans l'UE (audience française, belge, suisse, canadienne francophone)

Quand ce n'est PAS adapté

  • Hôpital, laboratoire médical, structure de soins
  • Cabinet d'avocats avec obligations de secret professionnel étendues
  • Recherche universitaire avec comité d'éthique exigeant DPA
  • Entreprise dont la politique interne exige contrat de sous-traitance formel

Essayez avec votre propre audio

60 minutes gratuites, sans carte bancaire. Tous les formats d'export débloqués dès le début.

DeluxeScribe face aux alternatives pour le français

DeluxeScribe ne gagne pas sur toutes les colonnes — nous présentons la comparaison honnête pour vous aider à choisir le bon outil selon votre cas.

OutilOffre gratuiteEmplacement donnéesExportÉtiquettes locuteurWhatsApp
DeluxeScribe60 min à vieUE (Francfort)SRT, VTT, TXT, DOCX, PDFNonOui
Otter300 min/moisÉtats-UnisTXT et MP3 seulementOuiOui (avec export)
Notta120 min/mois, 3 min/enregistrementÉtats-Unis (estimé)TXT seulementOuiOui
TurboScribe90 min/jour (3 × 30 min)États-UnisSRT, VTT, TXT, DOCX, PDFOuiOui
Whisper (local)Illimité (open source)Votre machineTXT, SRT, VTT (CLI)Avec pyannote à partOui, si vous savez installer
Google Docs voixIllimité (temps réel uniquement)Google CloudTXT seulementNonNon

Chiffres vérifiés le 16 août 2026 sur les sites officiels de chaque fournisseur. Les forfaits et limites changent sans préavis.

Quel outil choisir selon votre cas

  • Données dans l'UE (entreprises françaises/européennes ou audience RGPD-sensible) : DeluxeScribe (Francfort).
  • Volume gratuit récurrent maximal : Otter (300 min/mois) ou TurboScribe (2 700 min/mois effectif si vous utilisez tous les jours).
  • Réunion en temps réel avec bot qui rejoint l'appel : Otter, Fireflies, tl;dv.
  • Étiquettes locuteur automatiques : Notta, TurboScribe, Otter (DeluxeScribe n'a pas encore la diarisation).
  • Usage 100 % hors ligne / privé : Whisper local sur votre machine.
  • Dictée en direct pendant que vous écrivez : Google Docs voix (intégré à l'éditeur).
  • Tous les formats d'export dès la 1ʳᵉ minute : DeluxeScribe ou TurboScribe.
  • DPA signé / conformité RGPD formelle : outils enterprise (DeluxeScribe pas encore).

Positionnement honnête de DeluxeScribe

DeluxeScribe est positionné sur « Whisper large-v3 depuis le navigateur, données dans l'UE, pas de piège d'abonnement mensuel caché ». Si vous avez besoin d'étiquettes locuteur automatiques, de compte-rendu formaté ou d'un bot de réunion en direct, d'autres outils sont meilleurs. Notre point fort : Whisper direct et sans fioritures, données dans l'UE avec suppression automatique à 30 jours, et une offre gratuite honnête (60 minutes à vie, pas un mois avec piège de renouvellement).

Comment cette page a été vérifiée

Toutes les affirmations de précision sont basées sur le paper original de Whisper (Radford et al., 2022) et sur le benchmark FLEURS de Google. Les chiffres des free tiers des concurrents (Otter, Notta, TurboScribe) ont été vérifiés le 16 août 2026 sur les sites officiels de chaque fournisseur. Les forfaits et limites changent sans préavis — si vous constatez une information obsolète, prévenez notre équipe.

Questions fréquentes

Comment transcrire un fichier MP3 en texte français ?

Envoyez votre fichier MP3 (ou M4A, WAV, OPUS, OGG) sur DeluxeScribe, choisissez le français comme langue, et en quelques secondes vous obtenez le texte avec horodatage. Les 60 premières minutes sont gratuites à vie — dotation unique, sans renouvellement mensuel, sans carte bancaire.

Transcrire, convertir ou transformer un audio : quelle est la différence ?

En français, ces trois verbes désignent la même opération quand on parle de passage parole → texte écrit. Attention à « convertir » : dans d'autres contextes, cela peut signifier changer de format de fichier (MP3 → WAV). Notre outil ne fait pas de conversion de format — il fait de la reconnaissance vocale (ASR). Si vous voulez le texte de ce qui est dit dans un audio, vous êtes au bon endroit, quel que soit le verbe utilisé.

Quelle est la précision en français ?

Whisper large-v3 (le modèle utilisé par DeluxeScribe) atteint un taux d'erreur mots (WER) proche de 5 % sur le benchmark FLEURS French de Google. C'est proche du niveau d'un transcripteur humain attentif sur un audio propre à un seul locuteur. La précision baisse avec bruit de fond, plusieurs locuteurs simultanés, ou accents très marqués (québécois profond, marseillais, corse fermé).

Où mes données sont-elles stockées ?

Les fichiers sont transmis chiffrés en TLS et stockés chiffrés sur AWS UE (région de Francfort) — pas aux États-Unis. Audio et transcriptions sont supprimés automatiquement après 30 jours. Vous pouvez aussi supprimer manuellement à tout moment depuis le tableau de bord. Nous n'utilisons jamais votre audio pour entraîner des modèles d'IA.

Proposez-vous un contrat RGPD (DPA) ?

Non. Nous ne proposons pas actuellement de contrat formel de sous-traitance de données au sens de l'article 28 du RGPD. Si votre organisation — hôpital, cabinet d'avocats, entreprise traitant des données sensibles réglementées — exige un DPA signé, DeluxeScribe n'est pas l'outil adapté. Dans ce cas, utilisez un fournisseur avec DPA ou installez Whisper localement (open source, gratuit, hors ligne). Pour un usage individuel, freelance, ou une entreprise dont la politique interne autorise les services cloud standard, notre stockage UE + suppression automatique à 30 jours couvre la plupart des cas.

Quelle est la taille maximale de fichier ?

Sur le forfait Pro (10 $/mois), chaque fichier peut durer jusqu'à 4 heures ou peser 2 Go. Sur Premium (29 $/mois), jusqu'à 10 heures ou 5 Go. Les fichiers vidéo (MP4, MOV, AVI) fonctionnent aussi — l'audio est extrait et transcrit automatiquement.

Combien coûte 1 heure de transcription ?

Avec la dotation gratuite de 60 minutes à vie, une heure entière rentre juste dans le palier gratuit. Au-delà, Pro coûte 10 $/mois pour 1 200 minutes (environ 0,008 $ la minute) et Premium 29 $/mois pour 3 600 minutes. Voir la page tarifs pour tous les détails.

Puis-je transcrire des audios longs (2 h et plus) ?

Oui. Sur Pro, chaque fichier peut durer jusqu'à 4 heures ; sur Premium, jusqu'à 10 heures. Une réunion de 2 heures se traite en général en 5-10 minutes. Pour les audios complexes avec plusieurs intervenants, il vaut mieux que chaque voix soit claire et séparée (un micro par personne ou intervenants espacés).

Ça marche sur mobile ?

Oui. Tout tourne dans le navigateur — Safari sur iPhone, Chrome sur Android, ou desktop. Aucune application native à installer.

Ça marche pour l'accent québécois, belge ou suisse ?

Oui. Whisper large-v3 a été entraîné sur du français de multiples régions — France, Québec, Belgique, Suisse, Afrique francophone. Les accents standards de ces variantes fonctionnent bien. Les accents régionaux très marqués (québécois joual, marseillais fermé, wallon profond) peuvent générer plus d'erreurs, mais la compréhension générale reste haute.

Est-ce vraiment gratuit ?

Oui, les 60 premières minutes sont gratuites à vie — dotation unique, sans renouvellement mensuel, sans carte bancaire. Un épisode de podcast de 30 minutes consomme 30 minutes du crédit. Au-delà, il faut passer à un forfait payant. C'est un modèle différent des free tiers mensuels (Otter 300 min/mois, Notta 120 min/mois) : chez nous c'est une seule fois, mais sans piège de renouvellement automatique caché.

Puis-je transcrire des messages vocaux WhatsApp ?

Oui. Les messages vocaux WhatsApp (format .opus ou .m4a) peuvent être uploadés directement. Depuis WhatsApp, appuyez longuement sur le message vocal, tapez « Transférer » puis « Partager » et sauvegardez le fichier. Cela dit, en France l'usage des messages vocaux WhatsApp est moins massif qu'au Brésil ou dans les pays hispanophones — c'est un usage plus marginal en France.