Audio transkribieren
Schnell, präzise und mit Speicherung auf AWS in der EU-Region.
- ✓ 60 Minuten kostenlos
- ✓ Keine Kreditkarte
- ✓ EU-Speicherung (AWS)
- ✓ Kein Training mit deinen Daten
Zuletzt aktualisiert: 24. Juli 2026
Audio in drei Schritten transkribieren
- Datei hochladen— MP3, WAV, M4A, MP4 oder jedes gängige Format per Drag & Drop.
- Deutsch wählen (oder automatische Spracherkennung nutzen, falls das Audio mehrsprachig ist).
- Transkript herunterladen — in Sekunden liegt der Text mit Sprechererkennung vor. Export als TXT, DOCX, PDF, SRT oder VTT.
Keine Installation nötig. Alles läuft im Browser.
WhatsApp-Sprachnachricht in Text umwandeln
Auf iPhone (iOS 16+) transkribiert WhatsApp deutsche Sprachnachrichten seit November 2024 nativ. Auf Android ist Deutsch aktuell nicht unterstützt — dort brauchst du eine Alternative. DeluxeScribe funktioniert auf beiden Plattformen: Sprachnachricht lange drücken → Teilen → Datei bei uns hochladen → in Sekunden liegt der Text vor.
Ausführliche Schritt-für-Schritt-Anleitungen für iPhone und Android, die vollständige Sprachliste (welche Sprachen auf welcher Plattform funktionieren) sowie ein Vergleich der drei Android-Alternativen (DeluxeScribe, Google Live Transcribe, Drittanbieter-Apps) findest du auf unserer eigenen Seite: WhatsApp-Sprachnachricht in Text umwandeln — auf Deutsch.
Unterstützte Audioformate
MP3, WAV, M4A, MP4, OGG, OPUS, FLAC, AAC und WebM. Videos (MP4, MOV, AVI) werden automatisch verarbeitet — nur der Ton wird transkribiert.
- MP3 — häufigstes Format für Aufnahmen und Podcasts
- M4A — natives Format der iPhone-Sprachmemos
- OPUS — von WhatsApp verwendetes Format für Sprachnachrichten
- WAV — unkomprimiert, maximale Qualität
- MP4/MOV — Video mit Ton (es wird nur der Ton transkribiert)
MP3, WAV und M4A in Text umwandeln
MP3 in Text umwandeln
MP3 ist das häufigste Aufnahmeformat. Funktioniert mit jeder Bitrate — 128 kbps für leichte Aufnahmen, 192 oder 256 kbps für Podcasts, 320 kbps für maximale Qualität. DeluxeScribe verarbeitet die Datei direkt, ohne vorherige Umwandlung. Genauigkeit über 95 % bei sauberem Audio, unabhängig von der Bitrate.
Typische Anwendung: Podcast-Episoden, mit dem Handy aufgenommene Interviews, von YouTube oder Spotify heruntergeladene Audios, Radiomitschnitte, exportierte Sprachnachrichten. Für den ausführlichen MP3-spezifischen Workflow inklusive Bitrate-Analyse und Vergleich der Verb-Formen (transkribieren / umwandeln / zu Text): siehe MP3 in Text umwandeln.
WAV in Text umwandeln
WAV ist unkomprimiertes Audio — die maximal mögliche Qualität. Wird in professionellen Studioaufnahmen genutzt, bei Podcasts mit mehreren Mikrofonen, bei qualitativen Forschungsinterviews, wo jedes Wort zählt. Die Dateien sind groß (etwa 10 MB pro Minute), werden von DeluxeScribe aber genauso schnell verarbeitet wie MP3.
M4A in Text umwandeln
M4A ist das native Format der iPhone-Aufnahmen (Sprachmemos, mit kompatiblen Apps aufgenommene Anrufe) und der QuickTime-Aufnahmen auf dem Mac. Auch beim Export aus iMovie oder GarageBand wird M4A verwendet. Wird ohne vorherige Umwandlung transkribiert, genau wie MP3. Für den iPhone-spezifischen Workflow inklusive iOS 18 nativer Transkription und Export-Anleitung: siehe Sprachmemo in Text umwandeln.
Ist die Umwandlung dieser Formate kostenlos?
Ja — die 60 Freiminuten gelten für jedes Format. Eine 10- minütige MP3-Datei verbraucht 10 Minuten des Guthabens, ebenso wie eine 10-minütige WAV-Datei. Abgerechnet wird nach Audiodauer, nicht nach Dateigröße.
Genauigkeit auf Deutsch
Bei sauberem Audio mit einer sprechenden Person liegt die Genauigkeit zwischen 95 % und 98 % — nahe menschlichem Niveau. Whisper large-v3 (das Modell hinter DeluxeScribe und den meisten anderen aktuellen Diensten) erreicht auf dem FLEURS German-Benchmark eine WER unter 5 %.
Hochdeutsch vs. Dialekte
Hochdeutsch, österreichisches Standarddeutsch und Standardschweizerdeutsch werden zuverlässig transkribiert. Starke Dialekte — breites Bairisch, Schwyzerdütsch, Sächsisch — führen zu spürbar mehr Fehlern. Das ist ein Grenzfall aller aktuellen KI-Transkriptionsdienste, nicht spezifisch für DeluxeScribe.
Vergleich mit lokalem Whisper und anderen Diensten
DeluxeScribe nutzt Modelle aus der Whisper-Familie — die gleiche Grundlage wie TurboScribe, HappyScribe und Notta. Unterschiede zwischen den Diensten liegen bei Geschwindigkeit, Sprechererkennung, Editor und Exportformaten im Free-Tier.
Datenschutz & DSGVO — die ehrliche Version
Was wir tun:
- Verschlüsselte Übertragung (TLS)
- Verschlüsselte Speicherung auf AWS in der EU-Region
- Keine Nutzung deines Audios für Modelltraining
- Löschung einzelner Transkripte oder deines gesamten Kontos jederzeit möglich
- Kein Verkauf oder Weitergabe von Daten an Dritte
Was wir nicht tun:
- Keine DSGVO-Zertifizierung
- Aktuell kein Auftragsverarbeitungsvertrag (AVV) für geschäftliche Kunden
- Keine HIPAA-Konformität
Empfehlung: Für geschäftliche Verarbeitung personenbezogener Daten unter DSGVO — insbesondere Aufnahmen mit Kundenstimmen, medizinischen Daten oder anwaltlich geschützten Gesprächen — ist ein Dienst mit signiertem AVV oder eine selbst gehostete Whisper-Instanz die bessere Wahl. Für private Notizen, öffentlich zugängliche Podcasts, eigene Videos und Sprachnachrichten ohne fremde personenbezogene Daten ist DeluxeScribe eine praktikable und sichere Option.
Anwendungsfälle
- Meetings — Zoom, Google Meet, Teams: Aufnahme hochladen und Zusammenfassung mit dem Team teilen.
- Interviews — für Journalismus und qualitative Forschung: wortgenaue Zitate mit Zeitstempeln.
- Podcasts — Transkript zum Episode für SEO und Barrierefreiheit veröffentlichen.
- Vorlesungen — 2-Stunden-Aufnahme in Minuten zu Text-Notizen machen.
- Persönliche Sprachnachrichten — WhatsApp, Signal, Telegram, iPhone Sprachmemos.
DeluxeScribe im Vergleich zu kostenlosen Alternativen
| Tool | Kostenloser Plan | Exportformate | EU-Speicherung |
|---|---|---|---|
| DeluxeScribe | 60 Min. insgesamt | SRT, VTT, TXT, DOCX, PDF | Ja (AWS EU) |
| Otter | 300 Min./Monat | nur TXT und MP3 | USA |
| TurboScribe | 90 Min./Tag (3 × 30 Min.) | SRT, VTT, TXT, DOCX, PDF | USA |
| HappyScribe | 10 Min. KI-Transkription/Monat | TXT, SRT | Ja (Barcelona) |
| Whisper (lokal) | Unbegrenzt (Open Source) | TXT, SRT, VTT (per CLI) | Läuft auf deinem Rechner |
Wann DeluxeScribe die richtige Wahl ist: wenn du EU-Speicherung möchtest und alle Exportformate ab der ersten Minute brauchst, oder ein seriöses Tool testen willst, bevor du zahlst. Wann eine Alternative besser passt: wenn du dauerhaft kostenlos ohne Zahlung transkribieren willst (TurboScribe für Dateien, Whisper lokal für technische Nutzung), oder wenn du eine formale DSGVO-Zertifizierung brauchst (dann selbst hosten).
Teste mit deinem eigenen Audio
60 Minuten kostenlos, keine Kreditkarte. EU-Speicherung. Alle Exportformate ab der ersten Minute freigeschaltet.
Häufig gestellte Fragen
Wie kann ich Audio in Text transkribieren?
Lade deine Audiodatei (MP3, WAV, M4A, OGG oder andere) bei DeluxeScribe hoch, wähle Deutsch als Sprache aus, und in wenigen Sekunden erhältst du den Text mit Sprechererkennung und Zeitstempeln. WhatsApp-Sprachnachrichten kannst du direkt hochladen. Die ersten 60 Minuten sind kostenlos, ohne Kreditkarte.
Wie wandle ich eine WhatsApp-Sprachnachricht in Text um?
In WhatsApp die Sprachnachricht lange drücken, auf 'Weiterleiten' und dann 'Teilen' tippen, um die Datei zu speichern (Format .opus oder .m4a). Anschließend die Datei bei DeluxeScribe hochladen. Funktioniert auf iPhone und Android gleich. Bei langen Sprachnachrichten deutlich schneller, den Text zu lesen, als die Nachricht in doppelter Geschwindigkeit anzuhören.
Ist DeluxeScribe DSGVO-konform?
Kurze, ehrliche Antwort: Wir sind nicht DSGVO-zertifiziert und bieten aktuell keinen Auftragsverarbeitungsvertrag (AVV) an. Was wir tun: Daten werden verschlüsselt übertragen (TLS) und verschlüsselt auf AWS in der EU-Region gespeichert. Wir verwenden dein Audio nicht für Modelltraining. Du kannst Transkripte jederzeit löschen. Für die geschäftliche Verarbeitung personenbezogener Daten unter DSGVO empfehlen wir einen Anbieter mit signiertem AVV oder eine selbst gehostete Whisper-Instanz.
Wo werden meine Daten gespeichert?
Auf AWS in der EU-Region. Die Übertragung erfolgt über TLS, die Speicherung ist verschlüsselt. Wir trainieren keine Modelle mit deinem Audio und geben Daten nicht an Dritte weiter. Du kannst jedes Transkript einzeln oder komplett löschen — im Dashboard oder per Anfrage an den Support.
Was kostet die kostenlose Version wirklich?
60 Minuten insgesamt, nicht monatlich. Also einmalig zum Testen — nicht als Dauerlösung gedacht. Wenn du fortlaufend transkribierst, kostet Pro 10 $/Monat für 1.200 Minuten. Kein Wasserzeichen, keine Bindung an bestimmte Exportformate — alle Formate (SRT, VTT, TXT, DOCX, PDF) sind ab dem ersten Kostenlosminute freigeschaltet.
Wie genau ist die Transkription auf Deutsch?
Bei sauberem Audio mit einer sprechenden Person liegt die Genauigkeit zwischen 95 % und 98 %. Whisper large-v3 — das Modell hinter DeluxeScribe und den meisten anderen aktuellen Diensten — erreicht auf dem FLEURS German-Benchmark eine Wortfehlerquote (WER) unter 5 %. Bei mehreren Sprechern, Hintergrundgeräuschen oder starken Dialekten (Schweizerdeutsch, breites Bairisch) steigt die Fehlerquote messbar an.
Funktioniert es mit Schweizerdeutsch und Bairisch?
Hochdeutsch, österreichisches Standarddeutsch und Standardschweizerdeutsch funktionieren gut. Starke Dialekte wie breites Bairisch, Schwyzerdütsch oder Sächsisch führen zu deutlich mehr Fehlern — das gilt für alle aktuellen KI-Transkriptionsdienste, nicht nur DeluxeScribe. Für dialektstarke Aufnahmen empfehlen wir, das Audio wenn möglich hochdeutsch nachzusprechen oder eine manuelle Nachkorrektur einzuplanen.
Welche Audioformate werden unterstützt?
MP3, WAV, M4A, MP4, OGG, OPUS, FLAC, AAC und WebM. Videodateien (MP4, MOV, AVI) funktionieren auch — der Ton wird automatisch extrahiert und transkribiert. Maximale Dateigröße im kostenlosen Plan: 100 MB. In den bezahlten Plänen bis 5 GB.
Können mehrere Sprecher erkannt werden?
Ja. DeluxeScribe erkennt bis zu 10 verschiedene Sprecher automatisch und markiert sie als 'Sprecher 1', 'Sprecher 2' usw. Du kannst sie im Editor manuell umbenennen. Am besten funktioniert es bei Aufnahmen, in denen jede Person klar spricht und die Stimmen sich nicht zu stark überlappen.
Kann ich Untertitel als SRT oder VTT exportieren?
Ja. Alle Exportformate (SRT, VTT, TXT, DOCX, PDF, JSON) sind auch im kostenlosen Plan verfügbar. SRT- und VTT-Dateien enthalten Zeitstempel und sind sofort einsatzbereit in YouTube, Vimeo, Premiere Pro, DaVinci Resolve oder jedem anderen Videoeditor.
Wie wandle ich MP3 in Text um?
Lade die MP3-Datei bei DeluxeScribe hoch, wähle Deutsch als Sprache aus, und in Sekunden erhältst du den Text. Funktioniert mit jeder Bitrate (128 kbps, 192 kbps, 320 kbps). Für große MP3-Dateien (über 100 MB im kostenlosen Plan) brauchst du einen bezahlten Plan oder musst die Datei aufteilen. Die Genauigkeit hängt von der Audioqualität ab, nicht vom Format — ein sauberes MP3 mit 128 kbps wird genauso präzise transkribiert wie eine WAV-Datei.
Werden WAV- und M4A-Dateien unterstützt?
Ja. WAV ist unkomprimiertes Audio mit maximaler Qualität — ideal für professionelle Studioaufnahmen oder Podcasts. M4A ist das native Format der iPhone-Sprachmemos und der QuickTime-Aufnahmen auf dem Mac. Beide funktionieren wie MP3 in DeluxeScribe, mit gleicher Genauigkeit und denselben Exportoptionen.
Ist die MP3-zu-Text-Umwandlung kostenlos?
Die ersten 60 Minuten sind kostenlos, ohne Kreditkarte. Du kannst beliebig viele MP3-Dateien transkribieren, bis dieses Guthaben aufgebraucht ist — eine 30-minütige Podcast-Episode verbraucht 30 Minuten, zwei 15-minütige Dateien verbrauchen ebenfalls 30, und so weiter. Nach dem Gratiskontingent kostet der Pro-Tarif 10 $/Monat für 1.200 Minuten (etwa 0,008 $ pro Minute).