Audio transkribieren
Schnell, präzise und mit Speicherung auf AWS in der EU-Region.
- ✓ 60 Minuten kostenlos
- ✓ Keine Kreditkarte
- ✓ EU-Speicherung (AWS)
- ✓ Kein Training mit deinen Daten
Zuletzt aktualisiert: 20. Juli 2026
Audio in drei Schritten transkribieren
- Datei hochladen— MP3, WAV, M4A, MP4 oder jedes gängige Format per Drag & Drop.
- Deutsch wählen (oder automatische Spracherkennung nutzen, falls das Audio mehrsprachig ist).
- Transkript herunterladen — in Sekunden liegt der Text mit Sprechererkennung vor. Export als TXT, DOCX, PDF, SRT oder VTT.
Keine Installation nötig. Alles läuft im Browser.
WhatsApp-Sprachnachricht in Text umwandeln
Sprachnachrichten in Text umzuwandeln ist im deutschen Sprachraum einer der häufigsten Transkriptions-Anwendungsfälle. Lange Nachrichten von Kolleginnen und Kollegen, Familien-Sprachnachrichten, Notizen, die du selbst unterwegs aufgenommen hast — alles wird zu lesbarem Text in Sekunden.
Aus WhatsApp exportieren (iPhone)
- Öffne den WhatsApp-Chat mit der Sprachnachricht.
- Drücke lange auf die Nachricht und tippe auf Weiterleiten.
- Wähle Teilen und dann In “Dateien” sichern.
- Lade die .opus- oder .m4a-Datei bei DeluxeScribe hoch.
Aus WhatsApp exportieren (Android)
- Lange auf die Sprachnachricht in WhatsApp drücken.
- Auf das Teilen-Symbol tippen (drei Punkte → Teilen).
- Über eine Datei-App speichern oder direkt im Speicher ablegen.
- Datei bei DeluxeScribe hochladen.
Lange Sprachnachrichten (über 5 Minuten)
Für Sprachnachrichten über 5 Minuten unterstützt DeluxeScribe im Free-Plan bis zu 30 Minuten pro Datei, im Pro-Plan bis zu 4 Stunden. Die automatische Sprechererkennung funktioniert auch bei mehreren Personen im Hintergrund.
Unterstützte Audioformate
MP3, WAV, M4A, MP4, OGG, OPUS, FLAC, AAC und WebM. Videos (MP4, MOV, AVI) werden automatisch verarbeitet — nur der Ton wird transkribiert.
- MP3 — häufigstes Format für Aufnahmen und Podcasts
- M4A — natives Format der iPhone-Sprachmemos
- OPUS — von WhatsApp verwendetes Format für Sprachnachrichten
- WAV — unkomprimiert, maximale Qualität
- MP4/MOV — Video mit Ton (es wird nur der Ton transkribiert)
Genauigkeit auf Deutsch
Bei sauberem Audio mit einer sprechenden Person liegt die Genauigkeit zwischen 95 % und 98 % — nahe menschlichem Niveau. Whisper large-v3 (das Modell hinter DeluxeScribe und den meisten anderen aktuellen Diensten) erreicht auf dem FLEURS German-Benchmark eine WER unter 5 %.
Hochdeutsch vs. Dialekte
Hochdeutsch, österreichisches Standarddeutsch und Standardschweizerdeutsch werden zuverlässig transkribiert. Starke Dialekte — breites Bairisch, Schwyzerdütsch, Sächsisch — führen zu spürbar mehr Fehlern. Das ist ein Grenzfall aller aktuellen KI-Transkriptionsdienste, nicht spezifisch für DeluxeScribe.
Vergleich mit lokalem Whisper und anderen Diensten
DeluxeScribe nutzt Modelle aus der Whisper-Familie — die gleiche Grundlage wie TurboScribe, HappyScribe und Notta. Unterschiede zwischen den Diensten liegen bei Geschwindigkeit, Sprechererkennung, Editor und Exportformaten im Free-Tier.
Datenschutz & DSGVO — die ehrliche Version
Was wir tun:
- Verschlüsselte Übertragung (TLS)
- Verschlüsselte Speicherung auf AWS in der EU-Region
- Keine Nutzung deines Audios für Modelltraining
- Löschung einzelner Transkripte oder deines gesamten Kontos jederzeit möglich
- Kein Verkauf oder Weitergabe von Daten an Dritte
Was wir nicht tun:
- Keine DSGVO-Zertifizierung
- Aktuell kein Auftragsverarbeitungsvertrag (AVV) für geschäftliche Kunden
- Keine HIPAA-Konformität
Empfehlung: Für geschäftliche Verarbeitung personenbezogener Daten unter DSGVO — insbesondere Aufnahmen mit Kundenstimmen, medizinischen Daten oder anwaltlich geschützten Gesprächen — ist ein Dienst mit signiertem AVV oder eine selbst gehostete Whisper-Instanz die bessere Wahl. Für private Notizen, öffentlich zugängliche Podcasts, eigene Videos und Sprachnachrichten ohne fremde personenbezogene Daten ist DeluxeScribe eine praktikable und sichere Option.
Anwendungsfälle
- Meetings — Zoom, Google Meet, Teams: Aufnahme hochladen und Zusammenfassung mit dem Team teilen.
- Interviews — für Journalismus und qualitative Forschung: wortgenaue Zitate mit Zeitstempeln.
- Podcasts — Transkript zum Episode für SEO und Barrierefreiheit veröffentlichen.
- Vorlesungen — 2-Stunden-Aufnahme in Minuten zu Text-Notizen machen.
- Persönliche Sprachnachrichten — WhatsApp, Signal, Telegram, iPhone Sprachmemos.
DeluxeScribe im Vergleich zu kostenlosen Alternativen
| Tool | Kostenloser Plan | Exportformate | EU-Speicherung |
|---|---|---|---|
| DeluxeScribe | 60 Min. insgesamt | SRT, VTT, TXT, DOCX, PDF | Ja (AWS EU) |
| Otter | 300 Min./Monat | nur TXT und MP3 | USA |
| TurboScribe | 90 Min./Tag (3 × 30 Min.) | SRT, VTT, TXT, DOCX, PDF | USA |
| HappyScribe | 10 Min. KI-Transkription/Monat | TXT, SRT | Ja (Barcelona) |
| Whisper (lokal) | Unbegrenzt (Open Source) | TXT, SRT, VTT (per CLI) | Läuft auf deinem Rechner |
Wann DeluxeScribe die richtige Wahl ist: wenn du EU-Speicherung möchtest und alle Exportformate ab der ersten Minute brauchst, oder ein seriöses Tool testen willst, bevor du zahlst. Wann eine Alternative besser passt: wenn du dauerhaft kostenlos ohne Zahlung transkribieren willst (TurboScribe für Dateien, Whisper lokal für technische Nutzung), oder wenn du eine formale DSGVO-Zertifizierung brauchst (dann selbst hosten).
Teste mit deinem eigenen Audio
60 Minuten kostenlos, keine Kreditkarte. EU-Speicherung. Alle Exportformate ab der ersten Minute freigeschaltet.
Häufig gestellte Fragen
Wie kann ich Audio in Text transkribieren?
Lade deine Audiodatei (MP3, WAV, M4A, OGG oder andere) bei DeluxeScribe hoch, wähle Deutsch als Sprache aus, und in wenigen Sekunden erhältst du den Text mit Sprechererkennung und Zeitstempeln. WhatsApp-Sprachnachrichten kannst du direkt hochladen. Die ersten 60 Minuten sind kostenlos, ohne Kreditkarte.
Wie wandle ich eine WhatsApp-Sprachnachricht in Text um?
In WhatsApp die Sprachnachricht lange drücken, auf 'Weiterleiten' und dann 'Teilen' tippen, um die Datei zu speichern (Format .opus oder .m4a). Anschließend die Datei bei DeluxeScribe hochladen. Funktioniert auf iPhone und Android gleich. Bei langen Sprachnachrichten deutlich schneller, den Text zu lesen, als die Nachricht in doppelter Geschwindigkeit anzuhören.
Ist DeluxeScribe DSGVO-konform?
Kurze, ehrliche Antwort: Wir sind nicht DSGVO-zertifiziert und bieten aktuell keinen Auftragsverarbeitungsvertrag (AVV) an. Was wir tun: Daten werden verschlüsselt übertragen (TLS) und verschlüsselt auf AWS in der EU-Region gespeichert. Wir verwenden dein Audio nicht für Modelltraining. Du kannst Transkripte jederzeit löschen. Für die geschäftliche Verarbeitung personenbezogener Daten unter DSGVO empfehlen wir einen Anbieter mit signiertem AVV oder eine selbst gehostete Whisper-Instanz.
Wo werden meine Daten gespeichert?
Auf AWS in der EU-Region. Die Übertragung erfolgt über TLS, die Speicherung ist verschlüsselt. Wir trainieren keine Modelle mit deinem Audio und geben Daten nicht an Dritte weiter. Du kannst jedes Transkript einzeln oder komplett löschen — im Dashboard oder per Anfrage an den Support.
Was kostet die kostenlose Version wirklich?
60 Minuten insgesamt, nicht monatlich. Also einmalig zum Testen — nicht als Dauerlösung gedacht. Wenn du fortlaufend transkribierst, kostet Pro 10 $/Monat für 1.200 Minuten. Kein Wasserzeichen, keine Bindung an bestimmte Exportformate — alle Formate (SRT, VTT, TXT, DOCX, PDF) sind ab dem ersten Kostenlosminute freigeschaltet.
Wie genau ist die Transkription auf Deutsch?
Bei sauberem Audio mit einer sprechenden Person liegt die Genauigkeit zwischen 95 % und 98 %. Whisper large-v3 — das Modell hinter DeluxeScribe und den meisten anderen aktuellen Diensten — erreicht auf dem FLEURS German-Benchmark eine Wortfehlerquote (WER) unter 5 %. Bei mehreren Sprechern, Hintergrundgeräuschen oder starken Dialekten (Schweizerdeutsch, breites Bairisch) steigt die Fehlerquote messbar an.
Funktioniert es mit Schweizerdeutsch und Bairisch?
Hochdeutsch, österreichisches Standarddeutsch und Standardschweizerdeutsch funktionieren gut. Starke Dialekte wie breites Bairisch, Schwyzerdütsch oder Sächsisch führen zu deutlich mehr Fehlern — das gilt für alle aktuellen KI-Transkriptionsdienste, nicht nur DeluxeScribe. Für dialektstarke Aufnahmen empfehlen wir, das Audio wenn möglich hochdeutsch nachzusprechen oder eine manuelle Nachkorrektur einzuplanen.
Welche Audioformate werden unterstützt?
MP3, WAV, M4A, MP4, OGG, OPUS, FLAC, AAC und WebM. Videodateien (MP4, MOV, AVI) funktionieren auch — der Ton wird automatisch extrahiert und transkribiert. Maximale Dateigröße im kostenlosen Plan: 100 MB. In den bezahlten Plänen bis 5 GB.
Können mehrere Sprecher erkannt werden?
Ja. DeluxeScribe erkennt bis zu 10 verschiedene Sprecher automatisch und markiert sie als 'Sprecher 1', 'Sprecher 2' usw. Du kannst sie im Editor manuell umbenennen. Am besten funktioniert es bei Aufnahmen, in denen jede Person klar spricht und die Stimmen sich nicht zu stark überlappen.
Kann ich Untertitel als SRT oder VTT exportieren?
Ja. Alle Exportformate (SRT, VTT, TXT, DOCX, PDF, JSON) sind auch im kostenlosen Plan verfügbar. SRT- und VTT-Dateien enthalten Zeitstempel und sind sofort einsatzbereit in YouTube, Vimeo, Premiere Pro, DaVinci Resolve oder jedem anderen Videoeditor.