MP3 a Texto
Subí tu MP3 y obtené el texto en segundos — con Whisper large-v3 y español nativo de LATAM y España.
- 60 minutos gratis de por vida
- Sin tarjeta de crédito
- Español nativo — LATAM y España
- Datos en la UE (Fráncfort), borrados a los 30 días
Última verificación: 22 de septiembre de 2026
Cómo pasar un MP3 a texto en 3 pasos
En corto: subís el MP3, elegís español, y en segundos tenés el texto con marcas de tiempo. Sin instalar nada, sin tarjeta de crédito, y con todos los formatos de exportación desbloqueados desde el plan gratuito.
- Subí tu MP3 — arrastrá y soltá el archivo al uploader. Cualquier bitrate funciona (128, 192, 256 o 320 kbps).
- Elegí españolcomo idioma de entrada (o dejá “auto-detectar” si el audio mezcla idiomas).
- Descargá el texto — la transcripción llega con marcas de tiempo. Exportá como TXT, DOCX, PDF, SRT o VTT.
Un MP3 de 10 minutos suele estar listo en 30 a 90 segundos. Un episodio de pódcast de 1 hora, en 2 a 5 minutos.
Qué obtenés al transcribir el MP3
- Texto completo con marcas de tiempo — cada bloque de texto está vinculado al momento exacto del audio, así podés verificar cualquier frase contra la grabación original.
- Seis formatos de exportación — TXT para pegar donde sea, DOCX y PDF para documentos, SRT y VTT para subtítulos, JSON para procesamiento posterior. Todos disponibles también en el plan gratuito.
- Editor en el navegador — corregí nombres propios o jerga técnica antes de exportar, escuchando el audio en el punto exacto de cada frase.
Lo que no obtenés (todavía): etiquetas automáticas de hablante. Si tu archivo es una entrevista con varias voces y necesitás que cada intervención salga etiquetada por persona, mirá la sección Cuándo otra herramienta es mejor.
¿Es gratis pasar un MP3 a texto?
Sí, con un límite que preferimos decirte antes de que subas el archivo: los primeros 60 minutos son gratis de por vida — cupo único, no un saldo mensual que se renueva. No pedimos tarjeta de crédito y no hay paywall escondido detrás del botón de descarga: todos los formatos de exportación funcionan desde el minuto uno.
Después del cupo gratuito, el plan Pro cuesta 10 USD al mes por 1.200 minutos (unos 0,008 USD por minuto). Los detalles están en la página de precios.
Cómo se comparan los planes gratuitos
| Herramienta | Plan gratuito | Límite por archivo | Exportación gratuita |
|---|---|---|---|
| DeluxeScribe | 60 min de por vida | Sin límite dentro del cupo | SRT, VTT, TXT, DOCX, PDF, JSON |
| TurboScribe | 90 min/día (3 × 30 min) | 30 min | SRT, VTT, TXT, DOCX, PDF |
| Otter | 300 min/mes | — | Solo TXT y MP3 |
| Notta | 120 min/mes | 3 min por grabación | Solo TXT |
| Whisper (local) | Ilimitado (open source) | Sin límite | TXT, SRT, VTT (CLI) |
Números de competidores verificados el 16 de agosto de 2026 en los sitios oficiales de cada proveedor. Planes y límites cambian sin previo aviso.
Si tu volumen es alto y recurrente, el free tier de TurboScribe (90 minutos diarios) es más generoso que el nuestro — lo decimos sin vueltas. Nuestro cupo es único pero sin restricción por archivo, y ningún formato de exportación está bloqueado.
Precisión real en español
En audio limpio con un solo hablante, Whisper large-v3 — el modelo detrás de DeluxeScribe — logra una tasa de error de palabras (WER) por debajo del 5% en el benchmark FLEURS Spanish de Google. Eso está cerca del nivel de un transcriptor humano atento. Para entender cómo se mide, mirá nuestra guía sobre la precisión de Whisper.
La precisión que vas a ver en la práctica depende del audio de origen, no del formato MP3:
- Grabación limpia, un hablante (pódcast, nota de voz cerca del micrófono): excelente — errores ocasionales en nombres propios y jerga muy específica.
- Reunión de Zoom/Meet con auriculares: buena — algunos errores cuando dos personas hablan a la vez.
- Audio telefónico, mucho ruido de fondo o voces superpuestas: la precisión baja de forma notable. Revisá el resultado contra el audio antes de citar literalmente.
El modelo maneja bien tanto el “tú” peninsular como el voseo rioplatense, y las variantes estándar de México, Colombia, Chile, Perú y el Caribe. Los acentos muy marcados (rural andino, chilango profundo, andaluz cerrado) generan más errores en palabras específicas.
¿Importa el bitrate del MP3? (Casi nunca)
No hace falta re-exportar tu MP3 a mayor calidad antes de subirlo. Un MP3 limpio a 128 kbps se transcribe igual de bien que uno a 320 kbps o que un WAV sin comprimir: el modelo trabaja sobre el habla, y la compresión MP3 estándar no elimina la información que necesita.
La excepción: audios comprimidos por debajo de 64 kbps o re-comprimidos varias veces (por ejemplo, un audio reenviado muchas veces entre apps de mensajería) pueden traer artefactos audibles — y la transcripción hereda esos errores. En ese caso el problema es la grabación, no el formato: ninguna herramienta lo corrige. Grabá siempre en la mejor calidad posible desde el origen.
¿Pasar, convertir o transcribir un MP3?
Según el país se dice distinto: en Argentina, Uruguay y Chile lo natural es “pasar mp3 a texto”; en México, Colombia y Perú se usa más “convertir”; en España, “transcribir”. Las tres búsquedas llegan al mismo lugar: obtener por escrito lo que se dice dentro del audio.
Ojo con “convertir”:también puede significar cambiar el formato del archivo (MP3 → WAV). Eso no es lo que hacemos — DeluxeScribe hace reconocimiento de habla (ASR), no conversión de formato. Si lo que necesitás es cambiar un MP3 a otro formato de audio, buscá “conversor de audio”; si querés el texto de lo que se dice, estás en el lugar correcto.
MP3 a subtítulos (SRT o VTT)
La misma transcripción se exporta directamente como SRT o VTT con marcas de tiempo listas para YouTube, Vimeo, Premiere Pro, DaVinci Resolve o cualquier player web — sin pasos intermedios y también en el plan gratuito. Si tu punto de partida es un video y no un MP3, o querés afinar la segmentación de los subtítulos, la guía del generador de SRT (en inglés) cubre ese flujo completo.
Probá con tu propio MP3
60 minutos gratis, sin tarjeta. Todos los formatos de exportación desbloqueados desde el inicio.
Privacidad y RGPD
Tu MP3 se transmite cifrado con TLS y se almacena cifrado en AWS UE (región Fráncfort) — no en Estados Unidos. Audio y transcripción se borran automáticamente a los 30 días, y podés eliminarlos manualmente en cualquier momento desde el panel. No usamos tu audio para entrenar modelos de IA.
Lo que no ofrecemos: un DPA (contrato de tratamiento de datos según el artículo 28 del RGPD). Si tu organización — hospital, estudio jurídico, empresa con datos regulados — exige un DPA firmado, DeluxeScribe todavía no es la herramienta adecuada: usá un proveedor con DPA o instalá Whisper localmente. Para uso individual, freelance o empresas cuya política interna cubre servicios cloud estándar, el almacenamiento en la UE con borrado automático cubre la mayoría de los casos.
Cuándo otra herramienta es mejor
DeluxeScribe no es la respuesta correcta para todos los casos. Antes de gastar tu cupo gratuito:
- Etiquetas de hablante automáticas (entrevistas con varias voces donde cada intervención debe salir etiquetada): Notta, TurboScribe u Otter las incluyen; DeluxeScribe todavía no tiene diarización.
- Volumen alto, gratis y para siempre: Whisper large-v3 ejecutado en tu propia máquina (CLI de OpenAI o whisper.cpp) produce los mismos resultados de modelo, sin costo y offline — a cambio de instalación técnica y una GPU decente o mucha paciencia en CPU.
- Bot que se une a la reunión en vivo y genera minutas automáticas: Otter, Fireflies o tl;dv. Lo nuestro es el archivo ya grabado.
- DPA firmado / cumplimiento formal RGPD: herramientas enterprise con contrato de tratamiento — no DeluxeScribe todavía.
Nuestro punto fuerte es concreto: Whisper large-v3 desde el navegador, datos en la UE con borrado automático, y un free tier honesto — 60 minutos de por vida, no un mes con truco.
¿Tu archivo no es MP3?
No hace falta convertirlo — DeluxeScribe procesa todos estos formatos directamente:
- M4A (notas de voz de iPhone) y WAV (grabaciones de estudio): funcionan igual que MP3, mismos precios y exportaciones. Guías en inglés: M4A to text y WAV to text.
- OPUS (audios de WhatsApp): subilos tal cual, sin conversión previa.
- MP4, MOV y otros videos: se extrae y transcribe solo el audio. Guía en inglés: MP4 to text.
- Para el panorama completo de formatos y usos en español, mirá la guía general de transcribir audio a texto.
Cómo se verificó esta página
Guías relacionadas
- Transcribir audio a textoLa guía general: WhatsApp, reuniones, uso profesional y todos los formatos.
- Precios y planes60 minutos gratis, luego Pro (10 USD/mes) o Premium (29 USD/mes).
- Precisión de Whisper (en inglés)Cómo se mide WER, benchmarks FLEURS y comparación por idioma.
- MP3 to text (English)La misma herramienta, con contexto adicional para audiencia en inglés.