MP3 a Texto

Subí tu MP3 y obtené el texto en segundos — con Whisper large-v3 y español nativo de LATAM y España.

DeluxeScribe pasa tu MP3 a texto usando Whisper large-v3, con marcas de tiempo y exportación en TXT, DOCX, PDF, SRT, VTT o JSON. Funciona con cualquier bitrate y, en planes pagos, con archivos de hasta 10 horas. Audio almacenado en AWS UE (Fráncfort) y borrado a los 30 días. 60 minutos gratis de por vida, sin tarjeta de crédito.
  • 60 minutos gratis de por vida
  • Sin tarjeta de crédito
  • Español nativo — LATAM y España
  • Datos en la UE (Fráncfort), borrados a los 30 días

Última verificación: 22 de septiembre de 2026

Cómo pasar un MP3 a texto en 3 pasos

En corto: subís el MP3, elegís español, y en segundos tenés el texto con marcas de tiempo. Sin instalar nada, sin tarjeta de crédito, y con todos los formatos de exportación desbloqueados desde el plan gratuito.

  1. Subí tu MP3 — arrastrá y soltá el archivo al uploader. Cualquier bitrate funciona (128, 192, 256 o 320 kbps).
  2. Elegí españolcomo idioma de entrada (o dejá “auto-detectar” si el audio mezcla idiomas).
  3. Descargá el texto — la transcripción llega con marcas de tiempo. Exportá como TXT, DOCX, PDF, SRT o VTT.

Un MP3 de 10 minutos suele estar listo en 30 a 90 segundos. Un episodio de pódcast de 1 hora, en 2 a 5 minutos.

Qué obtenés al transcribir el MP3

  • Texto completo con marcas de tiempo — cada bloque de texto está vinculado al momento exacto del audio, así podés verificar cualquier frase contra la grabación original.
  • Seis formatos de exportación — TXT para pegar donde sea, DOCX y PDF para documentos, SRT y VTT para subtítulos, JSON para procesamiento posterior. Todos disponibles también en el plan gratuito.
  • Editor en el navegador — corregí nombres propios o jerga técnica antes de exportar, escuchando el audio en el punto exacto de cada frase.

Lo que no obtenés (todavía): etiquetas automáticas de hablante. Si tu archivo es una entrevista con varias voces y necesitás que cada intervención salga etiquetada por persona, mirá la sección Cuándo otra herramienta es mejor.

¿Es gratis pasar un MP3 a texto?

Sí, con un límite que preferimos decirte antes de que subas el archivo: los primeros 60 minutos son gratis de por vida — cupo único, no un saldo mensual que se renueva. No pedimos tarjeta de crédito y no hay paywall escondido detrás del botón de descarga: todos los formatos de exportación funcionan desde el minuto uno.

Después del cupo gratuito, el plan Pro cuesta 10 USD al mes por 1.200 minutos (unos 0,008 USD por minuto). Los detalles están en la página de precios.

Cómo se comparan los planes gratuitos

HerramientaPlan gratuitoLímite por archivoExportación gratuita
DeluxeScribe60 min de por vidaSin límite dentro del cupoSRT, VTT, TXT, DOCX, PDF, JSON
TurboScribe90 min/día (3 × 30 min)30 minSRT, VTT, TXT, DOCX, PDF
Otter300 min/mesSolo TXT y MP3
Notta120 min/mes3 min por grabaciónSolo TXT
Whisper (local)Ilimitado (open source)Sin límiteTXT, SRT, VTT (CLI)

Números de competidores verificados el 16 de agosto de 2026 en los sitios oficiales de cada proveedor. Planes y límites cambian sin previo aviso.

Si tu volumen es alto y recurrente, el free tier de TurboScribe (90 minutos diarios) es más generoso que el nuestro — lo decimos sin vueltas. Nuestro cupo es único pero sin restricción por archivo, y ningún formato de exportación está bloqueado.

Precisión real en español

En audio limpio con un solo hablante, Whisper large-v3 — el modelo detrás de DeluxeScribe — logra una tasa de error de palabras (WER) por debajo del 5% en el benchmark FLEURS Spanish de Google. Eso está cerca del nivel de un transcriptor humano atento. Para entender cómo se mide, mirá nuestra guía sobre la precisión de Whisper.

La precisión que vas a ver en la práctica depende del audio de origen, no del formato MP3:

  • Grabación limpia, un hablante (pódcast, nota de voz cerca del micrófono): excelente — errores ocasionales en nombres propios y jerga muy específica.
  • Reunión de Zoom/Meet con auriculares: buena — algunos errores cuando dos personas hablan a la vez.
  • Audio telefónico, mucho ruido de fondo o voces superpuestas: la precisión baja de forma notable. Revisá el resultado contra el audio antes de citar literalmente.

El modelo maneja bien tanto el “tú” peninsular como el voseo rioplatense, y las variantes estándar de México, Colombia, Chile, Perú y el Caribe. Los acentos muy marcados (rural andino, chilango profundo, andaluz cerrado) generan más errores en palabras específicas.

¿Importa el bitrate del MP3? (Casi nunca)

No hace falta re-exportar tu MP3 a mayor calidad antes de subirlo. Un MP3 limpio a 128 kbps se transcribe igual de bien que uno a 320 kbps o que un WAV sin comprimir: el modelo trabaja sobre el habla, y la compresión MP3 estándar no elimina la información que necesita.

La excepción: audios comprimidos por debajo de 64 kbps o re-comprimidos varias veces (por ejemplo, un audio reenviado muchas veces entre apps de mensajería) pueden traer artefactos audibles — y la transcripción hereda esos errores. En ese caso el problema es la grabación, no el formato: ninguna herramienta lo corrige. Grabá siempre en la mejor calidad posible desde el origen.

¿Pasar, convertir o transcribir un MP3?

Según el país se dice distinto: en Argentina, Uruguay y Chile lo natural es “pasar mp3 a texto”; en México, Colombia y Perú se usa más “convertir”; en España, “transcribir”. Las tres búsquedas llegan al mismo lugar: obtener por escrito lo que se dice dentro del audio.

Ojo con “convertir”:también puede significar cambiar el formato del archivo (MP3 → WAV). Eso no es lo que hacemos — DeluxeScribe hace reconocimiento de habla (ASR), no conversión de formato. Si lo que necesitás es cambiar un MP3 a otro formato de audio, buscá “conversor de audio”; si querés el texto de lo que se dice, estás en el lugar correcto.

MP3 a subtítulos (SRT o VTT)

La misma transcripción se exporta directamente como SRT o VTT con marcas de tiempo listas para YouTube, Vimeo, Premiere Pro, DaVinci Resolve o cualquier player web — sin pasos intermedios y también en el plan gratuito. Si tu punto de partida es un video y no un MP3, o querés afinar la segmentación de los subtítulos, la guía del generador de SRT (en inglés) cubre ese flujo completo.

Probá con tu propio MP3

60 minutos gratis, sin tarjeta. Todos los formatos de exportación desbloqueados desde el inicio.

Privacidad y RGPD

Tu MP3 se transmite cifrado con TLS y se almacena cifrado en AWS UE (región Fráncfort) — no en Estados Unidos. Audio y transcripción se borran automáticamente a los 30 días, y podés eliminarlos manualmente en cualquier momento desde el panel. No usamos tu audio para entrenar modelos de IA.

Lo que no ofrecemos: un DPA (contrato de tratamiento de datos según el artículo 28 del RGPD). Si tu organización — hospital, estudio jurídico, empresa con datos regulados — exige un DPA firmado, DeluxeScribe todavía no es la herramienta adecuada: usá un proveedor con DPA o instalá Whisper localmente. Para uso individual, freelance o empresas cuya política interna cubre servicios cloud estándar, el almacenamiento en la UE con borrado automático cubre la mayoría de los casos.

Cuándo otra herramienta es mejor

DeluxeScribe no es la respuesta correcta para todos los casos. Antes de gastar tu cupo gratuito:

  • Etiquetas de hablante automáticas (entrevistas con varias voces donde cada intervención debe salir etiquetada): Notta, TurboScribe u Otter las incluyen; DeluxeScribe todavía no tiene diarización.
  • Volumen alto, gratis y para siempre: Whisper large-v3 ejecutado en tu propia máquina (CLI de OpenAI o whisper.cpp) produce los mismos resultados de modelo, sin costo y offline — a cambio de instalación técnica y una GPU decente o mucha paciencia en CPU.
  • Bot que se une a la reunión en vivo y genera minutas automáticas: Otter, Fireflies o tl;dv. Lo nuestro es el archivo ya grabado.
  • DPA firmado / cumplimiento formal RGPD: herramientas enterprise con contrato de tratamiento — no DeluxeScribe todavía.

Nuestro punto fuerte es concreto: Whisper large-v3 desde el navegador, datos en la UE con borrado automático, y un free tier honesto — 60 minutos de por vida, no un mes con truco.

¿Tu archivo no es MP3?

No hace falta convertirlo — DeluxeScribe procesa todos estos formatos directamente:

  • M4A (notas de voz de iPhone) y WAV (grabaciones de estudio): funcionan igual que MP3, mismos precios y exportaciones. Guías en inglés: M4A to text y WAV to text.
  • OPUS (audios de WhatsApp): subilos tal cual, sin conversión previa.
  • MP4, MOV y otros videos: se extrae y transcribe solo el audio. Guía en inglés: MP4 to text.
  • Para el panorama completo de formatos y usos en español, mirá la guía general de transcribir audio a texto.

Cómo se verificó esta página

Las afirmaciones de precisión se basan en el paper original de Whisper (Radford et al., 2022) y en el benchmark FLEURS de Google. Los números de free tiers de competidores (Otter, Notta, TurboScribe) provienen de nuestra última verificación en los sitios oficiales de cada proveedor. Los planes y límites cambian sin previo aviso — si notás información desactualizada, avisá a nuestro equipo.

Preguntas frecuentes

¿Cómo convertir un MP3 a texto?

Subí el archivo MP3 a DeluxeScribe, elegí español como idioma, y en segundos obtenés el texto con marcas de tiempo. Un MP3 de 10 minutos suele estar listo en 30 a 90 segundos. Exportá como TXT, DOCX, PDF, SRT, VTT o JSON. Los primeros 60 minutos son gratis, sin tarjeta de crédito. Funciona con cualquier bitrate (128, 192, 320 kbps).

¿Es gratis pasar MP3 a texto?

Sí, con un límite claro: los primeros 60 minutos son gratis de por vida — cupo único, no se renueva mes a mes, y todos los formatos de exportación están desbloqueados desde el inicio. Después, el plan Pro cuesta 10 USD al mes por 1.200 minutos. Whisper de OpenAI ejecutado en tu propia máquina es gratis para siempre, pero requiere instalación local y conocimientos técnicos.

¿Qué precisión tiene la transcripción de MP3 en español?

En audio limpio con un solo hablante, Whisper large-v3 (el modelo detrás de DeluxeScribe) logra una tasa de error de palabras (WER) por debajo del 5% en el benchmark FLEURS Spanish de Google. En grabaciones de Zoom con auriculares: buena, con algunos errores. En audio telefónico o con mucho ruido de fondo, la precisión baja de forma notable. El bitrate del MP3 casi no influye — la calidad de la grabación original sí.

¿Funciona con audios de WhatsApp?

Sí. WhatsApp usa el formato .opus para las notas de voz (a veces .m4a en iPhone), y DeluxeScribe los procesa directamente — no hace falta convertirlos a MP3 primero. Si ya convertiste el audio a MP3 con otra herramienta, también funciona igual. Exportá la nota desde WhatsApp con 'Compartir' y subila tal cual.

¿Cuánto tarda en transcribir un MP3?

Un MP3 de 10 minutos suele estar listo en 30 a 90 segundos. Un episodio de pódcast de 1 hora, en 2 a 5 minutos. El tamaño del archivo no cambia el tiempo de forma significativa — lo que cuenta es la duración del audio.

¿Dónde se guarda mi archivo MP3?

Se transmite cifrado con TLS y se almacena cifrado en AWS UE (región Fráncfort) — no en Estados Unidos. Audio y transcripción se borran automáticamente a los 30 días, y podés eliminarlos manualmente en cualquier momento desde el panel. No usamos tu audio para entrenar modelos de IA.