Transcribir Audio a Texto en Español
Rápido, preciso y con soporte nativo para notas de voz de WhatsApp.
- ✓ 60 minutos gratis
- ✓ Sin tarjeta de crédito
- ✓ 99 idiomas
- ✓ Etiquetas de hablante
Última verificación: 20 de julio de 2026
Cómo transcribir audio a texto en 3 pasos
- Subí tu archivo — arrastrá y soltá MP3, WAV, M4A, MP4 o cualquier formato común. También podés pegar la URL de un audio online.
- Elegí españolcomo idioma (o dejá “auto-detectar” si el audio tiene varios idiomas).
- Descargá el texto — en segundos tenés la transcripción con etiquetas de hablante. Exportá como TXT, DOCX, PDF, SRT o VTT.
No hace falta instalar nada. Todo pasa en el navegador.
Transcribir notas de voz de WhatsApp a texto
Las notas de voz de WhatsApp son uno de los usos más frecuentes de transcripción en español. Un audio de 5 minutos de tu tía, un mensaje largo de un compañero de trabajo, o una nota que grabaste vos mismo mientras manejabas — todo se puede convertir en texto legible en segundos.
Desde iPhone
- Abrí el chat de WhatsApp donde está la nota de voz.
- Mantené presionada la nota y tocá Reenviar.
- Elegí Compartir y luego Guardar en Archivos.
- Subí el archivo .opus o .m4a a DeluxeScribe.
Desde Android
- Mantené presionada la nota de voz en WhatsApp.
- Tocá el ícono de Compartir (tres puntitos → Compartir).
- Elegí una app de archivos o guardá directamente en tu almacenamiento.
- Subí el archivo a DeluxeScribe.
Notas de voz largas (más de 5 minutos)
Para notas de más de 5 minutos, DeluxeScribe acepta hasta 30 minutos por archivo en el plan gratuito y hasta 4 horas en Pro. La transcripción con hablantes identificados funciona incluso si en la nota hay varias personas hablando de fondo.
Formatos de audio soportados
MP3, WAV, M4A, MP4, OGG, OPUS, FLAC, AAC y WebM. Los archivos de video (MP4, MOV, AVI) también funcionan — se extrae y transcribe el audio automáticamente.
- MP3 — el formato más común para grabaciones y podcasts
- M4A — el formato nativo de las notas de voz de iPhone
- OPUS — el formato que usa WhatsApp para notas de voz
- WAV — audio sin comprimir, máxima calidad para grabaciones profesionales
- MP4/MOV — video con audio (se transcribe solo el audio)
Precisión real en español
En audio limpio con un hablante, la precisión ronda entre el 95% y el 98% en español — cerca del nivel humano. Whisper large-v3 (el modelo detrás de la mayoría de los servicios actuales, incluido DeluxeScribe) logra una tasa de error de palabras (WER) por debajo del 5% en el benchmark FLEURS Spanish de Google.
Español neutro vs regional
Los modelos actuales fueron entrenados con audio de múltiples regiones. La precisión es buena en México, Argentina, Colombia, Chile, España, y las variantes del Caribe. Los acentos muy marcados (rural andino, chilango profundo, andaluz cerrado) pueden generar más errores en palabras específicas, pero la comprensión general se mantiene alta. Modismos y jerga regional se transcriben correctamente si son parte del vocabulario estándar.
Comparación con Whisper local y otras opciones
DeluxeScribe usa modelos de la familia Whisper optimizados — la misma tecnología de fondo que TurboScribe, HappyScribe y Notta. La diferencia entre servicios está en la velocidad, la identificación de hablantes, el editor y los formatos de exportación disponibles en el plan gratuito.
Casos de uso
- Entrevistas periodísticas — obtené el texto para citar textualmente en tus notas, con marcas de tiempo para volver a escuchar cualquier parte.
- Reuniones de Zoom, Meet o Teams — subí la grabación después de la llamada y compartí el resumen con quienes no pudieron asistir.
- Podcasts — publicá la transcripción junto al episodio para SEO y accesibilidad.
- Clases y conferencias — convertí una grabación de 2 horas en apuntes de texto en minutos.
- Notas de voz personales — WhatsApp, Telegram, Voice Memos del iPhone — todo se puede leer en lugar de escuchar.
DeluxeScribe frente a alternativas gratuitas
| Herramienta | Plan gratuito | Formatos de exportación | |
|---|---|---|---|
| DeluxeScribe | 60 min totales | SRT, VTT, TXT, DOCX, PDF | Sí |
| Otter | 300 min/mes | Solo TXT y MP3 | Sí (con exportar) |
| Notta | 120 min/mes, 3 min por grabación | Solo TXT | Sí |
| TurboScribe | 90 min/día (3 archivos × 30 min) | SRT, VTT, TXT, DOCX, PDF | Sí |
| Whisper (local) | Ilimitado (código abierto) | TXT, SRT, VTT (línea de comandos) | Sí, si sabés instalar |
Cuándo usar DeluxeScribe: cuando querés probar todos los formatos de exportación desde el primer minuto, o cuando necesitás una herramienta seria pero querés confirmar la calidad antes de pagar. Cuándo usar otra: si necesitás volumen gratuito recurrente sin pagar nunca, TurboScribe (para archivos) o Whisper local (para uso técnico) son mejores opciones.
Probá con tu propio audio
60 minutos gratis, sin tarjeta. Todos los formatos de exportación desbloqueados desde el inicio.
Preguntas frecuentes
¿Cómo transcribir audio a texto en español?
Subí tu archivo de audio (MP3, WAV, M4A, OGG u otro) a DeluxeScribe, elegí el idioma español, y en pocos segundos obtenés el texto con etiquetas de hablante y marcas de tiempo. También podés subir notas de voz de WhatsApp directamente. Los primeros 60 minutos son gratis, sin tarjeta de crédito.
¿Cómo transcribir una nota de voz de WhatsApp?
Desde WhatsApp, mantené presionada la nota de voz, tocá 'Compartir' y exportá el archivo (formato .opus o .m4a). Luego subilo a DeluxeScribe como cualquier otro audio. Funciona igual en iPhone y Android. Para notas largas de familia o compañeros de trabajo, es mucho más rápido leer el texto que escuchar el audio a doble velocidad.
¿Cuál es la mejor herramienta para transcribir audio en español gratis?
Depende de tu caso: para uso ocasional con notas cortas, Otter (300 min/mes) o Notta (120 min/mes, máximo 3 min por grabación) funcionan bien. Para archivos más largos o WhatsApp, DeluxeScribe (60 minutos gratis totales, exportación completa) o TurboScribe (90 min/día, 30 min por archivo) son mejores opciones. Whisper de OpenAI es gratis para siempre pero requiere instalación local.
¿Qué precisión tiene la transcripción automática en español?
En audio limpio con un solo hablante, los modelos actuales alcanzan entre 95% y 98% de precisión — cerca del nivel humano. En español, Whisper large-v3 logra una tasa de error de palabras (WER) por debajo del 5% en el benchmark FLEURS. La precisión baja con ruido de fondo, múltiples hablantes hablando al mismo tiempo, o acentos muy marcados que el modelo no vio durante el entrenamiento.
¿Funciona con acentos latinoamericanos?
Sí. Los modelos actuales fueron entrenados con audio de múltiples regiones — México, Argentina, Colombia, Chile, España y otras. La precisión es buena en cualquier variante estándar. Los acentos regionales muy marcados (rural andino, chilango profundo, andaluz cerrado) pueden generar más errores, pero para conversación estándar y contenido profesional funciona sin problemas en todo el mundo hispanohablante.
¿Cuánto tiempo tarda en transcribir?
Un archivo de 10 minutos suele estar listo en 30 a 90 segundos, dependiendo de la calidad del audio y la carga del servidor. Archivos de 1 hora se procesan típicamente en 2 a 5 minutos. No hay cola de espera en horas normales.
¿Qué formatos de audio acepta?
MP3, WAV, M4A, MP4, OGG, OPUS, FLAC, AAC y WebM. También podés subir archivos de video (MP4, MOV, AVI) y solo se transcribirá el audio. El tamaño máximo por archivo en el plan gratuito es 100 MB; los planes pagos aceptan hasta 5 GB.
¿Se pueden identificar los diferentes hablantes?
Sí. DeluxeScribe detecta automáticamente hasta 10 hablantes distintos y los etiqueta como 'Hablante 1', 'Hablante 2', etc. Podés renombrarlos manualmente después. Funciona mejor en grabaciones donde cada persona habla con claridad y no se superponen demasiado las voces.
¿Es seguro subir grabaciones privadas?
Los archivos se transmiten cifrados (TLS) y se almacenan cifrados en reposo. No usamos tu audio para entrenar modelos de IA. Podés eliminar cualquier transcripción cuando quieras desde tu panel. Para contenido médico protegido (PHI) o legal privilegiado, DeluxeScribe no está certificado — usá un proveedor con acuerdo de BAA firmado o instalá Whisper localmente.
¿Puedo exportar la transcripción en subtítulos SRT o VTT?
Sí. Todos los formatos de exportación (SRT, VTT, TXT, DOCX, PDF, JSON) están disponibles incluso en el plan gratuito. Los subtítulos SRT y VTT vienen con marcas de tiempo listas para usar en YouTube, Vimeo, Premiere Pro, DaVinci Resolve o cualquier editor de video.