Transcrever Áudio em Texto

Grátis, com Whisper large-v3 e compatível com áudios do WhatsApp direto do celular.

O DeluxeScribe transcreve áudio em texto português usando Whisper large-v3 — MP3, M4A, WAV, OPUS (áudios do WhatsApp), OGG e mais. Com marcações de tempo e exportação em SRT, VTT, TXT, DOCX ou PDF. Áudio armazenado na AWS UE (Frankfurt) e apagado após 30 dias. 60 minutos grátis vitalícios, sem cartão de crédito.
  • 60 minutos grátis vitalícios
  • Sem cartão de crédito
  • 100+ idiomas
  • Dados na UE (Frankfurt), apagados em 30 dias

Última verificação: 16 de agosto de 2026

Como transcrever áudio em texto em 3 passos

Resumo rápido: O DeluxeScribe transcreve áudio para texto em português usando Whisper large-v3. Suporta MP3, M4A, WAV, OPUS (WhatsApp), OGG e mais. 60 minutos grátis vitalícios — sem cobrança mensal escondida. Áudio armazenado na AWS UE (Frankfurt) e apagado após 30 dias.

  1. Envie seu arquivo — arraste e solte MP3, WAV, M4A, MP4 ou qualquer formato comum. Também dá para colar a URL de um áudio online.
  2. Escolha portuguêscomo idioma (ou deixe “detecção automática” se o áudio tem vários idiomas).
  3. Baixe o texto — em segundos você tem a transcrição com marcações de tempo. Exporte em TXT, DOCX, PDF, SRT ou VTT.

Não precisa instalar nada. Tudo roda no navegador.

Transcrever áudio do WhatsApp em texto

Áudios do WhatsApp são o caso de uso mais comum de transcrição em português brasileiro. Um áudio de 5 minutos da família, uma mensagem longa do trabalho, ou uma nota que você mesmo gravou dirigindo — tudo pode virar texto em segundos.

Como exportar um áudio do WhatsApp (iPhone)

  1. Abra a conversa do WhatsApp com o áudio.
  2. Segure o áudio e toque em Encaminhar.
  3. Escolha Compartilhar e depois Salvar em Arquivos.
  4. Envie o arquivo .opus ou .m4a para o DeluxeScribe.

Como exportar um áudio do WhatsApp (Android)

  1. Segure o áudio no WhatsApp.
  2. Toque no ícone de Compartilhar (três pontos → Compartilhar).
  3. Escolha salvar em uma pasta ou aplicativo de arquivos.
  4. Envie o arquivo para o DeluxeScribe.

DeluxeScribe vs a transcrição nativa do WhatsApp

A Meta lançou transcrição integrada no WhatsApp em 2024. Ela funciona bem para áudios curtos e limpos, mas fica irregular com áudios longos, ambientes barulhentos, gírias regionais ou vários falantes. O DeluxeScribe entrega maior precisão em áudios longos ou complexos e exporta em SRT, VTT, TXT, DOCX, PDF — algo que a transcrição nativa não faz.

Áudios longos de família, amigos e trabalho

No Brasil, áudios de 3-8 minutos são a norma em grupos de família e de trabalho no WhatsApp. Escutar 10 áudios de 5 minutos leva quase uma hora; ler leva dois. O DeluxeScribe processa áudios de qualquer tamanho sem cortes, então você pode ler uma sequência inteira do grupo da sua mãe / dos amigos / da equipe enquanto faz outra coisa.

WhatsApp Business: áudios de clientes e fornecedores

Muito negócio no Brasil funciona pelo WhatsApp Business, onde clientes e fornecedores mandam pedidos, orçamentos ou instruções por áudio. Transcrever esses áudios permite: buscar por texto o que um cliente disse há 3 meses, copiar o pedido literal para um email de confirmação, ou arquivar a conversa como registro contratual. O formato .opus que o WhatsApp usa para as notas de voz é processado direto — não precisa converter para MP3 antes.

Uso profissional: reuniões, entrevistas, pesquisa

Reuniões (Zoom, Meet, Teams)

Grave a reunião com a função nativa do Zoom, Google Meet ou Microsoft Teams (todas exportam MP4 ou M4A). Envie o arquivo ao DeluxeScribe após a chamada. Uma reunião de 1 hora sai transcrita em 2-5 minutos, com marcações de tempo. Compartilhe o resumo com quem não pôde participar, ou use o texto para gerar ata na sua ferramenta preferida (Notion, Google Docs, Word). O DeluxeScribe não gera ata formatada automaticamente — se você precisa disso, Notta ou Fireflies encaixam melhor.

Entrevistas jornalísticas

Para jornalismo, a transcrição literal com marcações de tempo permite citar palavras exatas e voltar ao momento preciso do áudio para verificar tom e contexto. Grave com um app decente (Gravador do iPhone, Gravador do Android ou um gravador dedicado) e envie o arquivo. Os .m4a do iPhone são processados direto. Para matérias onde você vai citar literalmente, sempre revise a transcrição palavra por palavra contra o áudio original antes de publicar — nenhuma transcrição automática é 100% exata, especialmente em nomes próprios, sotaques regionais e jargão técnico.

Pesquisa qualitativa (acadêmica)

Teses, papers e projetos de pesquisa qualitativa exigem transcrição precisa de entrevistas e grupos focais. O DeluxeScribe acelera o primeiro passo (obter o texto), mas a análise qualitativa exige revisão manual — sobretudo para códigos temáticos e nuances de significado que o modelo não marca automaticamente. Para gravações sensíveis (dados pessoais de participantes, temas médicos regulados), leia a seção Privacidade e LGPD antes de enviar. Se o seu comitê de ética exige AVV assinado, esta não é a ferramenta certa.

Podcasts e conteúdo em áudio

Publicar a transcrição de um episódio junto do áudio melhora SEO (o Google indexa o texto), acessibilidade (usuários surdos, pessoas que preferem ler) e descobribilidade interna (dá para buscar em qual episódio você falou de um assunto). Exporte em SRT se quiser legendas sincronizadas para o YouTube ou um player web.

Formatos de áudio aceitos

MP3, WAV, M4A, MP4, OGG, OPUS, FLAC, AAC e WebM. Arquivos de vídeo (MP4, MOV, AVI) funcionam — o áudio é extraído e transcrito automaticamente.

  • MP3 — formato mais comum para gravações e podcasts
  • M4A — formato nativo de gravações do iPhone
  • OPUS — formato usado pelo WhatsApp em áudios
  • WAV — áudio sem compressão, máxima qualidade
  • MP4/MOV — vídeo com áudio (só o áudio é transcrito)

Transcrever áudio longo — podcasts, aulas, entrevistas

Arquivos longos são a força do DeluxeScribe. No plano Pro (US$ 10/mês) cada arquivo pode ter até 4 horas ou 2 GB; no Premium (US$ 29/mês), até 10 horas ou 5 GB. Um episódio de podcast de 1 hora normalmente processa em 2 a 5 minutos. Uma aula de 2 horas, entre 5 e 10 minutos.

Dicas para áudios longos: se o áudio tem mais de uma pessoa falando, prefira gravação com um microfone por pessoa (ou pelo menos os falantes bem separados). O modelo transcreve mesmo com áudio de ambiente, mas a precisão cai quando há sobreposição de vozes ou muito ruído de fundo. Para entrevistas de pesquisa qualitativa, gravar em WAV mantém a qualidade máxima.

Como converter MP3, WAV e M4A em texto

MP3 para texto

MP3 é o formato mais comum para gravações. Funciona com qualquer bitrate — 128 kbps para gravações leves, 192 ou 256 kbps para podcasts, 320 kbps para qualidade máxima. O DeluxeScribe processa o arquivo direto, sem precisar converter antes. A precisão depende da qualidade do áudio original, não do bitrate — um MP3 limpo a 128 kbps transcreve tão bem quanto um WAV.

Uso comum: episódios de podcast, entrevistas gravadas no celular, áudios baixados do YouTube ou Spotify, gravações de rádio, mensagens de voz exportadas.

WAV para texto

WAV é áudio sem compressão — a maior qualidade possível. Usado em gravações profissionais de estúdio, podcasts com vários microfones, sessões de pesquisa qualitativa onde cada palavra importa. Os arquivos são grandes (cerca de 10 MB por minuto), mas o DeluxeScribe processa na mesma velocidade que um MP3.

M4A para texto

M4A é o formato nativo das gravações do iPhone (Voice Memos, chamadas gravadas com apps compatíveis) e das gravações do QuickTime no Mac. Também é usado na exportação de áudio do iMovie ou GarageBand. É transcrito igual ao MP3, sem conversão prévia.

É grátis transcrever esses formatos?

Sim — os 60 minutos grátis valem para qualquer formato. Um MP3 de 10 minutos consome 10 minutos do saldo, igual a um WAV de 10 minutos. A contagem é feita pela duração do áudio, não pelo tamanho do arquivo.

Precisão em português brasileiro

Em áudio limpo com um falante, o Whisper large-v3 — modelo por trás do DeluxeScribe — alcança WER (taxa de erro de palavras) abaixo de 5% no benchmark FLEURS Portuguese do Google. Isso é próximo do nível de um transcritor humano atento. Para entender melhor como o Whisper mede precisão, veja nosso guia sobre a precisão do Whisper.

Sotaques regionais

Os modelos atuais foram treinados com áudio de várias regiões do Brasil. Sotaques paulista, carioca, mineiro, nordestino e gaúcho funcionam bem. Sotaques mais fechados ou regionalismos específicos podem gerar mais erros pontuais, mas a compreensão geral se mantém alta. Gírias do dia a dia como “beleza”, “pô”, “bicho” e “véi” são reconhecidas corretamente.

Português brasileiro e português europeu

O Whisper large-v3 trata PT-BR e PT-PT no mesmo modelo. O volume de treinamento em PT-BR é maior, então transcrições em conteúdo brasileiro tendem a ser um pouco mais precisas. Gravações em português europeu também funcionam bem — vocabulário, conjugações e o “tu” vs “você” são reconhecidos corretamente.

Quando a precisão sobe

  • Ambiente silencioso (sem música de fundo, TV ligada, ar-condicionado barulhento)
  • Falante próximo do microfone (com celular, a menos de 30 cm da boca)
  • Um único falante, ou dois com turnos claros (sem sobreposição)
  • Fala em velocidade normal (evite falar muito rápido ou sussurrando)
  • Vocabulário padrão (palavras do uso cotidiano e profissional comum)

Quando a precisão cai

  • Sotaques muito fechados ou regionalismos específicos
  • Nomes próprios pouco comuns, sobrenomes, marcas locais
  • Jargão técnico muito específico que o modelo não viu no treinamento
  • Sobreposição de vozes (várias pessoas falando ao mesmo tempo)
  • Música ou ruído de fundo forte
  • Áudios muito comprimidos (abaixo de 64 kbps) ou com eco

Comparação com Whisper aberto e outras opções

O DeluxeScribe usa modelos da família Whisper — a mesma tecnologia por trás do TurboScribe, HappyScribe e Notta. A diferença entre serviços está na velocidade, editor visual, e formatos de exportação liberados no plano grátis. Whisper large-v3 rodando localmente (com a CLI da OpenAI ou whisper.cpp) produz exatamente o mesmo resultado que o DeluxeScribe em modelo — mas exige uma máquina com GPU decente ou muita paciência em CPU, e você não tem interface web nem exportação em um clique.

Privacidade e LGPD

Áudios enviados ao DeluxeScribe são transmitidos com criptografia TLS e armazenados criptografados na AWS UE (região Frankfurt) — não nos Estados Unidos. Áudio e transcrições são apagados automaticamente após 30 dias. Você também pode excluir manualmente a qualquer momento pelo painel. Não usamos seu áudio para treinar modelos de IA.

AVV/DPA: atualmente não oferecemos Acordo de Processamento de Dados formal para LGPD ou GDPR. Se sua organização — hospital, escritório de advocacia, empresa com dados sensíveis regulados — exige contrato específico de processamento, o DeluxeScribe ainda não é a ferramenta certa. Nesses casos, considere um provedor com AVV/DPA ou instale o Whisper localmente (código aberto, gratuito, roda offline).

Para uso individual, freelance, ou empresas onde a política interna de privacidade cobre serviços cloud padrão, o modelo de armazenamento na UE + apagamento automático atende à maioria dos casos.

Teste com seu próprio áudio

60 minutos grátis, sem cartão. Todos os formatos de exportação liberados desde o início.

DeluxeScribe frente a alternativas para português

O DeluxeScribe não ganha em todas as colunas — apresentamos a comparação honesta para você escolher a ferramenta certa para o seu caso.

FerramentaPlano grátisLocal dos dadosExportaçãoIdentificação de falantesWhatsApp
DeluxeScribe60 min vitalíciosUE (Frankfurt)SRT, VTT, TXT, DOCX, PDFNãoSim
Otter300 min/mêsEUAApenas TXT e MP3SimSim (com exportar)
Notta120 min/mês, 3 min/gravaçãoEUA (estimado)Apenas TXTSimSim
TurboScribe90 min/dia (3 × 30 min)EUASRT, VTT, TXT, DOCX, PDFSimSim
Whisper (local)Ilimitado (open source)Sua própria máquinaTXT, SRT, VTT (CLI)Com pyannote separadoSim, se souber instalar
Google Docs vozIlimitado (tempo real)Google CloudApenas TXTNãoNão

Números verificados em 16 de agosto de 2026 nos sites oficiais de cada fornecedor. Planos e limites mudam sem aviso.

Qual escolher para o seu caso

  • Dados na UE (empresas europeias ou BR com exigência de armazenamento fora dos EUA): DeluxeScribe (Frankfurt).
  • Volume grátis recorrente máximo: Otter (300 min/mês) ou TurboScribe (2.700 min/mês efetivos se usar todo dia).
  • Reunião em tempo real com bot que entra na chamada: Otter, Fireflies, tl;dv.
  • Identificação automática de falantes: Notta, TurboScribe, Otter (DeluxeScribe não tem diarização ainda).
  • Uso 100% offline / privado: Whisper local na sua própria máquina.
  • Ditado ao vivo enquanto você digita: Google Docs voz (integrado no editor).
  • Todos os formatos de exportação desde o minuto 1: DeluxeScribe ou TurboScribe.
  • AVV/DPA assinado / compliance LGPD formal: ferramentas enterprise (DeluxeScribe ainda não).

Posicionamento honesto do DeluxeScribe

O DeluxeScribe está apostado em “Whisper large-v3 direto do navegador, dados na UE, sem pegadinha de mensalidade escondida”. Se você precisa de identificação automática de falantes, ata formatada ou bot de reunião ao vivo, outras ferramentas são melhores. Nosso ponto forte é: Whisper direto e sem enfeite, dados na UE com apagamento automático em 30 dias, e um plano grátis honesto (60 minutos vitalícios, não um mês com truque).

Como esta página foi verificada

Todas as reivindicações de precisão são baseadas no paper original do Whisper (Radford et al., 2022) e no benchmark FLEURS do Google. Números de planos gratuitos de concorrentes (Otter, Notta, TurboScribe) foram verificados em 16 de agosto de 2026 nos sites oficiais de cada fornecedor. Planos e limites mudam sem aviso — se você notar informação desatualizada, avise nosso time.

Perguntas frequentes

Como transcrever áudio em texto?

Envie seu arquivo de áudio (MP3, WAV, M4A, OGG, OPUS, entre outros) para o DeluxeScribe, escolha português como idioma, e em segundos você recebe o texto com marcações de tempo. Também dá para enviar áudios do WhatsApp direto. Os primeiros 60 minutos são grátis para sempre — cota única, não renova mensalmente.

Como transformar áudio do WhatsApp em texto?

No WhatsApp, segure o áudio, toque em 'Encaminhar' e depois em 'Compartilhar' para salvar o arquivo (formato .opus ou .m4a). Depois envie o arquivo para o DeluxeScribe. Funciona igual em iPhone e Android. Muito mais rápido ler um áudio longo do que escutar em velocidade dupla.

A transcrição nativa do WhatsApp é boa?

A transcrição integrada do WhatsApp (lançada globalmente pela Meta) funciona para áudios curtos e claros, mas fica inconsistente com áudios longos, ambientes barulhentos, ou múltiplos falantes. Para áudios de reuniões, entrevistas, ou conversas mais complexas, ferramentas dedicadas como DeluxeScribe entregam maior precisão e permitem exportar o texto em vários formatos.

Qual o melhor app para transcrever áudio grátis em português?

Depende do uso: para áudios curtos ocasionais, Otter (300 min/mês) ou Notta (120 min/mês, máximo 3 min por gravação) atendem. Para arquivos maiores ou áudios do WhatsApp, DeluxeScribe (60 minutos grátis totais, exportação completa) ou TurboScribe (90 min/dia, 30 min por arquivo) são melhores. O Whisper da OpenAI é grátis para sempre, mas exige instalação local.

A transcrição funciona bem em português brasileiro?

Sim. Whisper large-v3 (modelo por trás do DeluxeScribe) foi treinado com áudio em português de várias regiões e alcança WER (taxa de erro de palavras) abaixo de 5% no benchmark FLEURS Portuguese do Google. Sotaques paulista, carioca, mineiro, nordestino e gaúcho funcionam bem. Sotaques mais fechados ou regionalismos específicos podem gerar mais erros pontuais, mas a compreensão geral permanece alta.

Quanto tempo demora a transcrição?

Um arquivo de 10 minutos fica pronto em 30 a 90 segundos, dependendo da qualidade do áudio e da carga do servidor. Arquivos de 1 hora processam em 2 a 5 minutos. Não tem fila de espera em horário normal.

Quais formatos de áudio são aceitos?

MP3, WAV, M4A, MP4, OGG, OPUS, FLAC, AAC e WebM. Arquivos de vídeo (MP4, MOV, AVI) também funcionam — o áudio é extraído e transcrito automaticamente. No plano Pro cada arquivo pode ter até 4 horas ou 2 GB; no Premium, até 10 horas ou 5 GB.

Onde meu áudio fica armazenado?

Os arquivos são transmitidos com criptografia TLS e armazenados criptografados na AWS UE (região Frankfurt). Áudio e transcrições são apagados automaticamente após 30 dias — você também pode excluir manualmente a qualquer momento pelo painel. Não usamos seu áudio para treinar modelos de IA.

Vocês oferecem AVV/DPA (contrato LGPD/GDPR)?

Não. Atualmente não oferecemos AVV (Acordo de Processamento de Dados) nem DPA formal. Se sua organização — como hospitais, escritórios de advocacia, ou empresas com dados sensíveis regulados — exige um contrato específico, use outra ferramenta ou instale Whisper localmente. Para uso individual e profissional geral, nossa política padrão de privacidade cobre a maioria dos casos.

Dá para exportar em legendas SRT ou VTT?

Sim. Todos os formatos de exportação (SRT, VTT, TXT, DOCX, PDF, JSON) estão liberados no plano gratuito. As legendas SRT e VTT vêm com marcações de tempo prontas para YouTube, Vimeo, Premiere Pro, DaVinci Resolve ou qualquer editor de vídeo.

Como converter MP3 em texto?

Envie o arquivo MP3 para o DeluxeScribe, escolha português como idioma, e em segundos você recebe o texto. Funciona com MP3 em qualquer bitrate (128 kbps, 192 kbps, 320 kbps). A precisão depende da qualidade do áudio original, não do formato — um MP3 limpo a 128 kbps transcreve tão bem quanto um WAV.

Dá para transcrever arquivos WAV e M4A?

Sim. WAV é o formato sem compressão com a máxima qualidade — ideal para gravações profissionais de estúdio ou podcast. M4A é o formato nativo dos áudios do iPhone e das gravações do QuickTime no Mac. Os dois funcionam igual ao MP3 no DeluxeScribe, com a mesma precisão e as mesmas opções de exportação.

É grátis converter MP3 em texto?

Sim, os primeiros 60 minutos são grátis para sempre — cota única, não renova mensalmente. Um episódio de podcast de 30 minutos consome 30 minutos do saldo. Depois disso, o plano Pro custa US$ 10/mês por 1.200 minutos (cerca de US$ 0,008 por minuto).

Suporta português de Portugal (PT-PT) e brasileiro (PT-BR)?

Sim. O Whisper large-v3 lida com PT-BR e PT-PT no mesmo modelo. O volume de treinamento em PT-BR é maior, então a transcrição tende a ser um pouco mais precisa em conteúdo brasileiro, mas gravações em português europeu também funcionam bem.