Transcrever Áudio em Texto
Grátis, com Whisper large-v3 e compatível com áudios do WhatsApp direto do celular.
- 60 minutos grátis vitalícios
- Sem cartão de crédito
- 100+ idiomas
- Dados na UE (Frankfurt), apagados em 30 dias
Última verificação: 16 de agosto de 2026
Como transcrever áudio em texto em 3 passos
Resumo rápido: O DeluxeScribe transcreve áudio para texto em português usando Whisper large-v3. Suporta MP3, M4A, WAV, OPUS (WhatsApp), OGG e mais. 60 minutos grátis vitalícios — sem cobrança mensal escondida. Áudio armazenado na AWS UE (Frankfurt) e apagado após 30 dias.
- Envie seu arquivo — arraste e solte MP3, WAV, M4A, MP4 ou qualquer formato comum. Também dá para colar a URL de um áudio online.
- Escolha portuguêscomo idioma (ou deixe “detecção automática” se o áudio tem vários idiomas).
- Baixe o texto — em segundos você tem a transcrição com marcações de tempo. Exporte em TXT, DOCX, PDF, SRT ou VTT.
Não precisa instalar nada. Tudo roda no navegador.
Transcrever áudio do WhatsApp em texto
Áudios do WhatsApp são o caso de uso mais comum de transcrição em português brasileiro. Um áudio de 5 minutos da família, uma mensagem longa do trabalho, ou uma nota que você mesmo gravou dirigindo — tudo pode virar texto em segundos.
Como exportar um áudio do WhatsApp (iPhone)
- Abra a conversa do WhatsApp com o áudio.
- Segure o áudio e toque em Encaminhar.
- Escolha Compartilhar e depois Salvar em Arquivos.
- Envie o arquivo .opus ou .m4a para o DeluxeScribe.
Como exportar um áudio do WhatsApp (Android)
- Segure o áudio no WhatsApp.
- Toque no ícone de Compartilhar (três pontos → Compartilhar).
- Escolha salvar em uma pasta ou aplicativo de arquivos.
- Envie o arquivo para o DeluxeScribe.
DeluxeScribe vs a transcrição nativa do WhatsApp
A Meta lançou transcrição integrada no WhatsApp em 2024. Ela funciona bem para áudios curtos e limpos, mas fica irregular com áudios longos, ambientes barulhentos, gírias regionais ou vários falantes. O DeluxeScribe entrega maior precisão em áudios longos ou complexos e exporta em SRT, VTT, TXT, DOCX, PDF — algo que a transcrição nativa não faz.
Áudios longos de família, amigos e trabalho
No Brasil, áudios de 3-8 minutos são a norma em grupos de família e de trabalho no WhatsApp. Escutar 10 áudios de 5 minutos leva quase uma hora; ler leva dois. O DeluxeScribe processa áudios de qualquer tamanho sem cortes, então você pode ler uma sequência inteira do grupo da sua mãe / dos amigos / da equipe enquanto faz outra coisa.
WhatsApp Business: áudios de clientes e fornecedores
Muito negócio no Brasil funciona pelo WhatsApp Business, onde clientes e fornecedores mandam pedidos, orçamentos ou instruções por áudio. Transcrever esses áudios permite: buscar por texto o que um cliente disse há 3 meses, copiar o pedido literal para um email de confirmação, ou arquivar a conversa como registro contratual. O formato .opus que o WhatsApp usa para as notas de voz é processado direto — não precisa converter para MP3 antes.
Uso profissional: reuniões, entrevistas, pesquisa
Reuniões (Zoom, Meet, Teams)
Grave a reunião com a função nativa do Zoom, Google Meet ou Microsoft Teams (todas exportam MP4 ou M4A). Envie o arquivo ao DeluxeScribe após a chamada. Uma reunião de 1 hora sai transcrita em 2-5 minutos, com marcações de tempo. Compartilhe o resumo com quem não pôde participar, ou use o texto para gerar ata na sua ferramenta preferida (Notion, Google Docs, Word). O DeluxeScribe não gera ata formatada automaticamente — se você precisa disso, Notta ou Fireflies encaixam melhor.
Entrevistas jornalísticas
Para jornalismo, a transcrição literal com marcações de tempo permite citar palavras exatas e voltar ao momento preciso do áudio para verificar tom e contexto. Grave com um app decente (Gravador do iPhone, Gravador do Android ou um gravador dedicado) e envie o arquivo. Os .m4a do iPhone são processados direto. Para matérias onde você vai citar literalmente, sempre revise a transcrição palavra por palavra contra o áudio original antes de publicar — nenhuma transcrição automática é 100% exata, especialmente em nomes próprios, sotaques regionais e jargão técnico.
Pesquisa qualitativa (acadêmica)
Teses, papers e projetos de pesquisa qualitativa exigem transcrição precisa de entrevistas e grupos focais. O DeluxeScribe acelera o primeiro passo (obter o texto), mas a análise qualitativa exige revisão manual — sobretudo para códigos temáticos e nuances de significado que o modelo não marca automaticamente. Para gravações sensíveis (dados pessoais de participantes, temas médicos regulados), leia a seção Privacidade e LGPD antes de enviar. Se o seu comitê de ética exige AVV assinado, esta não é a ferramenta certa.
Podcasts e conteúdo em áudio
Publicar a transcrição de um episódio junto do áudio melhora SEO (o Google indexa o texto), acessibilidade (usuários surdos, pessoas que preferem ler) e descobribilidade interna (dá para buscar em qual episódio você falou de um assunto). Exporte em SRT se quiser legendas sincronizadas para o YouTube ou um player web.
Formatos de áudio aceitos
MP3, WAV, M4A, MP4, OGG, OPUS, FLAC, AAC e WebM. Arquivos de vídeo (MP4, MOV, AVI) funcionam — o áudio é extraído e transcrito automaticamente.
- MP3 — formato mais comum para gravações e podcasts
- M4A — formato nativo de gravações do iPhone
- OPUS — formato usado pelo WhatsApp em áudios
- WAV — áudio sem compressão, máxima qualidade
- MP4/MOV — vídeo com áudio (só o áudio é transcrito)
Transcrever áudio longo — podcasts, aulas, entrevistas
Arquivos longos são a força do DeluxeScribe. No plano Pro (US$ 10/mês) cada arquivo pode ter até 4 horas ou 2 GB; no Premium (US$ 29/mês), até 10 horas ou 5 GB. Um episódio de podcast de 1 hora normalmente processa em 2 a 5 minutos. Uma aula de 2 horas, entre 5 e 10 minutos.
Dicas para áudios longos: se o áudio tem mais de uma pessoa falando, prefira gravação com um microfone por pessoa (ou pelo menos os falantes bem separados). O modelo transcreve mesmo com áudio de ambiente, mas a precisão cai quando há sobreposição de vozes ou muito ruído de fundo. Para entrevistas de pesquisa qualitativa, gravar em WAV mantém a qualidade máxima.
Como converter MP3, WAV e M4A em texto
MP3 para texto
MP3 é o formato mais comum para gravações. Funciona com qualquer bitrate — 128 kbps para gravações leves, 192 ou 256 kbps para podcasts, 320 kbps para qualidade máxima. O DeluxeScribe processa o arquivo direto, sem precisar converter antes. A precisão depende da qualidade do áudio original, não do bitrate — um MP3 limpo a 128 kbps transcreve tão bem quanto um WAV.
Uso comum: episódios de podcast, entrevistas gravadas no celular, áudios baixados do YouTube ou Spotify, gravações de rádio, mensagens de voz exportadas.
WAV para texto
WAV é áudio sem compressão — a maior qualidade possível. Usado em gravações profissionais de estúdio, podcasts com vários microfones, sessões de pesquisa qualitativa onde cada palavra importa. Os arquivos são grandes (cerca de 10 MB por minuto), mas o DeluxeScribe processa na mesma velocidade que um MP3.
M4A para texto
M4A é o formato nativo das gravações do iPhone (Voice Memos, chamadas gravadas com apps compatíveis) e das gravações do QuickTime no Mac. Também é usado na exportação de áudio do iMovie ou GarageBand. É transcrito igual ao MP3, sem conversão prévia.
É grátis transcrever esses formatos?
Sim — os 60 minutos grátis valem para qualquer formato. Um MP3 de 10 minutos consome 10 minutos do saldo, igual a um WAV de 10 minutos. A contagem é feita pela duração do áudio, não pelo tamanho do arquivo.
Precisão em português brasileiro
Em áudio limpo com um falante, o Whisper large-v3 — modelo por trás do DeluxeScribe — alcança WER (taxa de erro de palavras) abaixo de 5% no benchmark FLEURS Portuguese do Google. Isso é próximo do nível de um transcritor humano atento. Para entender melhor como o Whisper mede precisão, veja nosso guia sobre a precisão do Whisper.
Sotaques regionais
Os modelos atuais foram treinados com áudio de várias regiões do Brasil. Sotaques paulista, carioca, mineiro, nordestino e gaúcho funcionam bem. Sotaques mais fechados ou regionalismos específicos podem gerar mais erros pontuais, mas a compreensão geral se mantém alta. Gírias do dia a dia como “beleza”, “pô”, “bicho” e “véi” são reconhecidas corretamente.
Português brasileiro e português europeu
O Whisper large-v3 trata PT-BR e PT-PT no mesmo modelo. O volume de treinamento em PT-BR é maior, então transcrições em conteúdo brasileiro tendem a ser um pouco mais precisas. Gravações em português europeu também funcionam bem — vocabulário, conjugações e o “tu” vs “você” são reconhecidos corretamente.
Quando a precisão sobe
- Ambiente silencioso (sem música de fundo, TV ligada, ar-condicionado barulhento)
- Falante próximo do microfone (com celular, a menos de 30 cm da boca)
- Um único falante, ou dois com turnos claros (sem sobreposição)
- Fala em velocidade normal (evite falar muito rápido ou sussurrando)
- Vocabulário padrão (palavras do uso cotidiano e profissional comum)
Quando a precisão cai
- Sotaques muito fechados ou regionalismos específicos
- Nomes próprios pouco comuns, sobrenomes, marcas locais
- Jargão técnico muito específico que o modelo não viu no treinamento
- Sobreposição de vozes (várias pessoas falando ao mesmo tempo)
- Música ou ruído de fundo forte
- Áudios muito comprimidos (abaixo de 64 kbps) ou com eco
Comparação com Whisper aberto e outras opções
O DeluxeScribe usa modelos da família Whisper — a mesma tecnologia por trás do TurboScribe, HappyScribe e Notta. A diferença entre serviços está na velocidade, editor visual, e formatos de exportação liberados no plano grátis. Whisper large-v3 rodando localmente (com a CLI da OpenAI ou whisper.cpp) produz exatamente o mesmo resultado que o DeluxeScribe em modelo — mas exige uma máquina com GPU decente ou muita paciência em CPU, e você não tem interface web nem exportação em um clique.
Privacidade e LGPD
Áudios enviados ao DeluxeScribe são transmitidos com criptografia TLS e armazenados criptografados na AWS UE (região Frankfurt) — não nos Estados Unidos. Áudio e transcrições são apagados automaticamente após 30 dias. Você também pode excluir manualmente a qualquer momento pelo painel. Não usamos seu áudio para treinar modelos de IA.
AVV/DPA: atualmente não oferecemos Acordo de Processamento de Dados formal para LGPD ou GDPR. Se sua organização — hospital, escritório de advocacia, empresa com dados sensíveis regulados — exige contrato específico de processamento, o DeluxeScribe ainda não é a ferramenta certa. Nesses casos, considere um provedor com AVV/DPA ou instale o Whisper localmente (código aberto, gratuito, roda offline).
Para uso individual, freelance, ou empresas onde a política interna de privacidade cobre serviços cloud padrão, o modelo de armazenamento na UE + apagamento automático atende à maioria dos casos.
Teste com seu próprio áudio
60 minutos grátis, sem cartão. Todos os formatos de exportação liberados desde o início.
DeluxeScribe frente a alternativas para português
O DeluxeScribe não ganha em todas as colunas — apresentamos a comparação honesta para você escolher a ferramenta certa para o seu caso.
| Ferramenta | Plano grátis | Local dos dados | Exportação | Identificação de falantes | |
|---|---|---|---|---|---|
| DeluxeScribe | 60 min vitalícios | UE (Frankfurt) | SRT, VTT, TXT, DOCX, PDF | Não | Sim |
| Otter | 300 min/mês | EUA | Apenas TXT e MP3 | Sim | Sim (com exportar) |
| Notta | 120 min/mês, 3 min/gravação | EUA (estimado) | Apenas TXT | Sim | Sim |
| TurboScribe | 90 min/dia (3 × 30 min) | EUA | SRT, VTT, TXT, DOCX, PDF | Sim | Sim |
| Whisper (local) | Ilimitado (open source) | Sua própria máquina | TXT, SRT, VTT (CLI) | Com pyannote separado | Sim, se souber instalar |
| Google Docs voz | Ilimitado (tempo real) | Google Cloud | Apenas TXT | Não | Não |
Números verificados em 16 de agosto de 2026 nos sites oficiais de cada fornecedor. Planos e limites mudam sem aviso.
Qual escolher para o seu caso
- Dados na UE (empresas europeias ou BR com exigência de armazenamento fora dos EUA): DeluxeScribe (Frankfurt).
- Volume grátis recorrente máximo: Otter (300 min/mês) ou TurboScribe (2.700 min/mês efetivos se usar todo dia).
- Reunião em tempo real com bot que entra na chamada: Otter, Fireflies, tl;dv.
- Identificação automática de falantes: Notta, TurboScribe, Otter (DeluxeScribe não tem diarização ainda).
- Uso 100% offline / privado: Whisper local na sua própria máquina.
- Ditado ao vivo enquanto você digita: Google Docs voz (integrado no editor).
- Todos os formatos de exportação desde o minuto 1: DeluxeScribe ou TurboScribe.
- AVV/DPA assinado / compliance LGPD formal: ferramentas enterprise (DeluxeScribe ainda não).
Posicionamento honesto do DeluxeScribe
O DeluxeScribe está apostado em “Whisper large-v3 direto do navegador, dados na UE, sem pegadinha de mensalidade escondida”. Se você precisa de identificação automática de falantes, ata formatada ou bot de reunião ao vivo, outras ferramentas são melhores. Nosso ponto forte é: Whisper direto e sem enfeite, dados na UE com apagamento automático em 30 dias, e um plano grátis honesto (60 minutos vitalícios, não um mês com truque).
Como esta página foi verificada
Guias relacionados
- Preços e planos60 minutos grátis, depois Pro (US$ 10/mês) ou Premium (US$ 29/mês).
- Precisão do Whisper (em inglês)Como se mede WER, benchmarks FLEURS e comparação por idioma.
- Audio to text (English)Mesma ferramenta, audiência em inglês, contexto adicional sobre alternativas ao Whisper.
- Best free transcription software (em inglês)Comparativo detalhado dos planos grátis de todas as ferramentas citadas acima.