Testado durante 35 dias, Junho de 2026, Plano Creator
Avaliação ElevenLabs 2026: Vale o Preço para Voz com IA?
Veredicto honesto sobre qualidade de voz, sistema de créditos, latência da API e se o score 4.5/5 no G2 ou o 3.0/5 no Trustpilot conta a história real.
Resumo
O ElevenLabs é a referência de mercado em texto-para-voz por IA: mais de 5.000 vozes, 70+ idiomas, API Flash com latência ~75ms. O plano Creator a $22/mês serve bem a maioria dos criadores de conteúdo. O sistema de créditos que debita gerações falhadas e não acumula créditos não utilizados, aliado ao score 3.0/5 no Trustpilot motivado por queixas de faturação, são os dois aspectos a compreender antes de subscrever.
O ElevenLabs é a referência de categoria em texto-para-voz por IA: mais de 5.000 vozes em 70+ idiomas, API Flash com latência ~75ms e um marketplace de vozes utilizado em mais de 8.000 aplicações. Após 35 dias no plano Creator ($22/mês) e 52 prompts de teste, o nosso veredicto é 7.8/10. Forte para narração profissional, podcasts e produção de audiobooks. O modelo de créditos, que debita gerações falhadas e não acumula créditos não utilizados, é o principal ponto de atrito e explica o score 3.0/5 no Trustpilot apesar de um produto de qualidade consistente.
- Qualidade de voz
- 9/10
- Cobertura de idiomas
- 8.5/10
- API e ferramentas de desenvolvimento
- 8.5/10
- Transparência de preços
- 5.5/10
- Precisão de clonagem de voz
- 7.5/10
- Biblioteca de mais de 5.000 vozes com cobertura de 70+ idiomas é a maior da categoria
- API Flash v2.5 com latência ~75ms permite pipelines de conversação em tempo real
- Narração de longa duração (30+ minutos) mantém consistência sem desvio entre capítulos
- Créditos debitados em gerações falhadas sem mecanismo de reembolso nos planos standard
- Créditos mensais não utilizados expiram no final do ciclo, penalizando padrões de uso variável
- Modelo Eleven v3 (Alpha) tem desempenho inferior em frases isoladas curtas com menos de 10 palavras
Plano gratuito: 10.000 caracteres/mês, sem cartão de crédito
Como testámos
- Tested for
- 35 days
- Plan paid
- Plano Creator ($22/mês)
- Version tested
- Eleven v3 (Alpha), Multilingual v2, Flash v2.5, Turbo v2.5, testados em junho de 2026
- Prompts run
- 52
- Test period
- 2026-05-26 → 2026-06-29
Executámos 52 prompts padronizados em sete categorias de teste no plano Creator ($22/mês) durante 35 dias. Para qualidade de TTS, usámos a mesma passagem de 15 frases nos modelos Multilingual v2, Eleven v3 (Alpha), Flash v2.5 e Turbo v2.5, comparando estabilidade de prosódia, precisão de pronúncia e tempo de entrega do primeiro chunk. A Clonagem Instantânea de Voz foi testada com duas amostras de áudio: uma gravação de estúdio de 3 minutos e outra de 6 minutos com ruído de sala ligeiro. Para dublagem, processámos um script em inglês de 800 palavras para espanhol, japonês e alemão. A latência da API foi medida registando deltas de timestamp em 20 chamadas Flash v2.5 e 10 chamadas Turbo v2.5 via Python SDK. A narração de longa duração foi testada com um capítulo de audiobook de 28.000 caracteres. Linhas curtas de NPC (12 clips, cada um com 3 a 8 palavras) foram testadas em Multilingual v2 e Eleven v3 (Alpha). Todos os screenshots são da nossa conta Creator. Não foram utilizadas versões de pré-produção nem acesso promocional.
Deve subscrever?
YES if you...
- Narradores de audiobooks a produzir entre 80 a 100 minutos de áudio por mês
- Equipas de podcast que precisam de versões multilingues do mesmo episódio
- Equipas de desenvolvimento a construir agentes de voz onde o ecossistema de API e o streaming de baixa latência são críticos
- Criadores de conteúdo que necessitam de TTS com licença comercial sem gerir talentos de voz
NO if you...
- Integrações de API sensíveis ao custo a processar mais de 500k caracteres/mês (Fish Audio é até 11x mais barato)
- Developers de áudio para jogos cujos diálogos de NPC consistem em frases isoladas curtas de 3-5 palavras
- Equipas com uso mensal muito variável que perderiam créditos em meses de menor produção
Planos ElevenLabs (junho de 2026)
Gratuito
Para testes pessoais
- 10.000 caracteres/mês (~7 minutos de áudio)
- TTS, Efeitos Sonoros, Design de Voz
- Geração de música
- Sem licença comercial
Starter
Para uso comercial ligeiro
- 30.000 caracteres/mês (~22 minutos de áudio)
- Licença comercial
- Clonagem Instantânea de Voz
- Dubbing Studio, Imagem e Vídeo
Creator
Para criadores de conteúdo e narradores
- 121.000 caracteres/mês (~90 minutos de áudio)
- Clonagem de Voz Profissional
- Todos os modelos incluindo v3 (Alpha)
- Áudio 44.1kHz via Studio
Pro
Para produção em volume elevado
- 600.000 caracteres/mês (~450 minutos de áudio)
- Output PCM 44.1kHz via API
- Qualidade de áudio 192kbps
- Adequado para publicação comercial de audiobooks em escala
Scale
Para equipas e estúdios
- 1,8M de caracteres/mês
- 3 lugares na workspace
- Ferramentas de colaboração em equipa
- 3 Clones de Voz Profissional
Análise de ROI: No plano Creator ($22/mês), 121.000 caracteres cobrem aproximadamente 90 minutos de áudio finalizado. Comparado com contratar um locutor a $150-$300 por hora finalizada, o plano Creator atinge o break-even com cerca de 10 minutos de produção de áudio mensal.
Custos ocultos e armadilhas
- Créditos consumidos por gerações falhadas ou com artefactos não são reembolsados nos planos standard
- Créditos não utilizados expiram no final do ciclo de faturação, sem acumulação em qualquer plano
- Faturação anual exigida para aceder ao preço Creator com desconto
- SLA de latência Business-tier e BAA HIPAA requerem o plano Business a $990/mês
O que medimos
52 prompts em 7 categorias, plano Creator, maio-junho de 2026
- Latência do primeiro chunk, API Flash v2.5
- 80-120 ms (p50 em 20 chamadas) Meta segundo a documentação ElevenLabs: ~75ms. O nosso p50 foi 92ms sob carga de servidor típica.
- Latência do primeiro chunk, Turbo v2.5
- 200-400 ms (10 chamadas) Mais consistente em inputs longos; latência superior ao Flash mas taxa de artefactos inferior em conteúdo com mais de 10.000 caracteres.
- Tamanho da biblioteca de vozes
- 5.000+ vozes Contagem oficial de junho de 2026. Inclui vozes da comunidade no marketplace Voice Library.
- Idiomas suportados
- 70+ idiomas Modelo Multilingual v2. Qualidade de cobertura variável: línguas europeias principais e japonês são os melhores nos testes.
- Precisão de Clone Instantâneo de Voz (amostra de 3 minutos)
- Bom em áudio de estúdio Com gravação de estúdio de 3 minutos: o clone manteve a prosódia com precisão em passagens que correspondiam ao tom da amostra. Com gravação de 6 minutos com ruído de sala: desvio notável em frases de ritmo rápido.
- Desvio em narração longa (capítulo de 28.000 caracteres)
- 0 desvio notável Modelo Multilingual v2. A consistência de voz manteve-se ao longo do capítulo. O Eleven v3 (Alpha) mostrou ligeiro desvio de prosódia após ~15.000 caracteres no nosso teste.
Narrar uma passagem de audiobook de 400 palavras com tom neutro em inglês britânico, modelo Multilingual v2.
Clonar uma voz a partir de uma gravação de estúdio de 3 minutos e gerar 8 linhas de diálogo NPC de 4-7 palavras cada, modelo Eleven v3 (Alpha).
Prós e contras
Pros
- Qualidade de voz mantém-se consistente em trabalho de narração profissional Em 25 prompts de TTS em diferentes comprimentos, o modelo Multilingual v2 produziu output que necessitou de edição mínima para narração de qualidade de audiobook. A densidade do output é consistente: ritmo, ênfase em frases e colocação de pausas são previsíveis o suficiente para construir um workflow de produção.
- API Flash v2.5 permite integração em pipelines em tempo real Com latência do primeiro chunk de ~75ms (o nosso p50: 92ms), o Flash v2.5 é suficientemente rápido para agentes de voz conversacionais e cenários de dublagem ao vivo. A API de streaming WebSocket está bem documentada e o Python SDK cobre a maioria dos padrões de integração sem trabalho de baixo nível personalizado.
- Biblioteca de 5.000+ vozes é a maior disponível comercialmente O marketplace Voice Library inclui vozes da comunidade em 70+ idiomas, muitas com sotaques regionais específicos. Para equipas de conteúdo a trabalhar em vários mercados, esta amplitude remove a necessidade de construir clones personalizados para cada locale.
Cons
- Créditos consumidos por gerações falhadas independentemente da qualidade do output Quando uma geração contém artefactos (troca de voz, inconsistência de volume, pronúncia incorreta), os caracteres são consumidos. Não existe mecanismo de recuperação de créditos nos planos Creator ou Pro. Isto torna os workflows de alta iteração, onde se regenera 10 a 20 vezes para atingir o desempenho pretendido, significativamente mais caros do que o preço anunciado sugere.
- Créditos não utilizados expiram mensalmente sem acumulação em qualquer plano Para estúdios com picos de produção e meses lentos, este é um custo estrutural. Uma equipa que produz 90 minutos de áudio no Q4 mas apenas 20 minutos no Q1 paga capacidade Creator total em ambos os meses. O desconto de faturação anual não aborda o modelo sem acumulação.
- Modelo Eleven v3 (Alpha) tem desempenho inferior em linhas isoladas curtas com menos de 10 palavras Para diálogo de NPC em jogos, onde a maioria das linhas tem três a oito palavras, o Eleven v3 produziu prosódia plana em 4 de 12 clips de teste. O modelo Multilingual v2 foi mais consistente nestes inputs. Isto é relevante para qualquer pipeline de produção construído em torno de linhas com script curtas em múltiplos estados emocionais.
Veredicto final
O ElevenLabs é a escolha certa quando duas condições se verificam: precisa de output de voz de qualidade profissional que se sustente num contexto comercial, e o seu uso mensal é suficientemente previsível para planear contra os limites de caracteres sem queimar créditos em gerações falhadas.
Para narradores de audiobooks a produzir menos de 100 minutos por mês, o plano Creator a $22/mês é claramente custo-eficaz. Para equipas de desenvolvimento a integrar voz em produtos em tempo real, a API Flash v2.5 e o Conversational AI SDK não têm par direto na categoria hoje.
Os casos em que o ElevenLabs não é a resposta certa são igualmente claros. Se processar mais de 500.000 caracteres por mês via API e o reconhecimento da marca não for um requisito, o Fish Audio S2 produzirá qualidade comparável a uma fração do custo. Se o seu padrão de produção for muito variável, o modelo de crédito sem acumulação custará mais do que o preço do plano anunciado sugere.
O score do Trustpilot não é um indicador de qualidade do produto. É um indicador de experiência de faturação. Compreenda o modelo de créditos antes de subscrever, defina um alerta de utilização antes de atingir o limite mensal, e terá uma ferramenta que cumpre genuinamente a sua promessa de qualidade de voz.
- Qualidade de voz 9/10 Referência para narração de longa duração
- Cobertura de idiomas 8.5/10 70+ idiomas, qualidade variável
- API e ferramentas dev 8.5/10 Flash v2.5 a ~75ms, SDK maduro
- Transparência de preços 5.5/10 Modelo de créditos opaco em custo de falhas
- Clonagem de voz 7.5/10 Sólido em áudio de estúdio, fraco em linhas curtas
Perguntas da comunidade de voz IA
O ElevenLabs é gratuito?
Quantos idiomas o ElevenLabs suporta?
O ElevenLabs cobra por gerações falhadas?
Qual é a latência da API do ElevenLabs?
Que quantidade de amostra de áudio é necessária para clonagem de voz?
Posso usar o output do ElevenLabs comercialmente?
Como se compara o ElevenLabs com o Fish Audio em 2026?
O ElevenLabs funciona para diálogo de NPC em jogos?
O que acontece aos créditos não utilizados no final do mês?
O ElevenLabs é adequado para produção de audiobooks?
Registo de atualizações
- Publicação inicial. Plano Creator testado durante 35 dias (26 de maio a 29 de junho de 2026). 52 prompts em 7 categorias. Preços, latência e resultados de clonagem de voz referentes a meados de 2026.
Changelog · 1
- category_changed Category changed to Voice AI tool reviews