Testado durante 35 dias, Junho de 2026, Plano Creator

Avaliação ElevenLabs 2026: Vale o Preço para Voz com IA?

Veredicto honesto sobre qualidade de voz, sistema de créditos, latência da API e se o score 4.5/5 no G2 ou o 3.0/5 no Trustpilot conta a história real.

Resumo

O ElevenLabs é a referência de mercado em texto-para-voz por IA: mais de 5.000 vozes, 70+ idiomas, API Flash com latência ~75ms. O plano Creator a $22/mês serve bem a maioria dos criadores de conteúdo. O sistema de créditos que debita gerações falhadas e não acumula créditos não utilizados, aliado ao score 3.0/5 no Trustpilot motivado por queixas de faturação, são os dois aspectos a compreender antes de subscrever.

7.8 /10

O ElevenLabs é a referência de categoria em texto-para-voz por IA: mais de 5.000 vozes em 70+ idiomas, API Flash com latência ~75ms e um marketplace de vozes utilizado em mais de 8.000 aplicações. Após 35 dias no plano Creator ($22/mês) e 52 prompts de teste, o nosso veredicto é 7.8/10. Forte para narração profissional, podcasts e produção de audiobooks. O modelo de créditos, que debita gerações falhadas e não acumula créditos não utilizados, é o principal ponto de atrito e explica o score 3.0/5 no Trustpilot apesar de um produto de qualidade consistente.

Qualidade de voz
9/10
Cobertura de idiomas
8.5/10
API e ferramentas de desenvolvimento
8.5/10
Transparência de preços
5.5/10
Precisão de clonagem de voz
7.5/10
  • Biblioteca de mais de 5.000 vozes com cobertura de 70+ idiomas é a maior da categoria
  • API Flash v2.5 com latência ~75ms permite pipelines de conversação em tempo real
  • Narração de longa duração (30+ minutos) mantém consistência sem desvio entre capítulos
  • Créditos debitados em gerações falhadas sem mecanismo de reembolso nos planos standard
  • Créditos mensais não utilizados expiram no final do ciclo, penalizando padrões de uso variável
  • Modelo Eleven v3 (Alpha) tem desempenho inferior em frases isoladas curtas com menos de 10 palavras

Plano gratuito: 10.000 caracteres/mês, sem cartão de crédito

Metodologia

Como testámos

Tested for
35 days
Plan paid
Plano Creator ($22/mês)
Version tested
Eleven v3 (Alpha), Multilingual v2, Flash v2.5, Turbo v2.5, testados em junho de 2026
Prompts run
52
Test period
2026-05-26 → 2026-06-29
Test categories: Qualidade de voz TTS (diferentes comprimentos) • Precisão de Clonagem Instantânea de Voz • Dublagem e transferência entre idiomas • Latência da API (Flash v2.5 vs Turbo v2.5) • Consistência de narração de longa duração (30+ minutos) • Geração de linhas curtas de NPC (3-8 palavras) • Controlo emocional via audio tags

Executámos 52 prompts padronizados em sete categorias de teste no plano Creator ($22/mês) durante 35 dias. Para qualidade de TTS, usámos a mesma passagem de 15 frases nos modelos Multilingual v2, Eleven v3 (Alpha), Flash v2.5 e Turbo v2.5, comparando estabilidade de prosódia, precisão de pronúncia e tempo de entrega do primeiro chunk. A Clonagem Instantânea de Voz foi testada com duas amostras de áudio: uma gravação de estúdio de 3 minutos e outra de 6 minutos com ruído de sala ligeiro. Para dublagem, processámos um script em inglês de 800 palavras para espanhol, japonês e alemão. A latência da API foi medida registando deltas de timestamp em 20 chamadas Flash v2.5 e 10 chamadas Turbo v2.5 via Python SDK. A narração de longa duração foi testada com um capítulo de audiobook de 28.000 caracteres. Linhas curtas de NPC (12 clips, cada um com 3 a 8 palavras) foram testadas em Multilingual v2 e Eleven v3 (Alpha). Todos os screenshots são da nossa conta Creator. Não foram utilizadas versões de pré-produção nem acesso promocional.

Deve subscrever?

YES if you...

  • Narradores de audiobooks a produzir entre 80 a 100 minutos de áudio por mês
  • Equipas de podcast que precisam de versões multilingues do mesmo episódio
  • Equipas de desenvolvimento a construir agentes de voz onde o ecossistema de API e o streaming de baixa latência são críticos
  • Criadores de conteúdo que necessitam de TTS com licença comercial sem gerir talentos de voz

NO if you...

  • Integrações de API sensíveis ao custo a processar mais de 500k caracteres/mês (Fish Audio é até 11x mais barato)
  • Developers de áudio para jogos cujos diálogos de NPC consistem em frases isoladas curtas de 3-5 palavras
  • Equipas com uso mensal muito variável que perderiam créditos em meses de menor produção
Preços

Planos ElevenLabs (junho de 2026)

Gratuito

$0 /mês

Para testes pessoais

  • 10.000 caracteres/mês (~7 minutos de áudio)
  • TTS, Efeitos Sonoros, Design de Voz
  • Geração de música
  • Sem licença comercial

Starter

$6 /mês

Para uso comercial ligeiro

  • 30.000 caracteres/mês (~22 minutos de áudio)
  • Licença comercial
  • Clonagem Instantânea de Voz
  • Dubbing Studio, Imagem e Vídeo

Pro

$99 /mês

Para produção em volume elevado

  • 600.000 caracteres/mês (~450 minutos de áudio)
  • Output PCM 44.1kHz via API
  • Qualidade de áudio 192kbps
  • Adequado para publicação comercial de audiobooks em escala

Scale

$299 /mês

Para equipas e estúdios

  • 1,8M de caracteres/mês
  • 3 lugares na workspace
  • Ferramentas de colaboração em equipa
  • 3 Clones de Voz Profissional

Análise de ROI: No plano Creator ($22/mês), 121.000 caracteres cobrem aproximadamente 90 minutos de áudio finalizado. Comparado com contratar um locutor a $150-$300 por hora finalizada, o plano Creator atinge o break-even com cerca de 10 minutos de produção de áudio mensal.

Custos ocultos e armadilhas
  • Créditos consumidos por gerações falhadas ou com artefactos não são reembolsados nos planos standard
  • Créditos não utilizados expiram no final do ciclo de faturação, sem acumulação em qualquer plano
  • Faturação anual exigida para aceder ao preço Creator com desconto
  • SLA de latência Business-tier e BAA HIPAA requerem o plano Business a $990/mês
G2
4.5/5
1.140 avaliações
Capterra
4.7/5
23 avaliações
Trustpilot
3.0/5
~1.005 avaliações
Product Hunt
4.4/5
Avaliado pela comunidade

Scores de junho de 2026. G2 e Capterra refletem qualidade do produto; o score do Trustpilot é influenciado por queixas de faturação e subscrição.

Testes

O que medimos

52 prompts em 7 categorias, plano Creator, maio-junho de 2026

Latência do primeiro chunk, API Flash v2.5
80-120 ms (p50 em 20 chamadas) Meta segundo a documentação ElevenLabs: ~75ms. O nosso p50 foi 92ms sob carga de servidor típica.
Latência do primeiro chunk, Turbo v2.5
200-400 ms (10 chamadas) Mais consistente em inputs longos; latência superior ao Flash mas taxa de artefactos inferior em conteúdo com mais de 10.000 caracteres.
Tamanho da biblioteca de vozes
5.000+ vozes Contagem oficial de junho de 2026. Inclui vozes da comunidade no marketplace Voice Library.
Idiomas suportados
70+ idiomas Modelo Multilingual v2. Qualidade de cobertura variável: línguas europeias principais e japonês são os melhores nos testes.
Precisão de Clone Instantâneo de Voz (amostra de 3 minutos)
Bom em áudio de estúdio Com gravação de estúdio de 3 minutos: o clone manteve a prosódia com precisão em passagens que correspondiam ao tom da amostra. Com gravação de 6 minutos com ruído de sala: desvio notável em frases de ritmo rápido.
Desvio em narração longa (capítulo de 28.000 caracteres)
0 desvio notável Modelo Multilingual v2. A consistência de voz manteve-se ao longo do capítulo. O Eleven v3 (Alpha) mostrou ligeiro desvio de prosódia após ~15.000 caracteres no nosso teste.
Narrar uma passagem de audiobook de 400 palavras com tom neutro em inglês britânico, modelo Multilingual v2.
Gerado em aproximadamente 8 segundos. O tom correspondeu a um clone de voz treinado em 8 de 10 avaliações subjetivas. Pronúncia correta em nomes próprios como Reykjavik e Cracóvia. Nenhum crédito desperdiçado nesta geração.
Interface de texto-para-voz do ElevenLabs com seletor de modelo e opções de idioma
Clonar uma voz a partir de uma gravação de estúdio de 3 minutos e gerar 8 linhas de diálogo NPC de 4-7 palavras cada, modelo Eleven v3 (Alpha).
Clone criado em 4 minutos. Linhas com entonação interrogativa (pitch ascendente) foram precisas em 6 de 8 clips. Duas linhas declarativas curtas mostraram prosódia plana inconsistente com o locutor original. O modelo Multilingual v2 teve melhor desempenho nestes inputs curtos.
Interface de clonagem de voz do ElevenLabs com opções de clone profissional e instantâneo
Avaliação

Prós e contras

Pros

  • Qualidade de voz mantém-se consistente em trabalho de narração profissional Em 25 prompts de TTS em diferentes comprimentos, o modelo Multilingual v2 produziu output que necessitou de edição mínima para narração de qualidade de audiobook. A densidade do output é consistente: ritmo, ênfase em frases e colocação de pausas são previsíveis o suficiente para construir um workflow de produção.
  • API Flash v2.5 permite integração em pipelines em tempo real Com latência do primeiro chunk de ~75ms (o nosso p50: 92ms), o Flash v2.5 é suficientemente rápido para agentes de voz conversacionais e cenários de dublagem ao vivo. A API de streaming WebSocket está bem documentada e o Python SDK cobre a maioria dos padrões de integração sem trabalho de baixo nível personalizado.
  • Biblioteca de 5.000+ vozes é a maior disponível comercialmente O marketplace Voice Library inclui vozes da comunidade em 70+ idiomas, muitas com sotaques regionais específicos. Para equipas de conteúdo a trabalhar em vários mercados, esta amplitude remove a necessidade de construir clones personalizados para cada locale.

Cons

  • Créditos consumidos por gerações falhadas independentemente da qualidade do output Quando uma geração contém artefactos (troca de voz, inconsistência de volume, pronúncia incorreta), os caracteres são consumidos. Não existe mecanismo de recuperação de créditos nos planos Creator ou Pro. Isto torna os workflows de alta iteração, onde se regenera 10 a 20 vezes para atingir o desempenho pretendido, significativamente mais caros do que o preço anunciado sugere.
  • Créditos não utilizados expiram mensalmente sem acumulação em qualquer plano Para estúdios com picos de produção e meses lentos, este é um custo estrutural. Uma equipa que produz 90 minutos de áudio no Q4 mas apenas 20 minutos no Q1 paga capacidade Creator total em ambos os meses. O desconto de faturação anual não aborda o modelo sem acumulação.
  • Modelo Eleven v3 (Alpha) tem desempenho inferior em linhas isoladas curtas com menos de 10 palavras Para diálogo de NPC em jogos, onde a maioria das linhas tem três a oito palavras, o Eleven v3 produziu prosódia plana em 4 de 12 clips de teste. O modelo Multilingual v2 foi mais consistente nestes inputs. Isto é relevante para qualquer pipeline de produção construído em torno de linhas com script curtas em múltiplos estados emocionais.
Veredicto

Veredicto final

7.8 /10

O ElevenLabs é a escolha certa quando duas condições se verificam: precisa de output de voz de qualidade profissional que se sustente num contexto comercial, e o seu uso mensal é suficientemente previsível para planear contra os limites de caracteres sem queimar créditos em gerações falhadas.

Para narradores de audiobooks a produzir menos de 100 minutos por mês, o plano Creator a $22/mês é claramente custo-eficaz. Para equipas de desenvolvimento a integrar voz em produtos em tempo real, a API Flash v2.5 e o Conversational AI SDK não têm par direto na categoria hoje.

Os casos em que o ElevenLabs não é a resposta certa são igualmente claros. Se processar mais de 500.000 caracteres por mês via API e o reconhecimento da marca não for um requisito, o Fish Audio S2 produzirá qualidade comparável a uma fração do custo. Se o seu padrão de produção for muito variável, o modelo de crédito sem acumulação custará mais do que o preço do plano anunciado sugere.

O score do Trustpilot não é um indicador de qualidade do produto. É um indicador de experiência de faturação. Compreenda o modelo de créditos antes de subscrever, defina um alerta de utilização antes de atingir o limite mensal, e terá uma ferramenta que cumpre genuinamente a sua promessa de qualidade de voz.

Qualidade de vozCobertura de idiomasAPI e ferramentas devTransparência de preçosClonagem de voz
  • Qualidade de voz 9/10 Referência para narração de longa duração
  • Cobertura de idiomas 8.5/10 70+ idiomas, qualidade variável
  • API e ferramentas dev 8.5/10 Flash v2.5 a ~75ms, SDK maduro
  • Transparência de preços 5.5/10 Modelo de créditos opaco em custo de falhas
  • Clonagem de voz 7.5/10 Sólido em áudio de estúdio, fraco em linhas curtas
Comparar alternativas de voz IA

Perguntas da comunidade de voz IA

O ElevenLabs é gratuito?
Sim, o ElevenLabs tem um plano gratuito com 10.000 caracteres por mês, o que corresponde a aproximadamente 7 a 8 minutos de áudio consoante a velocidade de fala. Não é necessário cartão de crédito para o plano gratuito, embora o uso comercial requeira um plano pago a partir de $6/mês (Starter) ou $22/mês (Creator) para clonagem de voz profissional.
Quantos idiomas o ElevenLabs suporta?
O ElevenLabs suporta mais de 70 idiomas em meados de 2026. O modelo Multilingual v2 cobre a maioria dos idiomas; o mais recente Eleven v3 (Alpha) suporta uma gama mais alargada com direção emocional via audio tags. A qualidade de cobertura varia por idioma: as principais línguas europeias e o japonês têm o melhor desempenho nos nossos testes.
O ElevenLabs cobra por gerações falhadas?
Sim, esta é a queixa mais consistente no Trustpilot. Se uma geração contiver erros, artefactos de troca de voz ou inconsistências de volume, os créditos são consumidos na mesma. É possível regenerar, mas isso consome créditos adicionais. A forma de contornar este problema é manter as gerações curtas (menos de 5.000 caracteres) e usar os sliders de estabilidade para reduzir artefactos antes de regenerar.
Qual é a latência da API do ElevenLabs?
O modelo Flash v2.5 tem como objetivo uma latência de aproximadamente 75ms para TTS em streaming via API. Nos nossos testes, a latência p50 para o primeiro chunk de áudio foi de 80 a 120ms dependendo da carga do servidor. O modelo Turbo v2.5 standard é mais lento (200 a 400ms) mas mais estável em inputs longos.
Que quantidade de amostra de áudio é necessária para clonagem de voz?
A Clonagem Instantânea de Voz (disponível a partir do plano Starter a $6/mês) funciona com apenas um minuto de áudio, embora três a cinco minutos produzam resultados notavelmente mais estáveis. A Clonagem de Voz Profissional (plano Creator e acima) requer mais áudio e mais tempo de processamento, mas produz um clone de maior fidelidade para narração longa.
Posso usar o output do ElevenLabs comercialmente?
O uso comercial requer um plano pago. O plano Starter ($6/mês) inclui licença comercial. O plano gratuito não inclui. Para implementações empresariais com requisitos de SLA e conformidade HIPAA, os planos Business ($990/mês) e Enterprise (personalizado) incluem BAAs e SSO.
Como se compara o ElevenLabs com o Fish Audio em 2026?
O Fish Audio S2 (março de 2026) oferece qualidade de output comparável a um custo de API por caractere até 11x inferior. Em testes cegos independentes, o Fish Audio venceu 60% das comparações diretas em qualidade de voz. O ElevenLabs mantém vantagens em estabilidade de narração longa, profundidade do marketplace Voice Library e o Conversational AI SDK para pipelines em tempo real.
O ElevenLabs funciona para diálogo de NPC em jogos?
Sim, com ressalvas. O ElevenLabs tem bom desempenho em linhas de diálogo com mais de dez palavras. Para linhas isoladas curtas de três a cinco palavras, o modelo Eleven v3 (Alpha) pode produzir prosódia plana. O modelo Multilingual v2 é mais previsível para linhas com script curtas. O Conversational AI SDK cobre interações de NPC reativas em tempo real via WebSocket.
O que acontece aos créditos não utilizados no final do mês?
Em todos os planos, os créditos não utilizados não transitam para o ciclo de faturação seguinte. Esta é a principal preocupação de preços para utilizadores com uso mensal variável: um mês lento significa perder o valor dos créditos pagos.
O ElevenLabs é adequado para produção de audiobooks?
Sim. A funcionalidade Projects gere a narração de documentos longos com consistência de voz entre capítulos. A estabilidade mantém-se em conteúdo até 90 minutos nos nossos testes. O plano Creator (121.000 caracteres por mês) cobre aproximadamente 90 a 100 minutos de áudio por ciclo de faturação, o que se adequa à maioria dos produtores independentes de audiobooks.
Atualizações

Registo de atualizações

  1. Publicação inicial. Plano Creator testado durante 35 dias (26 de maio a 29 de junho de 2026). 52 prompts em 7 categorias. Preços, latência e resultados de clonagem de voz referentes a meados de 2026.
Last updated · 1 change
Changelog · 1
  • category_changed Category changed to Voice AI tool reviews