← Voltar ao glossário

Text-to-Speech (TTS)

Tecnologia que converte texto escrito em fala sintetizada. Os sistemas atuais, baseados em redes neurais, produzem vozes com entonação e ritmo próximos aos de um locutor humano, em dezenas de idiomas.

Text-to-speech (TTS), ou síntese de voz, é a tecnologia que transforma texto em áudio falado. As gerações antigas soavam robóticas porque colavam pedaços de gravações; os sistemas atuais usam redes neurais que geram a onda sonora do zero, aprendendo entonação, pausas e emoção a partir de milhares de horas de fala real. O resultado, nas melhores ferramentas, é difícil de distinguir de um locutor humano.

Os recursos que diferenciam as plataformas modernas:

  • Variedade de vozes e idiomas, incluindo sotaques regionais (como português brasileiro).
  • Clonagem de voz: criar uma voz sintética a partir de amostras de uma voz real, útil para narração consistente, e sensível do ponto de vista ético (exige consentimento de quem é clonado).
  • Controle de estilo: ajustar velocidade, ênfase, pausas e emoção.
  • API: gerar áudio programaticamente, para dar voz a chatbots e assistentes.

Os usos vão de acessibilidade (leitores de tela, audiodescrição) a produção de conteúdo: narração de vídeos, audiolivros, podcasts, cursos e atendimentos telefônicos automatizados. É o caminho inverso do *speech-to-text* (transcrição).

Exemplo concreto: um criador de conteúdo escreve o roteiro de um vídeo educativo, cola o texto numa ferramenta como ElevenLabs ou Murf, escolhe uma voz em português e baixa a narração pronta em minutos, sem estúdio nem microfone.

Categorias

Veja também