Sobre o sistema de vogais do português
O alfabeto português tem seis vogais fonêmicas, não cinco. A e I, O e U contam como os padrão. O problema é que o português também usa E aberto e fechado, e O aberto e fechado, como unidades distintas na fala, mesmo que se escrevam com as mesmas letras. Quem nunca viu um estudante errar "mesa" porque a vogal tá aberta em vez de fechada não presta atenção nos detalhes.
quantas vogais tem o alfabeto
A resposta curta é que as letras do alfabeto são vinte e seis, sendo cinco vogais: A, E, I, O, U. Isso é o padrão. Mas aí você começa a notar coisas. O "E" em "pé" e "peso" não soa igual. O mesmo vale para "O" em "coração" versus "amor". Essas diferenças existem na fala real, mesmo que a escrita não marque explicitamente. No meu trabalho com processamento de linguagem, já precisei lidar com sistemas que tratavam todas as vogais como iguais só porque compartilhavam a mesma letra. Resultado: o algoritmo confundia "sola" com "sala" em certos contextos de acentuação. A solução foi implementar um mapeamento fonêmico que separava os sons, não só os caracteres. Levou duas semanas pra ajustar e testar no corpus, mas depois funcionou bem.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Outra coisa que muita gente ignora: o dígrafo "NH" aparece em palavras como "ninho" e carrega uma vogal nasalizada em cada lado. Não é vogal extra, mas o efeito sonoro é diferente. Se você tá fazendo análise fonética séria, precisa registrar isso como nuance, não como exceção.
Como contar na prática
Se você precisa extrair vogais de um texto automaticamente, use a expressão regular [aeiouAEIOU]. Funciona pra maioria dos casos. Mas se quiser cobrir também os sons abertos e fechados de forma automática, aí a coisa complica. A menos que você tenha um analisador fonêmico robusto, vai terminar com resultados imprecisos pra palavras como "medo" versus "mudo". Em tarefas de contagem simples — tipo validar se uma string tem vogais suficientes — o regex resolve rápido. Leva uns 30 milissegundos pra processar um texto de dez mil palavras num máquina comum. Nada excepcional, mas funciona.
Quando o modelo simples falha
O problema maior aparece com hiatos e ditongos. "Saúda" tem três vogais escritas mas só dois sons vocálicos distintos na pronúncia padrão. Um script ingênuo conta três e dá resultado errado. Eu já vi isso quebrar validação de senhas em um sistema que exigia pelo menos uma vogal por palavra. Achei que era bug do usuário, era bug do regex. Se o seu caso envolve processamento fonológico ou geração de fala, o ideal é usar uma biblioteca como o Phonetisaurus ou treinar um modelo fonético específico pra sua variedade do português. Isso adiciona complexidade, mas evita erros de contagem que passam despercebidos até produção.