Texto Com A Letra D - Atividades de Alfabetização com pequeno texto em PDF letra D
Atividades de Alfabetização com pequeno texto em PDF letra D

Como filtrar e extrair texto com a letra d de forma prática

A maioria das pessoas que precisa trabalhar com filtros de texto tenta fazer isso na mão, cortando palavras manualmente ou usando ferramentas genéricas que não entregam o que prometem. O resultado é uma planilha cheia de erros, palavras escritas errado ou trechos que simplesmente desaparecem quando você aplica um filtro básico. Eu passei por isso duas vezes antes de decidir estruturar um processo que funciona de verdade.

texto com a letra d: o que na prática significa

Quando falo de texto com a letra d, estou me referindo a qualquer conjunto de caracteres — palavras, frases, linhas inteiras — que contenha a letra d em maiúscula ou minúscula. O problema é que a maioria das pessoas ignora a questão da case sensitivity e perde metade dos resultados. Um filtro simples como "contém d" pode retornar apenas os resultados em caixa alta se não configurar o regex corretamente. Isso acontece especialmente em planilhas brasileiras, onde ferramentas como o Google Sheets e o Excel tratam esses filtros de forma diferente uma da outra. No meu caso, o problema real surgiu quando precisei extrair termos técnicos de um banco de dados com mais de 40 mil registros. O filtro padrão do Excel deletou linhas inteiras porque encontrava "d" dentro de siglas e códigos que eu não queria. Minha solução foi construir uma fórmula no Google Sheets que cruzava posição da letra com expressão regular, filtrando apenas ocorrências isoladas da letra d em palavras completas.

Como montar o filtro que realmente funciona

A abordagem mais confiável é usar o Google Sheets com uma combinação de REGEXMATCH e LOWER. A fórmula base é: =REGEXMATCH(LOWER(A1), "(?i)\bd\b")

Isso retorna TRUE para todas as células que contêm a letra d isolada, respeitando tanto maiúsculas quanto minúsculas e ignorando d dentro de outras sequências de letras. O \b é o word boundary, que é o detalhe que a maioria das pessoas esquece e que causa os falsos positivos. Se você está lidando com arquivos grandes, como CSVs com centenas de milhares de linhas, o Google Sheets começa a engasgar. Nesse cenário, o ideal é migrar para um script Python usando pandas e re. O código leva cerca de 3 minutos para processar 200 mil linhas em uma máquina comum. Aqui está o esqueleto funcional:

👉 Clique no botão abaixo para saber mais sobre o assunto!

import pandas as pd
import re

df = pd.read_csv("seu_arquivo.csv")
padrao = r'\bd\b'
resultado = df[df.apply(lambda row: row.astype(str).str.contains(padrao, case=False, regex=True).any(), axis=1)]
resultado.to_csv("texto_com_d.csv", index=False)

Esse script procura pela letra d em qualquer coluna do DataFrame e exporta um novo CSV apenas com as linhas que passaram no filtro. Se quiser restringir a uma coluna específica, basta trocar o apply por df["coluna"].str.contains(padrao, case=False, regex=True).

Pegadinhas que ninguém conta

O primeiro erro comum é confiar cegamente no operador AND. Se seu texto contém d em uma coluna e e em outra, mas você quer d em qualquer coluna, usar AND vai descartar linhas válidas. O correto é usar OR ou aplicar o filtro linha por linha como mostrei acima. O segundo erro, mais sutil, é esquecer caracteres especiais. A letra d pode aparecer acompanhada de acentos, cedilha ou hífen em textos em português. Se seu filtro usa \b sem considerar o unicode, palavras como "décimo" ou "açude" vão escapar. A correção é adicionar o flag UNICODE na expressão: re.compile(r'\bd\b', re.UNICODE).

Um problema que encontrei na prática foi com textos que continham d como parte de abreviações como "Dr.", "Ed.", "Av.". O word boundary \b trata o ponto como delimitador, então "Dr." é computado como contendo d. Se seu caso de uso exige excluir essas siglas, adicione uma negaçãolookahead: r'\bd(?!\.)'. Isso filtra d que não são seguidos imediatamente por ponto.

Alternativas quando o filtro não resolve

Às vezes, a letra d está embutida em strings codificadas, nomes de arquivo, URLs ou dados JSON mal formatados. Nesses casos, o regex direto não funciona bem porque o contexto é irrelevante para o filtro. A saída é pré-processar o dado: extrair apenas o campo de texto puro antes de aplicar o regex. No Python, isso significa converter cada registro para string, remover tags HTML se houver, e só então rodar a expressão. Se você não tem familiaridade com Python, o que dá certo como alternativa rápida é usar uma extensão do Chrome chamada "Table Capture" combinada com uma macro no Google Sheets. Seleciona a tabela, cola no Sheets, aplica o REGEXMATCH e filtra os TRUE. Leva uns 10 minutos para uma planilha de até 5 mil linhas. Acima disso, o script Python já compensa o esforço de configuração.

texto com a letra d: resumo do que funciona

Não existe solução única porque o comportamento muda conforme a ferramenta e o volume de dados. Para pequenos conjuntos, REGEXMATCH no Sheets com word boundary resolve. Para volumes maiores ou quando você precisa de precisão cirúrgica contra falsos positivos, o caminho Python com pandas e regex unicode é o que entrega resultado consistente. Evite filtros nativos do Excel para esse tipo de operação — eles não tratam word boundary e geram dados sujos que exigem limpeza posterior. O filtro mais útil que eu construí e ainda uso hoje é uma função personalizada no Python que recebe um CSV, uma coluna opcional, um pattern regex e exporta o resultado com timestamp no nome do arquivo. Isso evita que você sobrescreva dados e permite rastrear qual versão do filtro foi aplicada. Se precisar de algo assim, a estrutura do script acima já é o suficiente para adaptar.