Prepare palavras-chave, URLs, títulos, fragmentos CSV e outras listas de texto para importar ou verificar. A ferramenta remove caracteres e linhas extras, altera maiúsculas/minúsculas, substitui delimitadores, ordena os dados e executa várias operações numa só passagem.
Em que ordem processar os dados
O resultado depende não apenas das ações escolhidas, mas também da sua sequência. Para uma lista comum linha a linha, esta ordem é adequada:
- substituir o delimitador por uma quebra de linha;
- remover espaços e tabulações nas bordas das linhas;
- eliminar linhas vazias;
- se necessário, converter os valores para um caso uniforme;
- eliminar duplicados;
- ordenar o resultado apenas se a ordem original não for importante.
Por exemplo, as cadeias example, Example e example parecem quase iguais,
mas antes de remover espaços e normalizar maiúsculas/minúsculas, podem ser consideradas três valores diferentes.
O que cada operação faz e quando ter cuidado
| Operação | Aplicação prática | O que verificar |
|---|---|---|
| Remoção de BOM | corrigir o caractere invisível antes do primeiro cabeçalho ou valor | não remover BOM de um ficheiro UTF-16 sem conhecer a sua codificação |
| Substituição de delimitador por quebra de linha | transformar uma lista separada por vírgulas ou ponto e vírgula numa lista linha a linha | uma simples substituição não respeita as regras completas do CSV com aspas |
| Eliminação de linhas vazias | limpeza de listas antes da importação | uma linha vazia às vezes serve como separador semântico entre blocos |
| Eliminação de quebras de linha | juntar o texto numa única linha | parágrafos e limites de elementos serão perdidos |
| Eliminação de espaços supérfluos | corrigir espaços repetidos dentro do texto | em código e dados formatados, os espaços podem ser significativos |
| Corte de bordas das linhas | remover espaços e tabulações acidentais | geralmente seguro para listas, mas não para fragmentos com formatação fixa |
| Alteração de maiúsculas/minúsculas | unificar palavras-chave, etiquetas ou códigos | URLs, identificadores, palavras-passe e alguns valores são sensíveis a maiúsculas/minúsculas |
| Eliminação de linhas por condição | excluir elementos de serviço ou indesejados | verifique se o fragmento procurado não aparece dentro de linhas úteis |
| Eliminação de duplicados | obter uma lista de cadeias únicas | a ferramenta procura correspondências exatas de cadeias, não o mesmo significado |
| Ordenação | facilitar a verificação manual e a comparação | após a ordenação, a sequência original não é preservada |
O que é BOM e porque interfere na importação
BOM é uma marca de codificação de serviço no início de um fluxo de texto. Em UTF-8 pode aparecer como um caractere invisível antes da primeira palavra.
Por isso, o sistema de importação às vezes interpreta o primeiro cabeçalho como URL em vez de URL,
não reconhece o nome da coluna ou adiciona um sinal estranho no início da linha.
A remoção do BOM UTF-8 é útil quando o sistema recetor não o espera. Mas o BOM também é usado para determinar a ordem dos bytes em UTF-16 e UTF-32. Portanto, não deve ser removido mecanicamente de qualquer ficheiro: primeiro é necessário entender a codificação original.
Por que substituir vírgulas nem sempre equivale a processar CSV
Um CSV pode conter o delimitador dentro de um valor entre aspas:
"Lisboa, centro",1200
Se simplesmente substituir cada vírgula por uma quebra de linha, um valor será dividido erroneamente em partes. O processador é adequado para listas simples e fragmentos em que o delimitador não aparece nos dados. Para ficheiros CSV complexos com aspas, escapes e várias colunas, é necessário um analisador CSV completo.
Cuidado com URLs e identificadores
Não aplique a conversão para minúsculas a toda a lista de URLs sem verificação. Num endereço, o esquema e o domínio não são sensíveis a maiúsculas/minúsculas, mas o caminho e os parâmetros num servidor específico podem variar:
https://example.com/Catalog
https://example.com/catalog
Estes endereços podem levar a páginas diferentes. Da mesma forma, não deve alterar maiúsculas/minúsculas de tokens, códigos de artigo, hashes, chaves API, códigos promocionais e identificadores se as regras do sistema não forem conhecidas.
Contagem de comprimento: caracteres, bytes e emojis
Diferentes sistemas podem contar o comprimento da mesma cadeia de maneiras diferentes. Uma letra normal conta geralmente como um caractere, enquanto emojis, sinais compostos e algumas combinações Unicode podem ocupar várias unidades de código. Portanto, o resultado de um contador online nem sempre coincide com o limite de um CMS, plataforma publicitária ou base de dados específicos.
Para títulos, descrições e textos publicitários, verifique não apenas o número de caracteres, mas também como a cadeia é realmente exibida no sistema em questão.
Cenários práticos
Preparação de semântica
Cole uma lista de consultas, remova espaços nas bordas e linhas vazias, unifique maiúsculas/minúsculas, elimine duplicados. Ordene apenas após a limpeza, se a ordem de exportação não for importante.
Conversão de uma lista de uma tabela
Se os valores foram copiados com tabulações ou outro delimitador simples, substitua-o por quebras de linha. Em seguida, verifique manualmente algumas linhas para garantir que esse caractere não aparece dentro dos valores.
Limpeza de uma lista de URLs
Remova linhas vazias e espaços nas bordas, mas não altere maiúsculas/minúsculas de caminhos e parâmetros. Após a limpeza, é útil verificar a lista com a ferramenta de eliminação de duplicados.
Exclusão de linhas indesejadas
A função de eliminar linhas por fragmento é adequada, por exemplo, para excluir um domínio de serviço, um parâmetro ou uma palavra. Teste primeiro a condição numa pequena cópia: a pesquisa por um fragmento curto pode eliminar mais linhas do que o esperado.
Como não perder os dados originais
Antes do processamento em lote, guarde o original. Especialmente importante ao eliminar linhas, fundir parágrafos, ordenar e alterar maiúsculas/minúsculas: tais operações não podem ser desfeitas de forma fiável após copiar o resultado sobre a lista original.
Perguntas frequentes
É possível processar um ficheiro CSV real?
A ferramenta é adequada para texto e fragmentos CSV simples. Se o ficheiro tiver várias colunas, aspas, quebras dentro de células ou delimitadores escapados, utilize um programa que analise CSV de acordo com as suas regras.
Por que após eliminar duplicados permanecem linhas semelhantes?
Podem diferir em maiúsculas/minúsculas, espaços, espaços inseparáveis ou caracteres invisíveis. Primeiro realize uma normalização adequada e depois repita a eliminação de duplicados.
É seguro converter todo o texto para minúsculas?
Para palavras-chave comuns, muitas vezes sim. Para URLs, códigos, identificadores, palavras-passe e código de programa, não: a caixa pode alterar o significado.
A operação remove todos os caracteres Unicode invisíveis?
Não necessariamente. A remoção de BOM afeta uma marca de serviço específica, não todos os espaços inseparáveis, caracteres de largura zero e outros sinais invisíveis.
Ferramentas relacionadas: Eliminação de duplicados; Diffchecker; Combinador de palavras-chave.
