Resolvido por Pontuação de Similaridade de Strings
Este recurso ajuda você a identificar entradas de texto quase idênticas em um conjunto de dados sem a necessidade de comparação manual, linha por linha. Ele acelera o trabalho de desduplicação e reduz a chance de perder variações sutis.
Ao limpar conjuntos de dados, é comum encontrar entradas de texto que são quase iguais, mas não perfeitamente idênticas. Este recurso oferece suporte para encontrar essas entradas quase idênticas, para que você possa analisá-las juntas em vez de comparar itens um por um. Ele foi projetado para fluxos de trabalho de desduplicação e controle de qualidade, onde pequenas diferenças na ortografia, pontuação, espaçamento ou redação podem ocultar duplicatas. Ao exibir correspondências próximas, torna-se mais fácil consolidar registros, padronizar campos de texto e reduzir o ruído em análises posteriores. É útil quando várias fontes ou inserções manuais introduzem frases repetidas com pequenas variações. Também pode oferecer suporte a tarefas como limpeza de respostas de pesquisas, notas de suporte ao cliente, descrições de produtos ou campos de endereço de formato livre. O principal benefício é a economia de tempo: você pode concentrar sua atenção em um conjunto menor de prováveis duplicatas em vez de examinar todo o conjunto de dados. Um benefício secundário é a melhoria da consistência, já que o recurso ajuda a revelar padrões de variação que podem ser padronizados. No geral, ele permite uma limpeza de conjunto de dados mais rápida e confiável, tornando textos quase duplicados mais fáceis de encontrar e avaliar.
Recurso externo
https://cross-service-solutions.com/
Se conhece uma ferramenta ou abordagem que poderia ajudar as pessoas a resolver um problema que ainda não abordámos, gostaríamos de saber.