Resolvido por Pontuação de Similaridade de String
Detecte e sinalize registros duplicados que são semelhantes, mas não idênticos (por exemplo, variações de ortografia, diferenças de formatação ou sobreposições parciais). Isso ajuda a reduzir a desorganização, melhorar a qualidade dos dados e evitar a contagem dupla em relatórios e fluxos de trabalho.
Este recurso ajuda a identificar registros duplicados que não correspondem exatamente, como entradas com erros de digitação, abreviações diferentes, capitalização inconsistente ou variações na formatação. Ele foi projetado para situações em que a correspondência exata não consegue capturar duplicatas reais, levando a dados confusos e análises não confiáveis. O recurso oferece suporte à comparação de registros usando detecção baseada em similaridade, para que correspondências aproximadas possam ser exibidas para revisão. Ele permite que você encontre possíveis duplicatas em campos-chave onde elas ocorrem com frequência, como nomes, endereços de e-mail, números de telefone, endereços ou IDs com formatação inconsistente. Os resultados podem ser usados para identificar grupos de registros que provavelmente representam a mesma entidade, permitindo que você decida o que deve ser limpo. Ao detectar esses registros quase duplicados, você pode reduzir o esforço manual gasto na verificação de planilhas ou bancos de dados em busca de inconsistências. Isso melhora a precisão dos relatórios, minimizando a contagem dupla e valores conflitantes. Também oferece suporte a processos subsequentes, como comunicações com clientes, verificações de conformidade e fluxos de trabalho operacionais, garantindo que os registros não fiquem fragmentados em várias variantes. No geral, ele fornece uma maneira mais confiável de localizar duplicatas quando a entrada de dados no mundo real é inconsistente.
Recurso externo
https://cross-service-solutions.com/
Se você conhece uma ferramenta ou abordagem que pode ajudar as pessoas a resolver um problema que ainda não cobrimos, adoraríamos saber.