Personal Data Mining: o que é e como usar dados pessoais sob a LGPD

Mãos organizam peças coloridas por diferentes caminhos, representando análise, inferência e classificação de informações.

Entenda como reconhecer a mineração de dados pessoais, mapear inferências, priorizar riscos e estruturar análises empresariais compatíveis com a LGPD.

Seu CRM reúne compras, chamados e respostas a campanhas. A plataforma de vendas registra navegação, enquanto a equipe comercial separa clientes por probabilidade de fechar negócio. Quando você cruza essas informações para encontrar padrões, classificar pessoas ou estimar comportamentos, pode existir uma operação de mineração de dados pessoais, mesmo sem inteligência artificial sofisticada.

Considere uma empresa fictícia de software por assinatura que deseja prever cancelamentos. Ela pretende combinar frequência de uso, atrasos e contatos com o suporte para definir quem receberá uma oferta de retenção. Se você administra um processo semelhante, precisa enxergar mais do que o resultado da pontuação: é necessário compreender de onde vieram os dados, qual inferência foi produzida, quem a utilizará e o que poderá acontecer com cada cliente.

Este guia ajuda você a reconhecer uma operação de Personal Data Mining, registrá-la em um modelo prático e priorizar riscos sem tratar toda análise como igualmente perigosa. A conformidade não depende apenas da ferramenta usada. Ela também envolve o contexto, a justificativa do tratamento, a qualidade das entradas, a possibilidade de contestação e a intensidade do efeito sobre as pessoas.

Principais pontos

  • A mineração de dados pessoais começa quando você cruza informações para classificar pessoas, prever comportamentos ou orientar ações.
  • Uma inferência associada a uma pessoa continua sendo dado pessoal, mesmo que não tenha sido informada diretamente pelo titular.
  • Consentimento e legítimo interesse não são escolhas automáticas; a base legal depende da finalidade, do contexto e das características do tratamento.
  • O risco aumenta quando uma pontuação influencia preço, acesso, prioridade, bloqueio ou outra condição relevante para o titular.
  • Prazos de piloto, reavaliação e descarte devem ser definidos conforme o risco, o ciclo do negócio e as obrigações aplicáveis, e não copiados como padrões universais.
  • A incidência do artigo 20 da LGPD precisa ser examinada a partir do texto legal e validada juridicamente no caso concreto.

O que é Personal Data Mining e como ele aparece nas empresas

Personal Data Mining é o uso de técnicas analíticas, modelos ou regras para encontrar relações, tendências e inferências em conjuntos que contêm dados pessoais. As entradas podem ter sido fornecidas pelo titular, como cadastro e endereço; observadas durante o serviço, como cliques e frequência de uso; ou produzidas pela própria análise, como uma pontuação de propensão ao cancelamento.

Guardar cadastros, localizar um pedido ou emitir um relatório de faturamento não caracteriza necessariamente mineração. A diferença aparece quando você cruza informações para classificar alguém, prever uma conduta ou orientar uma ação individual ou coletiva. Na empresa de software, contar assinaturas ativas é um relatório descritivo. Combinar atrasos, chamados e redução de acesso para atribuir um nível de risco a cada cliente envolve geração de inferência.

Essa distinção também ajuda a separar mineração, perfilamento e decisão automatizada. A mineração encontra padrões ou relações. O perfilamento utiliza dados para avaliar ou prever aspectos relacionados a uma pessoa. A decisão automatizada emprega processamento automático para produzir uma decisão. As três práticas podem ocorrer juntas, mas uma não pressupõe necessariamente as outras. Você pode, por exemplo, usar um modelo para ordenar uma fila e manter a decisão final com uma pessoa, ou identificar uma tendência agregada sem criar um perfil individual.

Uma classificação ligada a um cliente é um dado inferido, e não se torna anônima apenas porque não foi declarada pelo titular. Expressões como “probabilidade elevada de cancelamento” ou “transação que requer verificação” podem afetar o atendimento e permanecem associadas a uma pessoa identificada ou identificável. Retirar nome e CPF também não basta se você ainda consegue relacionar o registro ao indivíduo por identificadores, combinações de atributos ou bases auxiliares.

A explicação jurídica da anonimização deve seguir o artigo 12 da Lei nº 13.709/2018. Segundo esse dispositivo, dados anonimizados não são considerados dados pessoais para os fins da LGPD, salvo quando o processo puder ser revertido com meios próprios exclusivamente ou quando a reversão puder ocorrer com esforços razoáveis. A própria lei determina que a avaliação dos esforços razoáveis considere fatores objetivos, como custo e tempo necessários, tecnologias disponíveis na ocasião do tratamento e utilização exclusiva de meios próprios. Portanto, anonimização exige análise contextual e atualizada; não é uma garantia permanente baseada apenas na remoção de campos óbvios.

A LGPD não cria uma categoria jurídica chamada Personal Data Mining nem proíbe automaticamente a prática. Você deve examinar cada operação segundo os princípios do artigo 6º, incluindo finalidade, adequação, necessidade, livre acesso, qualidade dos dados, transparência, segurança, prevenção, não discriminação e responsabilização. O efeito sobre a pessoa pode ser tão importante quanto a complexidade da tecnologia empregada.

Os exemplos abaixo mostram como entradas semelhantes podem produzir resultados e consequências diferentes. Eles não determinam, por si sós, a conformidade. Servem para você localizar o ponto em que um relatório operacional passa a orientar classificação, priorização ou intervenção sobre pessoas.

Comparação de usos comuns de mineração de dados pessoais
Critério Segmentação de clientes Previsão de cancelamento Recomendação de produtos Possível fraude
Dados de entrada Compras e respostas a campanhas Uso, atrasos e chamados Compras e navegação Transação, dispositivo e histórico
Resultado Grupo com interesse provável Pontuação de risco Produto com afinidade estimada Sinalização para verificação
Efeito possível Seleção de comunicação Priorização de retenção Ordenação de ofertas Revisão ou bloqueio da compra
Pergunta principal O agrupamento é adequado ao contexto? A pontuação representa a situação atual? Os dados usados são necessários para ordenar ofertas? Como um erro poderá ser identificado e contestado?

Como avaliar e estruturar uma operação de mineração de dados pessoais

Para estruturar a operação, comece por uma decisão concreta, e não pelo desejo genérico de aproveitar todos os dados disponíveis. Na empresa fictícia, você pode formular o caso de uso como “ordenar a fila de contatos de retenção para que a equipe avalie quais clientes devem receber uma oferta”. Essa descrição informa o limite do projeto: a pontuação organiza o trabalho, mas não autoriza automaticamente restringir descontos, alterar preços ou suspender contas.

Diferentes fontes convergem para um mecanismo de separação, ilustrando o cruzamento de informações em uma empresa.

Transforme essa descrição em uma ficha preenchível para cada caso de uso. A ficha deve permitir que outra pessoa compreenda o fluxo sem depender da explicação verbal de quem criou o modelo. Registre o nome do processo, a área responsável, a decisão apoiada, o público atingido, o resultado esperado, as fontes utilizadas, os campos efetivamente consumidos, as transformações realizadas, a saída produzida, os destinatários da saída e a ação permitida. Acrescente o responsável por aprovar mudanças e a evidência usada para considerar o resultado suficientemente confiável.

Um preenchimento resumido para o exemplo seria: processo “priorização de retenção”; responsável “gestão de relacionamento”; público “clientes com assinatura ativa”; entradas “frequência de uso, atrasos e chamados”; saída “faixa de propensão ao cancelamento”; destinatário “equipe de retenção”; ação permitida “ordenar contatos”; ação não permitida “alterar preço ou bloquear funcionalidades”; indicador operacional “capacidade de identificar clientes que aceitam conversar sobre retenção”; condição de interrupção “aumento de reclamações ou desempenho inconsistente em grupos comparáveis”. Assim, você converte um mapeamento abstrato em um registro que pode ser testado e auditado.

Mapeie também a linhagem dos dados. Para cada campo, anote se ele foi fornecido pela pessoa, observado durante o serviço, recebido de terceiro ou inferido internamente. Identifique o sistema de origem, a frequência de atualização e as transformações aplicadas. Nenhuma fonte deve entrar apenas porque está tecnicamente acessível. Se um fornecedor enriquecer a base, registre o que ele entrega, de onde declara obter os dados e quais responsabilidades contratuais assume. Informações publicamente acessíveis continuam sujeitas à LGPD e não devem ser tratadas como recursos sem restrições.

A hipótese de base legal integra a ficha, mas precisa de uma análise própria antes do uso. Examine a operação completa, e não somente a coleta inicial. Consentimento não é obrigatório em todos os casos, enquanto legítimo interesse não funciona como autorização genérica. O Guia Orientativo das Hipóteses Legais de Tratamento de Dados Pessoais — Legítimo Interesse, publicado pela ANPD, apresenta parâmetros para a avaliação dessa hipótese, incluindo finalidade, necessidade, balanceamento e salvaguardas. Outros fundamentos do artigo 7º ou, no caso de dados pessoais sensíveis, do artigo 11 da LGPD podem ser aplicáveis conforme a relação e o contexto. Se houver dúvida, submeta a escolha à validação jurídica.

Depois de preencher a ficha, estabeleça portões de passagem. O primeiro confirma se o objetivo está delimitado e se cada entrada tem contribuição justificável. O segundo verifica se a origem dos dados, a hipótese legal e a informação oferecida ao titular estão documentadas. O terceiro testa o comportamento da análise em ambiente controlado. O quarto autoriza o uso operacional apenas dentro das ações previstas. Mudanças de fonte, finalidade, público, modelo ou consequência devem fazer o caso retornar ao portão correspondente.

O teste controlado pode ter duração definida, mas não existe um prazo universal. Um piloto de 30 dias, por exemplo, é apenas um parâmetro inicial adaptável à frequência das transações, ao volume necessário para observar o comportamento do modelo e à gravidade de um possível erro. Em um negócio sazonal, 30 dias talvez não representem um ciclo completo; em um serviço de alta frequência, o período pode ser excessivo. Registre por que o prazo escolhido é suficiente e quais eventos exigirão encerramento antecipado.

A mesma lógica vale para reavaliação e descarte. Rever a pontuação a cada seis meses ou descartar variáveis sem uso após 12 meses são exemplos de parâmetros internos, não exigências gerais da LGPD. Você deve ajustar esses intervalos ao ciclo do negócio, à velocidade de mudança dos dados, às obrigações legais, à possibilidade de contestação e ao dano potencial de manter uma classificação desatualizada. A retenção precisa ter justificativa por categoria de dado, e o término do tratamento deve observar as hipóteses e exceções dos artigos 15 e 16 da LGPD.

Antes da entrada em produção, conecte a ficha aos procedimentos já existentes para atendimento dos titulares. Defina como sua equipe localizará entradas e inferências, como registrará uma contestação, como corrigirá dados inexatos e como comunicará mudanças aos sistemas que recebem a pontuação. Separe permissões para dados brutos, perfis e resultados conforme a função de cada equipe. Esses elementos não precisam estar embutidos no algoritmo, mas devem funcionar ao redor dele.

O artigo 20 merece cuidado específico. O texto legal assegura ao titular o direito de solicitar a revisão de decisões tomadas unicamente com base em tratamento automatizado de dados pessoais que afetem seus interesses, incluídas as decisões destinadas a definir perfil pessoal, profissional, de consumo e de crédito ou aspectos de sua personalidade. O controlador também deve fornecer, quando solicitado, informações claras e adequadas sobre critérios e procedimentos utilizados, observados os segredos comercial e industrial. A lei não oferece uma lista fechada de todas as decisões que “afetem interesses”, e você não deve presumir que qualquer apoio computacional torna a decisão unicamente automatizada.

Consulte o texto atualizado da LGPD em fonte oficial e as orientações vigentes da ANPD, além de obter validação jurídica para o caso concreto, sobretudo quando houver preço, crédito, acesso, bloqueio, prioridade ou outra consequência relevante.

Conclua a estruturação com um registro de aprovação. Ele deve indicar quem avaliou o caso, quais condições limitam o uso, por quanto tempo o teste foi autorizado e quais mudanças exigem nova análise. Esse registro não prova sozinho a conformidade, mas evita que uma experiência limitada se transforme silenciosamente em uma infraestrutura permanente e utilizada para finalidades mais amplas.

Riscos que exigem atenção e erros que comprometem a conformidade

Depois de estruturar o fluxo, você precisa priorizar riscos. Não coloque discriminação, falsos positivos, incidentes de segurança e falhas operacionais em uma lista sem hierarquia. Classifique cada cenário segundo a gravidade da consequência, a quantidade de pessoas expostas, a probabilidade de ocorrência, a dificuldade de perceber o erro e a possibilidade de reparar o efeito. Um resultado facilmente corrigível e usado apenas para sugerir a ordem de uma campanha não recebe a mesma prioridade de um bloqueio silencioso que impede uma compra.

Comece pelos riscos de qualidade e validade. Um modelo pode apresentar bom desempenho médio e ainda falhar quando os dados ficam antigos, incompletos ou deixam de representar o contexto atual. Na empresa de software, meses de instabilidade podem reduzir o uso de diversos clientes. Se o serviço voltar ao normal, uma pontuação treinada naquele período talvez continue interpretando o comportamento como intenção de cancelamento. Para priorizar esse risco, verifique quanto tempo o erro permanece invisível, quantas ações ele aciona e se existe evidência independente que permita reconhecer a mudança de contexto.

Variáveis substitutas também exigem investigação, mas você não deve afirmar que determinado campo revela renda, origem social, saúde ou religião sem evidência técnica aplicável ao seu conjunto de dados. Trate essa possibilidade como uma hipótese a ser testada. Se resultados internos mostrarem que uma variável geográfica ou comportamental está associada a diferenças persistentes entre grupos relevantes, documente a análise, investigue explicações alternativas e avalie se o atributo contribui legitimamente para o objetivo. Quando você não dispõe de fonte técnica, teste documentado ou justificativa verificável, não apresente a associação como fato.

O risco de discriminação deve ser priorizado pelo efeito, e não apenas pela presença de um atributo sensível explícito. Compare taxas de sinalização, erro e resultado entre grupos quando essa comparação for juridicamente adequada e tecnicamente viável. Procure diferenças persistentes que possam resultar em exclusão, pior condição comercial ou vigilância mais intensa. Uma disparidade não demonstra automaticamente discriminação, mas exige investigação. A análise deve considerar a qualidade das amostras, o contexto e possíveis fatores de confusão, com apoio especializado quando necessário.

Falsos positivos formam uma categoria própria porque a urgência depende da consequência. Uma sinalização de possível fraude enviada para verificação antes da cobrança é diferente de um bloqueio automático sem explicação nem canal de contestação. Pergunte o que acontece imediatamente após o alerta, quanto tempo a pessoa permanece afetada e se a reversão recompõe a situação original. Quanto mais difícil for reparar o efeito, menor deve ser a tolerância a erros e mais forte deve ser a intervenção antes da ação.

Riscos de segurança decorrem da concentração e da conectividade do ambiente. Ao cruzar CRM, navegação, suporte e pagamentos, você pode criar uma base mais reveladora do que cada sistema isolado. Priorize cenários segundo o valor informacional do conjunto, a exposição a fornecedores, a possibilidade de movimentação lateral entre sistemas e a capacidade de detectar uso indevido. Medidas proporcionais podem incluir segregação de ambientes, autenticação adequada, registro de eventos, cópias de segurança, gestão de vulnerabilidades e plano de resposta a incidentes. O Guia Orientativo sobre Segurança da Informação para Agentes de Tratamento de Pequeno Porte, da ANPD, oferece referências práticas, mas você precisa adaptá-las à sua estrutura e ao risco real.

Falhas operacionais surgem quando pessoas interpretam a pontuação como certeza, ignoram as limitações do modelo ou ampliam seu uso sem autorização. Um atendente pode tratar “maior propensão” como confirmação de que o cliente pretende sair. Uma equipe comercial pode reutilizar a mesma classificação para negar benefícios, embora o projeto original só previsse ordenar contatos. Para reduzir esse risco, apresente a saída com linguagem compatível com sua incerteza, treine quem a utiliza e impeça tecnicamente ações que estejam fora do escopo aprovado quando isso for viável.

Ferramentas de terceiros acrescentam riscos de opacidade e dependência. Não aceite integralmente uma classificação apenas porque o fornecedor a chama de inteligência artificial ou informa uma taxa geral de desempenho. Solicite documentação compatível com o seu papel no tratamento, identifique quais entradas serão enviadas, quais saídas retornarão e se o fornecedor utilizará os dados para objetivos próprios. Se você não consegue explicar minimamente a origem, a função e a consequência da pontuação, considere se o uso é defensável no contexto pretendido.

Registre os cenários prioritários em uma matriz de risco, com responsável e evidência de tratamento. Encaminhe para avaliação aprofundada os casos com dados sensíveis, crianças e adolescentes, monitoramento sistemático, cruzamentos extensivos, grande concentração de informações ou consequências difíceis de reverter. Um Relatório de Impacto à Proteção de Dados Pessoais não é automaticamente obrigatório para toda mineração, mas pode apoiar a documentação de operações de maior risco e pode ser solicitado pela ANPD nas hipóteses previstas na LGPD.

Os erros que mais comprometem o processo são aqueles que impedem você de enxergar o risco: confiar apenas na precisão média, omitir inferências do inventário, presumir que dados públicos são livres, usar a classificação fora do contexto testado, aceitar resultados de fornecedor sem exame e manter uma automação sem identificar quem responde por seus efeitos. A prioridade deve recair primeiro sobre cenários graves, amplos, pouco detectáveis e de reparação difícil.

Perguntas frequentes

Personal Data Mining é proibido pela LGPD?

Não. A LGPD não proíbe genericamente a mineração de dados pessoais. Você deve avaliar a finalidade, a base legal, as categorias de dados, a necessidade dos cruzamentos, a transparência, a segurança e os efeitos sobre os titulares. Usos discriminatórios, excessivos ou incompatíveis com o contexto podem violar a lei.

É necessário obter consentimento para minerar dados pessoais?

Não em todos os casos. Consentimento é uma das bases legais previstas na LGPD, mas não é a única. A escolha depende da finalidade, da relação com o titular, da categoria dos dados e das características do tratamento. O legítimo interesse exige análise concreta de finalidade, necessidade, balanceamento e salvaguardas; não funciona como justificativa automática.

Dados encontrados em fontes públicas podem ser usados livremente em análises?

Não. O acesso público não elimina os princípios, as bases legais e os direitos previstos na LGPD. Você precisa considerar o contexto da publicação, a finalidade do novo tratamento e os efeitos sobre o titular. Uma informação publicada para consulta específica não se torna automaticamente adequada para formar perfis comerciais.

Uma inferência ou pontuação criada pela empresa também é considerada dado pessoal?

Sim, quando estiver associada ou puder ser associada a uma pessoa identificada ou identificável. Uma pontuação de risco, uma preferência estimada ou uma classificação comportamental pode integrar o tratamento de dados pessoais. Os pedidos de acesso devem observar o artigo 19 da LGPD, que prevê formato simplificado imediatamente ou declaração clara e completa em até 15 dias, conforme a modalidade requerida.

Qual é a diferença entre mineração, perfilamento e decisão automatizada?

Mineração encontra padrões e relações; perfilamento utiliza dados para avaliar ou prever aspectos de uma pessoa; decisão automatizada produz uma decisão por processamento automático. As práticas podem aparecer juntas, mas não são equivalentes. Você pode usar uma pontuação apenas como apoio para uma avaliação humana real, ou encontrar uma tendência agregada sem criar um perfil individual.

Quando o artigo 20 da LGPD pode ser aplicável?

O artigo 20 trata de decisões tomadas unicamente com base em tratamento automatizado de dados pessoais que afetem os interesses do titular, incluindo decisões destinadas a definir determinados perfis. A aplicação depende de saber se houve efetiva decisão, se ela foi unicamente automatizada e se afetou interesses. Como esses elementos exigem análise contextual, consulte o texto legal atualizado, as orientações vigentes da ANPD e apoio jurídico para o caso concreto.

Dados anonimizados podem voltar a ser alcançados pela LGPD?

Podem, se o processo de anonimização puder ser revertido com meios próprios exclusivamente ou com esforços razoáveis. Conforme o artigo 12, a avaliação considera fatores objetivos, como custo, tempo e tecnologias disponíveis na ocasião do tratamento. Remover nome e CPF não basta quando outros atributos ainda permitem relacionar o registro a uma pessoa.

Existe prazo obrigatório de 30 dias para piloto, seis meses para revisão ou 12 meses para descarte?

Não como regra geral da LGPD. Esses períodos são exemplos de parâmetros internos. Você deve adaptá-los à frequência das operações, ao ciclo do negócio, à velocidade de mudança dos dados, às obrigações legais e à gravidade de possíveis erros, registrando a justificativa de cada prazo.

Quando uma operação de mineração pode exigir avaliação de impacto mais aprofundada?

Considere aprofundar a avaliação quando houver dados sensíveis, crianças e adolescentes, grande escala, cruzamento extensivo, monitoramento sistemático ou decisões com consequências relevantes e difíceis de reverter. O Relatório de Impacto à Proteção de Dados Pessoais não é uma obrigação automática para todo projeto, mas pode documentar operações de maior risco e pode ser solicitado pela ANPD nas hipóteses previstas na LGPD.

Conclusão

Antes de contratar uma nova ferramenta ou aumentar o volume analisado, escolha uma operação real e desenhe o caminho entre entrada, inferência, decisão e efeito. Preencha a ficha do caso de uso, limite as ações autorizadas e justifique os parâmetros de teste e ciclo de vida conforme o risco do seu negócio.

Em seguida, priorize cenários pela gravidade, alcance, probabilidade, detectabilidade e reversibilidade. Essa separação evita que a estruturação do processo se confunda com a análise de risco e ajuda você a concentrar recursos onde um erro pode causar consequências mais sérias.

Se a análise envolver dados sensíveis, pessoas vulneráveis, cruzamentos extensivos ou decisões potencialmente abrangidas pelo artigo 20, procure apoio técnico e jurídico antes da implantação. Personal Data Mining pode apoiar decisões úteis, mas você precisa manter as inferências compreensíveis, contestáveis e limitadas ao contexto em que foram avaliadas.

Qual desafio você quer resolver hoje?

Nós temos a solução.

Lidar com os requerimentos dos titulares de dados.

Conheça a solução completa para adequação à LGPD e GDPR.

Fale conosco!

Artigos recentes