Tutorial de mineração de dados: O que é mineração de dados? Técnicas, Processo

⚡ Resumo Inteligente

A mineração de dados é o processo de encontrar padrões potencialmente úteis em grandes conjuntos de dados. Esta página explica o processo de implementação em seis fases, sete técnicas principais, as ferramentas que as suportam, exemplos reais de negócios e os benefícios e limitações de cada abordagem.

  • 🔍 Definição: A mineração de dados utiliza aprendizado de máquina, estatística e IA para extrair informações valiosas.tract relações ocultas em grandes conjuntos de dados.
  • 🗂️ Fontes de dados: Bancos de dados relacionais, data warehouses, repositórios transacionais, espaciais, multimídia e de texto, todos suportam mineração de dados.
  • 🔄 Processo de implementação: Compreensão de negócios, compreensão de dados, preparação de dados, modelagem, avaliação e implementação.
  • 🧩 Técnicas principais: Classificação, agrupamento, regressão, regras de associação, detecção de outliers, padrões sequenciais e previsão.
  • 🛠️ Ferramentas: R e Oracle O aprendizado de máquina fornece computação estatística e modelagem preditiva em bancos de dados.
  • 🏢 Aplicações: Os setores bancário, varejista, de seguros, educacional, industrial e de investigação criminal aplicam a mineração de dados em suas decisões diárias.
  • ⚠️ Limitações: O sobreajuste, a escassez de competências e as preocupações com a privacidade limitam o grau de confiabilidade dos resultados.

O que é Mineração de Dados, suas técnicas e processos?

O que é mineração de dados?

Data Mining é um processo de encontrar padrões potencialmente úteis em grandes conjuntos de dados. É uma habilidade multidisciplinar que utiliza aprendizado de máquina, estatísticas e IA para extracA mineração de dados permite avaliar a probabilidade de eventos futuros. Os insights obtidos por meio dessa ferramenta são utilizados em marketing, detecção de fraudes, descobertas científicas, entre outras aplicações.

A mineração de dados consiste em descobrir relações ocultas, inesperadas e até então desconhecidas, porém válidas, entre os dados. A mineração de dados também é chamada de Descoberta de Conhecimento em Dados (KDD, do inglês Knowledge Discovery in Data).tracção, análise de dados/padrões, coleta de informações, etc.

Tipos de dados

A mineração de dados pode ser realizada nos seguintes tipos de dados

  • Bancos de dados relacionais
  • Armazéns de dados
  • Banco de dados avançado e repositórios de informações
  • Bancos de dados orientados a objetos e relacionais a objetos
  • Bancos de dados transacionais e espaciais
  • Bancos de dados heterogêneos e legados
  • Banco de dados multimídia e streaming
  • Bancos de dados de texto
  • Mineração de texto e mineração na Web

Independentemente da origem, a mesma sequência disciplinada de fases transforma esses dados brutos em um modelo utilizável.

Processo de Implementação de Mineração de Dados

Processo de implementação de mineração de dados
Processo de implementação de mineração de dados

Vamos estudar detalhadamente o processo de implementação de Data Mining

Compreensão de negócios

Nesta fase, são estabelecidas metas de negócios e de mineração de dados.

  • Primeiro, você precisa entender os objetivos do negócio e do cliente. Você precisa definir o que seu cliente deseja (o que muitas vezes nem ele mesmo sabe)
  • Faça um balanço do cenário atual de mineração de dados. Considere recursos, suposições, restrições e outros fatores significativos em sua avaliação.
  • Usando os objetivos de negócios e o cenário atual, defina suas metas de mineração de dados.
  • Um bom plano de mineração de dados é muito detalhado e deve ser desenvolvido para atingir os objetivos de negócios e de mineração de dados.

Compreensão de dados

Nesta fase, realiza-se uma verificação de integridade dos dados para verificar se são adequados aos objetivos da mineração de dados.

  • Primeiramente, os dados são coletados de múltiplas fontes de dados disponíveis na organização.
  • Essas fontes de dados podem incluir vários bancos de dados, arquivos simples ou cubos de dados. Problemas como correspondência de objetos e integração de esquemas podem surgir durante o processo de integração de dados. É um processo bastante complexo e delicado, pois é improvável que os dados de diversas fontes correspondam facilmente. Por exemplo, a tabela A contém uma entidade chamada cust_no, enquanto outra tabela, a tabela B, contém uma entidade chamada cust-id.
  • Portanto, é muito difícil garantir que ambos os objetos referem-se ao mesmo valor ou não. Aqui, os metadados devem ser usados ​​para reduzir erros no processo de integração de dados.
  • A seguir, a etapa é buscar as propriedades dos dados adquiridos. Uma boa maneira de explorar os dados é responder às questões de mineração de dados (decididas na fase de negócios) usando as ferramentas de consulta, geração de relatórios e visualização.
  • Com base nos resultados da consulta, deve-se verificar a qualidade dos dados. Quaisquer dados faltantes devem ser obtidos.

Preparação de dados

Nesta fase, os dados ficam prontos para produção.

A preparação de dados é normalmente a fase mais longa, representando geralmente de 60% a 80% do esforço total.

Os dados de diferentes fontes devem ser selecionados, limpos, transformados, formatados, anonimizados e estruturados (se necessário).

A limpeza de dados é um processo para “limpar” os dados, suavizando dados ruidosos e preenchendo valores ausentes.

Por exemplo, para um perfil demográfico de cliente, faltam dados de idade. Os dados estão incompletos e devem ser preenchidos. Em alguns casos, pode haver dados discrepantes. Por exemplo, a idade tem um valor 300. Os dados podem ser inconsistentes. Por exemplo, o nome do cliente é diferente em tabelas diferentes.

As operações de transformação de dados modificam os dados para torná-los úteis na mineração de dados. As seguintes transformações podem ser aplicadas.

Transformação de dados

As operações de transformação de dados contribuiriam para o sucesso do processo de mineração.

Suavização: Ajuda a remover o ruído dos dados.

Agregação: Operações de resumo ou agregação são aplicadas aos dados. Ou seja, os dados de vendas semanais são agregados para calcular o total mensal e anual.

Generalização: Nesta etapa, os dados de baixo nível são substituídos por conceitos de nível superior com o auxílio de hierarquias de conceitos. Por exemplo, a cidade é substituída pelo estado ou pelo país.

Normalização: A normalização é realizada quando os dados dos atributos são ampliados ou reduzidos. Exemplo: após a normalização, os dados devem estar no intervalo de -2.0 a 2.0.

Construção de atributoEsses atributos são construídos e incluídos no conjunto de atributos fornecidos, úteis para mineração de dados.

O resultado deste processo é um conjunto de dados final que pode ser utilizado na modelagem.

Modelagem

Nesta fase, modelos matemáticos são usados ​​para determinar padrões de dados.

  • Com base nos objetivos de negócio, devem ser selecionadas técnicas de modelagem adequadas para o conjunto de dados preparado.
  • Crie um cenário para testar a qualidade e validade do modelo.
  • Execute o modelo no conjunto de dados preparado.
  • Os resultados devem ser avaliados por todas as partes interessadas para garantir que o modelo possa cumprir os objetivos de mineração de dados.

Avaliação

Nesta fase, os padrões identificados são avaliados em relação aos objetivos de negócio.

  • Os resultados gerados pelo modelo de mineração de dados devem ser avaliados em relação aos objetivos de negócio.
  • Obter compreensão do negócio é um processo iterativo. Na verdade, durante a compreensão, novos requisitos de negócios podem ser levantados devido à mineração de dados.
  • Uma decisão de avançar ou não é tomada para mover o modelo na fase de implantação.

desenvolvimento

Na fase de implantação, você envia suas descobertas de mineração de dados para as operações comerciais diárias.

  • O conhecimento ou informação descoberto durante o processo de mineração de dados deve ser de fácil compreensão para as partes interessadas não técnicas.
  • Um plano de implantação detalhado para o navio.pingÉ criada uma infraestrutura para a manutenção e o monitoramento das descobertas de mineração de dados.
  • Um relatório final do projeto é criado com as lições aprendidas e as principais experiências durante o projeto. Isso ajuda a melhorar a política de negócios da organização.

A fase de modelagem acima se baseia em um conjunto definido de técnicas, cada uma adequada a um tipo diferente de questão.

Técnicas de Mineração de Dados

1. Classificação

Esta análise é usada para recuperar informações importantes e relevantes sobre dados e metadados. Este método de mineração de dados ajuda a classificar os dados em diferentes classes.

2. Clustering

ClusterA análise de dados é uma técnica de mineração de dados para identificar dados semelhantes entre si. Este processo ajuda a compreender as diferenças e semelhanças entre os dados.

3. Regressão

A análise de regressão é o método de mineração de dados para identificar e analisar a relação entre as variáveis. É utilizado para identificar a probabilidade de uma variável específica, dada a presença de outras variáveis.

4. Regras de associação

Esta técnica de mineração de dados ajuda a encontrar a associação entre dois ou mais itens. Ele descobre um padrão oculto no conjunto de dados.

5. Detecção de Outliers

Essa técnica de mineração de dados se refere à observação de itens em um conjunto de dados que não correspondem a um padrão ou comportamento esperado. Ela pode ser utilizada em diversas áreas, como detecção de intrusões, fraudes ou falhas, entre outras. A detecção de outliers também é chamada de análise de outliers ou mineração de outliers.

6. Padrões Sequenciais

Esta técnica de mineração de dados ajuda a descobrir ou identificar padrões ou tendências semelhantes em dados de transações durante um determinado período.

7. Predição

A previsão usou uma combinação de outras técnicas de mineração de dados, como tendências, padrões sequenciais, agrupamento, classificação, etc. Ela analisa eventos ou instâncias passadas em uma sequência correta para prever um evento futuro.

DescriptMineração de dados preditiva versus mineração de dados preditiva

As sete técnicas acima se dividem em duas famílias, e saber a qual família uma questão pertence determina como o resultado deve ser interpretado.

Descriptmineração de dados ativa Resume o que já aconteceu. Busca estrutura nos dados existentes sem nenhum objetivo específico, razão pela qual às vezes é chamado de aprendizado não supervisionado. ClusterRegras de associação e padrões sequenciais pertencem a este contexto. Um supermercado que aprende que fraldas e cerveja são frequentemente compradas juntas está fazendo uma descoberta descritiva: isso explica o passado, e um ser humano decide o que fazer a respeito.

Mineração de dados preditiva Estima o que acontecerá a seguir. Aprende com registros históricos onde a resposta já é conhecida e, em seguida, aplica esse aprendizado a novos registros, razão pela qual é chamado de aprendizado supervisionado. Classificação, regressão e previsão se enquadram nessa categoria. Avaliar a probabilidade de um solicitante de empréstimo em relação à inadimplência é uma descoberta preditiva.

Dessa distinção decorrem duas consequências práticas.

  • A validação difere: Um modelo preditivo pode ser avaliado quanto à sua precisão em relação a resultados conhecidos. Um resultado descritivo não pode, portanto, é avaliado com base em seu interesse e aplicabilidade prática.
  • Os requisitos de dados diferem: O trabalho preditivo precisa de uma coluna com os resultados históricos devidamente identificados. DescriptO trabalho de pesquisa não faz isso, o que o torna o ponto de partida usual quando uma empresa tem dados, mas ainda não tem um objetivo claro.

Desafios da implementação da mineração de dados

  • São necessários especialistas qualificados para formular as consultas de mineração de dados.
  • Overfitting: Devido ao pequeno tamanho do banco de dados de treinamento, um modelo pode não se ajustar a estados futuros.
  • A mineração de dados precisa de grandes bancos de dados que às vezes são difíceis de gerenciar
  • As práticas comerciais podem precisar ser modificadas para determinar o uso das informações descobertas.
  • Se o conjunto de dados não for diversificado, os resultados da mineração de dados poderão não ser precisos.
  • As informações de integração necessárias de bancos de dados heterogêneos e sistemas de informação globais podem ser complexas

Exemplos de Mineração de Dados

Agora neste curso de Mineração de Dados, vamos aprender sobre Mineração de Dados com exemplos:

1 exemplo:

Considere um diretor de marketing de uma empresa de telecomunicações que deseja aumentar a receita com serviços de longa distância. Para um alto retorno sobre o investimento (ROI) em seus esforços de vendas e marketing, o perfil do cliente é fundamental. Ele possui um vasto banco de dados com informações sobre os clientes, como idade, sexo, renda, histórico de crédito, etc. No entanto, é impossível determinar as características das pessoas que preferem fazer ligações de longa distância apenas com análise manual. Utilizando técnicas de mineração de dados, ele pode descobrir padrões entre os usuários frequentes de ligações de longa distância e suas características.

Por exemplo, ele pode descobrir que seus melhores clientes são mulheres casadas, com idade entre 45 e 54 anos, que ganham mais de US$ 80,000 mil por ano. Os esforços de marketing podem ser direcionados a esse grupo demográfico.

2 exemplo:

Um banco quer buscar novas maneiras de aumentar a receita com suas operações de cartão de crédito. Eles querem verificar se o uso dobraria caso as taxas fossem reduzidas pela metade.

O banco possui registros de vários anos sobre saldos médios de cartões de crédito, valores pagos, utilização do limite de crédito e outros parâmetros importantes. Eles criaram um modelo para verificar o impacto da nova política comercial proposta. Os resultados dos dados mostram que reduzir as tarifas pela metade para uma base de clientes específica poderia aumentar a receita em US$ 10 milhões.

Mineração de dados versus aprendizado de máquina

Os dois termos se sobrepõem bastante e são frequentemente usados ​​como sinônimos, mas respondem a perguntas diferentes. A mineração de dados busca descobrir um padrão que uma pessoa desconhecia anteriormente. O aprendizado de máquina busca construir um sistema que aprimore suas próprias previsões à medida que mais dados são coletados.

Ponto de diferença Data Mining Machine Learning
Objetivo principal Descubra padrões desconhecidos em dados existentes. Construa um modelo que faça previsões com base em novos dados.
Envolvimento humano Um analista interpreta os resultados e age de acordo com eles. O algoritmo aplica a regra automaticamente.
volume de dados Trabalha com um conjunto de dados históricos definidos. Melhora à medida que mais dados são fornecidos ao longo do tempo.
Saída típica Uma regra, conjunto ou associação que uma pessoa pode ler. Um modelo treinado que retorna uma pontuação ou classe.
Relacionamento A mineração de dados frequentemente utiliza algoritmos de aprendizado de máquina como seu mecanismo principal.

Resumindo, o aprendizado de máquina é um dos conjuntos de ferramentas utilizados na mineração de dados, e a mineração de dados simples pode ser feita apenas com estatística.

Ferramentas de mineração de dados

A seguir estão 2 populares Ferramentas de mineração de dados amplamente utilizado na indústria

Linguagem R:

Linguagem R é uma ferramenta de código aberto para computação estatística e gráficos. R possui uma ampla variedade de testes estatísticos clássicos, análise de séries temporais, classificação e técnicas gráficas. Ele oferece facilidade eficaz de manuseio e armazenamento de dados.

Saiba mais aqui

Oracle Mineração de dados:

Oracle Data Mining, popularmente conhecido como ODM, é um módulo do Oracle O Banco de Dados de Análise Avançada agora é fornecido como parte de Oracle Aprendizado de Máquina. Essa ferramenta de mineração de dados permite que analistas de dados gerem insights detalhados e façam previsões. Ela ajuda a prever o comportamento do cliente, desenvolver perfis de clientes e identificar oportunidades de venda cruzada.

Saiba mais aqui

Benefícios da mineração de dados

  • A técnica de mineração de dados ajuda as empresas a obter informações baseadas em conhecimento.
  • A mineração de dados ajuda as organizações a fazer ajustes lucrativos na operação e produção.
  • A mineração de dados é uma solução econômica e eficiente em comparação com outras aplicações de dados estatísticos.
  • A mineração de dados ajuda no processo de tomada de decisão.
  • Facilita a previsão automatizada de tendências e comportamentos, bem como a descoberta automatizada de padrões ocultos.
  • Pode ser implementado em novos sistemas, bem como em plataformas existentes
  • É o processo rápido que facilita aos usuários a análise de grandes quantidades de dados em menos tempo.

Desvantagens da mineração de dados

  • Existe o risco de as empresas venderem informações úteis sobre seus clientes para outras organizações, o que levanta sérias preocupações com a privacidade.
  • Muitos softwares de análise de mineração de dados são difíceis de operar e requerem treinamento avançado para funcionar.
  • Diferentes ferramentas de mineração de dados funcionam de maneiras diferentes devido aos diferentes algoritmos empregados em seu design. Portanto, a seleção da ferramenta correta de mineração de dados é uma tarefa muito difícil.
  • As técnicas de mineração de dados não são precisas e por isso podem causar graves consequências em determinadas condições.

Aplicativos de mineração de dados

Aplicações Uso
Comunicações Na área da comunicação, são utilizadas técnicas de mineração de dados para prever o comportamento do cliente e, assim, oferecer campanhas altamente direcionadas e relevantes.
Seguros A mineração de dados ajuda as companhias de seguros a definir preços lucrativos para seus produtos e promover novas ofertas para seus clientes novos ou existentes.
Educação A mineração de dados beneficia os educadores para acessar dados dos alunos, prever níveis de desempenho e encontrar alunos ou grupos de alunos que precisam de atenção extra. Por exemplo, alunos que são fracos na matéria de matemática.
Manufatura Com a ajuda da mineração de dados, os fabricantes podem prever o desgaste dos ativos de produção. Eles podem antecipar a manutenção, o que os ajuda a minimizar o tempo de inatividade.
Bancário A mineração de dados ajuda o setor financeiro a ter uma visão dos riscos do mercado e a gerir a conformidade regulamentar. Ajuda os bancos a identificar prováveis ​​inadimplentes para decidir se devem emitir cartões de crédito, empréstimos, etc.
Varejo As técnicas de mineração de dados ajudam shoppings e supermercados a identificar e organizar os itens mais vendáveis ​​em locais de destaque. Isso auxilia os lojistas a criarem ofertas que incentivem os clientes a aumentar seus gastos.
Provedores de serviço Provedores de serviços, como os setores de telefonia móvel e serviços públicos, usam a mineração de dados para prever os motivos pelos quais um cliente deixa sua empresa. Eles analisam detalhes de faturamento, interações de atendimento ao cliente, reclamações feitas à empresa para atribuir a cada cliente uma pontuação de probabilidade e oferecer incentivos.
E-Commerce Os sites de comércio eletrônico usam mineração de dados para oferecer vendas cruzadas e incrementais por meio de seus sites. Um dos nomes mais famosos é Amazon, que usam técnicas de mineração de dados para atrair mais clientes para sua loja de comércio eletrônico.
Supermercados A mineração de dados permite que os supermercados desenvolvam regras para prever se seus clientes provavelmente estão grávidas. Ao avaliar seus padrões de compra, eles podem identificar as clientes com maior probabilidade de estarem grávidas. A partir daí, podem direcionar suas vendas para produtos como talco para bebês, sabonete infantil, fraldas e outros itens similares.
Investigação de crimes A mineração de dados ajuda as agências de investigação criminal a mobilizar força de trabalho policial (onde é mais provável que um crime aconteça e quando?), quem procurar numa passagem de fronteira, etc.
Bioinformática A mineração de dados ajuda a extrair dados biológicos de enormes conjuntos de dados coletados em biologia e medicina.

Perguntas Frequentes

Não exatamente. A descoberta de conhecimento em bancos de dados abrange todo o processo, da seleção e limpeza à interpretação. A mineração de dados é a etapa de identificação de padrões dentro desse processo, embora os dois termos sejam usados ​​como sinônimos na prática.

SQL, por exemplo.tracdados de análise, estatísticas para avaliar se um padrão é real, uma linguagem como R ou Pythone conhecimento do domínio do negócio. A comunicação é igualmente importante, pois as conclusões devem convencer as partes interessadas não técnicas.

É legal quando os dados são coletados e usados ​​de forma lícita. Regulamentos como o GDPR exigem uma base legal, limitação de finalidade e, frequentemente, anonimização; portanto, os identificadores pessoais geralmente são removidos antes do início da mineração de dados.

Isso encurta os passos mais lentos. Assistentes de IA escrevem extracO analista formula consultas, sugere regras de limpeza e elabora explicações em linguagem simples de um modelo para as partes interessadas. Ele ainda define a questão de negócios e valida cada resultado.

Sim, como ponto de partida. Descreva os dados e a questão, e um assistente de IA recomendará classificação, agrupamento ou regressão, explicando o porquê. Confirme a escolha com uma amostra de validação antes de adotá-la.

Resuma esta postagem com: