Lar Finanças Pessoais Dados Mining for Big Data - dummies

Dados Mining for Big Data - dummies

Vídeo: Mineração de dados 2025

Vídeo: Mineração de dados 2025
Anonim

A mineração de dados envolve a exploração e análise de grandes quantidades de dados para encontrar padrões para grandes dados. As técnicas surgiram dos campos das estatísticas e da inteligência artificial (AI), com um pouco de gerenciamento de banco de dados jogado na mistura.

Geralmente, o objetivo da mineração de dados é classificação ou previsão. Na classificação, a idéia é classificar os dados em grupos. Por exemplo, um comerciante pode estar interessado nas características daqueles que responderam versus quem não respondeu a uma promoção.

Estas são duas classes. Na predição, a idéia é prever o valor de uma variável contínua. Por exemplo, um comerciante pode estar interessado em prever aqueles que responderão a uma promoção.

Os algoritmos típicos utilizados na mineração de dados incluem o seguinte:

  • Árvores de classificação: Uma técnica de mineração de dados popular que é usada para classificar uma variável categórica dependente com base em medidas de uma ou mais variáveis ​​preditoras. O resultado é uma árvore com nós e links entre os nós que podem ser lidos para formar se - então, regras.

  • Regressão logística: Uma técnica estatística que é uma variante da regressão padrão, mas amplia o conceito para lidar com a classificação. Ele produz uma fórmula que prediz a probabilidade da ocorrência como uma função das variáveis ​​independentes.

  • Redes neurais: Um algoritmo de software que é modelado após a arquitetura paralela dos cérebros dos animais. A rede consiste em nós de entrada, camadas ocultas e nós de saída. Cada unidade recebe um peso. Os dados são dados ao nó de entrada, e por um sistema de teste e erro, o algoritmo ajusta os pesos até encontrar um certo critério de parada. Algumas pessoas compararam isso com uma abordagem de caixa preta.

  • Técnicas de agrupamento como vizinhos K-mais próximos: Uma técnica que identifica grupos de registros similares. A técnica do vizinho mais próximo calcula as distâncias entre o registro e os pontos nos dados históricos (treinamento). Ele então atribui esse registro à classe de seu vizinho mais próximo em um conjunto de dados.

Aqui está um exemplo de árvore de classificação. Considere a situação em que uma companhia de telefone quer determinar quais clientes residenciais podem desconectar seu serviço.

A companhia telefônica possui informações que consistem nos seguintes atributos: quanto tempo a pessoa teve o serviço, quanto ele gasta no serviço, se o serviço tem sido problemático, quer ele tenha o melhor plano de chamada que ele precisa, onde ele vidas, quantos anos ele tem, se ele tem outros serviços agrupados, informações competitivas sobre outros planos de operadoras e se ele ainda tem o serviço.

Claro, você pode encontrar muitos outros atributos do que isso. O último atributo é a variável de resultado; Isto é o que o software usará para classificar os clientes em um dos dois grupos - talvez chamados de stayers e riscos de vôo.

O conjunto de dados é dividido em dados de treinamento e um conjunto de dados de teste. Os dados de treinamento consistem em observações (chamados atributos) e uma variável de resultado (binária no caso de um modelo de classificação) - neste caso, os stayers ou os riscos de vôo.

O algoritmo é executado sobre os dados de treinamento e vem com uma árvore que pode ser lida como uma série de regras. Por exemplo, se os clientes estiveram com a empresa há mais de dez anos e têm mais de 55 anos, é provável que permaneçam como clientes fiéis.

Essas regras são executadas em cima do conjunto de dados de teste para determinar o quão bom este modelo está em "novos dados". "As medidas de precisão são fornecidas para o modelo. Por exemplo, uma técnica popular é a matriz de confusão. Esta matriz é uma tabela que fornece informações sobre quantos casos foram corretamente contra incorretamente classificados.

Se o modelo parece ser bom, ele pode ser implantado em outros dados, pois está disponível (isto é, usá-lo para prever novos casos de risco de vôo). Com base no modelo, a empresa pode decidir, por exemplo, enviar ofertas especiais para aqueles clientes que acha que são riscos de vôo.

Dados Mining for Big Data - dummies

Escolha dos editores

Noções básicas do arquivo de dados Flashback da Oracle 12c - dummies

Noções básicas do arquivo de dados Flashback da Oracle 12c - dummies

O Flashback Data Archive do oracle 12c é um mecanismo de banco de dados que permite que você para armazenar periodicamente ou indefinidamente todas as versões de linha em uma tabela ao longo da sua vida útil. Você pode então escolher uma hora para ver os dados como existia em um ponto específico. Esteja ciente de que o Flashback Data Archive é um recurso licenciado. ...

Noções básicas de clusters de aplicativos reais do Oracle 12c - manequins

Noções básicas de clusters de aplicativos reais do Oracle 12c - manequins

Se você visitou os sites da Oracle nos últimos 12 anos , você viu o byline de marketing: "Inquebrável. "Essa linha de tag refere-se ao recurso Real Application Clusters (RAC). Claro, muitos elementos estão envolvidos, mas o RAC tem o destaque. O RAC é a solução de clustering de banco de dados Oracle. Em certo sentido, funciona na teoria de que ...

Noções básicas de Redo Log Files no Oracle 12c - dummies

Noções básicas de Redo Log Files no Oracle 12c - dummies

Redo os arquivos de log armazenam as informações do buffer de log no banco de dados Oracle 12c. Eles são escritos pelo Log Writer (LGWR). Mais uma vez, você não pode ler esses arquivos binários sem a ajuda do software de banco de dados. Normalmente, os arquivos de reto de log são nomeados com a extensão. LOG ou. RDO. Pode ser qualquer coisa que você queira, ...

Escolha dos editores

São orgasmos ok durante a gravidez? - Dummies

São orgasmos ok durante a gravidez? - Dummies

As mulheres grávidas não só têm permissão para fazer sexo, mas muitas vezes o desejam. Mas é bom aproveitar a relação sexual com o ponto do orgasmo? Afinal, os orgasmos são nada mais do que contrações - e as pessoas sugeriram que isso poderia desencadear mão-de-obra. Isso é apenas um mito. De fato, grávida ...

Alimentando a Multidão em uma Reunião Familiar - manequins

Alimentando a Multidão em uma Reunião Familiar - manequins

Cozinhando uma refeição para um grande grupo (reunião familiar ou de outra forma ) requer planejamento e resistência. Aqui está um guia útil para quantidades de alimentos e segurança alimentar, e conselhos sobre a organização de uma festa de potluck. Planejando para potlucks A forma mais comum de comestibles de grupo é uma festa de potluck - qual é a maneira mais barata e fácil de ...

Anatomia do Penis humano - dummies

Anatomia do Penis humano - dummies

Sabendo como as funções de um pénis podem fornecer uma visão útil do sexo e do corpo humano - se você quer entender o pénis e a anatomia masculina melhor ou aprender sobre isso pela primeira vez. Basicamente, um pênis é composto de três estruturas, que são feitas de um material esponjoso que pode preencher com sangue: ...

Escolha dos editores

Como lidar com outliers causados ​​por Forças externas - manequins

Como lidar com outliers causados ​​por Forças externas - manequins

Certifique-se de verificar atentamente os outliers antes eles influenciam sua análise preditiva. Os outliers podem distorcer a análise de dados e dados. Por exemplo, qualquer análise estatística feita com dados que deixa outliers no lugar acaba por desviar os meios e variâncias. Os outliers não controlados ou mal interpretados podem levar a conclusões falsas. Diga os seus dados que ...

Como criar um modelo de análise preditiva com regressão R - manequins

Como criar um modelo de análise preditiva com regressão R - manequins

Você deseja criar um preditivo modelo de análise que você pode avaliar usando resultados conhecidos. Para fazer isso, vamos dividir nosso conjunto de dados em dois conjuntos: um para treinar o modelo e outro para testar o modelo. Uma divisão 70/30 entre treinamento e testes de conjuntos de dados será suficiente. As próximas duas linhas de código ...

Como definir objetivos de negócios para um modelo de análise preditiva - dummies

Como definir objetivos de negócios para um modelo de análise preditiva - dummies

Um modelo de análise preditiva visa resolvendo um problema comercial ou realizando um resultado comercial desejado. Esses objetivos comerciais se tornam os objetivos do modelo. Conhecer aqueles garante o valor comercial do modelo que você constrói - o que não deve ser confundido com a precisão do modelo. Hipotéticamente, você pode construir um modelo preciso para ...