Lar Finanças Pessoais Dados Mining for Big Data - dummies

Dados Mining for Big Data - dummies

Vídeo: Mineração de dados 2024

Vídeo: Mineração de dados 2024
Anonim

A mineração de dados envolve a exploração e análise de grandes quantidades de dados para encontrar padrões para grandes dados. As técnicas surgiram dos campos das estatísticas e da inteligência artificial (AI), com um pouco de gerenciamento de banco de dados jogado na mistura.

Geralmente, o objetivo da mineração de dados é classificação ou previsão. Na classificação, a idéia é classificar os dados em grupos. Por exemplo, um comerciante pode estar interessado nas características daqueles que responderam versus quem não respondeu a uma promoção.

Estas são duas classes. Na predição, a idéia é prever o valor de uma variável contínua. Por exemplo, um comerciante pode estar interessado em prever aqueles que responderão a uma promoção.

Os algoritmos típicos utilizados na mineração de dados incluem o seguinte:

  • Árvores de classificação: Uma técnica de mineração de dados popular que é usada para classificar uma variável categórica dependente com base em medidas de uma ou mais variáveis ​​preditoras. O resultado é uma árvore com nós e links entre os nós que podem ser lidos para formar se - então, regras.

  • Regressão logística: Uma técnica estatística que é uma variante da regressão padrão, mas amplia o conceito para lidar com a classificação. Ele produz uma fórmula que prediz a probabilidade da ocorrência como uma função das variáveis ​​independentes.

  • Redes neurais: Um algoritmo de software que é modelado após a arquitetura paralela dos cérebros dos animais. A rede consiste em nós de entrada, camadas ocultas e nós de saída. Cada unidade recebe um peso. Os dados são dados ao nó de entrada, e por um sistema de teste e erro, o algoritmo ajusta os pesos até encontrar um certo critério de parada. Algumas pessoas compararam isso com uma abordagem de caixa preta.

  • Técnicas de agrupamento como vizinhos K-mais próximos: Uma técnica que identifica grupos de registros similares. A técnica do vizinho mais próximo calcula as distâncias entre o registro e os pontos nos dados históricos (treinamento). Ele então atribui esse registro à classe de seu vizinho mais próximo em um conjunto de dados.

Aqui está um exemplo de árvore de classificação. Considere a situação em que uma companhia de telefone quer determinar quais clientes residenciais podem desconectar seu serviço.

A companhia telefônica possui informações que consistem nos seguintes atributos: quanto tempo a pessoa teve o serviço, quanto ele gasta no serviço, se o serviço tem sido problemático, quer ele tenha o melhor plano de chamada que ele precisa, onde ele vidas, quantos anos ele tem, se ele tem outros serviços agrupados, informações competitivas sobre outros planos de operadoras e se ele ainda tem o serviço.

Claro, você pode encontrar muitos outros atributos do que isso. O último atributo é a variável de resultado; Isto é o que o software usará para classificar os clientes em um dos dois grupos - talvez chamados de stayers e riscos de vôo.

O conjunto de dados é dividido em dados de treinamento e um conjunto de dados de teste. Os dados de treinamento consistem em observações (chamados atributos) e uma variável de resultado (binária no caso de um modelo de classificação) - neste caso, os stayers ou os riscos de vôo.

O algoritmo é executado sobre os dados de treinamento e vem com uma árvore que pode ser lida como uma série de regras. Por exemplo, se os clientes estiveram com a empresa há mais de dez anos e têm mais de 55 anos, é provável que permaneçam como clientes fiéis.

Essas regras são executadas em cima do conjunto de dados de teste para determinar o quão bom este modelo está em "novos dados". "As medidas de precisão são fornecidas para o modelo. Por exemplo, uma técnica popular é a matriz de confusão. Esta matriz é uma tabela que fornece informações sobre quantos casos foram corretamente contra incorretamente classificados.

Se o modelo parece ser bom, ele pode ser implantado em outros dados, pois está disponível (isto é, usá-lo para prever novos casos de risco de vôo). Com base no modelo, a empresa pode decidir, por exemplo, enviar ofertas especiais para aqueles clientes que acha que são riscos de vôo.

Dados Mining for Big Data - dummies

Escolha dos editores

ASVAB Paragraph Comprehension Practice - dummies

ASVAB Paragraph Comprehension Practice - dummies

Um dos subtestes que você verá no ASVAB é o teste de compreensão de parágrafos. Esta parte do ASVAB está voltada para ver se você entende o que você lê. Exemplo de perguntas Parágrafo Tempo de compreensão: 13 minutos para 15 perguntas Instruções: A compreensão de parágrafo é o quarto subtesto no ASVAB. As perguntas são projetadas para ...

ASVAB Preparação: Números positivos e negativos - manequins

ASVAB Preparação: Números positivos e negativos - manequins

Certifique-se de que esteja familiarizado com o trabalho positivo e negativo números para o ASVAB. Os números podem ser positivos ou negativos. Um número positivo é qualquer número maior que zero. Então, 4; 3. 2; 793; 3/4; 1/2; e 430, 932, 843, 784 são todos números positivos. Números inferiores a zero são números negativos. Cada número positivo tem um negativo ...

ASVAB Dicas de compreensão de leitura - manequins

ASVAB Dicas de compreensão de leitura - manequins

As abordagens de compreensão de parágrafo no ASVAB geralmente são bastante curtas. Essas dicas podem ajudá-lo a compreender melhor as passagens de leitura ASVAB e as perguntas que as seguem: Compreenda o que a questão quer de você. Solicita o ponto principal, informações específicas ou uma conclusão baseada na informação apresentada? Releia o parágrafo ...

Escolha dos editores

A diferença entre análises analógicas e digitais - manequins

A diferença entre análises analógicas e digitais - manequins

Toda a eletrônica pode ser dividida em duas grandes categorias: analógico e digital. Um dos exemplos mais comuns da diferença entre dispositivos analógicos e digitais é um relógio. No relógio analógico, o tempo é representado por mãos que giram ao redor de um disco e apontam para uma localização no mostrador que representa ...

O papel dos átomos na eletrônica - dummies

O papel dos átomos na eletrônica - dummies

Os átomos são os blocos de construção básicos de tudo no universo, seja natural ou manmade. Eles são tão pequenos que você encontraria milhões deles em uma única partícula de poeira. A corrente elétrica, às vezes conhecida como eletricidade, é o movimento na mesma direção de partículas microscópicamente pequenas e eletricamente carregadas, chamadas elétrons. Cada átomo contém o ...

Roles de prótons e elétrons - dummies

Roles de prótons e elétrons - dummies

É Uma propriedade de certas partículas, como elétrons, prótons , e quarks (sim, quarks) que descreve como eles interagem uns com os outros. Existem dois tipos diferentes de carga elétrica, um pouco arbitrariamente chamada positiva e negativa (bem como as quatro direções cardinais são chamadas norte, sul, leste e oeste). Em geral, partículas que carregam ...

Escolha dos editores

Acesso 2007 All-In-One For Dummies Cheat Sheet - dummies

Acesso 2007 All-In-One For Dummies Cheat Sheet - dummies

Trabalhando no Access 2007 é mais fácil uma vez que você entenda executar a janela do Access 2007 e usar ferramentas para ajudar a gerenciar seus dados e responder suas perguntas.

Arrumando suas mensagens com o Lotus Notes 6 - manequins

Arrumando suas mensagens com o Lotus Notes 6 - manequins

Antes de enviar uma mensagem de e-mail no Lotus Notes 6, você pode definir Opções de entrega, Opções de segurança e Selos de humor. Use essas dicas de notas para informar o destinatário sobre o quão quente é sua mensagem ou qual é o seu humor; ou solicitar confirmação de entrega, definir o tempo de entrega e muito mais. Depois de terminar de compor o corpo ...

10 Ofícios de teclado do Office 2016 - dummies

10 Ofícios de teclado do Office 2016 - dummies

Um tema comum do Office 2016 é que todos os programas se parecem e funcionam. Depois de aprender a usar o Word, você achará que não é muito mais difícil aprender o Excel ou o PowerPoint porque as guias do Ribbon funcionam de maneiras semelhantes. Ainda melhor, os mesmos comandos de teclas funcionam de forma semelhante em todos os programas do Office 2016. Por ...