Lar Finanças Pessoais Comparando Hadoop Distributions - dummies

Comparando Hadoop Distributions - dummies

Vídeo: Cloudera VS Apache VS MapR VS Hortonworks Which Hadoop Distribution To Use Big Data Tutorial 2025

Vídeo: Cloudera VS Apache VS MapR VS Hortonworks Which Hadoop Distribution To Use Big Data Tutorial 2025
Anonim

Você verá que o ecossistema Hadoop possui muitos componentes, todos os quais existem como seus próprios projetos Apache. Como o Hadoop cresceu consideravelmente e enfrenta mudanças significativas, diferentes versões desses componentes da comunidade de código aberto podem não ser totalmente compatíveis com outros componentes. Isso representa dificuldades consideráveis ​​para as pessoas que procuram um começo independente com o Hadoop, baixando e compilando projetos diretamente do Apache.

O Red Hat é, para muitas pessoas, o modelo de como ganhar dinheiro com sucesso no mercado de software aberto. O que a Red Hat fez é levar o Linux (um sistema operacional de código aberto), agrupar todos os componentes necessários, criar um instalador simples e oferecer suporte pago a qualquer cliente.

Da mesma forma que a Red Hat forneceu uma embalagem útil para o Linux, várias empresas colocaram o Hadoop e algumas tecnologias relacionadas em suas próprias distribuições Hadoop. Esta lista descreve os mais proeminentes:

  • Cloudera : talvez o jogador mais conhecido do campo, a Cloudera pode reivindicar Doug Cutting, co-fundador da Hadoop, como seu principal arquiteto. Cloudera é vista por muitas pessoas como líder de mercado no espaço Hadoop porque lançou a primeira distribuição comercial Hadoop e é um contribuidor altamente ativo de código para o ecossistema Hadoop.

    Cloudera Enterprise, um produto posicionado pela Cloudera no centro do que ele chama de "Enterprise Data Hub", inclui a Distribuição Cloudera para Hadoop (CDH), uma distribuição baseada em fonte aberta do Hadoop e seus projetos relacionados também como seu proprietário Cloudera Manager. Também está incluído uma subscrição de suporte técnico para os componentes principais da CDH.

    O modelo de negócios primário da Cloudera tem sido baseado em sua capacidade de alavancar sua popular distribuição de CDH e fornecer serviços e suporte pagos. No outono de 2013, a Cloudera anunciou formalmente que está se concentrando na adição de componentes proprietários de valor agregado em cima do Hadoop de código aberto para atuar como um diferenciador.

    Além disso, Cloudera tornou uma prática comum acelerar a adoção de código aberto de nível alfabético e beta para os lançamentos Hadoop mais recentes. A abordagem é tomar componentes que julgar maduros e adaptá-los às bibliotecas de código aberto existentes para produção, que estão incluídas em sua distribuição.

  • EMC : Pivotal HD, a distribuição Apache Hadoop da EMC, integra nativamente a tecnologia de banco de dados (MPP) de processamento paralelo (MPP) da EMC (anteriormente conhecida como Greenplum e agora conhecida como HAWQ) com o Apache Hadoop.O resultado é uma distribuição Hadoop de alto desempenho com o verdadeiro processamento de SQL para o Hadoop. As consultas baseadas em SQL e outras ferramentas de inteligência de negócios podem ser usadas para analisar dados armazenados no HDFS.

  • Hortonworks : Outro importante jogador no mercado Hadoop, a Hortonworks possui o maior número de contribuidores e contribuintes de código para os componentes do ecossistema Hadoop. (Os usuários são os guardiões dos projetos do Apache e têm o poder de aprovar as alterações de código.)

    O Hortonworks é um spin-off do Yahoo!, que foi o motorista corporativo original do projeto Hadoop porque precisava de uma plataforma em larga escala para suportar o seu negócio de motores de busca. De todos os fornecedores de distribuição da Hadoop, a Hortonworks é a mais comprometida com o movimento de código aberto, com base no grande volume do trabalho de desenvolvimento que contribui para a comunidade e porque todos os seus esforços de desenvolvimento são (eventualmente) dobrados na base de código aberto.

    O modelo de negócios da Hortonworks baseia-se na sua capacidade de alavancar a sua popular distribuição HDP e fornecer serviços e suporte pagos. No entanto, ele não vende software proprietário. Em vez disso, a empresa apoia com entusiasmo a ideia de trabalhar na comunidade de código aberto para desenvolver soluções que abordem requisitos de recursos empresariais (por exemplo, processamento de consulta mais rápido com o Hive).

    A Hortonworks estabeleceu uma série de relações com empresas estabelecidas no setor de gerenciamento de dados: Teradata, Microsoft, Informatica e SAS, por exemplo. Embora essas empresas não tenham suas próprias ofertas internas Hadoop, elas colaboram com a Hortonworks para oferecer soluções integradas Hadoop com seus próprios conjuntos de produtos.

    A oferta Horton Hadoop é a Hortonworks Data Platform (HDP), que inclui Hadoop, bem como ferramentas e projetos relacionados. Também ao contrário de Cloudera, a Hortonworks lança apenas versões HDP com código de nível de produção da comunidade de código aberto.

  • IBM : o Big Blue oferece uma gama de ofertas da Hadoop, com foco no valor agregado em cima da pilha Hadoop de código aberto.

  • Intel: A Distribuição Intel para o Apache Hadoop (Distribuição Intel) fornece processamento distribuído e gerenciamento de dados para aplicativos corporativos que analisam grandes dados.

    Os principais recursos incluem excelente desempenho com otimizações para processadores Intel Xeon, armazenamento SSD Intel e rede Intel 10GbE; segurança de dados através de criptografia e descriptografia em HDFS e controle de acesso baseado em função com granularidade de nível de célula em HBase; Melhor desempenho da consulta de colmeia; suporte para análise estatística com um conector para R, o pacote estatístico popular de código aberto; e gráficos analíticos através do Intel Graph Builder.

  • MapR : para uma distribuição completa para Apache Hadoop e projetos relacionados que são independentes da Apache Software Foundation, não procure mais do que MapR. Com nenhuma dependência de Java ou dependência do sistema de arquivos Linux, o MapR está sendo promovido como a única distribuição Hadoop que fornece proteção total de dados, nenhum ponto de falha e vantagens significativas de facilidade de uso.

    Três edições MapR estão disponíveis: M3, M5 e M7. A edição M3 é gratuita e está disponível para uso ilimitado de produção; MapR M5 é uma oferta de software de assinatura de nível intermediário; e MapR M7 é uma distribuição completa para Apache Hadoop e HBase que inclui Pig, Hive, Sqoop e muito mais.

Comparando Hadoop Distributions - dummies

Escolha dos editores

Como criar um módulo HTML personalizado no Joomla - dummies

Como criar um módulo HTML personalizado no Joomla - dummies

Uma das grandes coisas sobre o Joomla é o quão incrivelmente flexível é. A instalação padrão do CMS inclui 23 módulos diferentes para ajudá-lo a fazer seu site funcionar sem problemas. Às vezes, no entanto, você pode querer adicionar uma função ao seu site que esses 23 módulos simplesmente não vão cobrir. Sob tais circunstâncias, você pode querer considerar ...

Como criar um item de menu no Joomla Content Management - manequins

Como criar um item de menu no Joomla Content Management - manequins

Um item de menu determina o layout dos artigos, que é um dos aspectos do Joomla para o qual você precisa se acostumar. As páginas da Web não existem fisicamente no Joomla - elas são apenas itens no seu banco de dados - até que a página seja acessada. Quando você abre um artigo, o Joomla tira os dados necessários do ...

Como criar um novo item de menu com o Joomla! 1. 6 - dummies

Como criar um novo item de menu com o Joomla! 1. 6 - dummies

Não estresse se você precisa criar um item de menu em sua página da Web interativa - é fácil ao usar o Joomla! Gerenciador de menu. Para adicionar itens de menu a um site existente, basta usar estas etapas: Escolha Menus → Gerenciador de menus para abrir o Gerenciador de menus. Clique no nome do menu que deseja adicionar um novo ...

Escolha dos editores

Obtendo Ajuda do Eclipse - dummies

Obtendo Ajuda do Eclipse - dummies

Com a complexidade do Java e a nuance do Eclipse, você não pode esperar para lembrar de tudo. Às vezes, você precisa de um pouco mais de ajuda do Eclipse para começar sua programação. Felizmente, o Eclipse oferece ajuda geral e sensível ao contexto: para ajuda sensível ao contexto: no Windows, pressione F1. No Linux, pressione Ctrl + F1. Em um Mac, pressione ...

Software gratuito: preenchimento automático de células no OpenOffice. org Calc - dummies

Software gratuito: preenchimento automático de células no OpenOffice. org Calc - dummies

OpenOffice. org - uma alternativa gratuita para o Microsoft Office - inclui Calc, uma planilha eletrônica semelhante ao Excel. O Calc fornece uma maneira fácil de criar automaticamente uma coluna ou linha de números em qualquer sequência que você especificar. Esse recurso de preenchimento automático é útil para criar listas numeradas ou preencher os cabeçalhos de colunas e linhas de tabelas, como ...

Acessos acessíveis no modo de exibição do Prezi - dummies

Acessos acessíveis no modo de exibição do Prezi - dummies

O prezi possui dois modos de operação diferentes: Modo de edição, no qual você crie sua apresentação e Show Mode, no qual você apresenta suas criações. No modo Show, use esses atalhos úteis para tornar sua apresentação ainda mais suave. Use esta como uma lista de verificação de prática antes de começar: Use esta função: Para fazer isso: Completo ...

Escolha dos editores

Elementos HTML básicos - dummies

Elementos HTML básicos - dummies

HyperText Markup Language (HTML) é o idioma da web, onde os elementos ditaram a formatação e o estilo do seu conteúdo. Os elementos HTML compõem a codificação baixada que você vê quando você acessa uma página da Web em seu navegador da Web (como Internet Explorer, Firefox ou Safari). Aqui estão alguns elementos básicos para você ...

Usando AutoCAD DesignCenter - dummies

Usando AutoCAD DesignCenter - dummies

DesignCenter é um nome tolo para uma paleta útil, se um pouco ocupada. A paleta DesignCenter é útil para dados de mineração de todos os tipos de desenhos. Enquanto a paleta Propriedades está preocupada com as propriedades do objeto, a paleta DesignCenter lida principalmente com objetos nomeados: camadas, tipos de linha, definições de bloco (isto é, símbolo), estilos de texto e outros objetos organizacionais ...

Zoom e Panning no AutoCAD - dummies

Zoom e Panning no AutoCAD - dummies

O AutoCAD facilita a panorâmica, oferecendo barras de rolagem e panning em tempo real. Na panorâmica em tempo real (em oposição à panorâmica de finalização), você pode ver objetos movendo-se na tela enquanto você arrasta o mouse para cima e para baixo ou para frente e para trás. Claro, o ponto de vista está em movimento, não os objetos. Tanto a panorâmica quanto o zoom mudam a visualização ...