WikiDer > Apache Hadoop
Apache Hadoop | ||||
| Entwickler | Apache Software Foundation | |||
| Veröffentlicht | 27. Dezember 2011 | |||
| Letzte Version | 3.2.1 (22. September 2019) | |||
| Status | Aktiv | |||
| Betriebssystem | Multiplattform | |||
| Geschrieben in | Java | |||
| Kategorie | Verteiltes Dateisystem | |||
| Lizenz | Apache-Lizenz 2.0 | |||
| Versionskontrolle | git-wip-us.apache.org | |||
| Webseite | http://hadoop.apache.org | |||
| ||||
Apache Hadoop ist ein Open SourceSoftware-Framework vor dem verteilter Speicher und Verarbeitung großer Datenmengen mit dem Karte verkleinernParadigma. Hadoop als Plattform treibt die Popularität von Große Daten.[1] Es läuft auf a Cluster von Computern bestehend aus Commodity-Hardware. Das Design der Hadoop-Softwarekomponenten berücksichtigt den Ausfall von Systemen in einem Cluster, beispielsweise durch replizieren und verteilen Sie es auf mehrere Computer/Speichermedien.
Module
Hadoop besteht im Wesentlichen aus den folgenden Modulen:
- Hadoop Common - eine Sammlung Softwarebibliotheken die von den anderen Modulen verwendet werden;
- Hadoop Distributed File System (HDFS) - die verteilten Dateisystem das speichert Dateien, die über die Systeme im Cluster verteilt sind;
- Hadoop GARN (seit Version 2.0) – der Ressourcenmanager, der den auf Hadoop ausgeführten Anwendungen verfügbare Systemressourcen zuweist;
- Hadoop MapReduce - eine Implementierung des MapReduce-Paradigmas für die groß angelegte Datenverarbeitung.
Anwendungen
Neben diesen Basismodulen wurde eine Vielzahl von Anwendungen für den Einsatz in oder auf Hadoop entwickelt. Häufig verwendete Anwendungen sind Apache Hive, Apache-Schwein, Apache HBase, Apache Phoenix, Apache Spark, Apache Flume, Apache Oozie, Zoowärter der Apachen, Apache Sqoop und Apache Sturm. Der Name Hadoop wird daher oft nicht nur als Framework bezeichnet, sondern als gesamtes Ökosystem von Anwendungen rund um das Framework.
Geschichte
Im Oktober 2003 veröffentlicht Google ein Artikel über das Google-Dateisystem[2], ein skalierbares und verteiltes Dateisystem zur Verwendung in datenintensiven Anwendungen. Doug-Schneiden, der Entwickler dahinter Apache Lucene, und Mike Cafarella, arbeiteten zu dieser Zeit an ihrer Open Source WebcrawlerApache Nutch und suchten nach einer Lösung, um die großen Datensätze, die sie mit Nutch erstellt haben, verarbeiten zu können.[3] Basierend auf dem Artikel von Google implementierten sie das Google File System im Jahr 2004 in Java unter dem Namen Nutch Distributed File System.
Um die Daten auf NDFS verarbeiten zu können, suchten Cutting und Cafarella nach einer Lösung, die genauso skalierbar sein muss wie das Dateisystem selbst. Dafür sind sie auch bei Google gelandet. Das Softwareunternehmen veröffentlichte 2004 einen Artikel über MapReduce.[4] Cutting und Cafarella haben das MapReduce-Prinzip in Nutch implementiert.
Yahoo!
Im Jahr 2006 startete Cutting auf Hadoop, als Unterprojekt von Lucene. Er brachte das verteilte Dateisystem von Nutch, das in HDFS umbenannt wurde, und MapReduce in dieses neue Projekt ein. Er weckte das Interesse von Yahoo!, das mit ihrem in C entwickelte Suche Backend auf Probleme gestoßen. Yahoo! beauftragte Cutting mit der Umstellung auf Hadoop.Ab 2007 begannen immer mehr Unternehmen mit Hadoop. Unternehmen wie Twitter, Facebook und LinkedIn nahm Hadoop ernst und entwickelte eine eigene Software rund um die Plattform. Dadurch entstand ein Open-Source-Ökosystem.
2008 und darüber hinaus
2008 wuchs Hadoop von einem Lucene-Teilprojekt zu einem Top-Level ApacheProjekt. In dieser Zeit entstanden mehrere Open-Source-Projekte rund um das Hadoop-Framework, darunter NoSQLDatenbank Apache HBase, Facebooks Apache Hive und Yahoos Apache Pig. war auch Cloudera gegründet, das erste Unternehmen, das den kommerziellen Vertrieb von Hadoop anbietet.
Quellen, Anmerkungen und/oder Verweise
|