Nicht beansprucht: Arbeiten Sie bei Hive?
Hive Bewertungen: 4.2/5 – Solide Wahl
Hive ist ein All-in-One-Projektmanagement-Tool, das entwickelt wurde, um „Teams dabei zu helfen, sich schneller zu bewegen“, unabhängig davon, wie sie arbeiten. Funktionen werden basierend auf Benutzeranfragen erstellt und wöchentlich aktualisiert, was Hive zur weltweit ersten demokratischen Softwareplattform macht. Es ist vor allem für seine Fähigkeiten in den Bereichen Projektmanagement, Zeitmanagement, Teamzusammenarbeit, Automatisierung und eine Reihe von Integrationen mit Software von Drittanbietern bekannt. Hive ist für Solo-Benutzer kostenlos und für Teams und Unternehmen mit Premium-Versionen verfügbar.
| Kompetenzen |
API
|
|---|---|
| Kategorie |
Vertriebspartner
Mittlerer Markt
Unternehmen
|
| Einsatz | Cloud / SaaS / Webbasiert, mobiles Android, mobiles iPad, mobiles iPhone |
| Unterstützung | 24/7 (Live-Repräsentant), Chat, E-Mail/Helpdesk, FAQs/Forum, Wissensdatenbank, Telefonsupport |
| Training | Dokumentation |
| Sprachen | Englisch |
Vergleichen Hive mit anderen beliebten Tools in derselben Kategorie.
Nutzen Sie Ihre SQL-Kenntnisse, um Operationen an in Hadoop gespeicherten Daten durchzuführen.
Es basiert auf dem MapReduce-Algorithmus, daher ist der Datenabruf etwas langsam.
Ermöglichte es Geschäftsanwendern, Daten mithilfe ihrer SQL-Kenntnisse abzufragen.
Das Beste an HIVE ist, dass jeder mit SQL-Kenntnissen die MapReduce-Funktion von HIVE nutzen kann. Neuere Versionen von HIVE verbessern die Unterstützung von Windowing-Funktionen und beheben etwaige Inkonsistenzen. Die Dokumentation ist für meine Aufgaben bisher ausreichend, und der Support für das Produkt läuft weiterhin – ein sehr gutes Zeichen.
Ältere Versionen von Hive sind unbrauchbar. Es gibt viele Einschränkungen, die einen zwingen, umständliche und unter Umständen sogar ineffiziente HiveQL-Abfragen zu schreiben. Beispielsweise kann die fehlende Unterstützung für Fensterfunktionen und Gleichheitsvergleiche bei Joins die Arbeit erheblich erschweren, sodass man auf komplizierte Full Joins oder Self Joins zurückgreifen muss, um dasselbe Ziel zu erreichen.
Wir nutzen HIVE als Data Warehouse. Ein Vorteil von HIVE ist, dass es SQL-Abfragen in eine Reihe von MapReduce-Jobs aufteilen kann, wodurch die Abfragen bei ausreichend vielen Rechenknoten beschleunigt werden sollen.
Hive ist die beste Lösung für die parallele Beantwortung von Ad-hoc-Abfragen. Es harmoniert hervorragend mit dem Hadoop-Ökosystem (insbesondere mit HDFS). – Es ist benutzerfreundlich, da es die meisten SQL-Funktionen implementiert.
- Für komplexe Abfragen ist weitere Optimierung erforderlich (z. B. Caching, automatische Partitionierung usw.), um die Latenz zu verringern. - Die Anpassung der Hive-Parameter ist für Benutzer sehr schwierig. Die Standardeinstellungen funktionieren nicht bei großen Abfragen. - Hive eignet sich optimal, wenn 90–95 % der Abfragen nur lesend sind. Für Anwendungen mit häufigen Aktualisierungen ist es ungeeignet.
Gewinnen Sie schnell Erkenntnisse aus Big Data, falls die Kundendaten nicht auf einen einzelnen Rechner passen. Dies erleichtert die Datenaufbereitung (z. B. das Erstellen temporärer Tabellen) erheblich, die dann von anderen Machine-Learning-Lösungen wie Spark genutzt werden können, um Machine-Learning-Modelle zu erstellen, die einen höheren Geschäftswert generieren.
Trotz seiner Rechenleistung erfordert Pig von Programmierern, dass sie zusätzlich zu SQL weitere Kenntnisse erwerben. Hive-Anweisungen ähneln SQL bemerkenswert, und trotz der Einschränkungen der Hive Query Language (HQL) hinsichtlich der unterstützten Befehle ist sie dennoch sehr nützlich. Hive bietet eine hervorragende Open-Source-Implementierung von MapReduce. Im Gegensatz zu SQL, das die strikte Einhaltung von Schemata beim Speichern von Daten erfordert, eignet sich Hive besonders gut für die Verarbeitung verteilt gespeicherter Daten.
Trotz der Unterschiede in der Arbeitsweise sorgt die sprachliche Ähnlichkeit beim Umstieg von SQL auf Hive für einen reibungslosen Übergang. Es ist jedoch wichtig, die Unterschiede in den Konstrukten und der Syntax zu beachten, sonst drohen frustrierende Erfahrungen.
Datenextraktion, -verarbeitung und -analyse. Es geht schnell.
Hive bietet Nutzern, die große Datenmengen tabellarisch speichern möchten, eine komfortable Lösung. Es arbeitet mit denselben Abfragen wie SQL und ist daher mit traditionellen Datenbanksystemen kompatibel. Aus diesem Grund müssen Anwender keine neue Programmiersprache lernen und können sich dennoch an die Big-Data-Kultur anpassen. Funktionen wie Partitionierung und Bucketing erleichtern die Datensegmentierung. Daten können direkt über HDFS mithilfe von CSV-Dateien im gleichen Format oder über HBase mithilfe eines Verweises auf die HBase-Tabelle in Hive geladen werden, wodurch eine Verknüpfung innerhalb von Hadoop hergestellt wird.
Auch bei kleinen Datenmengen wird ein MapReduce-Job ausgeführt, was zeitaufwändig und daher ineffizient ist. Da Hive kein Konzept von Primärschlüsseln kennt, können redundante Einträge auftreten. Zudem waren Aktualisierungen und Löschungen in älteren Versionen nicht möglich, und auch in der neuen Version verschlechtert sich die Performance des Tools, wenn man diese Befehle verwenden möchte.
Wir verwenden Hive zur Speicherung von Protokollen der in unserem Unternehmen generierten Daten. Diese Protokolle dienen außerdem der Datenabgleichung und helfen uns, den Überblick über die Daten zu behalten.
Stabiles Produkt; Einfache Bedienung; Mehrere Berechnungsmodule - Tez, MR; Nahezu alle SQL-Funktionen;
Die Unterstützung für das Löschen von Dateien ist noch nicht vollständig implementiert, obwohl sie fast soweit ist.
Primäre Abfrage-Engine für die Datenanalyse
Liefert schnelle Ergebnisse auf Basis einer Hadoop-Datenbank, benutzerfreundliche Oberfläche mit einfachen Einrichtungsschritten
Bei einigen Besonderheiten von HiveQL ist es unter Umständen notwendig, die Dokumentation zu konsultieren, es gibt jedoch viele Ähnlichkeiten mit anderen SQL-basierten Sprachen.
Datenanalyse, die riesige Datenmengen für allgemeine BI-Anwendungen verfügbar macht
The Hive soll Ihre Erfahrung mit Hadoop vereinfachen und ermöglicht es Entwicklern und Business-Analysten, ihre SQL-Kenntnisse anzuwenden, um Daten abzufragen, Berichte zu erstellen, ETL-Prozesse durchzuführen usw.
Als Open-Source-Software weist sie die üblichen Supportprobleme auf. Zudem unterstützt Hive viele Funktionen nicht, die herkömmliches SQL bietet.
Der Hauptzweck von Hive besteht darin, Berichte zu erstellen und Daten zu analysieren, die im Hadoop-Dateisystem gespeichert sind. Aktuell ist es das einzige Framework, das von den meisten gängigen BI-Tools zum Lesen von Daten aus dem HDFS verwendet werden kann.
Es zeichnet sich durch Benutzerfreundlichkeit und Skalierbarkeit aus und hat seine Zuverlässigkeit unter Beweis gestellt. Gleichzeitig wurden kontinuierlich neue Funktionen hinzugefügt und die Geschwindigkeit erhöht.
Die Geschwindigkeit ist im Vergleich zu neueren verteilten Lagern immer noch geringer. Außerdem wird im Hintergrund immer noch MapReduce verwendet, was heutzutage sehr langsam ist.
Wir speichern große Datenmengen, die in kein relationales Datenbanksystem passen. Durch die Ausführung von MapReduce-Jobs auf den in Hive gespeicherten Daten gewinnen wir wertvolle Erkenntnisse.
Das Beste an Hive ist, dass es dank seiner SQL-ähnlichen Schnittstelle leicht zu erlernen ist. Außerdem ist es ein sehr praktisches Werkzeug für ETL- und Data-Warehouse-Funktionen.
Ich bin nicht besonders gut darin, Optimierungsparameter einzurichten. Man muss sich viele Konsoleneinstellungen merken. Der Index erweist sich als wenig hilfreich. CRUD-Funktionen haben viele Voraussetzungen, z. B. muss die Tabelle in Buckets unterteilt sein.
Wir versuchen, ein standardisiertes ETL-Pipeline-Tool zu entwickeln, das gängige BI-/Reporting-Tools unterstützt.
Das Beste daran ist, eine vertraute Syntax verwenden zu können.
Unterstützt nicht alle MySQL-Anwendungsfälle (verständlicherweise).
Ad-hoc-Abfragen auf ETL-verarbeiteten Produktionsdaten.
Um MapReduce-Jobs mit JSON-Parsing ausführen und dynamische Partitionen im Parquet-Dateiformat generieren zu können.
Im Vergleich zu Spark/Impala ist es bei den meisten Operationen langsam. Außerdem tritt ein Speichermangel auf, wenn mehrere Partitionen mit vielen Parquet-Dateien aktualisiert werden.
Ereignisse werden von Flume in HDFS erfasst und müssen für schnelle Abfragen in Parquet-Dateien umgewandelt werden. Die Eingabedaten enthalten variable Attribute in der JSON-Nutzlast, da jeder Kunde benutzerdefinierte Attribute definieren kann. Dies ist Teil der ETL-Pipeline, in der Hive-Jobs JSON-Daten lesen und Parquet-Dateien generieren, die anschließend mit Impala/Spark abgefragt werden. Mithilfe von Views fragt jeder Kunde nur die relevanten Daten ab.
Die größten Vorteile ergeben sich aus der Durchführung von SQL-ähnlichen Abfragen, dem Partitionieren von Tabellen, dem Denormalisieren von Daten und dem Komprimieren der Map/Reduce-Ausgabe.
In manchen Fällen können mit Hive keine komplizierten Operationen durchgeführt werden, z. B. wenn die Ausgabe eines Jobs als Eingabe für den anderen Job dient (SequenceFileFormat-Datei) oder wenn eine Abfrage auf eine Bilddatei geschrieben wird, ist Hive nicht nützlich.
Hive hilft bei der Lösung von Big-Data-Problemen
Hadoop besitzt keine eigene Abfragesprache, aber Hive ist eine hervorragende Ergänzung. Ich kann auf Daten in Hadoop in einer bestimmten Tabelle verweisen und normale SQL-Abfragen verwenden. Joins, Aggregationen usw. sind möglich. Das vereinfacht die Arbeit erheblich.
Da im Hintergrund MapReduce-Jobs ausgeführt werden, kann es sehr langsam sein. Die Daten können nicht aktualisiert werden, daher müssen wir den Code neu schreiben.
Wer Erfahrung im Schreiben von SQL-Abfragen hat, wird mit Hive auf Basis von Hadoop für in HDFS gespeicherte Dateien viel Freude haben.
-> Einfache Konfiguration/Erstellung von Tabellen für Big Data oder Streaming-Daten -> Schnelle und einfache Abfragen. Anwender ohne technische Vorkenntnisse können HUE für interaktivere Abfragen von Hive-Tabellen nutzen. -> HUE speichert Ergebnisse und frühere Abfragen und ermöglicht den Export der Ergebnisse als Excel-Datei (CSV).
-> Das Verknüpfen und Parsen mehrerer Tabellen mit sehr großen Datenmengen stellt weiterhin eine Herausforderung dar. -> Einige SQL-Operationen, wie z. B. Joins mit ungleichen Bedingungen, funktionieren in Hive nicht.
Aktivitäten der Dumping-Site, Big-Data-Streamingdaten sowie Datenprotokolle in Hive
Das Open-Source-Framework ermöglicht das Lesen, Schreiben und Verwalten von Daten wie SQL und HQL, was die Nutzung vereinfacht.
Die Latenz in Apache Hive ist sehr hoch.
Es bietet eine SQL-ähnliche Abfragesprache namens HQL mit Schema-on-Read und konvertiert Abfragen transparent in MapReduce.
Am meisten gefällt mir an Apache Hive die Unterstützung von Partitionierung und Bucketing für einen schnellen Datenabruf. Wir können benutzerdefinierte Funktionen (UDFs) erstellen, um Datenbereinigung und -filterung gemäß den Anforderungen durchzuführen. Es unterstützt HQL, ähnlich wie SQL, was die Arbeit für SQL-Nutzer erleichtert.
Unterstützt weder OLTP noch Lösch- oder Aktualisierungsaktionen.
Wir haben in Hive eine semantische Schicht erstellt, die uns hilft, Terabytes an Daten zu verarbeiten und Berichte schneller zu generieren. Sie hat uns außerdem zu Fehlertoleranz und hoher Datenverfügbarkeit verholfen.
Flexibel und leicht verständlich – ich war begeistert!
Nicht mit mehreren Plattformen kompatibel, daher hauptsächlich plotformabhängig
Funktioniert am besten bei ETL-bezogenen Arbeiten oder Aufgaben.
Abfragen in Hive lassen sich einfach ausführen, da Hive HQL verwendet, das SQL sehr ähnlich ist. Hive verfügt über den HiveMetastore-Dienst zum Speichern von Metadaten und den HiveServer2 zur Bearbeitung von Clientanfragen. Diese Trennung trägt zu einer optimalen Ressourcenverteilung bei. Hive ist zudem fehlertolerant und eignet sich daher ideal für die Ausführung langlaufender ETL-Batches.
Hive hat Probleme mit dem Kaltstart und ist aufgrund der Verwendung des MapReduce-Algorithmus im Backend deutlich langsamer als Spark. Aus diesem Grund sind wir von Hive auf Spark umgestiegen, da sich die Job-Abschlusszeit nach dem Wechsel zu Spark um 70–80 % reduziert hat.
Informatica-Datenaufnahme, Abinitio-Datenaufnahme und -modifikationen, Datenformatierung (mit Optionen wie CSV, Paraguet usw.), Datentransformation mittels Hive-Abfragen, Datenpipelines
Die Benutzerfreundlichkeit des Data-Warehouse-Tools für Datenbankentwickler
Die Säureeigenschaften werden nicht berücksichtigt; es besitzt nicht die in den Datenbanken enthaltenen Säureeigenschaften.
Für meine Big-Data-Probleme (Datenmigration) nutze ich üblicherweise Hive, da die Abfragen sehr schnell ausgeführt werden und verschiedene Engines zur Auswahl stehen.
Wenn Sie Datenanalyst und SQL-Experte sind, sollten Sie Hive verwenden. Hive ist besonders für SQL-Anwender sehr benutzerfreundlich. Ich selbst nutze Hive und Pig beruflich. Hive verwende ich hauptsächlich für Ad-hoc-Abfragen und Berichte. Für BI-Berichte ist Hive optimal, da Sie den gesamten SQL-Code, den Sie für traditionelle Data Warehouses erstellt haben, wiederverwenden können. Mit Hive Server 2 erhalten Sie außerdem echte JDBC-Unterstützung, sodass Sie Ihre BI-Tools problemlos integrieren können. Dank der Hortonworks Stinger Initiative werden Hive kontinuierlich um viele weitere SQL-Funktionen wie Cubes, Rollups, Windowing, Lag, Lead usw. erweitert. Hive erzeugt zudem sehr kompakten Code, was die Lesbarkeit und das Debuggen deutlich erleichtert.
Für größere Projekte, bei denen SQL-ähnlicher Datenzugriff, Schemata, Metadaten, Partitionen, serverbasierte Bereitstellung, JDBC usw. implementiert werden sollen, empfehle ich Hive. Pig ist eine gute Sprache und kann für kurzfristige Aufgaben oder kleinere Projekte sehr nützlich sein. Für kleinere Projekte würde ich Pig empfehlen.
Hive Hadoop bietet Nutzern leistungsstarke Statistikfunktionen. Da Hive Hadoop SQL ähnelt, ist der Lernaufwand für SQL-Entwickler minimal. Hive Hadoop lässt sich mit HBase integrieren, um Daten in HBase abzufragen, was mit Pig nicht möglich ist. Bei Pig wird die Funktion `HbaseStorage()` verwendet, um Daten aus HBase zu laden. Hive Hadoop erfreut sich zunehmender Beliebtheit, da es von Hue unterstützt wird. Es gibt verschiedene Nutzergruppen für Hive Hadoop, darunter CNET, Facebook und Digg.
Wenn Sie SQL-Abfragen schreiben können, können Sie auch HiveQL schreiben, ohne etwas Neues lernen zu müssen – es ist ziemlich einfach.
Die Leistungsoptimierung gestaltet sich schwierig und wird bei komplexen Abfragen immer schwieriger. Außerdem weist das System noch einige Fehler auf, wie beispielsweise die Verarbeitung aller Daten durch einen einzigen Reducer, was zu einer Verlangsamung der Abfrageergebnisse führen kann.
Viele Business-Analysten, die Berichte erstellen, kennen SQL-Abfragen, sodass sie problemlos Informationen für die Analyse schreiben und abrufen können.
- Leicht zu erlernen - Kann komplexe Daten einschließlich verschachtelter Strukturen abfragen. - Flexibel (bezüglich des Datenschemas) - Mit ORC SerDe kann die Ein-/Ausgabe drastisch reduziert werden - durch das Lesen nur der benötigten Daten (spaltenorientierte Formate).
- Schema muss zuvor definiert werden. - Nicht ANSI-SQL-konform. - Nicht geeignet für schnelle interaktive Abfragen, selbst bei mittelgroßen Datensätzen. - Funktioniert nur mit Hadoop (kein eigenständiges Abfrageverarbeitungstool). - Nicht für den Unternehmenseinsatz geeignet (Dokumentationsqualität, Fehlermeldungen).sages, Unterstützung
Erforschung von Möglichkeiten zur Speicherung und Verarbeitung semantischer Datensätze
Hive kann uns den detaillierten Fortschritt einer Abfrage anzeigen und benutzerdefinierte Funktionen in verschiedenen Sprachen einbinden.
Die Abfragegeschwindigkeit ist viel zu langsam und Positionsargumente werden in GROUP BY und ORDER BY nicht unterstützt.
Wir verwenden Hive, um unsere nächtlichen Workflows auf HDFS im Batch-Verfahren zur Datenaggregation und -analyse auszuführen.
Die Syntax von Hive ähnelt fast exakt der von SQL, daher ist der Einstieg in Hive für SQL-Kenner denkbar einfach. Hive ermöglicht vielfältige Analysen sehr großer Datensätze und erfordert nur geringen Konfigurationsaufwand, sofern man etwas Geduld für die Ergebnisse hat.
Hive ist im Vergleich zu anderen Sprachen wie Pig etwas langsamer. Außerdem bietet es nicht so viele Skriptsprachen. Aus diesem Grund ist es bei LinkedIn für die meisten Datenanalyse-Jobs die zweitbeliebteste Sprache.
Wir versuchen, Daten aus riesigen Datensätzen für verschiedenste Zwecke zu extrahieren (u. a. zur Fehlerbehebung in der Produktion, zur Erstellung von Geschäftskennzahlen, Modellen und Prognosen). Mit unserem Data Warehouse und einer Kombination aus Hive und Pig gelingt uns dies sehr einfach.
Hive ist eine auf Hadoop basierende Data-Warehouse-Infrastruktur für die Gruppierung, Abfrage und Analyse von Daten. Apache Hive unterstützt die Analyse großer, in Hadoop HDFS und kompatiblen Systemen wie dem Amazon-Archivsystem gespeicherter Datenmengen. Es bietet die SQL-basierte Abfragesprache HiveQL5 mit Schemas zum transparenten Lesen und Konvertieren von Abfragen in MapReduce-, Apache Tez6- und Spark-Tasks. Alle drei Ausführungs-Engines können unter YARN ausgeführt werden. Zur Beschleunigung von Abfragen stellt Hive Indizes bereit, darunter Bitmap-Indizes.
Bietet viele Tools, hat großes Wachstumspotenzial
Möglichkeit, Metadaten übersichtlich und leicht zugänglich zu speichern.
Die Syntax von Hive ähnelt stark der von SQL, daher fällt es SQL-Kennern leicht, sich in Hive einzuarbeiten. Allerdings gibt es heutzutage andere Tools, die dieselbe Aufgabe schneller erledigen. Hive war anfangs sehr nützlich; mittlerweile stehen jedoch immer mehr Projekte zur Verfügung, die SQL-ähnliche Operationen auf Big Data ermöglichen (wie beispielsweise Drill).
Hive ist im Vergleich zu Konkurrenzprodukten relativ langsam. Es ist zwar benutzerfreundlich, aber das geht mit einem höheren Rechenaufwand einher. Für die reine Stapelverarbeitung ist Hive jedoch völlig ausreichend. Außerdem bietet es nicht so viele Skriptsprachen.
Im Einzelhandel bevorzugen Geschäftspartner die Abfrage ihrer eigenen Daten gegenüber Technikern. Hive löst eines dieser Probleme. Hauptzweck von Hive ist die Erstellung von Berichten und die Analyse von Daten, die im Hadoop-Dateisystem gespeichert sind.
Nichts Besonderes. Es hilft uns bei Big Data und ermöglicht allen Benutzern uneingeschränkte Bandbreite, aber wir sind bereits auf Probleme damit gestoßen, sodass nun einer der Server Einschränkungen aufweist.
In meinem Unternehmen war der Zugriff recht umständlich, da die zugrundeliegende Datenspeicherung in Hadoop erfolgt und die Verbindung über Hive hergestellt werden muss.
Dateneinblicke mit großen Browserdatenmengen durch MapReduce
Einfache SQL-ähnliche Syntax für sehr kurze und einfache Abfragen
Kein Alias für die Relation. Auch keine Ablaufsteuerung.
Ich entwickle Machine-Learning-Modelle für Online-Werbesysteme. Hive ist für mich eher eine Ad-hoc-Abfragemaschine als eine Plattform, auf der ich komplexe Algorithmen entwickeln kann.