Was sind Big Data? Arten, Merkmale und Beispiele

โšก Intelligente Zusammenfassung

Big Data beschreibt Sammlungen von Informationen, die so groรŸ, so vielfรคltig und so schnelllebig sind, dass herkรถmmliche Datenbanktools sie nicht speichern oder verarbeiten kรถnnen. Deshalb wurden verteilte Plattformen und neue Analysemethoden notwendig.

  • ๐Ÿ”˜ Definition: Datenvolumen allein macht noch keine Big Data aus; Komplexitรคt und Wachstumsrate sind genauso wichtig.
  • โ˜‘๏ธ Drei Arten: Strukturierte Daten haben ein festes Format, unstrukturierte Daten haben keins, und semistrukturierte Daten liegen dazwischen.
  • โœ… Durchgerechnete Beispiele: Bรถrsen, soziale Plattformen und Dรผsentriebwerke produzieren tรคglich Terabytes an neuen Datensรคtzen.
  • ๐Ÿงช Charakteristik: Volumen, Vielfalt, Geschwindigkeit und Variabilitรคt sind die vier klassischen Faktoren, oft ergรคnzt durch Wahrhaftigkeit und Wert.
  • ๏ธ Geschรคftswert: Externe Erkenntnisse, schnellere Analyse von Kundenfeedback, frรผhere Risikoerkennung und kostengรผnstigere Lagerentladung.
  • โš ๏ธ MaรŸstab heute: Weltweit werden derzeit tรคglich etwa 402 Millionen Terabyte an Daten erzeugt. track fรผr รผber 200 Zettabyte im Jahr 2026.

Big-Data-Typen und -Merkmale anhand von Beispielen erklรคrt

Bevor wir zur Einfรผhrung in Big Data kommen, mรผssen Sie zunรคchst wissen, was Daten รผberhaupt sind.

Was sind Daten?

Daten sind die Mengen, Zeichen oder Symbole, auf denen ein Computer Operationen ausfรผhrt und die gespeichert werden kรถnnen. transmitin Form von elektrischen Signalen erfasst und auf magnetischen, optischen oder mechanischen Aufzeichnungsmedien aufgezeichnet.

Schauen wir uns nun die Definition von Big Data an.

Was sind Big Data?

Big Data Big Data ist eine riesige Datenmenge, die exponentiell mit der Zeit wรคchst. Aufgrund ihres Umfangs und ihrer Komplexitรคt kรถnnen herkรถmmliche Datenmanagement-Tools sie weder effizient speichern noch verarbeiten. Big Data sind also immer noch Daten, nur in einer GrรถรŸenordnung, die die รผblichen Werkzeuge รผberfordert.

Das untenstehende Diagramm stellt diese Definition den gewรถhnlichen Daten gegenรผber, die eine Organisation bereits verarbeitet, sodass der Sprung in der GrรถรŸenordnung leicht erkennbar ist.

Diagramm zur Definition von Big Data und dessen Unterschieden zu Daten, die mit traditionellen Management-Tools verarbeitet werden.

Was sind Big Data?

Was ist ein Beispiel fรผr Big Data?

Im Folgenden sind einige Beispiele fรผr Big Data aufgefรผhrt:

Bรถrsendaten

Das New York Stock Exchange ist ein Beispiel fรผr Big Data, das etwa generiert ein Terabyte neuer Handelsdaten pro Tag.

Der Bรถrsenhandelssaal generiert tรคglich etwa ein Terabyte an Handelsdaten.

Soziale Medien

Das zeigt die Statistik 500+Terabyte Neue Daten werden in die Datenbanken der Social-Media-Sites aufgenommen Facebook, tรคglich. Diese Daten werden hauptsรคchlich durch das Hochladen von Fotos und Videos, den Austausch von Nachrichten, das Setzen von Kommentaren usw. generiert.

Symbole sozialer Medien, die das tรคgliche Volumen an Foto-, Video- und Nachrichtendaten veranschaulichen

Strahltriebwerke

Ein einzelner Dรผsentriebwerk erzeugen kann 10+Terabyte von Daten ein 30 ะœinuten der Flugzeit. Bei vielen tausend Flรผgen pro Tag reicht die Datengenerierung bis zu viele Petabyte.

Triebwerkssensoren erzeugen in dreiรŸig Minuten Flugzeit mehr als zehn Terabyte Telemetriedaten.

Diese drei Zahlen sind Momentaufnahmen pro Quelle aus der Zeit, als die Beispiele erstmals verรถffentlicht wurden, und sie sind seither noch gestiegen. Um einen aktuellen Eindruck zu vermitteln: Die Welt als Ganzes produziert jetzt ungefรคhr 402 Millionen Terabyte Daten pro Tag, wodurch sich die jรคhrliche Gesamtsumme fรผr 2026 auf track fรผr mehr als 200 Zettabyte.

Arten von Big Data

Im Folgenden sind die Typen von Big Data aufgefรผhrt:

  1. Strukturierte
  2. Unstrukturiert
  3. Halbstrukturiert

Strukturierte

Alle Daten, die in einem festen Format gespeichert, abgerufen und verarbeitet werden kรถnnen, werden als โ€žstrukturierteโ€œ Daten bezeichnet. Die Informatik hat im Laufe der Zeit groรŸe Erfolge bei der Entwicklung solcher Daten erzielt.ping Es gibt bewรคhrte Techniken fรผr die Verarbeitung solcher Daten, deren Format im Voraus bekannt ist, und zur Wertschรถpfung daraus. Probleme treten jedoch auf, wenn die GrรถรŸe dieser Daten enorm anwรคchst und typische GrรถรŸen mehrere Zettabyte erreichen.

WeiรŸt du es? Ein Zettabyte ist 1021 Bytes, Das ist eine Milliarde Terabyte.

Beim Anblick dieser Zahlen wird schnell klar, warum man von Big Data spricht, und man kann sich die Herausforderungen vorstellen, die mit der Speicherung und Verarbeitung dieser Daten verbunden sind.

WeiรŸt du es? Daten, die in einem relationalen Datenbankmanagementsystem gespeichert sind, sind ein Beispiel dafรผr 'strukturiert' Daten.

Beispiele fรผr strukturierte Daten

Eine Tabelle namens โ€žMitarbeiterโ€œ in einer Datenbank ist ein Beispiel fรผr strukturierte Daten. Jede Zeile hat dieselben fรผnf Spalten, und jede Spalte hat einen bekannten Datentyp, was die Abfrage der Daten erheblich vereinfacht.

Mitarbeiter-ID Mitarbeitername Geschlecht Abteilung Salary_In_lacs
2365 Rajesh Kulkarni Mรคnnlich Finanzen 650000
3398 Pratibha Joshi Weiblich Administrator 650000
7465 Shushil Roy Mรคnnlich Administrator 500000
7500 Shubhojit Das Mรคnnlich Finanzen 500000
7699 Priya Sane Weiblich Finanzen 550000

Unstrukturiert

Daten unbekannter Form oder Struktur werden als unstrukturierte Daten klassifiziert. Neben ihrem enormen Umfang stellen unstrukturierte Daten zahlreiche Herausforderungen bei der Verarbeitung dar, um daraus Nutzen zu ziehen. Ein typisches Beispiel fรผr unstrukturierte Daten ist eine heterogene Datenquelle, die eine Kombination aus einfachen Textdateien, Bildern, Videos usw. enthรคlt. Heutzutage verfรผgen Unternehmen รผber eine Fรผlle von Daten, wissen aber leider nicht, wie sie daraus Nutzen ziehen kรถnnen, da diese Daten in ihrem Roh- oder unstrukturierten Format vorliegen.

Beispiele fรผr unstrukturierte Daten

Die von ' zurรผckgegebene AusgabeGoogle Die Suche ist unstrukturiert: Dieselbe Abfrage liefert Seiten, Bilder, Snippets und Links ohne zugrundeliegendes gemeinsames Schema.

Google Suchergebnisseite als Beispiel fรผr unstrukturierte Daten mit gemischtem Text, Links und Bildern

Beispiel fรผr unstrukturierte Daten

Halbstrukturiert

Semistrukturierte Daten kรถnnen beide oben genannten Formen enthalten. Sie wirken strukturiert, sind aber nicht durch ein formales Schema wie beispielsweise eine Tabellendefinition in einem relationalen System definiert. DBMSEin gรคngiges Beispiel fรผr semistrukturierte Daten sind Daten in einer XML-Datei. JSON-Dokumente und Logzeilen mit Schlรผssel-Wert-Paaren fallen in dieselbe Kategorie.

Beispiele fรผr semistrukturierte Daten

In einer XML-Datei gespeicherte personenbezogene Daten-

<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec>
<rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec>
<rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec>
<rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec>
<rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>

Datenwachstum im Laufe der Jahre

Das Diagramm unten tracks wie sich die Mischung aus strukturierten und unstrukturierten Daten mit dem Anstieg des Gesamtvolumens verรคndert hat.

Diagramm zum Datenwachstum รผber die Jahre, das zeigt, dass unstrukturierte Daten strukturierte Daten รผberholt haben.

Datenwachstum im Laufe der Jahre

Bitte beachten Sie, dass Web-Anwendung Daten, die unstrukturiert sind, bestehen aus Protokolldateien, Transaktionsverlaufsdateien usw. OLTP-Systeme sind fรผr die Arbeit mit strukturierten Daten ausgelegt, wobei die Daten in Relationen (Tabellen) gespeichert werden.

Merkmale von Big Data

Big Data lรคsst sich durch folgende Merkmale beschreiben:

  • Volumen
  • Vielfalt
  • Geschwindigkeit
  • Variabilitรคt

(i) Volumen โ€“ Der Begriff Big Data selbst verweist auf eine enorme Datenmenge. Die GrรถรŸe der Daten spielt eine entscheidende Rolle fรผr den daraus ableitbaren Nutzen. Ob ein bestimmter Datensatz als Big Data gilt oder nicht, hรคngt von seinem Volumen ab. Daherโ€ฆ 'Volumen' ist ein Merkmal, das beim Umgang mit Big-Data-Lรถsungen berรผcksichtigt werden muss.

(ii) Vielfalt โ€“ Der nรคchste Aspekt von Big Data ist sein Vielfalt.

Die Vielfalt der Datenquellen und ihrer Beschaffenheit โ€“ sowohl strukturierter als auch unstrukturierter Daten โ€“ wird als Diversitรคt bezeichnet. Frรผher nutzten die meisten Anwendungen ausschlieรŸlich Tabellenkalkulationen und Datenbanken als Datenquellen. Heute werden in Analyseanwendungen auch Daten in Form von E-Mails, Fotos, Videos, รœberwachungsgerรคten, PDFs, Audiodateien usw. berรผcksichtigt. Diese Vielfalt unstrukturierter Daten stellt die Speicherung, das Data Mining und die Analyse vor gewisse Herausforderungen.

(iii) Geschwindigkeit โ€“ Die 'Geschwindigkeit' Bezieht sich auf die Geschwindigkeit der Datengenerierung. Wie schnell die Daten generiert und verarbeitet werden, um den Bedarf zu decken, bestimmt das tatsรคchliche Potenzial der Daten.

Die Geschwindigkeit von Big Data befasst sich mit der Geschwindigkeit, mit der Daten aus Quellen wie Geschรคftsprozessen, Anwendungsprotokollen, Netzwerken, Social-Media-Seiten und Sensoren einflieรŸen. Mobile Gerรคte usw. Der Datenfluss ist massiv und kontinuierlich.

(iv) Variabilitรคt โ€“ Damit ist die Inkonsistenz gemeint, die die Daten zeitweise aufweisen kรถnnen und die den Prozess der effektiven Handhabung und Verwaltung der Daten erschwert.

Heute werden dieser Liste รผblicherweise zwei weitere Eigenschaften hinzugefรผgt, wodurch die viel zitierten โ€žfรผnf Vsโ€œ entstehen:

  • Richtigkeit โ€“ wie vertrauenswรผrdig und genau die Daten sind. Doppelte Datensรคtze, Sensorabweichungen und fehlende Felder mindern die Aussagekraft, und auch ein hohes Datenvolumen kann dies nicht ausgleichen.
  • Wert โ€“ welchen Wert die Daten nach der Analyse tatsรคchlich haben. Daten, die nie zu einer Entscheidung fรผhren, verursachen lediglich zusรคtzliche Speicherkosten.

Vorteile der Big-Data-Verarbeitung

Die Fรคhigkeit, Big Data in einem DBMS zu verarbeiten, bietet zahlreiche Vorteile, wie zum Beispiel:

Unternehmen kรถnnen bei Entscheidungen externe Informationen nutzen.

Zugriff auf soziale Daten von Suchmaschinen Und Plattformen wie Facebook und X (ehemals Twitter) ermรถglichen es Unternehmen, ihre Geschรคftsstrategien zu verfeinern.

Verbesserter Kundenservice

Traditionelle Kundenfeedbacksysteme werden durch neue Systeme ersetzt, die auf Big-Data-Technologien basieren. In diesen neuen Systemen werden Big Data und Technologien zur Verarbeitung natรผrlicher Sprache eingesetzt, um Kundenreaktionen zu erfassen und auszuwerten.

Frรผherkennung von Risiken fรผr Produkte und Dienstleistungen

Durch die kontinuierliche Analyse von Transaktionsdatensรคtzen, Sensormesswerten und Support-Tickets werden Fehler, Betrugsmuster und Serviceausfรคlle bereits in geringem MaรŸe aufgedeckt, anstatt auf einen monatlichen Bericht zu warten, der sie offenbart.

Arbeitsumgebungen Operanationale Effizienz

Big-Data-Technologien kรถnnen verwendet werden, um einen Zwischenspeicher oder eine Landingzone fรผr neue Daten zu erstellen, bevor festgelegt wird, welche Daten verschoben werden sollen. Data WarehouseDarรผber hinaus hilft eine solche Integration von Big-Data-Technologien und dem Data Warehouse einer Organisation dabei, selten abgerufene Daten auszulagern.

Hรคufig gestellte Fragen

Nach aktuellen Schรคtzungen sind es rund 402 Millionen Terabyte pro Tag, womit die jรคhrliche Gesamtmenge im Jahr 2026 รผber 200 Zettabyte liegen dรผrfte. Die Zahl steigt stetig, da Video-, Sensor-Telemetrie- und Anwendungsprotokolle schneller wachsen als Transaktionsdatensรคtze.

Algorithms Man findet Muster in Millionen von Datensรคtzen, die kein Analyst manuell รผberprรผfen kรถnnte, und bewertet neue Datensรคtze anhand dieser Muster. GrรถรŸere und vielfรคltigere Trainingsdatensรคtze verbessern in der Regel die Genauigkeit, weshalb die beiden Forschungsbereiche eng miteinander verbunden sind.

Es eignet sich gut fรผr die Ausarbeitung von Routinearbeiten: Spark Transformationen, Schemadefinitionen, SQL-Joins und Konnektorkonfiguration. RevPrรผfen Sie die Ausgabe sorgfรคltig, denn generierte Pipelines ignorieren oft Partitionierung, Datentypen und Kosten, was bei realen Pipelines hรคufig zu Problemen fรผhrt.

Verteilte Speicher wie z. B. HDFS oder Cloud-Objektspeicher, Verarbeitungs-Engines wie Spark und Flink, Streaming-Systeme wie Kafka und Abfrageschichten wie HiveVerwaltete Cloud-Warehouses decken mittlerweile viele der gleichen Aufgaben ab.

Mangelhafte Datenqualitรคt, unklare Zustรคndigkeiten, hohe Speicher- und Rechenkosten sowie ein Mangel an Ingenieuren, die verteilte Systeme betreiben kรถnnen. Die meisten gescheiterten Projekte scheitern eher an Governance-Fragen und unklaren Geschรคftsfragen als an technologischen Problemen.

Regelungen wie die DSGVO schrรคnken ein, welche personenbezogenen Daten erhoben werden dรผrfen, wie lange sie gespeichert werden dรผrfen und wo sie gespeichert werden dรผrfen. Teams antworten mit Einwilligung. tracKรถnig, Aufbewahrungsrichtlinien, Pseudonymisierung und Audit-Logs sind in die Pipeline integriert.

Ein Data Lake speichert Rohdaten in beliebigen Formaten und strukturiert die Daten erst beim Lesen. Ein Data Warehouse hingegen speichert bereinigte, modellierte Tabellen und strukturiert die Daten erst beim Schreiben. Dadurch werden Abfragen beschleunigt, das Laden der Daten jedoch verlangsamt.

Zuerst SQL, dann eine Programmiersprache wie z. B. Python oder Scala, verteilte Verarbeitung mit SparkEine Cloud-Plattform und ausreichend Datenmodellierung, um Tabellen sinnvoll zu gestalten, sind erforderlich. Die Kommunikation ist ebenso wichtig, da die Ergebnisse auch Nicht-Techniker รผberzeugen mรผssen.

Fassen Sie diesen Beitrag mit folgenden Worten zusammen: