Apa itu Big Data? Jenis, Karakteristik & Contoh

โšก Ringkasan Cerdas

Big Data menggambarkan kumpulan informasi yang sangat besar, sangat beragam, dan sangat cepat berubah sehingga perangkat lunak basis data biasa tidak dapat menyimpan atau memprosesnya, itulah sebabnya platform terdistribusi dan metode analisis baru menjadi diperlukan.

  • ๐Ÿ”˜ Definisi: Volume saja tidak cukup untuk membuat data menjadi besar; kompleksitas dan tingkat pertumbuhan sama pentingnya.
  • โ˜‘๏ธ Tiga jenis: Data terstruktur memiliki format tetap, data tidak terstruktur tidak memiliki format, dan data semi-terstruktur berada di antara keduanya.
  • โœ… Contoh soal: Bursa saham, platform media sosial, dan mesin jet masing-masing menghasilkan terabyte data baru setiap hari.
  • ๐Ÿงช karakteristik: Volume, variasi, kecepatan, dan variabilitas adalah empat hal klasik, dengan kebenaran dan nilai sering ditambahkan.
  • ๏ธ Nilai bisnis: Intelijen eksternal, analisis umpan balik pelanggan yang lebih cepat, deteksi risiko lebih awal, dan biaya bongkar muat gudang yang lebih murah.
  • โš ๏ธ Skala saat ini: Saat ini, dunia menghasilkan sekitar 402 juta terabyte setiap hari, track untuk lebih dari 200 zettabyte pada tahun 2026.

Jenis dan karakteristik Big Data dijelaskan beserta contohnya.

Sebelum masuk ke pengantar Big Data, Anda perlu terlebih dahulu mengetahui apa itu data.

Apa itu Data?

Data adalah kuantitas, karakter, atau simbol yang diolah oleh komputer, yang dapat disimpan dan transmitDisampaikan dalam bentuk sinyal listrik dan direkam pada media perekaman magnetik, optik, atau mekanis.

Sekarang, mari kita lihat definisi Big Data.

Apa itu Big Data?

Big data Big Data adalah kumpulan data yang volumenya sangat besar, namun terus bertambah secara eksponensial seiring waktu. Ini adalah data dengan ukuran dan kompleksitas yang sangat besar sehingga tidak ada alat manajemen data tradisional yang dapat menyimpan atau memprosesnya secara efisien. Big Data tetaplah data, tetapi dengan ukuran yang melampaui kemampuan alat-alat yang biasa digunakan.

Diagram di bawah ini membandingkan definisi tersebut dengan data biasa yang sudah ditangani oleh suatu organisasi, sehingga peningkatan skalanya mudah terlihat.

Diagram yang mendefinisikan Big Data dan perbedaannya dengan data yang ditangani oleh alat manajemen tradisional.

Apa itu Big Data?

Apa Contoh Big Data?

Berikut ini adalah beberapa contoh Big Data-

Data Bursa Saham

The New York Stock Exchange adalah contoh Big Data yang menghasilkan tentang satu terabyte data perdagangan baru per hari.

Lantai perdagangan bursa saham menghasilkan sekitar satu terabyte data perdagangan per hari.

Media sosial

Statistik menunjukkan hal itu 500+terabyte data baru dimasukkan ke dalam database situs media sosial Facebook, setiap hari. Data ini terutama dihasilkan dalam hal unggahan foto dan video, pertukaran pesan, pemberian komentar, dll.

Ikon media sosial yang menggambarkan volume data foto, video, dan pesan setiap hari.

Mesin jet

Tunggal Mesin jet dapat menghasilkan 10+terabyte data di 30 menit waktu penerbangan. Dengan ribuan penerbangan per hari, pembangkitan data menjangkau hingga banyak orang Petabyte.

Sensor mesin jet menghasilkan lebih dari sepuluh terabyte data telemetri dalam tiga puluh menit penerbangan.

Ketiga angka ini adalah cuplikan per sumber dari periode ketika contoh-contoh tersebut pertama kali dipublikasikan, dan jumlahnya terus meningkat sejak saat itu. Untuk memberikan gambaran skala saat ini, dunia secara keseluruhan sekarang menciptakan kira-kira 402 juta terabyte data setiap hari, sehingga total tahunan pada tahun 2026 menjadi track untuk lebih dari 200 zettabyte.

Jenis-jenis Big Data

Berikut ini adalah jenis-jenis Big Data:

  1. Tersusun
  2. Tidak terstruktur
  3. Semi-terstruktur

Tersusun

Segala data yang dapat disimpan, diakses, dan diproses dalam format tetap disebut data 'terstruktur'. Seiring waktu, ilmu komputer telah mencapai kesuksesan besar dalam mengembangkanping Terdapat berbagai teknik untuk mengolah jenis data ini, di mana formatnya sudah diketahui sebelumnya, dan untuk mendapatkan nilai darinya. Namun, kini kita menghadapi masalah ketika ukuran data tersebut tumbuh sangat besar, dengan ukuran tipikal mencapai beberapa zettabyte.

Apakah Anda tahu? Satu zettabyte adalah 1021 byte, Yang satu miliar terabyte.

Dengan melihat angka-angka ini, kita dapat dengan mudah memahami mengapa disebut Big Data, dan membayangkan tantangan yang terkait dengan penyimpanan dan pengolahannya.

Apakah Anda tahu? Data yang tersimpan dalam sistem manajemen basis data relasional adalah salah satu contoh dari 'tersusun' Data.

Contoh Data Terstruktur

Tabel 'Karyawan' dalam basis data adalah contoh data terstruktur. Setiap baris memiliki lima kolom yang sama, dan setiap kolom memiliki tipe data yang diketahui, yang justru membuat data mudah untuk diakses.

Identitas pegawai Nama karyawan Gender Departemen Gaji_In_lacs
2365 Rajesh Kulkarni Pria Cicilan 650000
3398 Pratibha Joshi Perempuan admin 650000
7465 Shushil Roy Pria admin 500000
7500 Shubhojit Das Pria Cicilan 500000
7699 Priya Waras Perempuan Cicilan 550000

Tidak terstruktur

Setiap data dengan bentuk atau struktur yang tidak diketahui diklasifikasikan sebagai data tidak terstruktur. Selain ukurannya yang sangat besar, data tidak terstruktur menimbulkan banyak tantangan dalam hal pengolahannya untuk mendapatkan nilai. Contoh tipikal data tidak terstruktur adalah sumber data heterogen yang berisi kombinasi file teks sederhana, gambar, video, dan lain-lain. Saat ini, organisasi memiliki banyak sekali data yang tersedia, tetapi sayangnya mereka tidak tahu bagaimana cara mendapatkan nilai darinya, karena data tersebut masih dalam format mentah atau tidak terstruktur.

Contoh Data Tidak Terstruktur

Output yang dikembalikan oleh 'Google Pencarian bersifat tidak terstruktur: kueri yang sama mengembalikan halaman, gambar, cuplikan, dan tautan tanpa skema umum di baliknya.

Google Halaman hasil pencarian sebagai contoh data tidak terstruktur dengan campuran teks, tautan, dan gambar.

Contoh data tidak terstruktur

Semi-terstruktur

Data semi-terstruktur dapat berisi kedua bentuk di atas. Meskipun terlihat terstruktur, data ini tidak didefinisikan oleh skema formal seperti definisi tabel dalam basis data relasional. DBMSContoh umum data semi-terstruktur adalah data yang direpresentasikan dalam file XML. Dokumen JSON dan baris log dengan pasangan kunci-nilai termasuk dalam kategori yang sama.

Contoh Data Semi-terstruktur

Data pribadi disimpan dalam file XML-

<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec>
<rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec>
<rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec>
<rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec>
<rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>

Pertumbuhan Data Selama Bertahun-tahun

Bagan di bawah ini tracks bagaimana perpaduan antara data terstruktur dan tidak terstruktur telah bergeser seiring dengan meningkatnya volume total.

Grafik pertumbuhan data selama bertahun-tahun menunjukkan data tidak terstruktur melampaui data terstruktur.

Pertumbuhan data selama bertahun-tahun

Harap dicatat bahwa aplikasi web Data yang tidak terstruktur terdiri dari file log, file riwayat transaksi, dan lain-lain. Sistem OLTP dibangun untuk bekerja dengan data terstruktur, di mana data disimpan dalam relasi (tabel).

Karakteristik Big Data

Big Data dapat dijelaskan dengan karakteristik sebagai berikut:

  • Volume
  • Variasi
  • Kecepatan
  • Variabilitas

(i) Volume โ€“ Nama Big Data sendiri berkaitan dengan ukuran yang sangat besar. Ukuran data memainkan peran yang sangat penting dalam menentukan nilai yang dapat diperoleh darinya. Selain itu, apakah suatu kumpulan data tertentu benar-benar dapat dianggap sebagai Big Data atau tidak bergantung pada volumenya. Oleh karena itu, 'Volume' adalah salah satu karakteristik yang perlu dipertimbangkan saat menangani solusi Big Data.

(ii) Variasi โ€“ Aspek selanjutnya dari Big Data adalah miliknya variasi.

Variasi mengacu pada sumber yang heterogen dan sifat data, baik terstruktur maupun tidak terstruktur. Pada masa lalu, spreadsheet dan basis data adalah satu-satunya sumber data yang dipertimbangkan oleh sebagian besar aplikasi. Saat ini, data dalam bentuk email, foto, video, perangkat pemantauan, PDF, audio, dan lain-lain juga dipertimbangkan dalam aplikasi analisis. Variasi data tidak terstruktur ini menimbulkan beberapa masalah dalam penyimpanan, penggalian, dan analisis data.

(iii) Kecepatan โ€“ Istilah 'kecepatan' mengacu pada kecepatan generasi data. Seberapa cepat data dihasilkan dan diproses untuk memenuhi permintaan menentukan potensi sebenarnya dari data tersebut.

Kecepatan Big Data berkaitan dengan kecepatan aliran data yang masuk dari berbagai sumber seperti proses bisnis, log aplikasi, jaringan, situs media sosial, sensor, mobil perangkat, dll. Aliran data sangat besar dan berkelanjutan.

(iv) Variabilitas โ€“ Hal ini mengacu pada ketidakkonsistenan yang kadang-kadang ditunjukkan oleh data, sehingga menghambat proses penanganan dan pengelolaan data secara efektif.

Saat ini, dua karakteristik lagi umumnya ditambahkan ke daftar tersebut, sehingga menghasilkan "lima V" yang banyak dikutip:

  • kebenaran โ€“ seberapa terpercaya dan akurat data tersebut. Data duplikat, pergeseran sensor, dan kolom yang hilang semuanya mengurangi keakuratan, dan volume data sebesar apa pun tidak dapat mengimbanginya.
  • Nilai โ€“ nilai sebenarnya dari data tersebut setelah dianalisis. Data yang tidak pernah diubah menjadi keputusan hanya menambah biaya penyimpanan.

Keunggulan Pengolahan Big Data

Kemampuan untuk memproses Big Data dalam DBMS memberikan banyak manfaat, seperti:

Bisnis Dapat Menggunakan Informasi dari Luar Saat Mengambil Keputusan

Akses ke data sosial dari mesin pencari dan situs-situs seperti Facebook dan X (sebelumnya Twitter) memungkinkan organisasi untuk menyempurnakan strategi bisnis mereka.

Layanan Pelanggan yang Ditingkatkan

Sistem umpan balik pelanggan tradisional sedang digantikan oleh sistem baru yang dirancang dengan teknologi Big Data. Dalam sistem baru ini, teknologi Big Data dan pemrosesan bahasa alami digunakan untuk membaca dan mengevaluasi tanggapan konsumen.

Identifikasi Dini Risiko terhadap Produk dan Layanan

Melakukan analisis secara terus-menerus terhadap catatan transaksi, pembacaan sensor, dan tiket dukungan akan mengungkap cacat, pola penipuan, dan kegagalan layanan saat masih kecil, alih-alih menunggu laporan bulanan untuk mengungkapkannya.

Lebih baik OperaEfisiensi Nasional

Teknologi Big Data dapat digunakan untuk membuat area penampungan atau zona pendaratan untuk data baru sebelum mengidentifikasi data mana yang harus dipindahkan ke tempat penyimpanan utama. data warehouseSelain itu, integrasi teknologi Big Data dan data warehouse seperti ini membantu organisasi mengurangi beban data yang jarang diakses.

Pertanyaan Umum Demo Slot

Berdasarkan perkiraan saat ini, sekitar 402 juta terabyte per hari, yang berarti total tahunan pada tahun 2026 akan melebihi 200 zettabyte. Angka ini terus meningkat karena data video, telemetri sensor, dan log aplikasi tumbuh lebih cepat daripada catatan transaksi.

Algorithms Menemukan pola di antara jutaan catatan yang tidak mungkin ditinjau secara manual oleh analis mana pun, kemudian memberi skor pada catatan baru berdasarkan pola tersebut. Kumpulan data pelatihan yang lebih besar dan lebih beragam biasanya meningkatkan akurasi, itulah sebabnya kedua bidang ini berkembang bersama.

Ini menyusun pekerjaan rutin dengan baik: Spark transformasi, definisi skema, penggabungan SQL, dan konfigurasi konektor. RevPerhatikan outputnya dengan saksama, karena pipeline yang dihasilkan sering mengabaikan partisi, tipe data, dan biaya, yang merupakan titik kegagalan pipeline sebenarnya.

Penyimpanan terdistribusi seperti HDFS atau penyimpanan objek cloud, mesin pemrosesan seperti Spark dan Flink, sistem streaming seperti Kafka, dan lapisan kueri seperti Sarang lebahGudang data cloud terkelola kini mencakup banyak pekerjaan yang sama.

Kualitas data yang buruk, kepemilikan yang tidak jelas, biaya penyimpanan dan komputasi, serta kekurangan insinyur yang dapat mengoperasikan sistem terdistribusi. Sebagian besar proyek yang gagal terhenti karena tata kelola dan pertanyaan bisnis yang tidak jelas, bukan karena teknologi.

Aturan seperti GDPR membatasi data pribadi apa yang boleh dikumpulkan, berapa lama data tersebut boleh disimpan, dan di mana data tersebut boleh disimpan. Tim merespons dengan persetujuan. tracking, kebijakan retensi, pseudonimisasi, dan log audit yang terintegrasi ke dalam alur kerja.

Data lake menyimpan file mentah dalam format apa pun dan menerapkan struktur saat data dibaca. Gudang data menyimpan tabel yang telah dibersihkan dan dimodelkan, serta menerapkan struktur saat data ditulis, yang membuat kueri lebih cepat tetapi proses pemuatan lebih lambat.

SQL terlebih dahulu, kemudian bahasa pemrograman seperti... Python atau Scala, pemrosesan terdistribusi dengan Spark, sebuah platform cloud, dan pemodelan data yang memadai untuk mendesain tabel secara masuk akal. Komunikasi sama pentingnya, karena hasilnya harus meyakinkan pembaca non-teknis.

Ringkaslah postingan ini dengan: