Tutorial Penambangan Data: Apa itu Penambangan Data? Teknik, Proses

โšก Ringkasan Cerdas

Penambangan data (Data Mining) adalah proses menemukan pola yang berpotensi berguna dalam kumpulan data yang besar. Halaman ini menjelaskan proses implementasi enam fase, tujuh teknik inti, alat-alat yang mendukungnya, contoh bisnis nyata, serta manfaat dan keterbatasan dari setiap pendekatan.

  • ๐Ÿ” Definisi: Penambangan data menggunakan pembelajaran mesin, statistik, dan AI untuk mengekstraksi data.tracmengidentifikasi hubungan tersembunyi dari kumpulan data besar.
  • ๏ธ Sumber data: Basis data relasional, gudang data, repositori transaksional, spasial, multimedia, dan teks semuanya mendukung penambangan data.
  • ๐Ÿ”„ Proses Implementasi: Pemahaman bisnis, pemahaman data, persiapan data, pemodelan, evaluasi, dan penerapan.
  • ๐Ÿงฉ Teknik Inti: Klasifikasi, pengelompokan, regresi, aturan asosiasi, deteksi outlier, pola sekuensial, dan prediksi.
  • ๏ธ Alat: R dan Oracle Pembelajaran Mesin menyediakan komputasi statistik dan pemodelan prediktif dalam basis data.
  • ๐Ÿข aplikasi: Sektor perbankan, ritel, asuransi, pendidikan, manufaktur, dan investigasi kriminal menerapkan penambangan data dalam pengambilan keputusan sehari-hari.
  • โš ๏ธ Keterbatasan: Overfitting, kekurangan keterampilan, dan kekhawatiran tentang privasi membatasi sejauh mana hasil dapat dipercaya.

Apa itu Penambangan Data, Teknik dan Prosesnya?

Apa itu Data Mining?

Data Mining adalah proses menemukan pola yang berpotensi berguna dari kumpulan data yang sangat besar. Ini adalah keterampilan multi-disiplin yang digunakan Mesin belajarstatistik dan AI untuk contohtracInformasi ini digunakan untuk mengevaluasi probabilitas kejadian di masa mendatang. Wawasan yang diperoleh dari Data Mining digunakan untuk pemasaran, deteksi penipuan, penemuan ilmiah, dan lain sebagainya.

Penambangan data adalah tentang menemukan hubungan tersembunyi, tak terduga, dan yang sebelumnya tidak diketahui namun valid di antara data. Penambangan data juga disebut Penemuan Pengetahuan dalam Data (Knowledge Discovery in Data/KDD), atau eksplorasi pengetahuan.tracanalisis data/pola, pengumpulan informasi, dll.

Jenis Data

Penambangan data dapat dilakukan pada jenis data berikut

  • Database relasional
  • Gudang data
  • DB tingkat lanjut dan repositori informasi
  • Database berorientasi objek dan relasional objek
  • Database Transaksional dan Spasial
  • Basis data heterogen dan lama
  • Basis data multimedia dan streaming
  • Basis data teks
  • Penambangan teks dan penambangan Web

Apa pun sumbernya, urutan fase yang disiplin yang sama mengubah data mentah tersebut menjadi model yang dapat digunakan.

Proses Implementasi Data Mining

Proses Implementasi Data Mining
Proses Implementasi Data Mining

Mari kita pelajari proses implementasi Data Mining secara detail

pengertian bisnis

Pada fase ini, tujuan bisnis dan penambangan data ditetapkan.

  • Pertama, Anda perlu memahami tujuan bisnis dan klien. Anda perlu mendefinisikan apa yang diinginkan klien Anda (yang seringkali bahkan mereka sendiri tidak mengetahuinya)
  • Perhatikan skenario penambangan data saat ini. Pertimbangkan sumber daya, asumsi, kendala, dan faktor penting lainnya dalam penilaian Anda.
  • Dengan menggunakan tujuan bisnis dan skenario saat ini, tentukan tujuan penambangan data Anda.
  • Rencana penambangan data yang baik sangat rinci dan harus dikembangkan untuk mencapai tujuan bisnis dan penambangan data.

Pemahaman data

Pada fase ini, dilakukan pengecekan kewajaran data untuk memastikan apakah data tersebut sesuai dengan tujuan penambangan data.

  • Pertama, data dikumpulkan dari berbagai sumber data yang tersedia di organisasi.
  • Sumber data ini dapat mencakup beberapa basis data, file datar, atau kubus data. Terdapat masalah seperti pencocokan objek dan integrasi skema yang dapat muncul selama proses Integrasi Data. Ini adalah proses yang cukup kompleks dan rumit karena data dari berbagai sumber cenderung tidak mudah cocok. Misalnya, tabel A berisi entitas bernama cust_no sedangkan tabel B berisi entitas bernama cust-id.
  • Oleh karena itu, cukup sulit untuk memastikan apakah kedua objek yang diberikan ini memiliki nilai yang sama atau tidak. Di sini, Metadata harus digunakan untuk mengurangi kesalahan dalam proses integrasi data.
  • Langkah selanjutnya adalah mencari properti dari data yang diperoleh. Cara yang baik untuk mengeksplorasi data adalah dengan menjawab pertanyaan data mining (diputuskan dalam fase bisnis) menggunakan alat kueri, pelaporan, dan visualisasi.
  • Berdasarkan hasil kueri, kualitas data harus dipastikan. Data yang hilang, jika ada, harus dilengkapi.

Persiapan data

Pada fase ini, data sudah siap diproduksi.

Persiapan data biasanya merupakan fase terpanjang, yang umumnya disebut-sebut mencapai 60% hingga 80% dari total upaya.

Data dari berbagai sumber harus dipilih, dibersihkan, diubah, diformat, dianonimkan, dan disusun (jika diperlukan).

Pembersihan data adalah proses untuk โ€œmembersihkanโ€ data dengan menghaluskan data yang berisik dan mengisi nilai yang hilang.

Misalnya, untuk profil demografi pelanggan, data usia tidak ada. Data tidak lengkap dan harus diisi. Dalam beberapa kasus, mungkin terdapat outlier data. Misalnya, umur mempunyai nilai 300. Data mungkin tidak konsisten. Misalnya, nama pelanggan berbeda di tabel yang berbeda.

Operasi transformasi data mengubah data agar bermanfaat dalam penambangan data. Transformasi berikut dapat diterapkan.

Transformasi data

Operasi transformasi data akan berkontribusi terhadap keberhasilan proses penambangan.

Menghaluskan: Ini membantu menghilangkan noise dari data.

Pengumpulan: Operasi ringkasan atau agregasi diterapkan pada data. Yaitu, data penjualan mingguan diagregasi untuk menghitung total bulanan dan tahunan.

Generalisasi: Pada langkah ini, data tingkat rendah digantikan oleh konsep tingkat yang lebih tinggi dengan bantuan hierarki konsep. Misalnya, kota digantikan oleh negara bagian atau negara.

Normalisasi: Normalisasi dilakukan ketika data atribut diperbesar atau diperkecil. Contoh: Data seharusnya berada dalam rentang -2.0 hingga 2.0 setelah normalisasi.

Konstruksi atributAtribut-atribut ini dibangun dan mencakup kumpulan atribut yang berguna untuk penambangan data.

Hasil dari proses ini adalah kumpulan data akhir yang dapat digunakan dalam pemodelan.

Modeling

Pada fase ini, model matematika digunakan untuk menentukan pola data.

  • Berdasarkan tujuan bisnis, teknik pemodelan yang sesuai harus dipilih untuk kumpulan data yang disiapkan.
  • Buat skenario untuk menguji kualitas dan validitas model.
  • Jalankan model pada kumpulan data yang telah disiapkan.
  • Hasilnya harus dinilai oleh seluruh pemangku kepentingan untuk memastikan model tersebut dapat memenuhi tujuan penambangan data.

Evaluasi

Pada fase ini, pola yang diidentifikasi dievaluasi berdasarkan tujuan bisnis.

  • Hasil yang dihasilkan oleh model penambangan data harus dievaluasi berdasarkan tujuan bisnis.
  • Mendapatkan pemahaman bisnis adalah proses yang berulang. Faktanya, sambil memahami, persyaratan bisnis baru mungkin muncul karena penambangan data.
  • Keputusan lanjutkan atau tidak diambil untuk memindahkan model dalam fase penerapan.

Penyebaran

Pada fase penerapan, Anda mengirimkan penemuan data mining Anda ke operasi bisnis sehari-hari.

  • Pengetahuan atau informasi yang ditemukan selama proses data mining harus dibuat mudah dipahami oleh pemangku kepentingan non-teknis.
  • Rencana penempatan terperinci untuk kapal.ping, pemeliharaan, dan pemantauan temuan penambangan data pun dibuat.
  • Laporan proyek akhir dibuat dengan pembelajaran dan pengalaman penting selama proyek berlangsung. Hal ini membantu meningkatkan kebijakan bisnis organisasi.

Fase pemodelan di atas menggunakan serangkaian teknik yang telah ditentukan, yang masing-masing sesuai untuk jenis pertanyaan yang berbeda.

Teknik Penambangan Data

1. Klasifikasi

Analisis ini digunakan untuk mengambil informasi penting dan relevan tentang data, dan metadata. Metode penambangan data ini membantu mengklasifikasikan data dalam kelas yang berbeda.

2. Clustering

ClusterAnalisis adalah teknik penambangan data untuk mengidentifikasi data yang mirip satu sama lain. Proses ini membantu untuk memahami perbedaan dan persamaan antar data.

3. Regresi

Analisis regresi adalah metode penambangan data untuk mengidentifikasi dan menganalisis hubungan antar variabel. Ini digunakan untuk mengidentifikasi kemungkinan suatu variabel tertentu, dengan adanya variabel lain.

4. Aturan Asosiasi

Teknik penambangan data ini membantu menemukan hubungan antara dua Item atau lebih. Ia menemukan pola tersembunyi dalam kumpulan data.

5. Deteksi Pencilan

Teknik penambangan data jenis ini mengacu pada pengamatan item data dalam dataset yang tidak sesuai dengan pola atau perilaku yang diharapkan. Teknik ini dapat digunakan dalam berbagai domain, seperti deteksi intrusi, deteksi penipuan atau kesalahan, dll. Deteksi outlier juga disebut Analisis Outlier atau Penambangan Outlier.

6. Pola Berurutan

Teknik data mining ini membantu menemukan atau mengidentifikasi pola atau tren serupa pada data transaksi untuk periode tertentu.

7. Ramalan

Prediksi telah menggunakan kombinasi teknik penambangan data lainnya seperti tren, pola sekuensial, pengelompokan, klasifikasi, dll. Prediksi ini menganalisis peristiwa atau kejadian masa lalu dalam urutan yang tepat untuk memprediksi peristiwa di masa depan.

DescriptPenambangan Data Interaktif vs Prediktif

Ketujuh teknik di atas dapat dikelompokkan menjadi dua keluarga, dan mengetahui keluarga mana suatu pertanyaan termasuk akan menentukan bagaimana hasil tersebut harus ditafsirkan.

Descriptpenambangan data langsung Meringkas apa yang telah terjadi. Ia mencari struktur di dalam data yang ada tanpa target yang ingin dicapai, itulah sebabnya terkadang disebut sebagai pembelajaran tanpa pengawasan (unsupervised learning). ClusterAturan asosiasi dan pola sekuensial termasuk di sini. Penemuan bahwa supermarket sering membeli popok dan bir bersamaan adalah temuan deskriptif: hal itu menjelaskan masa lalu, dan manusia memutuskan apa yang harus dilakukan selanjutnya.

Penambangan data prediktif Memperkirakan apa yang akan terjadi selanjutnya. Ia belajar dari catatan historis di mana jawabannya sudah diketahui, kemudian menerapkan pembelajaran itu pada catatan baru, itulah sebabnya disebut pembelajaran terawasi (supervised learning). Klasifikasi, regresi, dan prediksi termasuk di sini. Memberi skor pada pemohon pinjaman sebagai kemungkinan atau tidak mungkin gagal bayar adalah temuan prediktif.

Dua konsekuensi praktis muncul dari perbedaan tersebut.

  • Validasi berbeda: Model prediktif dapat dinilai akurasinya berdasarkan hasil yang diketahui. Hasil deskriptif tidak dapat dinilai demikian, sehingga dinilai berdasarkan apakah hasil tersebut menarik dan dapat ditindaklanjuti.
  • Persyaratan data berbeda-beda: Pekerjaan prediktif memerlukan kolom hasil historis yang diberi label. DescriptPekerjaan langsung tidak demikian, yang menjadikannya titik awal yang umum ketika sebuah bisnis memiliki data tetapi belum memiliki target yang jelas.

Tantangan dalam Menerapkan Penambangan Data

  • Pakar yang terampil diperlukan untuk merumuskan pertanyaan penambangan data.
  • Overfitting: Karena ukuran database pelatihan yang kecil, suatu model mungkin tidak sesuai dengan kondisi di masa mendatang.
  • Penambangan data membutuhkan database besar yang terkadang sulit dikelola
  • Praktik bisnis mungkin perlu dimodifikasi untuk menentukan penggunaan informasi yang ditemukan.
  • Jika kumpulan datanya tidak beragam, hasil data mining mungkin tidak akurat.
  • Integrasi informasi yang dibutuhkan dari database heterogen dan sistem informasi global bisa jadi rumit

Contoh Penambangan Data

Nah pada kursus Data Mining ini, mari kita belajar tentang Data mining dengan contoh:

Contoh 1:

Bayangkan seorang kepala pemasaran penyedia layanan telekomunikasi yang ingin meningkatkan pendapatan layanan jarak jauh. Untuk ROI tinggi pada upaya penjualan dan pemasarannya, pembuatan profil pelanggan sangat penting. Ia memiliki kumpulan data informasi pelanggan yang luas seperti usia, jenis kelamin, pendapatan, riwayat kredit, dll. Namun, mustahil untuk menentukan karakteristik orang yang lebih suka melakukan panggilan jarak jauh dengan analisis manual. Dengan menggunakan teknik penambangan data, ia dapat mengungkap pola antara pengguna panggilan jarak jauh yang sering dan karakteristik mereka.

Misalnya, dia mungkin mengetahui bahwa pelanggan terbaiknya adalah wanita menikah berusia antara 45 dan 54 tahun yang berpenghasilan lebih dari $80,000 per tahun. Upaya pemasaran dapat ditargetkan pada demografi tersebut.

Contoh 2:

Sebuah bank ingin mencari cara baru untuk meningkatkan pendapatan dari operasional kartu kreditnya. Mereka ingin memeriksa apakah penggunaan kartu kredit akan berlipat ganda jika biaya dikurangi setengahnya.

Bank tersebut memiliki catatan data selama beberapa tahun mengenai rata-rata saldo kartu kredit, jumlah pembayaran, penggunaan batas kredit, dan parameter kunci lainnya. Mereka membuat model untuk memeriksa dampak dari kebijakan bisnis baru yang diusulkan. Hasil data menunjukkan bahwa pengurangan biaya hingga setengahnya untuk basis pelanggan yang ditargetkan dapat meningkatkan pendapatan sebesar $10 juta.

Penambangan Data vs Pembelajaran Mesin

Kedua istilah tersebut sangat tumpang tindih dan sering digunakan secara bergantian, tetapi keduanya menjawab pertanyaan yang berbeda. Penambangan data bertujuan untuk menemukan pola yang sebelumnya tidak diketahui oleh seseorang. Pembelajaran mesin bertujuan untuk membangun sistem yang meningkatkan prediksinya sendiri seiring dengan masuknya lebih banyak data.

Titik perbedaan Data Mining Pembelajaran mesin
Tujuan utama Temukan pola yang belum diketahui dalam data yang ada. Bangun model yang memprediksi berdasarkan data baru.
Keterlibatan manusia Seorang analis menafsirkan dan menindaklanjuti temuan tersebut. Algoritma tersebut menerapkan aturan secara otomatis.
volume data Bekerja pada kumpulan data historis yang telah ditentukan. Kinerjanya membaik seiring bertambahnya data yang diberikan dari waktu ke waktu.
Keluaran biasa Suatu aturan, kelompok, atau asosiasi yang dapat dibaca oleh seseorang. Model terlatih yang mengembalikan skor atau kelas.
Hubungan Penambangan data sering menggunakan algoritma pembelajaran mesin sebagai penggeraknya.

Singkatnya, pembelajaran mesin adalah salah satu perangkat yang digunakan dalam penambangan data, dan penambangan data sederhana dapat dilakukan hanya dengan statistik.

Alat Penambangan Data

Berikut ini adalah 2 yang populer Alat Penambangan Data banyak digunakan di Industri

Bahasa R:

Bahasa R. adalah alat sumber terbuka untuk komputasi statistik dan grafik. R memiliki beragam statistik, uji statistik klasik, analisis deret waktu, klasifikasi, dan teknik grafis. Ini menawarkan fasilitas penyerahan dan penyimpanan data yang efektif.

Pelajari lebih lanjut di sini

Oracle Penambangan Data:

Oracle Data Mining, yang populer dikenal sebagai ODM, adalah modul dari Oracle Basis Data Analitik Tingkat Lanjut dan sekarang disajikan sebagai bagian dari Oracle Pembelajaran Mesin. Alat penambangan data ini memungkinkan analis data untuk menghasilkan wawasan terperinci dan membuat prediksi. Ini membantu memprediksi perilaku pelanggan, mengembangkan profil pelanggan, dan mengidentifikasi peluang penjualan silang.

Pelajari lebih lanjut di sini

Manfaat Penambangan Data

  • Teknik data mining membantu perusahaan mendapatkan informasi berbasis pengetahuan.
  • Penambangan data membantu organisasi membuat penyesuaian yang menguntungkan dalam operasi dan produksi.
  • Penambangan data adalah solusi yang hemat biaya dan efisien dibandingkan dengan aplikasi data statistik lainnya.
  • Penambangan data membantu proses pengambilan keputusan.
  • Memfasilitasi prediksi otomatis terhadap tren dan perilaku serta penemuan otomatis pola tersembunyi.
  • Hal ini dapat diimplementasikan dalam sistem baru maupun platform yang sudah ada
  • Ini adalah proses cepat yang memudahkan pengguna menganalisis data dalam jumlah besar dalam waktu lebih singkat.

Kerugian dari Penambangan Data

  • Terdapat risiko bahwa perusahaan menjual informasi penting tentang pelanggan mereka kepada organisasi lain, yang menimbulkan kekhawatiran signifikan terkait privasi.
  • Banyak perangkat lunak analitik penambangan data yang sulit dioperasikan dan memerlukan pelatihan terlebih dahulu untuk dapat digunakan.
  • Alat penambangan data yang berbeda bekerja dengan cara yang berbeda karena algoritma berbeda yang digunakan dalam desainnya. Oleh karena itu, pemilihan alat data mining yang tepat adalah tugas yang sangat sulit.
  • Teknik data mining tidak akurat sehingga dapat menimbulkan konsekuensi serius pada kondisi tertentu.

Aplikasi Penambangan Data

Aplikasi penggunaan
komunikasi Teknik penambangan data digunakan di sektor komunikasi untuk memprediksi perilaku pelanggan guna menawarkan kampanye yang sangat tepat sasaran dan relevan.
Asuransi Penambangan data membantu perusahaan asuransi menentukan harga produk mereka yang menguntungkan dan mempromosikan penawaran baru kepada pelanggan baru atau lama mereka.
Pendidikan Penambangan data bermanfaat bagi pendidik untuk mengakses data siswa, memprediksi tingkat prestasi, dan menemukan siswa atau kelompok siswa yang memerlukan perhatian ekstra. Misalnya siswa yang lemah dalam mata pelajaran matematika.
Manufaktur Dengan bantuan penambangan data, produsen dapat memprediksi keausan aset produksi. Mereka dapat mengantisipasi perawatan yang membantu mereka meminimalkan waktu henti.
Perbankan Penambangan data membantu sektor keuangan untuk mendapatkan gambaran risiko pasar dan mengelola kepatuhan terhadap peraturan. Ini membantu bank untuk mengidentifikasi kemungkinan orang yang mangkir untuk memutuskan apakah akan menerbitkan kartu kredit, pinjaman, dll.
Retail Teknik penambangan data membantu pusat perbelanjaan dan toko kelontong mengidentifikasi dan menempatkan barang-barang yang paling laris di posisi yang paling menarik perhatian. Hal ini membantu pemilik toko untuk membuat penawaran yang mendorong pelanggan untuk meningkatkan pengeluaran mereka.
Penyedia Layanan Penyedia layanan seperti industri telepon seluler dan utilitas menggunakan Data Mining untuk memprediksi alasan pelanggan meninggalkan perusahaan mereka. Mereka menganalisis detail penagihan, interaksi layanan pelanggan, keluhan yang disampaikan kepada perusahaan untuk menetapkan skor probabilitas bagi setiap pelanggan dan menawarkan insentif.
E-commerce Situs web e-niaga menggunakan Data Mining untuk menawarkan penjualan silang dan penjualan atas melalui situs web mereka. Salah satu nama yang paling terkenal adalah Amazon, yang menggunakan teknik penambangan data untuk menarik lebih banyak pelanggan ke toko eCommerce mereka.
Pasar Super Penambangan data memungkinkan supermarket untuk mengembangkan aturan guna memprediksi apakah pelanggan mereka kemungkinan sedang hamil. Dengan mengevaluasi pola pembelian mereka, mereka dapat menemukan pelanggan wanita yang kemungkinan besar hamil. Mereka dapat mulai menargetkan produk-produk seperti bedak bayi, sabun bayi, popok, dan sebagainya.
Investigasi Kejahatan Penambangan Data membantu lembaga investigasi kejahatan untuk mengerahkan tenaga polisi (di mana kejahatan paling mungkin terjadi dan kapan?), siapa yang harus digeledah di perbatasan, dll.
Bioinformatika Penambangan Data membantu menambang data biologis dari kumpulan data besar yang dikumpulkan dalam bidang biologi dan kedokteran.

Pertanyaan Umum Demo Slot

Tidak sepenuhnya benar. Penemuan Pengetahuan dalam Basis Data adalah keseluruhan alur kerja, mulai dari pemilihan dan pembersihan hingga interpretasi. Penambangan data adalah langkah pencarian pola di dalamnya, meskipun kedua nama tersebut sekarang digunakan secara bergantian dalam praktiknya.

SQL misalnyatracmengumpulkan data, statistik untuk menilai apakah suatu pola itu nyata, satu bahasa seperti R atau Pythondan pengetahuan mendalam tentang bisnis tersebut. Komunikasi sama pentingnya, karena temuan harus mampu meyakinkan para pemangku kepentingan non-teknis.

Pengumpulan dan penggunaan data dianggap legal jika data tersebut dilakukan secara sah. Regulasi seperti GDPR mensyaratkan dasar hukum, pembatasan tujuan, dan seringkali anonimisasi, sehingga identitas pribadi biasanya dihapus sebelum penambangan data dimulai.

Ini mempersingkat langkah-langkah paling lambat. Asisten AI menulis contoh.tracAnalis mengajukan pertanyaan, menyarankan aturan pembersihan, dan menyusun penjelasan model dalam bahasa yang mudah dipahami untuk para pemangku kepentingan. Analis tetap merumuskan pertanyaan bisnis dan memvalidasi setiap hasilnya.

Ya, sebagai titik awal. Jelaskan data dan pertanyaannya, dan asisten AI akan merekomendasikan klasifikasi, pengelompokan, atau regresi dan menjelaskan alasannya. Konfirmasikan pilihan tersebut terhadap sampel uji sebelum mengandalkannya.

Ringkaslah postingan ini dengan: