Cara Memasang HIVE di Ubuntu (Unduh & Panduan Pengaturan)

โšก Ringkasan Cerdas

Apache Hive diinstal pada Ubuntu Sebagai lapisan gudang data tipis di atas klaster Hadoop yang sudah berjalan, pengaturannya sebagian besar hanya berupa mengekstrak satu arsip dan mengarahkan tiga variabel lingkungan ke direktori yang tepat.

  • ๐Ÿงฑ Hadoop pertama: Setiap daemon Hadoop harus sudah berjalan, karena Hive menyimpan data tabelnya di HDFS dan mengirimkan tugas-tugasnya ke klaster.
  • (I.e. Unduh sumber: Rilis biner berasal dari halaman mirror Apache, dan lini 3.x telah mencapai akhir masa pakainya pada Oktober 2024.
  • ๐Ÿ“ Dua file konfigurasi: HIVE_HOME berada di bashrc, dan HADOOP_HOME berada di hive-config.sh di dalam direktori bin Hive.
  • ๐Ÿ’พ Folder HDFS: Direktori warehouse dan tmp harus ada di HDFS dengan izin tulis grup sebelum tabel pertama dibuat.
  • ๐Ÿงฉ Langkah skema: Utilitas schematool membuat tabel metastore, dan Hive 3.x dan versi yang lebih baru menolak untuk memulai dengan skema yang belum diinisialisasi.
  • ๐Ÿ”จ Verifikasi dengan cepat: Pernyataan `create` yang diikuti dengan `describe` membuktikan bahwa shell, metastore, dan HDFS semuanya terhubung dengan benar.

Cara menginstal Hive di Ubuntu

Sebelum instalasi Apache Hive, kami memerlukan akses khusus. Hadoop instalasi, aktif dan berjalan dengan semua daemon Hadoop.

Untuk instalasi Hadoop, periksa ini. link.

Setelah semua daemon Hadoop berfungsi dengan baik, mulailah instalasi bagian Hive. Panduan di bawah ini akan membahas empat tahap:

Proses instalasi Apache Hive

  1. Persyaratan dan kompatibilitas versi
  2. Pemasangan Sarang
  3. Inisialisasi skema metastore
  4. Perintah shell sarang

Prasyarat untuk Menginstal Apache Hive pada Ubuntu

Hive bukanlah basis data mandiri. Ini adalah lapisan kueri yang menerjemahkan HiveQL menjadi tugas yang berjalan pada klaster yang sudah ada, sehingga hampir setiap instalasi yang gagal akan tercakup. tracMasalahnya kembali pada prasyarat yang hilang, bukan pada Hive itu sendiri. Konfirmasikan hal berikut sebelum mengunduh apa pun:

  • JDK yang didukung. Hive 4.1.x berjalan pada JDK 17, sedangkan Hive 4.2.x menaikkan minimumnya menjadi JDK 21. Periksa versinya dengan java -version dan pastikan JAVA_HOME diekspor.
  • Klaster Hadoop yang sedang berjalan. Baik NameNode maupun DataNode harus aktif. Jalankan JPS dan pastikan bahwa NameNode, DataNode, ResourceManager, dan NodeManager semuanya muncul dalam daftar.
  • Akses tulis ke HDFS. Akun yang menjalankan Hive memerlukan izin untuk membuat direktori di bawah HDFS.
  • Versi yang cocok. Hive 4.2.0 dibangun berdasarkan Hadoop 3.4.1 dan Tez 0.10.5. Seri Hive 3.x telah mencapai akhir masa pakainya pada Oktober 2024, jadi instalasi baru harus menargetkan seri 4.x.
  • Sumber daya gratis. Konfigurasi pembelajaran satu node cukup memadai dengan RAM sekitar 4 GB dan ruang disk kosong sekitar 20 GB.

Setelah semua persyaratan terpenuhi, proses pengunduhan dan pembukaan arsip di bawah ini berjalan tanpa kendala.

Cara Memasang Hive di Ubuntu

Di bawah ini adalah proses langkah demi langkah tentang cara menginstal Hive Ubuntu:

Langkah 1) Unduh dan Instal Hive Ubuntu

Untuk mengunduh instalasi stabil Hive, lihat Apache URL seperti yang disebutkan di bawah ini.

https://www.apache.org/dyn/closer.cgi/hive/ โ€” pergi ke URL lalu pilih tautan unduhan mirror Apache. Kemudian Halaman unduhan Apache Hive Daftar rilis mana yang dipasangkan dengan versi Hadoop mana.

Halaman mirror akan terbuka dengan daftar direktori rilis Hive yang tersedia, seperti yang ditunjukkan di bawah ini.

Halaman mirror Apache yang mencantumkan direktori rilis Apache Hive yang tersedia.

Pilih versi terbaru dari instalasi Hive. (Dalam kasus saya saat ini adalah hive โ€“ 3.1.2.) Folder rilis menampilkan arsip biner dan sumber secara berdampingan.

Folder rilis Hive yang menampilkan arsip distribusi biner dan kode sumber.

Klik pada file bin dan unduhan akan dimulai.

Permintaan unduhan browser untuk file distribusi apache-hive bin tar.gz.

Langkah 2) Contohtracfile tar

Buka lokasi file tar yang telah diunduh, lalu ekstraktracEkstrak file tar dengan menggunakan perintah berikut untuk menginstal Hive. Ubuntu pada sistem Anda.

tar -xvf  apache-hive-3.1.2-bin.tar.gz

Terminal akan menampilkan setiap file saat diekstrak ke dalam direktori Hive yang baru.

Output terminal saat arsip tar Hive sedang diekstraksi.tracted pada Ubuntu

Langkah 3) Tempatkan properti konfigurasi yang berbeda di Apache Hive

Pada langkah ini, kita akan melakukan dua hal:

  1. Menambahkan path home Hive ke dalam file bashrc.
  2. Menempatkan lokasi jalur utama Hadoop di hive-config.sh

1) Sebutkan jalur Hive di ~/.bashrc

Buka file untuk diedit dengan perintah yang ditunjukkan di bawah ini.

Perintah yang membuka file bashrc untuk mengedit variabel lingkungan Hive.

  • Buka file bashrc seperti yang ditunjukkan pada tangkapan layar di atas.
  • Sebutkan jalur home Hive, yaitu jalur HIVE_HOME, di dalam file bashrc dan ekspor seperti yang ditunjukkan di bawah ini.

Baris ekspor HIVE_HOME dan PATH ditambahkan di akhir file bashrc.

Code untuk ditempatkan di bashrc:

export HIVE_HOME="/home/guru99hive/apache-hive-1.2.0-bin"
export PATH=$PATH:$HIVE_HOME/bin

Muat ulang file dengan sumber ~ / .bashrc Jadi, jalur baru tersebut akan berlaku pada sesi terminal saat ini.

2) Mengekspor jalur Hadoop di hive-config.sh

Untuk berkomunikasi dengan ekosistem Hadoop, kita mendefinisikan jalur utama Hadoop di file konfigurasi Hive. Buka hive-config.sh seperti yang ditunjukkan di bawah ini.

Perintah yang digunakan untuk membuka hive-config.sh dari direktori bin Hive.

Sebutkan jalur HADOOP_HOME di file hive-config.sh seperti yang ditunjukkan di bawah ini.

Jalur HADOOP_HOME dideklarasikan di dalam file hive-config.sh

Langkah 4) Buat direktori Hive di Hadoop

Untuk berkomunikasi dengan Hadoop, kita perlu membuat direktori di Hadoop seperti yang ditunjukkan di bawah ini. Hive menulis data tabel terkelola ke dalam direktori warehouse dan output staging ke dalam direktori tmp.

Perintah HDFS yang membuat direktori tmp dan warehouse di Hive.

Memberikan izin root untuk membuat folder Hive di Hadoop. Jika tidak muncul pesan kesalahan, berarti Hadoop telah berhasil memberikan izin ke folder Hive.

Terminal menampilkan izin tulis grup yang diberikan ke folder Hive di HDFS.

Langkah 5) Masuk ke shell Hive

Masuk ke shell Hive dengan memasukkan '. /sarang lebah' perintah seperti yang ditunjukkan di bawah ini.

Prompt shell Hive dibuka dari direktori bin Hive pada Ubuntu

Cara Menginisialisasi Skema Metastore Hive

Hive menyimpan setiap nama tabel, nama kolom, dan tipe data dalam penyimpanan relasional yang disebut metastore. Pada instalasi baru, penyimpanan tersebut kosong, dan mulai dari Hive 3.x dan seterusnya, shell menolak untuk memulai sampai tabel skema ada. Utilitas schematool yang disertakan dalam direktori bin Hive akan membuatnya.

Untuk pengaturan pembelajaran pengguna tunggal, basis data Derby yang disertakan sudah cukup:

$HIVE_HOME/bin/schematool -dbType derby -initSchema

Perintah tersebut mencetak versi skema yang dibuatnya dan diakhiri dengan schemaTool selesaiDerby menulis file-nya ke direktori tempat perintah dijalankan, jadi selalu jalankan Hive dari direktori yang sama setelahnya.

Derby hanya menerima satu sesi aktif dalam satu waktu, yang membuatnya tidak cocok untuk klaster bersama. Arahkan Hive ke MySQL Sebagai gantinya, tambahkan properti koneksi ke hive-site.xml dan jalankan kembali alat tersebut dengan tipe basis data yang berbeda:

$HIVE_HOME/bin/schematool -dbType mysql -initSchema

Daftar properti lengkap dan penempatan pengemudi dibahas dalam panduan tentang cara konfigurasikan metastore Hive dengan MySQLDua bendera lagi yang patut diingat:

  • -Info melaporkan versi skema yang saat ini tercatat di metastore tanpa mengubah apa pun.
  • -upgradeSchema Memigrasikan metastore yang sudah ada ke versi skema dari rilis Hive yang baru diinstal.

Dengan skema yang sudah ada, shell siap menerima pernyataan HiveQL pertamanya.

Perintah shell sarang

Di sini kita akan membuat tabel contoh menggunakan perintah shell Hive โ€œcreateโ€ dengan nama kolom.

Contoh kode untuk membuat basis data di Hive. Tangkapan layar di bawah menunjukkan pernyataan pembuatan dan output deskripsi secara berurutan.

Output shell Hive untuk perintah create table dan describe product

Dari tangkapan layar di atas, kita dapat mengamati hal-hal berikut:

1) Pembuatan tabel contoh dengan nama kolom di Hive

  • Di sini nama tabelnya adalah โ€œprodukโ€ dengan tiga nama kolom produk, nama, dan harga
  • Ketiga nama kolom tersebut ditunjukkan oleh tipe data masing-masing.
  • Semua kolom diakhiri dengan koma ', '

2) Menampilkan informasi tabel Hive

  • Dengan menggunakan perintah โ€œdescribeโ€, kita dapat melihat informasi tabel yang ada di Hive.
  • Berikut ini ditampilkan nama-nama kolom beserta tipe data masing-masing yang ada dalam skema tabel.
  • Pada akhirnya, akan ditampilkan waktu yang dibutuhkan untuk menjalankan perintah ini dan jumlah baris yang diambil.

Contoh kode untuk membuat basis data di Sarang lebah (untuk pengecekan mandiri)

1) Buat tabel product(product int, pname string, price float)

Row format delimited
Fields terminated by ',';

2) mendeskripsikan produk;

Setelah tabel merespons perintah deskripsi, shell, metastore, dan HDFS semuanya terhubung. Dari sini, sesi yang sama menerima informasi yang lebih luas. membuat, mengubah, dan menghapus tabel pernyataan dan urutkan berdasarkan, kelompokkan berdasarkan, dan klasterkan berdasarkan pertanyaan.

Kesalahan Umum Instalasi Hive pada Ubuntu dan Cara Memperbaikinya

Sebagian besar kegagalan saat pertama kali dijalankan berasal dari lingkungan sekitar Hive, bukan dari Hive itu sendiri. Tabel di bawah ini memetakan pesan yang paling sering muncul ke penyebabnya dan perintah yang dapat mengatasinya.

Pesan di layar Kemungkinan penyebab Memperbaiki
hive: perintah tidak ditemukan HIVE_HOME/bin tidak ada di PATH. Periksa kembali baris ekspor di bashrc, lalu jalankan. sumber ~ / .bashrc
Informasi versi tidak ditemukan di metastore. Skema metastore tidak pernah diinisialisasi. Jalankan schematool dengan -initSchema untuk tipe basis data yang dipilih.
Panggilan ke localhost:9000 gagal karena pengecualian koneksi. HDFS tidak berjalan Mulai daemon Hadoop dan pastikan NameNode dan DataNode muncul. JPS
Node nama berada dalam mode aman. NameNode masih dalam mode aman saat memulai. Keluar dari mode aman dengan hdfs dfsadmin -safemode leave
Izin ditolak: akses=TULIS pada /user/hive/warehouse Direktori gudang tidak memiliki izin tulis grup. Melamar lagi hdfs dfs -chmod g+w pada direktori gudang dan tmp
NoSuchMethodError pada Preconditions.checkArgument Hive dan Hadoop mengirimkan versi jar Guava yang berbeda. Hapus file jar Guava yang lebih lama di direktori lib Hive dan salin file jar Hadoop ke tempatnya.

Cara cepat untuk membedakan masalah Hive dari masalah Hadoop adalah dengan menjalankan perintah berikut: JPS Pertama. Jika daemon hilang, cluster yang bermasalah; jika daemon ada dan shell masih gagal, kesalahannya ada pada konfigurasi Hive atau skema metastore. Setelah shell stabil, Operator dan fungsi bawaan HiveQL Referensi adalah langkah selanjutnya yang wajar.

Pertanyaan Umum Demo Slot

Tabel terkelola memungkinkan Hive memiliki metadata dan file sekaligus, jadi cukup dengan menghapusnya.ping Ini menghapus data di direktori gudang data. Tabel eksternal hanya mencatat metadata, dan menghapusping Hal ini tidak mengubah file-file yang mendasarinya.

Hive dapat dijalankan di mana saja JVM dan Hadoop berjalan, tetapi skrip shell mengasumsikan tata letak Unix. Pada Windows Sebagian besar tim menggunakan WSL2 atau image Docker; pada macOS Arsip tar yang sama akan berfungsi setelah JAVA_HOME dan HADOOP_HOME diekspor.

Beeline adalah klien JDBC yang terhubung ke HiveServer2 alih-alih memuat Hive di dalam proses shell. Beeline mendukung pengguna bersamaan dan otentikasi, dan CLI Hive versi lama sudah usang, jadi instalasi baru sebaiknya menggunakan Beeline sebagai standar.

Mesin modern memasukkan statistik kueri historis ke dalam model biaya yang dipelajari untuk memprediksi ukuran pemindaian, pemangkasan partisi, dan urutan penggabungan. Vendor cloud mengekspos sinyal yang sama sebagai rekomendasi otomatis untuk pemadatan file, tata letak partisi, dan ukuran kontainer.

Copilot membuat draf ekspor bashrc, blok hive-site.xml, dan pemanggilan schematool dengan cepat, dan runner agentic dapat mengeksekusinya di dalam sandbox. Anggap output tersebut sebagai draf pertama: nomor versi, port, dan jalur direktori masih perlu diverifikasi terhadap klaster Anda sendiri.

Kira-kira 4 GB RAM dan 20 GB ruang disk kosong sudah cukup nyaman untuk belajar, karena Hive sendiri merupakan thin client. Ukuran node produksi ditentukan berdasarkan klaster Hadoop dan basis data metastore, bukan berdasarkan Hive.

Ekstrak rilis baru di samping yang lama, arahkan ulang HIVE_HOME, lalu jalankan schematool dengan -upgradeSchema agar metastore sesuai. Penghapusan cukup dengan menghapus direktori Hive dan strip.ping Baris ekspor dari bashrc; data gudang HDFS tetap ada.

Tidak. MapReduce sudah usang sebagai mesin eksekusi Hive dan Hive 4.x berjalan di Apache Tez secara default. PetaKurangi Model ini tetap layak dipahami karena Tez mengikuti model pekerjaan terarah yang sama.

Ringkaslah postingan ini dengan: