Cara Menginstal Hadoop di UbuntuLangkah-langkah Pengunduhan & Pengaturan

โšก Ringkasan Cerdas

Menginstal Apache Hadoop pada Ubuntu Membutuhkan dua langkah: mengekstrak rilis di bawah akun sistem khusus dengan SSH tanpa kata sandi, kemudian mengedit empat file XML sebelum memformat HDFS dan memulai klaster node tunggal.

  • ๐Ÿ”˜ Prasyarat: Sebuah berlari Ubuntu mesin dan didukung Java Development Kit harus terpasang terlebih dahulu.
  • โ˜‘๏ธ Akun khusus: Buat grup hadoop_ dan akun hduser_ agar daemon tidak pernah berjalan sebagai pengguna login Anda.
  • โœ… SSH tanpa kata sandi: Hadoop menjalankan daemon melalui SSH, jadi perintah ssh localhost harus berhasil tanpa meminta kata sandi.
  • ๐Ÿงช Empat file konfigurasi: hadoop-env.sh, core-site.xml, mapred-site.xml dan hdfs-site.xml memuat setiap pengaturan yang diubah dalam panduan ini.
  • ๏ธ Permulaan pertama: Format NameNode sekali, lalu jalankan start-dfs.sh dan start-yarn.sh dan konfirmasikan lima daemon dengan jps.
  • ๐Ÿงญ Pergeseran versi: Screenshot menggunakan Hadoop 2.2.0, jadi periksa rilis, port, dan nama properti terhadap Hadoop 3.x.

Cara Menginstal Hadoop di Ubuntu

Dalam tutorial ini, kami akan memandu Anda langkah demi langkah untuk menginstal Apache Hadoop di sistem Linux (UbuntuIni adalah proses dua bagian: pertama unduh dan instal rilisnya, lalu konfigurasikan.

Ada dua prasyarat:

Catatan Versi Hadoop 3.x untuk Pengaturan Ini

Tangkapan layar dalam panduan ini diambil pada Hadoop 2.2.0. Urutan langkah-langkahnya tidak berubah pada rilis terbaru, tetapi beberapa nama dan nilai default telah berubah. Periksa tabel di bawah ini sebelum menyalin perintah apa pun secara pers verbatim.

Pengaturan atau langkah Dalam tutorial ini (Hadoop 2.x) Hadoop 3.x saat ini
Arsip rilis hadoop-2.2.0.tar.gz hadoop-3.5.0.tar.gz, rilis stabil 3.5 pertama, diterbitkan pada 2 April 2026
Properti sistem file default fs.default.name dalam prosa, fs.defaultFS dalam XML fs.defaultFS hanya; fs.default.name sudah ditinggalkan
Properti MapReduce mapreduce.jobtracker.address mapreduce.framework.name mulai yarnPekerjaanTracker tidak lagi ada setelah YARN menjadwalkan pekerjaan.
situs-mapred.xml Disalin dari mapred-site.xml.template Kapal di etc/hadoop sudah, jadi langkah penyalinan tidak diperlukan.
Port UI web NameNode 50070 9870
Java Java 6 atau Java 7 Java 8 atau Java 11

Semua hal lain dalam panduan ini berperilaku sama di Hadoop 3: akun khusus, kunci SSH, empat file konfigurasi, dan skrip mulai dan berhenti.

Bagian 1) Unduh dan Instal Hadoop

Langkah 1) Tambahkan pengguna sistem Hadoop

Tambahkan pengguna sistem Hadoop menggunakan perintah di bawah ini.

sudo addgroup hadoop_

Terminal menjalankan sudo addgroup hadoop_

sudo adduser --ingroup hadoop_ hduser_

Perintah adduser mengumpulkan detail untuk hduser_

Masukkan kata sandi Anda, nama, dan rincian lainnya.

CATATAN: Ada kemungkinan terjadinya kesalahan yang disebutkan di bawah ini dalam proses pengaturan dan instalasi ini.

โ€œhduser tidak ada dalam file sudoers. Kejadian ini akan dilaporkan.โ€

Pesan kesalahan: hduser tidak ada dalam file sudoers

Kesalahan ini dapat diatasi dengan masuk sebagai pengguna root.

Beralih ke pengguna root di terminal.

Jalankan perintah

sudo adduser hduser_ sudo

Menambahkan hduser_ ke grup sudo

Re-login as hduser_

Masuk kembali sebagai hduser_

Langkah 2) Konfigurasikan SSH

Untuk mengelola node dalam sebuah cluster, Hadoop memerlukan akses SSH.

Pertama, ganti pengguna, masukkan perintah berikut

su - hduser_

Mengganti pengguna dengan su - hduser_

Perintah ini akan membuat kunci baru.

ssh-keygen -t rsa -P ""

ssh-keygen menghasilkan pasangan kunci RSA untuk hduser_

Aktifkan akses SSH ke mesin lokal menggunakan kunci ini.

cat $HOME/.ssh/id_rsa.pub >> $HOME/.ssh/authorized_keys

Menambahkan id_rsa.pub ke file authorized_keys

Sekarang uji pengaturan SSH dengan terhubung ke localhost sebagai pengguna 'hduser_'.

ssh localhost

Sesi ssh localhost berhasil untuk hduser_

Catatan: Jika Anda melihat kesalahan di bawah ini sebagai respons terhadap 'ssh localhost', maka ada kemungkinan SSH tidak tersedia pada sistem ini.

SSH ke localhost gagal dengan kesalahan "connection refused".

Untuk mengatasi ini โ€“

Bersihkan SSH menggunakan,

sudo apt-get purge openssh-server

Sebaiknya lakukan pembersihan (purge) sebelum memulai instalasi.

apt-get purge menghapus paket openssh-server yang sudah ada

Instal SSH menggunakan perintah-

sudo apt-get install openssh-server

apt-get menginstal paket openssh-server

Langkah 3) Unduh Hadoop

Langkah selanjutnya adalah mengunduh Hadoop dari Halaman rilis Apache Hadoop.

Halaman rilis Apache Hadoop yang mencantumkan versi yang tersedia.

Pilih Stabil

Daftar direktori untuk rilis Hadoop stabil.

Pilih file tar.gz (bukan file yang berakhiran src).

Memilih file biner Hadoop tar.gz sebagai pengganti arsip src.

Setelah pengunduhan selesai, navigasikan ke direktori yang berisi file tar tersebut.

Terminal terbuka di direktori tempat file tar yang diunduh berada.

Masukkan,

sudo tar xzf hadoop-2.2.0.tar.gz

ExtracMengekstraksi file tar Hadoop dengan perintah tar xzf

Sekarang, ganti nama hadoop-2.2.0 menjadi hadoop.

sudo mv hadoop-2.2.0 hadoop

Mengganti nama mantantracted hadoop-2.2.0 folder to hadoop

Terakhir, serahkan folder tersebut ke akun baru.

sudo chown -R hduser_:hadoop_ hadoop

Perintah `chown` menetapkan folder hadoop ke `hduser_` dan `hadoop_`.

Ganti dengan versi yang sebenarnya Anda unduh hadoop-2.2.0 pada tiga perintah di atas.

Bagian 2) Konfigurasikan Hadoop

Langkah 1) Ubah file ~/.bashrc

Tambahkan baris-baris berikut ke akhir file ~/.bashrc.

#Set HADOOP_HOME
export HADOOP_HOME=<Installation Directory of Hadoop>
#Set JAVA_HOME
export JAVA_HOME=<Installation Directory of Java>
# Add bin/ directory of Hadoop to PATH
export PATH=$PATH:$HADOOP_HOME/bin

File bashrc dengan ekspor HADOOP_HOME, JAVA_HOME, dan PATH yang ditambahkan.

Sekarang, jalankan konfigurasi lingkungan ini menggunakan perintah di bawah ini.

. ~/.bashrc

Menjalankan bashrc agar variabel lingkungan baru berlaku.

Langkah 2) Konfigurasi terkait HDFS

Atur JAVA_HOME di dalam file $HADOOP_HOME/etc/hadoop/hadoop-env.sh, seperti yang ditunjukkan di bawah ini.

Baris JAVA_HOME default di dalam hadoop-env.sh

hadoop-env.sh dibuka di editor yang menampilkan ekspor JAVA_HOME.

Dengan

hadoop-env.sh JAVA_HOME diganti dengan yang sebenarnya Java jalur instalasi

Ada dua parameter di $HADOOP_HOME/etc/hadoop/core-site.xml yang perlu diatur-

1. 'hadoop.tmp.dir' โ€“ Digunakan untuk menentukan direktori yang akan digunakan oleh Hadoop untuk menyimpan file datanya.

2. 'fs.defaultFS' โ€“ Ini menentukan sistem file default. Nama lama untuk properti yang sama, 'fs.default.name', sudah usang.

Untuk mengatur parameter ini, buka core-site.xml

sudo gedit $HADOOP_HOME/etc/hadoop/core-site.xml

Membuka core-site.xml dengan gedit

Salin baris-baris di bawah ini di antara tag.

<property>
<name>hadoop.tmp.dir</name>
<value>/app/hadoop/tmp</value>
<description>Parent directory for other temporary directories.</description>
</property>
<property>
<name>fs.defaultFS </name>
<value>hdfs://localhost:54310</value>
<description>The name of the default file system. </description>
</property>

core-site.xml yang berisi properti hadoop.tmp.dir dan fs.defaultFS

Masuk ke direktori $HADOOP_HOME/etc/hadoop.

Terminal di dalam direktori konfigurasi Hadoop etc/hadoop

Sekarang, buat direktori yang disebutkan dalam core-site.xml.

sudo mkdir -p <Path of Directory used in above setting>

Perintah `mkdir -p` membuat jalur `hadoop.tmp.dir`.

Berikan izin akses ke direktori tersebut.

sudo chown -R hduser_:Hadoop_ <Path of Directory created in above step>

memberikan hak kepemilikan direktori sementara kepada hduser_ dengan perintah chown.

sudo chmod 750 <Path of Directory created in above step>

Perintah chmod 750 diterapkan ke direktori sementara.

Langkah 3) Konfigurasi MapReduce

Sebelum Anda memulai konfigurasi ini, mari kita atur jalur HADOOP_HOME terlebih dahulu.

sudo gedit /etc/profile.d/hadoop.sh

Dan Masuk

export HADOOP_HOME=/home/guru99/Downloads/Hadoop

Skrip profil hadoop.sh mengekspor HADOOP_HOME

Selanjutnya masuk

sudo chmod +x /etc/profile.d/hadoop.sh

chmod +x menjadikan skrip profil hadoop.sh dapat dieksekusi

Keluar dari Terminal dan mulai ulang lagi.

Ketik echo $HADOOP_HOME untuk memverifikasi jalurnya.

echo $HADOOP_HOME mencetak jalur instalasi yang telah dikonfigurasi

Sekarang salin file

sudo cp $HADOOP_HOME/etc/hadoop/mapred-site.xml.template $HADOOP_HOME/etc/hadoop/mapred-site.xml

Menyalin mapred-site.xml.template ke mapred-site.xml

Buka file mapred-site.xml

sudo gedit $HADOOP_HOME/etc/hadoop/mapred-site.xml

Membuka mapred-site.xml dengan gedit

Tambahkan pengaturan di bawah ini di antara Dan tag.

<property>
<name>mapreduce.jobtracker.address</name>
<value>localhost:54311</value>
<description>MapReduce job tracker runs at this host and port.
</description>
</property>

mapred-site.xml yang berisi tugas MapReduce tracproperti ker

Buka file $HADOOP_HOME/etc/hadoop/hdfs-site.xml seperti di bawah ini,

sudo gedit $HADOOP_HOME/etc/hadoop/hdfs-site.xml

Membuka hdfs-site.xml dengan gedit

Tambahkan pengaturan di bawah ini di antara Dan tag.

<property>
<name>dfs.replication</name>
<value>1</value>
<description>Default block replication.</description>
</property>
<property>
<name>dfs.datanode.data.dir</name>
<value>/home/hduser_/hdfs</value>
</property>

File hdfs-site.xml yang berisi properti dfs.replication dan dfs.datanode.data.dir

Buat direktori yang ditentukan dalam pengaturan di atas.

sudo mkdir -p <Path of Directory used in above setting>
sudo mkdir -p /home/hduser_/hdfs

mkdir -p membuat direktori data DataNode

Kemudian berikan kepemilikan dan izin akses padanya.

sudo chown -R hduser_:hadoop_ <Path of Directory created in above step>
sudo chown -R hduser_:hadoop_ /home/hduser_/hdfs

memberikan hak kepemilikan direktori data DataNode kepada hduser_ dengan perintah chown.

sudo chmod 750 <Path of Directory created in above step>
sudo chmod 750 /home/hduser_/hdfs

chmod 750 diterapkan ke direktori data DataNode

Langkah 4) Format HDFS

Sebelum kita memulai Hadoop untuk pertama kalinya, format HDFS menggunakan perintah di bawah ini.

$HADOOP_HOME/bin/hdfs namenode -format

hdfs namenode -format output memformat sistem file baru

Langkah 5) Mulai klaster Hadoop node tunggal

Mulai klaster Hadoop node tunggal menggunakan perintah di bawah ini.

$HADOOP_HOME/sbin/start-dfs.sh

Hasil dari perintah di atas ditunjukkan di bawah ini.

Output dari start-dfs.sh yang menunjukkan proses memulai NameNode dan DataNode.

Kemudian jalankan daemon YARN.

$HADOOP_HOME/sbin/start-yarn.sh

Output dari start-yarn.sh: memulai ResourceManager dan NodeManager

Dengan menggunakan alat 'jps', verifikasi apakah semua proses yang terkait dengan Hadoop sedang berjalan.

Output jps yang menampilkan daftar lima daemon Hadoop yang sedang berjalan.

Jika Hadoop telah berhasil dijalankan, output jps akan menampilkan NameNode, NodeManager, ResourceManager, SecondaryNameNode, dan DataNode.

Langkah 6) Berhentiping Hadoop

Matikan klaster dengan urutan terbalik.

$HADOOP_HOME/sbin/stop-dfs.sh

Output stop-dfs.sh yang mematikan daemon HDFS

$HADOOP_HOME/sbin/stop-yarn.sh

Output stop-yarn.sh mematikan daemon YARN

Cara Memverifikasi Hadoop Berjalan dan Memperbaiki Kesalahan Umum

Output jps mengkonfirmasi bahwa proses telah dimulai, tetapi tidak mengkonfirmasi bahwa klaster dapat digunakan. Empat pemeriksaan tambahan menyelesaikan pertanyaan itu.

  • Buka antarmuka web NameNode di http://localhost:9870 (port 50070 pada Hadoop 2.x) dan konfirmasikan bahwa laporan ringkasan menunjukkan satu node aktif.
  • Buka antarmuka ResourceManager di http://localhost:8088 untuk memastikan YARN menerima NodeManager.
  • Run hdfs dfsadmin -report untuk kapasitas, DataNode aktif, dan blok yang kurang tereplikasi.
  • Tulis sesuatu: hdfs dfs -mkdir /test diikuti oleh hdfs dfs -ls / membuktikan bahwa namespace tersebut menerima perubahan.

Sebagian besar kegagalan pertama kali termasuk dalam salah satu dari lima kategori berikut.

Gejala Menyebabkan Memperbaiki
Variabel lingkungan JAVA_HOME belum diatur dan tidak dapat ditemukan. Variabel tersebut diekspor di .bashrc tetapi tidak di hadoop-env.sh Atur jalur JDK absolut di dalam hadoop-env.sh juga.
Izin ditolak (publickey, password) pada ssh localhost authorized_keys hilang atau terlalu permisif Tambahkan kembali id_rsa.pub, lalu jalankan chmod 600 pada ~/.ssh/authorized_keys
Koneksi ditolak pada port 22 openssh-server tidak terpasang atau tidak berjalan. Instal openssh-server dan mulai layanan ssh.
DataNode hilang dari jps setelah pemformatan ulang. Cluster Ketidaksesuaian ID antara NameNode yang diformat dan direktori DataNode lama. Kosongkan folder dfs.datanode.data.dir, lalu format sekali lagi.
start-dfs.sh: perintah tidak ditemukan HADOOP_HOME dan PATH tidak pernah dijalankan di shell saat ini. Jalankan . ~/.bashrc atau buka terminal baru.

Pertanyaan Umum Demo Slot

Dukungan aktif apa pun Ubuntu Rilis LTS berfungsi, termasuk 22.04 dan 24.04. Hadoop 3.x dibangun dan diuji terhadapnya. Java 8 dan Java 11, jadi instal salah satu JDK tersebut; JDK yang lebih baru tidak sepenuhnya didukung dan yang lebih lama Java Versi 7 tidak lagi berlaku.

Skrip start-dfs.sh dan start-yarn.sh menjalankan setiap daemon melalui SSH, bahkan ketika satu-satunya host adalah localhost. Tanpa kunci tanpa kata sandi, skrip akan macet pada permintaan kata sandi dan tidak ada daemon yang berjalan.

hadoop.tmp.dir adalah jalur sementara dasar yang digunakan Hadoop untuk mendapatkan lokasi sementara lainnya. dfs.datanode.data.dir adalah tempat DataNode menyimpan file blok sebenarnya. Arahkan yang kedua ke penyimpanan permanen, jangan pernah ke /tmp, atau blok akan hilang saat reboot.

Lakukan format sekali saja, sebelum memulai pertama kali. Menjalankan format ulang akan menghapus namespace dan meninggalkan direktori DataNode yang ada dengan ID cluster yang lebih lama, itulah sebabnya DataNode kemudian menolak untuk mendaftar dan menghilang dari output jps.

Ya, meskipun begitu Windows Membutuhkan binary asli winutils.exe dan hadoop.dll untuk rilis yang sesuai. Kebanyakan orang menghindari hal itu dengan menjalankan hal yang sama. Ubuntu langkah-langkah di dalam WSL 2, yang berperilaku seperti host Linux biasa.

Untuk tujuan pembelajaran, ya: citra yang sudah jadi melewati pembuatan pengguna, kunci SSH, dan pengeditan XML. Instalasi secara manual tetap layak dilakukan sekali, karena menunjukkan file mana yang mengontrol setiap pengaturan ketika klaster sebenarnya mengalami masalah.

Model pembelajaran mesin di atas metrik NameNode dan YARN memprediksi batas kapasitas, mendeteksi pekerjaan yang tidak seimbang, dan menandai disk yang rusak sejak dini. Beberapa platform juga merekomendasikan ukuran kontainer secara otomatis, menggantikan sebagian besar penyetelan manual yang sebelumnya diperlukan untuk konfigurasi ini.

Copilot membuat draf blok properti core-site.xml dan hdfs-site.xml dengan cepat dan mengingat ejaan yang tepat. Verifikasi setiap saran terhadap dokumentasi untuk rilis Anda, karena sering kali menyarankan properti yang sudah tidak digunakan lagi seperti mapreduce.job.tracker.address atau fs.default.name.

Ringkaslah postingan ini dengan: