Cara Menginstal Hadoop di UbuntuLangkah-langkah Pengunduhan & Pengaturan
โก Ringkasan Cerdas
Menginstal Apache Hadoop pada Ubuntu Membutuhkan dua langkah: mengekstrak rilis di bawah akun sistem khusus dengan SSH tanpa kata sandi, kemudian mengedit empat file XML sebelum memformat HDFS dan memulai klaster node tunggal.
Dalam tutorial ini, kami akan memandu Anda langkah demi langkah untuk menginstal Apache Hadoop di sistem Linux (UbuntuIni adalah proses dua bagian: pertama unduh dan instal rilisnya, lalu konfigurasikan.
Ada dua prasyarat:
- Anda harus memiliki Ubuntu diinstal dan berlari.
- Anda harus memiliki Java diinstal.
Catatan Versi Hadoop 3.x untuk Pengaturan Ini
Tangkapan layar dalam panduan ini diambil pada Hadoop 2.2.0. Urutan langkah-langkahnya tidak berubah pada rilis terbaru, tetapi beberapa nama dan nilai default telah berubah. Periksa tabel di bawah ini sebelum menyalin perintah apa pun secara pers verbatim.
| Pengaturan atau langkah | Dalam tutorial ini (Hadoop 2.x) | Hadoop 3.x saat ini |
|---|---|---|
| Arsip rilis | hadoop-2.2.0.tar.gz |
hadoop-3.5.0.tar.gz, rilis stabil 3.5 pertama, diterbitkan pada 2 April 2026 |
| Properti sistem file default | fs.default.name dalam prosa, fs.defaultFS dalam XML |
fs.defaultFS hanya; fs.default.name sudah ditinggalkan |
| Properti MapReduce | mapreduce.jobtracker.address |
mapreduce.framework.name mulai yarnPekerjaanTracker tidak lagi ada setelah YARN menjadwalkan pekerjaan. |
| situs-mapred.xml | Disalin dari mapred-site.xml.template |
Kapal di etc/hadoop sudah, jadi langkah penyalinan tidak diperlukan. |
| Port UI web NameNode | 50070 | 9870 |
| Java | Java 6 atau Java 7 | Java 8 atau Java 11 |
Semua hal lain dalam panduan ini berperilaku sama di Hadoop 3: akun khusus, kunci SSH, empat file konfigurasi, dan skrip mulai dan berhenti.
Bagian 1) Unduh dan Instal Hadoop
Langkah 1) Tambahkan pengguna sistem Hadoop
Tambahkan pengguna sistem Hadoop menggunakan perintah di bawah ini.
sudo addgroup hadoop_
sudo adduser --ingroup hadoop_ hduser_
Masukkan kata sandi Anda, nama, dan rincian lainnya.
CATATAN: Ada kemungkinan terjadinya kesalahan yang disebutkan di bawah ini dalam proses pengaturan dan instalasi ini.
โhduser tidak ada dalam file sudoers. Kejadian ini akan dilaporkan.โ
Kesalahan ini dapat diatasi dengan masuk sebagai pengguna root.
Jalankan perintah
sudo adduser hduser_ sudo
Re-login as hduser_
Langkah 2) Konfigurasikan SSH
Untuk mengelola node dalam sebuah cluster, Hadoop memerlukan akses SSH.
Pertama, ganti pengguna, masukkan perintah berikut
su - hduser_
Perintah ini akan membuat kunci baru.
ssh-keygen -t rsa -P ""
Aktifkan akses SSH ke mesin lokal menggunakan kunci ini.
cat $HOME/.ssh/id_rsa.pub >> $HOME/.ssh/authorized_keys
Sekarang uji pengaturan SSH dengan terhubung ke localhost sebagai pengguna 'hduser_'.
ssh localhost
Catatan: Jika Anda melihat kesalahan di bawah ini sebagai respons terhadap 'ssh localhost', maka ada kemungkinan SSH tidak tersedia pada sistem ini.
Untuk mengatasi ini โ
Bersihkan SSH menggunakan,
sudo apt-get purge openssh-server
Sebaiknya lakukan pembersihan (purge) sebelum memulai instalasi.
Instal SSH menggunakan perintah-
sudo apt-get install openssh-server
Langkah 3) Unduh Hadoop
Langkah selanjutnya adalah mengunduh Hadoop dari Halaman rilis Apache Hadoop.
Pilih Stabil
Pilih file tar.gz (bukan file yang berakhiran src).
Setelah pengunduhan selesai, navigasikan ke direktori yang berisi file tar tersebut.
Masukkan,
sudo tar xzf hadoop-2.2.0.tar.gz
Sekarang, ganti nama hadoop-2.2.0 menjadi hadoop.
sudo mv hadoop-2.2.0 hadoop
Terakhir, serahkan folder tersebut ke akun baru.
sudo chown -R hduser_:hadoop_ hadoop
Ganti dengan versi yang sebenarnya Anda unduh hadoop-2.2.0 pada tiga perintah di atas.
Bagian 2) Konfigurasikan Hadoop
Langkah 1) Ubah file ~/.bashrc
Tambahkan baris-baris berikut ke akhir file ~/.bashrc.
#Set HADOOP_HOME export HADOOP_HOME=<Installation Directory of Hadoop> #Set JAVA_HOME export JAVA_HOME=<Installation Directory of Java> # Add bin/ directory of Hadoop to PATH export PATH=$PATH:$HADOOP_HOME/bin
Sekarang, jalankan konfigurasi lingkungan ini menggunakan perintah di bawah ini.
. ~/.bashrc
Langkah 2) Konfigurasi terkait HDFS
Atur JAVA_HOME di dalam file $HADOOP_HOME/etc/hadoop/hadoop-env.sh, seperti yang ditunjukkan di bawah ini.
Dengan
Ada dua parameter di $HADOOP_HOME/etc/hadoop/core-site.xml yang perlu diatur-
1. 'hadoop.tmp.dir' โ Digunakan untuk menentukan direktori yang akan digunakan oleh Hadoop untuk menyimpan file datanya.
2. 'fs.defaultFS' โ Ini menentukan sistem file default. Nama lama untuk properti yang sama, 'fs.default.name', sudah usang.
Untuk mengatur parameter ini, buka core-site.xml
sudo gedit $HADOOP_HOME/etc/hadoop/core-site.xml
Salin baris-baris di bawah ini di antara tag.
<property> <name>hadoop.tmp.dir</name> <value>/app/hadoop/tmp</value> <description>Parent directory for other temporary directories.</description> </property> <property> <name>fs.defaultFS </name> <value>hdfs://localhost:54310</value> <description>The name of the default file system. </description> </property>
Masuk ke direktori $HADOOP_HOME/etc/hadoop.
Sekarang, buat direktori yang disebutkan dalam core-site.xml.
sudo mkdir -p <Path of Directory used in above setting>
Berikan izin akses ke direktori tersebut.
sudo chown -R hduser_:Hadoop_ <Path of Directory created in above step>
sudo chmod 750 <Path of Directory created in above step>
Langkah 3) Konfigurasi MapReduce
Sebelum Anda memulai konfigurasi ini, mari kita atur jalur HADOOP_HOME terlebih dahulu.
sudo gedit /etc/profile.d/hadoop.sh
Dan Masuk
export HADOOP_HOME=/home/guru99/Downloads/Hadoop
Selanjutnya masuk
sudo chmod +x /etc/profile.d/hadoop.sh
Keluar dari Terminal dan mulai ulang lagi.
Ketik echo $HADOOP_HOME untuk memverifikasi jalurnya.
Sekarang salin file
sudo cp $HADOOP_HOME/etc/hadoop/mapred-site.xml.template $HADOOP_HOME/etc/hadoop/mapred-site.xml
Buka file mapred-site.xml
sudo gedit $HADOOP_HOME/etc/hadoop/mapred-site.xml
Tambahkan pengaturan di bawah ini di antara Dan tag.
<property> <name>mapreduce.jobtracker.address</name> <value>localhost:54311</value> <description>MapReduce job tracker runs at this host and port. </description> </property>
Buka file $HADOOP_HOME/etc/hadoop/hdfs-site.xml seperti di bawah ini,
sudo gedit $HADOOP_HOME/etc/hadoop/hdfs-site.xml
Tambahkan pengaturan di bawah ini di antara Dan tag.
<property> <name>dfs.replication</name> <value>1</value> <description>Default block replication.</description> </property> <property> <name>dfs.datanode.data.dir</name> <value>/home/hduser_/hdfs</value> </property>
Buat direktori yang ditentukan dalam pengaturan di atas.
sudo mkdir -p <Path of Directory used in above setting>
sudo mkdir -p /home/hduser_/hdfs
Kemudian berikan kepemilikan dan izin akses padanya.
sudo chown -R hduser_:hadoop_ <Path of Directory created in above step>
sudo chown -R hduser_:hadoop_ /home/hduser_/hdfs
sudo chmod 750 <Path of Directory created in above step>
sudo chmod 750 /home/hduser_/hdfs
Langkah 4) Format HDFS
Sebelum kita memulai Hadoop untuk pertama kalinya, format HDFS menggunakan perintah di bawah ini.
$HADOOP_HOME/bin/hdfs namenode -format
Langkah 5) Mulai klaster Hadoop node tunggal
Mulai klaster Hadoop node tunggal menggunakan perintah di bawah ini.
$HADOOP_HOME/sbin/start-dfs.sh
Hasil dari perintah di atas ditunjukkan di bawah ini.
Kemudian jalankan daemon YARN.
$HADOOP_HOME/sbin/start-yarn.sh
Dengan menggunakan alat 'jps', verifikasi apakah semua proses yang terkait dengan Hadoop sedang berjalan.
Jika Hadoop telah berhasil dijalankan, output jps akan menampilkan NameNode, NodeManager, ResourceManager, SecondaryNameNode, dan DataNode.
Langkah 6) Berhentiping Hadoop
Matikan klaster dengan urutan terbalik.
$HADOOP_HOME/sbin/stop-dfs.sh
$HADOOP_HOME/sbin/stop-yarn.sh
Cara Memverifikasi Hadoop Berjalan dan Memperbaiki Kesalahan Umum
Output jps mengkonfirmasi bahwa proses telah dimulai, tetapi tidak mengkonfirmasi bahwa klaster dapat digunakan. Empat pemeriksaan tambahan menyelesaikan pertanyaan itu.
- Buka antarmuka web NameNode di
http://localhost:9870(port 50070 pada Hadoop 2.x) dan konfirmasikan bahwa laporan ringkasan menunjukkan satu node aktif. - Buka antarmuka ResourceManager di
http://localhost:8088untuk memastikan YARN menerima NodeManager. - Run
hdfs dfsadmin -reportuntuk kapasitas, DataNode aktif, dan blok yang kurang tereplikasi. - Tulis sesuatu:
hdfs dfs -mkdir /testdiikuti olehhdfs dfs -ls /membuktikan bahwa namespace tersebut menerima perubahan.
Sebagian besar kegagalan pertama kali termasuk dalam salah satu dari lima kategori berikut.
| Gejala | Menyebabkan | Memperbaiki |
|---|---|---|
| Variabel lingkungan JAVA_HOME belum diatur dan tidak dapat ditemukan. | Variabel tersebut diekspor di .bashrc tetapi tidak di hadoop-env.sh | Atur jalur JDK absolut di dalam hadoop-env.sh juga. |
| Izin ditolak (publickey, password) pada ssh localhost | authorized_keys hilang atau terlalu permisif | Tambahkan kembali id_rsa.pub, lalu jalankan chmod 600 pada ~/.ssh/authorized_keys |
| Koneksi ditolak pada port 22 | openssh-server tidak terpasang atau tidak berjalan. | Instal openssh-server dan mulai layanan ssh. |
| DataNode hilang dari jps setelah pemformatan ulang. | Cluster Ketidaksesuaian ID antara NameNode yang diformat dan direktori DataNode lama. | Kosongkan folder dfs.datanode.data.dir, lalu format sekali lagi. |
| start-dfs.sh: perintah tidak ditemukan | HADOOP_HOME dan PATH tidak pernah dijalankan di shell saat ini. | Jalankan . ~/.bashrc atau buka terminal baru. |





























