Kuinka asentaa Hadoop UbuntuLataus- ja asennusvaiheet
โก รlykรคs yhteenveto
Apache Hadoopin asentaminen Ubuntu vaatii kaksi vaihetta: purkaa julkaisun erilliselle jรคrjestelmรคtilille salasanattoman SSH:n avulla, sitten muokkaa neljรครค XML-tiedostoa ennen HDFS:n alustamista ja yksisolmuisen klusterin kรคynnistรคmistรค.
Tรคssรค opetusohjelmassa kรคymme lรคpi vaiheittaisen prosessin Apache Hadoopin asentamiseksi Linux-tietokoneelle (Ubuntu). Tรคmรค on kaksiosainen prosessi: lataa ja asenna ensin julkaisu ja mรครคritรค se sitten.
Edellytyksiรค on kaksi:
- Sinun tรคytyy olla Ubuntu asennetaan ja juokseminen.
- Sinun tรคytyy olla Java asennetaan.
Hadoop 3.x -version muistiinpanoja tรคlle asennukselle
Tรคmรคn ohjeen kuvakaappaukset on otettu Hadoop 2.2.0:lla. Vaihejรคrjestys on pysynyt muuttumattomana nykyisissรค versioissa, mutta joitakin nimiรค ja oletusarvoja on siirretty. Tarkista alla oleva taulukko ennen kuin kopioit mitรครคn komentoja sanatarkasti.
| Asetus tai vaihe | Tรคssรค opetusohjelmassa (Hadoop 2.x) | Nykyinen Hadoop 3.x |
|---|---|---|
| Julkaisuarkisto | hadoop-2.2.0.tar.gz |
hadoop-3.5.0.tar.gz, ensimmรคinen vakaa 3.5-julkaisu, julkaistu 2. huhtikuuta 2026 |
| Oletustiedostojรคrjestelmรคn ominaisuus | fs.default.name proosassa fs.defaultFS XML-tiedostossa |
fs.defaultFS vain; fs.default.name on vanhentunut |
| MapReduce-ominaisuus | mapreduce.jobtracker.address |
mapreduce.framework.name asetettu yarnTyรถTracker-funktiota ei enรครค ole olemassa, kun YARN aikatauluttaa tyรถn |
| mapred-site.xml | Kopioitu kohteesta mapred-site.xml.template |
Lรคhetetรครคn sisรครคn etc/hadoop jo, joten kopiointivaihe on tarpeeton |
| NameNode-verkkokรคyttรถliittymรคn portti | 50070 | 9870 |
| Java | Java 6 tai Java 7 | Java 8 tai Java 11 |
Kaikki muu tรคssรค oppaassa toimii samalla tavalla Hadoop 3:ssa: erillinen tili, SSH-avain, neljรค mรครคritystiedostoa sekรค aloitus- ja lopetusskriptit.
Osa 1) Lataa ja asenna Hadoop
Vaihe 1) Lisรครค Hadoop-jรคrjestelmรคn kรคyttรคjรค
Lisรครค Hadoop-jรคrjestelmรคn kรคyttรคjรค alla olevalla komennolla.
sudo addgroup hadoop_
sudo adduser --ingroup hadoop_ hduser_
Anna salasanasi, nimesi ja muut tiedot.
HUOMAUTUS: Tรคssรค asennusprosessissa on mahdollista, ettรค esiintyy alla mainittu virhe.
"hduser ei ole sudoers-tiedostossa. Tรคstรค tapauksesta tiedotetaan."
Tรคmรค virhe voidaan korjata kirjautumalla sisรครคn pรครคkรคyttรคjรคnรค.
Suorita komento
sudo adduser hduser_ sudo
Re-login as hduser_
Vaihe 2) Mรครคritรค SSH
Solmujen hallintaan klusterissa Hadoop vaatii SSH-yhteyden.
Vaihda ensin kรคyttรคjรครค ja anna seuraava komento
su - hduser_
Tรคmรค komento luo uuden avaimen.
ssh-keygen -t rsa -P ""
Ota SSH-yhteys paikalliseen koneeseen kรคyttรถรถn tรคllรค avaimella.
cat $HOME/.ssh/id_rsa.pub >> $HOME/.ssh/authorized_keys
Testaa nyt SSH-asetuksia muodostamalla yhteys localhostiin kรคyttรคjรคnรค 'hduser_'.
ssh localhost
Huomautus: Jos nรคet alla olevan virheen vastauksena 'ssh localhost' -komennolle, on mahdollista, ettรค SSH ei ole kรคytettรคvissรค tรคssรค jรคrjestelmรคssรค.
Tรคmรคn ratkaisemiseksi -
Tyhjennรค SSH kรคyttรคmรคllรค
sudo apt-get purge openssh-server
On hyvรค kรคytรคntรถ tyhjentรครค se ennen asennuksen aloittamista.
Asenna SSH komennolla-
sudo apt-get install openssh-server
Vaihe 3) Lataa Hadoop
Seuraava vaihe on ladata Hadoop osoitteesta Apache Hadoopin julkaisusivu.
Valitse Vakaa
Valitse tar.gz-tiedosto (ei src-pรครคtteistรค tiedostoa).
Kun lataus on valmis, siirry tar-tiedoston sisรคltรคvรครคn hakemistoon.
Enter,
sudo tar xzf hadoop-2.2.0.tar.gz
Nimeรค nyt hadoop-2.2.0 uudelleen nimellรค hadoop.
sudo mv hadoop-2.2.0 hadoop
Lopuksi anna kansio uudelle tilille.
sudo chown -R hduser_:hadoop_ hadoop
Korvaa lataamasi versio hadoop-2.2.0 kolmessa yllรค olevassa komennossa.
Osa 2) Mรครคritรค Hadoop
Vaihe 1) Muokkaa ~/.bashrc-tiedostoa
Lisรครค seuraavat rivit tiedoston ~/.bashrc loppuun.
#Set HADOOP_HOME export HADOOP_HOME=<Installation Directory of Hadoop> #Set JAVA_HOME export JAVA_HOME=<Installation Directory of Java> # Add bin/ directory of Hadoop to PATH export PATH=$PATH:$HADOOP_HOME/bin
Nyt lรคhdekoodin luo tรคmรค ympรคristรถn kokoonpano alla olevalla komennolla.
. ~/.bashrc
Vaihe 2) HDFS:รครคn liittyvรคt konfiguraatiot
Aseta JAVA_HOME tiedostoon $HADOOP_HOME/etc/hadoop/hadoop-env.sh, kuten alla nรคkyy.
Kanssa
Tiedostossa $HADOOP_HOME/etc/hadoop/core-site.xml on kaksi parametria, jotka on asetettava:
1. 'hadoop.tmp.dir' โ Kรคytetรครคn mรครคrittรคmรครคn hakemisto, jota Hadoop kรคyttรครค datatiedostojensa tallentamiseen.
2. 'fs.defaultFS' โ Tรคmรค mรครคrittรครค oletusarvoisen tiedostojรคrjestelmรคn. Saman ominaisuuden vanhempi nimi, 'fs.default.name', on vanhentunut.
Aseta nรคmรค parametrit avaamalla core-site.xml
sudo gedit $HADOOP_HOME/etc/hadoop/core-site.xml
Kopioi alla olevat rivit tekstin vรคliin tunnisteet.
<property> <name>hadoop.tmp.dir</name> <value>/app/hadoop/tmp</value> <description>Parent directory for other temporary directories.</description> </property> <property> <name>fs.defaultFS </name> <value>hdfs://localhost:54310</value> <description>The name of the default file system. </description> </property>
Siirry hakemistoon $HADOOP_HOME/etc/hadoop.
Luo nyt core-site.xml-tiedostossa mainittu hakemisto.
sudo mkdir -p <Path of Directory used in above setting>
Myรถnnรค hakemistoon kรคyttรถoikeudet.
sudo chown -R hduser_:Hadoop_ <Path of Directory created in above step>
sudo chmod 750 <Path of Directory created in above step>
Vaihe 3) MapReduce-konfiguraatio
Ennen kuin aloitat nรคiden mรครคritysten kanssa, asetetaan HADOOP_HOME-polku.
sudo gedit /etc/profile.d/hadoop.sh
Ja Enter
export HADOOP_HOME=/home/guru99/Downloads/Hadoop
Seuraavaksi syรถtรค
sudo chmod +x /etc/profile.d/hadoop.sh
Poistu terminaalista ja kรคynnistรค se uudelleen.
Tarkista polku kirjoittamalla echo $HADOOP_HOME.
Kopioi nyt tiedostot
sudo cp $HADOOP_HOME/etc/hadoop/mapred-site.xml.template $HADOOP_HOME/etc/hadoop/mapred-site.xml
Avaa mapred-site.xml-tiedosto
sudo gedit $HADOOP_HOME/etc/hadoop/mapred-site.xml
Lisรครค alla olevat asetukset vรคliin ja tunnisteet.
<property> <name>mapreduce.jobtracker.address</name> <value>localhost:54311</value> <description>MapReduce job tracker runs at this host and port. </description> </property>
Avaa $HADOOP_HOME/etc/hadoop/hdfs-site.xml alla olevan mukaisesti,
sudo gedit $HADOOP_HOME/etc/hadoop/hdfs-site.xml
Lisรครค alla olevat asetukset vรคliin ja tunnisteet.
<property> <name>dfs.replication</name> <value>1</value> <description>Default block replication.</description> </property> <property> <name>dfs.datanode.data.dir</name> <value>/home/hduser_/hdfs</value> </property>
Luo yllรค olevassa asetuksessa mรครคritetty hakemisto.
sudo mkdir -p <Path of Directory used in above setting>
sudo mkdir -p /home/hduser_/hdfs
Sitten myรถnnรค sille omistajuus ja kรคyttรถoikeudet.
sudo chown -R hduser_:hadoop_ <Path of Directory created in above step>
sudo chown -R hduser_:hadoop_ /home/hduser_/hdfs
sudo chmod 750 <Path of Directory created in above step>
sudo chmod 750 /home/hduser_/hdfs
Vaihe 4) Alusta HDFS
Ennen kuin kรคynnistรคmme Hadoopin ensimmรคistรค kertaa, alusta HDFS alla olevalla komennolla.
$HADOOP_HOME/bin/hdfs namenode -format
Vaihe 5) Kรคynnistรค Hadoop-yksisolmuklusteri
Kรคynnistรค Hadoopin yhden solmun klusteri alla olevalla komennolla.
$HADOOP_HOME/sbin/start-dfs.sh
Yllรค olevan komennon tuloste on esitetty alla.
Kรคynnistรค sitten YARN-daemonit.
$HADOOP_HOME/sbin/start-yarn.sh
Tarkista 'jps'-tyรถkalulla, ovatko kaikki Hadoopiin liittyvรคt prosessit kรคynnissรค.
Jos Hadoop on kรคynnistynyt onnistuneesti, jps-tulosteen pitรคisi sisรคltรครค NameNode, NodeManager, ResourceManager, SecondaryNameNode ja DataNode.
Vaihe 6) Pysรคhdyping Hadoop
Sammuta klusteri kรครคnteisessรค jรคrjestyksessรค.
$HADOOP_HOME/sbin/stop-dfs.sh
$HADOOP_HOME/sbin/stop-yarn.sh
Kuinka varmistaa, ettรค Hadoop on kรคynnissรค, ja korjata yleisiรค virheitรค
jps-tuloste vahvistaa prosessien kรคynnistymisen, mutta ei sitรค, ettรค klusteri on kรคyttรถkelpoinen. Neljรค lisรคtarkistusta ratkaisee tรคmรคn kysymyksen.
- Avaa NameNoden web-kรคyttรถliittymรค osoitteessa
http://localhost:9870(portti 50070 Hadoop 2.x:ssรค) ja vahvista, ettรค yhteenveto raportoi yhden aktiivisen solmun. - Avaa ResourceManager-kรคyttรถliittymรค osoitteessa
http://localhost:8088vahvistaakseen, ettรค YARN hyvรคksyi NodeManagerin. - ajaa
hdfs dfsadmin -reportkapasiteetin, aktiivisten DataNodejen ja alireplikoitujen lohkojen osalta. - Kirjoita jotain:
hdfs dfs -mkdir /testjรคlkeenhdfs dfs -ls /todistaa, ettรค nimiavaruus hyvรคksyy muutokset.
Useimmat ensimmรคiset epรคonnistumiset kuuluvat johonkin viidestรค kategoriasta.
| Oire | Aiheuttaa | Korjata |
|---|---|---|
| JAVA_HOME-tiedostoa ei ole asetettu eikรค sitรค lรถydetty. | Muuttuja viedรครคn .bashrc-tiedostoon, mutta ei hadoop-env.sh-tiedostoon. | Aseta absoluuttinen JDK-polku myรถs hadoop-env.sh-tiedoston sisรคllรค |
| Kรคyttรถoikeus evรคtty (julkinen avain, salasana) ssh localhostissa | authorized_keys puuttuu tai on liian salliva | Liitรค id_rsa.pub uudelleen ja suorita sitten chmod 600 hakemistossa ~/.ssh/authorized_keys |
| Yhteys estetty portissa 22 | openssh-palvelinta ei ole asennettu tai se ei ole kรคynnissรค | Asenna openssh-server ja kรคynnistรค ssh-palvelu |
| DataNode puuttuu jps:stรค uudelleenmuotoilun jรคlkeen | Cluster Muotoillun NameNode-hakemiston ja vanhan DataNode-hakemiston ID-ristiriita | Tyhjennรค dfs.datanode.data.dir-kansio ja alusta se uudelleen. |
| start-dfs.sh: komentoa ei lรถytynyt | HADOOP_HOME- ja PATH-metodeja ei koskaan sisรคllytetty nykyiseen komentotulkkiin. | Suorita .~/.bashrc tai avaa uusi pรครคte |





























