Como instalar o Hadoop no UbuntuEtapas de download e instalação
⚡ Resumo Inteligente
Instalando o Apache Hadoop em Ubuntu São necessárias duas etapas: descompactar a versão em uma conta de sistema dedicada com SSH sem senha e, em seguida, editar quatro arquivos XML antes de formatar o HDFS e iniciar o cluster de nó único.
Neste tutorial, vamos guiá-lo passo a passo pelo processo de instalação do Apache Hadoop em um sistema Linux (UbuntuEste é um processo em duas etapas: primeiro, baixe e instale a versão e, em seguida, configure-a.
Existem dois pré-requisitos:
- Você deve ter Ubuntu instalado e correndo.
- Você deve ter Java instalado.
Observações sobre a versão Hadoop 3.x para esta configuração
As capturas de tela neste passo a passo foram feitas no Hadoop 2.2.0. A sequência de passos permanece inalterada nas versões atuais, mas alguns nomes e valores padrão foram alterados. Consulte a tabela abaixo antes de copiar qualquer comando literalmente.
| Configuração ou etapa | Neste tutorial (Hadoop 2.x) | Hadoop 3.x atual |
|---|---|---|
| Arquivo de lançamentos | hadoop-2.2.0.tar.gz |
hadoop-3.5.0.tar.gz, a primeira versão estável 3.5, publicada em 2 de abril de 2026 |
| Propriedade padrão do sistema de arquivos | fs.default.name na prosa, fs.defaultFS no XML |
fs.defaultFS só; fs.default.name está obsoleto |
| Propriedade MapReduce | mapreduce.jobtracker.address |
mapreduce.framework.name definido para yarn; o empregoTracO ker deixa de existir assim que o YARN agenda o trabalho. |
| mapred-site.xml | Copiado de mapred-site.xml.template |
Navios em etc/hadoop já existe, então a etapa de cópia é desnecessária. |
| Portabilidade da interface web do NameNode | 50070 | 9870 |
| Java | Java 6 ou Java 7 | Java 8 ou Java 11 |
Todo o resto neste guia funciona da mesma maneira no Hadoop 3: a conta dedicada, a chave SSH, os quatro arquivos de configuração e os scripts de inicialização e parada.
Parte 1) Baixe e instale o Hadoop
Etapa 1) Adicione um usuário do sistema Hadoop
Adicione um usuário do sistema Hadoop usando o comando abaixo.
sudo addgroup hadoop_
sudo adduser --ingroup hadoop_ hduser_
Digite sua senha, nome e outros detalhes.
OBSERVAÇÃO: Existe a possibilidade de ocorrer o erro mencionado abaixo durante o processo de configuração e instalação.
“hduser não está no arquivo sudoers. Este incidente será relatado."
Esse erro pode ser resolvido fazendo login como usuário root.
Execute o comando
sudo adduser hduser_ sudo
Re-login as hduser_
Etapa 2) Configurar SSH
Para gerenciar os nós em um cluster, o Hadoop requer acesso SSH.
Primeiro, troque de usuário, digite o seguinte comando
su - hduser_
Este comando criará uma nova chave.
ssh-keygen -t rsa -P ""
Habilite o acesso SSH à máquina local usando esta chave.
cat $HOME/.ssh/id_rsa.pub >> $HOME/.ssh/authorized_keys
Agora teste a configuração SSH conectando-se ao localhost como o usuário 'hduser_'.
ssh localhost
Observação: Se você vir o erro abaixo em resposta a 'ssh localhost', é possível que o SSH não esteja disponível neste sistema.
Para resolver isso –
Limpe o SSH usando,
sudo apt-get purge openssh-server
É uma boa prática realizar uma limpeza completa antes de iniciar a instalação.
Instale o SSH usando o comando-
sudo apt-get install openssh-server
Etapa 3) Baixe o Hadoop
O próximo passo é baixar o Hadoop do Página de lançamentos do Apache Hadoop.
Selecione Estável
Selecione o arquivo tar.gz (não o arquivo que termina em src).
Após a conclusão do download, navegue até o diretório que contém o arquivo tar.
Enter,
sudo tar xzf hadoop-2.2.0.tar.gz
Agora, renomeie hadoop-2.2.0 para hadoop.
sudo mv hadoop-2.2.0 hadoop
Por fim, entregue a pasta à nova conta.
sudo chown -R hduser_:hadoop_ hadoop
Substitua pela versão que você realmente baixou. hadoop-2.2.0 nos três comandos acima.
Parte 2) Configurar o Hadoop
Passo 1) Modifique o arquivo ~/.bashrc
Adicione as seguintes linhas ao final do arquivo ~/.bashrc.
#Set HADOOP_HOME export HADOOP_HOME=<Installation Directory of Hadoop> #Set JAVA_HOME export JAVA_HOME=<Installation Directory of Java> # Add bin/ directory of Hadoop to PATH export PATH=$PATH:$HADOOP_HOME/bin
Agora, execute essa configuração de ambiente usando o comando abaixo.
. ~/.bashrc
Etapa 2) Configurações relacionadas ao HDFS
Defina a variável de ambiente JAVA_HOME no arquivo $HADOOP_HOME/etc/hadoop/hadoop-env.sh, conforme mostrado abaixo.
Com
Existem dois parâmetros em $HADOOP_HOME/etc/hadoop/core-site.xml que precisam ser configurados:
1. 'hadoop.tmp.dir' – Usado para especificar um diretório que será usado pelo Hadoop para armazenar seus arquivos de dados.
2. 'fs.defaultFS' – Esta opção especifica o sistema de arquivos padrão. O nome antigo para a mesma propriedade, 'fs.default.name', está obsoleto.
Para definir esses parâmetros, abra core-site.xml
sudo gedit $HADOOP_HOME/etc/hadoop/core-site.xml
Copie as linhas abaixo entre os etiquetas.
<property> <name>hadoop.tmp.dir</name> <value>/app/hadoop/tmp</value> <description>Parent directory for other temporary directories.</description> </property> <property> <name>fs.defaultFS </name> <value>hdfs://localhost:54310</value> <description>The name of the default file system. </description> </property>
Navegue até o diretório $HADOOP_HOME/etc/hadoop.
Agora, crie o diretório mencionado em core-site.xml.
sudo mkdir -p <Path of Directory used in above setting>
Conceda permissões ao diretório.
sudo chown -R hduser_:Hadoop_ <Path of Directory created in above step>
sudo chmod 750 <Path of Directory created in above step>
Etapa 3) Configuração do MapReduce
Antes de começar com essas configurações, vamos definir o caminho HADOOP_HOME.
sudo gedit /etc/profile.d/hadoop.sh
E entre
export HADOOP_HOME=/home/guru99/Downloads/Hadoop
Em seguida, insira
sudo chmod +x /etc/profile.d/hadoop.sh
Saia do terminal e reinicie-o.
Digite `echo $HADOOP_HOME` para verificar o caminho.
Agora copie os arquivos
sudo cp $HADOOP_HOME/etc/hadoop/mapred-site.xml.template $HADOOP_HOME/etc/hadoop/mapred-site.xml
Abra o arquivo mapred-site.xml
sudo gedit $HADOOP_HOME/etc/hadoop/mapred-site.xml
Adicione as configurações abaixo entre os e etiquetas.
<property> <name>mapreduce.jobtracker.address</name> <value>localhost:54311</value> <description>MapReduce job tracker runs at this host and port. </description> </property>
Abra o arquivo $HADOOP_HOME/etc/hadoop/hdfs-site.xml conforme abaixo,
sudo gedit $HADOOP_HOME/etc/hadoop/hdfs-site.xml
Adicione as configurações abaixo entre os e etiquetas.
<property> <name>dfs.replication</name> <value>1</value> <description>Default block replication.</description> </property> <property> <name>dfs.datanode.data.dir</name> <value>/home/hduser_/hdfs</value> </property>
Crie o diretório especificado na configuração acima.
sudo mkdir -p <Path of Directory used in above setting>
sudo mkdir -p /home/hduser_/hdfs
Em seguida, conceda a propriedade e as permissões necessárias.
sudo chown -R hduser_:hadoop_ <Path of Directory created in above step>
sudo chown -R hduser_:hadoop_ /home/hduser_/hdfs
sudo chmod 750 <Path of Directory created in above step>
sudo chmod 750 /home/hduser_/hdfs
Etapa 4) Formate o HDFS
Antes de iniciar o Hadoop pela primeira vez, formate o HDFS usando o comando abaixo.
$HADOOP_HOME/bin/hdfs namenode -format
Etapa 5) Inicie o cluster Hadoop de nó único
Inicie o cluster Hadoop de nó único usando o comando abaixo.
$HADOOP_HOME/sbin/start-dfs.sh
O resultado do comando acima é mostrado abaixo.
Em seguida, inicie os daemons do YARN.
$HADOOP_HOME/sbin/start-yarn.sh
Utilizando a ferramenta 'jps', verifique se todos os processos relacionados ao Hadoop estão em execução.
Se o Hadoop tiver sido iniciado com sucesso, a saída do comando jps deverá listar NameNode, NodeManager, ResourceManager, SecondaryNameNode e DataNode.
Passo 6) Pareping Hadoop
Desligue o cluster na ordem inversa.
$HADOOP_HOME/sbin/stop-dfs.sh
$HADOOP_HOME/sbin/stop-yarn.sh
Como verificar se o Hadoop está em execução e corrigir erros comuns
A saída do comando jps confirma que os processos foram iniciados, mas não que o cluster esteja utilizável. Quatro verificações adicionais resolvem essa questão.
- Abra a interface web do NameNode em
http://localhost:9870(porta 50070 no Hadoop 2.x) e confirme se o resumo indica um nó ativo. - Abra a interface do ResourceManager em
http://localhost:8088para confirmar se o YARN aceitou o NodeManager. - Execute
hdfs dfsadmin -reportpara capacidade, DataNodes ativos e quaisquer blocos com replicação insuficiente. - Escreva algo:
hdfs dfs -mkdir /testseguidohdfs dfs -ls /Prova que o espaço de nomes aceita alterações.
A maioria das falhas na primeira tentativa se enquadra em uma de cinco categorias.
| Sintoma | Causar | Fixar |
|---|---|---|
| A variável de ambiente JAVA_HOME não está definida e não foi encontrada. | A variável é exportada em .bashrc, mas não em hadoop-env.sh. | Defina também o caminho absoluto do JDK dentro do arquivo hadoop-env.sh. |
| Permissão negada (chave pública, senha) em ssh localhost | O arquivo authorized_keys está faltando ou é muito permissivo. | Adicione novamente o arquivo id_rsa.pub e, em seguida, execute o comando chmod 600 em ~/.ssh/authorized_keys. |
| Conexão recusada na porta 22 | O servidor OpenSSH não está instalado ou não está em execução. | Instale o openssh-server e inicie o serviço ssh. |
| DataNode ausente do arquivo jps após uma reformatação. | Cluster Incompatibilidade de ID entre o NameNode formatado e o diretório DataNode antigo. | Esvazie a pasta dfs.datanode.data.dir e formate-a novamente. |
| start-dfs.sh: comando não encontrado | HADOOP_HOME e PATH nunca foram carregados no shell atual. | Execute o arquivo . ~/.bashrc ou abra um novo terminal. |





























