Cómo instalar Hadoop en UbuntuPasos para la descarga y la configuración
⚡ Resumen inteligente
Instalación de Apache Hadoop en Ubuntu El proceso consta de dos fases: primero, descomprimir la versión bajo una cuenta de sistema dedicada con SSH sin contraseña y, a continuación, editar cuatro archivos XML antes de formatear HDFS e iniciar el clúster de un solo nodo.

En este tutorial, le guiaremos paso a paso por el proceso de instalación de Apache Hadoop en un equipo Linux (Ubuntu). Este es un proceso de dos partes: primero, descargar e instalar la versión, y luego configurarla.
Hay dos requisitos previos:
- Usted debe tener Ubuntu instalado y corriendo.
- Usted debe tener Java instalado.
Notas sobre la versión Hadoop 3.x para esta configuración.
Las capturas de pantalla de este tutorial se realizaron en Hadoop 2.2.0. La secuencia de pasos no ha cambiado en las versiones actuales, pero algunos nombres y valores predeterminados se han modificado. Consulte la tabla a continuación antes de copiar cualquier comando tal cual.
| Configuración o paso | En este tutorial (Hadoop 2.x) | Hadoop 3.x actual |
|---|---|---|
| Archivo de lanzamientos | hadoop-2.2.0.tar.gz |
hadoop-3.5.0.tar.gz, la primera versión estable 3.5, publicada el 2 de abril de 2026 |
| Propiedad predeterminada del sistema de archivos | fs.default.name en la prosa, fs.defaultFS en el XML |
fs.defaultFS solamente; fs.default.name es obsoleto |
| Propiedad MapReduce | mapreduce.jobtracker.address |
mapreduce.framework.name establecido en yarn; el trabajoTracker ya no existe una vez que YARN programa el trabajo. |
| mapred-sitio.xml | Copiado de mapred-site.xml.template |
Se envia en etc/hadoop ya es así, por lo que el paso de copia es innecesario. |
| Puerto de interfaz web de NameNode | 50070 | 9870 |
| Java | Java 6 o Java 7 | Java 8 o Java 11 |
Todo lo demás en esta guía se comporta de la misma manera en Hadoop 3: la cuenta dedicada, la clave SSH, los cuatro archivos de configuración y los scripts de inicio y parada.
Parte 1) Descargar e instalar Hadoop
Paso 1) Agregar un usuario del sistema Hadoop
Agregue un usuario del sistema Hadoop utilizando el siguiente comando.
sudo addgroup hadoop_
sudo adduser --ingroup hadoop_ hduser_
Ingrese su contraseña, nombre y otros datos.
NOTA: Existe la posibilidad de que se produzca el siguiente error en este proceso de configuración e instalación.
“hduser no está en el archivo sudoers. Este incidente será reportado."
Este error se puede solucionar iniciando sesión como usuario root.
Ejecutar el comando
sudo adduser hduser_ sudo
Re-login as hduser_
Paso 2) Configurar SSH
Para administrar los nodos en un clúster, Hadoop requiere acceso SSH.
Primero, cambie de usuario e ingrese el siguiente comando
su - hduser_
Este comando creará una nueva clave.
ssh-keygen -t rsa -P ""
Habilite el acceso SSH a la máquina local utilizando esta clave.
cat $HOME/.ssh/id_rsa.pub >> $HOME/.ssh/authorized_keys
Ahora prueba la configuración SSH conectándote a localhost como el usuario 'hduser_'.
ssh localhost
Nota: Si ve el siguiente error en respuesta a 'ssh localhost', es posible que SSH no esté disponible en este sistema.
Para resolver esto –
Purgue SSH usando,
sudo apt-get purge openssh-server
Es recomendable purgar el sistema antes de comenzar la instalación.
Instale SSH usando el comando-
sudo apt-get install openssh-server
Paso 3) Descarga Hadoop
El siguiente paso es descargar Hadoop desde el Página de versiones de Apache Hadoop.
Seleccione Estable
Seleccione el archivo tar.gz (no el archivo que termina en src).
Una vez finalizada la descarga, navegue hasta el directorio que contiene el archivo tar.
Enter,
sudo tar xzf hadoop-2.2.0.tar.gz
Ahora, cambie el nombre de hadoop-2.2.0 a hadoop.
sudo mv hadoop-2.2.0 hadoop
Finalmente, entregue la carpeta a la nueva cuenta.
sudo chown -R hduser_:hadoop_ hadoop
Sustituya la versión que realmente descargó por hadoop-2.2.0 en los tres comandos anteriores.
Parte 2) Configurar Hadoop
Paso 1) Modificar el archivo ~/.bashrc
Agregue las siguientes líneas al final del archivo ~/.bashrc.
#Set HADOOP_HOME export HADOOP_HOME=<Installation Directory of Hadoop> #Set JAVA_HOME export JAVA_HOME=<Installation Directory of Java> # Add bin/ directory of Hadoop to PATH export PATH=$PATH:$HADOOP_HOME/bin
Ahora, configure este entorno utilizando el siguiente comando.
. ~/.bashrc
Paso 2) Configuraciones relacionadas con HDFS
Configure JAVA_HOME dentro del archivo $HADOOP_HOME/etc/hadoop/hadoop-env.sh, como se muestra a continuación.
Con
Hay dos parámetros en $HADOOP_HOME/etc/hadoop/core-site.xml que deben configurarse:
1. 'hadoop.tmp.dir' – Se utiliza para especificar un directorio que Hadoop utilizará para almacenar sus archivos de datos.
2. 'fs.defaultFS': especifica el sistema de archivos predeterminado. El nombre anterior para la misma propiedad, 'fs.default.name', está obsoleto.
Para configurar estos parámetros, abra core-site.xml
sudo gedit $HADOOP_HOME/etc/hadoop/core-site.xml
Copia las líneas siguientes entre las etiquetas.
<property> <name>hadoop.tmp.dir</name> <value>/app/hadoop/tmp</value> <description>Parent directory for other temporary directories.</description> </property> <property> <name>fs.defaultFS </name> <value>hdfs://localhost:54310</value> <description>The name of the default file system. </description> </property>
Navegue al directorio $HADOOP_HOME/etc/hadoop.
Ahora, cree el directorio mencionado en core-site.xml.
sudo mkdir -p <Path of Directory used in above setting>
Otorgar permisos al directorio.
sudo chown -R hduser_:Hadoop_ <Path of Directory created in above step>
sudo chmod 750 <Path of Directory created in above step>
Paso 3) Configuración de MapReduce
Antes de comenzar con estas configuraciones, vamos a establecer la ruta HADOOP_HOME.
sudo gedit /etc/profile.d/hadoop.sh
y entrar
export HADOOP_HOME=/home/guru99/Downloads/Hadoop
Siguiente entrar
sudo chmod +x /etc/profile.d/hadoop.sh
Salga de la terminal y vuelva a reiniciarla.
Escriba echo $HADOOP_HOME para verificar la ruta.
Ahora copia archivos
sudo cp $HADOOP_HOME/etc/hadoop/mapred-site.xml.template $HADOOP_HOME/etc/hadoop/mapred-site.xml
Abra el archivo mapred-site.xml
sudo gedit $HADOOP_HOME/etc/hadoop/mapred-site.xml
Agregue la configuración a continuación entre los y etiquetas.
<property> <name>mapreduce.jobtracker.address</name> <value>localhost:54311</value> <description>MapReduce job tracker runs at this host and port. </description> </property>
Abra el archivo $HADOOP_HOME/etc/hadoop/hdfs-site.xml como se muestra a continuación:
sudo gedit $HADOOP_HOME/etc/hadoop/hdfs-site.xml
Agregue la configuración a continuación entre los y etiquetas.
<property> <name>dfs.replication</name> <value>1</value> <description>Default block replication.</description> </property> <property> <name>dfs.datanode.data.dir</name> <value>/home/hduser_/hdfs</value> </property>
Cree el directorio especificado en la configuración anterior.
sudo mkdir -p <Path of Directory used in above setting>
sudo mkdir -p /home/hduser_/hdfs
Luego, otorga la propiedad y los permisos sobre él.
sudo chown -R hduser_:hadoop_ <Path of Directory created in above step>
sudo chown -R hduser_:hadoop_ /home/hduser_/hdfs
sudo chmod 750 <Path of Directory created in above step>
sudo chmod 750 /home/hduser_/hdfs
Paso 4) Formatear HDFS
Antes de iniciar Hadoop por primera vez, formatee HDFS utilizando el siguiente comando.
$HADOOP_HOME/bin/hdfs namenode -format
Paso 5) Inicie el clúster de nodo único de Hadoop.
Inicie el clúster de nodo único de Hadoop utilizando el siguiente comando.
$HADOOP_HOME/sbin/start-dfs.sh
El resultado del comando anterior se muestra a continuación.
Luego, inicia los demonios de YARN.
$HADOOP_HOME/sbin/start-yarn.sh
Utilizando la herramienta 'jps', verifique si todos los procesos relacionados con Hadoop se están ejecutando.
Si Hadoop se ha iniciado correctamente, la salida de jps debería mostrar NameNode, NodeManager, ResourceManager, SecondaryNameNode y DataNode.
Paso 6) Detenerseping Hadoop
Desactive el clúster en orden inverso.
$HADOOP_HOME/sbin/stop-dfs.sh
$HADOOP_HOME/sbin/stop-yarn.sh
Cómo verificar que Hadoop esté funcionando y solucionar errores comunes
La salida de jps confirma que los procesos se iniciaron, pero no que el clúster sea utilizable. Cuatro comprobaciones adicionales resuelven esa duda.
- Abra la interfaz web de NameNode en
http://localhost:9870(puerto 50070 en Hadoop 2.x) y confirme que el resumen informa un nodo activo. - Abra la interfaz de ResourceManager en
http://localhost:8088para confirmar que YARN aceptó el NodeManager. - Ejecutar
hdfs dfsadmin -reportpara la capacidad, los DataNodes activos y cualquier bloque con replicación insuficiente. - Escribe algo:
hdfs dfs -mkdir /testseguido porhdfs dfs -ls /demuestra que el espacio de nombres acepta cambios.
La mayoría de los fracasos en el primer intento se engloban en una de cinco categorías.
| Síntoma | Causa | Solución |
|---|---|---|
| JAVA_HOME no está configurado y no se pudo encontrar. | La variable se exporta en .bashrc pero no en hadoop-env.sh. | También debes configurar la ruta absoluta del JDK dentro de hadoop-env.sh. |
| Permiso denegado (clave pública, contraseña) en ssh localhost | El parámetro authorized_keys no está presente o es demasiado permisivo. | Vuelva a agregar id_rsa.pub y luego ejecute chmod 600 en ~/.ssh/authorized_keys |
| Conexión rechazada en el puerto 22 | El servidor OpenSSH no está instalado o no se está ejecutando. | Instale openssh-server e inicie el servicio ssh. |
| Falta DataNode en jps después de un reformateo. | Cluster Discrepancia de ID entre el NameNode formateado y el antiguo directorio DataNode. | Vacía la carpeta dfs.datanode.data.dir y luego formatéala una vez más. |
| start-dfs.sh: comando no encontrado | HADOOP_HOME y PATH nunca se cargaron en el shell actual. | Ejecuta . ~/.bashrc o abre una nueva terminal. |





























