Le 60 principali domande e risposte dell'intervista Hadoop (2026)

Ecco le domande e le risposte del colloquio Hadoop MapReduce per i candidati piรน freschi ed esperti che vogliono ottenere il lavoro dei loro sogni.

Hadoop MapRiduci le domande dell'intervista

1) Cos'รจ Hadoop Map Reduce?

Per l'elaborazione di set di dati di grandi dimensioni in parallelo in un cluster Hadoop, viene utilizzato il framework Hadoop MapReduce. L'analisi dei dati utilizza una mappa in due fasi e un processo di riduzione.


2) Come funziona Hadoop MapReduce?

In MapReduce, durante la fase di mappatura, conta le parole in ciascun documento, mentre nella fase di riduzione aggrega i dati come da documento che abbraccia l'intera raccolta. Durante la fase della mappa, i dati di input vengono divisi in suddivisioni per l'analisi da parte delle attivitร  della mappa eseguite in parallelo nel framework Hadoop.

๐Ÿ‘‰ Download gratuito del PDF: domande e risposte all'intervista su Hadoop e MapReduce


3) Spiegare cosa significa mescolare in MapReduce?

Il processo mediante il quale il sistema esegue l'ordinamento e trasferisce gli output della mappa al riduttore come input รจ noto come shuffle


4) Spiegare cos'รจ la cache distribuita nel framework MapReduce?

La cache distribuita รจ una funzionalitร  importante fornita dal framework MapReduce. Quando vuoi condividere alcuni file su tutti i nodi in Hadoop Cluster, Viene utilizzata la cache distribuita. I file potrebbero essere file jar eseguibili o semplici file di proprietร .

Hadoop MapRiduci le domande dell'intervista
Hadoop MapRiduci le domande dell'intervista

5) Spiegare cos'รจ NameNode in Hadoop?

NameNode in Hadoop รจ il nodo in cui Hadoop archivia tutte le informazioni sulla posizione del file HDFS (file system distribuito Hadoop)In altre parole, NameNode รจ il fulcro di un file system HDFS. Mantiene il registro di tutti i file nel file system e tracks i dati del file nell'intero cluster o su piรน macchine


6) Spiega cos'รจ GiobbeTracCos'รจ Hadoop? Quali sono le azioni eseguite da Hadoop?

In Hadoop per l'invio e tracLavori di King MapReduce, LavoroTracker viene utilizzato. Lavoro tracker viene eseguito sul proprio processo JVM

Lavoro Tracker esegue le seguenti azioni in Hadoop

  • Applicazione del cliente invia lavori al lavoro tracker
  • LavoroTracker comunica con la modalitร  Nome per determinare la posizione dei dati
  • Vicino ai dati o con slot disponibili LavoroTracker individua l'attivitร Tracnodi ker
  • Sul compito sceltoTracker Nodes, invia il lavoro
  • Quando un compito fallisce, Job tracker avvisa e decide cosa fare.
  • La TaskTracI nodi ker sono monitorati da JobTracker

7) Spiegare cos'รจ il battito cardiaco in HDFS?

Heartbeat รจ un segnale utilizzato tra un nodo dati e un nodo nome, e tra attivitร  tracker e job tracker, se il nodo Nome o il lavoro tracSe il ker non risponde al segnale, si considera che ci siano problemi con il nodo dati o con l'attivitร . tracker


8) Spiegare cosa sono i combinatori e quando dovresti utilizzare un combinatore in un lavoro MapReduce?

Per aumentare l'efficienza di Programma MapReduce, Vengono utilizzati i combinatori. La quantitร  di dati puรฒ essere ridotta con l'aiuto di combinatori che devono essere trasferiti ai riduttori. Se l'operazione eseguita รจ commutativa e associativa puoi utilizzare il tuo codice riduttore come combinatore. L'esecuzione del combinatore non รจ garantita in Hadoop


9) Cosa succede quando un nodo dati fallisce?

Quando un nodo dati fallisce

  • Lavorotracker e namenode rilevano il guasto
  • Sul nodo guasto tutte le attivitร  vengono riprogrammate
  • Namenode replica i dati dell'utente su un altro nodo

10) Spiegare cos'รจ l'esecuzione speculativa?

In Hadoop durante l'esecuzione speculativa vengono avviati un certo numero di attivitร  duplicate. Su un diverso nodo slave, รจ possibile eseguire piรน copie della stessa mappa o ridurre l'attivitร  utilizzando l'esecuzione speculativa. In parole semplici, se una particolare unitร  impiega molto tempo per completare un'attivitร , Hadoop creerร  un'attivitร  duplicata su un altro disco. Un disco che termina per primo l'attivitร  viene mantenuto mentre i dischi che non la terminano per primi vengono terminati.


11) Spiegare quali sono i parametri base di un Mapper?

I parametri di base di un Mapper sono

  • LongWritable e testo
  • Testo e IntWritable

12) Spiegare qual รจ la funzione del partizionatore MapReduce?

La funzione del partizionatore MapReduce รจ quella di assicurarsi che tutto il valore di una singola chiave vada allo stesso riduttore, il che alla fine aiuta la distribuzione uniforme dell'output della mappa sui riduttori


13) Spiegare qual รจ la differenza tra un Input Split e un blocco HDFS?

La divisione logica dei dati รจ nota come Dividi mentre una divisione fisica dei dati รจ nota come Blocco HDFS


14) Spiegare cosa succede in formato testo?

Nel formato di input testo, ogni riga nel file di testo รจ un record. Il valore รจ il contenuto della riga mentre la chiave รจ l'offset in byte della riga. Ad esempio, Chiave: longWritable, Valore: text


15) Quali sono i principali parametri di configurazione che l'utente deve specificare per eseguire MapReduce Job?

L'utente del framework MapReduce deve specificare

  • Posizioni di input del lavoro nel file system distribuito
  • Posizione dell'output del lavoro nel file system distribuito
  • Formato di input
  • Formato di output
  • Classe contenente la funzione map
  • Classe contenente la funzione di riduzione
  • File JAR contenente le classi mapper, reducer e driver

16) Spiegare cos'รจ WebDAV in Hadoop?

Per supportare la modifica e l'aggiornamento dei file, WebDAV รจ un set di estensioni di HTTP. Sulla maggior parte dei sistemi operativi, le condivisioni WebDAV possono essere montate come filesystem, quindi รจ possibile accedere a HDFS come filesystem standard esponendo HDFS su WebDAV.


17) Spiegare cos'รจ Sqoop in Hadoop?

Per trasferire i dati tra Gestione database relazionali (RDBMS) and Hadoop HDFS viene utilizzato uno strumento noto come Sqoop. Utilizzando Sqoop i dati possono essere trasferiti da RDMS simili MySQL or Oracle in HDFS nonchรฉ esportare dati dal file HDFS a RDBMS


18) Spiega come GiobbeTracKer pianifica un'attivitร ?

L'obiettivo tracker invia messaggi di battito cardiaco a Jobtracker di solito ogni pochi minuti per assicurarsi che JobTracker รจ attivo e funzionante. Il messaggio informa anche JobTracinformarsi sul numero di slot disponibili, quindi il lavoroTracker puรฒ rimanere aggiornato su dove puรฒ essere delegato il lavoro del cluster


19) Spiegare cos'รจ Sequencefileinputformat?

Sequencefileinputformat viene utilizzato per leggere i file in sequenza. รˆ un formato di file binario compresso specifico ottimizzato per il passaggio di dati tra l'output di un lavoro MapReduce all'input di un altro lavoro MapReduce.


20) Spiega cosa fa la classe conf.setMapper?

Conf.setMapperclass imposta la classe del mapper e tutto ciรฒ che riguarda il lavoro della mappa come la lettura dei dati e la generazione di una coppia chiave-valore dal mapper

21) Spiegare cos'รจ Hadoop?

รˆ un framework software open source per l'archiviazione di dati e l'esecuzione di applicazioni su cluster di hardware di base. Fornisce un'enorme potenza di elaborazione e un'enorme archiviazione per qualsiasi tipo di dati.


22) Menziona qual รจ la differenza tra un RDBMS e Hadoop?

RDBMS Hadoop
RDBMS รจ un sistema di gestione di database relazionali Hadoop รจ una struttura piatta basata su nodi
Utilizzato per l'elaborazione OLTP mentre Hadoop Attualmente รจ utilizzato per analisi e per l'elaborazione di BIG DATA
In RDBMS, il cluster di database utilizza gli stessi file di dati archiviati in un archivio condiviso In Hadoop, i dati di archiviazione possono essere archiviati in modo indipendente in ciascun nodo di elaborazione.
รˆ necessario preelaborare i dati prima di archiviarli non รจ necessario preelaborare i dati prima di archiviarli

23) Menzionare i componenti principali di Hadoop?

I componenti principali di Hadoop includono,

  • HDFS
  • MapReduce

24) Cos'รจ NameNode in Hadoop?

Il NameNode in Hadoop รจ il nodo in cui Hadoop memorizza tutte le informazioni sulla posizione dei file in HDFS. รˆ il nodo master su cui viene eseguito il job. tracker esegue e consiste in metadati.


25) Menzionare quali sono i componenti dei dati utilizzati da Hadoop?

I componenti dati utilizzati da Hadoop sono


26) Menziona qual รจ il componente di archiviazione dei dati utilizzato da Hadoop?

Il componente di archiviazione dei dati utilizzato da Hadoop รจ HBase.


27) Menzionare quali sono i formati di input piรน comuni definiti in Hadoop?

I formati di input piรน comuni definiti in Hadoop sono;

  • TextInputFormat
  • KeyValueInputFormat
  • SequenceFileInputFormat

28) In Hadoop cos'รจ InputSplit?

Divide i file di input in blocchi e assegna ciascuna divisione a un mappatore per l'elaborazione.


29) Per un lavoro Hadoop, come scriverai un partizionatore personalizzato?

Per scrivere un partizionatore personalizzato per un lavoro Hadoop, segui il seguente percorso

  • Crea una nuova classe che estende la classe Partitioner
  • Sostituisci il metodo getPartition
  • Nel wrapper che esegue MapReduce
  • Aggiungere il partizionatore personalizzato al lavoro utilizzando il metodo set Partitioner Class oppure โ€“ aggiungere il partizionatore personalizzato al lavoro come file di configurazione

30) Per un lavoro in Hadoop รจ possibile modificare il numero di mappatori da creare?

No, non รจ possibile modificare il numero di mappatori da creare. Il numero di mappatori รจ determinato dal numero di suddivisioni di input.


31) Spiegare cos'รจ un file di sequenza in Hadoop?

Per memorizzare coppie chiave/valore binarie, viene utilizzato il file di sequenza. A differenza dei normali file compressi, i file di sequenza supportano la suddivisione anche quando i dati all'interno del file sono compressi.


32) Cosa succede al job quando Namenode รจ inattivo? tracker?

Namenode รจ il singolo punto di errore in HDFS, quindi quando Namenode รจ inattivo il tuo cluster si attiverร .


33) Spiegare come viene eseguita l'indicizzazione in HDFS?

Hadoop ha un modo unico di indicizzare. Una volta archiviati i dati in base alla dimensione del blocco, HDFS continuerร  a archiviare l'ultima parte dei dati che indica dove sarร  la parte successiva dei dati.


34) Spiegare รจ possibile cercare file utilizzando i caratteri jolly?

Sรฌ, รจ possibile cercare file utilizzando i caratteri jolly.


35) Elencare i tre file di configurazione di Hadoop?

I tre file di configurazione sono

  • sito-core.xml
  • sito-mapred.xml
  • hdfs-sito.xml

36) Spiega come puoi verificare se Namenode funziona oltre a utilizzare il comando jps?

Oltre a usare il comando jps, per verificare se i Namenode funzionano puoi anche usare

/etc/init.d/hadoop-0.20-namenode stato.


37) Spiegare cos'รจ la "mappa" e cos'รจ il "riduttore" in Hadoop?

In Hadoop, una mappa รจ una fase nella risoluzione delle query HDFS. Una mappa legge i dati da una posizione di input e restituisce una coppia di valori chiave in base al tipo di input.

In Hadoop, un riduttore raccoglie l'output generato dal mapper, lo elabora e crea un proprio output finale.


38) In Hadoop, quale file controlla la segnalazione in Hadoop?

In Hadoop, il file hadoop-metrics.properties controlla il reporting.


39) Per utilizzare Hadoop elencare i requisiti di rete?

Per utilizzare Hadoop l'elenco dei requisiti di rete รจ:

  • Connessione SSH senza password
  • Secure Shell (SSH) per l'avvio dei processi del server

40) Menziona cos'รจ la consapevolezza del rack?

La consapevolezza del rack รจ il modo in cui il namenode determina come posizionare i blocchi in base alle definizioni del rack.


41) Spiega cos'รจ un compito Tracker in Hadoop?

Un compito Tracker in Hadoop รจ un demone del nodo slave nel cluster che accetta attivitร  da un JobTracker. Invia anche i messaggi di battito cardiaco al lavoroTracker, ogni pochi minuti, per confermare che il lavoroTracKer รจ ancora vivo.


42) Menzionare quali demoni vengono eseguiti su un nodo master e sui nodi slave?

  • I demoni eseguiti sul nodo master sono "NameNode"
  • I daemon in esecuzione su ciascun nodo slave sono "Task Trackerโ€ e โ€œDataโ€

43) Spiega come puoi eseguire il debug del codice Hadoop?

I metodi piรน diffusi per il debug del codice Hadoop sono:

  • Utilizzando l'interfaccia web fornita dal framework Hadoop
  • Utilizzando i contatori

44) Spiegare cosa sono i nodi di archiviazione e di calcolo?

  • Il nodo di archiviazione รจ la macchina o il computer in cui risiede il file system per archiviare i dati di elaborazione
  • Il nodo di calcolo รจ il computer o la macchina in cui verrร  eseguita la logica aziendale effettiva.

45) Menziona qual รจ l'uso dell'oggetto contesto?

L'oggetto contesto consente al mappatore di interagire con il resto dell'Hadoop

sistema. Include i dati di configurazione per il lavoro, nonchรฉ le interfacce che gli consentono di emettere output.


46) Indica qual รจ il passaggio successivo dopo Mapper o MapTask?

Il passaggio successivo dopo Mapper o MapTask รจ che l'output del Mapper viene ordinato e verranno create partizioni per l'output.


47) Menziona qual รจ il numero di partizionatore predefinito in Hadoop?

In Hadoop, il partizionatore predefinito รจ un partizionatore "Hash".


48) Spiegare qual รจ lo scopo di RecordReader in Hadoop?

In Hadoop, il RecordReader carica i dati dalla sua fonte e li converte in coppie (chiave, valore) adatte per la lettura da parte del Mapper.


49) Spiegare come vengono partizionati i dati prima di essere inviati al riduttore se in Hadoop non รจ definito alcun partizionatore personalizzato?

Se in Hadoop non รจ definito alcun partizionatore personalizzato, un partizionatore predefinito calcola un valore hash per la chiave e assegna la partizione in base al risultato.


50) Spiegare cosa succede quando Hadoop genera 50 attivitร  per un lavoro e una delle attivitร  fallisce?

Riavvierร  l'attivitร  su un'altra attivitร Tracker se l'attivitร  fallisce piรน volte del limite definito.


51) Indica qual รจ il modo migliore per copiare file tra cluster HDFS?

Il modo migliore per copiare file tra cluster HDFS รจ utilizzare piรน nodi e il comando distcp, in modo che il carico di lavoro sia condiviso.


52) Menziona qual รจ la differenza tra HDFS e NAS?

I blocchi di dati HDFS vengono distribuiti sulle unitร  locali di tutte le macchine in un cluster mentre i dati NAS vengono archiviati su hardware dedicato.


53) Menzionare in che modo Hadoop รจ diverso da altri strumenti di elaborazione dati?

In Hadoop puoi aumentare o diminuire il numero di mappatori senza preoccuparti del volume di dati da elaborare.


54) Menziona quale lavoro svolge la classe conf?

La classe Job conf separa diversi lavori in esecuzione sullo stesso cluster. Esegue le impostazioni a livello di lavoro come la dichiarazione di un lavoro in un ambiente reale.


55) Menziona cosa sono le API Hadoop MapReducetract per una classe chiave e valore?

Per una classe chiave e valore, ci sono due API Hadoop MapReduce contract

  • Il valore deve definire l'interfaccia org.apache.hadoop.io.Writable
  • La chiave deve definire l'interfaccia org.apache.hadoop.io.WritableComparable

56) Menzionare quali sono le tre modalitร  in cui รจ possibile eseguire Hadoop?

Le tre modalitร  in cui รจ possibile eseguire Hadoop sono

  • Modalitร  pseudo distribuita
  • Modalitร  autonoma (locale).
  • Modalitร  completamente distribuita

57) Menziona cosa fa il formato di immissione del testo?

Il formato di input del testo creerร  un oggetto linea che รจ un numero esadecimale. Il valore viene considerato come un'intera riga di testo mentre la chiave viene considerata come un oggetto riga. Il mappatore riceverร  il valore come parametro 'testo' mentre la chiave come parametro 'longwriteable'.


58) Menzionare quanti InputSplit sono realizzati da un framework Hadoop?

Hadoop effettuerร  5 divisioni

  • 1 divisione per file da 64K
  • 2 divisi per file da 65 MB
  • 2 suddivisioni per file da 127 MB

59) Menzionare cos'รจ la cache distribuita in Hadoop?

La cache distribuita in Hadoop รจ una funzionalitร  fornita dal framework MapReduce. Al momento dell'esecuzione del lavoro, viene utilizzato per memorizzare nella cache il file. Il Framework copia i file necessari sul nodo slave prima dell'esecuzione di qualsiasi attivitร  su quel nodo.


60) Spiega in che modo Hadoop Classpath svolge un ruolo vitale nell'arrestoping o iniziando dai daemon di Hadoop?

Classpath sarร  costituito da un elenco di directory contenenti file jar per arrestare o avviare i demoni.

Queste domande del colloquio ti aiuteranno anche nel tuo viva(orale)

Riassumi questo post con: