Πώς να κατεβάσετε και να εγκαταστήσετε το NLTK

⚡ Έξυπνη Σύνοψη

Λήψη και εγκατάσταση του NLTK στο Windows, Mac ή Linux εγκαθιστώντας Python πρώτα, και στη συνέχεια προσθέτοντας το Φυσικό Language Toolκιτ μέσω pip ή Anaconda και λήψη των συνόλων δεδομένων του corpus.

  • Απαιτείται: εγκαταστήστε Python πριν από την προσθήκη του NLTK.
  • ⚙️ Εγκατάσταση: Χρησιμοποιήστε pip, easy_install ή Anaconda.
  • 📚 Σύνολα δεδομένων: Εκτελέστε την εντολή nltk.download() για να ανακτήσετε τα σώματα κειμένων.
  • 🐍 Επαληθεύω: εισαγωγή nltk στο Python κέλυφος.
  • 🤖 Χρήση Τεχνητής Νοημοσύνης: Tokenization και tagging για αγωγούς NLP.

Λήψη και εγκατάσταση του NLTK

Εγκατάσταση του NLTK στο Windows

Μάθετε πώς να ρυθμίσετε το NLTK στο Windows από τη γραμμή εντολών. Οι παρακάτω οδηγίες υποθέτουν ότι Python δεν έχει εγκατασταθεί ακόμα, επομένως το πρώτο βήμα είναι να το εγκαταστήσετε Python.

εγκατάσταση Python in Windows

Βήμα 1) Ανοίξτε το σύνδεσμο https://www.python.org/downloads/, και επιλέξτε το πιο πρόσφατο Windows ελευθέρωση.

εγκατάσταση Python in Windows

ΣημείωσηΓια μια παλαιότερη έκδοση, επισκεφθείτε την καρτέλα Λήψεις για να δείτε όλες τις κυκλοφορίες.

εγκατάσταση Python in Windows

Βήμα 2) Κάντε κλικ στο αρχείο εγκατάστασης που έχετε κατεβάσει.

εγκατάσταση Python in Windows

Βήμα 3) Επιλέξτε Προσαρμογή εγκατάστασης.

εγκατάσταση Python in Windows

Βήμα 4) Κάντε κλικ στο ΕΠΟΜΕΝΟ.

εγκατάσταση Python in Windows

Βήμα 5) Στην επόμενη οθόνη:

  1. Επιλέξτε τις προηγμένες επιλογές.
  2. Παρέχετε μια προσαρμοσμένη τοποθεσία εγκατάστασης. Σε αυτό το παράδειγμα, επιλέγεται ένας φάκελος στη μονάδα δίσκου C για ευκολότερη πρόσβαση.
  3. Κάντε κλικ στο κουμπί Εγκατάσταση.

εγκατάσταση Python in Windows

Βήμα 6) Κάντε κλικ στο κουμπί Κλείσιμο μόλις ολοκληρωθεί η εγκατάσταση.

εγκατάσταση Python in Windows

Βήμα 7) Αντιγράψτε τη διαδρομή του φακέλου Scripts.

εγκατάσταση Python in Windows

Βήμα 8) Στο Windows γραμμή εντολών:

  • Μεταβείτε στη θέση του φακέλου pip.
  • Πληκτρολογήστε την εντολή για να εγκαταστήσετε το NLTK:
    pip3 install nltk
  • Η εγκατάσταση θα πρέπει να ολοκληρωθεί με επιτυχία.

εγκατάσταση Python in Windows

ΣΗΜΕΊΩΣΗ: Για Python 2, χρησιμοποιήστε την εντολή pip2 install nltk.

Βήμα 9) Από το Windows Μενού Έναρξη, αναζητήστε και ανοίξτε το Python Κέλυφος.

εγκατάσταση Python in Windows

Βήμα 10) Επαληθεύστε ότι η εγκατάσταση λειτουργεί εκτελώντας την παρακάτω εντολή:

import nltk

εγκατάσταση Python in Windows

Εάν δεν εμφανιστεί σφάλμα, η εγκατάσταση έχει ολοκληρωθεί.

Εγκατάσταση του NLTK σε Mac/Linux

Η εγκατάσταση του NLTK σε Mac ή Linux απαιτεί το Python pip του διαχειριστή πακέτων. Εάν το pip δεν είναι εγκατεστημένο, ακολουθήστε τις παρακάτω οδηγίες για να ολοκληρώσετε τη διαδικασία.

Βήμα 1) Ενημέρωση του ευρετηρίου πακέτου κατά typing την παρακάτω εντολή:

sudo apt update

Βήμα 2) Εγκατάσταση pip για Python 3:

sudo apt install python3-pip

Μπορείτε επίσης να εγκαταστήσετε το pip μέσω του easy_install:

sudo apt-get install python-setuptools  python-dev build-essential

Μόλις εγκατασταθεί το easy_install, εκτελέστε την παρακάτω εντολή για να εγκαταστήσετε το pip:

sudo easy_install pip

Βήμα 3) Χρησιμοποιήστε την ακόλουθη εντολή για να εγκαταστήσετε το NLTK:

sudo pip install -U nltk
sudo pip3 install -U nltk

Εγκατάσταση NLTK μέσω Anaconda

Βήμα 1) Εγκαταστήστε το Anaconda μεταβαίνοντας https://www.anaconda.com/products/individual και επιλέγοντας το Python έκδοση που χρειάζεστε.

Εγκατάσταση NLTK μέσω Anaconda

Σημείωση: Ανατρέξτε σε αυτό το σεμινάριο για λεπτομερή βήματα εγκατάσταση του Anaconda.

Βήμα 2) Στην προτροπή του Anaconda:

  1. Εισαγάγετε την εντολή:
    conda install -c anaconda nltk
  2. RevΔείτε τις πληροφορίες αναβάθμισης, υποβάθμισης και εγκατάστασης του πακέτου και, στη συνέχεια, πληκτρολογήστε "Ναι".
  3. Το NLTK λαμβάνεται και εγκαθίσταται.

Εγκατάσταση NLTK μέσω Anaconda

Σύνολο δεδομένων NLTK

Η ενότητα NLTK συνοδεύεται από πολλά σύνολα δεδομένων που πρέπει να κατεβάσετε πριν από τη χρήση. Τεχνικά, κάθε σύνολο δεδομένων ονομάζεται σώμα. Συνηθισμένα παραδείγματα περιλαμβάνουν λέξεις-κλειδιά, Gutenberg, framenet_v15, μεγάλες_γραμματικές, καστανόςκαι wordnet.

Πώς να κατεβάσετε όλα τα πακέτα του NLTK

Βήμα 1) Εκτελέστε το Python διερμηνέας in Windows ή Linux.

Βήμα 2)

  1. Εισαγάγετε τις εντολές:
import nltk
nltk.download ()
  1. Ανοίγει το παράθυρο του NLTK Downloader. Κάντε κλικ στο κουμπί Λήψη για να ανακτήσετε το σύνολο δεδομένων. Αυτή η διαδικασία διαρκεί χρόνο ανάλογα με τη σύνδεσή σας στο διαδίκτυο.

Κατεβάστε όλα τα πακέτα του NLTK

ΣΗΜΕΊΩΣΗ: Μπορείτε να αλλάξετε την τοποθεσία λήψης κάνοντας κλικ στις επιλογές Αρχείο > Αλλαγή καταλόγου λήψεων.

Κατεβάστε όλα τα πακέτα του NLTK

Βήμα 3) Για να ελέγξετε τα εγκατεστημένα δεδομένα, χρησιμοποιήστε τον ακόλουθο κώδικα:

>>> from nltk.corpus import brown
>>>brown.words()

['The', 'Fulton', 'County', 'Grand', 'Jury', 'sid', ...]

Κατεβάστε όλα τα πακέτα του NLTK

Εκτέλεση του σεναρίου NLP

Αυτή η ενότητα εξηγεί πώς εκτελείται ένα σενάριο NLP σε έναν τοπικό υπολογιστή. Η σωστή επιλογή βιβλιοθήκης εξαρτάται από τις απαιτήσεις σας. Δείτε την επίσημη λίστα με Βιβλιοθήκες NLP για εναλλακτικές λύσεις όπως spaCy, gensim και TextBlob.

Πώς να εκτελέσετε το σενάριο NLTK

Βήμα 1) Στον αγαπημένο σας επεξεργαστή κώδικα, αντιγράψτε τον κώδικα και αποθηκεύστε το αρχείο ως NLTKsample.py:

from nltk.tokenize import RegexpTokenizer
tokenizer = RegexpTokenizer(r'\w+')
filterdText=tokenizer.tokenize('Hello Guru99, You have build a very good site and I love visiting your site.')
print(filterdText)

Εκτελέστε το σενάριο NLTK

Code Επεξήγηση:

  1. Ο στόχος αυτού του προγράμματος είναι να αφαιρέσει κάθε είδους στίξη από ένα δεδομένο κείμενο. Εισαγάγαμε το "RegexpTokenizer", μια ενότητα του NLTK που αφαιρεί οποιαδήποτε έκφραση, σύμβολο, χαρακτήρα ή αριθμητική τιμή επιλέγετε.
  2. Μια κανονική έκφραση διαβιβάζεται στη μονάδα "RegexpTokenizer".
  3. Το κείμενο μετατρέπεται σε token χρησιμοποιώντας τη μέθοδο "tokenize" και η έξοδος αποθηκεύεται στη μεταβλητή "filterdText".
  4. Το αποτέλεσμα εκτυπώνεται χρησιμοποιώντας την εντολή "print()".

Βήμα 2) Στη γραμμή εντολών:

  • Μεταβείτε στη θέση όπου αποθηκεύσατε το αρχείο.
  • Εκτελέστε την εντολή python NLTKsample.py.

Εκτελέστε το σενάριο NLTK

Η έξοδος είναι:

['Γεια', 'Guru99', 'Εσείς', 'έχετε', 'κατασκευάστε', 'ένα', 'πολύ', 'καλό', 'ιστότοπος', 'και', 'εγώ', 'αγαπώ', 'επισκέπτομαι', 'σας', 'ιστότοπος']

Συχνές Ερωτήσεις

Η εντολή pip εγκαθιστά την ίδια τη βιβλιοθήκη, ενώ η εντολή nltk.download() ανακτά σώματα κειμένων και εκπαιδευμένα μοντέλα όπως stopwords, punkt και wordnet. Και τα δύο βήματα είναι απαραίτητα πριν από την προσθήκη tokenization ή tag σε κείμενο.

Ναι. Το NLTK παραμένει δημοφιλές για την προεπεξεργασία κειμένου που τροφοδοτεί τα LLM, συμπεριλαμβανομένης της δημιουργίας διακριτικών, της αφαίρεσης stop-word, της δημιουργίας stem και της ετικέτας POS. Χρησιμοποιείται επίσης ευρέως στη διδασκαλία και την έρευνα χάρη στο σαφές API και τα κλασικά σώματα κειμένων.

Το NLTK είναι το καλύτερο για την εκμάθηση των βασικών αρχών του NLP. Το spaCy είναι πιο γρήγορο για παραγωγή, ενώ Αγκαλιάζοντας μετασχηματιστές προσώπου προσφέρει προ-εκπαιδευμένα μοντέλα βαθιάς μάθησης. Πολλά έργα τεχνητής νοημοσύνης συνδυάζουν την προεπεξεργασία NLTK με την εξαγωγή συμπερασμάτων από μετασχηματιστές.

Συνοψίστε αυτήν την ανάρτηση με: