Πώς να κατεβάσετε και να εγκαταστήσετε το NLTK
⚡ Έξυπνη Σύνοψη
Λήψη και εγκατάσταση του NLTK στο Windows, Mac ή Linux εγκαθιστώντας Python πρώτα, και στη συνέχεια προσθέτοντας το Φυσικό Language Toolκιτ μέσω pip ή Anaconda και λήψη των συνόλων δεδομένων του corpus.

Εγκατάσταση του NLTK στο Windows
Μάθετε πώς να ρυθμίσετε το NLTK στο Windows από τη γραμμή εντολών. Οι παρακάτω οδηγίες υποθέτουν ότι Python δεν έχει εγκατασταθεί ακόμα, επομένως το πρώτο βήμα είναι να το εγκαταστήσετε Python.
εγκατάσταση Python in Windows
Βήμα 1) Ανοίξτε το σύνδεσμο https://www.python.org/downloads/, και επιλέξτε το πιο πρόσφατο Windows ελευθέρωση.
ΣημείωσηΓια μια παλαιότερη έκδοση, επισκεφθείτε την καρτέλα Λήψεις για να δείτε όλες τις κυκλοφορίες.
Βήμα 2) Κάντε κλικ στο αρχείο εγκατάστασης που έχετε κατεβάσει.
Βήμα 3) Επιλέξτε Προσαρμογή εγκατάστασης.
Βήμα 4) Κάντε κλικ στο ΕΠΟΜΕΝΟ.
Βήμα 5) Στην επόμενη οθόνη:
- Επιλέξτε τις προηγμένες επιλογές.
- Παρέχετε μια προσαρμοσμένη τοποθεσία εγκατάστασης. Σε αυτό το παράδειγμα, επιλέγεται ένας φάκελος στη μονάδα δίσκου C για ευκολότερη πρόσβαση.
- Κάντε κλικ στο κουμπί Εγκατάσταση.
Βήμα 6) Κάντε κλικ στο κουμπί Κλείσιμο μόλις ολοκληρωθεί η εγκατάσταση.
Βήμα 7) Αντιγράψτε τη διαδρομή του φακέλου Scripts.
Βήμα 8) Στο Windows γραμμή εντολών:
- Μεταβείτε στη θέση του φακέλου pip.
- Πληκτρολογήστε την εντολή για να εγκαταστήσετε το NLTK:
pip3 install nltk
- Η εγκατάσταση θα πρέπει να ολοκληρωθεί με επιτυχία.
ΣΗΜΕΊΩΣΗ: Για Python 2, χρησιμοποιήστε την εντολή pip2 install nltk.
Βήμα 9) Από το Windows Μενού Έναρξη, αναζητήστε και ανοίξτε το Python Κέλυφος.
Βήμα 10) Επαληθεύστε ότι η εγκατάσταση λειτουργεί εκτελώντας την παρακάτω εντολή:
import nltk
Εάν δεν εμφανιστεί σφάλμα, η εγκατάσταση έχει ολοκληρωθεί.
Εγκατάσταση του NLTK σε Mac/Linux
Η εγκατάσταση του NLTK σε Mac ή Linux απαιτεί το Python pip του διαχειριστή πακέτων. Εάν το pip δεν είναι εγκατεστημένο, ακολουθήστε τις παρακάτω οδηγίες για να ολοκληρώσετε τη διαδικασία.
Βήμα 1) Ενημέρωση του ευρετηρίου πακέτου κατά typing την παρακάτω εντολή:
sudo apt update
Βήμα 2) Εγκατάσταση pip για Python 3:
sudo apt install python3-pip
Μπορείτε επίσης να εγκαταστήσετε το pip μέσω του easy_install:
sudo apt-get install python-setuptools python-dev build-essential
Μόλις εγκατασταθεί το easy_install, εκτελέστε την παρακάτω εντολή για να εγκαταστήσετε το pip:
sudo easy_install pip
Βήμα 3) Χρησιμοποιήστε την ακόλουθη εντολή για να εγκαταστήσετε το NLTK:
sudo pip install -U nltk sudo pip3 install -U nltk
Εγκατάσταση NLTK μέσω Anaconda
Βήμα 1) Εγκαταστήστε το Anaconda μεταβαίνοντας https://www.anaconda.com/products/individual και επιλέγοντας το Python έκδοση που χρειάζεστε.
Σημείωση: Ανατρέξτε σε αυτό το σεμινάριο για λεπτομερή βήματα εγκατάσταση του Anaconda.
Βήμα 2) Στην προτροπή του Anaconda:
- Εισαγάγετε την εντολή:
conda install -c anaconda nltk
- RevΔείτε τις πληροφορίες αναβάθμισης, υποβάθμισης και εγκατάστασης του πακέτου και, στη συνέχεια, πληκτρολογήστε "Ναι".
- Το NLTK λαμβάνεται και εγκαθίσταται.
Σύνολο δεδομένων NLTK
Η ενότητα NLTK συνοδεύεται από πολλά σύνολα δεδομένων που πρέπει να κατεβάσετε πριν από τη χρήση. Τεχνικά, κάθε σύνολο δεδομένων ονομάζεται σώμα. Συνηθισμένα παραδείγματα περιλαμβάνουν λέξεις-κλειδιά, Gutenberg, framenet_v15, μεγάλες_γραμματικές, καστανόςκαι wordnet.
Πώς να κατεβάσετε όλα τα πακέτα του NLTK
Βήμα 1) Εκτελέστε το Python διερμηνέας in Windows ή Linux.
Βήμα 2)
- Εισαγάγετε τις εντολές:
import nltk nltk.download ()
- Ανοίγει το παράθυρο του NLTK Downloader. Κάντε κλικ στο κουμπί Λήψη για να ανακτήσετε το σύνολο δεδομένων. Αυτή η διαδικασία διαρκεί χρόνο ανάλογα με τη σύνδεσή σας στο διαδίκτυο.
ΣΗΜΕΊΩΣΗ: Μπορείτε να αλλάξετε την τοποθεσία λήψης κάνοντας κλικ στις επιλογές Αρχείο > Αλλαγή καταλόγου λήψεων.
Βήμα 3) Για να ελέγξετε τα εγκατεστημένα δεδομένα, χρησιμοποιήστε τον ακόλουθο κώδικα:
>>> from nltk.corpus import brown >>>brown.words()
['The', 'Fulton', 'County', 'Grand', 'Jury', 'sid', ...]
Εκτέλεση του σεναρίου NLP
Αυτή η ενότητα εξηγεί πώς εκτελείται ένα σενάριο NLP σε έναν τοπικό υπολογιστή. Η σωστή επιλογή βιβλιοθήκης εξαρτάται από τις απαιτήσεις σας. Δείτε την επίσημη λίστα με Βιβλιοθήκες NLP για εναλλακτικές λύσεις όπως spaCy, gensim και TextBlob.
Πώς να εκτελέσετε το σενάριο NLTK
Βήμα 1) Στον αγαπημένο σας επεξεργαστή κώδικα, αντιγράψτε τον κώδικα και αποθηκεύστε το αρχείο ως NLTKsample.py:
from nltk.tokenize import RegexpTokenizer
tokenizer = RegexpTokenizer(r'\w+')
filterdText=tokenizer.tokenize('Hello Guru99, You have build a very good site and I love visiting your site.')
print(filterdText)
Code Επεξήγηση:
- Ο στόχος αυτού του προγράμματος είναι να αφαιρέσει κάθε είδους στίξη από ένα δεδομένο κείμενο. Εισαγάγαμε το "RegexpTokenizer", μια ενότητα του NLTK που αφαιρεί οποιαδήποτε έκφραση, σύμβολο, χαρακτήρα ή αριθμητική τιμή επιλέγετε.
- Μια κανονική έκφραση διαβιβάζεται στη μονάδα "RegexpTokenizer".
- Το κείμενο μετατρέπεται σε token χρησιμοποιώντας τη μέθοδο "tokenize" και η έξοδος αποθηκεύεται στη μεταβλητή "filterdText".
- Το αποτέλεσμα εκτυπώνεται χρησιμοποιώντας την εντολή "print()".
Βήμα 2) Στη γραμμή εντολών:
- Μεταβείτε στη θέση όπου αποθηκεύσατε το αρχείο.
- Εκτελέστε την εντολή
python NLTKsample.py.
Η έξοδος είναι:
['Γεια', 'Guru99', 'Εσείς', 'έχετε', 'κατασκευάστε', 'ένα', 'πολύ', 'καλό', 'ιστότοπος', 'και', 'εγώ', 'αγαπώ', 'επισκέπτομαι', 'σας', 'ιστότοπος']


















