Jak pobrać i zainstalować NLTK

⚡ Inteligentne podsumowanie

Pobierz i zainstaluj NLTK na Windows, Mac lub Linux poprzez instalację Python najpierw dodając Natural Language Toolkit poprzez pip lub Anacondę i pobranie zestawów danych korpusowych.

  • Wymaganie: Zainstalować Python przed dodaniem NLTK.
  • ⚙️ Zainstaluj: Użyj pip, easy_install lub Anaconda.
  • 📚 Zestawy danych: Uruchom nltk.download(), aby pobrać korpusy.
  • 🐍 Zweryfikować: importuj nltk w Python muszla.
  • 🤖 Wykorzystanie sztucznej inteligencji: Tokenizacja i tagowanie dla procesów NLP.

Pobierz i zainstaluj NLTK

Instalowanie NLTK w Windows

Dowiedz się, jak skonfigurować NLTK na Windows z wiersza poleceń. Poniższe instrukcje zakładają, Python nie jest jeszcze zainstalowany, więc pierwszym krokiem jest instalacja Python.

Instalacja Python in Windows

Krok 1) Otwórz link https://www.python.org/downloads/, i wybierz najnowszą Windows zwolnić.

Instalacja Python in Windows

Note: Aby pobrać starszą wersję, przejdź do zakładki Pobieranie, aby zobaczyć wszystkie wydania.

Instalacja Python in Windows

Krok 2) Kliknij pobrany plik instalatora.

Instalacja Python in Windows

Krok 3) Wybierz opcję Dostosuj instalację.

Instalacja Python in Windows

Krok 4) Kliknij DALEJ.

Instalacja Python in Windows

Krok 5) Na następnym ekranie:

  1. Wybierz opcje zaawansowane.
  2. Podaj niestandardową lokalizację instalacji. W tym przykładzie wybrano folder na dysku C, aby ułatwić dostęp.
  3. Kliknij Zainstaluj.

Instalacja Python in Windows

Krok 6) Po zakończeniu instalacji kliknij przycisk Zamknij.

Instalacja Python in Windows

Krok 7) Skopiuj ścieżkę do folderu Skrypty.

Instalacja Python in Windows

Krok 8) W Windows wiersz poleceń:

  • Przejdź do lokalizacji folderu pip.
  • Wprowadź polecenie, aby zainstalować NLTK:
    pip3 install nltk
  • Instalacja powinna zakończyć się pomyślnie.

Instalacja Python in Windows

UWAGA: Dla Python 2, użyj polecenia pip2 install nltk.

Krok 9) Z Windows Menu Start, wyszukaj i otwórz Python Muszla.

Instalacja Python in Windows

Krok 10) Sprawdź, czy instalacja przebiegła pomyślnie, uruchamiając poniższe polecenie:

import nltk

Instalacja Python in Windows

Jeżeli nie pojawi się żaden błąd, instalacja jest zakończona.

Instalowanie NLTK w systemie Mac/Linux

Do zainstalowania NLTK na komputerze Mac lub Linux wymagane jest: Python Menedżer pakietów pip. Jeśli pip nie jest zainstalowany, postępuj zgodnie z poniższymi instrukcjami, aby dokończyć proces.

Krok 1) Zaktualizuj indeks pakietów według typing polecenie poniżej:

sudo apt update

Krok 2) Zainstaluj pip dla Python 3:

sudo apt install python3-pip

Możesz również zainstalować pip poprzez easy_install:

sudo apt-get install python-setuptools  python-dev build-essential

Po zainstalowaniu easy_install uruchom poniższe polecenie, aby zainstalować pip:

sudo easy_install pip

Krok 3) Aby zainstalować NLTK, użyj następującego polecenia:

sudo pip install -U nltk
sudo pip3 install -U nltk

Instalowanie NLTK przez Anacondę

Krok 1) Zainstaluj Anacondę, odwiedzając https://www.anaconda.com/products/individual i wybierając Python wersja, której potrzebujesz.

Instalowanie NLTK przez Anacondę

Uwaga: szczegółowe instrukcje można znaleźć w tym samouczku zainstaluj Anacondę.

Krok 2) W wierszu poleceń Anacondy:

  1. Wprowadź polecenie:
    conda install -c anaconda nltk
  2. RevWyświetl informacje o aktualizacji, obniżeniu wersji i instalacji pakietu, a następnie wpisz „tak”.
  3. NLTK został pobrany i zainstalowany.

Instalowanie NLTK przez Anacondę

Zbiór danych NLTK

Moduł NLTK zawiera wiele zestawów danych, które należy pobrać przed użyciem. Technicznie rzecz biorąc, każdy zestaw danych nazywa się ciałoTypowe przykłady obejmują: pomijane słowa, Gutenberg, ramka_v15, duża_gramatyka, brązowy, wordnet.

Jak pobrać wszystkie pakiety NLTK

Krok 1) Uruchom Python interpretator in Windows lub Linux.

Krok 2)

  1. Wprowadź polecenia:
import nltk
nltk.download ()
  1. Otworzy się okno programu NLTK Downloader. Kliknij przycisk „Pobierz”, aby pobrać zestaw danych. Ten proces zajmuje trochę czasu i zależy od połączenia internetowego.

Pobierz wszystkie pakiety NLTK

UWAGA: Możesz zmienić lokalizację pobierania, klikając Plik > Zmień katalog pobierania.

Pobierz wszystkie pakiety NLTK

Krok 3) Aby przetestować zainstalowane dane, użyj następującego kodu:

>>> from nltk.corpus import brown
>>>brown.words()

[„The”, „Fulton”, „Hrabstwo”, „Wielki”, „Jury”, „powiedział”, …]

Pobierz wszystkie pakiety NLTK

Uruchamianie skryptu NLP

W tej sekcji wyjaśniono, jak skrypt NLP działa na komputerze lokalnym. Wybór odpowiedniej biblioteki zależy od Twoich wymagań. Zobacz oficjalną listę Biblioteki NLP dla alternatyw takich jak spaCy, gensim i TextBlob.

Jak uruchomić skrypt NLTK

Krok 1) W swoim ulubionym edytorze kodu skopiuj kod i zapisz plik jako NLTKsample.py:

from nltk.tokenize import RegexpTokenizer
tokenizer = RegexpTokenizer(r'\w+')
filterdText=tokenizer.tokenize('Hello Guru99, You have build a very good site and I love visiting your site.')
print(filterdText)

Uruchom skrypt NLTK

Code Wyjaśnienie:

  1. Celem tego programu jest usunięcie wszelkich znaków interpunkcyjnych z danego tekstu. Zaimportowaliśmy „RegexpTokenizer”, moduł NLTK która usuwa dowolne wybrane wyrażenie, symbol, znak lub wartość liczbową.
  2. Wyrażenie regularne jest przekazywane do modułu „RegexpTokenizer”.
  3. Tekst jest tokenizowany przy użyciu metody „tokenize”, a dane wyjściowe są przechowywane w zmiennej „filterdText”.
  4. Wynik drukowany jest za pomocą „print()”.

Krok 2) W wierszu poleceń:

  • Przejdź do lokalizacji, w której zapisałeś plik.
  • Uruchom polecenie python NLTKsample.py.

Uruchom skrypt NLTK

Wynik to:

['Cześć', 'Guru99', 'Ty', 'masz', 'budować', 'bardzo', 'dobry', 'miejsce', 'i', 'ja', 'kocham', 'odwiedzam', 'twoje', 'miejsce']

FAQ

Polecenie pip instaluje samą bibliotekę, natomiast nltk.download() pobiera korpusy i wytrenowane modele, takie jak stopwords, punkt i wordnet. Oba kroki są wymagane przed tokenizacją lub tagowaniem tekstu.

Tak. NLTK pozostaje popularny do wstępnego przetwarzania tekstu przeznaczonego na potrzeby LLM, w tym tokenizacji, usuwania słów pomijanych, stemmingu i tagowania POS. Jest również szeroko stosowany w nauczaniu i badaniach dzięki przejrzystemu interfejsowi API i klasycznym korpusom.

NLTK jest najlepszy do nauki podstaw NLP. spaCy jest szybszy w produkcji, podczas gdy Przytulanie transformatorów twarzy Oferuje wstępnie wytrenowane modele głębokiego uczenia. Wiele projektów AI łączy wstępne przetwarzanie NLTK z wnioskowaniem transformatorowym.

Podsumuj ten post następująco: