Sådan downloader og installerer du NLTK

⚡ Smart opsummering

Download og installer NLTK på Windows, Mac eller Linux ved at installere Python først, derefter tilsættes det naturlige Language Toolkit via pip eller Anaconda og download af corpus-datasættene.

  • Krav: Installer Python før du tilføjer NLTK.
  • 🇧🇷 Installer: Brug pip, easy_install eller Anaconda.
  • 📚 Datasæt: Kør nltk.download() for at hente corpora.
  • 🐍 Verificere: importer nltk i Python skal.
  • 🤖 AI-brug: Tokenisering og tagging til NLP-pipelines.

Download og installer NLTK

Installerer NLTK i Windows

Lær hvordan du konfigurerer NLTK Windows fra kommandoprompten. Instruktionerne nedenfor forudsætter Python er ikke installeret endnu, så det første trin er at installere Python.

Installation Python in Windows

Trin 1) Åbn linket https://www.python.org/downloads/, og vælg den nyeste Windows frigive.

Installation Python in Windows

BemærkFor en ældre version, besøg fanen Downloads for at se alle udgivelser.

Installation Python in Windows

Trin 2) Klik på den downloadede installationsfil.

Installation Python in Windows

Trin 3) Vælg Tilpas installation.

Installation Python in Windows

Trin 4) Klik på NÆSTE.

Installation Python in Windows

Trin 5) På det næste skærmbillede:

  1. Vælg de avancerede indstillinger.
  2. Angiv en brugerdefineret installationsplacering. I dette eksempel er en mappe på C-drevet valgt for at give nemmere adgang.
  3. Klik på Installer.

Installation Python in Windows

Trin 6) Klik på knappen Luk, når installationen er færdig.

Installation Python in Windows

Trin 7) Kopier stien til din Scripts-mappe.

Installation Python in Windows

Trin 8) I Windows kommandoprompt:

  • Naviger til placeringen af ​​pip-mappen.
  • Indtast kommandoen for at installere NLTK:
    pip3 install nltk
  • Installationen skulle gerne være fuldført.

Installation Python in Windows

BEMÆRK: Til Python 2, brug kommandoen pip2 install nltk.

Trin 9) På hjemmesiden for oprettelse af en konto skal du indtaste postnummeret for dit service-eller faktureringsområde i feltet, der er markeret (A) på billedet ovenfor. Windows Startmenuen, søg efter og åbn Python Skal.

Installation Python in Windows

Trin 10) Bekræft at installationen fungerer ved at køre kommandoen nedenfor:

import nltk

Installation Python in Windows

Hvis der ikke vises nogen fejl, er installationen fuldført.

Installation af NLTK i Mac/Linux

Installation af NLTK på Mac eller Linux kræver Python pakkehåndtering pip. Hvis pip ikke er installeret, skal du følge instruktionerne nedenfor for at fuldføre processen.

Trin 1) Opdater pakkeindekset af typing kommandoen nedenfor:

sudo apt update

Trin 2) Installer pip til Python 3:

sudo apt install python3-pip

Du kan også installere pip via easy_install:

sudo apt-get install python-setuptools  python-dev build-essential

Når easy_install er installeret, skal du køre kommandoen nedenfor for at installere pip:

sudo easy_install pip

Trin 3) Brug følgende kommando til at installere NLTK:

sudo pip install -U nltk
sudo pip3 install -U nltk

Installation af NLTK gennem Anaconda

Trin 1) Installer Anaconda ved at besøge https://www.anaconda.com/products/individual og vælge Python version du har brug for.

Installation af NLTK gennem Anaconda

Bemærk: Se denne vejledning for detaljerede trin til Installer Anaconda.

Trin 2) I Anaconda-prompten:

  1. Indtast kommandoen:
    conda install -c anaconda nltk
  2. RevSe oplysningerne om pakkeopgradering, nedgradering og installation, og skriv derefter ja.
  3. NLTK er downloadet og installeret.

Installation af NLTK gennem Anaconda

NLTK datasæt

NLTK-modulet leveres med mange datasæt, som du skal downloade før brug. Teknisk set kaldes hvert datasæt et corpusAlmindelige eksempler inkluderer stopord, Gutenberg, rammenet_v15, store_grammatikker, brunog wordnet.

Sådan downloader du alle NLTK-pakker

Trin 1) Kør Python tolk in Windows eller Linux.

Trin 2)

  1. Indtast kommandoerne:
import nltk
nltk.download ()
  1. NLTK Downloader-vinduet åbnes. Klik på knappen Download for at hente datasættet. Denne proces tager tid afhængigt af din internetforbindelse.

Download alle pakker af NLTK

BEMÆRK VENLIGST: Du kan ændre downloadplaceringen ved at klikke på Filer > Skift downloadmappe.

Download alle pakker af NLTK

Trin 3) For at teste de installerede data skal du bruge følgende kode:

>>> from nltk.corpus import brown
>>>brown.words()

['The', 'Fulton', 'County', 'Grand', 'Jury', 'sagde', …]

Download alle pakker af NLTK

Kørsel af NLP-scriptet

Dette afsnit forklarer, hvordan et NLP-script kører på en lokal pc. Det rigtige biblioteksvalg afhænger af dine behov. Se den officielle liste over NLP biblioteker for alternativer som spaCy, gensim og TextBlob.

Sådan kører du NLTK-script

Trin 1) Kopier koden i dit yndlingskodeeditor, og gem filen som NLTKsample.py:

from nltk.tokenize import RegexpTokenizer
tokenizer = RegexpTokenizer(r'\w+')
filterdText=tokenizer.tokenize('Hello Guru99, You have build a very good site and I love visiting your site.')
print(filterdText)

Kør NLTK Script

Code Forklaring:

  1. Formålet med dette program er at fjerne alle former for tegnsætning fra en given tekst. Vi importerede "RegexpTokenizer", et modul af NLTK der fjerner ethvert udtryk, symbol, tegn eller numerisk værdi, du vælger.
  2. Et regulært udtryk sendes til modulet “RegexpTokenizer”.
  3. Teksten tokeniseres ved hjælp af "tokenize"-metoden, og outputtet gemmes i variablen "filterdText".
  4. Resultatet udskrives ved hjælp af “print()”.

Trin 2) I kommandoprompten:

  • Naviger til den placering, hvor du gemte filen.
  • Kør kommandoen python NLTKsample.py.

Kør NLTK Script

Udgangen er:

['Hej', 'Guru99', 'Du', 'har', 'bygge', 'en', 'meget', 'god', 'sted', 'og', 'jeg', 'elsker', 'besøger', 'din', 'sted']

Ofte Stillede Spørgsmål

pip-kommandoen installerer selve biblioteket, mens nltk.download() henter korpora og trænede modeller såsom stopord, punkt og wordnet. Begge trin er nødvendige, før man kan tokenisere eller tagge tekst.

Ja. NLTK er fortsat populært til forbehandling af tekst, der føder LLM'er, herunder tokenisering, fjernelse af stopord, stemming og POS-tagging. Det bruges også i vid udstrækning i undervisning og forskning takket være dets klare API og klassiske korpus.

NLTK er bedst til at lære NLP-grundprincipper. spaCy er hurtigere til produktion, mens Krammede ansigtstransformere tilbyder prætrænede deep-learning-modeller. Mange AI-projekter kombinerer NLTK-forbehandling med transformerinferens.

Opsummer dette indlæg med: