Как да изтеглите и инсталирате NLTK

⚡ Умно обобщение

Изтеглете и инсталирайте NLTK на Windows, Mac или Linux чрез инсталиране Python първо, след това добавяне на естествения Language Toolкомплект чрез pip или Anaconda и изтегляне на корпусните набори от данни.

  • изискване: Инсталирайте Python преди да добавите NLTK.
  • Инсталирайте: Използвайте pip, easy_install или Anaconda.
  • ???? Набори от данни: Изпълнете nltk.download(), за да извлечете корпуси.
  • 🐍 Проверете: импортиране на nltk в Python черупка.
  • 🤖 Използване на изкуствен интелект: Токенизация и маркиране за NLP конвейери.

Изтеглете и инсталирайте NLTK

Инсталиране на NLTK в Windows

Научете как да настроите NLTK на Windows от командния ред. Инструкциите по-долу предполагат Python все още не е инсталиран, така че първата стъпка е да го инсталирате Python.

Инсталиране Python in Windows

Стъпка 1) Отворете връзката https://www.python.org/downloads/, и изберете най-новото Windows освободите.

Инсталиране Python in Windows

ЗабележкаЗа по-стара версия посетете раздела „Изтегляния“, за да видите всички издания.

Инсталиране Python in Windows

Стъпка 2) Щракнете върху изтегления инсталационен файл.

Инсталиране Python in Windows

Стъпка 3) Изберете Персонализиране на инсталацията.

Инсталиране Python in Windows

Стъпка 4) Щракнете върху СЛЕДВАЩИЯ.

Инсталиране Python in Windows

Стъпка 5) На следващия екран:

  1. Изберете разширените опции.
  2. Предоставете персонализирано място за инсталиране. В този пример е избрана папка на C устройство за по-лесен достъп.
  3. Щракнете върху Инсталирай.

Инсталиране Python in Windows

Стъпка 6) Щракнете върху бутона Затвори, след като инсталацията приключи.

Инсталиране Python in Windows

Стъпка 7) Копирайте пътя на вашата папка Scripts.

Инсталиране Python in Windows

Стъпка 8) в Windows команден ред:

  • Отидете до местоположението на папката pip.
  • Въведете командата за инсталиране на NLTK:
    pip3 install nltk
  • Инсталацията би трябвало да завърши успешно.

Инсталиране Python in Windows

ЗАБЕЛЕЖКА: За Python 2, използвайте командата pip2 install nltk.

Стъпка 9) От Windows менюто „Старт“, потърсете и отворете Python Черупка.

Инсталиране Python in Windows

Стъпка 10) Проверете дали инсталацията работи, като изпълните командата по-долу:

import nltk

Инсталиране Python in Windows

Ако не се появи грешка, инсталацията е завършена.

Инсталиране на NLTK в Mac/Linux

Инсталирането на NLTK на Mac или Linux изисква Python мениджър на пакети pip. Ако pip не е инсталиран, следвайте инструкциите по-долу, за да завършите процеса.

Стъпка 1) Актуализирайте индекса на пакетите от typing командата по-долу:

sudo apt update

Стъпка 2) Инсталирайте pip за Python 3:

sudo apt install python3-pip

Можете също да инсталирате pip чрез easy_install:

sudo apt-get install python-setuptools  python-dev build-essential

След като easy_install е инсталиран, изпълнете командата по-долу, за да инсталирате pip:

sudo easy_install pip

Стъпка 3) Използвайте следната команда, за да инсталирате NLTK:

sudo pip install -U nltk
sudo pip3 install -U nltk

Инсталиране на NLTK чрез Anaconda

Стъпка 1) Инсталирайте Anaconda, като посетите https://www.anaconda.com/products/individual и избиране на Python версията, от която се нуждаете.

Инсталиране на NLTK чрез Anaconda

Забележка: Вижте този урок за подробни стъпки за инсталирайте Анаконда.

Стъпка 2) В подканата на Anaconda:

  1. Въведете командата:
    conda install -c anaconda nltk
  2. RevВижте информацията за надграждане, понижаване на версията и инсталиране на пакета, след което въведете „да“.
  3. NLTK е изтеглен и инсталиран.

Инсталиране на NLTK чрез Anaconda

Набор от данни NLTK

Модулът NLTK се доставя с много набори от данни, които трябва да изтеглите преди употреба. Технически, всеки набор от данни се нарича сборникЧесто срещани примери включват стоп думи, Гутенберг, framenet_v15, големи_граматики, кафяв, и уорднет.

Как да изтеглите всички пакети на NLTK

Стъпка 1) Стартирайте Python преводач in Windows или Linux.

Стъпка 2)

  1. Въведете командите:
import nltk
nltk.download ()
  1. Отваря се прозорецът на NLTK Downloader. Щракнете върху бутона „Изтегляне“, за да изтеглите набора от данни. Този процес отнема време в зависимост от вашата интернет връзка.

Изтеглете всички пакети на NLTK

ЗАБЕЛЕЖКА: Можете да промените местоположението за изтегляне, като щракнете върху Файл > Промяна на директорията за изтегляне.

Изтеглете всички пакети на NLTK

Стъпка 3) За да тествате инсталираните данни, използвайте следния код:

>>> from nltk.corpus import brown
>>>brown.words()

[„The“, „Fulton“, „County“, „Grand“, „Jury“, „said“, …]

Изтеглете всички пакети на NLTK

Изпълнение на НЛП скрипта

Този раздел обяснява как се изпълнява NLP скрипт на локален компютър. Изборът на правилната библиотека зависи от вашите изисквания. Вижте официалния списък с НЛП библиотеки за алтернативи като spaCy, gensim и TextBlob.

Как да стартирате NLTK скрипт

Стъпка 1) В любимия си редактор на код копирайте кода и запазете файла като NLTKsample.py:

from nltk.tokenize import RegexpTokenizer
tokenizer = RegexpTokenizer(r'\w+')
filterdText=tokenizer.tokenize('Hello Guru99, You have build a very good site and I love visiting your site.')
print(filterdText)

Стартирайте NLTK скрипт

Code Обяснение:

  1. Целта на тази програма е да премахне всякакъв вид препинателни знаци от даден текст. Импортирахме „RegexpTokenizer“, модул на NLTK който премахва всеки израз, символ, знак или числова стойност, която изберете.
  2. На модула „RegexpTokenizer“ се предава регулярен израз.
  3. Текстът се токенизира с помощта на метода „tokenize“, а резултатът се съхранява в променливата „filterdText“.
  4. Резултатът се отпечатва с помощта на „print()“.

Стъпка 2) В командния ред:

  • Отидете до мястото, където сте запазили файла.
  • Стартирайте командата python NLTKsample.py.

Стартирайте NLTK скрипт

Резултатът е:

[„Здравей“,Guru99', 'Вие', 'имате', 'изграждате', 'един', 'много', 'добър', 'място', 'и', 'аз', 'обичам', 'посещавам', 'вашия', 'място']

Въпроси и Отговори

Командата pip инсталира самата библиотека, докато nltk.download() извлича корпуси и обучени модели като стоп-думи, punkt и wordnet. И двете стъпки са необходими преди токенизиране или маркиране на текст.

Да. NLTK остава популярен за предварителна обработка на текст, който захранва LLM, включително токенизация, премахване на стоп-думи, stemming и POS тагване. Той също така се използва широко в преподаването и научните изследвания благодарение на ясния си API и класическите корпуси.

NLTK е най-подходящ за изучаване на основите на НЛП. spaCy е по-бърз за продуктивност, докато Прегръщащи се лица трансформатори предлага предварително обучени модели за дълбоко обучение. Много проекти с изкуствен интелект комбинират предварителна обработка на NLTK с трансформаторен извод.

Обобщете тази публикация с: