Як завантажити та встановити NLTK

⚡ Розумний підсумок

Завантажте та встановіть NLTK на Windows, Mac або Linux, встановивши Python спочатку, а потім додавання натурального Language Toolкомплект через pip або Anaconda та завантаження наборів даних корпусу.

  • вимога: Встановлювати Python перед додаванням NLTK.
  • Установка: Використовуйте pip, easy_install або Anaconda.
  • 📚 Набори даних: Запустіть nltk.download() для отримання корпусів.
  • 🐍 Перевірити: імпортувати nltk у Python оболонки.
  • 🤖 Використання ШІ: Токенізація та тегування для NLP-конвеєрів.

Завантажте та встановіть NLTK

Встановлення NLTK в Windows

Дізнайтеся, як налаштувати NLTK на Windows з командного рядка. Наведені нижче інструкції передбачають Python ще не встановлено, тому першим кроком є ​​встановлення Python.

Установка Python in Windows

Крок 1) Відкрийте посилання https://www.python.org/downloads/, та виберіть найновішу Windows звільнення.

Установка Python in Windows

Примітка:: Щоб переглянути всі випуски старішої версії, перейдіть на вкладку Завантаження.

Установка Python in Windows

Крок 2) Клацніть завантажений файл інсталятора.

Установка Python in Windows

Крок 3) Виберіть «Налаштувати інсталяцію».

Установка Python in Windows

Крок 4) Натисніть ДАЛІ.

Установка Python in Windows

Крок 5) На наступному екрані:

  1. Виберіть розширені параметри.
  2. Вкажіть власне місце встановлення. У цьому прикладі для легшого доступу вибрано папку на диску C.
  3. Натисніть Установити.

Установка Python in Windows

Крок 6) Натисніть кнопку «Закрити» після завершення встановлення.

Установка Python in Windows

Крок 7) Скопіюйте шлях до вашої папки Scripts.

Установка Python in Windows

Крок 8) Перейдіть на вкладку Windows командний рядок:

  • Перейдіть до розташування папки pip.
  • Введіть команду для встановлення NLTK:
    pip3 install nltk
  • Інсталяція має завершитися успішно.

Установка Python in Windows

ПРИМІТКА: Для Python 2, скористайтеся командою pip2 install nltk.

Крок 9) Від Windows меню «Пуск», знайдіть і відкрийте Python Оболонка.

Установка Python in Windows

Крок 10) Перевірте, чи інсталяція працює, виконавши команду нижче:

import nltk

Установка Python in Windows

Якщо помилок не з'явилося, встановлення завершено.

Встановлення NLTK у Mac/Linux

Для встановлення NLTK на Mac або Linux потрібна Python менеджер пакетів pip. Якщо pip не встановлено, виконайте наведені нижче інструкції, щоб завершити процес.

Крок 1) Оновити індекс пакета за допомогою typing команда нижче:

sudo apt update

Крок 2) Встановити pip для Python 3:

sudo apt install python3-pip

Ви також можете встановити pip через easy_install:

sudo apt-get install python-setuptools  python-dev build-essential

Після встановлення easy_install виконайте команду нижче, щоб встановити pip:

sudo easy_install pip

Крок 3) Використайте таку команду для встановлення NLTK:

sudo pip install -U nltk
sudo pip3 install -U nltk

Встановлення NLTK через Anaconda

Крок 1) Встановіть Anaconda, відвідавши https://www.anaconda.com/products/individual та вибір Python потрібну вам версію.

Встановлення NLTK через Anaconda

Примітка. Зверніться до цього підручника, щоб отримати докладні кроки встановити Анаконду.

Крок 2) У командному рядку Anaconda:

  1. Введіть команду:
    conda install -c anaconda nltk
  2. RevПерегляньте інформацію про оновлення, зниження версії та встановлення пакета, а потім введіть «так».
  3. NLTK завантажено та встановлено.

Встановлення NLTK через Anaconda

Набір даних NLTK

Модуль NLTK постачається з багатьма наборами даних, які потрібно завантажити перед використанням. Технічно кожен набір даних називається тілоТипові приклади включають стоп-слова, Гутенберг, framenet_v15, великі_граматики, коричневий та ворднет.

Як завантажити всі пакети NLTK

Крок 1) Запустіть Python Перекладач in Windows або Linux.

Крок 2)

  1. Введіть команди:
import nltk
nltk.download ()
  1. Відкриється вікно завантажувача NLTK. Натисніть кнопку «Завантажити», щоб отримати набір даних. Цей процес займає певний час залежно від вашого інтернет-з’єднання.

Завантажте всі пакети NLTK

ПРИМІТКА: Ви можете змінити місце завантаження, натиснувши Файл > Змінити каталог завантажень.

Завантажте всі пакети NLTK

Крок 3) Щоб перевірити встановлені дані, використовуйте наступний код:

>>> from nltk.corpus import brown
>>>brown.words()

["The", "Fulton", "County", "Grand", "Jury", "said", …]

Завантажте всі пакети NLTK

Запуск сценарію НЛП

У цьому розділі пояснюється, як NLP-скрипт працює на локальному ПК. Вибір правильної бібліотеки залежить від ваших вимог. Див. офіційний список Бібліотеки НЛП для альтернатив, таких як spaCy, gensim та TextBlob.

Як запустити сценарій NLTK

Крок 1) У вашому улюбленому редакторі коду скопіюйте код і збережіть файл як NLTKsample.py:

from nltk.tokenize import RegexpTokenizer
tokenizer = RegexpTokenizer(r'\w+')
filterdText=tokenizer.tokenize('Hello Guru99, You have build a very good site and I love visiting your site.')
print(filterdText)

Запустіть сценарій NLTK

Code Пояснення:

  1. Мета цієї програми — видалити всі види пунктуації з заданого тексту. Ми імпортували «RegexpTokenizer», модуль НЛТК який видаляє будь-який вибраний вами вираз, символ, символ або числове значення.
  2. Регулярний вираз передається модулю «RegexpTokenizer».
  3. Текст токенізується за допомогою методу «tokenize», а результат зберігається у змінній «filterdText».
  4. Результат друкується за допомогою функції «print()».

Крок 2) У командному рядку:

  • Перейдіть до місця, де ви зберегли файл.
  • Запустіть команду python NLTKsample.py.

Запустіть сценарій NLTK

Вихід:

['Привіт', 'Guru99', 'Ви', 'маєте', 'побудувати', 'а', 'дуже', 'добре', 'сайт', 'і', 'я', 'люблю', 'відвідую', 'ваш', 'сайт']

Поширені запитання

Команда pip встановлює саму бібліотеку, тоді як nltk.download() отримує корпуси та навчені моделі, такі як стоп-слова, punkt та wordnet. Обидва кроки необхідні перед токенізацією або тегуванням тексту.

Так. NLTK залишається популярним для попередньої обробки тексту, який використовується в LLM, включаючи токенізацію, видалення стоп-слів, стеммінг та POS-тегування. Він також широко використовується у навчанні та дослідженнях завдяки своєму зрозумілому API та класичним корпусам.

NLTK найкраще підходить для вивчення основ НЛП. spaCy швидший для продакшену, тоді як Обійми трансформатори обличчя пропонує попередньо навчені моделі глибокого навчання. Багато проектів штучного інтелекту поєднують попередню обробку NLTK з трансформаторним виводом.

Підсумуйте цей пост за допомогою: