NLTK Tokenize: tokenizador de palavras e frases com exemplo
โก Resumo Inteligente
O NLTK Tokenize divide textos longos em unidades menores chamadas tokens, uma etapa fundamental no processamento de linguagem natural. O conjunto de ferramentas fornece o word_tokenize para dividir frases em palavras e o sent_tokenize para dividir o texto em frases individuais.

O que รฉ tokenizaรงรฃo?
tokenization รฉ o processo pelo qual uma grande quantidade de texto รฉ dividida em partes menores chamadas tokens. Esses tokens sรฃo muito รบteis para encontrar padrรตes e sรฃo considerados uma etapa base para lematizaรงรฃo e lematizaรงรฃo. A tokenizaรงรฃo tambรฉm ajuda a substituir elementos de dados confidenciais por elementos de dados nรฃo confidenciais.
O processamento de linguagem natural รฉ usado para construir aplicativos como classificaรงรฃo de texto, chatbot inteligente, anรกlise sentimental, traduรงรฃo de idiomas, etc. Torna-se vital compreender o padrรฃo do texto para atingir o propรณsito declarado acima.
Por enquanto, nรฃo se preocupe com lematizaรงรฃo e lematizaรงรฃo, mas trate-as como etapas para limpeza de dados textuais usando PNL (processamento de linguagem natural). Discutiremos lematizaรงรฃo e lematizaรงรฃo posteriormente neste tutorial. Tarefas como Classificaรงรฃo de texto ou filtragem de spam faz uso de PNL junto com bibliotecas de aprendizagem profunda, como Keras e Tensorflow.
O kit de ferramentas Natural Language possui um mรณdulo NLTK muito importante tokenize frases que compreendem ainda submรณdulos
- palavra tokenizar
- tokenizaรงรฃo de frase
Tokenizaรงรฃo de palavras
Usamos o mรฉtodo palavra_tokenize() dividir uma frase em palavras. A saรญda da tokenizaรงรฃo de palavras pode ser convertida em Data Frame para melhor compreensรฃo do texto em aplicativos de aprendizado de mรกquina. Tambรฉm pode ser fornecido como entrada para outras etapas de limpeza de texto, como remoรงรฃo de pontuaรงรฃo, remoรงรฃo de caracteres numรฉricos ou lematizaรงรฃo. Os modelos de aprendizado de mรกquina precisam de dados numรฉricos para serem treinados e fazerem previsรตes. A tokenizaรงรฃo de palavras torna-se uma parte crucial da conversรฃo de texto (string) em dados numรฉricos. Por favor, leia sobre Saco de palavras ou CountVectorizer. Consulte o exemplo de tokenizaรงรฃo de palavras NLTK abaixo para entender melhor a teoria.
from nltk.tokenize import word_tokenize text = "God is Great! I won a lottery." print(word_tokenize(text)) Output: ['God', 'is', 'Great', '!', 'I', 'won', 'a', 'lottery', '.']
Code Explicaรงรฃo
- O mรณdulo word_tokenize รฉ importado da biblioteca NLTK.
- Uma variรกvel โtextoโ รฉ inicializada com duas sentenรงas.
- A variรกvel de texto รฉ passada no mรณdulo word_tokenize e imprime o resultado. Este mรณdulo divide cada palavra com pontuaรงรฃo que vocรช pode ver na saรญda.
Tokenizaรงรฃo de sentenรงas
O submรณdulo disponรญvel para o acima รฉ sent_tokenize. Uma pergunta รณbvia em sua mente seria por que a tokenizaรงรฃo de frases รฉ necessรกria quando temos a opรงรฃo de tokenizaรงรฃo de palavras. Imagine que vocรช precisa contar a mรฉdia de palavras por frase, como vocรช irรก calcular? Para realizar tal tarefa, vocรช precisa tanto do tokenizer de frase NLTK quanto do tokenizer de palavra NLTK para calcular a proporรงรฃo. Essa saรญda serve como um recurso importante para o treinamento da mรกquina, pois a resposta seria numรฉrica.
Verifique o exemplo do tokenizador NLTK abaixo para saber como a tokenizaรงรฃo de frases รฉ diferente da tokenizaรงรฃo de palavras.
from nltk.tokenize import sent_tokenize text = "God is Great! I won a lottery." print(sent_tokenize(text)) Output: ['God is Great!', 'I won a lottery ']
Nรณs temos 12 palavras e duas sentenรงas para a mesma entrada.
Explicaรงรฃo do programa
- Em uma linha como no programa anterior, importou o mรณdulo sent_tokenize.
- Tomamos a mesma sentenรงa. O tokenizador de frase adicional no mรณdulo NLTK analisou essas frases e mostrou a saรญda. ร claro que esta funรงรฃo quebra cada frase.
Acima do tokenizador de palavra Python exemplos sรฃo boas pedras de configuraรงรฃo para entender a mecรขnica da tokenizaรงรฃo de palavras e frases.


