NLTK Tokenize: Ord og setninger Tokenizer med eksempel
โก Smart oppsummering
NLTK Tokenize deler stor tekst inn i mindre enheter kalt tokens, et grunnleggende trinn i naturlig sprรฅkbehandling. Verktรธysettet inneholder word_tokenize for รฅ dele setninger inn i ord og sent_tokenize for รฅ dele tekst inn i individuelle setninger.

Hva er tokenisering?
tokenization er prosessen der en stor mengde tekst deles inn i mindre deler kalt tokens. Disse tokenene er svรฆrt nyttige for รฅ finne mรธnstre og betraktes som et basistrinn for stemming og lemmatisering. Tokenisering bidrar ogsรฅ til รฅ erstatte sensitive dataelementer med ikke-sensitive dataelementer.
Naturlig sprรฅkbehandling brukes til รฅ bygge applikasjoner som tekstklassifisering, intelligent chatbot, sentimental analyse, sprรฅkoversettelse, etc. Det blir viktig รฅ forstรฅ mรธnsteret i teksten for รฅ oppnรฅ det ovennevnte formรฅlet.
Forelรธpig ikke bekymre deg for stemming og lemmatisering, men behandle dem som trinn for rensing av tekstdata ved hjelp av NLP (Natural Language Processing). Vi vil diskutere stemming og lemmatisering senere i opplรฆringen. Oppgaver som f.eks Tekstklassifisering eller spamfiltrering bruker NLP sammen med dyplรฆringsbiblioteker som Keras og tensorflow.
Natural Language Toolkit har en svรฆrt viktig modul NLTK symbolisere setninger som videre bestรฅr av undermoduler
- ord tokenize
- setning tokenize
Tokenisering av ord
Vi bruker metoden word_tokenize() รฅ dele en setning i ord. Utdataene fra ordtokenisering kan konverteres til Data Frame for bedre tekstforstรฅelse i maskinlรฆringsapplikasjoner. Den kan ogsรฅ gis som input for ytterligere tekstrensetrinn, for eksempel fjerning av tegnsetting, fjerning av numeriske tegn eller stemming. Maskinlรฆringsmodeller trenger numeriske data for รฅ trenes opp og gi en prediksjon. Ordtokenisering blir en avgjรธrende del av teksten (strengen) til konvertering av numeriske data. Vennligst les om Bag of Words eller CountVectorizer. Vennligst referer til ordet tokenize NLTK-eksemplet nedenfor for รฅ forstรฅ teorien bedre.
from nltk.tokenize import word_tokenize text = "God is Great! I won a lottery." print(word_tokenize(text)) Output: ['God', 'is', 'Great', '!', 'I', 'won', 'a', 'lottery', '.']
Code Forklaring
- word_tokenize-modulen er importert fra NLTK-biblioteket.
- En variabel "tekst" initialiseres med to setninger.
- Tekstvariabel sendes i word_tokenize-modulen og skrives ut resultatet. Denne modulen bryter hvert ord med tegnsetting som du kan se i utdataene.
Tokenisering av setninger
Undermodulen tilgjengelig for ovennevnte er sent_tokenize. Et รฅpenbart spรธrsmรฅl i tankene dine ville vรฆre hvorfor setningstokenisering er nรธdvendig nรฅr vi har muligheten til ordtokenisering. Tenk deg at du trenger รฅ telle gjennomsnittlige ord per setning, hvordan vil du beregne det? For รฅ utfรธre en slik oppgave trenger du bรฅde NLTK setningstokenizer sรฅ vel som NLTK ordtokenizer for รฅ beregne forholdet. Slik utgang fungerer som en viktig funksjon for maskinopplรฆring, da svaret ville vรฆre numerisk.
Sjekk eksemplet under NLTK-tokenizer for รฅ lรฆre hvordan setningstokenisering er forskjellig fra ordtokenisering.
from nltk.tokenize import sent_tokenize text = "God is Great! I won a lottery." print(sent_tokenize(text)) Output: ['God is Great!', 'I won a lottery ']
Vi har 12 ord og to setninger for samme inngang.
Forklaring av programmet
- I en linje som det forrige programmet, importerte modulen sent_tokenize.
- Vi har tatt samme setning. Ytterligere setningstokenizer i NLTK-modulen analyserte setningene og viser utdata. Det er tydelig at denne funksjonen bryter hver setning.
Overordet tokenizer Python eksempler er gode settingsteiner for รฅ forstรฅ mekanikken i ordet og setningstokenisering.


