lingtools.tokenizer_nltk module¶
-
class
lingtools.tokenizer_nltk.NLTKTokenizer(language, encoding, simple_tokenizer)[source]¶ Bases:
objectUtility class to tokenize and tag documents. By default uses NLTK, but it is possible to use also a running Stanford POS Tagger server.
Parameters: - language – Choose between ‘english’, ‘dutch’, ‘russian’. Default: ‘english’
- encoding – Incoming text encoding. Default: utf-8
- simple_tokenizer – Use a simple white space tokenizer
-
get_deep_structure_paragraph(input_document, lowercase, remove_punctuation)[source]¶ Converts a raw paragraph into a list of sentences with a list of tagged tokens
Parameters: - input_document – Raw document (unicode)
- lowercase – boolean. If true, words will be converted to lowercase. Default: False
- remove_punctuation – boolean. If true, punctuation will be removed. Default: False