Package org.omegat.tokenizer
Class LuceneDanishTokenizer
java.lang.Object
org.omegat.tokenizer.BaseTokenizer
org.omegat.tokenizer.LuceneDanishTokenizer
- All Implemented Interfaces:
ITokenizer
The LuceneDanishTokenizer class extends the BaseTokenizer and provides
tokenization functionality for Danish language text processing. It uses
the Lucene DanishAnalyzer to handle language-specific tokenization,
including stemming and stop words, when enabled.
This tokenizer is marked as the default tokenizer for Danish ("da") language support and works with customizable options for stemming and stop word removal.
-
Nested Class Summary
Nested classes/interfaces inherited from interface org.omegat.tokenizer.ITokenizer
ITokenizer.StemmingMode -
Field Summary
Fields inherited from class org.omegat.tokenizer.BaseTokenizer
TOKENIZER_DEBUG_PROVIDER -
Constructor Summary
Constructors -
Method Summary
Methods inherited from class org.omegat.tokenizer.BaseTokenizer
getSupportedLanguages, tokenizeVerbatim, tokenizeVerbatimToStrings, tokenizeWords, tokenizeWordsToStrings
-
Constructor Details
-
LuceneDanishTokenizer
public LuceneDanishTokenizer()
-