Class LuceneRussianTokenizer

java.lang.Object
org.omegat.tokenizer.BaseTokenizer
org.omegat.tokenizer.LuceneRussianTokenizer
All Implemented Interfaces:
ITokenizer

public class LuceneRussianTokenizer extends BaseTokenizer
The LuceneRussianTokenizer class provides text tokenization specifically for the Russian language. This tokenizer utilizes the Lucene library and supports stemming and stop word filtering functionality based on the provided configuration.

It extends the BaseTokenizer class and overrides the base tokenization behavior to accommodate language-specific rules and features for Russian text.

  • Constructor Details

    • LuceneRussianTokenizer

      public LuceneRussianTokenizer()