Class LuceneBrazilianTokenizer

java.lang.Object
org.omegat.tokenizer.BaseTokenizer
org.omegat.tokenizer.LuceneBrazilianTokenizer
All Implemented Interfaces:
ITokenizer

public class LuceneBrazilianTokenizer extends BaseTokenizer
A tokenizer implementation for processing Brazilian Portuguese text with optional stemming and stop word removal capabilities. This class leverages Lucene's BrazilianAnalyzer and CharArraySet for tokenization tasks.

The behavior of the tokenizer is controlled via the method parameters and ensures that it is adaptable to a variety of text processing needs specific to Brazilian Portuguese.

  • Constructor Details

    • LuceneBrazilianTokenizer

      public LuceneBrazilianTokenizer()