Class LuceneCJKTokenizer

java.lang.Object
org.omegat.tokenizer.BaseTokenizer
org.omegat.tokenizer.LuceneCJKTokenizer
All Implemented Interfaces:
ITokenizer

public class LuceneCJKTokenizer extends BaseTokenizer
Tokenizer implementation specifically designed for processing CJK (Chinese, Japanese, Korean) text. It extends the BaseTokenizer to provide tokenization functionality tailored for CJK languages.

This tokenizer utilizes specific analysis tools like CJKAnalyzer, CJKBigramFilter, CJKWidthFilter, and LowerCaseFilter to process and create tokens suitable for CJK text indexing and searching.

  • Constructor Details

    • LuceneCJKTokenizer

      public LuceneCJKTokenizer()