Documentation
¶
Overview ¶
Java Object Serialization 스트림 리더 — KOMORAN 모델 파일이 쓰는 서브셋만 지원. 트라이 구조는 블록데이터(writeChar/writeInt), 노드 값은 TC_OBJECT 그래프로 인코딩되어 있다 (AhoCorasickNode.save 참고).
Komoran 분석기 포팅 (KOMORAN 3.3.7 core.Komoran). Tokenize는 Scala NLPManager.tokenizer(= analyze(trim).getTokenList의 morph 나열)와 동일한 출력을 낸다.
Lattice 포팅 (KOMORAN 3.3.7 core.model.Lattice). analyze는 항상 nbest=1이라 n-best 분기는 구현하지 않았다.
KOMORAN 모델 파일 로딩 (pos.table, transition.model, observation.model, irregular.model).
AhoCorasickDictionary 포팅 (shineware aho-corasick 1.1.0).
KoreanUnitParser 포팅. Java String과 인덱스가 1:1이 되도록 문자열을 UTF-16 코드 유닛([]uint16)으로 다룬다 — BMP 밖 문자도 Java처럼 서로게이트 쌍 2유닛으로 처리된다.
Index ¶
Constants ¶
This section is empty.
Variables ¶
This section is empty.
Functions ¶
This section is empty.
Types ¶
type IrregularNode ¶
type Komoran ¶
type Komoran struct {
// contains filtered or unexported fields
}
Komoran은 형태소 분석기다. 분석은 불변 리소스만 읽어 동시 사용이 안전하고, 사용자 사전 교체는 락으로 보호된다.
func (*Komoran) SetUserDictEntries ¶
SetUserDictEntries는 기동 시점 사용자 사전을 교체한다.
type Tokenizer ¶
type Tokenizer struct {
// contains filtered or unexported fields
}
Tokenizer는 Tokenize(string) []string 형태의 토크나이저 어댑터다.
func NewTokenizer ¶
NewTokenizer는 내장 FULL 모델로 토크나이저를 만든다. userDictPath 파일이 있으면 사용자 사전으로 로드하고, 없으면 스킵한다(Scala NLPManager와 동일). 파일이 존재하는데 읽지 못하면 잘못된 토크나이징으로 기동하지 않도록 실패한다.