벤치마크 · 품질
표준문 품질
Canonical은 표준 맞춤법과 explicit POS에서 기본 형태 coverage와 hard negative precision을 측정합니다.
dataset
양성 500개는 명사, 대명사, 수사, 동사, 형용사, 관형사와 부사의 목표 span을 가집니다. 음성 500개는 같은 표면이 다른 형태 기능으로 쓰이는 hard negative를 포함합니다.
문장은 수동 검토한 표준문만 사용하고 오류 문장은 Robust로 분리합니다.
지표
Backend별 raw confusion matrix와 precision, recall, F1을 기록합니다. Contract review가 없으므로 adjusted matrix는 raw와 같고 reviewed cases는 0입니다.
D3 차트는 두 series를 모두 표시해 동일함을 숨기지 않습니다.
해석 한계
Canonical F1은 표준문 lemma search 품질이며 파일 scan 처리량이나 오류 문장 robustness를 포함하지 않습니다.
품사별 분모가 다르므로 작은 범주의 percent를 전체 결과와 단순 평균하지 않습니다.