벤치마크 · 품질
오류 문장 품질
오류 데이터셋
전체 500 case는 positive 250개와 negative 250개로 구성됩니다. 한글 오타, 띄어쓰기 분리, 비표준 통사와 외국어 텍스트 오타를 원문 그대로 보존합니다.
표준문 gold와 별도 fixture이며 Canonical 점수에 합산하지 않습니다.
오류 분류
Positive 가운데 100건은 오류 표식이 gold token에 직접 걸린 target-span입니다. 나머지 150건은 오류가 다른 token에만 있는 context-only입니다. Negative 250건은 context-only 분모에 포함합니다.
두 범위의 recall을 따로 보면 형태 core 손상과 주변 noise 내성을 구분할 수 있습니다.
분리 보고
모든 backend에 raw와 adjusted confusion matrix를 기록합니다. Contract review가 없으므로 두 값은 같으며 review는 0건입니다.
Robust 설정은 모든 오류를 교정하지 않습니다. 각 backend가 실제로 받은 입력과 옵션을 원본 보고서에 보존합니다.