벤치마크 · 성능
성능 측정
서로 다른 단위의 workload를 분리하고 baseline과 candidate를 같은 환경에서 비교합니다.
workload
Morphology는 fresh process initialization, cases/s, p95와 RSS를 측정합니다. Query compile, matcher scan, 1 GiB file scan, npm startup과 TUI index는 별도 entrypoint를 사용합니다.
Lock 대기와 build 시간은 workload 시간에서 제외하지만 실행 환경과 binary revision에는 포함해 기록합니다.
통계
Warm-up 1회 뒤 5회 측정하고 median, min, max를 보고합니다. 단발 실행이나 smoke success는 성능 근거가 아닙니다.
Throughput, latency, seconds와 bytes를 같은 percent score로 합치지 않습니다.
회귀 판정
Baseline과 candidate는 같은 toolchain, resource, input checksum과 option을 사용합니다. 품질 projection을 함께 실행해 빠르지만 잘못된 candidate를 채택하지 않습니다.
불리한 증감과 noise 범위를 모두 보고하고 원인을 모르면 추정이라고 표시합니다.