2.2. Sampling and analysis
분석에 사용된 시료는 2017년 5월 16일부터 2018년 11 월 23일까지 연구대상 보의 상류 500 m 지점 중앙의 상층· 중층·하층에서 채취하였다.
백제보는 총 35회(105개 시료), 죽산보는 총 37회(111개 시료)의 실험이 이루어졌다. 시료 는 Van Dorn 채취기를 사용하여, 하천 중앙의
상층, 중층, 하층에서 각각 채취하였다. 수온(Temp, °C), pH, 용존산소 (DO, mg/L), 전기전도도(EC, μS/cm)는 시료 채취
시 현장에 서 다항목 수질측정기(YSI-EXO, YSI-6600, YSI Pro plus) 를 사용하여 수심별로 측정하였으며, 센서들에 대한 보정은
주간 단위로 실시하였다. 채취된 시료는 4 °C 이하로 보관 하여 실험실로 운반한 후, 수질오염공정시험기준(ME, 2017) 에 따라 분석하였다.
조류 종별 세포수 분석을 위한 시료는 Lugol 용액으로 현 장에서 조류를 고정한 후 시료를 실험실로 운반하여, 수질 오염공정시험기준(ME, 2017)의 “식물성플랑크톤-현미경계 수법(ES 04705.1b)”에 준하여 분석하였다. 다만 Microcystis 의 경우 colony를 형성하여 불균일하게 분포함으로써 계수 결과에 오차를 유발하기 때문에 일정량의 용액으로부터 Microcystis colony를 분리하여 별도로 계수하였다.
기상자료는 기상청의 기상자료개방포털에서 과업 구간 내에 위치한 종합기상관측소, 방재기상관측소를 대상으로 수집하였으며, 대상 지점은 금강 1개소, 영산강
2개소이며, 강수량(mm) 자료를 수집하였다. 유량자료는 K-water 물정 보포털에서 제공하는 보별 수문자료를 수집하였다.
2.3. Statistical analyses
본 연구의 연구절차는 Fig. 2와 같이 단계별로 수행되었 으며 최종적으로 각 보별 남조류 우점 환경을 종합적으로 평가하였다. 남조류(Cyano), 녹조류(Green), 규조류(Diatom)
세포수 밀도 및 Chl-a 농도는 환경요인과의 교차 상관성 분석을 실시하였다. 분석에 사용한 현장 측정 항목은 수온, DO, EC이며, 물리적 인자는
7일 평균 유량(Q7day), 7일 누적강우량(APRCP7), ΔT(상·하층 수온차)이다. 영양염류 는 TP (Total Phosphorus), TN
(Total Nitrogen), NH3-N, NO3-N, 유기물 및 미량 물질은 BOD (Biochemical Oxygen Demand), COD (Chemical Oxygen Demand), TOC
(Total Organic Carbon), Fe, SiO2를 포함하였다. 순간 유량을 사용 하지 않고 Q7day를 사용한 것은 호주의 남동쪽에 위치한 하 천에서 수행한 선행연구(Mitrovic et al,. 2003; Sherman et al., 1998) 결과에서, 보 구간의 남조류 우점이 지속적인 유 량의 감소와 수온성층 형성이 원인이라는 것을 참고하였다.
Fig. 2. The overall processes of this study.
남조류가 우점하는 환경의 중요변수를 평가하기 위해 SMLR 모델과 앙상블(Ensemble) 학습기법 중 RF기법을 사용하였다. 분석에 사용된 종속변수는
남조류 우점도(C. dominance)이며 독립변수는 Temp, DO, EC, Q7day, APRCP7, ΔT, pH, NO3-N, NH3-N, TN, PO4-P, Fe이다. C.dominance는 전체 조류 세포수 밀도에 대한 남조류 세포 수 밀도의 비로써 남조류 우점에 의한 녹조발생의 위험도 를 간접적으로
나타낸다.
SMLR은 단계적 전진 방법을 적용하였으며, 모델에 사용 하는 첫 번째 변수는 종속변수와 상관성이 가장 큰 독립변 수를 선택한다. 다음 변수도 상관성이
큰 독립변수가 순차 적으로 적용되며, 진입 기준에 만족하는 변수가 없으면 프 로시저는 중단된다(Chung et al., 2014). 분석결과는 결정계 수(R2), RMSE (Root Mean Square Error), Mallows의 CP 통 계량, AIC (Akaike Information Criterion)을
사용하여 평가 하였다. SMLR 결과는 RF 모델 결과와 비교를 통해 남조류 우점과 관계가 높은 중요 변수를 선정하는데 활용되었다.
RF 모델은 여러 의사결정나무 모델의 예측 결과들을 종 합하여 정확도를 높이는 앙상블 학습 기법으로, 분류는 투 표(voting), 회귀는 평균(averaging)으로
결과를 산출한다 (Breiman, 2001). RF 모델의 적용 절차는 탐색적 데이터 분석(Exploratory Data Analysis, EDA), 즉 데이터 수집, 정 렬 및 결측값 처리
등과 같은 전처리 작업 수행 후에 결과 를 추정하였다. 또한 RF 모델 개발과정 중 과적합을 방지 하고 예측성능을 평가하기 위해 k-fold 교차
검정(Cross validation)을 10-fold, 3회 반복으로 실시하였다. RF 모델은 목표변수의 값을 예측하기 위해 의사결정나무 모형을 최대
몇 개 사용할 것인지(ntree), 의사결정나무의 각 마디에서 설 명변수를 몇 개 로 할 것인지(mtry) 등을 연구자가 직접 선 택하여야 한다.
RF 모델의 ntree 값은 Breiman and Cutler (2015)에 따라 초기값인 500으로 설정하였으며, mtry는 Liaw and Wiener (2002)에 의한 방법에 의해 결정하였다. mtry 의 개수는 백제보는 2 ~ 4개, 죽산보는 2 ~ 5개까지 설정하 여 RF 모델에 적용하였다. 모의결과
예측 오차는 mtry가 증가할수록 감소하였으며, 백제보는 mtry가 4개인 모델에 서 RMSE 값이 0.077 %, 죽산보는 mtry가 5개인 모델에서
RMSE 값이 0.066 %로 가장 낮은 편차를 보여, 최종 매개 변수로 선정하였다.
최소의 변수로 예측 성능이 가장 좋은 RF 모델을 만들기 위해 RFE 기법을 사용하였으며, C.dominance 예측에 사용 한 독립변수는 ΔT,
Temp, EC, Q7day, APRCP7, TOC, TP, PO4-P, TN, Fe이다. RFE는 Backward 방식 중 하나로, 변수 중 중요도가 낮은 변수를 하나씩 제거하는 방법이다.
RF 모델을 이용한 남조류 우점과 관련된 중요 변수 추출 과 함께, 남조류 우점도가 높은 환경조건을 확인하기 위해 의사결정나무(Decision Tree,
이하 DT) 분석을 실시하였다. 분석에 사용된 종속변수는 C.dominance이며 설명변수는 RF 모델 중요도 평가 결과를 바탕으로 선정된 변수들을
적용 하였다. DT 모델은 각 변수를 이분화 하는 과정을 반복하 여 나무모형을 형성하며, 종속변수가 범주형인 경우 분류, 연속형인 경우 회귀분석을
수행한다. 독립변수들은 범주형 또는 연속형 모두에 적용될 수 있으며 이 과정을 반복한 후 적절한 나무모형을 찾기 위한 가지치기(Pruning)를 통해
최종모형을 선택한다. 본 연구에서 DT 모델은 R프로그램 의 rpart package (Breiman et al., 1984)를 사용하였고, RF 모델은 randomForest package(Breiman and Cutler, 2015)를 사용하였다.
녹조 발생에 영향을 미치는 환경요인의 군집분석을 위해 주성분분석(Principal component analysis, PCA)을 사용하였 다. 분석에
사용한 자료는 C.dominance, Temp, DO, EC, Q7day, APRCP7, ΔT, pH, NO3-N, NH3-N, TN, TP, PO4-P, Chl-a, Fe, BOD, COD, TOC, SiO2를 포함하였다. 주성분 수의 결정은 주성분 축에 정사된 자료의 분산 크기를 나타 내는 고유치(eigenvalue)가 1.0 이상인 값을 갖는 주성분
축 만을 고려하였으며(Box and Cox, 1964; Jung et al., 2012; Soltani et al., 2012), 축을 회전하는 방법은 변수와 요인간 의 관계를 가장 명확히 설명하는 것으로 알려진 Varimax 회전방법을 적용하였다(Husson, 2010). 또한, 원자료가 주 성분 분석에 타당한 방법론인지 판단하기 위해 Bartlett 구 형도 검정 및 KMO (Kaiser-Meyer-Olkin)
test (KMO)를 사 용하였다. KMO test 결과는 분석에 사용된 변수와 자료에 내재된 요인들 간의 공분산 정도를 나타낸 척도로써 1에 가까울수록
분석의 타당성이 높고 최소 0.5 이상 되어야 분 석이 가능하다(Jung and Kim, 2017). KMO 검정결과, 백제보 는 총 1개(COD), 죽산보는 총 4개(pH, PO4-P, TN, NO3-N) 의 변수가 KMO 기준 값(0.5 미만)을 만족하지 못하여 이 들 변수를 배제하고 분석하였다. 최종적으로 선정된 변수로 분석한 결과, 백제보의
KMO 값은 0.74 (p ≪ 0.05), 죽산보 는 KMO 값은 0.68 (p ≪ 0.05)로 모든 보에서 기준 값을 만족하였다.