Data Analysis
- 평가 메트릭 TP -> True를 True로 예측 TN -> False을 False로 예측 FP -> False을 True로 예측 FN -> True를 False로 예측 Accuracy (정확도): 예측이 정답과 얼마나 정확한가? 맞춘 True (TP) & False (TN) 수 Recall (재현율): 찾아야 할 것중에 실제로 찾은 비율은? 실제로 True인 데이터를 모델이 True라고 인식한 비율 TP / (TP+FN) True를 True로 예측 + True를 False로 예측 FN: 보안, 의학 분야에서 중요 Precision (정밀도): 예측한 것중에 정답의 비율은? 예측한 것 (abuser) 중에 정답 비율 TP / (TP+FP) True로 예측했는데 False이었음 F1 Score : 정밀도와 재현율의 조.. 2023.12.20
- pandas: map, apply, transform, agg agrregate는 groupby로 데이터를 집계 map은 입력되는 element별로 함수 매핑 (Series형만 가능) apply도 입력되는 element별로 연산 (lambda) 적용 (Series, DataFrame 모두 가능) applymap은 DataFrame에만 가능 transform은 input과 같은 사이즈의 새로운 DataFrame로 변환 map, apply는 element level transform은 column level 아래 예시에서, apply는 Label별로 결과를 리턴해주었으며 transform은 input df의 index를 유지하며 데이터프레임 형태로 리턴해주었다. (해당 인덱스가 어떤 label이었는지 알 수 없음) label_grouping = df.groupby('L.. 2023.12.19
Learning Model
- Bagging VS Boosting 의사결정규칙을 트리 구조로 나타내어 전체 자료를 몇 개의 소집단으로 분류하거나 예측을 수행하는 분석 방법 장점 - 쉽고 해석하기 용이 - 다중분류와 회귀에 모두 적용 가능 - 이상치에 견고, 데이터 스케일링이 불필요 (데이터의 상대적인 순서를 고려해서) 단점 - 트리가 너무 깊으면 과적합될 수 있음 - 훈련 데이터에 민감하여 작은 변화가 노이즈에도 트리의 구조가 크게 달라짐 (불안전성) -> random state 고정 (42) Bagging Bootstrapping + Aggregating의 약어 데이터가 부족한 문제를 해결하기 위한 방법론 데이터를 복원 추출하여 유사하지만 다른 데이터 집단(표본)을 생성 (Bootstrapping) 이 여러 개의 표본을 기반으로 각각의 DT모델을 개발한 후에 예측,분.. 2024.02.23
- Active Learning: UNKNOWN 데이터 라벨링 어뷰저/노말 유저가 일부 라벨링 되어 있는 데이터셋에서 unknown 데이터를 라벨링하기 위한 실험을 진행하였었다. 전체 플젝 진행 과정은 아래와 같으며, 1. EDA 분석으로 확실한 Normal/Abuser 유저를 판별 2. Active learning으로 unknown 데이터를 라벨링 3. Validation: RandomForestClassifier를 이용하여 트리 구조 확인 EDA 분석 결과를 토대로 구축한 학습용 데이터셋을 Active Learning으로 학습한 내용을 정리하려 한다. 1. Active Learning 데이터의 분포에서 라벨의 decision boundary에 위치하여 모델이 판단하기에 어려운 데이터 위주로 학습해나가는 방식. model.predict_prob에서 class들의 .. 2023.12.20