| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- 정보이득
- 선형회귀
- 아다부스트
- 부스팅
- Adaboost
- pre pruning
- AdaBoostRegressor
- 경사하강법
- C4.5
- 실제데이터활용
- 회귀분석
- LinearRegression
- post pruning
- 의사결정나무
- 군집화기법
- 부스팅기법
- 캘리포니아주택가격예측
- 체인지업후기
- boosting
- MultipleLinearRegression
- 사후 가지치기
- AdaBoostClassifier
- 선형모형
- 사전 가지치기
- 최소제곱법
- KNearestNeighbors
- cost complexity pruning
- LeastSquare
- 중선형회귀
- gradientdescent
- Today
- Total
목록전체 글 (19)
데이터 분석을 향한 발자취 남기기
오늘은 자주 사용되는 SOM 군집화 기법에 대해서 알아보고자 한다. 한때, 공부하면서 SOM을 도대체 어떻게 학습하는건지, 어떻게 예측하는건지 잘 이해가 되지 않았었다. 그래서, 여러 자료를 참고하면서 공부하며 알아간 SOM에 대해서 자세하게 설명하고자 한다! 1. SOM(Self Organizing Map)이란?2. SOM 예제3. SOM Clustering 방법1. SOM(Self Organizing Map)이란? SOM은 인공신경망 형태로 오차를 학습하는 기존 ANN(Artificial Neural Network)과 달리 경쟁 학습(competitive learning)을 통해 훈련을 수행하는 구조를 갖는다. 핵심) SOM은 입력 데이터를 2차원 혹은 3차원과 같은 저차원 데이터 공간으로 매핑하는..
DBSCAN은 "Density-Based Spatial Clustering of Applications with Noise"를 축약한 단어로 말 그대로 노이즈가 있는 데이터에 대해 밀도를 기반으로 공간 클러스터링을 하는 모델이다.오늘은 DBSCAN의 알고리즘과 하이퍼 파라미터 설정 방법에 대해서 알아보고자 한다. 1. 알고리즘2. 예제3. 하이퍼 파라미터 설정 1. 알고리즘기본 가정"데이터를 군집으로 분리했을 때, 군집 내 밀도 ↑ / 군집 간 밀도 ↓"이때, 밀도란 '정해진 반경 내에 데이터가 포함된 정도' 를 의미한다. 즉, DBSCAN은 군집 내에 데이터가 많이 밀집해있으면서, 군집 간에는 데이터 간 거리가 멀도록 군집화를 수행한다. 알고리즘 DBSCAN 알고리즘 Input:epsilon (반경..
- 참여 계기자소서를 어떻게 시작해야할지 몰라서 한참을 헤매고 있을 때,유튜브로 면접왕 이형을 접했다. 그동안 두괄식, 소제목의 필요성은 느꼈지만, 추가로 수치화에 대한 중요성을 느끼게 되었고내 자소서 퀄리티가 어떤지 알 수 있었다. ㅎ 그래서 자소서를 계속 수정을 하던 와중, 체인지업 사이트를 들어가게 되고 8만원?.. 진짜 깊게 고민하다가 후기 사이트 보고 바로 결제했다.. https://alivechangeup.com/ 체인지업누구나 합격할 수 밖에 없는 취업 커뮤니티입니다alivechangeup.com - 참여 후기 솔직히 3-4 시즌 전에 3C4P도 해봤고 자소서 바이블 책도 있으니까 이제 자소서만 쓰면 될줄 알았다.. 근데 스터디를 통해 와.. 3C4P는 이렇게 쓰는게 아니구나를 느꼈고그때 ..
빅데이터 분석기사에 관심이 있어 따야지 따야지 했던 필기와 실기를 모두 보고 왔다. 빅데이터 분석기사는 2020년부터 새로 신설된 자격증이라 볼 수 있다.이 자격증에 대해서 모르는 사람도 많기 때문에, 관심 있다면 꼭 따두는게 좋을것 같다! 1. 필기필기 책은 예문에듀걸로 사용해서 준비했다.시험보고 온지 좀 오래되서 잘 기억은 안나지만, 이 분야에서 2-3년동안 공부해서 그런지 어렵다고 느껴지는 부분은 별로 없었다. 하지만, 절차라던지, 개념에 대해서는 부족했기 때문에 외워야 할 부분이 많았다. 공부방법은 먼저, 각 챕터마다 내용에서 중요하다고 생각되는 부분을 컴퓨터로 타이핑 하면서 정리했다.각 챕터가 끝날 때마다 다시 한번 읽고 문제 풀이에 들어갔고, 이를 계속 반복해줬다. 곧 졸업을 앞뒀기 때문에,..
지난 시간에 의사결정 나무를 어떻게 생성하는지에 대해서 알아보았다. 의사결정 나무의 가장 큰 특징은 쉽게 과적합된다는 점이다. 이를 해결하기 위해 나무가 더이상 성장되지 않도록 막는 가지치기 방법을 사용한다. 0. Decision Tree의 과적합 위험성1. 가지치기 (pruning)2. Cost complexity pruning3. Minimal cost complexity pruning0. Decision Tree의 과적합 위험성과적합이란 모델이 훈련 데이터를 지나치게 학습해 훈련 데이터에 대해서는 매우 좋은 성능을 보이지만, 이에 반해 테스트 데이터에 대한 예측 성능이 떨어지는 경우라 볼 수 있다. 이를 확인해보기 위해 캘리포니아 지역의 주택 가격을 예측하는 의사결정 나무를 생성해보고자 한다. 데..
오늘은 대표적인 트리 모형인 Decision Tree에 대해서 공부하고자 한다. 먼저 Decision Tree에 대한 구조를 살펴보고, Decision Tree를 구성하는데 사용되는 알고리즘인 ID3, C4.5, CART에 대해서 알아보고자 한다. 0. Decision Tree란?1. ID32. C4.53. CART0. Decision Tree란?의사결정 나무(Decision Tree)는 데이터에 있는 규칙을 학습을 통해 자동으로 찾아내 트리 기반 분류 규칙을 생성하는 모델이다. 생성된 모델의 모양이 나무와 같다고 하여 결정 트리라 불린다. - 규칙 노드: 규칙 조건(분류 기준)- 리프 노드: 분류 및 예측값 새로운 데이터가 들어오면 루트 노드를 기준으로 규칙 노드를 거치면서 최종적으로 위치한 리프 노..
오늘은 분류와 회귀에서 쉽게 사용할 수 있는 알고리즘인 KNN에 대해서 알아보고자 한다.간단한 개념을 바탕으로 하기 때문에 접근하기 쉬운 알고리즘임에도 효과적으로 작동하여 많이 사용되는 알고리즘이다. 1. KNN이란?2. 주로 사용되는 거리 척도3. Citrus 분류 예측 설명에 사용한 데이터는 오렌지와 자몽을 분류하는 데이터로 이에 대한 설명은 아래 출처를 참고한다.https://footprints-toward-data-analysis.tistory.com/13 [Boosting] AdaBoost Classifier with Citrus오늘은 이전에 공부했던 AdaBoost Classifier를 구현하여 실제 데이터를 분류해보고 이를 시각화하여 표현해보고자 한다. AdaBoost Classifier에..
오늘은 Gradient Boosting 알고리즘을 회귀에 적용해보려고 한다. 1. Gradient Boosting Regressor Algorithm2. Simple example3. Sklearn GradientBoostingRegressor 비교1. Gradient Boosting Regressor AlgorithmGradient Boosting은 Boosting 기반 알고리즘으로 약한 학습기들을 앙상블하여 더 좋은 성능을 얻는 예측 모델을 생성하는 방법이다. 일반적으로 Bagging의 대표적인 알고리즘인 Random Forest보다 더 좋은 성능을 보인다. 핵심은 각 약한 학습기를 생성할 때, 미분 가능한 손실 함수를 최소화하는 방향으로 학습한다는 것이다. 이때, 손실함수 최적화 방법으로 경사하강법..