본문 바로가기

Machine Learning

(4)
Chapter4 : Machine Learning - Unsupervised Learning, Clustering, Dimension Reduction Unsupervised Learning이란?머신러닝을 이야기할 때 많은 분들이 먼저 분류나 회귀를 떠올리지만, 실제 데이터 분석에서는 정답 레이블이 없는 경우도 훨씬 많습니다. 이럴 때 중요한 것이 비지도학습이고,비지도학습이란 종속변수 없이 데이터 자체의 구조를 이해하고그 안에 숨어 있는 패턴을 발견하는 접근입니다. 대표적인 문제로는 비슷한 데이터를 묶는 군집화,많은 변수를 더 간결하게 줄이는 차원 축소,그리고 대부분과 다른 이상치를 찾는 이상 탐지가 있습니다.비지도학습의 핵심은 “무엇이 정답인가”를 맞히는 것이 아니라, “데이터가 어떻게 이루어져 있는가”를 설명하는 데 있습니다. 그래서 이 영역은 예측 모델을 만들기 전 탐색적 분석 단계에서 특히 강력하고,고객 세분화, 패턴 발굴, 구조 파악, 시각화 ..
Chapter3 : Machine Learning - Logistic Regression, Softmax, LDA, QDA 안녕하세요 오늘은 수학적으로 배운 머신러닝에 대해서 리뷰할까 합니다.수학적으로 소개되는 만큼 다소 어렵고 이해가 오래 걸리니 차근차근 이해하면서 공부하는 것이 중요했습니다.Logistic Regression로지스틱 회귀의 핵심은 입력 X가 커질수록양성 클래스일 확률 $P(y=1 | X)$가 어떻게 변하는지를 모델링하는 것입니다.이때 확률 자체를 바로 직선으로 표현하지 않고 오즈(odds)와 logit을 통해선형식과 연결함으로써 분류 문제를 안정적으로 다룰 수 있습니다.확률: $P(y = 1 \mid X = x)$오즈: $\text{odds}(x) = \dfrac{P(y=1 \mid x)}{1 - P(y=1 \mid x)}$로짓: $\text{logit}(x) = \log \left( \dfrac{P(y=..
Chapter2 : Machine Learning - Supervised Learning, Classification 안녕하세요 오늘은 머신러닝의 supervised learning(지도학습)과 classfication(분류)에 대해 알아보겠습니다.지도학습이란?지도학습(Supervised Learning)은 독립변수 X와 이를 설명하는 종속변수 Y가 함께 주어졌을 때, 두 변수 사이의 관계를 학습해 새로운 입력에 대한 Y를 예측하는 방법입니다. 즉, “데이터의 Y 값을 잘 예측하는 것”이 지도학습의 목표라고 할 수 있습니다.이때 Y가 범주형이면 분류 문제, 연속형이면 회귀 문제로 나뉘게 되는데요,지난 chapter에서 회귀분석에 대해 다루어 봤으니 쉽게 이해가 될 수 있겠습니다.예를 들어 직원의 이직 여부, 암 발병 여부, 꽃의 종류 예측은 분류에 해당하고, 주식 가격이나 부동산 가격 예측은 회귀에 해당하는 것입니다. ..
Chapter1 : Regression Analysis(회귀분석) 안녕하세요, 제가 2월부터 AI LLM 부트캠프를 수강하게 되었는데요,오늘부터 부트캠프를 수강하면서 주차별로 배운 내용들을 정리해서 올려볼까 합니다.간단하게 복습할때 돌아보는 용도로 내용 정리만 해 놓아도 도움이 될 것 같더라구요중요한 개념이나 개인적으로 이해하기 어려운 개념들 위주로 작성할 예정이니다소 두서없더라도 좋게 봐주시면 감사하겠습니다^^ Correlation Coefficient (상관계수)correlation coefficient란 두 변수 사이의 상관성의 정도를 의미하며-1부터 1 사이의 값을 지님절대값이 0.3 이상이면 상관관계가 있다고 평가*상관관계가 있다고 해서 무조건 인과관계가 있는 것이라고 생각하면 안됨$$ r=\frac{\sum_{i}^{n}(x_{i}-\overline{x})(..