Загружаем каталог…
Загружаем каталог…
[머신러닝] 5강. 특징 추출 📌 오늘의 학습 목표 고차원 데이터에서 핵심 정보만 남기는 특징 추출(Feature Extraction) 과 변환 함수 의 관계를 이해합니다. Representative 선형변환 기법인 PCA(주성분분석법) 와 LDA(선형판별분석법) 의 도입 이유와 동작 원리의 차이점을 구별합니다. 선형변환의 한계점과 이를 보완하는 거리 기반 비선형 차원 축소 기법의 특징을 파악합니다. 1. 특징 추출과 차원 축소의 개요 (1) 특징 추출(Feature Extraction)의 존재 이유 문제 상황 : 원본 데이터는 크기(차원)가 너무 크고, 불필요한 정보나 잡음(Noise)이 많이 포함되어 있습니다. 이를 그대로 머신러닝 모델에 사용하면 계산 시간이 급증하고 모델 성능이 떨어지는 차원의 저주 문제가 발생합니다. 해결 방법 : 기존 변수들을 종합 및 변환하여 중요한 정보만 축약한 새로운 저차원의 특징 벡터 를 뽑아내는 특징 추출 을 진행합니다. (2) 변환 함수(Transformation Function)의 역할 관계 : 특징 추출이라는 목적(결과)을 달성하기 위해 사용하는 수학적 연산 도구 가 바로 변환 함수 입니다. 선형변환 vs 비선형변환 : 선형변환 : $y = W^T x$ 식과 같이 데이터에 변환 행렬 $W$를 단순 곱하는 방식입니다. 공간을 휘지 않고 그대로 기울이거나 특정 평면에 투영하여 줄입니다. (예: PCA, LDA) 비선형변환 : 복잡한 함수 $\phi(x)$나 인공신경망을 활용해 공간을 꺾고 구부리면서 변환하는 방식입니다. 복잡하고 왜곡된 데이터 처리에 적합합니다. 2. 주성분분석법 (PCA, Principal Component Analysis) (1) 존재 이유 (Story & Purpose) 정답(클래스 라벨)이 없는 비지도학습 환경에서, 데이터의 정보 손실을 최소화하면서 차원을 축소하기 위해 등장했습니다. (2) 핵심 원리 (Condition & Logic) 데이터가 넓게 펼쳐져 있는 방향, 즉 분산(Variance)이 가장 큰 방향(주성분 축)에 유용한 정보가 집중되어 있다고 판단합니다. 수행 단계 : 입력 데이터 $X$의 평균을 0으로 맞추는 정규화(Centering) 진행 공분산 행렬 $\Sigma_x$ 계산 공분산 행렬의 고유치 분석을 통해 고유치(Eigenvalue)와 고유벡터(Eigenvector) 계산 고유치가 가장 큰 순서대로 $m$개의 고유벡터를 선택하여 변환 행렬 $W$ 구성 $y = W^T x$ 변환을 거쳐 저차원 데이터로 변환 3. 선형판별분석법 (LDA, Linear Discriminant Analysis) (1) 존재 이유 (Story & Purpose) 정답(클래스 라벨)이 존재하는 지도학습 환경에서, 단순 차원 축소를 넘어 분류(Classify) 성능을 극대화 하기 위해 등장했습니다. (2) 핵심 원리 (Condition & Logic) 서로 다른 클래스 간의 거리는 멀어지게 하고, 같은 클래스 내부의 거리는 좁혀지도록 데이터를 투영시킵니다. 핵심 지표 : 클래스 내 분산 ($S_W$, Within-class scatter matrix) : 최소화해야 함 클래스 간 분산 ($S_B$, Between-class scatter matrix) : 최대화해야 함 수행 단계 : 전체 평균 및 각 클래스별 평균 벡터 계산 클래스 내 분산 행렬 $S_W$와 클래스 간 분산 행렬 $S_B$ 계산 $S_W^{-1} S_B$ 행렬의 고유치 분석을 수행하여 고유치가 큰 $m$개의 고유벡터 추출 구한 고유벡터들로 변환 행렬 $W$를 구성하여 투영 4. 거리 기반 차원 축소 및 선형변환의 한계 (1) 선형변환의 한계 데이터의 구조가 직선이나 평면으로 잘리지 않고 휘어져 있는 곡면(비선형 매니폴드 구조) 형태인 경우, 선형변환(PCA/LDA)으로는 고유의 데이터 구조를 보존하기 어렵습니다. (2) 거리 기반 차원 축소 기법 다차원 척도법 MDS (Multidimensional Scaling) : 데이터 개체 간의 거리(유클리드안 거리) 정보를 저차원 공간에서도 가급적 그대로 유지하도록 변환합니다. t-SNE : 고차원 공간에서 데이터 점들 사이의 확률적 친밀도(Similarity)를 유지하도록 저차원에 매핑하여 시각화에 널리 사용됩니다. Isomap : 단순 유클리드안 거리가 아닌, 데이터의 휘어진 공간 곡면을 따라가는 측지선 거리(Geodesic Distance)를 보존하며 차원을 축소합니다. 5. 오늘 배운 내용 요약 특징 추출 은 고차원 원본 데이터의 핵심 정보만 변환 함수를 이용해 저차원으로 압축하는 방법입니다. PCA 는 라벨 없이 데이터 분산을 최대화하는 비지도 기법이고, LDA 는 클래스 구분(분류) 성능을 극대화하는 지도 기법입니다.
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
머신러닝 5강. 데이터표현 : 특징 추출. [머신러닝] 5강. 특징 추출 📌 오늘의 학습 목표 고차원 데이터에서 핵심 정보만 남기는 특징 추출(Feature Extraction) 과 변환 함수 의 관계를 이해합니다. Representative 선형변환 기법인 PCA(주성분분석법) 와 LDA(선형판별분석법) 의 도입 이유와 동작 원리의 차이점을 구별합니다. 선형변환의 한계점과 이를 보완하는 거리 기반 비선형 차원 축소 기법의 특징을 파악합니다. 1. 특징 추출과 차원 축소의 개요 (1) 특징 추출(Feature Extraction)의 존재 이유 문제 상황 : 원본 데이터는 크기(차원)가 너무 크고, 불필요한 정보나 잡음(Noise)이 많이 포함되어 있습니다. 이를 그대로 머신러닝 모델에 사용하면 계산…
Открыть источник