오늘 할 일 평균을 뺀 자료에서 공분산을 구하고 주성분 방향과 분산을 반영한 거리를 해석한다.
자료의 평균을 빼면 중심이 원점으로 옮겨진다. 공분산의 고유벡터와 고윳값은 각각 흩어짐의 방향과 그 방향의 분산이다.
먼저 확인 $(1,1),(3,3),(5,5)$의 평균을 구하시오.
풀이 읽기투영분산이 이차형식인 이유
자료를 행에 놓은 $X$에서 각 열의 평균을 뺀 행렬을 $X_c$라 한다. 이 예의 공분산은 $S=\frac1nX_c^TX_c$이다.
단위방향 v로 투영한 중심화 자료는 \(X_cv\)이다.
\[\operatorname{Var}(X_cv)=\frac{\|X_cv\|^2}{n}=v^TSv\]
앞 차시에서 배운 이차형식의 최대값이 가장 큰 고윳값이다. 해당 고유벡터가 첫 주성분 방향이 된다.
설명을 읽고 개념 정리
- 데이터에서 평균을 빼는 과정을 라 한다.
- 공분산행렬은 대칭이고 방향별 을 담는다.
- PCA의 첫 주성분 방향은 공분산행렬의 이다.
- 공분산행렬 $\Sigma$가 가역일 때 마할라노비스 거리 제곱은 $d_M^2=(x-\mu)^\mathsf T\underline{\hspace{2.0cm}}(x-\mu)$이다.
주의할 점 이 자료의 공분산은 모두 관측값 수 $n$으로 나눈다. 표본 공분산에서 쓰는 $n-1$과 섞지 않는다. 최대 고윳값이 중복되면 첫 방향은 하나로 정해지지 않는다.