정의와 조건

최소제곱 문제와 잔차

\(A\in\mathbb R^{m\times n}\)는 관측 조건을 행으로 모은 행렬, \(b\in\mathbb R^m\)는 관측값, \(\beta\in\mathbb R^n\)는 구할 계수이다. 잔차를 \(r=b-A\beta\)로 정한다.

\[S(\beta)=\|b-A\beta\|^2=\sum_{i=1}^m r_i^2\]

잔차제곱합 \(S\)를 가장 작게 하는 계수를 최소제곱해라 하며 \(\hat\beta\)로 적는다. \(m>n\)이면 미지수보다 식이 많은 과잉결정 문제이다. 식이 많아도 정확한 해가 있을 수 있으므로, 개수만으로 불가능을 단정하지 않는다.

21차시 · QR과 최소제곱

네 점에서 오차제곱합이 가장 작은 직선은?

모든 점을 지나는 직선이 없으므로, 실제값과 직선값의 차이를 제곱해 더한 값이 가장 작아지는 계수를 구합니다.

\(x\)0123 \(y\)1344
$y\approx \beta_0+\beta_1x$

계산 예제

직선의 계수를 미지수로 놓은 행렬

\[A=\begin{bmatrix}1&0\\1&1\\1&2\\1&3\end{bmatrix},\quad\beta=\binom{\beta_0}{\beta_1},\quad b=\begin{bmatrix}1\\3\\4\\4\end{bmatrix}\]

첫 열은 절편의 계수 1, 둘째 열은 입력값 \(0,1,2,3\)이다. 예측값 \(A\beta\)는 \(A\)의 두 열의 선형결합이다. \(\operatorname{col}(A)\)는 가능한 모든 예측값의 집합을 뜻한다.

처음 두 점을 정확히 지나려면 절편 1, 기울기 2여야 하지만 이 직선의 셋째 예측값은 5로 관측값 4와 다르다. 이 예제에서는 정확한 해가 없다.

근거와 유도

잔차 직교가 최솟값을 보장하는 이유

\(\hat r=b-A\hat\beta\)가 열공간과 직교한다고 하자. 임의의 계수 변화 \(h\)에서 \(Ah\)는 열공간 안에 있다.

\[\|b-A(\hat\beta+h)\|^2=\|\hat r-Ah\|^2=\|\hat r\|^2+\|Ah\|^2\]

교차항이 0이므로 어떤 변화도 잔차제곱합을 줄이지 못한다. 즉 잔차 직교는 최소해의 충분조건이다.

열들이 독립이면 \(h\ne0\)에서 \(Ah\ne0\)이므로 최소 계수도 유일하다.

근거와 유도

직교하지 않은 잔차의 제곱합을 줄이는 방향

\(r=b-A\beta\), \(g=A^Tr\ne0\)라 두고 계수를 \(\beta+tg\)로 바꾼다.

\[S(\beta+tg)-S(\beta)=-2t\|g\|^2+t^2\|Ag\|^2\]

교차항에서 \(r^TAg=(A^Tr)^Tg=\|g\|^2\)를 썼다. \(g\ne0\)이면 \(Ag\ne0\)이므로 \(0<t<2\|g\|^2/\|Ag\|^2\)를 고르면 위 값이 음수이다.

따라서 \(A^Tr\ne0\)인 계수는 최소해가 아니다. 앞의 충분조건과 합치면 최소해의 필요충분조건은 \(A^Tr=0\)이다.

정의와 조건

정규방정식과 얇은 QR 분해

\[A^T(b-A\hat\beta)=0\iff A^TA\hat\beta=A^Tb\]

오른쪽 식을 정규방정식이라 한다. 원래 방정식과 달리 잔차의 직교 조건을 나타내며, 잔차가 0일 필요는 없다.

\[A=QR,\quad Q^TQ=I_n,\quad Q\in\mathbb R^{m\times n},\ R\in\mathbb R^{n\times n}\]

이 수업에서는 \(A\)의 열이 독립이라고 가정한다. \(Q\)의 열은 열공간의 정규직교기저이고 \(R\)은 가역인 위삼각행렬이다.

근거와 유도

QR이 삼각방정식을 주는 이유

\(A\)와 \(Q\)의 열공간은 같으므로 잔차가 \(A\)의 모든 열에 수직인 것은 \(Q\)의 모든 열에 수직인 것과 같다.

\[Q^T(b-QR\hat\beta)=0\iff Q^Tb-R\hat\beta=0\]
\[R\hat\beta=Q^Tb\]

\(Q^Tb\)는 \(b\)의 열공간 성분을 그 정규직교기저로 나타낸 좌표이다. \(QQ^Tb\)가 예측값이며, 열공간 밖의 잔차 성분은 그대로 남는다.

직접 계산 · QR

상수열과 \(x\)열을 서로 직교하는 단위벡터로 바꿔 봅시다

$A=\begin{bmatrix}1&0\\1&1\\1&2\\1&3\end{bmatrix}=[\,\mathbf{a}_1\ \mathbf{a}_2\,]$
첫 번째 정규직교벡터
$\mathbf{q}_1=\frac{\mathbf{a}_1}{\lVert\mathbf{a}_1\rVert}=\frac12\begin{bmatrix}1\\1\\1\\1\end{bmatrix}$
$r_{11}=2,\qquad r_{12}=\mathbf{q}_1^\mathsf T\mathbf{a}_2=3$

상수열과 같은 방향의 단위벡터를 먼저 정합니다.

직교하는 단위벡터 좌표와 삼각 연립방정식

\(R\hat{\boldsymbol{\beta}}=Q^\mathsf T\mathbf{b}\)를 풀어 봅시다

$\mathbf{b}=\begin{bmatrix}1\\3\\4\\4\end{bmatrix},\qquad R=\begin{bmatrix}2&3\\0&\sqrt5\end{bmatrix}$
우변을 직교기저 좌표로 변환
$Q^\mathsf T\mathbf{b}=\begin{bmatrix}\mathbf{q}_1^\mathsf T\mathbf{b}\\\mathbf{q}_2^\mathsf T\mathbf{b}\end{bmatrix}=\begin{bmatrix}6\\\sqrt5\end{bmatrix}$
$R\hat{\boldsymbol{\beta}}=Q^\mathsf T\mathbf{b}$

\(Q^\mathsf T\mathbf{b}\)는 \(\mathbf{b}\)를 열공간에 투영했을 때의 좌표입니다.

직접 조작

절편과 기울기를 바꾸며 잔차제곱합을 비교해 봅시다

0.0
0.0
\(y=0.0+0.0x\) \(\mathrm{SSE}=42.00\) \(A^\mathsf T\mathbf{r}=(12,23)^\mathsf T\)

적용과 논증

잔차를 검산한 뒤 새 자료를 예측하기

구한 계수는 \(\hat\beta=(1.5,1)^T\), 잔차는 \(\hat r=(-.5,.5,.5,-.5)^T\)이다.

  1. 두 열과의 내적을 계산하여 최적 조건을 검산하라.
  2. 절편만 \(h\)만큼 바꾸면 잔차제곱합이 \(1+4h^2\)가 됨을 증명하라.
  3. 새 입력 \(x=4\)의 예측값을 구하라. 기존 잔차가 작다는 사실만으로 이 예측의 정확성을 보장할 수 있는가?
풀이와 판단 근거
\[\sum r_i=0,\quad\sum x_ir_i=0,\quad\sum(r_i-h)^2=1-2h\sum r_i+4h^2=1+4h^2\]

새 예측값은 5.5이다. 그러나 기존 자료 밖의 실제 관측값은 아직 없고 직선 모형이 계속 적절하다는 보장도 없다. 새 관측값으로 예측오차를 확인해야 한다. 학습 자료에 대한 최적화와 새 자료에 대한 검증은 다른 문제이다.

적용과 논증

열이 종속이면 무엇이 유일하지 않은가?

\[A=\begin{bmatrix}1&1\\1&1\end{bmatrix},\qquad b=\binom13\]

모든 예측값은 \((s,s)^T\), \(s=\beta_1+\beta_2\) 꼴이다. 잔차제곱합을 \(s\)의 식으로 쓰고 최소해 전체를 구하라. 예측값과 계수 중 어느 것이 유일한가?

풀이와 판단 근거
\[S=(1-s)^2+(3-s)^2=2(s-2)^2+2\]

최적 예측값은 \((2,2)^T\)로 유일하지만 계수는 \(\beta_1+\beta_2=2\)를 만족하는 모든 쌍이다. 열이 종속이면 서로 다른 계수가 같은 예측을 만들 수 있다. 이 경우 가역인 \(R\)을 가정한 후진대입 공식을 그대로 적용할 수 없다.

정리

목적함수, 최적 조건, 계산 방법의 구별

  1. 목적: \(\|b-A\beta\|^2\)를 최소화한다.
  2. 최적 조건: 잔차가 열공간에 수직이다. 피타고라스 분해로 증명한다.
  3. 계산: 독립인 열에서 QR을 구성하고 \(R\hat\beta=Q^Tb\)를 푼다.
  4. 검산: 잔차의 크기와 직교성, 계수의 유일성을 각각 확인한다.