회귀분석 가정에서 등분산 정규분포 따른다고 했던거 기억남? n개의 샘플을 뽑으면 Y~N(Xb,sigma^2I)를 만족하는 크기가 n짜리 정규분포임 근데 ||Y-Xb||를 최소로 하는 b의 추정량은 대충 미분해보면 b=(X'X)^(-1)X'Y가 나오게 됨 그럼 오차는 Y-Xb니까
Y-X(X'X)^(-1)X'Y=(I-X(X'X)^(-1)X')Y가 나오고
익명(106.102)2021-06-29 18:56
답글
귀찬으니 이걸 (I-P)Y라고 하면 오차는 (I-P)Y임 근데 (I-P)는 상수행렬이고 Y는 정규분포니 당연히 (I-P)Y도 정규분포고 오차도 정규분포며 오차제곱은 n-p의 자유도를 갖는 카이제곱 분포가 됨
일단 정규분포는 안 따라도 되긴 함 (선형, 등분산, 외생성, 오차독립만 충족시키면) 이 경우 BLUE여서 선형인 추정량 중 가장 좋은 추정량이 됨 - dc App
익명(117.111)2021-06-29 19:46
답글
그럼 왜 잔차정규성에 집착하냐? 3가지 이유가 있다
(1) 정규성을 따르면 선형회귀모형이 선형/비선형 포함 가장 좋은 모델이 됨. 정규성을 따르지 않으면 선형 중 베스트지만 비선형이 더 좋을 수도 있음 - dc App
익명(211.36)2021-06-29 19:51
답글
(2) 정규분포를 따라야 정규모집단 기반 t검정 / F검정이 정확하다 > 정규성에서 멀어질수록 1종 오류 커져서 Score 검정 써야할 수도 있다 - dc App
익명(211.36)2021-06-29 19:52
답글
(3) 예전에도 답변 달았는데, 잔차가 라플라스든 포아송이든 정규든 간에 어떤 '분포'를 따른다는 건 잔차가 랜덤인거라 더 이상 잔차에 숨어 있는 패턴이 없다는걸 의미한다. 모델이 완벽하다는거임.
머신러닝 관점에서 이게 중요한데 (1)과 연계해서 보면 무슨 괴상한 비선형 패턴이 숨어있어서 추가로 뽑아먹을 정보가 있을 수도 있거든. - dc App
태도가 건방지구나 - dc App
회귀분석 가정에서 등분산 정규분포 따른다고 했던거 기억남? n개의 샘플을 뽑으면 Y~N(Xb,sigma^2I)를 만족하는 크기가 n짜리 정규분포임 근데 ||Y-Xb||를 최소로 하는 b의 추정량은 대충 미분해보면 b=(X'X)^(-1)X'Y가 나오게 됨 그럼 오차는 Y-Xb니까 Y-X(X'X)^(-1)X'Y=(I-X(X'X)^(-1)X')Y가 나오고
귀찬으니 이걸 (I-P)Y라고 하면 오차는 (I-P)Y임 근데 (I-P)는 상수행렬이고 Y는 정규분포니 당연히 (I-P)Y도 정규분포고 오차도 정규분포며 오차제곱은 n-p의 자유도를 갖는 카이제곱 분포가 됨
결론: 니가 부족한건 기초지식이니 호그책 피고 다변량 정규분포 공부하셈 그럼 존나 당연해지니까
일단 정규분포는 안 따라도 되긴 함 (선형, 등분산, 외생성, 오차독립만 충족시키면) 이 경우 BLUE여서 선형인 추정량 중 가장 좋은 추정량이 됨 - dc App
그럼 왜 잔차정규성에 집착하냐? 3가지 이유가 있다 (1) 정규성을 따르면 선형회귀모형이 선형/비선형 포함 가장 좋은 모델이 됨. 정규성을 따르지 않으면 선형 중 베스트지만 비선형이 더 좋을 수도 있음 - dc App
(2) 정규분포를 따라야 정규모집단 기반 t검정 / F검정이 정확하다 > 정규성에서 멀어질수록 1종 오류 커져서 Score 검정 써야할 수도 있다 - dc App
(3) 예전에도 답변 달았는데, 잔차가 라플라스든 포아송이든 정규든 간에 어떤 '분포'를 따른다는 건 잔차가 랜덤인거라 더 이상 잔차에 숨어 있는 패턴이 없다는걸 의미한다. 모델이 완벽하다는거임. 머신러닝 관점에서 이게 중요한데 (1)과 연계해서 보면 무슨 괴상한 비선형 패턴이 숨어있어서 추가로 뽑아먹을 정보가 있을 수도 있거든. - dc App