예를 들어서 A와 B 총 2개의 연속형 변수를 바탕으로 독립표본 t 평균 검정을 수행하려고 합니다.
데이터의 크기는 A와 B 모두 3000행인데, 문제는 두 변수 모두 극단적인 이상값들이 많아서 왼쪽으로 매우 치우친 형태입니다.
여기서 궁금증이 생겼는데, 독립표본 t 평균검정이나 ANOVA 같이 정확한 수치 값을 예측하는 것이 목적이 아닌 기법의 경우에는 굳이 각 변수들을 로그화 시키거나 이상치들을 제거해야 되는 것인가요?
원본 데이터의 이상값들도 다 의미가 있는 데이터일 수 있는데, 독립표본 t 평균 검정을 수행할 때 로그화를 하거나 이상값들을 제거한 후 통계적 검정을 수행해도 그 의미가 훼손되지 않는 것인지 궁금합니다.
즉, 독립표본 평균검정/ANOVA와 같은 통계 기법은 로그화나 이상치들을 조정하지 않고 원본 데이터 그대로 통계적 검정을 수행하고, Regression과 같이 종속변수의 값을 예측하는 기법부터는 좀 더 정확한 예측을 위해 로그화나 이상치 제거 등을 시도하는 것이 맞는지 궁금합니다.
질문할 때가 마땅히 없어서 죄송합니다.
ㅇㅇ anova도 이상치 제거 해야됨. 아니 그 이전에 동분산인지 검정해야됨. 물론 대학원 레벨 가서 두 집단의 분포가 비슷한 경우에 한해서 집단이 정규분포를 따르지 않아도 n이 크면 어느정도 anova가 robust하다고는 하는데 이건 내가 정확히 원리를 모르니 둘째치고, 아노바 검정 자체가 데이터가 정규분표를 따른다는 가정하에서 세워진 이론이기 때문에
가정을 만족하지 못하면 anova자체가 의미가 없어. 원숭이 가지고 실험한 걸 물고기한테 적용시킬수 없는 것 처럼, 가정을 만족하지 못하면 테스트 값은 그냥 숫자에 불과함. 그러니 이상치를 날리든 아니면 변환을 해서 정규분포 비스므리 하게 만들던(box cox변환 등) 데이터가 정규분포 따르게 만들어야돼
그리고 지들 과제 물어보는 빡대가리 새끼들 보다 백만 배는 더 좋은 질문이니 이런 건 언제 올려도 환영이야
답변 감사합니다 - dc App
아노바에서 쓰는 F나 t나 결국 정규모집단에서 온거라 정규성 따져야함. 극단적인 이상값... 왼쪽으로 많이 치우쳤다면 데이터를 봐야겠지만 애초에 정규분포가 아닌 다른 분포일 수 있음 - dc App
그리고 Linear regression이나 t검정, 분산분석은 본질적으로 같은 분석임. Linear regression에서도 F검정 쓰고, 역시 잔차의 등분산, 정규성 가정하잖아. (정규성 없어도 BLUE긴 하지만 정규성 지켜져야 F검정이 가능하겠지) 이상값이 한 두 개가 아니라 많다면 제거보다 원인을 좀 따져봐 - dc App
답변 감사합니다. 말씀주신 대로 생각을 더 해보겠습니다 - dc App
1. Two sample t-test는 실제 두 그룹의 분포가 유사하다면 정규성이 없어도 잘 작동.(
https://files.eric.ed.gov/fulltext/ED443850.pdf)
2.
log 변환을 하면 검정의 대상이 바뀌기 때문에 주의해야함. Elog(X) != log(EX).
3. Permutation test같은 정규성이 요구되지 않는 test랑 같이 비교해보면 좋음.
답변 감사합니다 계속 공부하겠습니다 - dc App