예를 들어서 A와 B 총 2개의 연속형 변수를 바탕으로 독립표본 t 평균 검정을 수행하려고 합니다.


데이터의 크기는 A와 B 모두 3000행인데, 문제는 두 변수 모두 극단적인 이상값들이 많아서 왼쪽으로 매우 치우친 형태입니다.


여기서 궁금증이 생겼는데, 독립표본 t 평균검정이나 ANOVA 같이 정확한 수치 값을 예측하는 것이 목적이 아닌 기법의 경우에는 굳이 각 변수들을 로그화 시키거나 이상치들을 제거해야 되는 것인가요?


원본 데이터의 이상값들도 다 의미가 있는 데이터일 수 있는데, 독립표본 t 평균 검정을 수행할 때 로그화를 하거나 이상값들을 제거한 후 통계적 검정을 수행해도 그 의미가 훼손되지 않는 것인지 궁금합니다.


즉, 독립표본 평균검정/ANOVA와 같은 통계 기법은 로그화나 이상치들을 조정하지 않고 원본 데이터 그대로 통계적 검정을 수행하고, Regression과 같이 종속변수의 값을 예측하는 기법부터는 좀 더 정확한 예측을 위해 로그화나 이상치 제거 등을 시도하는 것이 맞는지 궁금합니다.


질문할 때가 마땅히 없어서 죄송합니다.