전체 셋(500개라 하자)에서 무작위로 16개의 숫자가 튀어나옴
각 숫자들을 보고 제시된 숫자들의 평균을 낸다고 하자.
예를 들어 1~500까지의 숫자 중에서 (1,2,6,124,363,290, ...) 이런식으로 16개를 뽑음
그래서 그 숫자를 평균 내는 거임.
이때 16개의 숫자들 중에 랜덤하게 4개나 8개만 꼽아서 보여주는거랑 16개 숫자 보여주는거랑
평균 계산하는데 있어서 유의미하게 차이가 날까?
전체 셋(500개라 하자)에서 무작위로 16개의 숫자가 튀어나옴
각 숫자들을 보고 제시된 숫자들의 평균을 낸다고 하자.
예를 들어 1~500까지의 숫자 중에서 (1,2,6,124,363,290, ...) 이런식으로 16개를 뽑음
그래서 그 숫자를 평균 내는 거임.
이때 16개의 숫자들 중에 랜덤하게 4개나 8개만 꼽아서 보여주는거랑 16개 숫자 보여주는거랑
평균 계산하는데 있어서 유의미하게 차이가 날까?
n개의 숫자 중에서 r개를 뽑아서 너 말대로 시행할때 만약 1을 예로 들면 어차피 다 더해서 산술평균을 구하는 거니까 1은 nCr개가 뽑혀서 각 숫자에 대해서도 nCr개로 같고 결국 몇개를 뽑든 1부터 n까지의 산술평균과 같지 않을까?
비복원이냐 복원이냐에 따라서도 달라질텐데 좀 더 자세하게 설정해줄 수 있어?
보다 정확히는 유니폼 분포를 따르는 50개의 풀에서 16개를 먼저 랜덤하게 뽑음. 16개 뽑힌 것중에서 1,2,4,8,16개로 또 섭샘플링을 함. 이때, 섭샘플링 한 것들로 평균을 계산하는거랑 16개로 평균을 계산하는거를 비교하는거에요. 근데 이떄 섭 샘플링에서 맞다는 판단은 먼저뽑은 16개의 평균이랑 비교를 해서 그 차이를 구하는 것임. 그리고 그 차이 |E(N=16) - E(N=k)| for k = 1,2,4,8,16를 비교하는게 중요한데 여기서 유의미한 차이가 나올까요?
유의미한 차이라고 하면 분산도(차이에 대한) 구하고 유의수준도 설정해놔야될거에요. 그리고 말씀하신거는 정말 따로 계산을 해봐야하는 문제긴 한데 경험적으로 보면 거의 없긴 해요. 치우친 분포나 괴상한 분포가 아닌 경우엔 더더욱 그렇고요. 말씀하신 기법에 관한 분야까지 있을정도니까요.
어떤걸 찾아봐야 할까요 혹시 관련된거 아시면 좀 가르쳐주세요... 실험해야하는데
제 기억으론 해석했을 때 ‘통계적 부트스트래핑’ 인 제목이었나 그런 원서였어요. 몇년 지나서 책 이름까진 기억이 ㅠㅠ
부트스트랩이랑 관련 있는거 맞는거 같은데. 아마 기대값은 같을 수 있어도 표준오차의 크기가 차이날듯