개인프로젝트를 하는 중인데 머신러닝으로는 결과가 잘 안나와서 고전적인 통계방법으로 한 번 분석해보려 하는데 통계를 잘 몰라서 선생님들의 조언을 구하고자 합니다.
자료) 음식과 해당음식을 먹고 안좋았던 경험에 대한 자료인데,
음식A를 먹고 설사50% 구토20% 무증상30%
음식B를 먹고 어지러움30% 변비10% 무증상60%
음식C를 먹고 구역감10% 어지러움50% 무증상40%....
이런 자료들이 음식Z까지 있다고 가정했을 때,
제가 하려는 건
무작위 음식 조합 예를 들어, 음식A, E, F, J를 먹고 설사가 날까 구토를 할까 아무일도 없을까? 를 예측해보고 싶습니다.
1. 혹시 이런 상황에 알맞는 통계적 분석 방법이 있을까요?? 머신러닝은 제가 데이터 모양 만들어서 넣어주면 되는데 고전적인 통계분석법은 제가 잘 몰라서 정형화된 방법이 없는지 궁금합니다.
2. 만약 음식A에 대한 사례는 10만건인데 D는 10건이라면 D는 유의성이 없을 것 같은데 이런 자료형에서 유의성을 판단하는 통계학적인 기준이나 유의성을 부여하는 방법이 있을까요??
용어 하나하나 안 풀어써주셔도 제가 최대한 용어같은거 찾아보면서 공부해서 이해해보겠습니다. 선생님들의 고견을 구합니다. 감사합니다(_ _)
제 통계 배경지식은 분산이 뭔지 표준편차가 뭔지 정도만 알고 있습니다.
애초에 통계를 모르는데 머신러닝을 한다는 거 자체가 넌센스인데... 1번 질문은 다항 로지스틱 회귀분석 찾아보면 될 거 같은데 외람된 말씀이지만 분산, 표준편차만 아는 고등학생 수준이라고 하셨으니 보셔도 뭔 말인지 모르실 확률이 매우 높을거에요;
요즘은 통계 몰라도 아무나 머신러닝할 수 있죠. 블랙박스 모형들은 통계적인 해석을 그냥 배제해도 되는 수준이고... 인공신경망은 그냥 자기들끼리 만든 용어 쓰면서 절편항을 bias라고 부르고...
오늘 좀 찾아봤는데 로지스틱을 알맞다고 하신 이유가 로지스틱이 중간에 급격하게 증가하는 부분이 있어서 yes or no로 결과가 나오니까 이 모델에 잘 어울릴거라고 생각하신건가요??? 만약 y축을 'A음식을 먹은 후 설사를 할 확률'이라고 하면 x축은 어떻게 둬야할까요??
조합을 고려해야 해서 결합분포 형태를 잡아줘야 할 것 같은데 음식조합에 대한 데이터가 있음? 머신러닝 모델로는 머머 써봄? - dc App
원본데이터가 A,C,D먹었을때 설사,구토,어지러움 C,D,F 먹었을때 구토, 어지러움, 무증상 머 이런식으로 돼있는걸 제가 본문에 써놓은것처럼 가공했습니다! 머신러닝 모델로는 SVM, random forest써봤는데 둘다 20%나오더라구요 ㅠ 왜 낮은지는 알겠는데 머신러닝면에서 해결방법은 뾰족히 생각나지 않아서 고전통계쪽으로 접근해보려합니다. /// 결합분포형태라는 단어도 검색해봤는데 이건 잘 이해가 안갑니다...
너가 얘기하는 게 결합분포임. 데이터가 묶음으로 나오잖아. 음식 간 당연히 독립 아닐 거고 심지어 순서 영향도 받을 것 같긴 한데, 그런 거 없다 가정하고 marginal로 음식들 각각 따로 빼서 확률 구한 뒤, 나이브 베이즈 쓰면 될 것 같음. 공분산까지 잡아서 베이즈 정리 쓰면 좋겠지만 어려울 것 같음. 머신러닝 모델로는 뭐 association rule 이런 거 있을 것 같긴 한데.
안 좋은 소리 하나 덧붙이면 통계를 알든 모르든 데이터 타입에 따라서 무슨 머신러닝 모델 쓴다는 학원에서 야매로 배우는 애들도 알텐데 머신러닝도 제대로 모르는 사람 같음. 요새 몇 달만에 머신러닝 끝내니 마니 이상한 수업들도 수학이랑 기초통계는 앞에서 맛보기라도 가르쳐주는데 평균 분산 표준편차만 아는거면 고등학교 수준 통계도 모른다는 건데 심각한 거야.
어.. 저는 머신러닝 리서쳐는 아니구요.... 직업은 약사인데. 취미로 이것저것 해보고싶은 것들 해보는거라.. 잘 모릅니다.. 통계나 머신러닝 관련한것들은 제가 시간내서 인강듣고 공부해서 만들고 있는거라 걸음마입니다!
약사면 의학통계 안 들었을리가 없는데 왜 수준이 저 모양임?
커리큘럼에 그런 과목 업습니다 ㅎㅎ
https://snupharm.snu.ac.kr/ko/board/class/view/13230
샤대
약대 커리큘럼. 3학년 전선부분에 존재하는데 없다고 단언하기는 ㅋㅋㅋㅋㅋㅋ
걍 음식간 독립 가정해버리고 조합 이용해서 풀어버리는게 머리 덜아플듯
혹시 조금만 더 자세히 말씀 부탁드려도될까요?? 저는 저상태에서 A,B,C를 먹는다고 가정하면 그냥 부작용퍼센트값을 모두 더해서 설사 50% 무증상130% 구토20% 어지러움 80%..(등등) 이니까 가장 확률높은 무증상을 도출해볼까? 하는 생각을 했어요. 제가 방금 말한 방법을 말씀하신건가요?
범주형 자료 분석 찾아보셈
오늘 찾아봤는데 독립변수, 종속변수의 형태에따라 분석방법이있더군요! 둘다 범주형같아서 카이제곱검정을 내일 한 번 해볼 생각입니다! 근데 웃긴건 카이제곱은 카이제곱 값은 안보고 p-value만 보던데요...?
얜 진짜 아무것도 모르는 백치상태구나.. 중학생정도야?
진짜 현업에선 이딴 게 머신러닝이라고 굴러다님? ㅋㅋㅋㅋ
어.. 저는 머신러닝 리서쳐는 아니구요.... 직업은 약사인데. 취미로 이것저것 해보고싶은 것들 해보는거라.. 잘 모릅니다.. 통계나 머신러닝 관련한 것들은 제가 시간 내서 인강듣고 공부해서 만들고 있는거라 걸음마입니다! 다 떠나서 새로운 분야라 그런가 재밌네요 ㅎㅎㅎ
아 제가 개인 프로젝트라 해서 오해하셨을 수도 있겠네요 다들 !
진지하게 기초통계학부터 한번 읽고 프로젝트 시작하는게 맞는거 아님? 용어 자체도 모르는것 같은데 이게 분석을 한다고 될건 아닌것같은데... 막말로 저거 고등학생 확통한 애들만되도 벌써 음식조합 몇개나올지 경우의수 계산하고 그거 맞춰서 각각 증상에 관한 확률 독립시행이라고 가정하고 단순 곱으로 모든 조합에 대한 확률분포표를 구할듯. 고딩들도 이정도 생각으로 접근하는 마당에 뭔 머신러닝이야 시발. 개패버리고 싶네 진짜
그거는 해봤습니다 ㅎㅎ 먼가 다른 통계적으로 멋있는 방법이 있나 했어요.