현업 요청 중에 단일 분석으로 raw 데이터가 5기가 넘기기가 쉽지 않음 ㄷㄷㄷ
DT로 해서 열연산 때리면 생각보다 빨리 끝남
물론 그 보다 큰 물건은 분산 처리하거나 doParallel 같은 패키지 써서 병렬연산 해야 하고
사실 제일 중요한 점은 데이터 처리 속도에 큰 영향을 미치는 요인중 하나가
변수 (Column) 선택과 이에 따른 데이터 용량 증가인데
R은 메모리 연산을 하기 때문에
사용하지도 않을 변수를 잔뜩 탑재했다던가
비효율적인 방식, 예를들어 행연산 중심으로 처리를 시도 한다던가, R 네이티브 함수를 써서 느리다던가
이런 삽질인줄 모르는 삽질을 해서 느리게 느껴지는 경우가 생각보다 많음
대표적인 행연산 삽질이 for문을 돌리는건데
R이 느리다는 소리 나오는 이유 중 하나가 열 연산 함수를 쓰는 개념없이 바로 for문 돌려버리는거 ㄷㄷㄷ
좀더 빠르게 갈려면 apply 쓰거나 c++로 짠 함수 쓰던가, purrr패키지 등을 쓰던가
빠르게 처리할 수 있는 방법이 상당히 많음
문제는 R 기초 교육에서는 이런거 안갈켜줌 'ㅅ'ㅋ
당연히 초보니깐 걍 dplyr 하세염 이런거 갈켜 주고 파이프연산이 편하기도 하니깐
그런데 실전 나가서 백만행만 넘어가도 dplyr쓰면 R이 멈춰버리는 경험 몇 번 하면 생각이 바뀜 ㄷㄷㄷ
그럼 실전말고 배우려면 무슨책을 봐야할까?
실전은 나중에 생각하고 그냥 tidyverse 중심으로 한 dplyr 부터 마스터 하셈 솔직히 R 멈춰버리는건 그 때가서 생각해도 됨 나도 트레이닝 과정까지는 dplyr로 문제 없었음
다만, 어느정도 짬이 쌓이면 열 연산이라는 개념을 연습해나가는게 좋음 그래서 효율적인 처리 플로우를 디자인하는 연습이 되야함 apply함수류나 map을 써보는 연습하는것도 도움되고
결국 케이스바이케이스로 대안 찾는 방식이네 파이썬은 그냥 이거하셈 ㅇㅇ 하면 되는데
이미 솔루션은 정해져있지 간단한건 dplyr, 대용량 DT, 그 이상은 분산처리, 병렬처리 걍 초보들한테는 그까지 가기도 힘드니 안 알려주는 것일 뿐이고
그리고 분석처리 자체가 전처리부터 헬게이트인데 이거 하셈으로 제발 만사 OK되었으면 좋겠따 ㅠㅠ. 하다보면 오만 짓거리 다해야 해서
한국 사람이 쓴 책인데 dplyr랑 data.table 같이 다뤄서 괜춘하다
http://ds.sumeun.org/
파이썬은 귀신같이 이거하셈 ㅇㅇ 으로 추상화 시켜서 만들어놓음 코어만질일 생기면 좆같긴 하지만 ㅋㅋ
너 심평원이나 공단 빅데이터 분석하냐?
ㄴㄴ 사기업
프갤 R 단톡방 생각 없니
나중에 꼭 들어가겠음
나도 올해안에 들어감
ㄱㄱ 나 오프라인 모임도 하나 운영하니까 언제든 콜