그냥 pd.to_excel이나 pd.to_csv로 저장한 다음에 어디 SQL로 보내던 아니면 클라우드에 저장하던 해야지
익명(125.191)2022-12-11 18:31
답글
파이프라인이 뭐 그렇게 거창한게 아니고 필요한 파일 꺼내오려고 구글 클라우드나 드라이브랑 연동하는 것 자체가 pipeline임
익명(125.191)2022-12-11 18:32
답글
그리고 웹 스크래핑도 코드 짜는거에 따라 다른데 내가 짠건 200페이지/분 정도니까 시간을 대충 예상해야 함
익명(125.191)2022-12-11 18:35
답글
크롤링 짜는건 직접하려다가..그냥 기성품 쓰기로 했어요. 노코드 툴들 많더라구요..
익명(218.38)2022-12-11 18:38
답글
야니면 pd.to_sql도 있는데 호환률은 이쪽이 더 높겠다 어느 쪽이건 DataFrame 변환 후에 저장만 할 수 있으면 파이프라인도 그렇게 안어려움
익명(125.191)2022-12-11 18:38
답글
클라우드는 그 노코드 툴 제공하는 곳에서 주는 클라우드로 할지..따로 클라우드 할지 생각중입니다.
익명(218.38)2022-12-11 18:38
답글
어 기성품 쓰는게 정신건강에 좋음 이미 구글 클라우드만 해도 Pipeline Wizard GUI가 있어서 클릭만으로 뚝딱 구축함
익명(125.191)2022-12-11 18:39
답글
음...Pipeline Wizard GUI 이거 아직 안해봤는데 이거만 파면 다 해결되나여
익명(218.38)2022-12-11 18:40
답글
근데 데이터 저장할때 Json/Excel/CSV 중에 어느걸로 저장되게 하는게 제일 편함?
익명(218.38)2022-12-11 18:41
답글
그거 일단 Google Cloud에서 BigQuery나 Looker로 들어가면 데이터 들여오라고 할텐데 거기서 GUI가 등장할거임
익명(125.191)2022-12-11 18:42
답글
표준은 csv임 json은 좀 까다롭고 사실 NoSQL 최적화임 xlsx도 많이 쓰이지만 csv한테 밀리고
익명(125.191)2022-12-11 18:43
답글
Google Cloud에서 BigQuery나 Looker -- 이거 공부하는데 오래 걸림??
익명(218.38)2022-12-11 18:43
답글
뭔지 모르겠으면 그냥 csv 국룰
익명(125.191)2022-12-11 18:43
답글
ok그럼 csv로 할게여..
익명(218.38)2022-12-11 18:44
답글
BigQuery 자체는 RDBMS임 SQL 공부하면 어차피 별도로 공부 안해도 됨 Looker는 Tableau 경쟁자인데 개인적으로는 Looker가 훨 편함
익명(125.191)2022-12-11 18:44
답글
태블로는 써본적 있슴요...근데 여전히 공부안하니까 뭐 어케 해야될지 감은 안오는군요
익명(218.38)2022-12-11 18:47
답글
아파치나 flink는 필요 없나연
익명(218.38)2022-12-11 18:47
답글
일단 난도만 따지면 SQL이 엑셀급이니까 SQL 부터 배워 의외로 실무자들이 엄청 선호해서 마케팅 자격증 한두개랑 SQL 자격증 따놓으면 스펙이 엄청 탄탄해짐
익명(125.191)2022-12-11 18:48
답글
hadoop이랑 spark? 굳이 안배워도 됨 어차피 지금 메타는 죄다 클라우드 서비스로 옮겨갔는데 무리하게 알 필요가 있나?
익명(125.191)2022-12-11 18:49
답글
음..근데 다시 한번 좀 정리 좀 해야되는게...그 크롤러 회사에서 제공하는 클라우드는 안쓰는게 맞겠지?( 유통기한같은게 있는거 같음) 로컬로 받아서 내 클라우드에 넣어야 되는게 맞는건지..그렇다면 카페24 클라우드 써야되는지 구글클라우드 써야되는지..뭐 이런거 모르겠슴
익명(218.38)2022-12-11 18:51
답글
보통은 규모가 있거나 생각이 있는 회사라면 구글 클라우드로 가려고 할텐데 그게 아니라면 업무용 컴퓨터 받아서라도 웹 스크래퍼 코드 돌려야함 이거 생각보다 컴 성능 잡아먹는 귀신이라 좋은거 안쓰면 분석 못함
익명(125.191)2022-12-11 18:54
답글
크롤러 자체는 기성품 쓰는건데?? 무슨 얘기인지 혼돈...;;
익명(218.38)2022-12-11 18:56
답글
아 크롤러 얘기였네 기성품이면 그냥 개인컴과 회사컴 둘 다 박고 익숙해질 때까지 연습하렴
익명(125.191)2022-12-11 18:58
답글
Hadoop이랑 Spark를 어떻게 몰라도 됨? 클라우드라고 한들 GKE 등 VM위 여러 Node 병렬 클러스터 구성하는게 사실 당연한건데.. 데이터가 TB, PB 등 커지면 커질수록 M/R 필수인데 M/R 안쓰고 Spark를 쓰지만
??(125.186)2022-12-11 19:00
답글
박는다는게 크롤러 쓰라는건가요? 크롤러는 그냥 그 회사 서버로 돌리는거 아닌가요? 물리 컴퓨터 갯수랑은 상관없는거 같은데..
익명(218.38)2022-12-11 19:00
답글
ㄴ 그런 생각으로 요구하는게 헬조센 색히들인데 팩트는 SQL query 최적화나 잘하는게 우선임 서버나 데이터베이스 조금이라도 깊게 파기 시작하면 못빠져나온다
익명(125.191)2022-12-11 19:01
답글
218/ 회사 서버도 씀 근데 그건 기성품 크롤러이기 때문에 개인적으로 써보면서 연습도 필요함
익명(125.191)2022-12-11 19:03
답글
서버 쪽은 서버 엔지니어가 따로 있거나 Hadoop(HDFS) 등 데엔 쪽에서 Infra 영역으로 들어감. 흔히 말하는 데이터 엔지니어는 HDFS에서 Data Warehouse 사이 파이프라인 영역이고. Warehouse는 대부분 Bigquery(OLAP)를 사용하는데 일단 데이터가 개 많은 기업들이 사용함. 이 파이프라인에서는 Spark, Airflow, Kafka(MQ), NoSQL/SQL는 필수라고 생각. 그리고 이쪽은 워낙 핫한 분야라 알고/자료는 기본깔고가야함. + 신입 진입장벽 매우 높음
??(125.186)2022-12-11 19:09
답글
SQL 기본인 거 맞는데 튜닝 말씀하시는 거면 튜닝까지 요구 안함. 그건 DBA나 서버쪽 영역 DE은 기본적으로 Distributed System + Cloud Cluster를 깔고 가기 때문에 RDB 잘 사용안함. SQL은 많이 쓰이지만. Scale Out 방식의 NoSQL을 더 선호하지. 물론 RDB를 쓰는 경우도 존재
??(125.186)2022-12-11 19:12
답글
그 높은건 헬조센이라 그런거고요 그 병신들은 엔지니어랑 애널리스트 차이도 모르고 엔지니어한테 애널리스트 역량도 요구하는 작자들임 근데 애널리스트 하려면 마케팅과 재무도 파야지
그냥 pd.to_excel이나 pd.to_csv로 저장한 다음에 어디 SQL로 보내던 아니면 클라우드에 저장하던 해야지
파이프라인이 뭐 그렇게 거창한게 아니고 필요한 파일 꺼내오려고 구글 클라우드나 드라이브랑 연동하는 것 자체가 pipeline임
그리고 웹 스크래핑도 코드 짜는거에 따라 다른데 내가 짠건 200페이지/분 정도니까 시간을 대충 예상해야 함
크롤링 짜는건 직접하려다가..그냥 기성품 쓰기로 했어요. 노코드 툴들 많더라구요..
야니면 pd.to_sql도 있는데 호환률은 이쪽이 더 높겠다 어느 쪽이건 DataFrame 변환 후에 저장만 할 수 있으면 파이프라인도 그렇게 안어려움
클라우드는 그 노코드 툴 제공하는 곳에서 주는 클라우드로 할지..따로 클라우드 할지 생각중입니다.
어 기성품 쓰는게 정신건강에 좋음 이미 구글 클라우드만 해도 Pipeline Wizard GUI가 있어서 클릭만으로 뚝딱 구축함
음...Pipeline Wizard GUI 이거 아직 안해봤는데 이거만 파면 다 해결되나여
근데 데이터 저장할때 Json/Excel/CSV 중에 어느걸로 저장되게 하는게 제일 편함?
그거 일단 Google Cloud에서 BigQuery나 Looker로 들어가면 데이터 들여오라고 할텐데 거기서 GUI가 등장할거임
표준은 csv임 json은 좀 까다롭고 사실 NoSQL 최적화임 xlsx도 많이 쓰이지만 csv한테 밀리고
Google Cloud에서 BigQuery나 Looker -- 이거 공부하는데 오래 걸림??
뭔지 모르겠으면 그냥 csv 국룰
ok그럼 csv로 할게여..
BigQuery 자체는 RDBMS임 SQL 공부하면 어차피 별도로 공부 안해도 됨 Looker는 Tableau 경쟁자인데 개인적으로는 Looker가 훨 편함
태블로는 써본적 있슴요...근데 여전히 공부안하니까 뭐 어케 해야될지 감은 안오는군요
아파치나 flink는 필요 없나연
일단 난도만 따지면 SQL이 엑셀급이니까 SQL 부터 배워 의외로 실무자들이 엄청 선호해서 마케팅 자격증 한두개랑 SQL 자격증 따놓으면 스펙이 엄청 탄탄해짐
hadoop이랑 spark? 굳이 안배워도 됨 어차피 지금 메타는 죄다 클라우드 서비스로 옮겨갔는데 무리하게 알 필요가 있나?
음..근데 다시 한번 좀 정리 좀 해야되는게...그 크롤러 회사에서 제공하는 클라우드는 안쓰는게 맞겠지?( 유통기한같은게 있는거 같음) 로컬로 받아서 내 클라우드에 넣어야 되는게 맞는건지..그렇다면 카페24 클라우드 써야되는지 구글클라우드 써야되는지..뭐 이런거 모르겠슴
보통은 규모가 있거나 생각이 있는 회사라면 구글 클라우드로 가려고 할텐데 그게 아니라면 업무용 컴퓨터 받아서라도 웹 스크래퍼 코드 돌려야함 이거 생각보다 컴 성능 잡아먹는 귀신이라 좋은거 안쓰면 분석 못함
크롤러 자체는 기성품 쓰는건데?? 무슨 얘기인지 혼돈...;;
아 크롤러 얘기였네 기성품이면 그냥 개인컴과 회사컴 둘 다 박고 익숙해질 때까지 연습하렴
Hadoop이랑 Spark를 어떻게 몰라도 됨? 클라우드라고 한들 GKE 등 VM위 여러 Node 병렬 클러스터 구성하는게 사실 당연한건데.. 데이터가 TB, PB 등 커지면 커질수록 M/R 필수인데 M/R 안쓰고 Spark를 쓰지만
박는다는게 크롤러 쓰라는건가요? 크롤러는 그냥 그 회사 서버로 돌리는거 아닌가요? 물리 컴퓨터 갯수랑은 상관없는거 같은데..
ㄴ 그런 생각으로 요구하는게 헬조센 색히들인데 팩트는 SQL query 최적화나 잘하는게 우선임 서버나 데이터베이스 조금이라도 깊게 파기 시작하면 못빠져나온다
218/ 회사 서버도 씀 근데 그건 기성품 크롤러이기 때문에 개인적으로 써보면서 연습도 필요함
서버 쪽은 서버 엔지니어가 따로 있거나 Hadoop(HDFS) 등 데엔 쪽에서 Infra 영역으로 들어감. 흔히 말하는 데이터 엔지니어는 HDFS에서 Data Warehouse 사이 파이프라인 영역이고. Warehouse는 대부분 Bigquery(OLAP)를 사용하는데 일단 데이터가 개 많은 기업들이 사용함. 이 파이프라인에서는 Spark, Airflow, Kafka(MQ), NoSQL/SQL는 필수라고 생각. 그리고 이쪽은 워낙 핫한 분야라 알고/자료는 기본깔고가야함. + 신입 진입장벽 매우 높음
SQL 기본인 거 맞는데 튜닝 말씀하시는 거면 튜닝까지 요구 안함. 그건 DBA나 서버쪽 영역 DE은 기본적으로 Distributed System + Cloud Cluster를 깔고 가기 때문에 RDB 잘 사용안함. SQL은 많이 쓰이지만. Scale Out 방식의 NoSQL을 더 선호하지. 물론 RDB를 쓰는 경우도 존재
그 높은건 헬조센이라 그런거고요 그 병신들은 엔지니어랑 애널리스트 차이도 모르고 엔지니어한테 애널리스트 역량도 요구하는 작자들임 근데 애널리스트 하려면 마케팅과 재무도 파야지
심지어 사이언스한테 엔지니어 역량 요구하는 공고도 봤다 존나 엉망진창임
https://careers.google.com/jobs/results/96274776009384646-customer-engineer-data-analytics-digital-natives-google-cloud/?company=Google&company=YouTube&employment_type=FULL_TIME&gclid=Cj0KCQiAnNacBhDvARIsABnDa6_2TfcBPlEQDVa35WGchRA2nZCkX1VxpoKXwcDSTg5vDK63TjupI5kaAp-YEALw_wcB&gclsrc=aw.ds&hl=en_US&jlo=en_US&location=South%20Korea&q=&sort_by=relevance&src=Online%2FHouse%20Ads%2FBKWS_Cloud_APAC
구글 DA 공고. 얘네도 DA한테 DE 역량 요구함. 그냥 데이터나 AI는 일반 개발자영역이 아님. 여러명의 협동도 중요하지만 한 명의 극상위 개발자가 훨씬 중요하다고 생각..
검색이나 똑바로 하세요 좀 저건 Bachelor of Data Science 계열인데 이것도 Business Insight 도출이냐 아니면 다른거 도출이냐 따라서 같은 DA인데도 왓다갔다함
그리고 DA한테 DE 역량 운운하는데 현실은 인사이트에서 솔루션 찾는거 때문에 마케팅과 회계 못하면 바로 컷임 DE 부족한건 극복이 되지만 마케팅 회계는 얄짤없다 DA에서 안봐줌
그냥 찾기 귀찮아서 가장 상단에꺼 갖고 오긴 했는데 저 틀에서 크게 다르지 않아요..
당연히 Engineer가 아니라 Analytics영역이니까 가장 메인인 부분이 없으면 얄짤없긴 하죠 근데 추가적으로 ETL, Data Engineer 역량은 공통적으로 요구하는 바라는 걸 말해주고 싶었을 뿐이에요
크게 다르긴 뭐가 달라 요요 DA가 뭔지 이해 자체를 안한 모양이네 아무리 영역이 겹쳐도 DE는 로우 레벨 DA는 하이 레벨인데
로우 하이는 무슨 근거로 정하신 거죠?
아직 감은 잘 안오지만 답변들 감사요