프리트레이닝하는데 임베딩 384, 레이어 6층, 시퀀스 256를OpenMathInstruct-2 해당 데이터 셋으로 한다는 가정하에 1기가 이하의 gpu메모리로 돌릴 수 있을까 아님 3070기준 초당 토큰 처리를 5000에서 3~4만까지 올려본다던지 배치는 4로 하면 가능할까

- dc official App