이런 식으로 질문을 던졌을때 나오는 퀴즈의 퀄리티를 측정할 예정임


아래는 요청하신 영문 텍스트의 한글 번역입니다.

저는 AI 엔지니어로 일하고 있고, 곧 AI 기술 검증을 위한 면접관으로 면접에 참여할 예정입니다. 저는 AI 퀴즈가 좋은 평가 기준이 될 수 있다고 제안했습니다. 그래서 이 퀴즈의 난이도와 타당성을 평가해 주었으면 하고, 이와 비슷하게 더 어려운 퀴즈도 만들어 주셨으면 합니다. 다만, 의사결정 경계의 날카로움에 대한 직관이나 데이터 분포 간의 차이에 대한 기본 이해처럼 특정 영역에 치우친 문제는 만들지 말아 주세요. 그리고 너무 어려운 용어도 사용하지 않았으면 합니다. 그런 용어들은 이해력보다는 지식의 유무를 평가하게 되기 때문입니다.

문제 1 (도표와 함께)

이진 분류 딥 모델 y=fθ(⋅)y = f_{\theta}(\cdot)가 있고, θ\theta는 모델의 파라미터입니다. 그리고 모델 fθf_{\theta}의 손실 함수 L(⋅)L(\cdot)가 있습니다. 입력 데이터 X∈Rn×dX \in \mathbb{R}^{n \times d}가 주어져 있고, 이때 α=L(fθ1(X))=L(fθ2(X))\alpha = L(f_{\theta_1}(X)) = L(f_{\theta_2}(X))을 만족하며, 그 곡률은 그림으로 나타나 있습니다. 각 결정 경계(decision boundary)는 어떻게 그려질 수 있을까요? 데이터 포인트 xi∈Rdx_i \in \mathbb{R}^d가 입력 데이터 XX 중 하나라고 합시다. fθ1(⋅)f_{\theta_1}(\cdot)fθ2(⋅)f_{\theta_2}(\cdot)의 2차원 공간상에서의 결정 경계 차이점에 대해 서술해 주세요. (데이터 포인트들은 2차원 공간상에 놓일 수 있다고 가정)

문제 2
nn개의 데이터 포인트 X∈Rn×dX \in \mathbb{R}^{n \times d}가 주어져 있고, 각 행 xx는 아래 규칙으로 생성됩니다.

x=[e1,e2,...,ed]x = [e_1, e_2, ..., e_d], 단 ei∼Uniform(0,1)e_i \sim Uniform(0,1)

또한 gtraing_{train}은 모든 가능한 xx를 샘플링할 수 있는 균등 분포입니다.

데이터 포인트 xx{0,1,2}\{0,1,2\}의 값을 가질 수 있는 레이블 yy와 쌍을 이루며, “페어링 규칙 3”은 다음과 같이 정의됩니다.

  • 0 <= eie_i < 0.1을 만족하는 요소의 개수가 나머지보다 많으면 y=0y = 0

  • 0.1 <= eie_i <= 0.9을 만족하는 요소의 개수가 나머지보다 많으면 y=1y = 1

  • 0.9 < eie_i <= 1을 만족하는 요소의 개수가 나머지보다 많으면 y=2y = 2

만약 레이블을 결정할 수 없으면(즉, 동점인 경우) xx를 다시 샘플링합니다.

예를 들어, d=3d = 3이고 xj=[0.4,0.3,0.7]x_j = [0.4, 0.3, 0.7]이면 yj=1y_j = 1; xk=[0.0,0.09,0.6]x_k = [0.0, 0.09, 0.6]이면 yk=0y_k = 0입니다.

d=kd = k일 때, gtraing_{train}에서 nn개의 값을 샘플링하여 페어링 규칙을 적용해 데이터셋 DtrainD_{train}을 만듭니다. 그 다음, 자기 지도 학습(self-supervised learning) 형태로 DtrainD_{train}에서 레이블 yy를 제거하고, 각 행의 약 20%를 임의로 마스킹(masking)한 후, 신경망 모델 ff를 그래디언트 하강법으로 재구성 손실(reconstruction loss)을 최소화하도록 학습합니다. 학습 중 일정 간격마다, gtraing_{train}에서 샘플링한 별도의 검증 데이터셋 dvalidationd_{validation}에 대해 손실을 평가합니다. 손실은 마스킹된 위치에 대한 RMSE(제곱 오차의 제곱근)로, 마스킹된 요소의 개수로 정규화됩니다. 이 검증 손실의 기대값(expected value)은 kk에 대해 얼마인가요?



o3는 생각보다 그렇게 재밌는 문제를 만들지 못했음. 이정도 수준이었음


Question C – Precision/Recall trap

You have a heavily imbalanced fraud-detection dataset (0.2 % positives). Two models score as follows on the same test set:

ModelPrecisionRecall
M10.110.80
M20.300.25

You must choose one for deployment where each false negative costs $1000 and each false positive costs $5.
(a) Compute the expected cost per 100 000 transactions for each model.
(b) State which model you would deploy and why, in one sentence.


이거보단 낫겠지?