완전 초보자라서 오개념이 있으면 잡아줘 ㅜ

내가 이해한 대로 설명해볼게.


머신러닝의 목표는


D= {(x_i, y_i)_{i in I}}의 (어떤 분야에서의) 데이터 셋이 주어졌을 때(x_i와 y_i는 각각 topological space X,Y의 원소들)

f를 구성하여 f(x_i)를 (y_i)와 가깝게, 더 나아가서 D에 속하지 않는 다른 (x_j, y_j)에 대해서도 f가 잘 ``근사''하길 바라는 거야.


근사한다는 것이 D에서 정의된 어떤 함수의 expectation(loss function을 고정했을 때)의 최솟값을 구하는 거라서

D에 (probability) measure를 줘야 하는데(조금 더 자세히 말하자면, 나는 데이터 셋이 속한 ``어떤 분야''라는 것이 정해지면 X times Y 안에 어떤 C가 주어져서 임의의 data set이 C에 속한다고 생각하거든. 그래서 정확히는 C에 measure를 주는거지) , D가 product topology로부터 induced 되는 measure space는 아닌 것 같거든.


그런데 expectation의 최솟값을 구하려면, 어찌되었든 expectation이 정의되어야 하니까 결국 D의 measure에 대한 어떤 정보가 있어야 할 것 같아.


그래서 나의 질문이 뭐냐면, D(더 나아가서 C)에 정의된 measure를 모르면서, 이 문제를 어떻게 해결할 수 있느냐야.


읽어줘서 고마워!