그걸 웬만해서는 분간하기도 힘들고..


이걸 r1-zero 요령으로 강화학습해서


LLM이 X정보 서치해서 정답을 내도록 강화학습시키면


자동적으로 거짓 정보랑 진짜 정보 구분하는 능력 창발될 텐데


이럼 엄청난 뭔가가 나오지 않을지...


분명 차세대 Grok 모델 학습에 이런 식으로 X정보 이용할 거 같긴 함