지시의 정확한 수행
사용자의 의도 독자적 추론 및 해석
이 두 개가 하나를 챙기면 다른 하나가 약해지는 구조긴 하지만 둘 다 굉장히 중요하단 말임
시키는 것만 곧이곧대로 하는 모델도 별로고, 지멋대로 폭주하는 모델도 별로임
이 둘 사이의 밸런스를 얼마나 잘 잡았냐 하는 걸 측정하는 벤치마크도 필요할 것 같음
누가 봐도 사용자가 표현을 잘못한 건데 그걸 그대로 수행하는 모델에게는 점수를 깎는 식으로
이게 얼핏 보기엔 주관적인 것 같아도 충분히 정량화할 수 있다고 봄 나는
댓글 0