댓글들간의 유사도를 구해서 댓글들을 클러스터링 해야하는데요.


첫 번째 질문은 댓글 하나를 표현하기 위해서는 여러 개의 단어들이 모여 있을텐데 word2vec으로 단어들의 벡터 값을 구할 수는 있는데 클러스터링을 하려면 n차원의 벡터로 표현된 하나의 좌표가 필요하잖아요. 그래서 단어가 아니라 댓글을 벡터로 표현하려면 어떻게 해야할지를 모르겠어요.


두 번째는 보통 k-means를 사용해서 클러스터링을 할 때 단어간의 유클리드 거리를 이용해서 중심점을 기준으로 군집화를 하는 거잖아요. 근데 이 경우에는 그 단어들의 집합인 댓글들간의 클러스터링을 해야하는거라 댓글들간의 유사도를 구해서 클러스터링을 해야할텐데 보통은 그냥 유클리드 거리를 넣어서 처리하는데 따로 공식을 사용해서 구한(유사도는 구해놨어요) 유사도를 클러스터링에 어떻게 적용 시키는지 궁금합니다.