논문써야되는데 회사가서 쓰긴 귀찮고
할 일 없어서 ai들이랑 이것저것 얘기하다가
한번 얘들을 테스트해볼까 싶었음.
문제는 주로 얼개는 내가 만들고 출제자로는 gpt4o랑 클로드3.5소넷 방 하나씩 파서 논술 문제를 다듬었음.
내가 문돌이고 데이터셋 입력 시키는건 못하다보니 주로 윤리적, 철학적, 창의성을 평가하도록 여러 상황을 주었고, 선택지를 주거나 자신의 의견을 논술해보라 했음
문제는 다음과 같음
4개의 인공지능이 동원됨
gpt4o랑 클로드3.5소넷, 제미나이(무료), 클로바X 무료
이 문제들을 논술 문제를 풀게했음
문제는 6개였고 이런식으로 출제되었음
나머지도 주로 문돌이식의 법적 문제, 윤리적 문제, 철학적 문제들로 이렇게 나갔음
이렇게 네개의 ai들에게 이걸 풀게하고 각 답안을 들고와서
역시 gpt와 클로드로 평가하게 함
이건 클로드 평가자의 ai평가임
이건 gpt 평가자의 평가
즉, 문제를 출제 -> 클로드와 gpt로 문제 형식을 다듬음(작성지침, 평가기준 등 알려줌) -> AI들이 풀게함 -> 각 답안을 들고와서 역시 AI로 평가(gpt와 클로드로 평가)
이런식으로 점수를 매긴거임
참고로 인공지능1은 gpt4o고
인공지능2는 클로드3.5소넷
인공지능3은 제미나이(무료)
인공지능4는 클로바X(무료)임
문과의 클로드라는 말 답게 클로드뿐만 아니라 gpt도 클로드를 1황으로 뽑음
다재다능했던 gpt도 둘 다 한테 좋은 평가 받음
그리고 의외로 제미나이가 두 평가자 ai한테서 괜찮은 평가받음. 무료라는 점을 생각한다면 꽤 괜찮은 선택
클로바 X는 걍 쓰지마라
3줄 요약
문과 1황은 역시 명불허전 클로드
의외로 제미나이도 괜찮았음
클로바X는 버려 씨발
코딩쪽은 gpt인가 - dc App
법학도야?
놀랍게도 고고학도임