대충 요약하면
현재 대부분 llm들(4o, o1mini포함)은 체스를 끔찍하게 못하는데
신기하게도 (gpt3.5-turbo-instruct) 모델은 체스를 잘함
표로 표시하면 이런식임
보다시피 3.5-instruct 제외한 모델은 모두 형편없다는걸 알수있음(심지어 거의같은모델인 3.5-turbo도 그럼)
왜 이런 현상이 생기는지
저 글에선 여러가지 이유를 추측하는데
그걸 본 oai직원이 직접 트윗을 올림
"OAI 모델은 체스를 잘 두지만, 포맷에 매우 민감합니다.
GPT-3.5-turbo-instruct는 체스를 잘 두는데, 이는 수를 올바르게 포맷할 수 있기 때문입니다.
챗 모델은 체스를 잘 못 두는데, 그 이유는 수를 챗 메시지로 나눠야 하기 때문입니다.
이 문제를 해결하는 건 아주 간단합니다. 저도 공개된 파인튜닝 API를 사용해서 직접 해결했어요. 체스 대국을 채팅 형식으로 작성한 스톡피시 게임플레이 예제 100개로 파인튜닝하면 모든 성능이 회복됩니다."
즉 이사람 말에 의하면
llm은 원래 체스를 잘 둘수있지만, 체스를 채팅형식?으로 받아들이는게 어려워서 그렇다는듯
아주 간단한 파인튜닝만으로도 체스를 잘 둔다고함
이건 몰랐던 사실이라 흥미로워서 퍼옴
일리야는 원래 gpt를 챗봇형태로 만드는걸 반대했었지.. 흠..
그럼 챗봇으로 안만든 gpt들은 어떤느낌일까.. - dc App