일단 이런 글이 있었음


대충 요약하면

현재 대부분 llm들(4o, o1mini포함)은 체스를 끔찍하게 못하는데

신기하게도 (gpt3.5-turbo-instruct) 모델은 체스를 잘함


표로 표시하면 이런식임

보다시피 3.5-instruct 제외한 모델은 모두 형편없다는걸 알수있음(심지어 거의같은모델인 3.5-turbo도 그럼)

왜 이런 현상이 생기는지

저 글에선 여러가지 이유를 추측하는데

그걸 본 oai직원이 직접 트윗을 올림

"OAI 모델은 체스를 잘 두지만, 포맷에 매우 민감합니다.

GPT-3.5-turbo-instruct는 체스를 잘 두는데, 이는 수를 올바르게 포맷할 수 있기 때문입니다.

챗 모델은 체스를 잘 못 두는데, 그 이유는 수를 챗 메시지로 나눠야 하기 때문입니다.

이 문제를 해결하는 건 아주 간단합니다. 저도 공개된 파인튜닝 API를 사용해서 직접 해결했어요. 체스 대국을 채팅 형식으로 작성한 스톡피시 게임플레이 예제 100개로 파인튜닝하면 모든 성능이 회복됩니다."


즉 이사람 말에 의하면

llm은 원래 체스를 잘 둘수있지만, 체스를 채팅형식?으로 받아들이는게 어려워서 그렇다는듯

아주 간단한 파인튜닝만으로도 체스를 잘 둔다고함

이건 몰랐던 사실이라 흥미로워서 퍼옴