Medprompt는 프롬프트 작업 여러개 섞은 거던데 (퓨샷, cot ,앙상블 등등 ㅋㅋ)
좀 많이 귀찮은 작업이더라 아무튼 그래도 프리뷰 제로샷에는 당해내질 못함 , 짧은 질문보다 긴 질 문에서 더 차이가 많이 났음 , 역시 추론 능력이 뛰어나니 복잡한 질문에 특화된듯?
논문에서
o1 프리뷰도 여러가지 프롬프트를 사용했는데
제일 효과가 좋은건 역시 그냥 여러번 돌려서 가장 많은 빈도로 뽑은 답을 최종 답으로 채택하는 방식임, 의대 벤치마크 뿐 아니라 aime 도 openai가 64개 샘플중 다수결 답변 채택 방식을 써서 점수를 10점 이 상 올림 근데 이 방식은 일반 사용자는 일주일에 50개가 한도인데 한 문제를 여러번 돌리는 건 못 써먹을듯
그다음은 최적화된 프롬프트를 쓰는건데 극적이진 않아도 성능향상이 있었음
예시를 들어 설명하는건 오히려 모델 성능을 악화시켰음, 앞으로 o1 쓸때도 예시는 들지 말자 ㅋㅋㅋ
댓글 1