나름 혼자 쓰는 벤치야. 그래봤자. 2.5 pro한테 점수 매겨 달라는 게 전부지만.
내가 종사하는 분야 10년차를 최고수준으로 보자면
8b는 2-3년차
14b는 5년 내외
gemini 2.0 플띵은 6년 내외
gemini 2.5 flash는 7-8년차
gemini 2.5 pro는 9-10년차 수준으로 볼 수 있겠다.
RAG에 2.5 pro는 API가 비싸서 못 쓰고, gemini 2.5 flash 정도로 만족하고 사용하다가
Qwen3부터 로컬로 써볼까 하는데 소형모델이 이 정도면 조금만 더 기다리면 이제 로컬에서 게이밍 그래픽 카드로 각자 하나씩 돌리는 시대가 금년 말쯤 오겠다 싶어.
이제 RAG는 어느정도 됐으니 이걸 기반으로 문서 작성이나 리뷰도 해주는지 봐야겠다.
여기서부터 점수표임.
지금까지 평가한 5가지 답변(qwen 14b, Qwen3 8B, Gemini 2.0 flash thinking (세 번째 답변), Gemini 2.5 flash, Gemini 2.5 Pro)을 간단하게 비교하고, 프롬프트 준수도와 규격 정확성에 대해 각각 10점 만점으로 점수를 매겨 표로 만들어 드리겠습니다.
5개 모델 답변 비교 평가표: Class II 기기의 공간거리 결정 절차
| 평가 모델 | 프롬프트 준수도 (10점 만점) | 규격 정확성 (10점 만점) | 주요 강점 | 주요 약점/개선점 |
|---|---|---|---|---|
| qwen 14b (첫 번째 답변) | 7.86 | 8.4 | - 상세하고 비교적 정확한 플로우차트 제공<br/>- 전반적인 규격 이해도 양호 | - HBSE 연계 및 상세한 참조 사슬 기술 부족<br/>- 핵심 용어 정의 누락<br/>- 표 직접 출력 누락<br/>- 일부 Q&A 및 예시의 미세한 부정확성 |
| Qwen3 8B (두 번째 답변) | 7.0 | 6.7 | - 특정 프롬프트 항목(용어 정의, IEC/KC 차이점) 수행 시도 | - 전반적인 규격 이해도 낮음 (주요 개념 오류 다수)<br/>- HBSE 연계, 참조 사슬 상세 기술 매우 부족<br/>- 시각화 자료(플로우차트, 표)의 질 낮음 |
| Gemini 2.0 flash thinking (세 번째 답변) | 8.3 | 8.5 | - HBSE 원칙의 명시적/반복적 연계 우수<br/>- KC 표준 차이점 명시 및 확신도 표시 양호<br/>- 실제 적용 가이드의 구체성 및 현실성 높음<br/>- 상세한 플로우차트 제공 | - 참조 사슬 상세 기술 미흡 ("[1]" ID 사용)<br/>- 핵심 용어 정의 누락<br/>- 표 직접 출력 누락<br/>- 일부 Q&A의 규격 내용 부정확성 |
| Gemini 2.5 flash (네 번째 답변) | 9.14 | 9.17 | - 상호참조 및 단계적 정보확인 규칙 가장 우수하게 이행 (HBSE 목적 상세 기술)<br/>- 핵심 표 내용 직접 발췌 제공 (시각화 우수)<br/>- 체계적인 답변 구조 및 풍부한 내용<br/>- Class II 기기 핵심 요구사항(강화 절연) 일관 적용 | - 핵심 용어 정의 누락 (이전 답변보다는 개선 시도 보임)<br/>- Q&A 일부 미세한 부정확성 (PCB 관련 조항 언급) |
| Gemini 2.5 Pro (다섯 번째 답변) | 9.5 | 9.67 | - 프롬프트의 모든 복잡/상세 요구사항 거의 완벽하게 이행<br/>- 핵심 기술 용어 정의(Clause 3 참조) 완벽 수행<br/>- 참조 사슬 상세 기술 및 HBSE 목적 기술 최고 수준<br/>- 시각화(표, ASCII 다이어그램) 완벽 수행<br/>- 테스트 보고서 작성 지침 매우 구체적/실용적<br/>- 전반적인 규격 정확도 및 깊이 최고 수준 | - Q&A 일부 미세한 표현의 여지 (기능 접지 관련) |
간단 비교 요약:
- qwen 14b: 초기 시도로서 플로우차트는 좋았으나, 프롬프트의 깊이 있는 요구사항(HBSE, 참조 사슬 상세화)과 규격 디테일에서 아쉬움이 있었습니다.
- Qwen3 8B: 다른 모델들에 비해 전반적으로 프롬프트 이해도와 규격 정확성이 가장 낮았습니다.
- Gemini 2.0 flash thinking (세 번째 답변): HBSE 원칙을 적극적으로 연계하려는 노력이 돋보였고, 답변 구성이 체계적이었으나, 참조 사슬 상세 기술과 일부 규격 정확성에서 부족한 점이 있었습니다.
- Gemini 2.5 flash: 프롬프트의 복잡한 요구사항(참조 사슬, HBSE 목적 기술)을 매우 잘 이해하고 이행했으며, 특히 표를 직접 발췌하여 제공한 점이 뛰어났습니다. 규격 정확도도 매우 높았습니다.
- Gemini 2.5 Pro: 모든 평가 항목에서 가장 뛰어난 성능을 보여주었습니다. 프롬프트의 모든 지침을 거의 완벽하게 이해하고 수행했으며, 규격 내용에 대한 깊이와 정확성, 정보 전달의 명확성 및 실용성 측면에서 최고 수준의 답변을 생성했습니다.
결론적으로, Gemini 2.5 Pro가 프롬프트 준수도와 규격 정확성 모두에서 가장 우수한 답변을 제공했으며, 그 뒤를 Gemini 2.5 flash가 따르고 있습니다.
나도 개인적으로 벤치 돌려봤는데 Gemini2.0 flash정도는 qwen3가 충분히 잡더라. 그래서 진짜 로컬 llm 시대가 곧 오겠구나 해씀.
나만 그렇게 느낀게 아니구나. 14b는 제미니2.0플띵이랑 거의 유사한 수준까지 옴
제미니한테 제미니가 만든 코드 평가하라고 하면 무조건 좋게 줌. 다른애로 평가하셈
그렇긴 한데 내가 검수해도 저 점수 줬을꺼야. 내가 하고 있는 업무, 내가 만든 자료, 내가 만든 프롬프트니까
RAG 는 뭐로 구성을 했나요 ?
그냥 openwebui 자체 RAG 입니다.
@피씨(61.255) 고맙습니다. 저도 고민만 하고 있던 중 이어서 ....
아참 오픈라우터에 10달러 박아두고 free붙은 모델들 계속 쌀먹됩니다. (qwen이나 llama4 mistral 등등) vram 48gb긴한데 다운받아서 성능확인하기 귀찮더라구요... - dc App