0e91ff10c4ed61e87eb1d19528d52703d2580ea431de8c




네이버가 조용히 'HCX-005' 모델로 업데이트한 하이퍼클로바X. 클로바 스튜디오에 자세한 모델 설명이나 벤치마크도 없었음.


"소버린 AI"를 강조하는 네이버. 하이퍼클로바X의 신모델 성능은 어떨까? 궁금해서 직접 테스트 해보기로 함.






--- 1. 막강한 검열 ---

2eb1df30e492209939f1c6bb11f11a3953a3fe2920ea6d8aaf



토크나이저 테스트를 위한 요청도 "개인정보"를 위해 거절하는 모습





2eb1df30e492209938f1c6bb11f11a3958a9eeb1bf1c85c5c2



민수, 철수, 민아가 가족이 아니라는 사실을 마지막 결론에서 스스로 부정하는 모습






2-1. 회전 육각형 벤치 (GPT-4.1)



3fbeef74abd531a04e81d2b628f1776c16181189dc






2-2. 회전 육각형 벤치 (Cohere Command A)



1f9eef75abd531a04e81d2b628f1756f44fb2ccf







2-3. 회전 육각형 벤치 (Llama 4 Maverick)



3fbeef77abd531a04e81d2b628f1756d99c8fe93a5






2-4. 회전 육각형 벤치 {HCX-005(하이퍼클로바 X)}



2eb1df30e4ed6fe87eb1d19528d52703ca3fc4a207ef






--- 3. 효율적인 토크나이저 ---



0eb1df30e49220993ff1c6bb11f11a390effd26ede4d566e



2eb1df30e49220993af1c6bb11f11a397ee1ae7d72105ef2



2eb1df30e49220993bf1c6bb11f11a39b564a7dbb1f7ee37



'안녕하세요', '뛰어넘'등 동사+명사를 1개의 토큰으로 읽는 하이퍼클로바. 덕분에 GPT나 Cohere와 비교했을때 약 10%정도 적은 토큰을 씀. (66 VS 60)




--- 결론 ---

코딩, 추론 성능에서 글로벌 '비추론'모델에도 크게 밀리는 성능을 보여준다. 


네이버의 방대한 뉴스, 네이버 카페와 블로그 글을 학습했기 때문에 좋은 글쓰기 성능이 기대되지만, 거의 모든 요청을 검열당해 제대로 된 테스트를 할 수가 없었음. 


가격은 입출력(1250/5000원). 돈이 많고 애국심이 강한 특붕이들 전용 모델이다.