사회

엔씨소프트, 국내 최초 LLM 성능 검증 평가모델 ‘VARCO Judge LLM’ 출시

한진이 기자
입력
수정
e32a995ed2ffaf4e8c833dd5d1047915
엔씨소프트 사옥. 사진=엔씨소프트

엔씨소프트(공동대표 김택진, 박병무)는 국내 최초로 거대언어모델(LLM)의 성능과 수행능력을 검증할 수 있는 평가모델 ‘VARCO Judge LLM’을 출시했다고 밝혔다.

‘VARCO Judge LLM’은 다양한 LLM이 작업을 얼마나 정확하고 빠르게 수행하는지를 평가하는 모델로, 기업들이 시장에서 서비스 중인 여러 유형과 규모의 LLM 가운데 자사 AI 서비스에 적합한 모델을 효율적으로 검증할 수 있도록 돕는다.

엔씨소프트 측은 ‘VARCO Judge LLM’이 뛰어난 한국어 처리 능력과 LLM 편향(Bias) 문제 해결 능력을 갖췄으며, 동급 모델 중 최고 수준의 성능을 보유하고 있다고 설명했다. 올해 글로벌 NLP 학회인 EMNLP(Empirical Methods in Natural Language Processing)에 LLM 평가모델 관련 논문을 게재하며 국제적으로 기술력을 입증한 바 있다.

이 모델을 활용하면 AI 서비스 기업은 다양한 LLM의 품질을 빠르게 비교·평가해 최적화된 모델을 선택할 수 있으며, AI 연구개발 기업은 자사 LLM의 성능을 검증하고 개선점을 빠르게 보완할 수 있다. 또한 모델 허브(Model Hub) 사업자는 LLM 선택과 최적화, 배포 과정을 가속화할 수 있다.

엔씨소프트는 이번 평가모델 출시를 통해 자체 LLM ‘바르코(VARCO)’의 품질 향상뿐만 아니라 LLM 평가 분야에서도 선도적 위치를 확보한다는 계획이다.

NC Research 이연수 본부장은 “빠르게 진화하는 AI 시장에서 산업별 최적 모델을 선별·적용하는 서비스의 중요성이 커지고 있다”며 “VARCO Judge LLM은 기존 LLM 기반 서비스 품질 향상을 넘어 AI 비즈니스에서 필수 도구로 자리잡을 것”이라고 말했다.
 

한진이 기자
share-band
밴드
URL복사