퍼플렉시티(Perplexity)의 문맥형 임베딩 모델이 문서 검색 벤치마크에서 nDCG@10 81.96%를 기록했다. 문서 조각을 따로 처리하는 방식과 달리 전체 문서의 맥락을 반영해 검색증강생성(RAG) 시스템의 검색 품질을 높이는 방식이다.
퍼플렉시티는 2026년 2월 26일 표준 검색용 ‘pplx-embed-v1’과 문맥형 검색용 ‘pplx-embed-context-v1’을 공개했다. 두 모델군은 0.6B와 4B 매개변수 버전으로 제공되며 MIT 라이선스와 API를 지원한다고 공식 발표했다.
문맥형 모델은 긴 문서를 여러 조각으로 나눌 때 각 조각을 독립적으로 임베딩하지 않는다. 앞뒤 문장과 문서 전체 정보를 함께 반영해 대명사나 기업명처럼 조각만 보면 의미가 불분명한 표현을 구분한다.
예를 들어 ‘그는 1804년 황제가 됐다’는 문장만 따로 처리하면 대상을 찾기 어렵다. 문서 앞부분에 등장한 인물 정보를 함께 반영하면 해당 문장의 의미를 검색 과정에서 더 정확하게 파악할 수 있다.
이 방식은 문서 전체 맥락이 필요한 검색을 평가하는 ConTEB 벤치마크에서 강점을 보였다. 퍼플렉시티의 ‘pplx-embed-context-v1-4B’는 nDCG@10 81.96%를 기록했다.
퍼플렉시티는 같은 비교에서 Voyage의 ‘voyage-context-3’가 79.45%, 앤트로픽(Anthropic) 모델이 72.4%였다고 밝혔다. 해당 비교는 퍼플렉시티가 제시한 결과로, 관련 연구에서도 모델군의 성능 비교가 다뤄졌다.
OpenReview에 공개된 비교표에서 표준 검색용 ‘pplx-embed-v1-4B’는 다국어 MTEB 검색 부문 nDCG@10 69.66%를 기록했고, Qwen3-Embedding-4B는 69.60%, ‘gemini-embedding-001’은 67.71%로 집계됐다.
표준형과 문맥형은 적용 대상과 평가 조건이 다르다. 따라서 ConTEB의 81.96%와 MTEB의 69.66%를 같은 조건의 성능으로 비교할 수는 없다.
모델은 32K 토큰 문맥창과 양방향 어텐션을 지원한다. INT8·바이너리 양자화도 가능하며 퍼플렉시티는 바이너리 양자화로 저장공간을 최대 32배 줄일 수 있다고 설명했다.
API 가격은 4B 표준 모델이 100만 토큰당 0.03달러(약 41원), 4B 문맥형 모델이 0.05달러(약 68원)다. 가격은 퍼플렉시티의 공식 발표에 제시됐다.
ConTEB는 문서 조각 자체에 답이 모두 담겨 있지 않고 전체 문서의 정보가 필요한 상황을 평가하기 위해 설계됐다. ConTEB 연구는 문서 조각을 독립적으로 처리하면 문서 안의 의미 연결이 약해질 수 있다고 설명했다.
검색증강생성 시스템은 긴 문서를 여러 조각으로 나눠 벡터 데이터베이스에 저장하는 방식으로 운영되는 경우가 많다. 이때 조각만 따로 임베딩하면 문서의 주제나 앞뒤 맥락이 검색 결과에 충분히 반영되지 않을 수 있다.
개발자 커뮤니티에서는 모델 성능뿐 아니라 실제 운영 속도와 API 사용량에 대한 관심도 나타났다. 한 개발자는 동일한 A100 환경에서 ‘pplx-embed-v1-4B’의 색인 속도가 Qwen3-Embedding-4B보다 약 7~8배 느렸다고 개인 실험 결과를 공유했지만, 일반적인 성능으로 보기는 어렵다.
퍼플렉시티 개발자 포럼에서는 API 사용량이 문서 요청 단위가 아니라 문서 조각 수를 기준으로 계산되는 문제 제기도 나왔다. 퍼플렉시티 측은 해당 동작이 정상이라고 답했고, 문서의 ‘QPS’ 표기를 ‘초당 처리 가능한 조각 수’로 수정했다는 내용이 포럼 게시물에 담겼다.
공식 Hugging Face 모델 컬렉션에는 2026년 10월 1일 기준 ‘pplx-embed-v1’과 ‘pplx-embed-context-v1’ 계열이 올라와 있다. 취재 단서에 등장한 ‘pplx-embed-v2-context-9b-preview’는 공식 발표나 모델 카드에서 확인되지 않았으며, 관련 주장은 Crypto Briefing 보도에 포함됐다.
실제 도입을 검토하는 개발자는 벤치마크 점수와 함께 색인 속도, 메모리 사용량, API의 문서 조각 처리량, 한국어 검색 성능을 별도로 시험해야 한다. 퍼플렉시티가 표준 검색과 문맥형 검색을 각각 겨냥한다고 설명한 내용은 연구 논문에 정리돼 있으며, 퍼플렉시티 검색 API의 성능 비교는 본지가 앞서 보도한 내용에서도 다뤄졌다.

이준한 기자
댓글0
첫 댓글을 남겨 보세요.