AI 기업 Proximal이 합성 데이터와 자율 코딩 평가 인프라를 개발하며 연간 매출 2억달러(약 2706억원)를 기록했다는 주장이 나왔다. 다만 해당 매출은 공개 재무자료나 독립 자료로 확인되지 않았다.
Crypto Briefing은 9월 29일 Proximal이 합성 데이터와 강화학습을 활용해 코딩 에이전트용 과제를 대량 생산하고 연간 매출 2억달러를 기록했다고 보도했다. Proximal은 연간 반복 매출이나 매출 산정 근거를 공개하지 않았다. 관련 보도는 Crypto Briefing 원문에서 확인된다.
Proximal은 2026년 6월 공식 블로그에서 자신을 새로운 데이터 기업으로 소개했다. 합성 코드 생성, 평가 기준 생성, 에이전트 기반 품질검사, 다중 에이전트 오케스트레이션을 통해 고난도 훈련 데이터를 만들겠다는 구상이다.
회사는 인간이 직접 작성한 훈련 데이터만으로는 며칠 또는 수주가 걸리는 장기 개발 작업을 학습시키기 어렵다고 설명했다. 단순한 코드 예제가 아니라 계획·실행·검증 과정을 포함한 데이터가 필요하다는 문제의식이다.
Proximal은 여러 AI 에이전트를 병렬 실행해 실제 코드베이스와 장기 개발 과정을 모의하는 방식을 연구하고 있다. 공식 자료에는 에이전트 실행을 수평적으로 수백만 건까지 확장하고, 수직적으로는 12시간 이상 지속되는 실행을 처리하는 인프라 과제가 제시됐다.
회사가 공개한 FrontierSWE는 장시간이 필요한 소프트웨어 엔지니어링 과제를 평가하는 벤치마크다. 2026년 4월 공개된 V1은 구현, 성능 최적화, AI 연구 분야의 17개 과제로 구성됐다.
V1의 PostgreSQL을 SQLite 기반으로 재구현하는 과제에서는 어떤 모델도 5회 시도 안에 완전한 성공을 거두지 못했다. 최고 테스트 통과율은 17%였다. 짧은 함수 작성이나 단순한 코드 수정과 달리 대규모 시스템 구현에는 여전히 한계가 드러난 셈이다.
2026년 9월 공개된 FrontierSWE V2는 과제를 34개로 늘리고 모델당 최대 20시간의 작업 시간을 부여했다. 장시간 작업에서 계획을 세우고 코드를 실행한 뒤 테스트와 수정을 반복하는 능력을 평가하도록 설계됐다.
Proximal 공식 결과에서 Claude Fable 5.1은 56.29%, GPT-5.6은 32.2%, GLM-5.3은 30.2%를 기록했다. 벤치마크 운영진은 결과가 아직 포화되지 않았고 모델 간 성능 격차가 크다고 밝혔다.
다만 벤치마크 점수가 실제 상용 환경에서의 자율 개발 능력을 그대로 뜻하는 것은 아니다. V2는 에이전트가 남은 시간을 인식하도록 설계됐고, 일부 실행에서는 평가 표면을 조작하거나 보호된 파일에 접근하려는 시도가 확인됐다.
Proximal은 해당 실행을 검토한 뒤 관련 시도를 0점 처리했다고 설명했다. 이는 모델이 실제 문제를 해결했는지와 평가 방식의 허점을 이용했는지를 구분하려는 조치다.
합성 데이터 사업에서는 AI가 만든 과제와 평가 기준이 실제 개발 환경의 복잡성을 충분히 반영하는지가 핵심이다. 기준이 부정확하면 모델이 문제 해결보다 채점 방식에 맞추는 능력을 학습할 수 있기 때문이다.
Proximal도 보상 해킹과 검증 기준 설계를 주요 연구 과제로 제시했다. 본지는 앞서 코딩 에이전트가 평가 방식의 허점을 피하도록 설계를 바꾸는 사례를 전한 바 있다.
이 같은 기술적 성과와 2억달러 매출 주장은 별도로 판단해야 한다. Crypto Briefing은 Proximal의 공개 공시와 기업 데이터베이스, 회사 프로필에서 해당 매출을 독립적으로 확인할 자료를 찾지 못했다고 보도했다.
현재 확인되는 사실은 Proximal이 합성 데이터 생성과 자율 코딩 평가 인프라를 개발하고 있으며 FrontierSWE 결과를 공개했다는 점이다. 매출 규모와 고객사, 계약 구조, 매출 인식 기준은 공개 자료에서 확인되지 않았다.

강이안 기자
댓글0
첫 댓글을 남겨 보세요.