TOKENPOST

워터마크 적용 뒤 AI 모델 유해 응답·도구 호출 달라져

AI 에이전트 도구 호출 실험 장면 / TokenPost.ai

LLM에 AI 워터마크를 적용하면 일반적인 문장 선택뿐 아니라 유해 요청 거부와 AI 에이전트의 도구 호출까지 달라질 수 있다는 연구 결과가 나왔다. 일부 오픈 웨이트 모델에서는 워터마크 적용 뒤 유해 요청에 응답할 가능성이 높아졌다.

Lasso Security는 17일 공개한 연구에서 구글 딥마인드의 SynthID-Text 방식을 오픈 웨이트 모델에 적용해 행동 변화를 비교했다. 같은 모델과 프롬프트를 사용하고 워터마크 적용 여부만 바꾼 실험이다.

안드레아 시포소바(Andrea Siposova) Lasso Security 연구원은 “적대적 조건에 놓이거나 에이전트가 도구를 호출할 때 워터마크가 모델 행동을 분명히 바꾼다”고 말했다. 생성 결과에 눈에 보이지 않는 표식을 남기는 과정도 모델의 토큰 선택에는 영향을 줄 수 있다는 설명이다.

SynthID-Text는 생성이 끝난 뒤 별도 정보를 붙이는 방식이 아니다. 모델이 다음 토큰을 고르는 과정에 비밀 키와 토너먼트 샘플링을 적용해 통계적 패턴을 남긴다.

모델은 여러 후보 토큰의 확률을 비교해 다음 단어를 선택한다. 이 과정에 워터마크가 개입하면 같은 프롬프트와 모델에서도 키에 따라 선택 결과가 달라질 수 있다.

일반 문장에서는 이런 변화가 단어 일부의 차이에 그칠 수 있다. 그러나 AI 에이전트가 JSON 형식으로 도구명과 인자값을 생성하는 환경에서는 도구 선택뿐 아니라 경로·수신자·검색어·금액 같은 인자도 달라질 수 있다.

Lasso Security는 도구 호출 평가에 BFCL v4 단일 턴 AST를 사용했다. 워터마크 적용 뒤 도구 호출 정확도는 7개 모델 가운데 6개에서 낮아졌고, 4개 모델에서는 감소 폭이 통계적으로 유의미했다.

워터마크 적용 전후 호출 결과가 달라진 비율은 21개 모델·온도 조합에서 평균 6.5%였다. 일부 조건에서는 phi-4 호출 결과의 16.8%, Llama-3.1-8B 호출 결과의 9.9%가 바뀌었다.

유해 요청 거부 실험에는 HarmBench의 유해 행동 200개와 JailbreakBench의 정상 요청 100개가 사용됐다. 연구진은 유해 요청만 제시한 경우와 고정된 프롬프트 인젝션을 추가한 경우를 비교했으며, 워터마크가 거부 행동에 미친 영향은 프롬프트 인젝션이 결합됐을 때 더 커졌다.

연구진은 이 현상을 ‘sampling drift’라고 불렀다. 워터마크가 모델의 가중치나 프롬프트를 바꾸지는 않지만 토큰 선택을 바꿔 모델의 답변과 에이전트의 행동을 달라지게 한다는 의미다.

다만 이번 연구는 클로드 모델을 시험하지 않았다. 실험 대상은 오픈 웨이트 모델 6종이며, 허깅페이스의 수정되지 않은 SynthIDTextWatermarkLogitsProcessor 구현을 사용했다.

앤트로픽은 8월 14일 향후 클로드 모델에 구글 딥마인드의 SynthID-Text 기반 텍스트 워터마크를 적용한다고 밝혔다. 워터마크가 출력 품질이나 가독성에 실질적인 영향을 주지 않으며 독자가 식별할 수 없다는 입장이다.

구글 딥마인드의 연구는 약 2000만건의 제미나이 응답을 활용한 평가에서 워터마크로 인한 품질 저하가 관찰되지 않았다고 보고했다. 평균적인 문장 품질을 유지한다는 결과와 특정 프롬프트·키·모델에서 개별 실행이 달라질 수 있다는 결과는 동시에 성립할 수 있다.

AI 에이전트가 외부 도구를 호출하는 환경에서는 모델의 응답뿐 아니라 권한과 실행 경로도 관리 대상이 된다. 프롬프트 인젝션과 도구 호출을 함께 통제해야 한다는 점은 기업용 AI 보안 통제 체계가 모델 응답과 외부 도구 권한을 함께 다뤄야 한다는 지적과도 맞닿아 있다.

유럽연합 AI Act 제50조 2항은 합성 텍스트·이미지·음성·영상 생성 시스템 제공자가 결과물을 기계 판독 가능한 방식으로 표시하고 AI 생성물임을 탐지할 수 있도록 요구한다. 워터마크 도입이 확대되더라도 모델별 구현과 안전성 영향은 별도로 검증해야 한다.

이번 연구는 워터마크가 모든 모델과 모든 키에서 안전장치를 약화시킨다는 뜻은 아니다. 모델·키·프롬프트 조건에 따라 행동 변화가 나타날 수 있다는 점을 확인했으며, 실제 운영 중인 에이전트가 유해 도구를 실행하는 피해까지 입증한 연구도 아니다. LLM 워터마크와 가상자산·블록체인 사이의 직접 연결점은 확인되지 않았다.

오늘의 스탬프0명이 오늘 찍었어요

댓글0

첫 댓글을 남겨 보세요.