563 / 719

5 분 소요

hits

앤스로픽이 자사 AI 클로드가 만든 모든 글에 사람 눈에 보이지 않는 워터마크를 심기로 했다. 복사해 붙여넣거나 일부를 고쳐도 표식이 일부 남는다. 8월 2일 이후 나온 모델부터 적용하고, 이전 모델에도 순차로 넣는다. 유럽연합 AI법의 투명성 의무에 따른 조치이며, 전 세계 이용자에게 똑같이 적용한다.

이 소식은 하나의 대결이 시작됐다는 신호이다. 콘텐츠에 출처를 새기려는 쪽과 그 표식을 지우려는 쪽, 창과 방패의 대결이다.

창, 보이지 않는 표식

워터마크라고 하면 그림 위에 얹힌 반투명 로고를 떠올리기 쉽다. 그러나 텍스트에는 숨을 픽셀이 없고, 복사해 붙이면 메타데이터도 사라진다. 글자는 눈앞에 죄다 드러나 있다. 그렇다면 표식은 대체 어디에 숨는가. 답은 글자가 아니라 단어와 단어 사이의 선택에 있다. 원리는 세 걸음으로 나눠 보면 쉽다.

첫째, 글쓰기는 매 단어에서 여러 좋은 선택지 중 하나를 고르는 일이다. 언어모델은 문장 중간에서 다음 단어를 하나로 확신하지 않는다. 자동완성처럼 후보 목록을 두고 각 후보에 확률을 매긴 뒤, 가중치가 실린 주사위를 굴리듯 하나를 고른다. “연구 결과는 꽤 ___” 다음에는 ‘인상적이었다’, ‘놀라웠다’, ‘좋았다’가 모두 자연스럽다. 이렇게 여러 선택지가 똑같이 괜찮은 여유가 바로 표식이 숨을 빈자리다.

둘째, 비밀 키가 그 선택에 살짝 힘을 준다. 키는 매 순간 후보 단어를 초록과 빨강 두 무리로 나눈다. 키를 쥔 쪽만 재현할 수 있는 임의의 색칠이다. 그런 다음 주사위를 초록 쪽으로 조금 기울인다. 두 가지가 이 조작을 은밀하게 만든다. 힘이 약해서 빨강도 여전히 이길 수 있고(조금 덜 나올 뿐이다), 색이 단어의 고정된 성질이 아니라 바로 앞 몇 단어에서 계산된다. 그래서 같은 단어도 앞 맥락에 따라 초록이 됐다가 빨강이 된다. 사람은 아무것도 못 느끼지만, 긴 글에서는 초록으로의 치우침이 조용히 쌓인다.

비밀 키가 단어 선택 확률을 초록 쪽으로 살짝 기울이는 방식을 보여주는 도식
키가 없으면 모델 본래 확률로 단어를 고른다. 키가 붙으면 초록 단어의 확률이 미세하게 올라간다. 색은 바로 앞 단어들로 정해져 자리마다 달라지고, 그 배열은 키를 쥔 쪽만 안다.

이런 방식이 처음은 아니다. 구글 딥마인드는 2024년부터 신스ID(SynthID)로 제미나이가 만든 텍스트에 워터마크를 넣어 왔고(이미지에는 2023년부터), 더 미묘한 ‘토너먼트’ 방식으로 같은 결과에 이른다. 텍스트 워터마크를 공개적으로 도입한 큰 기업으로는 앤스로픽이 두 번째다.

셋째, 키를 쥔 쪽은 다시 색칠해 초록을 센다. 탐지는 글의 뜻이나 문체를 읽지 않는다. 같은 규칙으로 단어에 색을 다시 칠하고 초록이 몇 개인지 셀 뿐이다. 표식이 없으면 초록은 약 절반, 동전 던지기 수준이다. 표식이 있으면 초록이 우연보다 꾸준히 많이 나온다. 다만 이 치우침은 짧은 글에서는 옅어 판별이 어렵고, 글이 길수록 증거가 쌓인다. 증거의 세기는 대략 살아남은 표식 비율에 글 길이의 제곱근을 곱한 값에 비례한다. 앤스로픽은 제3자가 표식을 확인할 도구도 곧 내놓겠다고 했다.

워터마크가 없는 글과 있는 글의 초록 단어 비율을 비교하는 도식
탐지기는 초록의 개수만 센다. 표식이 없으면 절반(동전 던지기), 있으면 초록이 꾸준히 더 많다. 짧은 글은 판별이 어렵고, 글이 길수록 증거가 단단해진다.

왜 지금인가

배경에는 AI 대필 논란이 있다. 지난달 한 범죄소설은 14개 출판사가 입찰 경쟁을 벌인 끝에 계약됐지만, 저자의 AI 집필 의혹이 불거지며 계약이 철회됐다. 미국의 한 출판사도 공포소설 출간을 중단했다. 학생 과제부터 출판 원고까지, AI가 썼는지 아닌지를 두고 벌어지는 다툼이 늘고 있다.

워터마크는 이 다툼에 증거 하나를 보태 준다. 제출된 글에 특정 AI의 표식이 남아 있는지 확인할 길이 생기기 때문이다. 교육계와 출판계가 반길 만한 이유이다.

창의 약점

그런데 이 창은 생각만큼 날카롭지 않다.

앤스로픽 스스로 한계를 인정했다. 워터마크가 새겨진 글이라도 크게 손보거나 의역하거나 번역을 거치거나 다른 글과 섞으면 탐지가 어려워진다. 각 단어의 표식은 직전 단어들의 짧은 묶음(run)에서 파생된다. 따라서 원문과 동일한 단어 묶음이 남아있을 때만 표식이 유효하다.

가벼운 수정이나 한 번의 의역은 표식을 희석시킬 뿐 완전히 제거하지 못한다. 키르헨바우어 등(Kirchenbauer et al., 2023)의 실험에 따르면 인간이 의역한 글도 약 800토큰(600단어) 이상이면 탐지 가능성이 다시 높아진다. 워터마크를 완전히 지우는 유일한 방법은 원문과 단어 묶음을 공유하지 않는 전면적인 재구성(re-composition), 즉 의미에 기반한 다시 쓰기이다.

편집 강도에 따라 원문 배열이 살아남는 구간이 줄어드는 것을 보여주는 도식
표식은 원문 배열이 그대로 남은 구간에서만 잡힌다. 오타 수정은 대부분 살아남고, 한 번의 의역은 표식을 옅게 만들 뿐이며, 의미부터 새로 쓴 전면 재작성만이 동전 던지기 수준으로 지운다.

반대 방향의 문제도 까다롭다. 사람이 쓴 글을 클로드로 교정하거나 번역만 해도 표식이 남는다. 그러면 표식이 발견됐다는 사실만으로 그 글 전체를 AI가 썼다고 단정하지 못한다. 짧거나 선택지가 제한적인 텍스트(코드, 인용문, 사실 나열 등)는 모델이 단어를 선택할 여유가 적어 워터마크가 거의 남지 않는다. 즉, 있는데 못 찾기도 하고, 없는데 있다고 오해하기도 한다.

판별 기술의 역사도 이 어려움을 말해 준다. 오픈AI는 2023년 자체 개발한 AI 텍스트 판별기를 정확도가 낮다는 이유로 몇 달 만에 접었다.

워터마크 판독의 실제적 함의

워터마크 탐지는 비밀스럽고, 확률적이며, 처리 여부에 대한 단서이지, 저작권에 대한 판단 기준이 아니다.

특성 설명
탐지 주체 오직 워터마크를 심은 제공자(키 홀더)만이 표식 여부를 확인할 수 있다. 교사, 편집자, 시중에 있는 ‘AI 탐지기’ 웹사이트는 이 검사를 수행하지 못한다. 구글은 신스ID의 조기 접근 탐지 포털을 운영하며, 앤스로픽도 탐지 도구를 곧 제공한다.
탐지 목적 워터마크 검사는 GPT제로(GPTZero)와 같은 일반적인 ‘AI 탐지기’와 본질적으로 다르다. 일반 AI 탐지기는 문체나 스타일을 추측하여 신뢰도가 낮지만, 워터마크는 의도적으로 심어진 통계적 검증이다. 이는 AI 처리 여부에 대한 증거이다.
의미 해석 표식이 발견되었다는 것은 “AI에 의해 처리되었다”는 의미이지, “AI가 작성했다”는 의미가 아니다. 앤스로픽 스스로도 클로드로 교정하거나 번역만 해도 워터마크가 남는다고 밝힌다.
결과 신뢰도 워터마크가 없다고 해서 사람이 썼다고 단정할 수 없다. 오래된 모델이거나 대폭 수정된 AI 텍스트는 워터마크가 사라질 수 있기 때문이다. 증거는 텍스트 길이에 비례해 증가한다.

워터마크는 콘텐츠가 AI에 의해 ‘처리’되었을 가능성을 보여주는 하나의 단서일 뿐, 저작 주체를 ‘판정’하는 결정적인 증거가 아니다.

방패, 표식을 지우는 도구

창이 나오면 방패가 나온다. 이미 여러 AI 회사의 표식을 한꺼번에 지우는 도구가 공개되어 있다. 한 오픈소스 프로젝트는 눈에 보이지 않는 특수 문자, 통계적으로 심어진 텍스트 워터마크, 그리고 파일에 붙는 C2PA나 EXIF 같은 출처 메타데이터를 벗겨 낸다고 소개한다. 대상으로 클로드, 제미나이의 신스ID, 오픈AI 계열, 공개 언어모델의 표식을 나란히 든다.

이러한 도구들은 단순히 특수 문자를 제거하는 것을 넘어, 의미 기반의 재작성 방식을 사용하여 단어 선택의 통계적 패턴 자체를 파괴한다. 만든 쪽은 이 도구를 내가 소유한 콘텐츠의 프라이버시와 정리를 위한 것이라고 설명한다. 명분은 분명하다. 그러나 같은 도구가 대필을 감추는 데 쓰이면, 창이 겨눈 바로 그 투명성을 무너뜨린다. 방패는 언제나 이 두 얼굴을 함께 가진다.

대결의 본질

창과 방패의 대결에서 한쪽이 최종 승리하는 일은 드물다. 표식을 더 끈질기게 심으면 더 정교하게 지우는 도구가 따라 나온다. 워터마크가 강해질수록 글을 더 많이 건드려야 지워지고, 그만큼 원문의 결도 함께 뭉개진다. 지우는 쪽도 대가를 치른다.

그래서 실용적인 결론은 소박하다. 워터마크는 출처를 가리키는 하나의 단서이지, 유무죄를 가르는 판결이 아니다. 표식이 있다고 전부 AI가 쓴 것은 아니고, 없다고 사람이 쓴 것도 아니다. 더 나아가, 표식은 AI 처리 여부를 나타내지, 생성 여부를 단정하지는 않는다. 이 표식을 증거로 쓰려는 교실과 편집실은 그 한계를 먼저 알아야 한다. 창과 방패는 이제 막 부딪히기 시작했고, 당분간 어느 쪽도 결판을 내지 못한다.

출처

  • 동아일보. AI로 교정만 해도 흔적 남는다, 클로드 모든 글에 워터마크 도입. https://www.donga.com/news/It/article/all/20260811/134459610/2
  • guillaumemeyer/watermarks-remover (GitHub). https://github.com/guillaumemeyer/watermarks-remover
  • declaude. How AI text watermarking works. https://declaude.org/watermarking/
공유