435 읽음
오픈AI EU 챗GPT 투명 워터마크 도입, AI법 준수
위키트리
0
단어 선택에 숨긴 통계 신호, textGrain — 이해를 돕는 AI 자료 이미지

오픈AI가 유럽연합(EU) 지역 챗GPT와 코덱스(Codex)가 만든 텍스트에 눈에 보이지 않는 워터마크를 넣기로 했다. EU 인공지능법(AI Act)의 투명성 규정을 따르기 위한 조치다. 회사는 월요일(현지시각) 블로그 글로 계획을 밝혔다.

워터마크는 앞으로 몇 주에 걸쳐 EU 내 모든 요금제의 적용 대상 이용자에게 순차 도입된다. API(응용프로그램인터페이스) 고객은 전 세계 어디서든 이날부터 일부 모델에 한해 직접 켤 수 있다. 오픈AI는 출시 시점에 워터마크를 글로벌 기본값으로 삼지 않는다고 못 박았다.

오픈AI가 쓰는 기술의 이름은 textGrain이다. 회사 설명에 따르면 모델이 단어를 고르는 과정에 눈에 보이지 않는 통계적 신호를 더하는 방식이다. 탐지기는 이 신호를 찾아 글에 오픈AI 워터마크가 들어 있는지 판단한다.

테크크런치(TechCrunch)에 따르면 워터마크는 특정 기호가 아니다. 모델의 단어 선택을 미세하게 조정해 독자 눈에는 안 보이고 탐지기만 읽을 수 있는 패턴을 남긴다. 신호가 글 자체에 녹아 있어 복사해 붙여넣어도 그대로 따라간다. 오픈AI는 워터마크가 이용자를 식별하지 않는다고 밝혔다.

기술 보고서는 펜실베이니아대와 예일대 연구진이 공동 집필했다. 비밀 키를 이용해 다음 단어 후보를 분류하며 문장을 이어가는 예시가 실렸다. 이런 미세한 조정이 수백 번 쌓이면 탐지기가 텍스트와 키만으로 AI 생성 글을 가려낼 수 있다는 설명이다.

오픈AI는 보고서를 앞으로 몇 주 안에 추가 내용으로 갱신하겠다고 했다. 기술을 오픈소스로 공개해 다른 곳에서도 활용할 수 있게 하겠다는 계획도 내놨다. 엔가젯(Engadget)은 오픈AI가 구글의 SynthID 같은 다른 방식과 견줘 성능이 같거나 앞선다고 주장했다고 전했다.
EU는 기본 적용, API는 선택…앤트로픽과 다른 길 — 내용 이해를 돕는 AI 이미지

적용 범위는 이원적이다. EU의 챗GPT·코덱스 텍스트에는 기본으로 워터마크가 들어간다. API에서는 고객이 직접 켜야 하고 기본값은 꺼짐이다. 오픈AI는 이 방식이 고객이 투명성 의무와 이용자 경험을 스스로 조율하게 한다고 설명했다. 클라우드 파트너를 통한 오픈AI 모델 출력에도 앞으로 몇 주 안에 워터마크를 제공할 계획이다.

더 디코더(The Decoder)는 이 클라우드 파트너에 마이크로소프트 애저 등이 포함된다고 전했다. 같은 매체는 앤트로픽이 클로드 워터마크를 접속 방식과 관계없이 전 세계에 의무로 적용하는 것과 대비된다고 짚었다. 엔가젯은 API에서 선택할 수 있는 모델이 구체적으로 무엇인지는 오픈AI가 밝히지 않았다고 지적했다.

앤트로픽은 두 달 전 클로드 생성 텍스트에 워터마크를 넣겠다고 발표했다. 나인투파이브맥에 따르면 클로드는 의미와 품질에 영향이 없는 단어 중 하나를 숨은 패턴에 따라 고른다. 앤트로픽의 탐지기는 앤트로픽 고유의 비밀 키로 만든 신호만 찾아낸다. 오픈AI 글인지는 가려내지 못한다. 이 결정은 일부 클로드 이용자의 반발을 샀다. 지시와 맥락, 판단은 자신이 제공했고 클로드는 도구일 뿐이라는 항변이다.

오픈AI도 과거 텍스트 워터마크를 만들어 두고 출시를 미룬 적이 있다. 월스트리트저널은 2024년 이용자가 워터마크 없는 경쟁 서비스로 옮겨갈 우려가 이유 중 하나였다고 보도했다. 앤트로픽·구글·메타·마이크로소프트·오픈AI는 AI 생성 콘텐츠에 관한 EU 실천 강령을 따르겠다고 약속한 기업들이다.

오픈AI가 직접 밝힌 수치는 워터마크가 만능이 아님을 보여준다. 토큰(AI가 글을 처리하는 단위) 400개 분량의 글에서 단어의 10%를 동의어로 바꾸면 탐지율이 약 92%에서 66%로 떨어졌다. 25%를 바꾸면 17%까지 내려갔다.

길이와 주제에 따른 차이도 있었다. 오탐률(사람이 쓴 글을 AI 글로 잘못 판정하는 비율) 목표를 1%로 맞췄을 때 심리학 주제 400토큰 글에서는 약 95%를 잡아냈다. 200토큰에서는 약 80%로 낮아졌다. 수학처럼 단어 선택 폭이 좁은 내용은 탐지율이 크게 낮았다. 긴 글일수록 신호가 강해질 수 있지만 오픈AI는 이를 뒷받침할 데이터를 내놓지 않았다. 번역된 글도 탐지가 어렵다고 테크크런치는 전했다.

워터마크가 발견돼도 알 수 있는 것은 제한적이다. 오픈AI는 워터마크가 사람의 기여 정도를 재지 않고 소유권이나 책임을 입증하지 않는다고 밝혔다. 이용자를 식별하지 못하고 정확성도 검증하지 않는다. 워터마크가 없다고 사람이 쓴 글이라는 증거가 되지도 않는다. 글이 너무 짧거나 많이 고쳐졌거나 다른 회사 AI에서 나왔을 수도 있기 때문이다.

워터마크가 쉽게 지워진다면 탐지를 피하려는 이용자가 오픈 웨이트 모델로 옮겨갈 수 있다. 오픈AI가 이런 한계를 숨기지 않은 점이 눈에 띈다는 평가는 나오지 않았다. 다만 앤트로픽은 클로드 워터마크의 탐지율을 공개하지 않았다.

오픈AI는 워터마크가 모델 성능에 의미 있는 차이를 주지 않는다고 밝혔다. 근거는 최상위 모델 ‘아스트라’ 최대 설정의 벤치마크 8종 비교다. 일부는 올랐고 일부는 내렸다.

터미널벤치 4.0은 53.90%에서 56.06%로 올랐다. 딥SWE v1.1은 72.80%에서 71.68%로, GPQA 다이아몬드는 94.44%에서 93.94%로 내려갔다. 브라우즈컴프는 87.92%에서 87.35%였다. 아티피셜 애널리시스 인텔리전스 지수는 49.57점에서 49.76점이 됐다. 이 결과가 글쓰기 품질에 미치는 영향까지 입증하는 것은 아니다.

탐지기 접근은 당분간 제한된다. 승인된 연구자와 전문 기관이 이날부터 신청할 수 있고 실천 강령에 따라 사례별로 접근 권한이 주어진다. 탐지기는 오픈AI 워터마크가 감지됐는지만 알려준다. 이용자나 프롬프트, 대화 내용은 드러나지 않는다. 오픈AI는 탐지 누락과 오탐 위험 때문에 출시 시점에 일반 공개하지 않는다고 설명했다. 접근 확대 시점은 밝히지 않았다.

EU 시한도 걸려 있다. AI법 50조는 생성형 AI 제공자가 텍스트 출력을 기계가 읽을 수 있는 방식으로 식별 가능하게 하도록 요구한다. 신규 진입 기업에는 이미 적용 중이다. 기존 사업자는 12월 2일까지 맞춰야 한다. 오픈AI는 기술과 표준, 증거가 바뀌면 접근법을 다시 검토하겠다고 밝혔다. 워터마크가 편집과 번역을 거쳐서도 남는지, AI의 도움과 AI의 저작을 더 의미 있게 구분할 수 있는지도 계속 연구한다는 방침이다.
0 / 300