Reddit

OpenAI explains how it will watermark ChatGPT text to comply with EU provenance rules

OpenAI, EU 규정에 맞춰 ChatGPT 텍스트에 워터마크 적용

OpenAI가 EU AI Act에 대응해 텍스트 생성물에 보이지 않는 통계적 워터마크를 넣는 textGrain을 공개했습니다. 짧은 글이나 수학처럼 단어 선택 폭이 좁은 글에서는 탐지율이 낮고, 동의어로 일부를 고쳐도 신호가 약해집니다. API 적용은 전 세계에서 선택 사항이며, ChatGPT와 Codex는 EU에서 단계적으로 적용합니다.

AI 요약

OpenAI가 생성 텍스트의 출처를 기계가 읽을 수 있는 방식으로 표시하라는 EU AI Act 요구에 맞춰 텍스트 워터마킹 계획을 공개했습니다. 회사는 텍스트 워터마킹과 탐지 기술이 아직 초기 단계라고 설명합니다. 오탐과 미탐, 편집에 따른 신호 약화 같은 한계를 고려해 적용 범위를 나누고, 탐지 도구도 우선 연구자와 전문 기관에만 제공합니다.

적용 일정과 범위

전 세계 API 고객은 일부 모델의 텍스트 출력에 워터마크를 선택해 적용할 수 있습니다. API에서는 기본값이 꺼져 있습니다. 앞으로 몇 주 동안 EU의 ChatGPT와 Codex 이용자에게는 요건에 해당하는 출력물에 보이지 않는 워터마크를 단계적으로 넣습니다. 이 적용은 EU에 한정하며, 전 세계 기본 설정으로 확대하지는 않습니다. OpenAI는 클라우드 파트너를 거쳐 제공하는 모델 출력에도 몇 주 안에 워터마크를 지원할 계획입니다.

텍스트 워터마크 탐지기는 오늘부터 신청을 받지만, 출시 초기에는 승인된 연구자와 전문 기관만 이용할 수 있습니다. 신청은 건별로 검토하며, 기술의 신뢰도와 책임 있는 활용 방안을 평가하고 개선하는 데 목적을 둡니다. 탐지기는 OpenAI 워터마크가 있는지 보고할 뿐, 사용자나 프롬프트, 대화 내용은 식별하거나 공개하지 않는다고 밝혔습니다. 오탐과 미탐 가능성 때문에 일반 공개는 미룹니다. 이미지·오디오 검증 도구와 Content Provenance API는 기존처럼 기관에 공개합니다.

textGrain의 작동 방식과 한계

OpenAI의 텍스트 워터마킹 기술 textGrain은 모델이 단어를 고르는 과정에 보이지 않는 통계 신호를 넣습니다. 탐지기는 문장에 그 신호가 있는지 확인합니다. OpenAI는 자체 평가에서 textGrain이 비교한 다른 방식과 비슷하거나 더 나은 성능을 보였으며, 텍스트용 SynthID도 비교 대상에 포함했다고 설명합니다. 기술 보고서는 추가 내용을 담아 업데이트할 예정이며, 기술을 오픈소스로 공개하는 방안도 추진합니다.

탐지 성능은 글의 길이와 내용에 따라 달라집니다. 오탐률을 1%로 설정했을 때 심리학 등 단어 선택 폭이 있는 주제에서는 200토큰 글의 워터마크를 약 80% 탐지했고, 400토큰 글에서는 약 95%를 탐지했습니다. 수학처럼 선택 가능한 표현이 적은 분야에서는 탐지율이 훨씬 낮았습니다. 400토큰 글에서 단어 10%를 동의어로 바꾸면 탐지율이 약 92%에서 66%로 내려갔고, 25%를 바꾸면 17%까지 떨어졌습니다. 따라서 이상적인 조건에서 높은 성능을 보였더라도 실제 환경에서 안정적으로 판별한다는 보장은 없습니다.

워터마크가 출력 품질을 떨어뜨리는지도 평가했습니다. Astra를 대상으로 한 8개 벤치마크에서 워터마크 적용 전후 점수는 큰 차이가 없었다고 OpenAI는 밝혔습니다. Artificial Analysis Intelligence Index는 49.57점에서 49.76점으로, AutomationBench는 34.09%에서 34.86%로 바뀌었습니다. DeepSWE v1.1은 72.80%에서 71.68%로 낮아졌고, Terminal-Bench 4.0은 53.90%에서 56.06%로 높아졌습니다. Terminal-Bench Science 0.1은 56.90%에서 60.00%, BrowseComp는 87.92%에서 87.35%, HealthBench Professional은 64.27%에서 64.60%, GPQA Diamond는 94.44%에서 93.94%였습니다.

탐지 결과가 말해주지 않는 것

워터마크는 OpenAI 시스템이 글의 일부를 생성하거나 처리했는지 가리키는 제한된 신호입니다. 사람의 판단이나 편집, 창작 기여가 얼마나 있었는지는 측정하지 않습니다. 저작권 소유자나 사용의 적법성, 공개 의무, 책임자를 정해주지도 않습니다. 사용자·조직·계정·프롬프트·대화를 특정하지 않으며, 글의 사실 여부나 유해성도 판정하지 않습니다. 워터마크가 탐지되지 않았다고 사람이 쓴 글이라는 뜻도 아닙니다. 글이 짧거나 편집·번역됐거나, 지원하지 않는 모델에서 생성됐거나, 워터마킹 도입 전 생성됐을 수 있습니다.

OpenAI는 텍스트 출처 확인에 단일 기술만 쓰지 않고 표준과 워터마크, 검증 도구를 함께 활용하는 접근을 제시합니다. 지원 이미지에는 Content Credentials를 붙이고 C2PA 표준을 따릅니다. 일부 이미지와 오디오에는 SynthID 워터마크를 넣으며, 검증 도구와 API도 제공합니다. Content Credentials는 파일의 출처와 이력을 기록하고, 보이지 않는 워터마크는 메타데이터가 제거된 뒤에도 신호를 남기는 역할을 한다고 설명합니다. 텍스트는 쉽게 다시 쓰거나 번역할 수 있어 이미지·오디오와 다른 한계를 고려해야 한다며, 편집과 번역에 대한 내성을 연구하고 탐지 도구 공개 범위도 근거가 쌓이면 넓히겠다고 밝혔습니다.

Reddit 반응

  • @u/Sylvers — 편집으로 워터마크가 약해집니다. 400토큰 글에서 단어 10%를 동의어로 바꾸면 탐지율이 약 92%에서 66%로, 25%를 바꾸면 17%로 떨어집니다. 결국 오픈소스 AI에 동의어를 최소한으로 바꾸라고 지시하면 워터마크를 쉽게 지울 수 있다는 뜻입니다. 간단한 매크로나 플러그인도 만들 수 있을 것 같습니다. 그리고 지금은 EU에만 적용되는 것 같네요.
    • @u/BeardChops — 보통 사용자가 그런 작업을 할까요? 작정한 사람에게는 여전히 걱정거리겠지만, 보호 장치를 우회하거나 탈옥하는 방법은 늘 있었습니다.
    • @u/Sylvers — 아이러니하지 않나요? 이 조치는 AI를 악용해 피해를 주려는 사람을 막으려는 것이라고 합니다. 하지만 보통 사용자는 그런 부류가 아닙니다. 대다수는 텍스트에 워터마크를 넣을 수 있다는 사실조차 모르고, 따로 지우려 하지도 않습니다. 결국 악의적인 사용자가 적극적으로 워터마크를 제거하게 된다면, 이 조치는 무엇을 위한 건가요?
    • @u/sirgog — 텍스트에서 워터마크를 없애려면 상당한 사람 노동이 필요합니다. 제가 온라인에서 본 가장 빠른 방법은 받아쓰기 프로그램을 켜고 워터마크가 있는 글을 자기 말로 읽는 겁니다. 악의적인 행위자와 저품질 콘텐츠 공장의 자동화 속도를 크게 늦춥니다. 워터마킹은 “이건 AI 저품질 콘텐츠”라고 표시하는 큰 표지판으로도 쓸 만합니다. AI가 쓴 모든 글이 저품질이라고 생각하지는 않지만, AI가 대신 써준 글을 자랑스럽게 내놓고 싶다면 자연스럽게 워터마크가 없어질 만큼 충분히 고쳐 자기 글로 만들면 됩니다.
  • @u/plymouthvan — 영상·사진·오디오는 화면에 담긴 무언가의 증거처럼 여겨져 왔으니 AI 출처 표시가 중요할 수 있습니다. 하지만 텍스트에 워터마크를 넣으려는 집착은 과도하다고 봅니다. 텍스트만으로 무언가를 증명하던 시대는 오래전에 지났습니다. 사람이 썼든 기계가 썼든, 사실 여부는 어차피 다른 자료와 대조해야 합니다. AI가 글을 썼다는 사실만으로 달라지는 것은 없습니다. 사람이 직접 생각해서 썼든, 사람이 아이디어를 내고 기계가 문장으로 옮겼든 큰 차이가 있을까요?
    • @u/Possible-Usual-9357 — 그럴듯한 악성 콘텐츠를 빠르게 대량 생산하고 자동화하는 일은 한 사람이 직접 타이핑하는 것과 다릅니다.
    • @u/plymouthvan — 둘이 다르다는 데는 동의하지만, 워터마킹이 그 문제를 해결한다고 보지는 않습니다. 기계가 만든 텍스트가 이미 넘쳐나고 있으며, 생성기를 멈추지 않는 한 계속 쏟아질 겁니다. 동네가 해수면 상승으로 잠긴 뒤 방수 차도 코팅제를 더 바르는 일에 집중하는 것과 같습니다. 출처 표시보다 누가 출판물에 책임지는지, 문서가 생애주기 동안 어떻게 바뀌었는지, 주장을 뒷받침하는 자료가 무엇인지, 허위·명예훼손 등 부적절한 주장에 누가 책임지는지 살펴보는 편이 낫습니다. 워터마킹도 전체 대책의 일부가 될 수 있지만, 지금은 나무만 보고 숲을 놓친다고 생각합니다.
  • @u/Elvarien2 — 아무 쓸모도 없는 규제로, 뭔가 했다고 생색내려는 일입니다.
    • @u/bortlip — 가능합니다. Claude는 Google의 SynthID-Text를 쓰거나 쓸 예정입니다. OpenAI는 textGrain이라는 변형을 쓰려는 것으로 보입니다. “2+2=?” 같은 짧은 글에는 신호를 담을 공간이 부족합니다. 수백 토큰 정도가 필요할 수 있고, 수학처럼 선택지가 적은 글에는 더 많은 토큰이 필요합니다.
    • @u/Maty1000 — 가능하지만 모든 경우에 되는 건 아닙니다. 모델은 이미 출력을 만들 때 무작위성을 사용합니다. 워터마킹은 보통 난수 생성기를 워터마크를 넣는 방식으로 바꿉니다. 그래서 “2+2”처럼 답이 하나뿐이면 워터마크가 없겠지만, 선택지가 많은 글에서는 잘 작동할 수 있습니다.
  • @u/tim_vermeulen — LLM에는 원래 무작위성이 있습니다. 워터마킹은 그 무작위성 안에 들어가므로, 워터마킹을 켰다고 모델이 원래보다 나쁜 토큰을 고르는 것은 아닙니다.
    • @u/YoungSilent232 — 동의하지 않습니다. 모델은 특정 샘플링 설정에 맞춰 후처리 학습을 합니다. Gemini도 그 설정에 맞춰 학습했으니 온도 1을 권합니다. 토큰 선택 방식을 바꾸면 성능에 영향이 있을 겁니다. OpenAI가 EU 전용으로 별도 후처리 학습을 했을 것 같지는 않습니다. 영향이 어느 정도인지는 모르겠습니다.
    • @u/QuaternionsRoll — SynthID가 어떻게 작동하는지 잘 모르는 것 같습니다. 모델이 어떤 토큰을 선호하지 않는 경우처럼 여러 토큰의 확률이 비슷할 때만 분포를 바꿉니다.
  • @u/rendez2k — 이런 워터마크가 왜 나쁜지 잘 모르겠습니다. 누가 설명해주실 수 있나요? 사용자에게 보이지는 않을 것 같은데요.
    • @u/-Crash_Override- — 장단점이 있습니다. 다만 결과물의 출처를 추적하면 텍스트·코드·이미지의 파생물이 생애주기 전반에 걸쳐 추적되는 체계로 이어질 수 있습니다. 법적 소유권과 별개로, 워터마크는 수십억 달러 기업에 어느 정도의 소유권과 신뢰성을 부여하는 일이기도 합니다.
    • @u/Legitimate-Store3771 — AI 생성 여부를 알아낼 방법은 어느 정도 필요하지 않나요? 사회는 이미 모든 것을 의심하고 있고, 생성형 AI는 문제를 더 키웠습니다. YouTube에서 AI 생성 콘텐츠라는 표시를 볼 수 있는 것은 유용합니다. 플랫폼의 목적은 개인 창작자를 지원하는 것이니까요. 내가 보는 것이 누군가를 지원하는지도 모르면 플랫폼이 무슨 의미가 있겠습니까? 텍스트도 마찬가지라고 봅니다. 좋은 해결책이라고 생각하지는 않지만, 이게 올바른 방향으로 가는 첫걸음도 아니라면 무엇이 그런지 모르겠습니다.

원문: OpenAI / 번역·요약: Trawling