AI Exec: We May Have Pulled Off “The Largest Theft of Labor in Human History”
AI 임원 “인류 역사상 가장 큰 노동력 절도를 해냈을지도 모릅니다”
Mother Jones가 OpenAI와 Microsoft를 상대로 낸 저작권 소송 자료에는 두 회사 임원들이 학습 데이터의 무단 이용과 창작자 보상 문제를 인식한 정황이 담겼습니다. Microsoft 조사에서 AI 검색은 전통적 검색보다 뉴스 기사 클릭을 90% 줄였고, OpenAI 응답과 Mother Jones 기사 사이에 25단어 연속 일치가 40만 건 넘게 발견됐습니다.
- 주제
에디터 노트
"원고가 쓴 원고의 글"이라는 게 핵심 맥락입니다. 저자는 Mother Jones CEO로 소송 당사자 본인이고, 글은 원고 측이 9월 4일 제출한 법원 문서의 내부 발언들을 정리한 거죠. Microsoft 응용과학 책임자 Brent Hecht의 "인류 역사상 가장 큰 노동력 절도" 발언, Greg Brockman이 NYT 유료벽 우회 'hack'에 답한 "ah nice." 같은 인용은 그래서 발목을 잡는 게 아니라 잡혔다는 기록입니다. 소송을 낸 언론사 콘텐츠만 출력에서 가리는 필터, Microsoft 내부에서조차 "우발적 은폐"라 우려했다는 대목은 법정에서 가장 날카로운 무기가 될 겁니다. 다만 주장과 확정 사실은 구분해야 합니다. 원문 문서는 비공개라 변호사 외 열람이 안 되고, Microsoft는 Hecht 발언을 "개인의 견해"라고 선을 그었죠. 흥미로운 건 쟁점이 '훔쳤다'에서 '먹고 살 길을 끊었다'로 옮아가는 지점인데, Microsoft 자체 연구에서 AI 검색이 뉴스 클릭을 90% 줄였고 Hecht 스스로 그걸 'doom loop'라 불렀다는 겁니다. 판결이 어떻든 공급망을 말려 죽이는 구조에 대한 내부자 증언이라는 점에서 이 문서는 가치가 있어요.
AI 요약
Mother Jones는 자사 뉴스룸 콘텐츠를 모델 학습에 썼다며 OpenAI와 Microsoft를 상대로 소송을 제기했습니다. 이 글은 9월 4일 다른 언론사들과 함께 제출한 법률 문서에서 드러난 내부 발언과 조사 결과를 소개합니다. 제목의 ‘인류 역사상 가장 큰 노동력 절도’는 Mother Jones의 표현이 아니라 Microsoft 응용과학 책임자 Brent Hecht의 말입니다. 다만 인용과 주장은 소송 당사자들이 제출한 자료에 바탕을 두며, 법원의 판단과는 구분해야 합니다.
학습 데이터와 창작자 권리
Microsoft 내부 문서에는 사람들이 자신의 작업물이 대규모 언어 모델에 흡수되는 일을 “전례 없는 규모의 놀라운 절도”로 여길 수 있다는 경고가 나옵니다. 문서는 콘텐츠 제작자 대부분이 자신의 작업물이 이런 방식으로 쓰이리라 예상하지 않았고, 대가도 받지 않는다고 적었습니다. OpenAI 정책 책임자 Jack Clark은 회사가 사회 문화를 만드는 사람들의 노동을 대체하는 시스템을 만든다고 썼습니다.
기사에 따르면 기업들은 웹에서 무작위로 글을 모으는 데 그치지 않았습니다. 학습 데이터 한 종류에서는 양질의 콘텐츠를 골랐고, 그 안에서 뉴스 기사가 가장 흔한 유형이었습니다. OpenAI는 실제 뉴스 분야에서 최신성을 확보하는 일을 목표로 삼았습니다. 상업적 이용을 금지한 언어 연구용 데이터셋에 유료 뉴스 기사들이 포함된 사실도 언급됩니다. 데이터셋을 만들면서 저작권 표시, 작성자 정보, 이용 약관처럼 소유자를 식별할 정보가 체계적으로 빠졌다는 Microsoft 문서도 인용합니다.
검색 유입과 콘텐츠 생태계
Microsoft 자체 연구에서는 사람들이 전통적 검색엔진 대신 AI 검색을 쓸 때 뉴스 기사 클릭이 90% 줄었습니다. Microsoft 변호사는 챗봇이 이용자 질문에 답하도록 설계됐으며, 이용자가 직접 살펴볼 링크 목록을 제공하는 방식과 다르다고 설명했습니다. 글은 Google이 AI 개요를 도입한 뒤 Google Search와 Google Discover에서 언론사로 넘어가는 방문이 적어도 30% 감소했다는 다른 전문가의 분석도 전합니다.
Hecht는 AI가 콘텐츠를 공급하는 언론사의 경제 기반을 약화해 인터넷을 더 나쁘게 만드는 ‘doom loop’를 경고했습니다. 언론사와 창작자가 수익을 얻지 못하면 AI 기업이 학습에 쓸 콘텐츠 공급망도 흔들린다는 주장입니다. 법률 문서는 업계 전체로 보면 모두가 창작자에게 비용을 지급하는 편이 낫지만, 개별 기업은 다른 기업이 비용을 내는 동안 콘텐츠를 무료로 가져가는 편이 유리하다고 설명합니다.
내부 발언과 재현 실험
OpenAI 공동 창업자이자 사장인 Greg Brockman은 ChatGPT가 New York Times 기사 문장을 이어 쓰는 데 특히 능숙하다고 동료에게 전했습니다. 동료가 Times 유료 구독벽을 우회하는 방법을 언급하자 Brockman은 긍정적으로 답했습니다. 기사에는 ChatGPT 이용자들이 만든 맞춤 도구 중에도 Times 유료 콘텐츠에 접근하려는 도구가 있었다고 나옵니다.
소송이 시작된 뒤 OpenAI는 원고 언론사의 콘텐츠가 모델 출력에 나오지 않게 하는 필터를 만들었습니다. 원고 측 법률 문서는 이 필터가 저작권 침해 방지보다 소송에 쓸 복제 증거를 모으기 어렵게 하는 목적이었다고 주장합니다. Microsoft 내부에서도 이 필터가 콘텐츠를 소유한 사람들이 학습 자료에 자신의 콘텐츠가 쓰였는지 알아보기 어렵게 만드는 ‘우발적 은폐’가 될 수 있다는 우려가 나왔습니다.
Mother Jones는 OpenAI가 ChatGPT 응답 2천만 건을 조사해 기사와 응답 사이에 연속된 25단어가 일치하는 사례를 찾았다고 전합니다. Mother Jones 기사에서 나온 일치는 40만 건을 넘었으며 New York Times와 비슷한 규모였습니다. 다만 같은 인용문을 기사와 AI가 각각 사용한 경우도 포함될 수 있어, 모든 일치가 기사 내용을 그대로 재현했다는 뜻은 아니라고 글은 덧붙입니다.
Reddit 반응
- @u/Gorodish_ — 많은 사람이 놓치는 부분은 Microsoft 자체 연구에서 AI 검색이 전통적 검색보다 뉴스 기사 클릭을 90% 줄였다는 점입니다. 검색엔진은 이용자를 가능한 오래 자기 사이트에 머물게 하려 합니다. 클릭 유입을 줄이는 방식은 그 목적에 잘 맞고, 그 유인은 사라지지 않습니다.
- @u/bloodychill — Cloudflare가 Google의 크롤링 접근을 막겠다고 압박한 이유도 그 때문입니다. AI 검색엔진은 인터넷을 죽이고 있습니다. 모든 콘텐츠 사이트가 클릭 유입 부족으로 사라지면 학습과 최신 정보 유지에 필요한 데이터도 사라지는데, 끝에 무엇이 남는지 모르겠습니다. 단기적인 이익만 좇는 것 같습니다.
- @u/WMalon — 저는 기자입니다. 우리 회사는 ‘웹사이트 이후 시대’를 진지하게 고민하고 있습니다. 사람들이 우리 콘텐츠를 클릭하지 않으면 어떻게 할지 고민한다는 뜻입니다. 지금은 AI 검색에서 권위 있는 출처로 인정받아 챗봇 답변에 인용되기를 기대합니다. 디스플레이 광고 모델이 무너진 뒤에도 지속 가능한 방법인지는 모르겠고, 더 나은 생각도 없습니다.
- @u/invyros — “NYT 기사 중간에서 문장을 완성하게 하면 딱 맞게 완성하는 것 같다”는 말이 나왔습니다. AI가 초래하는 사회적·환경적 피해를 감수하면서까지, 다른 사람이 이미 쓴 문장을 이어 쓰게 하려는 셈입니다.
- @u/-The_Blazer- — 작동 방식은 반대입니다. NYT 기사를 학습했기 때문에 NYT 기사를 예측하는 겁니다. 세상에서 가장 훌륭한 신문도 똑같은 일이 벌어집니다. AI가 원문 사이트 방문 없이 기사를 다시 표현하면 언론사의 수익이 줄어들고, 언론의 질도 더 나빠집니다.
- @u/Caraes_Naur — “해냈을지도 모른다”가 아니라 그게 목표였습니다. 길에서 지갑을 주운 것처럼 말하지 마세요. 의도적인 강탈이었습니다.
- @u/CompetitiveSport1 — 기사를 읽어보세요. 제목은 실제 발언이 아닙니다. 그 임원은 자신들이 해냈을지도 모른다는 뜻이 아니라, 사람들이 곧 그렇게 믿게 될 거라고 말했습니다. 다시 말해 “사람들이 우리가 그들의 것을 훔쳤다는 사실을 곧 깨달을지도 모른다”는 뜻입니다.
- @u/cr0ft — ‘노동력 절도’는 자본주의 문제입니다. 사람을 고된 노동에서 해방하는 일은 좋은 일입니다. 문제는 자본주의에서 노동을 해방하면 생존에 필요한 돈까지 잃는다는 점입니다. 기술이 문제가 아니라 자본주의가 문제입니다.
- @u/Vinterblot — AI가 일자리를 빼앗는 게 문제가 아닙니다. 그게 사실은 이상적인 목표일 수도 있습니다. 일하지 않으면 모든 것을 잃는다고 요구하는 체제가 문제입니다. 사람들은 일이 없어지는 것을 두려워하는 게 아니라 생계를 잃을까 두려워합니다.
- @u/ill_be_huckleberry_1 — 사람들이 이 문제를 깨닫고 분노하기를 기다리고 있습니다. 우리 모두가 대차대조표의 부채 항목으로 줄어들고 있습니다.
원문: Mother Jones / 번역·요약: Trawling