Hacker News

OpenAI Feared "Optics" of what might appear on Hacker News

OpenAI가 걱정한 건 법보다 Hacker News의 여론이었습니다

작가조합(Authors Guild)이 공개한 소송 자료에는 OpenAI와 Microsoft가 LibGen의 책을 학습에 쓴 사실을 알고 있었으며, 저작권 문제보다 대외 여론을 우려했다는 내용이 담겼습니다. 자료에는 작가의 일자리 대체 가능성을 논의한 내부 발언과 LibGen 파일을 삭제하려 한 정황도 포함됐습니다.

에디터 노트

"법이 아니라 HN 여론이 걱정됐다"는 한 줄이 전부입니다. OpenAI 연구원 Sam McCandlish의 발언인데, LibGen을 학습에 쓴 사실을 알면서도 두려운 건 저작권법이 아니라 '수상한 러시아 사이트의 데이터를 썼다'는 글이 Hacker News에 오르는 것이었습니다. 두려움은 적중했습니다. 여론도 법정도 따라왔습니다. 결정적인 이유는 '몰랐다'는 변호가 무너졌기 때문입니다. Jack Clark은 2020년에 작가 일자리 대체를 알면서도 '무시하고 출시할 것'이라고 썼고, 2022년 여름 'Project Clear'로 LibGen 파일을 지웠습니다. 다만 작가 측이 약식판결용으로 제출한 주장이지 확정 사실은 아닙니다. 심리는 2027년 초입니다.

AI 요약

Authors Guild v. OpenAI 소송에서 작가 측이 제출한 자료를 바탕으로, Authors Guild가 피고 기업들의 내부 논의와 LibGen 사용 정황을 공개했습니다. 작가 측은 OpenAI와 Microsoft가 저작권 침해 가능성을 알면서도 책을 학습 데이터로 사용했다고 주장합니다. 아래 내용은 소송 자료와 이를 소개한 Authors Guild의 발표에 담긴 주장입니다.

작가의 일자리 대체 가능성을 논의했습니다

OpenAI 정책 책임자 Jack Clark은 2020년 AI와 창작 작업이 사람의 노동을 대체하는 시스템으로 이어질 수 있다고 썼습니다. GPT-X가 발전할수록 장르 소설 작가들이 Amazon에서 AI에 대체될 가능성을 걱정할 것이라고도 했습니다. 그는 AI 개발로 사람들이 일자리를 잃을 것이며, 예술가들이 우려를 표해도 제품을 출시할 가능성이 높다고 적었습니다.

OpenAI가 2022년 모델의 글쓰기 품질 개선을 맡긴 Tarun Gogineni는 GPT 모델이 George R. R. Martin의 《얼음과 불의 노래》 마지막 두 권을 완성하도록 하겠다는 목표를 언급했습니다. Martin이 일찍 세상을 떠나더라도 GPT-5가 시리즈를 자동완성해 줄 것이라고 썼습니다. 자료에 따르면 Gogineni는 작가들의 데이터 무단 사용 우려와 AI 경쟁으로 인한 일자리 감소를 알고 있었지만, 이를 ‘받아들일 만한 경제적 혼란’으로 여겼습니다.

LibGen 사용과 내부 인지 정황이 담겼습니다

작가 측 자료는 Microsoft가 2019년 4월부터 OpenAI의 LibGen 사용을 알았다고 주장합니다. 당시 Sam Altman과 Dario Amodei가 GPT-3 초기 버전을 Bill Gates와 Microsoft 최고기술책임자 Kevin Scott 등에게 소개하며 LibGen 사용 사실을 알렸다는 내용입니다.

OpenAI 연구 책임자였던 Amodei는 LibGen이 학습 데이터로는 ‘조금 더 수상하다’고 말했습니다. 연구원 Sam McCandlish는 자신이 걱정한 것은 법이 아니라 ‘수상한 러시아 웹사이트의 저작권 데이터를 OpenAI가 쓴다’는 내용이 Hacker News에 올라올 때의 여론이라고 밝혔습니다.

작가 측 자료에는 OpenAI가 2022년 여름 ‘Project Clear’의 일환으로 LibGen 파일을 삭제했다는 주장도 나옵니다. 2022년 6월, 한 직원은 Google Docs와 Slack, GitHub에 LibGen 언급이 많이 남아 있다고 물었습니다. 연구 부문 부사장 Bob McGrew는 OpenAI가 뉴스에 많이 오르내리는 지금이 시스템과 저장소에서 LibGen을 제거할 때라고 답했습니다.

소송은 진행 중입니다

Authors Guild와 작가들은 OpenAI와 Microsoft가 저작권이 있는 책을 무단으로 사용해 모델을 학습시켰다며 소송을 제기했습니다. 작가 측은 이번 자료를 부분 약식판결 신청을 뒷받침하는 근거로 제출했습니다. 해당 소송은 뉴욕 남부지방법원에서 진행 중이며, Authors Guild는 2027년 초 심리가 열릴 것으로 예상한다고 밝혔습니다.

Hacker News 반응

  • @papergirl — 새로 공개된 법원 자료에는 OpenAI 연구원이 “저작권이 있는 데이터를 수상한 러시아 웹사이트에서 썼다는 내용이 HN에 올라오는 게 걱정됐을 뿐”이라고 말했다고 나옵니다. Authors Guild가 OpenAI를 상대로 제기한 소송 자료에서 나온 흥미로운 발언 가운데 하나입니다.
    • @swiftcoder — 우리 모두가 Dario Amodei의 머릿속에 세 들어 산다는 걸 알게 돼 좋네요.
    • @optimalsolver — Demis Altman을 말하는 걸 수도 있겠네요.
    • @lensecat — Amodei가 OpenAI에서 일하던 때의 다음 발언을 말하는 것 같습니다. Amodei가 LibGen은 학습 데이터로 “조금 더 수상하다”고 하자, Sam McCandlish가 “수상한 러시아 웹사이트의 저작권 데이터를 OpenAI가 쓴다는 내용이 HN에 올라오는 게 걱정됐을 뿐”이라고 했습니다.
  • @locknitpicker — 덧붙이자면, 대부분의 조직은 신입 교육에서 입을 다물어야 할 필요성을 이미 다룹니다. 개인 발언이 회사 입장을 대변하지도 않고 대변해서도 안 된다는 점도 특히 강조합니다. 여러 조직의 신입 교육 자료에 이 소송이 명시적으로 들어가겠네요.
  • @Skyy93 — 이건 자기 의제를 밀어붙이려고 마음에 드는 부분만 골라 쓰는 로비 단체입니다. “수상한 러시아 웹사이트”라고 하기보다, 공공 자금으로 만들어져 일부는 공공 영역에 속해야 하는 책과 논문을 공유하는 도서관이라고 설명하면 어떨까요? 자료 가운데 일부만 저작권이 있고, 재출간되지 않는 오래된 작품도 있습니다. 하지만 그렇게 설명하면 사람들이 클릭하지 않겠죠. 사람을 실직시키겠다는 발언도 문제로 보이지 않습니다. 로봇이나 자동화 기업이 “값비싼 로봇을 잔뜩 사면서 비싼 노동력에도 계속 의존하고 효율은 얻지 못할 것”이라고 광고한다고 생각해 보세요.
    • @lensecat — “로비 단체라고요?” 개인 작가 한 명이 수십억 달러 규모 기업을 혼자 상대할 형편이 되겠습니까? 그리고 “수상한 러시아 웹사이트”는 OpenAI 직원들의 발언입니다. 무슨 말씀이신가요?
    • @Skyy93 — 첫째, 여전히 로비 단체이므로 노조나 정치적 목적을 가진 다른 단체처럼 과장된 주장을 하는 게 그들의 일입니다. 중립적이지 않고 뉴스도 아니라는 점을 말한 겁니다. 편향적이라고 말할 권리는 제게도 있습니다. 둘째, 직원 한 명이 LibGen을 수상하다고 불렀다는 한 줄을 근거로 큰 주장을 합니다. LibGen은 2010년대부터 있었고 많은 사람이 조사에 활용했습니다. 어느 날 갑자기 나타나 나쁜 일만 하는 수상한 사이트가 아닙니다. 더 균형 잡힌 입장이 필요합니다.
    • @abroszka33 — 도서관이었다는 근거가 있나요? 그렇더라도 OpenAI가 러시아 조직도 아닌데 그런 자료를 선의로 이용했는지 의문이 남습니다. 러시아 토렌트 사이트를 쓴 것 같은데요.
    • @Skyy93 — 본문에 나옵니다. https://en.wikipedia.org/wiki/Library_Genesis 에 따르면 Microsoft는 2019년 4월부터 OpenAI의 LibGen 사용을 알았습니다.
    • @spwa4 — 직접 확인해 보세요. https://libgen.im/ ISP가 막았을 수도 있으니 다른 주소를 찾아보세요. (참고: https://z-library.sk/ 가 더 보기 좋습니다.)
    • @ZeWaka — 기사에서 말하는 곳은 LibGen입니다.
    • @Andrew_nenakhov — 문제의 웹사이트는 libgen.io였던 것 같습니다. 지금은 내려간 듯하고, libgen.im, libgen.com.de 같은 미러가 많이 있습니다.
  • @quaintdev — 이 댓글이 HN에서 가장 높은 점수를 받은 게 슬프네요. 왜 기술 기업에 면죄부를 주나요? CEO들이 계속 법을 어겼는데 왜 그들을 믿죠? Aaron Swartz와 그가 겪은 일을 기억하세요. 왜 빅테크는 훨씬 더 많은 일을 저지르고도 처벌을 피하나요?
    • @Skyy93 — 제 주장을 잘못 이해하셨습니다. 저작권법은 크게 바뀌어야 하고, 현행 제도는 우리 모두에게 해롭다고 생각합니다.
    • @ares623 — 그렇다고 해도 현행법을 어겼다는 사실은 남습니다. 새 법이 과거의 행위를 소급 처벌하지 않듯, 새 법이 통과되기 전에 저지른 일을 소급해서 없던 일로 만들어서도 안 됩니다.
    • @Skyy93 — 저작권은 보통 제한된 기간 동안 저작물을 복사하고 배포하고 각색하고 전시하고 공연할 독점적 권리를 주는 지식재산권입니다. 더 흥미로운 질문은 AI 학습이 실제로 이런 행위에 해당하는지입니다. 책을 읽을 수 있고 복사할 수도 있지만, 법 때문에 복사하지는 않습니다. 무언가를 할 능력이 있다는 사실만으로 그 행위가 금지되는 걸까요?
    • @TeMPOraL — Aaron Swartz를 무덤 속 영구기관으로 만들려는 건가요? 그가 지식재산권을 근거로 AI 기업에 반대하고 출판·음반 단체를 지지했을 거라고 정말 생각하나요? 기술 커뮤니티가 갑자기 태도를 바꿔 “정보에 대한 자유로운 접근과 기술을 가능하게 하는 일은 이제 끝, RIAA가 내 절친”이라고 하는 게 더 어리석습니다. https://imgflip.com/memegenerator/137501417/Friendship-ended
  • @latexr — 무슨 말씀이신가요? “수상한 러시아 웹사이트”는 Authors Guild가 붙인 표현이 아니라 OpenAI에서 일한 Sam McCandlish의 발언입니다. LibGen에 공공 영역 저작물이 일부 있다는 이유로 방어하는 건, The Pirate Bay에서 “리눅스 ISO를 받았다”고 주장하는 것만큼 우스운 변명입니다. 사실인 경우가 일부 있더라도 그게 주된 이용 사례가 아니라는 건 다들 압니다. 다른 쪽이 의제를 밀어붙이는 로비라고 비난하면서 본인 편향은 꽤 뚜렷하네요.
  • @trompetenaccoun — 기사의 문장이 엉망이라 혼란스러울 수 있지만, “수상한 러시아 웹사이트”는 Anthropic의 Sam McCandlish가 직접 한 말인 것 같습니다. Dario Amodei도 수상하다고 했고요. 인류 역사상 가장 큰 저작권 침해 작전이라고 할 만한 일을 운영하면서 LibGen을 “수상하다”고 말하는 뻔뻔함이 놀랍습니다. LibGen이 수상하다면 OpenAI는 뭔가요?
    • @qarl — 많은 사람은 학습이 책을 읽는 것과 비슷하고 복제는 아니므로 공정 이용이라고 봅니다. 법원도 대체로 그렇습니다.
  • @hnfong — 제목을 고칠 수 있나요? HN을 노린 낚시성 제목입니다. 기사 원제는 “Unsealed Briefs in Authors’ Case v. Microsoft/OpenAI: Top Execs Knew Their Mass Book Piracy Was Illegal And Would Put Authors Out of Work”입니다.
  • @hn1rig3rak — 예전에 LibGen에서 말뭉치용 데이터셋을 내려받았는데, 대부분 저작권이 유효한 교재였습니다. 공공 영역 자료라는 설명은 설득력이 없습니다.

원문: Authors Guild / 번역·요약: Trawling