Hacker News

AI companies leak data to advertisers [pdf]

대화형 AI 서비스, 대화 제목·프롬프트·공유 링크를 추적 업체에 전송

연구진은 대화형 AI 서비스 9곳의 웹과 안드로이드 앱을 분석해 모든 서비스에서 광고·추적 업체와 연결되는 흐름을 확인했습니다. 일부 서비스는 대화 URL, 제목, 프롬프트, 스크린샷을 식별자와 함께 전송했고, 접근 제어가 없는 링크는 대화 전체를 노출할 수 있었습니다.

AI 요약

대화형 AI 서비스는 사용자의 민감한 질문과 대화 기록을 처리하지만, 그 흔적이 서비스 밖으로 나가는 방식은 충분히 드러나지 않았습니다. Guilherme Oliveira 등 연구진은 대형 대화형 AI 서비스 9곳의 웹 버전과 안드로이드 앱 8종을 살펴보고, 제3자 광고·추적 서비스(ATS)가 어떤 정보를 받는지 조사했습니다. 정적·동적 분석을 함께 사용했고, 동의 설정과 구독 등급, 대화 공유 기능에 따라 데이터 흐름이 어떻게 달라지는지도 비교했습니다. 실험은 2026년 5월 스페인에서 진행했습니다.

추적 서비스 연결과 동의 설정

분석한 서비스 9곳 모두 제3자 광고 또는 추적 서비스에 연결됐습니다. 연구진은 서로 다른 도메인 124개를 44개 조직으로 분류했고, 그중 34곳을 ATS로 확인했습니다. 웹과 안드로이드 앱의 연결 대상은 상당히 달랐습니다. ATS 11곳은 두 환경 모두에서 나타났고, 15곳은 웹에서만, 8곳은 모바일에서만 관찰됐습니다. 모바일에서 발생한 고유 네트워크 엔드포인트의 71%는 네이티브 코드가 아니라 앱 안의 웹뷰(WebView)에서 나왔습니다.

쿠키 동의는 웹에서 추적 범위를 바꿨지만, 필수 항목이 아닌 쿠키를 거부해도 추적이 완전히 사라지지는 않았습니다. ChatGPT, Claude, Copilot, DeepSeek, Gemini, Perplexity는 거부 설정에서도 Google Ads에 연결됐습니다. 반대로 동의 설정을 받아들인 뒤 Claude, Perplexity, Grok에서 Meta, TikTok, Twitter Ads, DoubleClick, AppsFlyer 같은 업체가 추가로 활성화됐습니다. 구독 등급에 따른 차이는 대체로 작았습니다. 무료 계정과 유료 계정에서 추적 인프라가 거의 같았습니다.

대화에서 나온 정보가 제3자에게 전달됩니다

웹 서비스 6곳과 안드로이드 앱 3곳에서 대화 관련 정보가 제3자에게 전달됐습니다. 웹에서는 5개 서비스가 대화 URL 또는 대화 식별자를 9개 ATS에 보냈습니다. 이 가운데 3곳은 기본 설정에서도 전송했고, 나머지는 비필수 쿠키에 동의한 뒤 전송했습니다. 대화 제목은 웹 서비스 3곳에서 9개 업체로 전달됐으며, 대부분은 쿠키 동의 뒤에 발생했습니다. 프롬프트와 스크린샷도 공유 기능을 사용하는 과정에서 전송된 사례가 있었습니다.

이 정보가 이메일 주소 해시, 계정 ID, 광고 쿠키 같은 지속 식별자와 함께 넘어가면 특정 사용자의 대화와 연결될 수 있습니다. Grok 웹에서는 대화 URL과 제목이 Google Ads, Google Search, DoubleClick, Meta, TikTok, Twitter Analytics 등에 전달됐습니다. Meta의 _fbp 쿠키나 TikTok의 _ttp 쿠키가 함께 실리는 경우도 확인했습니다. Claude는 사용자가 비필수 쿠키를 허용하면 Segment를 거쳐 Facebook, LinkedIn, TikTok, Reddit, Google 등 11개 광고 업체로 이벤트를 전달하는 서버 간 전송을 구성했습니다. 브라우저 안에서 보이지 않아 광고 차단기가 막기 어려운 방식입니다.

모바일에서도 계정과 기기 식별자가 전달됐습니다. 세 앱은 Android 광고 ID(AAID)를 Adjust, AppsFlyer, Singular에 보냈습니다. Grok은 사용자 ID와 AAID를 함께 보냈고, Perplexity는 사용자·설치 ID와 AAID를 함께 전송했습니다. 사용자가 광고 ID를 재설정해도 계정이나 설치에 연결된 다른 식별자가 남으면 다시 연결될 수 있다고 연구진은 설명합니다.

대화 링크의 접근 제어와 외부 접근

대화 링크가 추적 업체에 전달되면, 링크를 열어 대화 전체를 읽을 수 있는지도 문제가 됩니다. 연구진은 로그아웃한 비공개 브라우저에서 각 링크를 열어 접근 제어를 시험했습니다. Grok은 무료·유료 계정의 대화 링크가 기본적으로 공개됐고, 사용자가 별도로 공개를 막아야 했습니다. Perplexity는 게스트 계정의 대화를 공개 상태로 제공했습니다. 연구진은 공유 기능으로 만든 링크도 확인했으며, 모든 서비스에서 로그인 없이 대화를 볼 수 있었습니다. Grok 공유 페이지에서는 TikTok이 대화 스크린샷을, Meta와 TikTok이 가장 최근 프롬프트를 수집하는 사례도 관찰했습니다.

연구진은 대화와 업로드 파일에 추적용 카나리 URL을 넣어 외부 접근 여부도 살폈습니다. Grok에서는 제출 뒤 수 시간에서 며칠 사이에 70개 IP 주소에서 70회 접근이 발생했습니다. IP는 14개국, 4개 대륙에 걸쳐 있었고, 접속의 65.7%는 미국에서 왔습니다. Perplexity는 URL 접근을 명시적으로 금지한 프롬프트에서도 카나리 URL을 반복해서 열었습니다. 다만 관찰되지 않은 접근이 없었다고 단정할 수는 없다고 연구진은 덧붙였습니다.

연구 범위와 시사점

연구진은 웹 요청과 브라우저 저장소, 안드로이드 앱의 네트워크 통신과 식별자 접근을 관찰하고, 쿠키 동의와 계정 등급별 실험을 비교했습니다. 건강 관련 질문을 입력해 민감한 주제를 포함한 상황을 재현했으며, 결과를 GDPR과 ePrivacy Directive 맥락에서도 검토했습니다. 확인된 문제는 해당 업체와 유럽 데이터 보호 당국에 책임 있는 공개 절차로 전달했다고 밝혔습니다. 연구는 대화형 AI의 추적이 일반적인 웹 분석에 그치지 않고, 대화 내용에서 만들어진 제목·링크·프롬프트 같은 정보까지 포함할 수 있음을 보여줍니다.

Hacker News 반응

  • @damaru2 — 접근 제어가 없는 링크라면 추적 업체가 대화 URL만 받아도 대화 전체를 볼 수 있습니다. 공유 중 TikTok은 Grok 대화 스크린샷을 받았습니다. 프롬프트와 민감한 사실을 드러내는 자동 생성 대화 제목도 지속 식별자와 연결됩니다. “뉴욕 연봉 8만 5천 달러: 주택담보대출 28만~35만 달러” 같은 내용입니다.
    • @Traster — 믿기 어려울 정도로 무능합니다.
  • @Coeur — “여러 업체가 제목, 프롬프트, 스크린샷을 포함한 민감한 대화 정보를 제3자에게 공개하고, 사용자를 식별할 수 있는 지속 식별자도 함께 보내는 경우가 있습니다. 일부 업체는 접근 제어 없이 대화 링크를 공개해 추적 업체가 대화 전체를 읽게 합니다.” 정말 좋지 않습니다.
    • @postalcoder — 여러 AI 채팅 서비스에서 제가 가장 싫어하는 경향은 URL의 UUID를 개인정보 보호와 같은 것으로 취급한다는 점입니다. Perplexity가 그렇습니다. 예전 Perplexity 검색 URL에 접속하면 대화 전체가 드러납니다.
    • @msdz — 진심으로 묻습니다. UUID 기반 URL을 직접 공유하지 않는다면 무엇이 개인정보 보호에 좋지 않은 건가요? 누군가 URL을 추측할 수 있는 것도 아니잖아요. 그렇죠?
    • @postalcoder — 네, 기술적으로 URL을 맞히는 일은 불가능에 가깝습니다. 하지만 브라우저 기록은 평문으로 저장되고 수상한 행위자가 쉽게 볼 수 있습니다. 저도 입력창에 엉뚱한 내용을 실수로 붙여넣곤 합니다.
    • @albert_e — 보안 은닉(security by obscurity)은 오래된 안티패턴입니다. Gemini를 비롯한 여러 AI 도구는 대화에서 ‘공유’를 누르면 누구나 접근할 수 있는 URL을 만들고, 사용자가 그 링크의 수명 주기를 관리하길 기대하는 것 같습니다. 브라우저, 기기 OS, 훅·플러그인·확장 프로그램, 과도한 텔레메트리, 소셜 미디어 미리보기, 프리로드·프리페치, URL 래핑과 단축 같은 과정을 거치면서 링크가 의도한 사람에게 도달하는 동안 색인되거나 수집될 방법은 수없이 많습니다. 얼마 전 Claude 아티팩트가 Google 등 검색 엔진에 대량으로 색인된 일도 있었습니다. 설계 단계부터 보안과 개인정보를 고려하지 않는 방식은 놀라울 정도로 허술합니다.
    • @postalcoder — 채팅 UI는 “잘못 누르면 데이터를 공유하거나, 모르는 사이 학습에 쓰이게 되는” 지뢰밭입니다.
  • @classified — 애초에 계약의 목적이 그거였다면 여전히 ‘유출’이라고 부르나요? 누군가 조사해야 합니다. 하지만 아마 전부 “합법”이겠죠?
    • @lava_pidgeon — 미국에서는 그럴 수 있습니다. EU 법에서는 GDPR 위반일 가능성이 큽니다.
  • @charcircuit — 논문에는 앱이 변환된 대화 정보를 언제 전송하는지 나와 있지 않습니다.
  • @DrMandalay — ‘유출’이 아니라 ‘판매’라고 해야 합니다. 이 제목은 사기업이 사용자의 개인정보를 광고주에게 파는 행위에서 주체성을 지워버립니다.
  • @j4k0bfr — AI 업체들이 데이터를 그렇게 쌓아두려 하는데 이런 일이 벌어진다는 점이 조금 놀랍습니다. 일부 광고 업체는 AI 회사와 직접 경쟁하기도 합니다. 광고 기능을 서둘러 넣었거나, 수익을 내라는 투자자 요구가 회사의 이익과 충돌한 것 같습니다. 수정: AI 채팅 광고의 효과를 높이려면 일부 데이터는 어쨌든 유출해야 할 겁니다. 그래도 AI 업체들은 경쟁사에 넘기기보다 데이터를 직접 보유하고 광고를 운영하길 원할 것 같습니다. AI 업체가 단순히 광고를 호스팅하는 데 그치지 않고 광고 회사까지 되면 무섭겠습니다.
    • @alansaber — AI 업체가 구현을 서두른다고요? 그럴 리가요 :).
    • @mrweasel — 초록만 읽었는데, 데이터가 실수로 유출된 건지 의도적으로 제공된 건지가 질문인 것 같습니다. 제 추측은 전자입니다. 그렇다면 전혀 놀랍지 않습니다. 데이터를 팔았다고 해도 놀라진 않겠지만, 그건 다른 이야기입니다. OpenAI를 예로 들면 서비스를 안전하게 운영할 경험이나 자원이 부족하다는 점을 여러 차례 보여줬고, 운영 안정성도 인상적이지 않습니다. 수익성과 성장을 밀어붙이느라 서두른다는 추측에 동의합니다.
  • @drywater2 — 아니요, 데이터를 “유출”하는 게 아닙니다. 데이터를 판매하는 겁니다. 유출은 실수로 일어나는 일이죠. 이건 의도적입니다.
  • @999ziyadej — 데이터가 판매되는 것 같습니다.

원문: Hacker News / 번역·요약: Trawling