Reddit

I'm not paying $20 for ChatGPT or Claude because a free local LLM does everything I need

내가 필요한 일은 무료 로컬 LLM으로 충분해 ChatGPT와 Claude에 월 20달러를 내지 않습니다

작성자는 Qwen 3.8-27B를 로컬에서 실행해 이메일 정리, 요약, 정보 추출과 일부 코딩 작업을 처리하면서 ChatGPT와 Claude 구독을 대체했다고 말합니다. Reddit에서는 개인정보 보호와 사용량 제한 해소를 장점으로 꼽는 의견과, 하드웨어 비용과 성능을 고려하면 클라우드 모델이 낫다는 반론이 맞섭니다.

AI 요약

작성자는 ChatGPT와 Claude를 함께 구독하면서 매달 비용이 들자, 두 서비스에서 하던 작업을 로컬 모델로 옮겨 보았습니다. 그 결과 Qwen 3.8-27B가 자신이 자주 하는 일 대부분을 처리해 구독 하나를 취소할 만했다고 설명합니다. 다만 모든 사용자에게 클라우드 모델을 대체할 수 있다는 주장은 아닙니다. 글은 개인의 작업 방식과 이미 보유한 하드웨어를 기준으로 로컬 모델의 효용을 살펴봅니다.

16GB VRAM에서 실행한 Qwen

작성자는 Unsloth의 UD-IQ4_XS 빌드를 사용합니다. 모델 파일 크기는 13.3GB이며, 16GB GDDR6X 메모리를 탑재한 RTX 4070 Ti Super에서 16K 컨텍스트를 두고 실행합니다. llama.cpp로 localhost 서버를 띄웠고, 여러 차례 실행에서 초당 약 33.7토큰을 기록했다고 합니다. Pygame으로 한 파일짜리 Snake 게임을 만들어 달라는 요청도 한 번에 수행했습니다. 일반적인 텍스트 질의에서는 요약과 분석을 주로 맡겼습니다.

작성자는 장황한 이메일에 흩어진 숫자 열두 개를 표로 정리해 달라고 요청한 사례도 듭니다. 모델이 숫자를 빠짐없이 추출해 항목별 표로 구성했고, 이메일 문장 다듬기와 요점 정리, 여러 사용자 게시물의 반응 분석 같은 일도 처리했다고 합니다. 이런 작업에는 데이터센터급 모델이 꼭 필요하지 않다는 것이 작성자의 판단입니다.

코딩 성능보다 사용량 제한에 초점

글은 코딩에서는 Claude가 더 뛰어나다고 인정합니다. 특히 Python 프로젝트처럼 모델과 여러 차례 주고받으며 수정하는 작업에서 Claude를 유용하게 써 왔습니다. 문제는 사용량 제한입니다. 작성자는 5시간 제한에 걸리면 대화를 다시 살펴 작업 맥락을 되찾아야 하고, 추가 사용료를 내거나 제한이 풀릴 때까지 기다려야 한다고 설명합니다.

로컬 모델에는 5시간 제한이나 주간 사용량 한도, 초과 요금이 없습니다. 작성자는 밤새 모델에 프로젝트 작업을 맡겨도 전기료 외에 추가 비용이 들지 않는다고 말합니다. GPU 소비 전력은 285W라고 밝혔습니다. 이메일 초안이나 벤치마크 데이터도 자신의 PC 밖으로 나가지 않는다는 점을 개인정보 보호 측면의 이점으로 꼽습니다.

구독료와 하드웨어 비용의 비교

작성자는 Qwen 3.8-27B가 벤치마크에서 최상위권이 아니더라도 자신의 일상 작업에는 충분하다고 봅니다. 16GB 노트북에서 실행할 수 있는 Gemma 계열이나 더 작은 Qwen 모델처럼, 하드웨어에 맞는 선택지가 Hugging Face에 있다고 덧붙입니다. 다만 이 비교는 이미 해당 GPU를 보유한 작성자의 상황을 바탕으로 합니다. 새 장비 구입비와 전력 소비까지 포함하면 월 20달러 구독보다 저렴하다고 단정하기 어렵다는 반론도 나옵니다.

Reddit 반응

  • @u/THROWAWTRY — 저는 로컬에서 모델을 실행하며 제 용도에 맞춰 씁니다. Claude나 ChatGPT에 돈을 내지 않고, 직장에서도 특정 목적의 로컬 모델을 하나 또는 여러 개 돌릴 서버를 마련하는 이야기를 하고 있습니다. 직접 에이전트를 코딩하고 MCP 도구도 만들었습니다.
  • @u/THROWAWTRY — LM Studio를 씁니다. 모델을 내려받아 컴퓨터에 맞는 설정으로 불러온 뒤 평소처럼 대화하면 됩니다. 더 고급 작업에는 로컬 호스팅을 해서 OpenCode와 연결합니다. 하위 에이전트와 도구를 설정했고, RAG 도구와 Comfy Desktop용 이미지 처리기를 위한 MCP 서버도 만들었습니다.
  • @u/madogvelkor — 대부분의 일반 사용자는 괜찮은 로컬 모델을 돌릴 만한 하드웨어를 집에 갖고 있지 않습니다. 휴대폰이나 저전력 노트북에서도 쓸 수 있는 구독에 연간 240달러 정도를 내는 편이 더 저렴합니다. 그래픽카드 하나 값이면 구독을 3년 쓸 수 있습니다.
  • @u/slackmaster2k — “내가 필요한 건 다 한다”는 말이 웃깁니다. 필요한 일이란 대체 무엇이기에 평범한 성능으로 충분하다는 점이 프런티어 모델의 사업 모델과 관련한 결정타인 것처럼 말하는 건가요? 코드 생성부터 도구 실행, 데이터 분석까지 제가 실제로 하는 일로 벤치마크를 만들었습니다. 특정 작업에 맞는 오픈 모델은 찾았지만, 여러 분야를 놓고 보면 프런티어 모델과 비교가 안 됩니다.
  • @u/inTHEsiders — 모든 사람이 AI로 코드를 한 번에 생성하는 건 아닙니다. 이미 실력이 뛰어난 시니어 엔지니어라면 로컬 모델과 일반적인 코딩을 함께 써서 매우 빠르게 작업할 수 있습니다. 코드를 작성하는 동안 내용을 이해하고 있으니 검토 시간도 줄어듭니다. 이미 방법을 알고 있다면 프런티어 모델이 답을 알려 줄 필요 없이, 제가 입력하는 것보다 빠르게 타이핑해 줄 모델이면 됩니다.
  • @u/andysor — VRAM 24GB GPU로 로컬 모델을 많이 써 봤습니다. 재미로 로컬 이미지 생성이나 비교적 단순한 코딩을 하는 정도입니다. 하지만 Opus 5.5 코딩 에이전트 팀과는 품질과 속도 모두 비교가 안 됩니다. GPU는 실행 중 400W를 소비합니다. GPU를 세 개 더 사도 비용이 덜 들 것 같지 않고, 결과는 더 느리고 품질도 낮을 겁니다.
  • @u/tired514 — C/C++ 분야에서 커널, Qt, 항공전자, 임베디드 시스템 등을 다룬 30년 경력자입니다. Strix Halo에서 Qwen3.8-flash-next를 Q4_K_XL로 실행하는데, 제게는 충분히 쓸 만합니다. 몇 주째 모든 구독을 취소한 채 만족하며 쓰고 있습니다. 데이터를 다른 사람의 컴퓨터로 보내지 않아도 되고, 사용량 제한이나 접근 불가를 걱정하지 않아도 됩니다.
  • @u/Important-Today4119 — 왜 20달러를 내나요? 직접 돌리려면 최소 5,000달러를 쓰고, 24시간 실행하면 전기료도 20달러보다 훨씬 많이 내야 합니다.
    • @u/tired514 — Strix Halo 노드 하나를 24시간 돌릴 때를 기준으로 보면, 북미 대부분 지역에서 월 약 20달러가 들 수 있습니다. 추론과 디코딩을 합친 평균 소비전력을 약 150W로 잡으면 연간 1.3MWh입니다. 미국 평균 전기요금인 kWh당 0.18달러를 적용하면 연간 약 235달러, 월 약 19.50달러입니다. 다만 더운 지역의 냉방 비용은 포함하지 않았습니다.

원문: XDA Developers / 번역·요약: Trawling