Hacker News

One month coding with GLM 5.3 Flash

GLM 5.3 Flash로 한 달 코딩하기

Wagtail 개발자가 한 달 동안 효율적인 오픈 모델만 쓰려 했지만, GLM 5.3 Flash 사용량은 전체 토큰의 절반에 그쳤습니다. 모델 선택 실수와 추론 인프라 혼잡, 연구개발용 실험이 원인이었으며, 비용·에너지 측정과 작업별 모델 선택의 필요성을 짚습니다.

AI 요약

Wagtail 개발팀은 9월 한 달 동안 효율적인 오픈 모델 GLM 5.3 Flash만 사용하려 했습니다. 한 달 동안 처리한 토큰은 약 20억 개였고, 목표 모델에 쓴 양은 10억 개로 절반에 그쳤습니다. 실험은 계획대로 진행되지 않았지만, 모델 비용과 에너지 사용을 관리하고 실제 개발 작업에 알맞은 모델을 고르는 방법을 돌아봅니다.

목표 모델 사용과 비용

첫 절반 동안은 GLM 5.3 Flash만 사용했고, 해당 모델 비용은 68달러였습니다. 글은 이를 GPU 에너지 사용량 약 4kWh, 탄소 배출량 365g으로 집계합니다. 그러나 후반에는 다른 모델에 약 10억 토큰을 썼습니다.

가장 큰 원인은 Wagtail MCP 서버 프로토타입을 바이브 코딩(vibe coding)으로 만들면서 목표 모델이 아닌 GLM 5.3 일반 버전을 쓴 일입니다. 하룻밤 사이 4억 5천만 토큰을 사용해 150달러와 5kWh가 들었습니다. 결과물은 작동하는 MCP 서버와 기능 시연이었지만, 같은 결과를 약 5분의 1 비용으로 얻을 수도 있었다고 글쓴이는 봅니다. 모델을 잘못 고른 채 에이전트를 장시간 실행한 일이 비용을 키웠으며, 실험과 프로토타입 예산을 따로 잡고 에이전트 작업 범위를 제한해야 한다고 설명합니다.

모델 성능과 인프라

GLM 5.3 Flash는 100만 토큰 컨텍스트 창과 이미지 입력을 지원하고 여러 추론 제공업체에서 쓸 수 있습니다. 글쓴이는 Wagtail 개발, Wagtail 기반 사이트 작업, UI 작업, AI 연구개발, 문서 작성과 평가 작업에 활용했습니다. 일상 개발에서는 Flash급 저비용 모델 한두 개를 주력으로 쓰는 방식이 가능하다고 평가합니다.

다만 추론 제공업체의 용량 부족으로 GLM 5.3 Flash 성능이 저하됐고, DeepSeek V4.1 Flash와 Qwen 3.8 Flash로 바꿔야 했습니다. 유럽 데이터센터에서 쓸 수 있는 오픈 모델만 비교한 결과이므로, 다른 지역이나 제공업체를 선택하면 비교 대상이 달라질 수 있다고 덧붙입니다. 모델 비교와 Wagtail 작업 벤치마크를 위한 연구개발도 여러 모델을 시험해야 하는 이유였습니다.

다음 실험에서 바꿀 점

글쓴이는 10월부터 일상적인 개발 작업의 절반 이상에만 단일 모델 사용 목표를 적용하고, 연구개발은 별도로 계산할 계획입니다. 토큰 수뿐 아니라 비용과 에너지 사용을 계속 기록하고, 실험 예산을 편성하며, 계획·탐색·구현·검토 역할을 나눈 에이전트 구성을 시험하겠다고 합니다. 목표는 토큰 수가 아니라 실제 비용과 에너지 기준으로 추론 작업 대부분을 효율적인 모델에 맡기는 것입니다.

Hacker News 반응

  • @ThibWeb — 조금 우스운 도전이었고 실제로 가능할지 확신하지 못했지만, 사용량과 비용을 좌우하는 요인, 그리고 둘을 관리하는 방법을 많이 배웠습니다.
  • @RussianCow — 두 모델을 꽤 많이 써봤는데 GLM 5.3 일반 버전이 훨씬 나은 모델이라고 생각합니다. Flash는 일반적인 작업용 에이전트로 좋지만, 코드 전체를 고려해 추론하지 못하고 문제마다 과하게 설계하는 경향이 있습니다. GLM 5.3으로 모호하지 않은 상세 계획을 작성하면 Flash가 훨씬 저렴한 비용으로 잘 실행합니다.
  • @ThibWeb — 요즘은 GLM 5.3을 선택하기 어렵습니다. Flash보다 약간 낫지만 가격 차이를 정당화할 만큼은 아닌 경우가 많습니다. 사용량 기반으로만 결제하기 때문에 모델 가격에 민감합니다.
  • @sampullman — 다음 달을 더 쓸 수 있다면 DeepSeek V4.1 Flash와 비교해보면 좋겠습니다.
    • @ThibWeb — 다음 달에는 그 모델을 써볼 것 같습니다. 며칠 써본 느낌은 약간 더 낫고, 작업 중인 벤치마크에서도 점수가 훨씬 높습니다.
    • @nowittyusername — 제 경험으로는 GLM 5.3 Flash가 DeepSeek 4.1 Flash보다 나았습니다. DeepSeek은 추론 과정에서 쓸데없이 말을 너무 많이 해서 답은 빨리 내지만 작업 완료는 늦었습니다.
    • @RussianCow — 흥미롭네요. 속도는 정반대로 경험했습니다. 제 테스트에서는 DeepSeek V4.1 Flash가 GLM 5.3 Flash보다 훨씬 빨리 작업을 끝냈습니다. DeepSeek은 초당 300토큰 이상, GLM은 약 100토큰이었습니다. GLM이 약간 더 나은 모델인 데는 동의하지만 차이가 크지 않아 저는 DeepSeek의 속도를 택하겠습니다.
  • @aktenlage — 왜 잘못된 모델이었나요? 어떤 모델이 더 나았을까요? 교훈은 무엇이고, 어떻게 미리 알 수 있었나요?
    • @ThibWeb — 설명을 고쳐야 할 수도 있겠습니다. 처음 도전은 GLM 5.3 Flash를 쓰는 것이었는데, 바이브 코딩으로 프로토타입을 만드는 동안 GLM 5.3 일반 버전을 썼습니다. 한 세션이 한 달 지출의 4분의 1이자 예산의 150%라는 사실을 알아차리지 못했습니다. 두 모델의 가격 차이가 컸습니다.
  • @gpugreg — 에너지 사용량은 어떻게 측정했나요?
    • @ThibWeb — Neuralwatt에서 받은 수치이며 GPU 에너지 사용량만 포함합니다. 토큰 수보다 모델 효율을 더 분명하게 보여줍니다.
  • @disiplus — 글쓴이는 왜 실험이 실패했는지 구체적인 사례와 함께 제대로 설명했나요? 제가 읽기 어려운 건가요?
    • @desmondl — 저도 GLM 5.3 Flash 리뷰를 기대했지만, 글은 한 달간의 도전을 돌아보는 내용이었습니다. 잘못된 모델로 바이브 코딩을 하며 4억 5천만 토큰을 썼고, GLM 5.3 Flash가 느릴 때 다른 모델로 바꿨으며, 연구개발에도 다른 모델이 필요했습니다. 결론은 사용량 측정과 에이전트 구성 실험을 더 하고, 일상 작업에는 저렴한 Flash 모델을 써볼 만하다는 것입니다.
  • @benjiro29 — DeepSeek 공식 API는 캐시 처리가 더 좋아 Neuralwatt보다 훨씬 저렴할 수 있습니다. 긴 작업에서는 캐시 적중률 차이가 비용 격차를 두세 배까지 벌릴 수 있습니다. Neuralwatt의 에너지 수치는 실제 전력 사용량이라기보다 이윤이 포함된 별도 과금 방식일 수 있으니 주의해야 합니다.
    • @ThibWeb — 제가 Neuralwatt에서 받은 에너지 수치는 CleerDash 같은 다른 자료와 대략 비슷합니다. 이윤이나 설비투자 비용이 포함된다는 근거는 무엇인가요? 공개된 측정 방법은 꽤 투명해 보입니다.
  • @shieldagent — 에이전트 코딩 한 달에 68달러라는 점이 가장 눈에 들어옵니다. 모델 선택은 품질뿐 아니라 예산을 정하는 일이 되고 있습니다.
  • @nxobject — “평소 지향하는 방식은 아니지만 프로토타입에는 잘 맞는다”는 말이 바이브 코딩에 대한 제 생각과 같습니다. 복잡한 작업도 맡길 수 있지만, AI가 만든 GPU 드라이버를 매일 쓰지는 않겠습니다. 첫 시도는 버릴 거라고 다시 자연스럽게 생각해야 할지도 모릅니다.

원문: Wagtail / 번역·요약: Trawling