Hacker News

Why isn't the industry freaking out about DeepSeek 4.1 Flash?

업계는 왜 DeepSeek 4.1 Flash에 놀라지 않을까요?

글쓴이는 한 달간 여러 프로젝트에 DeepSeek 4.1 Flash를 써 본 결과, 일부 프런티어 모델과 체감 성능 차이가 크지 않은데 비용은 훨씬 낮다고 말합니다. 토론에서는 저렴한 모델의 실용성에 공감하는 의견과, 실제 작업 품질·구독 요금·하드웨어 비용을 따져야 한다는 반론이 맞섭니다.

AI 요약

글쓴이는 한 달 동안 12개 프로젝트에서 DeepSeek 4.1 Flash를 집중적으로 사용했습니다. 작업을 하다가 모델 이름을 확인하지 않으면 DeepSeek와 Opus를 구분하기 어려울 때도 있었다고 합니다. 이런 경험을 바탕으로, 프런티어 모델보다 한두 달 늦더라도 비슷한 작업을 훨씬 저렴하게 처리하는 모델이 등장했는데 업계의 반응이 조용한 이유를 묻습니다.

저렴한 모델로 달라진 개발 방식

글쓴이는 현재 모델이 고품질의 비감독 작업을 맡기기에 충분하다고 봅니다. 최신 모델을 쫓기보다 파일 정리, 탐색적 UI 테스트처럼 이전에는 비용 때문에 맡기기 망설였던 일을 자주 시키는 편이 낫다는 주장입니다. OpenCode Go의 월 10달러 구독으로 DeepSeek를 사실상 제한 없이 쓰며, 한 세션에서 예상 비용이 1달러를 넘는 경우가 드물다고 설명합니다. 하루 가까이 이어지는 세션에서도 계획 수립과 조사까지 맡기고, 중요한 작업은 Opus 5.5로 최종 검토한 뒤 DeepSeek에 수정 작업을 돌리는 식으로 사용합니다.

글쓴이는 품질뿐 아니라 추론 비용의 차이도 강조합니다. DeepSeek가 첫 번째 모델인 V1보다 KV 캐시를 약 437분의 1로 줄였으며, 긴 코딩 세션에서 GPU 메모리에 KV 캐시를 유지하는 비용을 낮췄다고 설명합니다. 이 효율 덕분에 하루 동안 작업해도 비용을 낮게 유지한다는 것이 글쓴이의 경험입니다. 전력과 물 사용량도 줄어들 수 있다고 주장하지만, 본문에는 이를 뒷받침하는 측정값은 제시하지 않습니다.

구독 가격과 실제 작업 비용

댓글에서는 모델 가격을 토큰 단가만으로 비교하면 안 된다는 지적이 나옵니다. 한 사용자는 DeepSeek가 프런티어 API보다 저렴하지만 같은 작업을 완료하는 데 토큰을 세 배쯤 더 쓸 수 있다며, 작업당 비용과 속도를 함께 봐야 한다고 말합니다. 반면 다른 사용자는 OpenCode Go에서 DeepSeek를 몇 주간 구현 에이전트로 썼는데도 월간 사용량의 일부만 소진했다며, 10달러 구독의 가치가 크다고 답합니다. 구독형 상품이 보조금을 받는 동안에는 API 요금만 비교해선 실제 사용자의 비용 차이를 알기 어렵다는 의견도 나옵니다.

성능 평가도 엇갈립니다. 한 댓글 작성자는 코딩 과제 비교에서 Opus 5.5가 99점, DeepSeek 4.1 Flash가 72점을 받았다며 두 모델을 동급으로 보는 데 반대합니다. 반대로 다른 사용자는 RPC 경계를 잘못 잡은 설계 문제를 DeepSeek가 짚었고, 이후 다른 모델을 동원해도 새로 발견한 내용이 없었다고 경험을 공유합니다. 또 다른 개발자는 DeepSeek가 잘 정의된 구현 작업은 잘 처리하지만, 복잡한 프로젝트의 맥락을 반영하는 설계·조율 역할은 부족해 GLM을 다시 오케스트레이터로 사용한다고 말합니다. 즉, 작업 종류와 평가 기준에 따라 체감 성능이 다릅니다.

오픈 가중치와 로컬 실행의 간격

저렴한 API나 호스팅 서비스에서 모델을 쓰는 일과, 개인 장비에서 직접 실행하는 일은 별개의 문제라는 의견도 나옵니다. 댓글에는 모델을 특정 정밀도로 실행하는 데 필요한 VRAM을 따진 계산이 제시되지만, 다른 참여자는 DeepSeek의 가중치가 이미 저정밀도로 양자화돼 있고 일부 n-gram 테이블은 VRAM이 아닌 시스템 메모리에 둘 수 있다고 바로잡습니다. 한 사용자는 M5 Ultra 256GiB에서 모델 전체를 메모리에 올려 실행했다고 보고하며, 양자화 방식과 장비 구성에 따라 요구 사항이 달라진다고 설명합니다. 로컬 실행은 가능하더라도 장비 가격과 속도, 교체 주기를 고려하면 구독이나 호스팅보다 경제적이지 않을 수 있다는 반론도 있습니다.

글쓴이가 제기한 업계의 침묵에도 여러 설명이 나옵니다. 기업이 새 모델을 천천히 도입하거나 중국 모델을 정책상 금지하는 경우가 있다는 의견이 있습니다. 프런티어 업체의 구독 상품이 이미 저렴하게 제공돼 사용자가 가격 차이를 크게 느끼지 못한다는 주장도 나옵니다. 반대로 오픈 모델이 성능을 유지한 채 가격을 낮추면 기업용 추론 시장에 경쟁 압력을 줄 수 있다는 기대도 있습니다. 이 토론은 DeepSeek 4.1 Flash의 성능을 단정하기보다, 작업당 비용과 품질, 구독 보조금, 데이터 처리 조건, 하드웨어 요구량을 함께 비교해야 한다는 점을 보여줍니다.

Hacker News 반응

  • @verdverm — 왜 놀라야 하나요? 우리가 쓰는 시스템은 늘 더 나아지고, 더 빨라지고, 더 저렴해져 왔습니다.
  • @ByteAtATime — 이 모델은 크기를 보면 Flash라기보다 Pro에 가깝고, 속도만 Flash에 가까운 것 같습니다.
  • @thefourthchime — 코딩에서는 Opus 5.5가 완전히 다른 수준입니다. 제가 본 비교에서 Opus 5.5는 9.3분, 1.99달러, 99점을 기록했고 DeepSeek 4.1 Flash는 2.8분, 1.89달러, 72점을 기록했습니다.
  • @apitman — OpenCode Go의 월간 사용량이 아침에 초기화될 예정이었는데, DeepSeek를 구현 에이전트로 몇 주간 집중적으로 썼어도 22%만 사용한 상태였습니다. C 코드를 역공학하는 하위 에이전트를 최대 50개까지 돌렸더니 5시간 사용량은 85%에 도달했지만, 월간 사용량은 초기화 직전에도 약 35%였습니다. 비용은 대략 2달러였을 겁니다.
  • @p1necone — DeepSeek를 오케스트레이터와 구현 에이전트 양쪽에 써 봤습니다. 잘 정의된 구현 작업은 충분히 처리하지만, 맥락을 충분히 고려하지 않고 새 설계를 만들어 내거나 문서가 장황해지는 문제가 있었습니다. 그래서 설계 조율은 GLM에 맡겼습니다.
  • @rapind — 토큰 비용에만 현혹되지 말고 작업당 비용을 봐야 합니다. DeepSeek는 같은 작업에 토큰을 세 배쯤 더 쓰는 경우가 있습니다. 그래도 제 업무에서는 여전히 이기며, 지금까지 본 대안 가운데 가장 실용적입니다.
  • @liuliu — DeepSeek 4.1 Flash 0910은 M5 Ultra 256GiB에서 잘 맞습니다. 메모리에 전부 올려 실행했으며, 프리필은 초당 약 2,500토큰, 디코딩은 초당 약 40토큰이었습니다.
  • @doctorpangloss — 제 사용 경험으로는 잘 작동하지 않습니다. 제대로 된 코딩 작업에서는 별로 좋지 않습니다.
    • @pimeys — 저희 팀 5명 중 3명은 유급 업무에서 매일 4.1을 사용합니다. Rust 시스템 작업, Iced 데스크톱 앱, 오래된 DOS 게임의 Linux 이식 등에 쓰는데 좋은 모델입니다.

원문: dgt.is / 번역·요약: Trawling