Hacker News

MicroLLM Lab – Try 7 tiny LLM's in the browser

MicroLLM Lab — 브라우저에서 소형 언어 모델 7종 시험하기

MicroLLM Lab은 브라우저에서 소형 언어 모델 7종을 실행하고, 정해진 검사로 정확도와 속도를 측정하는 데모입니다. 결과는 기기에 저장되며, JavaScript로 직접 벤치마크를 작성하고 성능 인증서를 내려받을 수도 있습니다.

AI 요약

MicroLLM Lab은 브라우저에서 소형 언어 모델 7종을 골라 실행해 보는 실험 도구입니다. 글쓰기 품질을 평가하는 대신 정규식이나 정확한 토큰 일치 같은 객관적 검사로 결과를 판정합니다. 135M 매개변수 모델이 실패하는 경우도 측정 결과로 받아들입니다.

실행 결과와 벤치마크

모델별 검사 시간(Runtime), 정확도(Accuracy), 지속 디코딩 속도(tokens/s), 전체 실행 시간(Suite wall)을 보여줍니다. 정확도는 검사 통과율로 계산하며, 차트에는 모델별 최신 테스트 결과를 표시합니다. 수치는 해당 브라우저에서 실행한 결과이고 기기에 저장됩니다. 이전 측정값이 있으면 속도 추정에 활용합니다.

사용자는 기기 정보와 최고·지속 토큰 처리 속도를 담은 검증 가능한 성능 인증서를 만들고 내려받거나 공유할 수 있습니다. JavaScript로 벤치마크를 작성하는 기능도 제공합니다. 편집기 코드는 현재 웹 출처(origin)에서 eval()로 실행되며, 각 검사는 모델이 생성한 텍스트를 대상으로 합니다.

Hacker News 반응

  • @logicallee — 브라우저에서 서로 다른 소형 언어 모델 7종을 시험해 볼 수 있습니다.
  • @tnrich — 브로민 욕조를 방금 새 물로 채웠습니다. 어떻게 하면 되는지 간단히 알려 주세요. 1. 물 한 스푼을 물통에 넣습니다. 2. 욕조를 물통에 넣고 5분쯤 둡니다. 3. 5분 뒤 욕조를 꺼내 식힙니다. 4. 이제 욕조에 물을 채우고 음, 완전히 쓸 수가 없네요?
    • @smokel — 소형 언어 모델(SLM)이 쓸모 있는 분야는 아닙니다. 이런 모델은 아는 내용이 적고 대개 추론 능력도 부족합니다. 감정 분석, 텍스트 분류, 개체 추출 같은 작업에 쓸 수 있습니다. 분명 쓸모는 있지만 Opus나 Fable 같은 LLM과 비교하면 안 됩니다.
    • @ironqcold — 그 용도로는 완전히 쓸모없습니다. 100M 모델이지 비서가 아닙니다.
  • @tolugenius — PetitGPT research-v1에서 기본 산수 문제를 냈습니다. “2+2는?” 답: “2+2를 구하려면 방정식 양쪽에 2를 더해야 합니다. 2+2=4. 그러므로 2+2=4+2입니다. 훌륭하네요.”
    • @dotancohen — 틀린 말은 아닙니다. LLM은 의미상 맞는 문장을 만들지 사실에 맞는 문장을 만드는 게 아닙니다. 벌써 그걸 잊었나요?
    • @anyfoo — 모든 면에서 틀렸습니다. 이 짧은 글에서 의미상 맞는 문장이 어디 있나요? 더 나은 LLM이라면 제대로 답하겠지만요.
    • @logicallee — 저는 PetitGPT research-v1에서 정답을 받았습니다.
  • @bhouston — 저도 지난달 비슷한 것을 만들었습니다. 같은 모델 몇 개를 썼고, ThreeJS의 Three-Shading-Language 추상화를 이용했습니다.
    • @sourweasel — MiniCPM5-1B 모델도 추가해 보길 권합니다. 1B 모델치고 놀라울 만큼 일관된 답을 내고 성능도 좋습니다. Pixel 9에서 CPU는 초당 33토큰, GPU는 초당 약 26토큰이었습니다. GPU에서는 프리필 속도가 거의 500까지 올라갑니다.
  • @demibabs — 프로젝트는 멋지지만 UI를 손보는 게 좋겠습니다. 글자가 너무 작고 정보가 지나치게 빽빽합니다. 쓰기 간단한 제품인데 실제 인터페이스를 보기까지 대부분 쓸모없어 보이는 AI 생성 정보를 한 페이지 넘게 스크롤해야 합니다.
    • @logicallee — 의견 감사합니다. 어떻게 반영할지 생각해 보겠습니다. 수정: 사람들이 건너뛸 수 있도록 글자를 작게 했습니다. 페이지 전체에 600단어뿐이라 읽더라도 많은 양은 아닙니다. 이 글이 몇 시간째 HN 첫 화면에 올라와 있으니 사람들이 지금 모습도 좋아하는 것 같습니다. 바꿀 필요는 없다고 봅니다. 푸터는 ZIP 파일을 내려받아 압축을 풀어도 index.html을 바로 열어서는 작동하지 않고 로컬 웹 서버를 실행해야 한다는 뜻입니다.
    • @janalsncm — 글자가 작거나 건너뛰기 쉬운지가 문제가 아닙니다. 사람은 트랜스포머처럼 여러 헤드로 주의를 기울이지 않고, 백만 토큰을 동시에 처리하지도 않습니다. 사람에게 무관한 정보를 처리하라고 하면 성가시게 느낍니다. 데모라면 처음 보는 화면에 데모와 적절한 기본값이 보여야 합니다.
  • @kenzic — 웹 앱이 기기 안의 모델에 직접 접근하는 일이 기대됩니다. 관련 제안인 Web Models API를 작업하고 있습니다. 브라우저 표준 API로 오픈 웨이트 모델을 기기에서 실행하는 방안을 다룹니다.
    • @logicallee — 제안서를 읽었는데 좋았습니다. 사용자가 모델 다운로드에 동의하면 브라우저는 어디서 모델을 가져오나요? 이 데모에서는 제가 서버에서 모델을 제공합니다. 더 큰 모델은 공개 가중치가 있어도 직접 내려받을 링크가 없을 수 있습니다.
    • @kenzic — 좋은 질문입니다. 아직 정해진 답은 없지만 해결해야 할 문제입니다. 모델 ID를 일관되게 관리하려면 브라우저마다 저장소를 따로 운영할지, 브라우저 간 공통 저장소를 둘지 정해야 합니다.
  • @anonimous-emacs — Firefox에서 작동하지 않습니다. “Uncaught ReferenceError: GPUShaderStage is not defined” 오류가 납니다.
    • @ad_fontes — 같은 문제입니다. Ubuntu GNOME의 최신 Firefox 156.0, AMD Radeon 860M을 씁니다. WebGPU 옵션을 끄고 새로고침해도 해결되지 않았습니다.
    • @logicallee — Radeon GPU가 없어 고치기 어려운 문제입니다. 내일 해결할 방법을 찾아보겠습니다.
  • @Mbarley — 이제 로컬에서 할 수 있는 일이 많아 놀랍습니다. 추론 속도가 훨씬 느릴 줄 알았는데 생각보다 빠릅니다.

원문: Hacker News / 번역·요약: Trawling