Altworld/Hemmingway-1
사람처럼 쓰는 AI, Hemmingway-1
Altworld가 27B 파라미터 규모의 오픈 웨이트 언어 모델 Hemmingway-1을 공개했습니다. 일상적인 메시지와 이메일 작성에 초점을 맞췄으며, 자체 블라인드 평가에서 여러 대형 모델보다 사람다운 문장을 더 자주 선택받았다고 설명합니다.
- 주제
AI 요약
Altworld가 일상적인 글쓰기에 초점을 맞춘 27B 파라미터 언어 모델 Hemmingway-1을 공개했습니다. 모델 이름은 원문 표기를 따랐으며, 오픈 웨이트와 Apache-2.0 라이선스를 제공합니다. 상업적 사용도 허용합니다. Qwen3.8-27B를 기반으로 만들었고, 컨텍스트 길이는 262,144토큰입니다.
■ 짧고 바로 쓸 수 있는 문장에 초점
Hemmingway-1은 긴 설명이나 여러 선택지를 붙이기보다 사용자가 실제로 보낼 문장을 바로 출력하도록 설계했습니다. 예를 들어 집주인에게 고장 난 보일러를 알리는 문장을 요청하면, 작성 방법을 설명하거나 선택지 세 개를 나열하지 않고 메시지 본문을 출력하는 방식입니다. Altworld는 문자 메시지, 이메일, 동료에게 보내기 어려운 메모, 계속 미루게 되는 요청문처럼 사람들이 매일 작성하는 글을 주요 사용 사례로 제시합니다.
■ 80개 요청을 대상으로 한 비교
Altworld는 실제 요청 80개를 준비하고, 각 요청에 대한 Hemmingway-1의 답변을 다른 모델의 답변과 일대일로 비교했습니다. 평가자는 어느 답변이 어느 모델에서 나왔는지 알 수 없도록 답변 순서를 섞었습니다. 같은 대결을 순서를 바꿔 다시 실행해 위치가 결과에 영향을 주지 않도록 했고, 비교 대상 모델과 다른 모델을 심사자로 사용했다고 밝혔습니다.
자체 비교에서 Hemmingway-1은 Fable 5.1과 GPT-6 Astra를 앞섰습니다. GPT-6 Astra와 비교한 결과에서는 50포인트 차이가 났다고 설명합니다. Kimi K3, GLM-5.3, Grok 4.6, DeepSeek V4 Pro도 Hemmingway-1 뒤에 놓였습니다. Altworld는 27B 규모 모델이 더 큰 모델들과 겨뤘다는 점을 함께 강조합니다.
같은 답변을 대상으로 “두 답변 중 어느 쪽을 사람이 작성했는가”를 다시 물었습니다. 이 평가에서 Hemmingway-1은 다음 모델보다 26포인트 앞섰다고 합니다. 결과는 요청 유형별로도 나눴습니다. 금전 및 행정 관련 요청, 업무용 글쓰기, 여러 번 다시 쓰게 되는 어려운 요청, 상대를 설득하는 글에서 Hemmingway-1의 답변을 사람이 작성했다고 판단한 비율이 높았습니다.
특히 어려운 요청 유형에서는 GPT-6 Astra가 9%, Hemmingway-1이 72%를 기록했습니다. 다만 적대적인 스토리텔링과 긴 이야기 전개에서는 Hemmingway-1이 뒤졌습니다. Altworld는 해당 유형에서 스토리 작성에 특화된 모델이 더 나은 결과를 보였다고 설명합니다.
■ 실제 본문을 가리는 장황한 응답 측정
Altworld는 모델이 사용자가 원한 본문 대신 해설, 선택지, 참고 사항을 앞뒤에 얼마나 많이 붙이는지도 측정했습니다. Fable 5, GLM-5.3, Kimi K3는 10번 중 9번이 넘는 답변에서 사용자가 찾는 실제 텍스트를 부가 설명 속에 묻었다고 밝혔습니다. Hemmingway-1은 이 문제를 줄이는 방향으로 설계됐으며, 평가 역시 바로 사용할 수 있는 문장을 얼마나 빠르게 제시하는지에 초점을 맞췄습니다.
■ EQ-Bench 4와 자체 벤치마크 구분
감정 지능을 평가하는 공개 벤치마크 EQ-Bench 4에서는 Hemmingway-1이 3위를 기록했다고 합니다. GPT-5.5, Opus 4.7, Opus 4.8보다 높은 순위였고, 최고 점수 모델과의 차이는 12포인트 이내였습니다. Kimi K3와 비슷한 수준이었으며 Qwen3.8-Max와 DeepSeek V4 Pro보다 앞섰습니다. Altworld가 처음 비교 대상으로 삼은 모델보다 504점 높았다는 설명도 덧붙였습니다.
CommunicationBench, Human-Likeness, StoryBench는 Altworld가 직접 만들고 실행한 자체 벤치마크입니다. 따라서 해당 평가의 설계와 결과는 공개 벤치마크 결과와 구분해서 봐야 합니다. Altworld는 모든 대결을 블라인드 방식으로 진행했고 양쪽 순서로 모두 실행했으며, 심사 모델을 피심사 모델과 다르게 구성했다고 밝혔습니다. EQ-Bench 4는 Altworld의 자체 벤치마크가 아니며, 해당 벤치마크의 공개 평가 하네스가 실행합니다.
■ 실행 방법과 사용 조건
vLLM에서는 다음 명령으로 모델을 서비스할 수 있습니다.
vllm serve Altworld/Hemmingway-1 --max-model-len 262144
Transformers에서는 AutoTokenizer와 AutoModelForCausalLM을 불러온 뒤, chat template을 적용해 생성합니다. 예시 코드는 “Write the text I send my landlord about the broken boiler.”라는 요청을 사용자 메시지로 넣고, 최대 512개의 새 토큰을 생성합니다. 모델과 토크나이저는 모두 Hugging Face에서 불러옵니다. device_map="auto"와 dtype="auto"를 사용하므로 실행 환경의 장치 구성에 맞춰 배치할 수 있습니다.
Hemmingway-1은 영어 우선 모델입니다. Altworld는 모델이 틀린 내용을 확신하는 말투로 출력할 수 있다고 경고합니다. 따라서 의료, 법률, 금융 관련 판단에 사용하지 말라고 안내합니다. 모델 카드에는 가중치, 체험 페이지, Mac 및 Android 앱, 코드 링크도 함께 제공됩니다.
원문: Hugging Face / 번역·요약: Trawling