Mistral Large 4
Mistral Large 4 공개 미리보기 — 1조 매개변수 오픈 웨이트 모델
Mistral이 1조 매개변수, 활성 매개변수 490억 개 규모의 멀티모달 모델 Mistral Large 4 미리보기를 공개했습니다. 코딩·에이전트 작업·사이버보안·시각 이해 성능과 학습 인프라를 소개했으며, 가중치는 이달 말 공개할 예정입니다.
- 주제
AI 요약
Mistral이 새 모델 Mistral Large 4(ML4)의 공개 미리보기를 시작했습니다. 모델 가중치는 이달 말 공개할 계획이며, 그전까지 사이버보안 전문가와 검증된 협력사, 정부 기관이 실제 환경에서 레드팀 테스트를 진행합니다. Mistral은 ML4를 매개변수 1조 개, 활성 매개변수 490억 개를 갖춘 네이티브 멀티모달 모델로 소개합니다. 코딩과 에이전트 워크플로, 이미지 이해, 기업용 작업에서 강점을 보인다는 설명입니다.
학습·배포 인프라
ML4는 유럽에 있는 Mistral 데이터센터에서 NVIDIA Grace Blackwell GPU 3,800개로 처음부터 학습했습니다. 미리보기 API도 같은 인프라에서 제공하며, 유럽 법률 아래 독립적으로 운영하는 배포 환경을 포함해 여러 지역에서 서비스할 계획입니다. 학습 데이터에는 EU 공식 언어를 모두 포함해 160개가 넘는 언어가 포함됐다고 밝혔습니다. 기업 고객에게 제공하는 Mistral Forge와 같은 학습·맞춤화·강화학습 환경을 모델 개발에 활용했다는 설명도 덧붙였습니다.
사이버보안·코딩·에이전트 작업
Mistral이 인용한 Artificial Analysis Cyber Index에서 ML4는 전 세계 상위 5개 모델에 들었고, 취약점을 재현한 뒤 수정하는 평가에서 82%를 기록해 해당 테스트 최고 점수를 얻었습니다. 보안 대회 문제를 모은 Cybench에서는 40개 과제 중 93%를 해결했다고 밝혔습니다. 다만 회사는 폐쇄형 모델 일부가 같은 취약점 재현 과제에서 거부 응답을 내 점수가 낮았다고 설명합니다. ML4는 악성코드 분석, 취약점 우선순위 지정, 탐지 규칙 작성에도 유용했다고 내부 테스트 결과를 소개했습니다. 조직이 자체 정책에 맞춰 프라이빗 클라우드나 온프레미스에서 운영할 수 있다는 점도 강조합니다.
코딩 평가에서는 DeepSWE v1.1 61.7%, SWE-Atlas-QnA 59.4%, Terminal-Bench 4 28.3%를 기록했습니다. 세 평가를 합친 Coding Agent Index 점수는 49.8%입니다. Surge AI의 블라인드 평가에서는 전문 평가자들이 결과물을 5점 만점으로 채점했고, ML4 Preview는 3.74점으로 다섯 모델 중 2위를 차지했습니다. AutomationBench의 657개 업무 워크플로 평가에서는 59.9%, 장기 지식 업무 평가 AA-Briefcase에서는 1,393 Elo를 기록했다고 발표했습니다.
멀티모달·과학·지식 업무
Mistral은 ML4가 복잡한 문서와 차트, 자연 이미지에서 시각 정보를 파악하며, 기술 도면 검사나 위성 이미지 분석에도 활용할 수 있다고 설명합니다. 시각적 근거 찾기 평가 Dense 200에서는 42%를 얻어 GPT-6-Astra의 41%를 앞섰다고 밝혔습니다. 과학 분야에서는 SciCode-Verified의 오픈 웨이트 모델 가운데 최고 성능을 기록했으며, 여러 단계가 필요한 Hartree–Fock 시뮬레이션 코드를 한 번에 생성하는 사례를 제시했습니다. 금융·법률 업무에서는 스프레드시트와 문서를 작성·수정할 수 있다고 소개하고, 제3자 평가 결과 ML4가 GPT-6-Astra보다 금융 및 법률 과제에서 높은 점수를 받았다고 주장합니다.
안전성·강화학습
간접 프롬프트 인젝션 방어 평가에서 ML4는 93.3%의 공격을 막았다고 밝혔습니다. 사이버보안 과제에서는 높은 성능을 내면서도 악의적인 요청에는 거부 응답을 하는 편이라며, JailbreakBench·StrongREJECT·AgentHarm의 사이버 프롬프트에서 오픈 웨이트 모델 중 평균 거부율이 가장 높았다고 설명합니다. 다만 해당 수치와 성능 비교는 Mistral이 소개한 평가 결과입니다.
후속 학습에는 지도 미세조정(SFT)과 강화학습(RL)을 적용합니다. 여러 작업 환경을 하나의 학습 실행에 조합하고, 코드 샌드박스와 웹 검색, 외부 API를 활용해 모델이 긴 작업을 수행하도록 설계했습니다. 자동 확장하는 작업자들이 병렬로 수만 개의 실행 결과를 만들며 학습은 비동기로 진행됩니다. Mistral은 현재 GPU 3,000개 규모에서 하루 약 330억 토큰을 생성하고, 필터링과 마스킹 뒤 약 160억 토큰을 학습에 사용한다고 밝혔습니다. 회사는 강화학습이 아직 진행 중이며, 이달 말 가중치와 모델 구조·추가 벤치마크·후속 학습 방법을 공개할 예정입니다.
Hacker News 반응
- @crimsoneer — 벤치마크가 주장한 대로라면 꽤 큰 소식 같네요. Mistral이 제 예상을 조금씩 뒤집고 있는데, 싫지는 않습니다.
- @aeneas_ory — 벤치마크 결과가 예상보다 좋네요. 아마 증류 없이 이 성능을 냈을 수도 있겠습니다.
- @water-drummer — 중국 오픈 웨이트 모델을 로컬에서 돌려 증류하지 않았으리라 볼 근거가 있나요?
- @oh_no — 인기가 적은 내부 수치 평가 하나에서 앞선다고 해서 비전 성능이 최고라고 보기는 어렵습니다. 세 번째 벤치마크도 살펴보세요. OpenAI 모델 점수가 다른 공개 자료와 맞지 않는 것처럼 보입니다. AI 회사들이 이런 자료를 선별해 내세우는 일을 그만했으면 좋겠습니다.
- @bluerooibos — 아직 OpenAI 생태계를 쓰고 있지만 Mistral을 써보니 응답이 빠릅니다. ChatGPT의 즉시 응답 모드보다 거의 바로 답하고, 품질도 더 좋아 보입니다.
- @4rtem — 이전 모델은 arena.ai에서 상위 50위에도 들지 못합니다.
- @maxdo — 나쁘지 않네요. 최상위권보다 큰 출시 두 번 정도 뒤처졌습니다. 정정합니다. 확인해보니 세 세대쯤 뒤처졌네요.
- @eigenspace — 적어도 AI 초창기에는 따라잡기가 불가능한 승자독식식 가속 경쟁이 벌어지지 않는다는 점이 흥미롭습니다. 10년 전에는 이렇게 예상하지 못했을 것 같습니다. Mistral이 Large 3에서 몇 차례 크게 흔들린 뒤에도 경쟁에 남아 있어 다행입니다.
원문: Mistral / 번역·요약: Trawling