dev.to

Gemma 4 on Amazon SageMaker: The NVIDIA T4 Decodes at 0.8x of the L4 With the Same Answers

Amazon SageMaker에서 Gemma 4 실행하기 — T4는 L4의 0.8배 속도로 같은 답변을 냅니다

Amazon SageMaker의 NVIDIA T4에서 Gemma 4를 구동하고 L4와 성능·비용을 비교했습니다. vLLM에 Turing GPU용 attention 패치를 적용하면 12B까지 실행되며, 단일 요청 디코딩 속도는 L4의 0.77~0.82배입니다. 동시 요청이 많으면 토큰당 비용은 T4가 더 높습니다.

AI 요약

SageMaker에서 제공하는 가장 작은 GPU인 NVIDIA T4 한 장으로 Gemma 4를 구동하고, 앞선 실험에서 사용한 L4와 비교한 글입니다. 대상 모델은 4비트 가중치와 4비트 임베딩을 적용한 E2B, E4B, 12B, 26B A4B입니다. T4는 단일 요청 디코딩에서 L4의 0.77~0.82배 속도를 내고, 40개 질문에 대한 답변은 L4와 모두 일치했습니다. 다만 T4 한 장에는 12B까지 들어가며, 26B A4B는 메모리 부족으로 실행에 실패했습니다.

Turing GPU에서 vLLM 실행하기

SageMaker JumpStart의 Gemma 4 항목에는 T4 인스턴스가 없습니다. vLLM 0.30.0의 Triton attention 커널도 Turing GPU에서 바로 실행되지 않습니다. 커널 타일이 블록당 공유 메모리 98,304바이트를 요구하지만 T4의 한도는 65,536바이트이기 때문입니다. 글은 사전 Ampere GPU에서 타일 크기를 절반으로 줄이는 스크립트를 AWS vLLM 컨테이너에 적용했습니다. 기본 컨테이너를 바탕으로 이미지를 만들고, PyTorch에 Turing용 sm_75 커널이 있는지 검사합니다. 패치는 L4 이상에서는 아무 작업도 하지 않으며, 기존 컨테이너 설정과 시작 명령은 유지합니다.

컨테이너가 사용하는 CUDA 버전과 SageMaker 호스트 드라이버도 맞춰야 합니다. vLLM 컨테이너는 CUDA 13 기반이라 드라이버 580이 포함된 호스트 이미지가 필요했습니다. InferenceAmiVersion을 지정하지 않았을 때는 약 6분 뒤 컨테이너 시작 오류가 발생했고 CloudWatch 로그 그룹도 생기지 않았습니다. 드라이버 580 호스트 이미지를 지정하자 같은 이미지와 인스턴스에서 엔드포인트가 13.2분 만에 InService 상태에 도달했습니다.

성능과 메모리 비교

실험은 us-east-2의 ml.g4dn.xlarge에서 진행했습니다. T4는 fp16으로 실행했고, MAX_MODEL_LEN은 8,192로 설정했습니다. 단일 요청 디코딩 속도는 E2B가 초당 108.5토큰, E4B가 65.6토큰, 12B가 28.5토큰이었습니다. L4 대비 비율은 각각 0.77, 0.82, 0.81입니다. 동시 요청 16개에서는 T4의 처리량이 L4의 0.63배에서 0.53배로 낮아졌습니다. 40개 질문의 답변은 세 모델 모두 L4 결과와 바이트 단위로 같았습니다. E2B와 E4B는 40개 중 36개, 12B는 40개 모두 정답이었습니다.

가중치 크기는 두 GPU에서 같지만 T4는 KV 캐시에 쓸 메모리가 더 적습니다. 12B의 KV 캐시는 T4에서 토큰 20,354개, L4에서 52,541개를 담았습니다. 8,192토큰 전체 길이 요청으로 계산하면 T4에는 2.48개 분량입니다. 26B A4B는 가중치가 14.2GiB이고, 메모리 사용량과 컨텍스트 길이를 낮춰도 T4에서 추가 메모리 할당에 실패했습니다. 따라서 시험한 모델 중 T4 한 장에서 실행되는 가장 큰 모델은 12B입니다.

처리량과 비용

us-east-2 온디맨드 시간당 가격은 T4가 0.736달러, L4가 1.1267달러로 T4가 0.65배입니다. 하지만 동시 요청 16개에서 출력 토큰 100만 개당 비용은 E2B가 T4 0.260달러, L4 0.249달러였고, E4B는 0.419달러 대 0.369달러, 12B는 0.945달러 대 0.760달러였습니다. 부하가 지속되면 T4의 토큰당 비용이 5~24% 높습니다. 반대로 엔드포인트가 대부분 유휴 상태라면 시간당 요금이 낮은 T4가 비용을 줄입니다.

비교에는 조건 차이도 있습니다. T4는 2026년 9월 30일에 fp16과 Turing 패치를 적용해 측정했고, L4 수치는 전날 stock 컨테이너에서 bf16으로 측정한 앞선 실험의 결과입니다. 저자는 측정 범위를 단일 계정, us-east-2, 모델별 단일 배포로 한정했습니다. E2B의 경우 같은 패치를 적용한 Compute Engine T4에서도 초당 109.7토큰을 기록해 SageMaker의 108.5토큰과 비슷했지만, vLLM 버전과 컨텍스트 길이가 달라 통제된 비교는 아니라고 덧붙였습니다.

dev.to 반응

  • @aifrontierpost — 진짜 제목감은 0.8배 속도가 아니라 토큰 100만 개당 비용 표입니다. T4는 시간당 요금이 0.65배지만 부하가 걸리면 처리량은 0.53~0.63배라 토큰당 비용이 5~24% 더 듭니다. 더 큰 제약은 KV 캐시입니다. T4에서 12B는 토큰 20,354개를 담아 전체 길이 요청 2.48개가 들어가므로, 요청이 몰리면 대기열이 생깁니다. 더 싼 하드웨어지만 토큰은 더 비쌉니다.

원문: dev.to / 번역·요약: Trawling