Intel Panther Lake Teardown
인텔 팬서 레이크 분해 분석 — 18A 공정과 PowerVia의 실제 구현
SemiAnalysis가 Intel Panther Lake를 분해해 18A 공정의 RibbonFET, 후면 전력 공급 PowerVia, Foveros-S 패키징과 칩 면적을 분석합니다. 18A의 컴퓨트 로직 밀도는 TSMC N3E와 비슷하지만 최신 노드보다 앞서지는 않으며, 고성능 GPU 타일은 TSMC N3E를 사용합니다.
- 주제
AI 요약
SemiAnalysis는 Intel Panther Lake의 칩 단면과 다이 구성을 분석해 Intel 18A의 트랜지스터, 배선, 전력 공급, 패키징을 살펴봅니다. Panther Lake는 Intel의 첫 상용 후면 전력 공급(backside power delivery, BSPD) 제품이자, 네 장의 나노시트를 쌓은 RibbonFET을 적용한 제품입니다. 분석은 제조 공정의 변화뿐 아니라 CPU·GPU·NPU 구성과 타일별 면적, 경쟁 공정과의 밀도 비교도 다룹니다.
PowerVia가 바꾸는 전력 배선
기존 칩은 전력선과 신호선을 트랜지스터 앞면의 금속 배선층에 함께 배치합니다. 전력망이 트랜지스터 가까운 배선 공간을 차지하고, 상부 금속층에서 전력을 끌어오는 비아도 필요합니다. Intel의 PowerVia는 전력 배선을 웨이퍼 뒷면으로 옮겨 앞면을 신호 배선에 더 많이 쓰도록 합니다. 앞면에는 M0부터 M14까지 신호 배선층을, 뒷면에는 BM0부터 BM5까지 전력 배선층을 둡니다.
두 배선망은 나노 TSV로 연결합니다. Intel은 접점 형성 뒤 웨이퍼 앞면에서 실리콘 기판 안쪽으로 비아를 식각합니다. 앞면 배선을 완성하고 웨이퍼를 지지용 캐리어에 접합한 뒤 뒤집어 원래 기판을 제거합니다. 비아 끝이 드러나면 뒷면 금속층을 형성합니다. 분석에서 접점부터 BM0까지 이어지는 비아 구간은 약 150nm입니다. 뒷면 전력 배선은 짧고 넓은 경로를 제공하지만, 셀 안에서 접점과 연결되는 면적을 차지합니다. 따라서 전력을 셀 외부에서 직접 공급하는 구조만큼 셀 면적을 되찾지는 못합니다. 캐리어는 완성된 칩에도 남아 열이 빠져나가는 경로의 일부가 됩니다.
뒷면 배선은 소자 가까이에 미세한 BM0~BM2를 두고, 패키지 쪽에 가까워질수록 더 굵고 성긴 BM3~BM5로 전력을 모읍니다. BM2와 BM3 사이에서 배선 간격이 크게 넓어집니다. 소자 부근에서는 배선 밀도가 중요하고, 상부로 갈수록 낮은 저항과 큰 전류 용량이 중요해지는 구조입니다.
금속 배선과 식각 정지층
18A는 전면의 접점과 배선에 몰리브데넘(Mo)이 얇게 둘러싼 텅스텐(W)을 사용하고, 뒷면 전력망에는 구리(Cu)를 씁니다. Mo는 W가 접점 안에서 잘 자라고 붙도록 돕습니다. 기존 텅스텐 공정에서 쓰던 저항이 큰 TiN 라이너보다 전류가 흐르는 단면을 넓게 확보하는 방식입니다. Intel은 금속층 위치에 따라 라이너와 확산 방지막도 달리합니다. M0~M1에는 Co/Ru, M2~M4에는 Co, M5~M9에는 Nb를 적용합니다. 미세한 하부 배선에는 얇고 균일한 막이 필요해 ALD를 쓰고, 상부 배선에는 PVD 방지막을 적용할 수 있습니다.
분석은 BM0와 일부 전면 배선에서 두 겹의 AlOx 식각 정지층을 관찰합니다. 두 층 사이에 다른 유전체를 두면 식각을 단계적으로 멈출 수 있습니다. 첫 번째 층이 주 식각을 막고, 이를 선택적으로 제거한 뒤 다음 유전체를 식각하면 두 번째 층이 금속 착지면을 보호합니다. 웨이퍼 위치나 구멍 크기에 따라 식각 속도가 달라져도 금속이 먼저 드러나 손상되는 상황을 줄입니다. 대신 증착과 세정 단계, 계면 관리가 늘고 AlOx가 낮은 유전율 유전체를 대체하는 만큼 기생 용량이 생길 수 있습니다.
네 장의 나노시트 RibbonFET
RibbonFET은 Intel이 부르는 GAAFET(Gate-All-Around FET)입니다. FinFET은 게이트가 수직 핀의 세 면을 감싸지만, GAAFET은 수평 나노시트 채널의 모든 면을 게이트가 둘러쌉니다. 게이트가 채널을 더 강하게 제어해 짧은 게이트 길이에서도 누설 전류를 억제합니다. Intel 18A는 나노시트 네 장을 쌓습니다. 삼성 SF2의 MBCFET은 세 장을 쌓으며, 시트의 폭으로 구동 전류와 정전용량을 조절합니다. 시트 폭은 공정 설계 규칙 안에서 연속적으로 바꿀 수 있어 FinFET처럼 핀을 통째로 더하거나 빼는 것보다 세밀한 조정이 가능합니다.
게이트 안쪽에는 SiOx 계면층과 HfOx 고유전율 절연막, 일함수 금속(work-function metal)이 들어갑니다. NMOS에는 TiAl 계열, PMOS에는 TiN 계열 금속을 사용합니다. 시트 사이 공간이 좁아 두꺼운 금속층을 넣기 어려운 문제는 란타넘(La)으로 문턱 전압을 조절하는 방법으로 보완합니다. 문턱 전압을 바꾸면 치수나 시트 사이 간격을 크게 바꾸지 않고도 빠른 경로의 구동력과 다른 회로의 누설 전류를 조정할 수 있습니다.
Intel은 고밀도 로직 아래의 실리콘을 유전체로 대체해 채널 아래쪽 누설 경로를 없앱니다. 기생 정전용량을 줄이는 대신 열이 실리콘을 통해 빠져나가는 경로도 약해집니다. 접점과 금속 배선, 패키지의 열 설계가 더 중요해집니다. 접점 구조에서도 선택이 갈립니다. Intel은 소스·드레인 에피택시를 남기고, 삼성은 접점 금속을 에피택시 안쪽으로 더 깊게 넣습니다. 깊은 접점은 접촉 면적을 늘리고 아래쪽 시트의 전류 경로를 줄이지만, 에피택시 재료를 덜 남겨 응력 전달과 식각 여유에 영향을 줍니다.
로직 밀도와 메모리 면적
분석진은 셀 높이와 게이트 피치, 배선, 나노시트 치수를 측정했습니다. 대표 셀을 기준으로 계산한 Intel 18A 컴퓨트 로직 밀도는 TSMC N3E GPU 로직과 비슷합니다. Intel 3 GPU 로직과 비교하면 18A가 18.6% 더 조밀합니다. 하지만 분석에 따르면 18A는 TSMC N3P·N2나 삼성 SF2의 최고 밀도보다 앞서지 않습니다. 셀 높이와 게이트 피치만으로 실제 다이의 밀도를 단정할 수는 없습니다. 셀 구성과 배치, 배선 가능성도 결과에 영향을 줍니다.
18A의 P코어 배선은 N3E 벡터 엔진보다 M0 금속 단면적이 큽니다. 측정 프로파일을 사다리꼴로 계산하면 배선 한 줄의 단면적은 2.63배, 배선 피치로 나눈 값은 1.84배입니다. 단면적이 커지면 저항과 전류 밀도를 낮출 수 있지만 정전용량도 늘어납니다. PowerVia는 전력 레일을 뒷면으로 옮겨 작은 셀 높이와 넓은 M0 배선을 함께 쓰도록 돕습니다.
Panther Lake-U의 P코어 면적은 Lunar Lake와 거의 같습니다. L2 용량은 코어당 2.5MiB에서 3MiB로 늘었습니다. 분석은 Cougar Cove의 코어 면적 변화가 크지 않은 가운데 SRAM 밀도 개선이 용량 증가를 뒷받침한다고 설명합니다. LP E코어 네 개를 묶은 클러스터는 Lunar Lake의 Skymont보다 5.0% 작으며, 줄어든 면적 대부분은 L2 영역에서 나왔습니다. NPU는 이전 세대보다 면적이 36.9% 작습니다. INT8 MAC 수는 유지하면서 신경망 컴퓨트 엔진을 여섯 개에서 세 개로 합쳤고, 스크래치패드와 SHAVE DSP 수도 각각 12개에서 6개로 줄였습니다. NPU 5는 FP8도 지원합니다. 로컬 메모리가 줄어든 만큼 중간 데이터가 스크래치패드에 들어맞는지, 더 많은 데이터 이동이 필요한지가 성능에 영향을 줍니다.
GPU 타일과 칩렛 구성
Panther Lake는 Xe3 GPU 타일을 두 가지 공정으로 만듭니다. 네 개 Xe 코어를 담은 GT1은 Intel 3, 열두 개 코어를 담은 GT2는 TSMC N3E를 사용합니다. GT2의 Xe 코어는 GT1보다 면적이 약 55% 작습니다. N3E 캐시 매크로는 Intel 3 매크로보다 54% 큰 면적으로 두 배의 데이터를 저장해 매크로 기준 밀도가 30% 높습니다. 캐시 뱅크의 제어 회로까지 포함하면 밀도 차이는 더 커집니다. GT2는 캐시 용량이 16MiB이고 GT1은 4MiB입니다.
컴퓨트 타일, GPU 타일, I/O 타일은 수동 실리콘 베이스 위에 나란히 놓입니다. Foveros-S의 베이스는 타일 사이 미세 배선과 TSV를 제공하며, 실제 연산은 위쪽 활성 타일에서 이뤄집니다. 분석진은 컴퓨트와 GPU 타일 사이 마이크로범프 간격을 약 25.24µm로 측정했습니다. 메모리 컨트롤러를 CPU와 같은 컴퓨트 타일에 넣어 CPU 메모리 요청이 별도 다이 간 연결을 지나지 않도록 했습니다. GPU는 여전히 별도 타일이므로 메모리에 접근할 때 다이 간 연결을 거칩니다.
이 분할 방식은 18A를 컴퓨트 타일에 집중시키고 GPU와 I/O에는 다른 공정을 쓸 수 있게 합니다. 작은 다이를 먼저 검사해 불량 다이가 완제품 전체를 낭비하는 일을 줄이고 타일을 여러 제품에 재사용할 수 있습니다. 대신 수동 베이스와 다이 간 연결 회로, 추가 접합·검사 과정이 필요합니다. 분석은 Panther Lake를 Intel 공정 경쟁력의 회복을 보여주는 제조 이정표로 보면서도, 공정 리더십을 되찾았는지는 성능과 비용, 수율, 다음 제품 구현까지 봐야 한다고 정리합니다.
Reddit 반응
- @u/Lwii2boo — 그림만 보고 무작위로 만든 AI 글인 줄 알았습니다. 실제로는 아주 훌륭한 심층 분석이네요. 축하합니다.
- @u/Geddagod — SemiAnalysis는 클릭을 노린 제목을 자주 쓰고 AI 생성 썸네일도 씁니다. 이번 글은 아니지만요. 이 글이나 다른 분해 분석처럼 유익한 글도 있는데 아쉽습니다.
- @u/CobaltFermi — 분해 분석을 보면 Intel이 공정에서 성능과 배선 유연성을 끌어내려고 꽤 영리한 방법을 쓰고 있습니다. 다만 18A가 TSMC 최신 공정보다 밀도가 크게 높은 것은 아닙니다. 칩도 하이브리드 설계라 큰 Xe3 GPU 타일은 TSMC N3E에서 만듭니다. 개인적으로는 Intel이 꽤 야심 찬 공정 기술을 실제 출하 제품에 넣었다는 점이 흥미롭습니다. 18A가 단일 밀도 지표에서 TSMC를 이기는지보다 그 점이 더 중요하다고 봅니다.
- @u/Geddagod — 흥미로운 글이지만 솔직히 많은 내용이 잘 이해되지 않았습니다. 플로어플랜 부분을 보면, L2가 2.5MiB에서 3MiB로 늘었는데도 P코어 면적은 Lunar Lake와 Panther Lake에서 거의 같습니다. Arrow Lake도 Lunar Lake와 같은 Lion Cove 코어에 3MiB L2를 씁니다. Cougar Cove는 같은 P코어 면적에 L2를 20% 더 담았습니다. 좋은 결과지만 다이 사진을 보면 면적 축소는 거의 SRAM 밀도 개선에서 나온 듯합니다. L1.5와 L2를 제외한 CGC/LNC 코어 면적은 같습니다. 18A의 BSPD와 트랜지스터 성능을 고려하면 로직 쪽이 면적을 더 줄였으리라 예상했을 사람도 많았을 텐데 흥미롭습니다. Darkmont LP E코어 클러스터도 Skymont보다 5% 작지만 대부분 L2 영역이 줄어든 결과입니다. 공유 L2를 뺀 E코어 자체 면적은 같습니다. PTL의 클럭이 경쟁 제품인 ARL-H보다 낮다는 점을 보면, 18A 로직 면적이 TSMC N3B와 같다는 결과도 인상적이라고 보기 어렵습니다. Intel 임원은 이틀 전 18AP가 PPA에서 N3와 N2P 사이에 있다고 말했습니다. SRAM 밀도에서 이점이 있다면 면적 관점에서는 설명이 되지만, 로직 밀도는 BSPD의 배선 이점까지 포함해도 N3와 비슷합니다. 전력과 와트당 성능도 David Huang의 테스트에서는 18A가 N3B보다 낫지 않았습니다. Intel은 18AP의 와트당 성능이 좋아졌다고 주장하니, 그 점으로 N3와 N2P 사이라는 주장을 설명하려는 듯합니다. 다만 기사와 Intel 경영진 모두 Intel에 유리한 IP를 골라 BSPD의 이점을 보여주는 비교를 하는 것 같습니다.
- @u/grumble11 — 여기서 비교하는 N3 제품은 여러 가지입니다. N3B가 가장 나쁘고, 이 비교에서 가장 나은 N3P는 같은 전력에서 성능이 N3B보다 약 8% 높습니다. 18AP가 그 정도 수준일 가능성이 있습니다. 14A가 더 흥미롭습니다. N2와 비슷하거나 기본 N2보다 약간 나을 수도 있습니다. 지켜보겠습니다.
- @u/SlamedCards — 14A는 A14보다 5% 이내이고, 14A2 정보를 유출한 사람도 14A의 PPA가 A16과 비슷하다고 했습니다.
- @u/anhphamfmr — 이 글을 보면 밀도 면에서 18A는 N3E와 대략 같습니다. 18A 트랜지스터는 길이가 더 짧아 고성능 데스크톱 CPU에는 적합하지 않습니다. 그래서 Intel이 노트북과 서버 CPU에만 18A를 쓰는 것 같습니다. PowerVia로 배치가 훨씬 복잡해졌기 때문에 더 넓은 금속 피치의 영향을 상쇄하려고 이런 선택을 했을 것입니다.
- @u/digital_n01se_ — 이득은 밀도가 아니라 전력 관리와 효율적인 패키징·배선에서 나온다고 봅니다.
- @u/anhphamfmr — 네. 밀도는 같지만 같은 전력에서 N3B보다 대략 10% 낫습니다. 18AP가 18A보다 추가로 10% 개선되면 성능 면에서 N2와 비슷하거나 조금 앞설 수 있지만 밀도는 뒤처질 것입니다.
- @u/Geddagod — 같은 전력에서 N3B보다 대략 10% 낫다는 점에 관해 말하자면, PTL이 ARL보다 같은 전력에서 보이는 약 10% 향상은 PTL의 IPC 향상과 비슷한 수준입니다. 주요 변화는 언코어뿐인데 꽤 놀랍습니다. David Huang뿐 아니라 Geekerwan과 Pen Bar Review의 SpecInt2017 테스트에서도 비슷하게 보입니다. IPC 향상은 대부분 언코어 변화에서 나옵니다. 그래서 서로 매우 비슷한 PTL과 ARL P코어를 비교하는 건 타당합니다. 측정한 전력도 코어 전력이지 SoC나 패키지 전력이 아니므로, 지연 시간이 훨씬 짧은 패브릭과 개선된 메모리 컨트롤러의 절충점이 있다 해도 전력 측정에는 반영되지 않습니다. 18AP가 18A보다 10% 더 좋아진다는 Intel 주장도 그대로 적용하면 N3B와 N2 사이의 와트당 성능이 됩니다. 하지만 이런 성능·전력 주장을 곱해 비교하는 건 매우 의심스럽습니다. 특히 Intel과 삼성의 하위 노드 개선에서는 현실과 맞지 않는 큰 수치가 나올 수 있습니다. 20A가 TSMC 2nm보다 와트당 성능이 좋을 거라는 Scotten Jones의 전망이 그런 사례입니다. 18A의 성능이 정말 N2와 같거나 더 좋다면 Intel이 N3와 N2P 사이가 아니라 최소한 N2 바로 뒤라고 말하지 않을 이유가 없습니다. 로직 밀도는 N3 수준이어도 SRAM 밀도는 그렇지 않으니까요. 당신 주장대로라면 로직은 N3 수준, SRAM은 N2 수준, 와트당 성능은 N2보다 좋다는 얘기인데, 그렇다면 Intel이 전체 PPA에서 최악의 경우에도 N2 바로 뒤라고 쉽게 말하지 않을 이유를 모르겠습니다.
- @u/digital_n01se_ — 메모리 컨트롤러는 CPU 코어와 같은 다이에 있어야 했습니다. LP E코어를 둔 SoC 방식은 유휴 전력을 낮추는 데 잘 맞지만, 메모리 컨트롤러를 다시 메인 코어와 합친 점이 중요합니다. Arrow Lake는 지연 시간 문제 때문에 게임 성능이 기대에 못 미쳤습니다. Intel이 최고급 Zen X3D를 앞설 수도 있어 AMD가 위기에 처했는데 아직 깨닫지 못하는 것 같습니다.
- @u/Exist50 — Arrow Lake 게임 성능이 메모리 컨트롤러와 다이 간 연결 때문이라는 설명만으로는 부족합니다. NVL은 코어를 다시 별도 다이로 옮깁니다.
- @u/digital_n01se_ — Nehalem 이후 CPU 코어와 L3 캐시, 메모리 컨트롤러는 한 다이에 있었습니다. Arrow Lake에서 왜 그렇게 하지 않았는지 모르겠습니다. 메모리 하위 시스템만으로 성능이 크게 올랐고, 실행 코어는 Penryn/Wolfdale 이후 거의 바뀌지 않았습니다.
- @u/Exist50 — ARL은 MTL에서 구조를 물려받았습니다. MTL에서 그렇게 한 이유는 엔지니어링 팀이 TSMC로 전면 이전하려 했지만 경영진이 P코어의 외부 이전을 원하지 않아 절충했기 때문입니다. 비용상 이점과 유연성도 있어서 NVL은 다시 그 방향으로 갑니다.
- @u/nhc150 — Arrow Lake에서 메모리 컨트롤러를 SoC 타일에 둔 것이 가장 큰 실수였습니다.
- @u/digital_n01se_ — 믿기 어렵습니다. 2008년 Nehalem에서 메모리 컨트롤러를 CPU 코어와 같은 다이에 넣었고 당시 큰 성능 향상이 있었는데, 왜 그걸 몰랐는지 이해가 안 됩니다.
- @u/Jackson_fitness — Panther Lake는 18A를 쓴 Intel의 첫 클라이언트 칩입니다. 이 분해 분석이 가치 있는 이유는 후면 전력 공급입니다. 웨이퍼 뒷면의 비아를 통해 전력을 올리므로 앞면 금속층을 거의 전부 신호 배선에 쓸 수 있습니다. 상부 금속층이 Intel 4보다 얇아졌다면 PowerVia가 제 몫을 하는 셈입니다. 사진에서 후면 비아 피치가 얼마인지 알고 싶습니다.
- @u/anhphamfmr — 정말 귀한 글입니다. 나중에 읽으려고 저장했습니다.
원문: SemiAnalysis / 번역·요약: Trawling