AMD выпустила серверный процессор EPYC 9996 поколения Venice с 256 вычислительными ядрами, 512 потоками и 1024 МБ кэша L3. Впервые стандартная 256-ядерная модель получила гигабайт кэша без дополнительных 3D V-Cache кристаллов.
Процессор построен на архитектуре Zen 6c и является флагманом шестого поколения EPYC 9006. Под крышкой размещены восемь вычислительных чиплетов (CCD) и два отдельных кристалла ввода-вывода. Каждый CCD содержит 32 ядра и 128 МБ кэша L3, в итоге давая 256 ядер и 1024 МБ на весь процессор.
По сравнению с предыдущим поколением AMD удвоила количество ядер в одном чиплете и увеличила объём L3 в четыре раза. На каждое ядро приходится минимум 4 МБ общего кэша.
Компания продолжает развивать чиплетную архитектуру, но Venice вносит значительные изменения. Наряду с 256-ядерной версией AMD выпустила частотно оптимизированные чиплеты с 12 ядрами и 48 МБ L3, которые жертвуют плотностью ради частот до 5 ГГц.
Подсистема памяти и ввода-вывода также получила серьёзную переработку. Платформа SP7 поддерживает 16 каналов DDR5, модули до DDR5-8000 и MRDIMM со скоростью 12 800 MT/s. Теоретическая пропускная способность памяти достигает 1,6 ТБ/с. К процессору подключены 128 линий PCIe 6.0 с поддержкой CXL 3.1.
EPYC 9996 работает на частоте 2,55 ГГц и разгоняется до 4,1 ГГц. Мощность установлена на уровне 600 Вт с возможностью снижения до 400 Вт. В тестах двухпроцессорной системы на SPECrate 2026 Integer EPYC 9996 показал примерно в 2,24 раза более высокую пропускную способность, чем платформа на Nvidia Vera. Тесты проведены самой AMD.
Гигабайт кэша для AMD не новинка. Серверные процессоры Genoa-X с 3D V-Cache уже преодолевали этот порог благодаря дополнительным SRAM-кристаллам. У Venice-X объём L3 достигает 1152 МБ. EPYC 9996 набирает свой гигабайт за счёт увеличенного кэша непосредственно в восьми вычислительных чиплетах без дополнительных кристаллов.
Конкуренты наращивают число ядер, но разрыв по кэшу остаётся заметным. Amazon Graviton5 получил 192 ядра и около 180 МБ L3. EPYC 9996 превосходит его по ядрам на 64 единицы и в пять раз по объёму кэша, фактически превращая один процессорный сокет в вычислительный узел, для которого требовалось бы несколько CPU.
