Ayer, el sitio de revisión de tecnología Chips and Cheese publicó una revisión de la nueva tecnología 3D V-Cache de AMD, mostrando su rendimiento en comparación con las generaciones anteriores de procesadores Zen. Chips and Cheese eligió los procesadores de servidor EPYC de AMD para esta función, incluido el EPYC 7V73 habilitado para 3D ( Milan-X) V-Cache y Vanilla Zen 3 EPYC 7763 (Milán).
3D V-Cache es una nueva tecnología desarrollada por AMD que permite apilar verticalmente la memoria caché L3, lo que puede aumentar significativamente el tamaño de la memoria caché utilizando muy poco espacio. AMD ya ha demostrado mejoras impresionantes en el rendimiento con la nueva tecnología, ya que permite que los núcleos de la CPU reciban más información de forma constante.
Al comparar Zen 3 solo, con y sin 3D V-Cache, Chips and Cheese notó que el EPYC 7V73 con 3D V-Cache funcionó solo una fracción peor que el Vanilla Zen 3 EPYC 7763 cuando la prueba no usó más caché. lo que el 7763 tenía para ofrecer. La diferencia de latencia era de tres a cuatro ciclos, lo que era una compensación necesaria debido al 3D V-Cache.
Sin embargo, una vez que se llenó el caché del 7763, el 7V73, con su monstruoso tamaño de caché, permitió que el chip tuviera una latencia significativamente menor que el 7763 hasta que el 3D V-Cache estuvo lleno. Curiosamente, el 7V73 también tenía una latencia de memoria ligeramente menor que el 7763.
Milan-X (Crédito de la imagen: papas fritas y queso)
Al agregar los chips EPYC Zen 1 y Zen 2, como el 7551 y el 7452, hemos visto una imagen aún mejor de lo bien diseñados que están los chips 3D V-Cache de AMD. Chips and Cheese notó que el caché L3 configurado para contar desde Zen 1 hasta Zen 2 cuesta una latencia adicional de aproximadamente cinco ciclos. Luego, el movimiento para unificar los bloques duales de 16 MB de caché L3 en Zen 3 desde Zen 2 agregó de siete a ocho ciclos de latencia aún mayor.
Mientras tanto, el cambio de AMD de Zen 3 a Zen 3 3D V-Cache y triplicar el tamaño de la memoria caché L3 solo cuesta de tres a cuatro ciclos de latencia, que es la penalización más insignificante que hemos visto hasta ahora.
El gráfico Chips and Cheese mostró que todas las generaciones de Zen tenían una latencia de caché L1 y L2 casi idéntica. Aún así, cuando se trata de caché L3, la latencia ha disminuido a medida que el uso de caché L3 ha aumentado entre generaciones, haciéndose más y más grande, especialmente de Zen 3 a Zen 3 con 3D V-Cache.
Ancho de banda
(Crédito de la imagen: papas fritas y queso)
En los resultados del ancho de banda, Chips and Cheese descubrió que el 7V73X 3D V-Cache de AMD solo recibió un aumento del 25 % en bytes por ciclo en la prueba de ancho de banda de caché de subproceso único.
Sin embargo, Chips and Cheese creía que podría haber una disminución en la velocidad del reloj cuando la CPU alcanza cargas de trabajo más altas que aprovechan el caché L3, lo que explica la diferencia.
Otro fenómeno extraño ocurrió con el 7V73X, donde la prueba de ancho de banda de caché CCD único muestra que el chip 3D V-Cache tiene un pequeño déficit de ancho de banda en comparación con el estándar 7763 de alrededor del 12,5%. Chips and Cheese sospecha que esto es para mantener la energía bajo control debido a los 64 núcleos cargados en ambos chips. Tiene mucho sentido ya que 3D V-Cache ocupa más espacio y requiere un poco más de energía, lo que hace que el enfriamiento de la CPU sea un poco más complejo.
Curiosamente, este mismo fenómeno también ocurrió en el chip EPYC 7452 de AMD basado en la microarquitectura Zen 2. La CPU EPYC 7763 Zen 3 fue el único chip que se desempeñó por igual en la prueba de ancho de banda CCD único y la prueba de ancho de banda de subproceso único.
Para aquellos que se preguntan acerca de Zen 1, el ancho de banda de caché no está ni cerca de sus contrapartes Zen 2 y Zen 3; el EPYC 7551 probado vino con menos de la mitad del ancho de banda para la gran mayoría de la prueba. No fue sino hasta las etapas intermedias y finales de la prueba que estuvo cerca de ponerse al día.
Conclusión
Entonces, ¿qué significan todos estos datos en términos de rendimiento en el mundo real? Chips and Cheese ejecutó varios puntos de referencia, incluidos Gem5, libx264 4K Transcoding, 7-Zip y más. Solo en Gem5, 3D V-Cache marcó una diferencia significativa en el rendimiento. El resto fue mediocre y apenas perceptible, con un beneficio de rendimiento de alrededor del 5 % a favor del chip 3D V-Cache.
Los resultados preliminares de Chips and Cheese sugieren que el impacto de 3D V-Cache no es tan significativo como predijo AMD. Sin embargo, requerirá pruebas más profundas para emitir el juicio. Además, no olvidemos que se trata de 3D V-Cache en los procesadores de servidor EYPC de AMD, por lo que el comportamiento de 3D V-Cache en sus contrapartes de consumo puede variar.
Por un lado, el 7V73X es un chip monstruoso con la friolera de 64 núcleos, por lo que el chip es sensible a la salida térmica y de energía y acelera los núcleos de la CPU rápidamente si es necesario. Se ajusta agregando caché, agregando más requisitos de energía y disipación de calor a la CPU.
Otra son las cargas de trabajo del servidor, que tradicionalmente pueden ser de gran capacidad informática en lugar de sensibles a la latencia debido a su naturaleza. 3D V-Cache solo es útil si los núcleos no son el cuello de botella y no ejecutan subprocesos que toman una cantidad significativa de tiempo para procesar.
En el espacio del consumidor, vemos chips con un recuento de núcleos sustancialmente más bajo, lo que reduce los requisitos de energía y permite que los núcleos estiren sus piernas con una pequeña desviación en la velocidad del reloj. No es un problema con sistemas de refrigeración competentes y placas base con soluciones sólidas de suministro de energía con mucho más espacio libre del que la CPU necesitará en el espacio de bricolaje de la PC.
Las aplicaciones en el espacio del consumidor a menudo consumen mucho menos cómputo, lo que hace que la latencia de la caché desempeñe un papel más crítico. Esto es muy cierto en los videojuegos, donde las CPU rara vez se cargan al 100 %, pero tener una latencia más baja significa que los fotogramas renderizados previamente llegan a la GPU más rápido, lo que reduce el retraso de entrada y aumenta la velocidad de fotogramas.






