Ampere presentó esta semana sus procesadores AmpereOne para centros de datos en la nube, que son las primeras CPU de propósito general de la industria con hasta 132 que se pueden usar para la inferencia de IA.
Los nuevos chips consumen más energía que sus predecesores, el Ampere Altra (que se mantendrá estable en el Ampere durante al menos un tiempo), pero la compañía afirma que, a pesar del mayor consumo de energía, sus procesadores con hasta 192 núcleos brindan mayor rendimiento computacional. densidad que las CPU de AMD e Intel. Algunas de estas afirmaciones de rendimiento pueden ser controvertidas.
192 núcleos nativos de nube personalizados
Los procesadores AmpereOne de Ampere cuentan con 136 a 192 núcleos (a diferencia de los 32 a 128 núcleos del Ampere Altra) que funcionan hasta a 3,0 GHz según la implementación patentada de la empresa de la arquitectura del conjunto de instrucciones Armv8.6+ (con dos vectores de 128 bits unidades compatibles con los formatos FP16, BF16, INT16 e INT8) que están equipados con 2 MB de caché L2 de asociatividad de 8 vías por núcleo (en lugar de 1 MB) y están interconectados mediante una red mecánica con 64 filtros de espionaje basados en el directorio y el hogar. Además de los cachés L1 y L2, el SoC también tiene un caché de nivel de sistema de 64 MB. Las nuevas CPU tienen una potencia nominal de 200 W a 350 W, según el SKU exacto, frente a los 40 W a 180 W del Ampere Altra.
(Crédito de la imagen: amperio)
La compañía afirma que sus nuevos núcleos están aún más optimizados para cargas de trabajo de inteligencia artificial y en la nube y cuentan con instrucciones de «potencia y eficiencia» por ganancias de reloj (IPC), lo que probablemente significa un IPC más alto (en comparación con Neoverse N1 de Arm utilizado para Altra) sin un tangible aumento en el consumo de energía y el área de la matriz. Hablando del área del troquel, Ampere no lo revela, pero dice que AmpereOne se fabrica con una de las tecnologías de proceso de clase de 5nm de TSMC.
(Crédito de la imagen: amperio)
Si bien Ampere no revelará todos los detalles sobre su núcleo AmpereOne, dicen que cuentan con un precapturador de datos L1 de alta precisión (reduce la latencia, asegura que la CPU pase menos tiempo esperando datos y reduce el consumo de energía del sistema al minimizar los accesos a la memoria), refinado recuperación de predicción errónea de rama (cuanto antes la CPU pueda detectar una predicción errónea de rama y recuperarse de ella, reduce la latencia y desperdicia menos energía) y desambiguación de memoria sofisticada (aumenta el IPC, minimiza la tubería de interrupciones, maximiza la ejecución fuera de orden, reduce la latencia, y mejora el manejo de múltiples solicitudes de lectura/escritura en entornos virtualizados).
Si bien la lista de mejoras en la arquitectura central de AmpereOne no parece muy larga en papel, estas cosas en realidad pueden mejorar significativamente el rendimiento y requieren mucha investigación (es decir, ¿qué cosas ralentizan más el rendimiento de una CPU de centro de datos en la nube? ) mucho trabajo para implementarlos de manera eficiente.
Seguridad avanzada y E/S
Dado que el SoC AmpereOne está dirigido a los centros de datos en la nube, está equipado con las E/S adecuadas, que incluyen ocho canales DDR5 para hasta 16 módulos que admiten hasta 8 TB de memoria por socket, 128 carriles de PCIe Gen5 con 32 controladores y bifurcación x4 .
Los centros de datos también requieren ciertas características de confiabilidad, disponibilidad, servicio (RAS) y seguridad. Con ese fin, el SoC es totalmente compatible con la memoria ECC, el cifrado de memoria de una clave, el etiquetado de memoria, la virtualización segura y la virtualización anidada, solo por nombrar algunos. Además, AmpereOne tiene varias funciones de seguridad, como criptografía y aceleradores de entropía, mitigación de ataques de canal lateral especulativo, mitigación de ataques ROP/JOP, etc.
Curiosos resultados de referencia
Sin duda, AmpereOne SoC de Ampere es una impresionante pieza de silicio diseñada para manejar cargas de trabajo en la nube y con 192 núcleos de uso general, una primicia en la industria. Sin embargo, para probar sus puntos, Ampere utiliza algunos resultados de referencia bastante curiosos.
Ampere ve la densidad de cómputo de su AmpereOne como su principal ventaja. La compañía afirma que un rack de 42U y 16,5 kW lleno de máquinas 1S basadas en un SoC AmpereOne de 192 núcleos puede admitir hasta 7926 máquinas virtuales, mientras que un rack basado en el EPYC 9654 ‘Genoa’ de 96 núcleos de AMD puede manejar 2496 VM y un rack- Procesador con tecnología Intel Xeon Scalable 8480+ de 56 núcleos Las CPU ‘Sapphire Rapids’ pueden manejar 1680 VM. Esta comparación tiene mucho sentido en el presupuesto de energía de 16,5 kW.
Imagen 1 de 2
(Crédito de la imagen: amperio)
(Crédito de la imagen: amperio)
Pero la densidad de potencia del rack de 42U está aumentando y los exescaladores como AWS, Google y Microsoft están preparados para ello, especialmente para sus cargas de trabajo que exigen rendimiento. Según una encuesta de UpTimeInstitute de 2020, podemos decir que el 16 % de las empresas han implementado racks típicos de 42U con una densidad de potencia de rack de 20kW a más de 50kW. Hasta ahora, la cantidad de implementaciones típicas con racks de 20kW ha aumentado, no disminuido, ya que las CPU de AMD de la generación anterior y la última han aumentado sus TDP en comparación con sus predecesores.
Imagen 1 de 2
(Crédito de la imagen: amperio)
(Crédito de la imagen: Amperio)
Cuando se trata de rendimiento, Ampere demuestra las ventajas de su sistema basado en AmpereOne de 160 núcleos con 512 GB de memoria que ejecuta Generative AI (Stable Diffusion) y AI Recommenders (DLRM) sobre los sistemas basados en la CPU EPYC 9654 de 96 núcleos de AMD con 256 GB de memoria (lo que significa que funcionó en un modo de ocho canales, no en el modo de 12 canales compatible con Génova). Las máquinas basadas en amperios produjeron 2,3 veces más cuadros por segundo para IA generativa y más de 2 veces más consultas por segundo para recomendaciones de IA.
En este caso, Ampere comparó el rendimiento de sus sistemas procesando datos con precisión FP16, mientras que las máquinas basadas en AMD calcularon con precisión FP32, lo que no es una comparación directa. Además, muchas cargas de trabajo de FP16 ahora se ejecutan en GPU en lugar de CPU, y las GPU paralelas masivas tienden a brindar resultados espectaculares con cargas de trabajo de IA generativas y recomendaciones de IA.
Resumen
Los AmpereOne de Ampere son los primeros procesadores de propósito general de la industria con hasta 192 núcleos, lo que sin duda merece mucho respeto. Estas CPU también cuentan con sólidas capacidades de E/S, características de seguridad avanzadas y prometen ganancias mejoradas de instrucciones por reloj (IPC). También pueden ejecutar cargas de trabajo de IA con precisión FP16, BF16, FP8 e INT8.
Pero la compañía ha optado por utilizar métodos bastante controvertidos para probar sus puntos en lo que respecta a los resultados de referencia, lo que arroja cierta sombra sobre sus logros. Dicho esto, será particularmente interesante ver los resultados de las pruebas independientes de los servidores basados en AmpereOne.






