Problemas intermitentes de rendimiento de la red

Sep 10 2020

He estado lidiando con un problema intermitente en mi red durante varias semanas.

Síntomas:

  1. "Host de destino inalcanzable" periódico y errores similares al hacer ping. Lo siguiente es indicativo:
    Haciendo ping 10.0.64.16 con 32 bytes de datos:
    Respuesta de 172.31.0.18: Host de destino inaccesible.
    Respuesta de 172.31.0.18: Host de destino inaccesible.
    Respuesta de 10.0.64.16: bytes = 32 tiempo = 1004ms TTL = 62
    Respuesta de 10.0.64.16: bytes = 32 tiempo <1ms TTL = 62

  2. Nuestro servidor JavaEE pierde periódicamente la conexión con nuestro servidor SQL (Microsoft).

  3. Un software interno escrito en Microsoft Access y respaldado por SQL Server experimenta periódicamente una degradación significativa del rendimiento.

  4. Nuestras máquinas virtuales experimentan picos de latencia periódicos al acceder a su almacenamiento, a través de iSCSI.

  5. Varias herramientas sensibles a la latencia se desconectan (SSH, XenCenter), mientras que las herramientas insensibles a la latencia no experimentan problemas (paneles de control basados ​​en web).

Por extraño que parezca, no parece que experimentemos todo lo anterior al mismo tiempo, es más como un problema continuo.

Tenemos un Netgear XS728T en el núcleo de nuestra red. Maneja el enrutamiento entre VLAN. Tenemos 3 racks, cada uno de los cuales tiene una pila de 2 conmutadores Netgear S3300, que se conectan al XS728T mediante LAG de 10G habilitados para LCAP.

Los usuarios se conectan a través de pilas de conmutadores Netgear S3300, conectados al núcleo mediante LAG de 10G habilitados para LACP.

Hemos intentado habilitar el Control de flujo entre las pilas en la parte superior de los racks y el núcleo. Cuando habilitamos esto, comenzamos a ver el intercambio de cuadros de pausa, pero la situación no pareció mejorar.

Hemos intentado duplicar el número de enlaces 10G en las conexiones entre las pilas de rack y el núcleo (de 2x10G a 4x10G). Esto tampoco pareció mejorar la situación.

Hemos estado revisando los registros del conmutador con regularidad y no vemos nada fuera de lo común.

La red está libre de bucles, excepto en el apilamiento, STP está deshabilitado. Lo habilitamos brevemente y no deshabilitó ningún enlace.

Siento que tenemos uno o más conmutadores con un problema de tabla MAC.

¿Alguna sugerencia sobre formas de recopilar información adicional? ¿Alguna sugerencia de solución de problemas?

Gracias,

Dominic Hilsbos

Respuestas

1 RonTrunk Sep 10 2020 at 00:10

Vuelva a encender el STP y déjelo encendido. Es concebible que tenga un bucle intermitente. Además, es un buen seguro.

Si tiene un problema de caché ARP, solo lo verá en el XS728T, ya que es el único dispositivo que realiza el enrutamiento.

Vea si sus registros mostrarán cambios en la dirección MAC. Algo puede aletear entre los puertos.

2 DominicHilsbos Sep 18 2020 at 00:18

Ha pasado un tiempo desde que participé en esta pregunta.

Creo que localicé el 90% de nuestro problema; de hecho, teníamos un bucle. Un miembro de TI había enchufado un cable adicional entre un interruptor y un puerto de pared, generando así un bucle.

Dado que el nuevo enlace era solo gigabit, en comparación con el LAGged 10G que es común para las conexiones entre conmutadores en nuestra red, los síntomas que esperaba ver no estaban presentes.