Différence entre les quantiles

Oct 12 2020

Autant que j'ai compris de sa définition, les frontières de quantile devraient diviser un ensemble de données en parties égales (ou au moins en parties presque égales, si l'ensemble de données n'a pas assez d'entrées ou a un nombre impair d'éléments). J'ai utilisé la pandasfonction quantilepour obtenir des quartiles de mon ensemble de données:

tquantiles = rawData['t'].quantile([0.25,0.5,0.75])

La sortie affiche les valeurs de limite de quantile:

0.25    -3.1
0.50     6.7
0.75    15.6
Name: t, dtype: float64

rawData est le résultat d'une requête SQL:

rawData = sqlio.read_sql_query('SELECT * ' +
'FROM cards ' +
'INNER JOIN weather ' +
'on ceil_time_3h(event_date) = weather.datetime', conn)

Donc, en supposant que les quantiles sont égaux, j'essaie de comparer la quantité d'objets entre les valeurs nommées:

SELECT count("t") AS "25" FROM cards
INNER JOIN weather
on ceil_time_3h(event_date) = weather.datetime
WHERE t >= 15.6;

C'est pour les 25% les plus riches. Changement de valeurs, j'ai sélectionné des quartiles, y compris la bordure gauche. Ces valeurs ne sont pas égales: 128829, 130150, 130250, 130266 pour les valeurs inférieures à 25%, 50%, 75% et supérieures à 75% respectivement. De plus, la somme de ces nombres est inférieure au nombre d'éléments de l'ensemble de données.

En quoi les quantiles diffèrent-ils les uns des autres dans mon cas? Pourquoi la somme diffère-t-elle du nombre d'éléments dans l'ensemble de données?

Réponses

4 NickCox Oct 18 2020 at 21:07

Il semble que vos données soient mesurées avec une résolution de 0,1 et que la plage soit d'au moins 18,7. Ma conjecture étant donné la mention de «temps» est que ce sont des températures Celsius.

Supposons que la variable a une plage de 50 dans ces unités: les queues au-delà des quartiles sont souvent plus longues que la différence entre les quartiles. Cela signifierait de l'ordre de 500 valeurs distinctes.

Il semble que la taille de votre échantillon soit de l'ordre de 500000, donc en moyenne chaque valeur distincte se produit environ 1000 fois, et les liens sont partout.

Il est également tout à fait possible que vos données soient plus bizarres que cela si des lectures humaines sont impliquées. De nombreux observateurs utilisent certains chiffres finaux plutôt que d'autres, bien que les bizarreries puissent varier, y compris les préférences pour 0 et 5 comme chiffres finaux ou pour des chiffres pairs.

Les liens sont susceptibles d'être le problème, ainsi qu'une règle selon laquelle les mêmes valeurs doivent être attribuées au même bac.