분위수의 차이

Oct 12 2020

정의에서 이해하는 한, 분위수 경계는 데이터 세트를 동일한 부분으로 분할해야합니다 (또는 데이터 세트에 항목이 충분하지 않거나 요소 수가 홀수 인 경우 적어도 거의 동일한 부분으로). 내 데이터 세트에서 사 분위수를 얻기 위해 pandas함수 quantile를 사용했습니다 .

tquantiles = rawData['t'].quantile([0.25,0.5,0.75])

출력에 분위수 경계 값이 표시됩니다.

0.25    -3.1
0.50     6.7
0.75    15.6
Name: t, dtype: float64

rawData SQL 쿼리의 결과입니다.

rawData = sqlio.read_sql_query('SELECT * ' +
'FROM cards ' +
'INNER JOIN weather ' +
'on ceil_time_3h(event_date) = weather.datetime', conn)

따라서 분위수가 같다고 가정하고 명명 된 값 간의 개체 양을 비교하려고합니다.

SELECT count("t") AS "25" FROM cards
INNER JOIN weather
on ceil_time_3h(event_date) = weather.datetime
WHERE t >= 15.6;

이것은 상위 25 %입니다. 값을 변경하면서 왼쪽 테두리를 포함하여 사 분위수를 선택했습니다. 이러한 값은 같지 않습니다. 각각 25 % 미만, 50 %, 75 % 및 75 % 이상인 경우 128829, 130150, 130250, 130266. 또한 이러한 개수의 합계는 데이터 세트의 요소 수보다 적습니다.

제 경우에는 분위수가 서로 어떻게 다른가요? 합계가 데이터 세트의 요소 수와 다른 이유는 무엇입니까?

답변

4 NickCox Oct 18 2020 at 21:07

데이터가 해상도 0.1로 측정되고 범위가 18.7 이상인 것 같습니다. "날씨"에 대한 언급은 섭씨 온도라는 것입니다.

변수의 범위가 해당 단위로 50이라고 가정 해 봅시다. 사 분위수를 초과하는 꼬리는 종종 사 분위수 차이보다 깁니다. 이는 500 개의 고유 한 값의 순서를 의미합니다.

표본 크기가 500000 정도이므로 평균적으로 각각의 고유 값이 약 1000 번 발생하고 모든 곳에 동점이 있습니다.

또한 사람의 판독이 포함 된 경우 데이터가 그보다 더 기이 할 수도 있습니다. 많은 관찰자들은 최종 숫자 또는 짝수 숫자에 대한 0과 5에 대한 환경 설정을 포함하여 기이 한 점이 다를 수 있지만 다른 것보다 최종 숫자를 사용합니다.

동일한 값이 동일한 빈에 할당되어야한다는 규칙과 함께 동점이 문제가 될 수 있습니다.