✖

Wariancja

Wariancja mówi nam, jak bardzo rozrzucone są wartości w naszej zbiorowości statystycznej.

Czym jest wariancja

Spójrz na następującą tabelę, która przedstawia oceny na świadectwie dziesięciu wybranych uczniów klasy 8b. Będą nas interesować dwa przedmioty, matematyka i historia.

Imię Matematyka Historia
Tomasz 4 2
Marcin 5 5
Jerzy 4 5
Mirosław 4 5
Anna 4 3
Magdalena 5 2
Andrzej 4 1
Łukasz 4 5
Paulina 4 4
Jan 3 2

Widzimy, że większość uczniów ma z matematyki czwórkę, czasem ktoś ma piątkę albo trójkę. Za to w kolumnie z historią mamy niezły chaos — oceny są rozrzucone od jedynki do piątki i żadna ocena wyraźnie nie przeważa. Oceny z historii są więc bardziej rozrzucone niż oceny z matematyki.

Jeśli obliczymy średnią ocenę z matematyki, wyjdzie nam 4,1. Widzimy, że większość wartości leży dość blisko tej liczby. Z kolei przy historii wychodzi nam średnia 3,4 i większość ocen nie leży blisko tej wartości.

Jak wyrazić ten rozrzut liczbą?

Jak obliczyć wariancję

Dane z poprzedniej tabeli przeniesiemy na wykres i pokażemy tylko oceny z historii.

Oceny końcowe z historii

Na osi x mamy uczniów (tym razem bez imion, przyjmijmy więc, że 1 = Tomasz, 2 = Marcin itd.). Na osi y mamy oceny końcowe. Prosta y = 3,4 przedstawia średnią wartość.

Wariancję obliczymy jako średnią kwadratów odległości od średniej. Brzmi to tajemniczo, ale jest proste. Kwadrat liczby x możemy sobie wyobrazić jako pole kwadratu o boku długości x. Narysujemy więc na wykresie kwadraty, których bok będzie równy odległości wartości od średniej:

Wykres z zaznaczonymi kwadratami odległości

Na wykresie są narysowane cztery takie kwadraty, wszystkie by się tam nie zmieściły. Widzimy, że Anna jest dość blisko średniej, dlatego jej kwadrat jest mały. Za to Andrzej jest daleko od średniej, dlatego jego kwadrat jest duży. Gdybyśmy narysowali wszystkie kwadraty i obliczyli średnie pole tych kwadratów, otrzymalibyśmy wariancję.

Jeśli mamy zbiór wartości X = [x1, …, xN], a $\overline{x}$ jest ich średnią, to wariancję, którą oznaczamy $\sigma^2$ (spotkasz też zapis $\mbox{Var}(X)$), obliczymy tak:

$$ \sigma^2 = \frac1N \left((x_1-\overline{x})^2 + (x_2-\overline{x})^2 + … + (x_N-\overline{x})^2 \right) $$

Albo za pomocą sumy tak:

$$ \sigma^2 = \frac1N\sum_{i=1}^N (x_i-\overline{x})^2 $$

Dlaczego akurat $(x_1-\overline{x})^2$? Samo wyrażenie $x_1-\overline{x}$ dałoby nam odległość punktu x1 od średniej. Dokładniej powinniśmy napisać $|x_1-\overline{x}|$ (wartość bezwzględna), na wypadek gdyby wartość x1 była mniejsza od średniej. Ponieważ chcemy znać pole kwadratu, podnosimy tę wartość do kwadratu.

Wariancja naszych danych wynosiłaby więc:

$$ \begin{align*} \sigma^2_{\mbox{historia}} = \frac{1}{10}((2-3{,}4)^2+(5-3{,}4)^2+(5-3{,}4)^2+\\(5-3{,}4)^2+(3-3{,}4)^2+(2-3{,}4)^2+\\(1-3{,}4)^2+(5-3{,}4)^2+(4-3{,}4)^2+\\(2-3{,}4)^2)=\frac{1}{10}\cdot 22{,}4 = 2{,}24 \end{align*} $$

Wariancja wynosi 2,24. Wariancja ocen z matematyki wyglądałaby tak:

$$ \begin{align*} \sigma^2_{\mbox{matematyka}} = \frac{1}{10}((4-4{,}1)^2+(5-4{,}1)^2+(4-4{,}1)^2+\\(4-4{,}1)^2+(4-4{,}1)^2+(5-4{,}1)^2+\\(4-4{,}1)^2+(4-4{,}1)^2+(4-4{,}1)^2+\\(3-4{,}1)^2)=\frac{1}{10}\cdot2{,}9 = 0{,}29 \end{align*} $$

Wariancja wynosi 0,29. Widzimy, że wariancja tych danych jest, zgodnie z oczekiwaniami, dużo mniejsza.

Jak obliczyć wariancję w Excelu

W polskim Excelu służy do tego funkcja WARIANCJA.POPUL, w angielskim VAR.P (istnieją też inne jej warianty). Jako argument podajemy wybrany zakres komórek.