✖

Podstawy statystyki

Statystyka to nauka, która bada rzeczywiste dane i przy pomocy teorii prawdopodobieństwa stara się te dane opisywać.

Osobny dział statystyki

To jest stary i nieaktualny artykuł, statystyka ma już swój osobny dział z artykułem wprowadzającym Podstawowe pojęcia statystyki.

Podstawowe pojęcia

W statystyce pracuje się z kilkoma podstawowymi pojęciami, które tutaj opiszemy.

Przede wszystkim chodzi o zbiorowość statystyczną, czyli skończony zbiór jakichś danych, które chcemy badać. Dane mogą być ogólne, w zasadzie może to być cokolwiek. Jeśli chcesz zbadać przeciętne wynagrodzenie w Polsce, zbiorowością statystyczną będzie zbiór wszystkich ludzi w Polsce. Liczbę elementów zbiorowości statystycznej nazywamy jej rozmiarem. Rozmiar tak zdefiniowanej zbiorowości statystycznej byłby więc równy liczbie mieszkańców Polski.

Dalej mamy pojęcie jednostki statystycznej, czyli konkretnego elementu zbiorowości statystycznej. W naszym przypadku jednostką statystyczną byłby więc jeden konkretny człowiek.

Na koniec mamy cechę statystyczną, czyli to, co chcemy mierzyć. W naszym przykładzie cechą statystyczną byłoby właśnie wynagrodzenie. Cecha statystyczna może być albo jakościowa, albo ilościowa. Cecha ilościowa to taka cecha, którą można wyrazić liczbami (na przykład właśnie to wynagrodzenie, wzrost, liczba dzieci, …), a cechę jakościową wyrażamy słownie (kolor, tak/nie, zawód, …).

Liczebność i częstość

Liczebność i częstość mówią, ile razy dana wartość cechy występuje w zbiorowości statystycznej — liczebność podaje to bezwzględnie, częstość względnie, w stosunku do liczby wszystkich elementów zbiorowości.

Ważne jest, że przy liczeniu liczebności musimy zastosować cechę statystyczną, bo gdybyśmy chcieli obliczyć liczebność jednostki statystycznej, musielibyśmy zawsze dojść albo do zera, albo do jedynki, ponieważ zbiorowość statystyczna jest zbiorem, a zbiór jako taki nie dopuszcza, żeby było w nim kilka takich samych elementów.

Liczebność wartości z cechy statystycznej podaje więc liczbę wystąpień wartości z w zbiorowości statystycznej S. Przykład: weźmy klasę liczącą dziesięciu uczniów. Każdy uczeń dostał na świadectwie jakąś ocenę z matematyki, od jedynki do piątki. Oceny zapisuje następująca tabela:

$$\begin{array}{c|c|c|c|c|c|c|c|c|c} 1&2&3&4&5&6&7&8&9&10\\ \hline 2&5&3&2&1&1&2&4&1&3 \end{array}$$

Uwaga: zbiorowością statystyczną w tym przykładzie byłaby ta dziesiątka kolegów z klasy, coś w rodzaju

$$S=\left\{\mbox{Kuba}, \mbox{Weronika}, \mbox{Marcin}, \ldots\right\}$$

W tabeli dla uproszczenia mamy w pierwszym wierszu numer identyfikujący ucznia, w pierwszym wierszu są więc jednostki statystyczne, czyli elementy zbiorowości statystycznej. W drugim wierszu mamy wartości cechy statystycznej, czyli wartości „ocena końcowa z matematyki” danego ucznia.

Liczebność wartości cechy (oceny na świadectwie) z = 3 byłaby więc równa dwóm, tylko dwóch uczniów dostało na świadectwie trójkę (są to „uczniowie” 3 i 10). Liczebność wartości z = 1 byłaby równa trzem („uczniowie” 5, 6 i 9).

Częstość mówi, jaka część (na przykład ile procent) wartości cechy w zbiorowości statystycznej jest równa z. Częstość wartości z obliczymy tak:

$$r=\frac{z_a}{|S|},$$

gdzie za to liczebność wartości z, a |S| to rozmiar zbiorowości statystycznej, czyli liczba jej elementów. Częstość oceny trzy byłaby więc równa:

$$r_3=\frac{2}{10}=\frac15.$$

Rozmiar naszej zbiorowości wynosi dziesięć, bo w klasie mamy dziesięciu uczniów. Zapis w procentach otrzymamy, mnożąc przez sto, dostalibyśmy więc 20%. Częstość jedynki byłaby równa

$$r_1=\frac{3}{10}.$$

Średnia arytmetyczna

Średnia arytmetyczna, często też po prostu średnia, to średnia wszystkich wartości w zbiorowości statystycznej. Przez słowo wartość rozumiemy to, co otrzymamy po zastosowaniu cechy statystycznej. Średnią obliczymy tak, że dodamy wszystkie wartości i podzielimy je przez liczbę wartości w zbiorowości. Mniej więcej tak:

$$p_a=\frac{x_1+x_2+x_3+\ldots+x_n}{n}=\frac1n\sum_{i=1}^nx_i$$

Dodałem też zapis za pomocą sumy, gdyby wydał ci się czytelniejszy. Ale wystarczy to wcześniejsze wyrażenie z ułamkiem. Wartości x to wszystkie wartości naszej zbiorowości.

Przykład: weźmiemy dane z poprzedniej tabeli i obliczymy średnią ocenę na ucznia.

$$p_a=\frac{2+5+3+2+1+1+2+4+1+3}{10}=\frac{24}{10}=2{,}4$$

W naszej klasie średnia ocena wynosi 2,4. Jak widzisz, średnia arytmetyczna może nam zwrócić nawet wartość, która właściwie w ogóle nie jest dopuszczalna — nie można postawić oceny 2,4.

Średnia arytmetyczna słabo się też sprawdza w przypadku, gdy część danych ma zasadniczo inną wartość niż reszta danych. Jeśli więc mamy zbiorowość z wartościami 1, 3, 2, 5, 4, 2, 75, to średnia arytmetyczna wyjdzie nam

$$p_a=\frac{1+3+2+5+4+2+75}{7}\approx 13{,}14.$$

Widzimy, że otrzymana wartość jest daleko od wszystkich wartości w zbiorowości. Jest kilka razy większa niż pierwsze sześć liczb i kilka razy mniejsza niż ostatnia wartość. To problem, który może rozwiązać na przykład mediana, patrz dalej. Przynajmniej już wiesz, dlaczego dwie trzecie ludzi nie zarabia średniej krajowej — istnieje mała grupa ludzi, którzy mają bardzo ponadprzeciętne pensje, a te podnoszą średnią arytmetyczną.

Średnia geometryczna

Średnią geometryczną oblicza się podobnie jak średnią arytmetyczną, tylko zamiast dodawania używa się mnożenia, a zamiast dzielenia pierwiastka. Średnią geometryczną obliczymy więc tak:

$$p_g=\sqrt[n]{x_1\cdot x_2\cdot x_3\cdot\ldots\cdot x_n}=\sqrt[n]{\prod_{i=1}^n x_i}$$

Średnia geometryczna może służyć jako wskaźnik wzrostu. Dla przykładu załóżmy, że cena jakiegoś produktu wzrosła w ciągu roku o 10%, w następnym roku o 15% i w kolejnym o 5%. Pierwotna cena c miała więc po tych trzech latach wartość

$$1{,}1\cdot1{,}15\cdot1{,}05c=1{,}32825c.$$

Średnia geometryczna tych współczynników byłaby równa:

$$p_g=\sqrt[3]{1{,}1\cdot1{,}15\cdot1{,}05}\approx 1{,}0992419$$

Co to oznacza? Że gdyby cena co roku została pomnożona dokładnie przez 1,0992419 (czyli wzrosła mniej więcej o 9,92%), to końcowa cena miałaby tę samą wartość:

$$1{,}0992419^3\approx 1{,}32825$$

Dominanta i mediana

Dominanta cechy to wartość, która ma największą liczebność, oznacza się ją Mod(x). Jeśli wrócimy do przykładu z ocenami, to dominantami są wartości 1 i 2, bo występują najczęściej — obie mają liczebność 3.

Mediana to z kolei środkowa wartość, oznaczamy ją Med(x). Jeśli potrafimy ustawić wartości w niemalejący ciąg

$$x_1\le x_2\le x_3\le\ldots\le x_n,$$

to mediana jest wartością, która leży w środku tego ciągu. Środkowa wartość wygląda jednak inaczej, gdy ciąg ma nieparzystą, a inaczej, gdy parzystą liczbę wyrazów. Jeśli nieparzystą, mediana jest wyrazem na pozycji

$$\mbox{Med}(x)=x_{\frac{n+1}{2}}$$

Jeśli ciąg ma parzystą liczbę wyrazów, to nie ma wyrazu, który byłby dokładnie w środku (przykład: ciąg 1, 2, 3, 4 po prostu nie ma środkowego wyrazu). Dlatego bierzemy średnią z dwóch środkowych wartości (średnią wartości 2 i 3). Wzór dla parzystego n jest więc taki:

$$\mbox{Med}(x)=\frac{x_{n/2}+x_{(n+2)/2}}{2}$$

Wróćmy do przykładu, który ilustrował źle użytą średnią arytmetyczną. Mieliśmy zbiorowość wartości s=1, 3, 2, 5, 4, 2, 75. Dominanta byłaby równa dwóm, to jedyna liczba, która się powtarza. Żeby obliczyć medianę, ustawimy liczby w ciąg:

$$a_i=1{,}2,2{,}3,4{,}5,75.$$

Ciąg ma siedem wyrazów, środkowym wyrazem jest więc a4, a ten jest równy trzem.