ANOVA - analysis of variance, procedura służąca do porównywania średnich w wielu grupach. Jednoczynnikowa ANOVA pozwala na testowanie hipotezy:

przeciwko hipotezie:

Pozwala badać czy istnieje zależność pomiędzy pewnymi cechami - dokładniej czy zmienna zwana zmienną objaśnianą (lub zmienną odpowiedzi) zależy od tzw. zmiennej objaśnianej (nazwanej też czynnikiem).

Przykład

Czy papier wytwarzany przez trzech producentów różni się pod względem jaskrawości (i jeśli tak, to kto®y z tych trzech producentów zapewnia największą jaskrawość); wtedy:

  • zmienna objaśniana (odpowiedzi) to jaskrawość
  • zmienna objaśniająca (czynnik) to producent czynnik ten występuje w trzech poziomach, producent 1,2,3
    Problem czy papier wytwarzany przez trzech producentów różni się pod względem jaskrawości, możemy rozwiązywać testując hipotezę

    przeciwko hipotezie przeciwnej (oczywista).

Powiedzmy, że te jaskrawości mają wartości jak w tabelce poniżej:

Żeby sprawdzić hipotezę, tworzymy model matematyczny:


gdzie i = nr. producenta a j to obserwacja w i-tej grupie.

  • to jaskrawość j-tej próbki papieru od i-tego producenta
  • to średnia jaskrawość papieru pochodzącego od i-tego producenta
  • to efekt i-tego producenta
  • to błąd losowy dla j-tej próbki papieru pochodzącej od i-tego producenta.

Ogólniej

gdzie oraz gdzie k to liczba poziomów czynnika, a n to liczba obserwacji na każdym poziomie czynnika.

  • to wartość zmiennej odpowiedzi dla j-tej obserwacji w i-tej grupie.
  • to wartość średnia zmiennej odpowiedzi w i-tej grupie.
  • to efekt w i-tej grupie
  • to błąd losowy dla j-tej obserwacji w i-tej grupie.

Jako że zakładamy że zmienne odpowiedzi mają tą samą wariancję, to ciągnie za sobą że również mają rozkłady normalne o tej samej wariancji. Ponieważ pomiary wykonujemy niezależnie, to błędy też są niezależne o tym samym rozkładzie .

Ponadto założyliśmy plan zrównoważony, czyli że każdy czynnik ma tyle samo wykonanych obserwacji.

Konwencje założeń przy ANOVIE


  1. Wtedy interpretujemy jako ogólną wartość średnią zmiennej odpowiedzi a to efekt działania i-tego poziomu czynnika względem średniej ogólnej.

  2. Wtedy poziom nr. 1 przyjmujemy za poziom odniesienia a jest wartością średnią zmiennej odpowiedzi w grupie, która jest poziomem odniesienia, a to efekt działania i-tego poziomu czynnika względem poziomu czynnika nr. 1

Niezależnie od wybranej konwencji weryfikujemy hipotezę

przeciwko hipotezie odwrotnej(oczywistej).

Konstrukcja testu do weryfikacji hipotez

Jeśli hipoteza zerowa jest prawdziwa i dla każdego poziomu czynnika zmienna odpowiedz ma tą samą wariancję, to wewnątrzgrupowe rozproszenie obserwacji (zmienność wewnątrzgrupowa) oraz międzygrupowe rozproszenie obserwacji będą w przybliżeniu równe.

Zmienność wewnątrzgrupowa ->

Zmienność międzygrupowa ->

Ma zachodzić równość:
gdzie SST to zmienność ogólna.
SSA(z tym ułamkiem) ma tendencję do przyjmowania większych wartości niż SSE(też z tym ułamkiem). Dlatego testem poprawności jest:

Jeśli F jest duże to odrzucamy , jeśli nie to przyjmujemy . Jak to ocenić?

F ma podobny rozkład do F-Snedscore’a o k-1 i k(n-1) stopniach swobody.

Jeśli to odrzucamy. Jeśli mniejsze, to nie mamy podstaw do odrzucenia.

Przed wykonaniem czegokolwiek trzeba sprawdzić założenia:

  1. Czy dla każdego poziomu czynnika rozkład zmiennej odpowiedz jest normalny?
  2. Czy wariancje w grupach są przynajmniej w przybliżeniu równe

Porównania wielokrotne

Jeśli odrzucamy , to pytanie które są nierówne. Robimy porównania parami wykonując t-test, z nieznajomą, lecz równą wariancją.

Problem jak dobrać poziom istotności każdego testu żeby poziom istotności całej procedury był pożądany.