T-test u R programiranju: jedan uzorak i upareni T-test [Primjer]
ล to je statistiฤko zakljuฤivanje?
Statistiฤko zakljuฤivanje je umijeฤe generiranja zakljuฤaka o distribuciji podataka. Podatkovni znanstvenik ฤesto je izloลพen pitanjima na koja se moลพe odgovoriti samo znanstveno. Stoga je statistiฤko zakljuฤivanje strategija kojom se testira je li hipoteza istinita, tj. potvrฤena podacima.
Uobiฤajena strategija za procjenu hipoteze je provoฤenje t-testa. T-test moลพe pokazati imaju li dvije grupe istu srednju vrijednost. T-test se takoฤer naziva a Studentski test. T-test se moลพe procijeniti za:
- Jedan vektor (tj. t-test jednog uzorka)
- Dva vektora iz iste skupine uzoraka (tj. upareni t-test).
Pretpostavljate da su oba vektora nasumiฤno uzorkovana, neovisna i da dolaze iz normalno rasporeฤene populacije s nepoznatim, ali jednakim varijancama.
ล to je T-test u R programiranju?
Osnovna ideja iza T-testa je koriลกtenje statistike za procjenu dviju suprotnih hipoteza:
- H0: NULL hipoteza: Prosjek je isti kao i koriลกteni uzorak
- H3: Toฤna hipoteza: Prosjek se razlikuje od koriลกtenog uzorka
T-test se obiฤno koristi s malim uzorcima. Da biste izvrลกili t-test, morate pretpostaviti normalnost podataka.
Sintaksa T-testa u R
Osnovna sintaksa za t.test() u R je:
t.test(x, y = NULL,
mu = 0, var.equal = FALSE)
arguments:
- x : A vector to compute the one-sample t-test
- y: A second vector to compute the two sample t-test
- mu: Mean of the population- var.equal: Specify if the variance of the two vectors are equal. By default, set to `FALSE`
Jedan uzorak T-testa u R
T-test jednog uzorka, ili Studentov test, usporeฤuje srednju vrijednost vektora s teoretskom sredinom, . Formula koja se koristi za izraฤunavanje t-testa je:
Ovdje,
odnosi se na srednju vrijednost
do teorijske sredine
- s je standardna devijacija
- n broj opaลพanja.
Da biste procijenili statistiฤku znaฤajnost t-testa, morate izraฤunati p-vrijednost, p-vrijednost kreฤe se od 0 do 1 i tumaฤi se na sljedeฤi naฤin:
- P-vrijednost niลพa od 0.05 znaฤi da ste ฤvrsto uvjereni da ฤete odbaciti nultu hipotezu, stoga je H3 prihvaฤena.
- P-vrijednost veฤa od 0.05 znaฤi da nemate dovoljno dokaza za odbacivanje nulte hipoteze.
P-vrijednost moลพete konstruirati gledajuฤi odgovarajuฤu apsolutnu vrijednost t-testa u Studentovoj distribuciji sa stupnjevima slobode jednakim
Na primjer, ako imate 5 opaลพanja, trebate usporediti naลกu t-vrijednost s t-vrijednoลกฤu u Studentovoj distribuciji s 4 stupnja slobode i 95-postotnim intervalom pouzdanosti. Da bi se odbacila nulta hipoteza, t-vrijednost bi trebala biti veฤa od 2.77.
Vidi tablicu ispod:
Jedan primjer T-testa u R
Pretpostavimo da ste tvrtka koja proizvodi kolaฤiฤe. Svaki kolaฤiฤ treba sadrลพavati 10 grama ลกeฤera. Kolaฤiฤi se proizvode pomoฤu stroja koji dodaje ลกeฤer u zdjelu prije nego ลกto sve izmijeลกa. Vjerujete da stroj ne dodaje 10 grama ลกeฤera za svaki kolaฤiฤ. Ako je vaลกa pretpostavka toฤna, stroj treba popraviti. Pohranili ste razinu ลกeฤera od trideset kolaฤiฤa.
biljeลกke: Moลพete stvoriti nasumiฤni vektor s funkcijom rnorm(). Ova funkcija generira normalno distribuirane vrijednosti. Osnovna sintaksa je:
rnorm(n, mean, sd) arguments - n: Number of observations to generate - mean: The mean of the distribution. Optional - sd: The standard deviation of the distribution. Optional
Moลพete stvoriti distribuciju s 30 opaลพanja sa srednjom vrijednoลกฤu od 9.99 i standardnom devijacijom od 0.04.
set.seed(123) sugar_cookie <- rnorm(30, mean = 9.99, sd = 0.04) head(sugar_cookie)
Izlaz:
## [1] 9.967581 9.980793 10.052348 9.992820 9.995172 10.058603
Moลพete upotrijebiti t-test jednog uzorka da provjerite razlikuje li se razina ลกeฤera od one u receptu. Moลพete nacrtati test hipoteze:
- H0: Prosjeฤna razina ลกeฤera jednaka je 10
- H3: Prosjeฤna razina ลกeฤera razlikuje se od 10
Koristite razinu znaฤajnosti od 0.05.
# H0 : mu = 10 t.test(sugar_cookie, mu = 10)
Evo rezultata:
P-vrijednost t-testa jednog uzorka je 0.1079 i iznad 0.05. Moลพete biti sigurni s 95% da je koliฤina ลกeฤera koju je stroj dodao izmeฤu 9.973 i 10.002 grama. Ne moลพete odbaciti nultu (H0) hipotezu. Nema dovoljno dokaza da koliฤina ลกeฤera koju stroj dodaje ne slijedi recept.
Upareni T-test u R
Upareni T-test ili t-test ovisnog uzorka koristi se kada se srednja vrijednost tretirane skupine izraฤuna dvaput. Osnovna primjena uparenog t-testa je:
- A / B testiranje: Usporedite dvije varijante
- Studije kontrole sluฤaja: Prije/poslije tretmana
Primjer uparenog T-testa u R
Tvrtka za proizvodnju piฤa zainteresirana je za uฤinak programa popusta na prodaju. Tvrtka je odluฤila pratiti dnevnu prodaju jedne od svojih trgovina u kojoj se promovira program. Na kraju programa, tvrtka ลพeli znati postoji li statistiฤka razlika izmeฤu prosjeฤne prodaje trgovine prije i nakon programa.
- tvrtka tracPratili smo prodaju svaki dan prije poฤetka programa. Ovo je naลก prvi vektor.
- Program se promovira tjedan dana, a prodaja se biljeลพi svaki dan. Ovo je naลก drugi vektor.
- Provest ฤete t-test kako biste procijenili uฤinkovitost programa. To se naziva upareni t-test jer vrijednosti oba vektora dolaze iz iste distribucije (tj. iste trgovine).
Testiranje hipoteze je:
- H0: Nema razlike u prosjeku
- H3: Dva su sredstva razliฤita
Zapamtite, jedna pretpostavka u t-testu je nepoznata, ali jednaka varijanca. U stvarnosti, podaci jedva da imaju jednaku srednju vrijednost i to dovodi do netoฤnih rezultata za t-test.
Jedno rjeลกenje za ublaลพavanje pretpostavke jednake varijance je koriลกtenje Welchovog testa. R pretpostavlja da dvije varijance nisu jednake prema zadanim postavkama. U vaลกem skupu podataka oba vektora imaju istu varijancu, moลพete postaviti var.equal= TRUE.
Kreirate dva sluฤajna vektora iz Gaussove distribucije s viลกom sredinom za prodaju nakon programa.
set.seed(123) # sales before the program sales_before <- rnorm(7, mean = 50000, sd = 50) # sales after the program.This has higher mean sales_after <- rnorm(7, mean = 50075, sd = 50) # draw the distribution t.test(sales_before, sales_after,var.equal = TRUE)
Dobili ste p-vrijednost od 0.04606, niลพu od praga od 0.05. Zakljuฤujete da su prosjeci dviju skupina znaฤajno razliฤiti. Program poboljลกava prodaju trgovina.
Rezime
- Statistiฤko zakljuฤivanje je umijeฤe generiranja zakljuฤaka o distribuciji podataka.
- T-test pripada obitelji inferencijalne statistike. Obiฤno se koristi da bi se otkrilo postoji li statistiฤka razlika izmeฤu srednjih vrijednosti dviju skupina.
- T-test jednog uzorka ili Studentov test usporeฤuje srednju vrijednost vektora s teoretskom sredinom.
- Upareni T-test ili t-test ovisnog uzorka koristi se kada se srednja vrijednost tretirane skupine izraฤuna dvaput.
T-test moลพemo saลพeti u tablici u nastavku:
| test | Hipoteza za testiranje | p-vrijednost | Code | Neobavezni argument |
|---|---|---|---|---|
| t-test jednog uzorka | Srednja vrijednost vektora razlikuje se od teorijske sredine | 0.05 |
t.test(x, mu = mean) |
|
| t-test uparenog uzorka | Srednja vrijednost A razlikuje se od srednje vrijednosti B za istu skupinu | 0.06 |
t.test(A,B, mu = mean) |
var.equal= TRUE |
Ako pretpostavimo da su varijance jednake, trebamo promijeniti parametar var.equal= TRUE.




