T-test u R programiranju: jedan uzorak i upareni T-test [Primjer]

ล to je statistiฤko zakljuฤivanje?

Statistiฤko zakljuฤivanje je umijeฤ‡e generiranja zakljuฤaka o distribuciji podataka. Podatkovni znanstvenik ฤesto je izloลพen pitanjima na koja se moลพe odgovoriti samo znanstveno. Stoga je statistiฤko zakljuฤivanje strategija kojom se testira je li hipoteza istinita, tj. potvrฤ‘ena podacima.

Uobiฤajena strategija za procjenu hipoteze je provoฤ‘enje t-testa. T-test moลพe pokazati imaju li dvije grupe istu srednju vrijednost. T-test se takoฤ‘er naziva a Studentski test. T-test se moลพe procijeniti za:

  1. Jedan vektor (tj. t-test jednog uzorka)
  2. Dva vektora iz iste skupine uzoraka (tj. upareni t-test).

Pretpostavljate da su oba vektora nasumiฤno uzorkovana, neovisna i da dolaze iz normalno rasporeฤ‘ene populacije s nepoznatim, ali jednakim varijancama.

ล to je T-test u R programiranju?

Osnovna ideja iza T-testa je koriลกtenje statistike za procjenu dviju suprotnih hipoteza:

  • H0: NULL hipoteza: Prosjek je isti kao i koriลกteni uzorak
  • H3: Toฤna hipoteza: Prosjek se razlikuje od koriลกtenog uzorka

T-test se obiฤno koristi s malim uzorcima. Da biste izvrลกili t-test, morate pretpostaviti normalnost podataka.

Sintaksa T-testa u R

Osnovna sintaksa za t.test() u R je:

t.test(x, y = NULL,
       mu = 0, var.equal = FALSE)
arguments:
- x : A vector to compute the one-sample t-test
- y: A second vector to compute the two sample t-test
- mu: Mean of the population- var.equal: Specify if the variance of the two vectors are equal. By default, set to `FALSE`

Jedan uzorak T-testa u R

T-test jednog uzorka, ili Studentov test, usporeฤ‘uje srednju vrijednost vektora s teoretskom sredinom, Jedan uzorak T-testa u R. Formula koja se koristi za izraฤunavanje t-testa je:

Jedan uzorak T-testa u R

Ovdje,

  • Jedan uzorak T-testa u R odnosi se na srednju vrijednost
  • Jedan uzorak T-testa u R do teorijske sredine
  • s je standardna devijacija
  • n broj opaลพanja.

Da biste procijenili statistiฤku znaฤajnost t-testa, morate izraฤunati p-vrijednost, p-vrijednost kreฤ‡e se od 0 do 1 i tumaฤi se na sljedeฤ‡i naฤin:

  • P-vrijednost niลพa od 0.05 znaฤi da ste ฤvrsto uvjereni da ฤ‡ete odbaciti nultu hipotezu, stoga je H3 prihvaฤ‡ena.
  • P-vrijednost veฤ‡a od 0.05 znaฤi da nemate dovoljno dokaza za odbacivanje nulte hipoteze.

P-vrijednost moลพete konstruirati gledajuฤ‡i odgovarajuฤ‡u apsolutnu vrijednost t-testa u Studentovoj distribuciji sa stupnjevima slobode jednakim Jedan uzorak T-testa u R

Na primjer, ako imate 5 opaลพanja, trebate usporediti naลกu t-vrijednost s t-vrijednoลกฤ‡u u Studentovoj distribuciji s 4 stupnja slobode i 95-postotnim intervalom pouzdanosti. Da bi se odbacila nulta hipoteza, t-vrijednost bi trebala biti veฤ‡a od 2.77.

Vidi tablicu ispod:

Jedan uzorak T-testa u R

Jedan primjer T-testa u R

Pretpostavimo da ste tvrtka koja proizvodi kolaฤiฤ‡e. Svaki kolaฤiฤ‡ treba sadrลพavati 10 grama ลกeฤ‡era. Kolaฤiฤ‡i se proizvode pomoฤ‡u stroja koji dodaje ลกeฤ‡er u zdjelu prije nego ลกto sve izmijeลกa. Vjerujete da stroj ne dodaje 10 grama ลกeฤ‡era za svaki kolaฤiฤ‡. Ako je vaลกa pretpostavka toฤna, stroj treba popraviti. Pohranili ste razinu ลกeฤ‡era od trideset kolaฤiฤ‡a.

biljeลกke: Moลพete stvoriti nasumiฤni vektor s funkcijom rnorm(). Ova funkcija generira normalno distribuirane vrijednosti. Osnovna sintaksa je:

rnorm(n, mean, sd)
arguments
- n: Number of observations to generate
- mean: The mean of the distribution. Optional
- sd: The standard deviation of the distribution. Optional

Moลพete stvoriti distribuciju s 30 opaลพanja sa srednjom vrijednoลกฤ‡u od 9.99 i standardnom devijacijom od 0.04.

set.seed(123) sugar_cookie <- rnorm(30, mean = 9.99, sd = 0.04)
head(sugar_cookie)

Izlaz:

## [1]  9.967581  9.980793 10.052348  9.992820  9.995172 10.058603

Moลพete upotrijebiti t-test jednog uzorka da provjerite razlikuje li se razina ลกeฤ‡era od one u receptu. Moลพete nacrtati test hipoteze:

  • H0: Prosjeฤna razina ลกeฤ‡era jednaka je 10
  • H3: Prosjeฤna razina ลกeฤ‡era razlikuje se od 10

Koristite razinu znaฤajnosti od 0.05.

# H0 : mu = 10
t.test(sugar_cookie, mu = 10)

Evo rezultata:

Jedan primjer T-testa u R

P-vrijednost t-testa jednog uzorka je 0.1079 i iznad 0.05. Moลพete biti sigurni s 95% da je koliฤina ลกeฤ‡era koju je stroj dodao izmeฤ‘u 9.973 i 10.002 grama. Ne moลพete odbaciti nultu (H0) hipotezu. Nema dovoljno dokaza da koliฤina ลกeฤ‡era koju stroj dodaje ne slijedi recept.

Upareni T-test u R

Upareni T-test ili t-test ovisnog uzorka koristi se kada se srednja vrijednost tretirane skupine izraฤuna dvaput. Osnovna primjena uparenog t-testa je:

  • A / B testiranje: Usporedite dvije varijante
  • Studije kontrole sluฤaja: Prije/poslije tretmana

Primjer uparenog T-testa u R

Tvrtka za proizvodnju piฤ‡a zainteresirana je za uฤinak programa popusta na prodaju. Tvrtka je odluฤila pratiti dnevnu prodaju jedne od svojih trgovina u kojoj se promovira program. Na kraju programa, tvrtka ลพeli znati postoji li statistiฤka razlika izmeฤ‘u prosjeฤne prodaje trgovine prije i nakon programa.

  • tvrtka tracPratili smo prodaju svaki dan prije poฤetka programa. Ovo je naลก prvi vektor.
  • Program se promovira tjedan dana, a prodaja se biljeลพi svaki dan. Ovo je naลก drugi vektor.
  • Provest ฤ‡ete t-test kako biste procijenili uฤinkovitost programa. To se naziva upareni t-test jer vrijednosti oba vektora dolaze iz iste distribucije (tj. iste trgovine).

Testiranje hipoteze je:

  • H0: Nema razlike u prosjeku
  • H3: Dva su sredstva razliฤita

Zapamtite, jedna pretpostavka u t-testu je nepoznata, ali jednaka varijanca. U stvarnosti, podaci jedva da imaju jednaku srednju vrijednost i to dovodi do netoฤnih rezultata za t-test.

Jedno rjeลกenje za ublaลพavanje pretpostavke jednake varijance je koriลกtenje Welchovog testa. R pretpostavlja da dvije varijance nisu jednake prema zadanim postavkama. U vaลกem skupu podataka oba vektora imaju istu varijancu, moลพete postaviti var.equal= TRUE.

Kreirate dva sluฤajna vektora iz Gaussove distribucije s viลกom sredinom za prodaju nakon programa.

set.seed(123)
# sales before the program
sales_before <- rnorm(7, mean = 50000, sd = 50)
# sales after the program.This has higher mean
sales_after <- rnorm(7, mean = 50075, sd = 50)
# draw the distribution
t.test(sales_before, sales_after,var.equal = TRUE)

Primjer uparenog T-testa u R

Dobili ste p-vrijednost od 0.04606, niลพu od praga od 0.05. Zakljuฤujete da su prosjeci dviju skupina znaฤajno razliฤiti. Program poboljลกava prodaju trgovina.

Rezime

  • Statistiฤko zakljuฤivanje je umijeฤ‡e generiranja zakljuฤaka o distribuciji podataka.
  • T-test pripada obitelji inferencijalne statistike. Obiฤno se koristi da bi se otkrilo postoji li statistiฤka razlika izmeฤ‘u srednjih vrijednosti dviju skupina.
  • T-test jednog uzorka ili Studentov test usporeฤ‘uje srednju vrijednost vektora s teoretskom sredinom.
  • Upareni T-test ili t-test ovisnog uzorka koristi se kada se srednja vrijednost tretirane skupine izraฤuna dvaput.

T-test moลพemo saลพeti u tablici u nastavku:

test Hipoteza za testiranje p-vrijednost Code Neobavezni argument
t-test jednog uzorka Srednja vrijednost vektora razlikuje se od teorijske sredine 0.05
t.test(x, mu = mean)
t-test uparenog uzorka Srednja vrijednost A razlikuje se od srednje vrijednosti B za istu skupinu 0.06
t.test(A,B, mu = mean)
var.equal= TRUE

Ako pretpostavimo da su varijance jednake, trebamo promijeniti parametar var.equal= TRUE.

Saลพmite ovu objavu uz: