Uji T dalam Pemrograman R: Contoh Satu Sampel & Berpasangan
โก Ringkasan Cerdas
Uji T di R membandingkan rata-rata menggunakan fungsi t.test(), mencakup satu sampel terhadap target tetap, dua kelompok independen, dan pengukuran berulang berpasangan. Panduan ini menjalankan setiap varian, membaca nilai p dengan benar, dan memverifikasi asumsi yang mendasarinya.

Apa itu Inferensi Statistik?
Inferensi statistik adalah seni menghasilkan kesimpulan tentang distribusi data. Seorang ilmuwan data sering dihadapkan pada pertanyaan yang hanya dapat dijawab secara ilmiah. Oleh karena itu, inferensi statistik adalah strategi untuk menguji apakah suatu hipotesis benar, yaitu divalidasi oleh data.
Strategi umum untuk menilai hipotesis adalah uji-t, yang memberi tahu Anda apakah dua rata-rata sama. Uji ini juga dikenal sebagai... Tes siswaUji t dapat dihitung untuk:
- Vektor tunggal terhadap nilai tetap (uji t satu sampel)
- Dua vektor dari dua kelompok terpisah (uji t dua sampel independen)
- Dua vektor diukur pada subjek yang sama (uji t berpasangan)
Setiap uji t mengasumsikan data diambil secara acak dan bahwa nilai-nilai (atau, untuk uji berpasangan, perbedaannya) berasal dari populasi yang terdistribusi secara normal. Versi dua sampel independen juga mengasumsikan kedua kelompok tersebut independen satu sama lain, dan bentuk klasiknya mengasumsikan variansnya sama.
Apa itu T-Test dalam Pemrograman R?
Ide dasar di balik Uji-T adalah menggunakan statistik untuk mengevaluasi dua hipotesis yang berlawanan:
- H0Hipotesis nol, yaitu bahwa rata-rata populasi sama dengan nilai yang sedang diuji.
- H1: hipotesis alternatif, bahwa rata-rata populasi berbeda dari nilai tersebut
Uji t dirancang untuk ukuran sampel kecil, di mana pendekatan normal tidak dapat diandalkan. Uji ini membutuhkan data yang terdistribusi secara mendekati normal.
Sintaks Uji-T di R
Sintaks dasar untuk t.test() di R adalah:
t.test(x, y = NULL, mu = 0, var.equal = FALSE) arguments: - x : A vector to compute the one-sample t-test - y: A second vector to compute the two sample t-test - mu: Mean of the population under the null hypothesis - var.equal: Specify whether the variances of the two vectors are equal. By default, set to `FALSE` - paired: Set to `TRUE` when the two vectors are repeated measures on the same subjects
Sebelum menjalankan apa pun, sesuaikan tata letak data Anda dengan varian pengujian yang tepat.
Jenis-jenis Uji T di R
Memilih varian yang salah adalah kesalahan uji-t yang paling umum, jadi mulailah dengan mencocokkan tata letak data Anda dengan pilihan yang tepat.
| Tipe | Gunakan saat | Panggilan R |
|---|---|---|
| Satu sampel | Satu kelompok dibandingkan dengan nilai target yang diketahui. | t.test(x, mu = nilai) |
| Uji dua sampel independen (Welch) | Dua kelompok terpisah, varians mungkin tidak sama. | t.test(x, y) |
| dua sampel independen (gabungan) | Dua kelompok terpisah dengan varians yang sama | t.test(x, y, var.equal = TRUE) |
| Dipasangkan | Subjek yang sama diukur dua kali. | t.test(x, y, paired = TRUE) |
| Berat sebelah | Anda hanya peduli dengan perbedaan dalam satu arah. | t.test(x, mu = nilai, alternatif = โlebih besarโ) |
Di luar tiga kelompok, uji t tidak lagi tepat. Beralihlah ke Uji ANOVAyang menjaga tingkat kesalahan keseluruhan tetap pada 5 persen, alih-alih meningkatkannya melalui perbandingan berpasangan yang berulang.
Uji-T Satu Sampel di R
Uji t Satu Sampel, atau uji siswa, membandingkan rata-rata vektor terhadap rata-rata teoritis, . Rumus yang digunakan untuk menghitung uji-t adalah:
Di sini,
mengacu pada mean
dengan arti teoritis
- s adalah simpangan baku
- n jumlah pengamatan.
Untuk mengevaluasi signifikansi statistik uji-t, Anda perlu menghitung p-value. itu p-value berkisar dari 0 hingga 1, dan ditafsirkan sebagai berikut:
- Nilai p kurang dari 0.05 berarti Anda dapat menolak hipotesis nol. Perlu diingat bahwa menolak H0 tidak sama dengan membuktikan H1 benar, itu hanya berarti data tersebut tidak mungkin terjadi di bawah H0.
- Nilai p yang lebih tinggi dari 0.05 menunjukkan bahwa Anda tidak memiliki cukup bukti untuk menolak hipotesis nol.
Anda dapat membuat nilai p dengan melihat nilai absolut uji-t yang sesuai dalam distribusi Student dengan derajat kebebasan sama dengan
Sebagai contoh, dengan 5 pengamatan, Anda membandingkan nilai t Anda dengan distribusi Student dengan 4 derajat kebebasan pada tingkat kepercayaan 95 persen. Untuk menolak hipotesis nol dalam uji dua sisi, nilai t absolut harus melebihi 2.776.
Lihat tabel di bawah ini:
Satu Contoh Contoh Uji-T di R
Misalkan Anda adalah perusahaan yang memproduksi kue. Setiap kue seharusnya mengandung 10 gram gula. Kue-kue tersebut diproduksi oleh mesin yang menambahkan gula ke dalam mangkuk sebelum mencampurkan semuanya. Anda yakin mesin tidak menambahkan 10 gram gula untuk setiap kue. Jika asumsi Anda benar, mesin perlu diperbaiki. Anda menyimpan kadar gula dari tiga puluh kue.
Note: Anda dapat membuat vektor acak dengan fungsi rnorm(). Fungsi ini menghasilkan nilai yang terdistribusi normal. Sintaks dasarnya adalah:
rnorm(n, mean, sd) arguments - n: Number of observations to generate - mean: The mean of the distribution. Optional - sd: The standard deviation of the distribution. Optional
Anda dapat membuat distribusi dengan 30 observasi dengan mean 9.99 dan standar deviasi 0.04.
set.seed(123) sugar_cookie <- rnorm(30, mean = 9.99, sd = 0.04) head(sugar_cookie)
Keluaran:
## [1] 9.967581 9.980793 10.052348 9.992820 9.995172 10.058603
Anda dapat menggunakan uji-t satu sampel untuk memeriksa apakah kadar gulanya berbeda dengan resep. Anda dapat menggambar uji hipotesis:
- H0: Kadar gula rata-rata sama dengan 10
- H1: Rata-rata kadar gulanya berbeda dari 10
Anda menggunakan tingkat signifikansi 0.05.
# H0 : mu = 10 t.test(sugar_cookie, mu = 10)
Berikut hasilnya:
Nilai p dari uji t satu sampel adalah 0.1079, di atas ambang batas 0.05. Interval kepercayaan 95 persen untuk rata-rata berkisar dari 9.973 hingga 10.002 gram, dan mengandung nilai target 10. Oleh karena itu, Anda tidak dapat menolak H0: tidak ada cukup bukti bahwa mesin tersebut menyimpang dari resep.
Uji T Dua Sampel Independen di R
Uji t dua sampel independen adalah varian yang paling sering digunakan, dan berlaku setiap kali dua set pengukuran berasal dari subjek yang berbeda: dua toko, dua mesin, dua kelompok perlakuan.
Misalkan sebuah pabrik menjalankan dua jalur produksi dan Anda ingin mengetahui apakah keduanya mengisi stoples dengan berat yang sama.
set.seed(123) line_a <- rnorm(25, mean = 500, sd = 8) line_b <- rnorm(25, mean = 505, sd = 8) # Welch test, the safe default t.test(line_a, line_b) # Pooled test, only when the variances are equal t.test(line_a, line_b, var.equal = TRUE)
Baca hasilnya dalam empat langkah.
- t adalah ukuran standar dari selisih antara kedua nilai rata-rata. Tandanya hanya mencerminkan urutan di mana Anda memasukkan vektor-vektor tersebut.
- df adalah derajat kebebasan. Welch menghasilkan nilai pecahan; uji gabungan memberikan bilangan bulat yang sama dengan n1 + n2 โ 2.
- p-value adalah probabilitas melihat kesenjangan sebesar ini jika nilai rata-rata sebenarnya identik.
- Interval kepercayaan membatasi perbedaan sebenarnya. Jika nilainya nol, perbedaan tersebut tidak signifikan pada tingkat tersebut.
Jika data Anda berada dalam satu data frame dengan satu kolom nilai dan satu kolom faktor, gunakan antarmuka formula sebagai gantinya, yang lebih mudah dibaca dan menghindari pemisahan data secara manual:
t.test(weight ~ line, data = jars)
Versi mana yang harus digunakan. Biarkan var.equal pada nilai default FALSE kecuali Anda telah menguji dan memastikan variansnya sama. Koreksi Welch hampir tidak mengurangi daya uji ketika variansnya cocok, dan melindungi Anda ketika variansnya tidak cocok.
Uji-T berpasangan di R
Uji t berpasangan, juga disebut uji t sampel dependen, berlaku ketika kelompok yang sama diukur dua kali. Aplikasi tipikalnya adalah:
- Pengujian A / B: Bandingkan dua varian
- Studi kasus kontrolsebelum dan sesudah perawatan pada subjek yang sama
Contoh Uji T Berpasangan di R
Sebuah perusahaan minuman tertarik untuk mengetahui kinerja program diskon terhadap penjualan. Perusahaan memutuskan untuk memantau penjualan harian salah satu tokonya yang sedang dipromosikan program tersebut. Di akhir program, perusahaan ingin mengetahui apakah ada perbedaan statistik antara penjualan rata-rata toko sebelum dan sesudah program.
- perusahaan tracKami memantau penjualan setiap hari sebelum program dimulai. Ini adalah vektor pertama kami.
- Program ini dipromosikan selama satu minggu dan penjualannya dicatat setiap hari. Ini adalah vektor kedua kami.
- Anda akan melakukan uji-t untuk menilai efektivitas program. Hal ini disebut uji-t berpasangan karena nilai kedua vektor berasal dari distribusi yang sama (yaitu toko yang sama).
Pengujian hipotesisnya adalah:
- H0: Tidak ada perbedaan mean
- H1: Kedua cara tersebut berbeda
Ingatlah bahwa uji t klasik mengasumsikan varians yang tidak diketahui tetapi sama di kedua kelompok. Data sebenarnya jarang memenuhi hal itu secara tepat, dan mengabaikan perbedaan tersebut dapat mendistorsi hasilnya.
Solusinya adalah uji t Welch, yang melonggarkan asumsi kesamaan varians. R menerapkannya secara default karena var.equal bernilai FALSE kecuali Anda menentukan sebaliknya. Dalam dataset ini, kedua vektor dihasilkan dengan deviasi standar yang sama, sehingga Anda dapat dengan aman mengatur var.equal = TRUE.
Anda membuat dua vektor acak dari distribusi Gaussian dengan mean lebih tinggi untuk penjualan setelah program.
set.seed(123) # sales before the program sales_before <- rnorm(7, mean = 50000, sd = 50) # sales after the program.This has higher mean sales_after <- rnorm(7, mean = 50075, sd = 50) # draw the distribution t.test(sales_before, sales_after,var.equal = TRUE)
Nilai p adalah 0.04606, sedikit di bawah ambang batas 0.05, sehingga Anda menolak H0 dan menyimpulkan bahwa kedua rata-rata tersebut berbeda secara signifikan. Program diskon tampaknya telah meningkatkan penjualan.
โ ๏ธ Penting: Panggilan di atas membandingkan kedua vektor sebagai berikut: independen sampel. Karena kedua rangkaian data tersebut merupakan pengukuran di toko yang sama, maka kesimpulan yang benar secara statistik akan menambahkan berpasangan = TRUE:
t.test(sales_before, sales_after, paired = TRUE)
Bentuk berpasangan menguji rata-rata perbedaan harian, bukan perbedaan antara dua rata-rata. Metode ini menghilangkan variasi tingkat toko yang dimiliki oleh kedua vektor dan karenanya memiliki kekuatan statistik yang lebih besar.
Cara Memeriksa Asumsi Uji-T di R
Nilai p pada uji t hanya bermakna jika asumsinya terpenuhi. Setiap uji t memiliki pengecekan langsung.
1. Normalitas. Uji satu sampel dan dua sampel mengasumsikan nilai-nilai tersebut mendekati distribusi normal; uji berpasangan mengasumsikan bahwa perbedaan Periksa plot QQ dan konfirmasikan dengan uji Shapiro-Wilk:
qqnorm(sugar_cookie); qqline(sugar_cookie)
shapiro.test(sugar_cookie)
# for a paired design, test the differences
shapiro.test(sales_after - sales_before)
Nilai p Shapiro-Wilk di atas 0.05 berarti normalitas tidak dapat ditolak. Dengan lebih dari sekitar 30 observasi per kelompok, teorema limit pusat membuat uji t tetap kuat terhadap kemiringan sedang.
2. Varians yang sama. Hanya uji dua sampel gabungan yang membutuhkan ini. Ujilah dengan uji F:
var.test(line_a, line_b)
Nilai p di atas 0.05 mendukung kesamaan varians, yang membenarkan var.equal = TRUE.
3. Kemerdekaan. Hal ini sesuai dengan desain penelitian dan tidak dapat diuji setelahnya. Jika subjek yang sama berkontribusi pada kedua vektor, uji independen bukanlah alat yang tepat dan Anda perlu menggunakan paired = TRUE.
Ketika sebuah asumsi gagal. Untuk data yang jelas tidak berdistribusi normal dengan sampel kecil, gunakan alternatif berbasis peringkat: wilcox.test(x, y) menggantikan uji t dua sampel dan wilcox.test(x, y, paired = TRUE) menggantikan versi berpasangan. Keduanya tidak memerlukan normalitas, meskipun keduanya sedikit mengorbankan kekuatan uji ketika data sebenarnya berdistribusi normal.
Uji T di R: Poin-Poin Penting dan Referensi Uji
- Inferensi Statistik adalah seni menghasilkan kesimpulan tentang distribusi data.
- Uji-T termasuk dalam keluarga statistik inferensial. Hal ini biasanya digunakan untuk mengetahui apakah ada perbedaan statistik antara rata-rata dua kelompok.
- Uji t satu sampel, atau uji Student, membandingkan rata-rata suatu vektor dengan rata-rata teoretis.
- Uji t berpasangan, atau uji t sampel dependen, berlaku ketika kelompok yang sama diukur dua kali.
Tabel di bawah ini merangkum setiap tes yang dibahas di atas:
| uji | Hipotesis untuk diuji | p-value | Code | Argumen opsional |
|---|---|---|---|---|
| uji-t satu sampel | Rata-rata suatu vektor berbeda dengan rata-rata teoretis | 0.05 |
t.test(x, mu = mean)
|
|
| uji-t sampel berpasangan | Rata-rata A berbeda dengan rata-rata B untuk subjek yang sama. | 0.05 |
t.test(A, B, paired = TRUE) |
var.equal = TRUE
|
Jika Anda bersedia mengasumsikan varians yang sama dalam uji dua sampel independen, atur var.equal = TRUE. Biarkan pada nilai default FALSE untuk menjalankan koreksi Welch yang lebih aman.




