İçeriğe geç
Educora
Üniversite32 dk81 / 82

İstatistiksel çıkarım: tahmin ve hipotez testi

Örneklemden anakütleye: tahmin ediciler, ortalama için güven aralıkları, p-değeri, anlamlılık düzeyi ve I./II. tip hatalarla hipotez testi, t-testi, korelasyon ve en küçük kareler yöntemiyle doğrusal regresyon.

Kendini test et
Bu derste öğreneceklerin
  • Bir örneklemden ortalama ve varyansın yansız tahminlerini hesaplamak
  • Ortalama için bir güven aralığı kurmak ve doğru yorumlamak
  • z- veya t-testi yapmak ve p-değerini doğru yorumlamak
  • Korelasyon katsayısını ve en küçük kareler regresyon doğrusunu bulmak

Bir seçimden önce anket şirketi 1000 kişiye soruyor ve “%52 ± %3” sonucunu açıklıyor. Bir çay fabrikası ürettiği milyonlarca paketin hepsini değil, 30'unu tartıyor. Bir öğretmen yeni yöntemin puanları gerçekten artırıp artırmadığını, yoksa sınıfın yalnızca şanslı mı olduğunu merak ediyor. İstatistiksel çıkarım bu tür soruları yanıtlar: rastgele bir örneklemden bütün anakütle hakkında nasıl güvenilir bir sonuca varılır ve bu sonuçtan ne kadar emin olabiliriz.

Anakütle, örneklem ve tahmin ediciler

Tanım
Anakütle ve örneklem

Anakütle, ilgilendiğimiz nesnelerin tamamıdır (tüm seçmenler, tüm paketler). Örneklem ise gerçekten ölçtüğümüz kısımdır; her nesnenin seçilme şansı eşit olsun diye rastgele olmalıdır. Anakütleyi tanımlayan sayılar (μ, σ, p) parametre, örneklemden hesaplanan ve parametreleri tahmin eden sayılar (x̄, s, p̂) ise istatistik olarak adlandırılır.

x̄ = (x₁ + x₂ + … + xₙ) / n, s² = ∑(xᵢ − x̄)² / (n − 1)x̄ = (x₁ + x₂ + … + xₙ) / n, s² = ∑(xᵢ − x̄)² / (n − 1)
burada:
  • x̄örneklem ortalaması, μ'yü tahmin eder
  • s²örneklem varyansı, σ²'yi tahmin eder
  • sörneklem standart sapması
  • nörneklem büyüklüğü

İki tahmin edici de yansızdır: tüm olası örneklemler üzerinden ortalama alınınca E(x̄) = μ ve E(s²) = σ².

Neden n − 1? Sapmalar, aynı verilere uydurulmuş x̄'den ölçülür; bu yüzden ortalamada biraz küçük çıkar. Sapmaların toplamı her zaman 0'dır, yani bunlardan yalnızca n − 1 tanesi serbesttir (serbestlik derecesi). n yerine n − 1'e bölmek bu yanlılığı tam olarak düzeltir.

Beş paket çay

Bir pakette 100 g çay olmalı. Beş paketin kütlesi 98, 102, 101, 97 ve 102 g. x̄, s² ve s'yi bulun.

Çözümü göster
x̄ = (98 + 102 + 101 + 97 + 102)/5 = 500/5 = 100 g.
Sapmalar: −2, 2, 1, −3, 2 (toplam 0 ✓); kareleri: 4, 4, 1, 9, 4, toplam 22.
s² = 22/(5 − 1) = 5,5 g², s = √5,5 ≈ 2,35 g.
5'e bölseydik 4,4 g² bulur ve yayılımı olduğundan küçük gösterirdik.

Ortalama için güven aralıkları

Tek bir x̄ sayısı μ'yü hiçbir zaman tam olarak bulmaz. Güven aralığı, örneklemlerin %95'inde μ'yü kapsayacak biçimde kurulan bir aralıktır. Merkezi limit teoremine göre x̄ ≈ N(μ, σ²/n) olduğundan μ, 0,95 olasılıkla x̄'den en fazla 1,96 standart hata uzaktadır.

x̄ ± z* · σ/√nx̄ ± z* · σ/√n
burada:
  • z*kritik değer: %90 için 1,645, %95 için 1,96, %99 için 2,576
  • σ/√nσ/√nortalamanın standart hatası
  • σanakütlenin bilinen standart sapması

σ bilindiğinde (ya da n büyükse; o zaman σ yerine s alınabilir) kullanılır.

x̄ ± t* · s/√n, df = n − 1x̄ ± t* · s/√n, df = n − 1
burada:
  • t*n − 1 serbestlik dereceli Student t dağılımının kritik değeri
  • sörneklem standart sapması

σ bilinmediğinde, özellikle küçük örneklemlerde kullanılır: t dağılımının kuyrukları normal dağılımınkinden kalındır, bu yüzden aralık daha geniştir.

Güven düzeyiz*t* (df = 4)t* (df = 9)t* (df = 29)
%901,6452,1321,8331,699
%951,9602,7762,2622,045
%992,5764,6043,2502,756
İki yönlü aralıklar için kritik değerler. n büyüdükçe t*, z*'a yaklaşır.
Günlük ders çalışma süresi

36 öğrencilik rastgele bir örneklemde günlük ortalama ders çalışma süresi x̄ = 2,4 saat; önceki anketlerden σ = 0,9 saat biliniyor. μ ortalaması için %95 güven aralığı kurun.

Çözümü göster
Standart hata: σ/√n = 0,9/√36 = 0,9/6 = 0,15 saat.
Hata payı: 1,96 · 0,15 ≈ 0,29 saat.
Aralık: 2,4 ± 0,29, yani [2,11; 2,69] saat.
Yorum: burada kullanılan yöntem örneklemlerin %95'inde gerçek ortalamayı yakalar.
Küçük örneklem: t aralığı

Çay paketlerinin ortalama kütlesi için %95 güven aralığı kurun (n = 5, x̄ = 100 g, s ≈ 2,35 g).

Çözümü göster
σ bilinmiyor ve n küçük; bu yüzden df = 4 ile t kullanırız: t* = 2,776.
Standart hata: s/√n = 2,345/√5 ≈ 1,049 g.
Hata payı: 2,776 · 1,049 ≈ 2,91 g.
Aralık: [97,09; 102,91] g. 100 g'ı içerir, yani veriler etiketle çelişmez; ama n küçük olduğu için aralık geniştir.

Hipotez testi

  1. 1
    Hipotezleri yaz

    Sıfır hipotezi H₀, “özel bir şey yok” iddiasıdır (μ = 500 g, yöntemin etkisi yok). Alternatif hipotez H₁ ise şüphelendiğimiz durumdur (μ < 500 g, yöntem işe yarıyor).

  2. 2
    Anlamlılık düzeyini seç

    α, doğru bir H₀'ı yanlışlıkla reddetme riskidir; genellikle α = 0,05 (bazen 0,01).

  3. 3
    Test istatistiğini hesapla

    Verilerin H₀'dan standart hata biriminde ne kadar uzak olduğunu ölçer; örneğin z veya t.

  4. 4
    p-değerini bul

    H₀ doğruyken gözlenen kadar ya da ondan daha uç bir sonuç elde etme olasılığı.

  5. 5
    Karar ver

    p ≤ α ise H₀ reddedilir (sonuç istatistiksel olarak anlamlıdır). p > α ise H₀ reddedilmez: veriler yeterince güçlü kanıt değildir; ama bu, H₀'ın doğru olduğunu kanıtlamaz.

z = (x̄ − μ₀) / (σ/√n), t = (x̄ − μ₀) / (s/√n)z = (x̄ − μ₀) / (σ/√n), t = (x̄ − μ₀) / (s/√n)
burada:
  • μ₀H₀'ın iddia ettiği ortalama
  • zσ bilindiğinde test istatistiği (normal dağılım)
  • tσ bilinmediğinde: n − 1 serbestlik dereceli t dağılımı
Ekmekler hafif mi?

Bir fırın, ekmeklerinin ortalama 500 g olduğunu iddia ediyor, σ = 12 g. Bir denetçi 36 ekmek tartıyor ve x̄ = 495 g buluyor. α = 0,05 düzeyinde ekmeklerin iddia edilenden hafif olup olmadığını test edin.

Çözümü göster
H₀: μ = 500 g; H₁: μ < 500 g (tek yönlü test).
z = (495 − 500)/(12/√36) = −5/2 = −2,5.
p-değeri = P(Z ≤ −2,5) = 1 − Φ(2,5) = 1 − 0,9938 ≈ 0,006.
p ≈ 0,006 < 0,05 olduğundan H₀ reddedilir: veriler, ekmeklerin ortalamada 500 g'dan hafif olduğuna dair güçlü bir kanıttır.
Not: 5 g tek bir ekmek için küçük bir farktır, ama 36 ekmekte standart hata yalnızca 2 g'dır.
KararH₀ doğruH₀ yanlış
H₀ reddedilirI. tip hata (olasılığı α)Doğru karar (testin gücü 1 − β)
H₀ reddedilmezDoğru kararII. tip hata (olasılığı β)
Daha küçük α daha az yanlış alarm ama daha çok kaçırılan etki demektir; örneklemi büyütmek iki hatayı da azaltır.

t-testi. σ bilinmediğinde yerine s konur ve t, Student t dağılımıyla (df = n − 1) karşılaştırılır. İki örneklem t-testi, örneğin yeni ve eski yöntemle ders gören sınıflar gibi iki grubun ortalamalarını karşılaştırır: ortalamalar arasındaki fark, kendi standart hatasına bölünür. t dağılımını 1908'de, Dublin'deki Guinness bira fabrikasında çalışan William Gosset “Student” takma adıyla yayımladı.

Korelasyon ve doğrusal regresyon

r = ∑(xᵢ − x̄)(yᵢ − ȳ) / √(∑(xᵢ − x̄)² · ∑(yᵢ − ȳ)²)r = ∑(xᵢ − x̄)(yᵢ − ȳ) / √(∑(xᵢ − x̄)² · ∑(yᵢ − ȳ)²)
burada:
  • rPearson korelasyon katsayısı, −1 ≤ r ≤ 1
  • r ≈ ±1noktalar neredeyse bir doğru üzerindedir
  • r ≈ 0doğrusal ilişki yok

ŷ = b₀ + b₁x regresyon doğrusu en küçük kareler yöntemiyle seçilir: dikey hataların karelerinin toplamı olan S(b₀, b₁) = ∑(yᵢ − b₀ − b₁xᵢ)² ifadesini en küçük yapar. ∂S/∂b₀ ve ∂S/∂b₁ kısmi türevleri sıfıra eşitlenirse iki doğrusal denklem (normal denklemler) elde edilir; çözümleri şudur:

b₁ = ∑(xᵢ − x̄)(yᵢ − ȳ) / ∑(xᵢ − x̄)², b₀ = ȳ − b₁ · x̄b₁ = ∑(xᵢ − x̄)(yᵢ − ȳ) / ∑(xᵢ − x̄)², b₀ = ȳ − b₁ · x̄
burada:
  • b₁eğim: x 1 arttığında y'deki ortalama değişim
  • b₀sabit terim (x = 0 iken ŷ)
  • ŷtahmin edilen değer

Doğru her zaman (x̄, ȳ) noktasından geçer; r² ise y'deki değişkenliğin doğru tarafından açıklanan payıdır.

Çalışma saatleri ve puanlar

Beş öğrenci: çalışma saatleri x = 1, 2, 3, 4, 5 ve test puanları y = 52, 58, 65, 70, 80. Regresyon doğrusunu ve r'yi bulun, 6 saat için puanı tahmin edin.

Çözümü göster
x̄ = 3, ȳ = 325/5 = 65.
x − x̄: −2, −1, 0, 1, 2; y − ȳ: −13, −7, 0, 5, 15.
∑(x − x̄)(y − ȳ) = 26 + 7 + 0 + 5 + 30 = 68; ∑(x − x̄)² = 10; ∑(y − ȳ)² = 169 + 49 + 0 + 25 + 225 = 468.
b₁ = 68/10 = saat başına 6,8 puan, b₀ = 65 − 6,8 · 3 = 44,6; yani ŷ = 44,6 + 6,8x.
r = 68/√(10 · 468) ≈ 68/68,41 ≈ 0,994, r² ≈ 0,99.
Tahmin: ŷ(6) = 44,6 + 40,8 = 85,4 puan.
Etkileşimli
Simülasyon yükleniyor…
En küçük kareler doğrusu ŷ = 44,6 + 6,8x (a = b₀, b = b₁). (1, 52), (2, 58), (3, 65), (4, 70), (5, 80) noktalarının yakınından geçer; başka herhangi bir a veya b, hata kareleri toplamını 5,6'dan büyük yapar.
Python
import numpy as np
from scipy import stats

tea = np.array([98, 102, 101, 97, 102])
se = tea.std(ddof=1) / np.sqrt(len(tea))
low, high = stats.t.interval(0.95, df=4, loc=tea.mean(), scale=se)
print(round(low, 2), round(high, 2))

t, p = stats.ttest_1samp(tea, 103)
print(round(t, 3), round(p, 3))

hours = [1, 2, 3, 4, 5]
score = [52, 58, 65, 70, 80]
b1, b0 = np.polyfit(hours, score, 1)
print(round(b1, 2), round(b0, 2), round(np.corrcoef(hours, score)[0, 1], 3))
▸ Beklenen çıktı
97.09 102.91
-2.86 0.046
6.8 44.6 0.994
scipy örnekleri kontrol eder: çay paketleri için t aralığı, H₀: μ = 103 g için t-testi (t = −2,86, p = 0,046: α = 0,05'te reddedilir, α = 0,01'de reddedilmez) ve r ile birlikte regresyon doğrusu.

Önemli noktalar

  • x̄ ve s² = ∑(xᵢ − x̄)²/(n − 1), μ ve σ²'nin yansız tahmin edicileridir; örneklem rastgele olmalıdır.
  • %95 güven aralığı: x̄ ± 1,96σ/√n; σ bilinmiyorsa x̄ ± t*·s/√n.
  • p ≤ α ise H₀ reddedilir; p-değeri H₀'ın doğru olma olasılığı değildir.
  • I. tip hata: doğru H₀'ı reddetmek (α); II. tip hata: yanlış H₀'ı kabul etmek (β).
  • Regresyon: b₁ = ∑(x − x̄)(y − ȳ)/∑(x − x̄)², b₀ = ȳ − b₁x̄; doğru (x̄, ȳ)'den geçer.
  • r yalnızca doğrusal ilişkiyi ölçer ve korelasyon nedensellik anlamına gelmez.

Kendini test et

10 soru. Her doğru cevap XP kazandırır.

1 / 10
n = 100, x̄ = 50, σ = 10. μ için %95 güven aralığı nedir?