KonuAnlatım.com

Örnekleme dağılımı

İstatistik · Bölüm 51İstatistikDers

Bu derste istatistiğin tahmin tarafının motoru olan örnekleme dağılımını sıfırdan işliyoruz: nedir, neden gerekir, nasıl hesaplanır ve nerede karşımıza çıkar. Güven aralıklarından hipotez testlerine kadar ünitedeki tüm konular bu tek fikir üzerine kurulur. Serinin tamamı için İstatistik dersleri bölümümüze bakabilirsin.

Örnekleme Dağılımı Nedir?

Bir popülasyondan aynı büyüklükte (n birimli) çok sayıda örnek çektiğimizi ve her örnekten aynı istatistiği, örneğin ortalamayı hesapladığımızı düşünelim. Değerler örnekten örneğe değişir: bir örneklemin ortalaması 172, bir başkasınınki 169 çıkar. İşte bu tüm olası değerlerin olasılık dağılımına örnekleme dağılımı denir. Tanım olarak: bir istatistiğin, aynı popülasyondan aynı büyüklükteki tüm olası örnekler üzerinden elde edilen değerlerinin dağılımıdır.

Buradaki anahtar düşünce şudur: örneğe hangi birimlerin gireceği şansa bağlı olduğu için, örneklemden hesaplanan ortalama da rastgele bir değişkendir. Ama bu rastgelelik kuralsız bir dağınıklık değildir; değerlerin nerede toplandığını ve ne kadar yayıldığını önceden söyleyebiliriz. Örnekleme dağılımı tam olarak bu düzenin haritasıdır.

Üç Dağılımı Ayırt Edin: Popülasyon, Örneklem, Örnekleme

Yeni başlayanların en sık karıştırdığı nokta budur, çünkü aynı anda üç farklı dağılımla çalışıyoruz:

  • Popülasyon dağılımı: İlgilendiğimiz tüm birimlerin değerlerinin dağılımı. Parametreleri μ (ortalama) ve σ (standart sapma) ile gösterilir.
  • Örneklem dağılımı: Elimizdeki tek bir örneklemin verilerinin dağılımı; çizdiğimiz histogramın ta kendisi. İstatistikleri x̄ ve s ile gösterilir.
  • Örnekleme dağılımı: Tüm olası örneklerden hesaplanan bir istatistiğin değerlerinin dağılımı. Merkezi μ, yayılımı ise standart hatadır.

Somutlaştıralım: Bir okuldaki tüm öğrencilerin boyları popülasyon dağılımıdır. Bu okuldan seçtiğimiz 30 öğrencinin boyları tek bir örneklem verisidir. Her seferinde 30 kişilik yeni bir örnek çekip ortalama alacak olsak, elde edeceğimiz ortalama değerlerinin dağılımı ise örnekleme dağılımıdır.

Örneklem İstatistiklerinin Örnekleme Dağılımı

Örneklem ortalamasının örnekleme dağılımı

En sık kullanılan hâli, örneklem ortalaması x̄'nin dağılımıdır. Bu dağılımın iki temel özelliği vardır:

  1. Merkez: Tüm olası x̄ değerlerinin ortalaması popülasyon ortalamasına eşittir: E(x̄) = μ. Ortalama bu anlamda yansız bir istatistiktir.
  2. Yayılım: x̄ değerlerinin standart sapmasına standart hata denir ve σ/√n formülüyle hesaplanır. n büyüdükçe standart hata küçülür, çünkü √n paydayı büyütür.

Zar örneğiyle görelim. Tek bir zarın gösterebildiği sayıların popülasyonu 1'den 6'ya uzanır ve ortalaması 3,5'tir. Tek zar atıp ortalamayı hesaplarsak 1 ile 6 arasında her sonucu eşit olasılıkla alırız. Oysa dört zar atıp ortalamalarını aldığımızda sonuçlar yine 1 ile 6 arasında ama artık 3,5'in çevresinde toplanır; 1,25 ya da 5,75 gibi uç değerler nadiren görülür. Zar sayısını 100'e çıkırırsak ortalamanın standart hatası σ/√n ≈ 1,71/10 ≈ 0,17'ye iner; ortalamalar çoğu zaman 3,3 ile 3,7 arasında kalır, ±2 standart hataya karşılık gelen yaklaşık 3,16 ile 3,84 bandı ise yaklaşık %95 olasılıkla yakalanır. Ortalama alındıkça dağılımın daralıp merkeze toplanması, örnekleme dağılımının özüdür.

Peki bu dağılımın biçimi nedir? Popülasyon normale yakınsa x̄'nin örnekleme dağılımı da her n için normaldir. Popülasyon çarpık olsa bile örneklem yeterince büyükse (kaba kural: n ≥ 30) x̄'nin örnekleme dağılımı yaklaşık normale dönüşür. Bu şaşırtıcı sonucun adı Merkezi limit teoremidir; ayrıntılarını ayrı bir derste işliyoruz.

Örneklem oranının örnekleme dağılımı

Aynı mantık oranlar için de geçerlidir. Bir ürünü kullananların oranı, bir şehri tercih edenlerin yüzdesi gibi sorularda örneklem oranı p̂ hesaplanır. Tüm olası örneklerden gelen p̂ değerlerinin dağılımının merkezi popülasyon oranıdır (E(p̂) = p) ve standart hatası √(p(1−p)/n) formülüyle bulunur. Örneklem yeterince büyüdüğünde bu dağılım da yaklaşık normaldir. Pratik kullanımı Oran için güven aralığı dersinin konusudur.

Standart Hata ile Standart Sapma Farkı

İki terim günlük dilde birbirinin yerine kullanılsa da farklı şeyleri ölçer:

  • Standart sapma (σ ya da s): Bireylerin değerlerinin ortalama etrafındaki yayılımını ölçer; popülasyonun veya tek bir örnek verinin değişkenliğidir.
  • Standart hata: Bir istatistiğin (örneğin x̄'nin) örnekten örneğe değişkenliğini ölçer; σ/√n ile hesaplanır.

Sayısal fark da büyüktür: σ = 20 ve n = 100 için bireylerin standart sapması 20'dir ama ortalamanın standart hatası yalnızca 20/√100 = 2'dir. Yani 100 kişilik bir örneklemde hesaplanan ortalama, tek bir bireyin değerinden çok daha güvenilirdir. Bu güvenilirlik fikri, Nokta tahmini dersindeki yansızlık ve etkinlik kavramlarının da temelidir.

Sık Yapılan Hatalar ve Yanılgılar

Aşağıdaki yanılgılar bu konuda en sık karşılaştığımız hatalardır; sınavdan önce bir daha gözden geçirin:

  • Örneklemin histogramını örnekleme dağılımı sanmak: 30 kişilik örneklemin grafiği örneklem dağılımıdır; örnekleme dağılımı ise tüm olası 30 kişilik örneklerden hesaplanan ortalama değerlerinin dağılımıdır.
  • Standart hatayı standart sapma sanmak: Standart hata bireylerin değil, ortalamanın kendi değişkenliğidir ve her zaman σ'dan küçük ya da ona eşittir.
  • n büyüdükçe dağılımın genişlediğini sanmak: Tersi doğrudur; σ/√n gereği n büyüdükçe standart hata küçülür ve dağılım merkeze sıkışır.
  • Örnekleme dağılımını kurmak için tüm örnekleri gerçekten çekmek gerektiğini düşünmek: Bu teorik bir dağılımdır; pratikte biçimini Merkezi limit teoremi ve standart hata formülüyle biliriz.
  • Küçük örneklemin ortalamasının hemen normal olduğunu varsaymak: n küçükse ve popülasyon güçlü biçimde çarpıksa x̄'nin dağılımı normal olmayabilir; n ≥ 30 kuralı ya da popülasyonun normalliği gerekir.

Bu Konu Ünitede Nereye Bağlanır?

Örnekleme dağılımı, bu ünitedeki tüm yöntemlerin motorudur. Popülasyon ortalamasını tek bir değerle tahmin etmek Nokta tahmini konusudur; bu tahminin çevresine güvenilir bir aralık çizmek Ortalama için güven aralığı dersinin, genel çerçevesi ise Güven aralığı dersinin konusudur. Popülasyon hakkında bir iddianın veriyle uyumlu olup olmadığını sınamak ise hipotez testlerinin işidir; o bölüme Hipotez nedir? yazısıyla, testin başlangıç varsayımını oluşturan Sıfır hipotezi konusuyla devam edebilirsin. Bu yöntemlerin tamamı x̄'nin örnekleme dağılımını bilmeden doğru kurulamaz; bu yüzden bu ders ünitenin temel taşıdır.

Sık Sorulan Sorular

Örnekleme dağılımı nedir?

Aynı popülasyondan aynı büyüklükte çekilen tüm olası örneklerden hesaplanan bir istatistiğin (örneğin örneklem ortalamasının) olasılık dağılımıdır. İstatistiğin örnekten örneğe nasıl değişeceğini tanımlar.

Örnekleme dağılımı ile örneklem dağılımı arasındaki fark nedir?

Örneklem dağılımı eldeki tek bir örneklemin verilerinin dağılımıdır. Örnekleme dağılımı ise tüm olası örneklerden hesaplanan istatistik değerlerinin dağılımıdır; biri veriyi, diğeri istatistiğin değişkenliğini anlatır.

Standart hata nasıl hesaplanır?

Örneklem ortalaması için standart hata, popülasyon standart sapmasının örneklem büyüklüğünün kareköküne bölünmesiyle bulunur: σ/√n. Örneklem büyüdükçe standart hata küçülür.

Dersler

Tümü →