Ulush gipotezasini tekshirish (chap tomonlama)
Bosh to‘plam ulushi — bosh to‘plamning muayyan kategoriyaga tegishli qismi.
Gipoteza testlari o‘sha bosh to‘plam ulushining kattaligi haqidagi da’voni tekshirish uchun ishlatiladi.
Ulush gipotezasini tekshirish
Gipoteza testi uchun quyidagi bosqichlardan foydalaniladi:
- Shartlarni tekshirish
- Da’volarni aniqlash
- Ahamiyatlilik darajasini tanlash
- Test statistikasini hisoblash
- Xulosa
Masalan:
- Bosh to‘plam: Nobel mukofoti sovrindorlari
- Kategoriya: Amerika Qo‘shma Shtatlarida tug‘ilganlar
Va biz quyidagi da’voni tekshirmoqchimiz:
"Less than 45% of Nobel Prize winners were born in the US"
Tasodifiy tanlangan 40 nafar Nobel mukofoti sovrindoridan iborat tanlanma olib, quyidagini aniqlashimiz mumkin:
10 out of 40 Nobel Prize winners in the sample were born in the US
U holda tanlanma ulushi: \(\displaystyle \frac{10}{40} = 0.25\), ya’ni 25%.
Bu tanlanma ma’lumotlari asosida da’voni quyidagi bosqichlar orqali tekshiramiz.
1. Shartlarni tekshirish
Ulush uchun ishonch oralig‘ini hisoblash shartlari:
- Tanlanma tasodifiy tanlangan
- Faqat ikkita variant bor:
- Kategoriyaga tegishli bo‘lish
- Kategoriyaga tegishli bo‘lmaslik
- Tanlanmada kamida quyidagilar bo‘lishi kerak:
- Kategoriyaga tegishli 5 ta a’zo
- Kategoriyaga tegishli bo‘lmagan 5 ta a’zo
Misolimizda tasodifiy tanlanganlardan 10 kishi AQShda tug‘ilgan.
Qolganlari AQShda tug‘ilmagan, shuning uchun boshqa kategoriyada 30 kishi bor.
Bu holda shartlar bajarilgan.
Eslatma: Har bir kategoriyada 5 tadan a’zo bo‘lmasa ham, gipoteza testini o‘tkazish mumkin. Lekin buning uchun maxsus tuzatishlar kiritish kerak.
2. Da’volarni aniqlash
Tekshirilayotgan da’vo asosida nol gipoteza (\(H_{0}\)) va muqobil gipotezani (\(H_{1}\)) aniqlashimiz kerak.
Da’vo quyidagicha edi:
"Less than 45% of Nobel Prize winners were born in the US"
Bu holda parametr — AQShda tug‘ilgan Nobel mukofoti sovrindorlarining ulushi (\(p\)).
U holda nol va muqobil gipotezalar:
Null hypothesis: 45% of Nobel Prize winners were born in the US.
Alternative hypothesis: Less than 45% of Nobel Prize winners were born in the US.
Buni belgilar yordamida quyidagicha ifodalash mumkin:
\(H_{0}\): \(p = 0.45 \)
\(H_{1}\): \(p < 0.45 \)
Bu "chap tomonlama" test, chunki muqobil gipoteza ulush nol gipotezadagidan kamroq ekanini da’vo qiladi.
Agar ma’lumotlar muqobil gipotezani qo‘llab-quvvatlasa, nol gipotezani rad etamiz va muqobil gipotezani qabul qilamiz.
3. Ahamiyatlilik darajasini tanlash
Ahamiyatlilik darajasi (\(\alpha\)) — gipoteza testida nol gipotezani rad etayotganda biz qabul qiladigan noaniqlik.
Ahamiyatlilik darajasi — tasodifan noto‘g‘ri xulosa chiqarish ehtimolligining foizdagi ifodasi.
Odatiy ahamiyatlilik darajalari:
- \(\alpha = 0.1\) (10%)
- \(\alpha = 0.05\) (5%)
- \(\alpha = 0.01\) (1%)
Ahamiyatlilik darajasi pastroq bo‘lsa, nol gipotezani rad etish uchun ma’lumotlardagi dalillar kuchliroq bo‘lishi kerak.
"To‘g‘ri" ahamiyatlilik darajasi degan narsa yo‘q — u faqat xulosaning noaniqligini ko‘rsatadi.
Eslatma: 5% ahamiyatlilik darajasi shuni anglatadiki, nol gipotezani rad etganimizda:
Biz 100 martadan 5 tasida to‘g‘ri nol gipotezani rad etishimizni kutamiz.
4. Test statistikasini hisoblash
Test statistikasi gipoteza testining natijasini aniqlash uchun ishlatiladi.
Test statistikasi — tanlanmadan hisoblangan standartlashtirilgan qiymat.
Bosh to‘plam ulushi uchun test statistikasining (TS) formulasi:
\(\displaystyle \frac{\hat{p} - p}{\sqrt{p(1-p)}} \cdot \sqrt{n} \)
\(\hat{p}-p\) — tanlanma ulushi (\(\hat{p}\)) bilan da’vo qilingan bosh to‘plam ulushi (\(p\)) orasidagi farq.
\(n\) — tanlanma hajmi.
Misolimizda:
The claimed (\(H_{0}\)) population proportion (\(p\)) was \( 0.45 \)
The sample proportion (\(\hat{p}\)) was 10 out of 40, or: \(\displaystyle \frac{10}{40} = 0.25\)
The sample size (\(n\)) was \(40\)
Demak, test statistikasi (TS):
\(\displaystyle \frac{0.25-0.45}{\sqrt{0.45(1-0.45)}} \cdot \sqrt{40} = \frac{-0.2}{\sqrt{0.45(0.55)}} \cdot \sqrt{40} = \frac{-0.2}{\sqrt{0.2475}} \cdot \sqrt{40} \approx \frac{-0.2}{0.498} \cdot 6.325 = \underline{-2.543}\)
Test statistikasini dasturlash tili funksiyalari yordamida ham hisoblashingiz mumkin:
Misol
Python’da ulush uchun test statistikasini hisoblash uchun scipy va math kutubxonalaridan foydalaning.
import scipy.stats as stats
import math
# Specify the number of occurrences (x), the sample size (n), and the proportion claimed in the null-hypothesis (p)
x = 10
n = 40
p = 0.45
# Calculate the sample proportion
p_hat = x/n
# Calculate and print the test statistic
print((p_hat-p)/(math.sqrt((p*(1-p))/(n))))
O‘zingiz sinab ko‘ring »
Misol
R’da ulush uchun test statistikasini hisoblash uchun o‘rnatilgan matematik funksiyalardan foydalaning.
# Specify the sample occurrences (x), the sample size (n), and the null-hypothesis claim (p)
x <- 10
n <- 40
p <- 0.45
# Calculate the sample proportion
p_hat = x/n
# Calculate and output the test statistic
(p_hat-p)/(sqrt((p*(1-p))/(n)))
O‘zingiz sinab ko‘ring »
5. Xulosa chiqarish
Gipoteza testi bo‘yicha xulosa chiqarishning ikkita asosiy yondashuvi bor:
- Kritik qiymat yondashuvi test statistikasini ahamiyatlilik darajasining kritik qiymati bilan taqqoslaydi.
- P-qiymat yondashuvi test statistikasining P-qiymatini ahamiyatlilik darajasi bilan taqqoslaydi.
Eslatma: Ikki yondashuv faqat xulosani qanday taqdim etishi bilan farq qiladi.
Kritik qiymat yondashuvi
Kritik qiymat yondashuvi uchun ahamiyatlilik darajasining (\(\alpha\)) kritik qiymatini (CV) topishimiz kerak.
Bosh to‘plam ulushi testida kritik qiymat (CV) — standart normal taqsimotdan olingan Z-qiymat.
Bu kritik Z-qiymat (CV) test uchun rad etish sohasini belgilaydi.
Rad etish sohasi — standart normal taqsimot dumlaridagi ehtimollik sohasi.
Da’vo bosh to‘plam ulushi 45% dan kamroq ekani haqida bo‘lgani uchun rad etish sohasi chap dumda joylashgan:
Rad etish sohasining kattaligi ahamiyatlilik darajasi (\(\alpha\)) bilan belgilanadi.
Ahamiyatlilik darajasini (\(\alpha\)) 0.01, ya’ni 1% deb tanlab, kritik Z-qiymatni Z-jadvaldan yoki dasturlash tili funksiyasi yordamida topishimiz mumkin:
Misol
Python’da chap dumda \(\alpha\) = 0.01 uchun Z-qiymatni topish uchun Scipy Stats kutubxonasining norm.ppf() funksiyasidan foydalaning.
import scipy.stats as stats
print(stats.norm.ppf(0.01))
O‘zingiz sinab ko‘ring »
Misol
R’da chap dumda \(\alpha\) = 0.01 uchun Z-qiymatni topish uchun o‘rnatilgan qnorm() funksiyasidan foydalaning.
qnorm(0.01)
O‘zingiz sinab ko‘ring »
Istalgan usul yordamida kritik Z-qiymat \(\approx \underline{-2.3264}\) ga teng ekanini topishimiz mumkin
Chap tomonlama test uchun test statistikasi (TS) kritik qiymatdan (CV) kichik ekanini tekshirishimiz kerak.
Agar test statistikasi kritik qiymatdan kichik bo‘lsa, test statistikasi rad etish sohasida bo‘ladi.
Test statistikasi rad etish sohasida bo‘lsa, nol gipotezani (\(H_{0}\)) rad etamiz.
Bu yerda test statistikasi (TS) \(\approx \underline{-2.543}\) ga, kritik qiymat esa \(\approx \underline{-2.3264}\) ga teng edi
Mana bu testning grafikdagi tasviri:
Test statistikasi kritik qiymatdan kichik bo‘lgani uchun nol gipotezani rad etamiz.
Bu tanlanma ma’lumotlari muqobil gipotezani qo‘llab-quvvatlashini bildiradi.
Xulosani quyidagicha umumlashtirishimiz mumkin:
The sample data supports the claim that "less than 45% of Nobel Prize winners were born in the US" at a 1% significance level.
P-qiymat yondashuvi
P-qiymat yondashuvi uchun test statistikasining (TS) P-qiymatini topishimiz kerak.
Agar P-qiymat ahamiyatlilik darajasidan (\(\alpha\)) kichik (smaller) bo‘lsa, nol gipotezani (\(H_{0}\)) rad etamiz.
Test statistikasi \( \approx \underline{-2.543} \) ga teng ekani aniqlangan edi
Bosh to‘plam ulushi testida test statistikasi — standart normal taqsimotdan olingan Z-qiymat.
Bu chap tomonlama test bo‘lgani uchun -2.543 dan kichik Z-qiymatning P-qiymatini topishimiz kerak.
P-qiymatni Z-jadval yordamida yoki dasturlash tili funksiyasi orqali topishimiz mumkin:
Misol
Python’da -2.543 dan kichik Z-qiymatning P-qiymatini topish uchun Scipy Stats kutubxonasining norm.cdf() funksiyasidan foydalaning:
import scipy.stats as stats
print(stats.norm.cdf(-2.543))
O‘zingiz sinab ko‘ring »
Misol
R’da -2.543 dan kichik Z-qiymatning P-qiymatini topish uchun o‘rnatilgan pnorm() funksiyasidan foydalaning:
pnorm(-2.543)
O‘zingiz sinab ko‘ring »
Istalgan usul yordamida P-qiymat \(\approx \underline{0.0055}\) ga teng ekanini topishimiz mumkin
Bu nol gipotezani rad etish uchun ahamiyatlilik darajasi (\(\alpha\)) 0.0055 dan, ya’ni 0.55% dan katta bo‘lishi kerakligini ko‘rsatadi.
Mana bu testning grafikdagi tasviri:
Bu P-qiymat odatiy ahamiyatlilik darajalarining (10%, 5%, 1%) har biridan kichik.
Shuning uchun bu ahamiyatlilik darajalarining barchasida nol gipoteza rad etiladi.
Xulosani quyidagicha umumlashtirishimiz mumkin:
The sample data supports the claim that "less than 45% of Nobel Prize winners were born in the US" at a 10%, 5%, and 1% significance level.
Gipoteza testi uchun P-qiymatni dasturlash yordamida hisoblash
Ko‘plab dasturlash tillari gipoteza testi natijasini aniqlash uchun P-qiymatni hisoblay oladi.
Statistikalarni hisoblash uchun dasturiy ta’minot va dasturlashdan foydalanish katta ma’lumotlar to‘plamlarida ko‘proq uchraydi, chunki qo‘lda hisoblash qiyinlashadi.
Bu yerda hisoblangan P-qiymat nol gipotezani rad etish mumkin bo‘lgan eng past ahamiyatlilik darajasini ko‘rsatadi.
Misol
Python’da ulush uchun chap tomonlama gipoteza testining P-qiymatini hisoblash uchun scipy va math kutubxonalaridan foydalaning.
Bu yerda tanlanma hajmi 40 ga, uchrashlar soni 10 ga teng, test esa ulush 0.45 dan kichik ekanini tekshiradi.
import scipy.stats as stats
import math
# Specify the number of occurrences (x), the sample size (n), and the proportion claimed in the null-hypothesis (p)
x = 10
n = 40
p = 0.45
# Calculate the sample proportion
p_hat = x/n
# Calculate the test statistic
test_stat = (p_hat-p)/(math.sqrt((p*(1-p))/(n)))
# Output the p-value of the test statistic (left tailed test)
print(stats.norm.cdf(test_stat))
O‘zingiz sinab ko‘ring »
Misol
R’da ulush uchun chap tomonlama gipoteza testining P-qiymatini topish uchun o‘rnatilgan prop.test() funksiyasidan foydalaning.
Bu yerda tanlanma hajmi 40 ga, uchrashlar soni 10 ga teng, test esa ulush 0.45 dan katta ekanini tekshiradi.
# Specify the sample occurrences (x), the sample size (n), and the null-hypothesis claim (p)
x <- 10
n <- 40
p <- 0.45
# P-value from left-tail proportion test at 0.01 significance level
prop.test(x, n, p, alternative = c("less"), conf.level = 0.99, correct = FALSE)$p.value
O‘zingiz sinab ko‘ring »
Eslatma: R kodidagi conf.level ahamiyatlilik darajasining teskarisidir.
Bu yerda ahamiyatlilik darajasi 0.01, ya’ni 1%, shuning uchun conf.level 1-0.01 = 0.99, ya’ni 99% ga teng.
Chap tomonlama va ikki tomonlama testlar
Bu chap tomonlama testga misol edi: unda muqobil gipoteza parametr nol gipoteza da’vosidan kichik ekanini da’vo qilgan.
Boshqa turlar uchun shunga o‘xshash bosqichma-bosqich qo‘llanmani bu yerda ko‘rishingiz mumkin:
W3Schools Pathfinder
Yutuqlaringizni kuzating – bu bepul!
