- Вычислять несмещённые оценки среднего и дисперсии по выборке
- Строить доверительный интервал для среднего и правильно его толковать
- Проводить z- или t-тест и правильно понимать p-значение
- Находить коэффициент корреляции и линию регрессии методом наименьших квадратов
Перед выборами социологи опрашивают 1000 человек и сообщают: «52% ± 3%». Чайная фабрика взвешивает 30 пачек, а не все миллионы, которые выпускает. Учитель хочет понять, действительно ли новый метод повысил баллы или классу просто повезло. На такие вопросы отвечают статистические выводы: как по случайной выборке сделать надёжное заключение обо всей генеральной совокупности и насколько в нём можно быть уверенным.
Генеральная совокупность, выборка и оценки
Генеральная совокупность — всё множество интересующих нас объектов (все избиратели, все пачки). Выборка — та часть, которую мы реально измеряем; она должна быть случайной, чтобы у каждого объекта был одинаковый шанс попасть в неё. Числа, описывающие генеральную совокупность (μ, σ, p), — параметры; числа, вычисленные по выборке (x̄, s, p̂), — статистики, они служат оценками параметров.
- x̄выборочное среднее, оценка μ
- s²исправленная выборочная дисперсия, оценка σ²
- sвыборочное среднеквадратическое отклонение
- nобъём выборки
Обе оценки несмещённые: в среднем по всем возможным выборкам M(x̄) = μ и M(s²) = σ².
Почему n − 1? Отклонения отсчитываются от x̄, подогнанного по тем же данным, поэтому в среднем они получаются чуть меньше, чем надо. Сумма отклонений всегда равна 0, так что свободны лишь n − 1 из них (число степеней свободы). Деление на n − 1 вместо n в точности устраняет это смещение.
В пачке должно быть 100 г чая. Масса пяти пачек: 98, 102, 101, 97 и 102 г. Найдите x̄, s² и s.
Показать решениеСкрыть решение
Отклонения: −2, 2, 1, −3, 2 (сумма 0 ✓); квадраты: 4, 4, 1, 9, 4, сумма 22.
s² = 22/(5 − 1) = 5,5 г², s = √5,5 ≈ 2,35 г.
Деление на 5 дало бы 4,4 г² и занизило бы разброс.
Доверительные интервалы для среднего
Одно число x̄ никогда точно не попадает в μ. Доверительный интервал — промежуток, построенный так, что в 95% выборок он накрывает μ. По центральной предельной теореме x̄ ≈ N(μ, σ²/n), поэтому с вероятностью 0,95 μ отстоит от x̄ не более чем на 1,96 стандартной ошибки.
- z*критическое значение: 1,645 для 90%, 1,96 для 95%, 2,576 для 99%
- σ/√nσ/√nстандартная ошибка среднего
- σизвестное среднеквадратическое отклонение генеральной совокупности
Применяется, когда σ известно (или n велико — тогда вместо σ можно брать s).
- t*критическое значение распределения Стьюдента с n − 1 степенями свободы
- sвыборочное среднеквадратическое отклонение
Применяется, когда σ неизвестно, особенно для малых выборок: у распределения Стьюдента «хвосты» тяжелее, чем у нормального, поэтому интервал шире.
| Уровень доверия | z* | t* (df = 4) | t* (df = 9) | t* (df = 29) |
|---|---|---|---|---|
| 90% | 1,645 | 2,132 | 1,833 | 1,699 |
| 95% | 1,960 | 2,776 | 2,262 | 2,045 |
| 99% | 2,576 | 4,604 | 3,250 | 2,756 |
В случайной выборке из 36 студентов среднее время учёбы в день x̄ = 2,4 часа; по прошлым опросам σ = 0,9 ч. Постройте 95%-й доверительный интервал для среднего μ.
Показать решениеСкрыть решение
Предельная погрешность: 1,96 · 0,15 ≈ 0,29 ч.
Интервал: 2,4 ± 0,29, то есть [2,11; 2,69] ч.
Смысл: применённый метод накрывает истинное среднее в 95% выборок.
Постройте 95%-й доверительный интервал для средней массы пачек чая (n = 5, x̄ = 100 г, s ≈ 2,35 г).
Показать решениеСкрыть решение
Стандартная ошибка: s/√n = 2,345/√5 ≈ 1,049 г.
Погрешность: 2,776 · 1,049 ≈ 2,91 г.
Интервал: [97,09; 102,91] г. Он содержит 100 г, так что данные не противоречат этикетке, но интервал широк, потому что n мало.
Проверка статистических гипотез
- 1Сформулируй гипотезы
Нулевая гипотеза H₀ — утверждение «ничего особенного нет» (μ = 500 г, метод не действует). Альтернативная H₁ — то, что мы подозреваем (μ < 500 г, метод помогает).
- 2Выбери уровень значимости
α — допустимый риск ошибочно отвергнуть верную H₀; обычно α = 0,05 (иногда 0,01).
- 3Вычисли статистику критерия
Она показывает, насколько данные удалены от H₀ в единицах стандартной ошибки, например z или t.
- 4Найди p-значение
Вероятность при верной H₀ получить результат, не менее «крайний», чем наблюдаемый.
- 5Прими решение
Если p ≤ α, H₀ отвергают (результат статистически значим). Если p > α, H₀ не отвергают: данных недостаточно для вывода, но это не доказывает, что H₀ верна.
- μ₀среднее, утверждаемое гипотезой H₀
- zстатистика критерия при известном σ (нормальное распределение)
- tпри неизвестном σ: распределение Стьюдента с n − 1 степенями свободы
Пекарня утверждает, что средняя масса её батонов 500 г, σ = 12 г. Инспектор взвесил 36 батонов и получил x̄ = 495 г. Проверьте при α = 0,05, легче ли батоны, чем заявлено.
Показать решениеСкрыть решение
z = (495 − 500)/(12/√36) = −5/2 = −2,5.
p-значение = P(Z ≤ −2,5) = 1 − Φ(2,5) = 1 − 0,9938 ≈ 0,006.
p ≈ 0,006 < 0,05, значит, H₀ отвергаем: данные убедительно говорят, что батоны в среднем легче 500 г.
Заметим: 5 г — мелочь для одного батона, но для 36 батонов стандартная ошибка всего 2 г.
| Решение | H₀ верна | H₀ неверна |
|---|---|---|
| H₀ отвергнута | Ошибка I рода (вероятность α) | Верное решение (мощность 1 − β) |
| H₀ не отвергнута | Верное решение | Ошибка II рода (вероятность β) |
t-критерий. Если σ неизвестно, его заменяют на s и сравнивают t с распределением Стьюдента (df = n − 1). Двухвыборочный t-критерий сравнивает средние двух групп, например классов, обучавшихся по новому и старому методу: разность средних делят на её стандартную ошибку. Распределение опубликовал в 1908 году Уильям Госсет, работавший на пивоварне Guinness в Дублине, под псевдонимом «Стьюдент».
Корреляция и линейная регрессия
- rкоэффициент корреляции Пирсона, −1 ≤ r ≤ 1
- r ≈ ±1точки лежат почти на одной прямой
- r ≈ 0линейной связи нет
Линию регрессии ŷ = b₀ + b₁x выбирают методом наименьших квадратов: она минимизирует сумму квадратов вертикальных отклонений S(b₀, b₁) = ∑(yᵢ − b₀ − b₁xᵢ)². Приравняв к нулю частные производные ∂S/∂b₀ и ∂S/∂b₁, получаем два линейных уравнения (нормальные уравнения); их решение:
- b₁угловой коэффициент: среднее изменение y при росте x на 1
- b₀свободный член (ŷ при x = 0)
- ŷпредсказанное значение
Прямая всегда проходит через точку (x̄; ȳ), а r² — доля изменчивости y, объяснённая прямой.
Пять студентов: часы учёбы x = 1, 2, 3, 4, 5 и баллы за тест y = 52, 58, 65, 70, 80. Найдите линию регрессии и r, предскажите балл при 6 часах.
Показать решениеСкрыть решение
x − x̄: −2, −1, 0, 1, 2; y − ȳ: −13, −7, 0, 5, 15.
∑(x − x̄)(y − ȳ) = 26 + 7 + 0 + 5 + 30 = 68; ∑(x − x̄)² = 10; ∑(y − ȳ)² = 169 + 49 + 0 + 25 + 225 = 468.
b₁ = 68/10 = 6,8 балла за час, b₀ = 65 − 6,8 · 3 = 44,6, то есть ŷ = 44,6 + 6,8x.
r = 68/√(10 · 468) ≈ 68/68,41 ≈ 0,994, r² ≈ 0,99.
Прогноз: ŷ(6) = 44,6 + 40,8 = 85,4 балла.
import numpy as np
from scipy import stats
tea = np.array([98, 102, 101, 97, 102])
se = tea.std(ddof=1) / np.sqrt(len(tea))
low, high = stats.t.interval(0.95, df=4, loc=tea.mean(), scale=se)
print(round(low, 2), round(high, 2))
t, p = stats.ttest_1samp(tea, 103)
print(round(t, 3), round(p, 3))
hours = [1, 2, 3, 4, 5]
score = [52, 58, 65, 70, 80]
b1, b0 = np.polyfit(hours, score, 1)
print(round(b1, 2), round(b0, 2), round(np.corrcoef(hours, score)[0, 1], 3))▸ Ожидаемый результат
97.09 102.91 -2.86 0.046 6.8 44.6 0.994
Главное
- x̄ и s² = ∑(xᵢ − x̄)²/(n − 1) — несмещённые оценки μ и σ²; выборка должна быть случайной.
- 95%-й доверительный интервал: x̄ ± 1,96σ/√n, а при неизвестном σ — x̄ ± t*·s/√n.
- H₀ отвергают при p ≤ α; p-значение — не вероятность того, что H₀ верна.
- Ошибка I рода — отвергнуть верную H₀ (α); ошибка II рода — принять неверную H₀ (β).
- Регрессия: b₁ = ∑(x − x̄)(y − ȳ)/∑(x − x̄)², b₀ = ȳ − b₁x̄; прямая проходит через (x̄; ȳ).
- r измеряет только линейную связь, а корреляция не означает причинности.
Проверь себя
Вопросов: 10. Каждый правильный ответ приносит XP.