- Составлять стратифицированную и систематическую выборки и знать, что вероятность попасть в выборку равна n/N.
- Читать таблицы частот и гистограммы (относительная частота / ширина интервала) и оценивать по ним среднее, моду и медиану.
- Вычислять среднее, медиану, моду, процентили, размах, дисперсию и стандартное отклонение, в том числе для y = ax + b и для объединения двух групп.
- Читать диаграммы «ствол — листья» и столбчатые диаграммы и сравнивать стабильность двух наборов данных.
Айсель и Эльвин тренируются в одном стрелковом клубе. За пять выстрелов Айсель набрала 7, 8, 8, 9, 8 очков, а Эльвин — 6, 10, 7, 9, 8: у обоих в среднем по 8 очков, но на соревнования тренер может отправить только одного. Одно среднее этот вопрос не решает — нужно ещё число, которое показывает, насколько стабильны результаты. Этот урок охватывает пункт программы «Числовые характеристики данных: среднее, дисперсия и др.»: как берут выборку, как группируют данные в таблицы и гистограммы и какие числа описывают центр и разброс данных. Сама случайность — тема урока «Классическая вероятность», а колоколообразная кривая, которую часто образуют сгруппированные данные, изучается в уроке «Нормальное распределение».
Генеральная совокупность, выборка и способы отбора
Генеральная совокупность — всё множество объектов, которые мы хотим изучить (например, все 1200 учеников школы); каждый объект — её единица. Выборка — часть совокупности, которую действительно измеряют; число её элементов — объём выборки n. Выборку изучают, чтобы судить обо всей совокупности, поэтому её нужно брать случайно, и она должна хорошо представлять совокупность.
- Простая случайная выборка (
简单随机抽样): у каждой единицы — и даже у каждой группы из n единиц — одинаковый шанс попасть в выборку. Её получают жеребьёвкой (методом лотереи) или с помощью случайных чисел; она подходит для небольших совокупностей без явных групп. - Стратифицированная (расслоенная) выборка (
分层随机抽样): совокупность делят на непересекающиеся, заметно различающиеся группы (слои) — классы, возрастные группы, цеха — и из каждого слоя берут простую случайную выборку, пропорциональную его численности. - Систематическая выборка (
系统抽样): N единиц нумеруют и делят на n равных частей, шаг k = N/n. В первой части случайно выбирают начало l (1 ≤ l ≤ k), затем берут номера l, l + k, l + 2k, … - При всех трёх способах каждая единица попадает в выборку с одной и той же вероятностью n/N — любимый вопрос CSCA.
- nᵢчисло единиц, взятых из i-го слоя
- Nᵢчисленность i-го слоя
- n, Nобъём выборки и численность совокупности
Пропорциональное распределение: доля n/N одинакова во всех слоях и равна вероятности того, что данная единица попадёт в выборку.
1) В старшей школе 500 учеников 10-го класса, 400 — 11-го и 300 — 12-го. Берут стратифицированную выборку из 60 учеников. Сколько учеников берут из каждого класса?
2) На заводе три цеха: 600, 400 и 200 рабочих. В стратифицированную выборку попали 15 рабочих первого цеха. Каков объём выборки?
3) 800 учеников пронумерованы 001–800, систематической выборкой отбирают 40. В первой группе выпал номер 007. Каков пятый номер и какова вероятность того, что данный ученик попадёт в выборку?
Показать решениеСкрыть решение
2) 15/600 = 1/40 — одна и та же доля для всех цехов, поэтому n = 1200/40 = 30.
3) k = 800/40 = 20, номера: 007, 027, 047, 067, 087. Каждый ученик попадает в выборку с вероятностью 40/800 = 1/20.
Таблицы частот и гистограммы
Когда значений много, их группируют. Находят размах (разность наибольшего и наименьшего значений), выбирают ширину интервала и число интервалов и считают, сколько значений попало в каждый интервал: это частота fᵢ (频数). Разделив её на объём выборки, получают относительную частоту fᵢ/n (频率). Сумма частот равна n, а сумма относительных частот — 1: быстрая проверка любой таблицы.
频率分布直方图)Диаграмма сгруппированных данных: интервалы стоят вплотную на горизонтальной оси, а высота каждого столбца равна относительной частоте, делённой на ширину интервала. Поэтому площадь столбца равна относительной частоте интервала, а сумма площадей всех столбцов равна 1.
- hᵢвысота i-го столбца (относительная частота / ширина интервала)
- dширина интервала
- wᵢотносительная частота i-го интервала (площадь столбца)
- mᵢсередина i-го интервала
Оценки по гистограмме: среднее ≈ Σ середина интервала × относительная частота; мода ≈ середина самого высокого столбца; медиана — точка x, левее которой площадь равна 0,5.
Гистограмма выше показывает тестовые баллы 200 учеников.
1) Найдите a.
2) Сколько учеников набрали 80 баллов и больше?
3) Оцените среднее, моду и медиану баллов.
Показать решениеСкрыть решение
2) Относительная частота [80; 100]: (0,025 + 0,010) · 10 = 0,35; 0,35 · 200 = 70 учеников.
3) Относительные частоты: 0,05; 0,1; 0,2; 0,3; 0,25; 0,1.
Среднее ≈ 45 · 0,05 + 55 · 0,1 + 65 · 0,2 + 75 · 0,3 + 85 · 0,25 + 95 · 0,1 = 2,25 + 5,5 + 13 + 22,5 + 21,25 + 9,5 = 74.
Мода ≈ середина самого высокого столбца = 75.
Медиана: левее 70 площадь 0,05 + 0,1 + 0,2 = 0,35; в интервале [70; 80) высотой 0,03 нужно добрать 0,15: 0,15 ÷ 0,03 = 5, значит, медиана ≈ 70 + 5 = 75.
Рост 400 учеников показан на гистограмме относительных частот с интервалами [150; 160), [160; 170), [170; 180), [180; 190] (в см). Высоты столбцов: 0,02; 0,04; 0,03 и 0,01. Оцените медиану роста.
A) 165 см B) 167,5 см C) 168 см D) 170 см
Показать решениеСкрыть решение
A — это мода (середина самого высокого столбца), C — оценка среднего (155 · 0,2 + 165 · 0,4 + 175 · 0,3 + 185 · 0,1 = 168), а D — лишь граница интервала, на которой накопленная площадь впервые превышает 0,5.
Меры центра: среднее, медиана, мода и процентили
Среднее x̄ (平均数) — сумма значений, делённая на их число. Медиана (中位数) — серединное значение данных, упорядоченных по возрастанию (при чётном числе значений — среднее двух серединных). Мода (众数) — значение, которое встречается чаще всего; мод может быть несколько.
- xᵢзначения (во второй формуле — различные значения)
- fᵢих частоты, f₁ + … + fₖ = n
- nчисло всех значений
Вторая форма (среднее взвешенное) применяется для таблицы частот или столбчатой диаграммы. Помни и другое: сумма всех значений = n · x̄.
1) Найдите среднее, медиану и моду данных 7, 3, 9, 5, 9, 12, 4, 9, 5.
2) В опросе 40 учеников назвали число книг, прочитанных за прошлый месяц: 0 книг — 4 ученика, 1 — 10, 2 — 12, 3 — 8, 4 — 6. Найдите среднее, медиану и моду.
3) Среднее шести чисел равно 8. Число 13 убрали. Каково среднее оставшихся пяти?
Показать решениеСкрыть решение
2) x̄ = (0 · 4 + 1 · 10 + 2 · 12 + 3 · 8 + 4 · 6)/40 = 82/40 = 2,05. Медиана — среднее 20-го и 21-го значений; накопленные частоты 4, 14, 26, поэтому оба равны 2: медиана 2. Мода — 2 (12 учеников).
3) Сумма была 6 · 8 = 48; без 13 остаётся 35, новое среднее 35/5 = 7.
百分位数)p-й процентиль — такое значение, что примерно p% данных не больше его, а примерно (100 − p)% — не меньше его. 50-й процентиль — это медиана; 25-й и 75-й процентили — нижний и верхний квартили. Китайские учебники (и CSCA) вычисляют его по правилу ниже.
- 1Упорядочь
Расположи n значений по возрастанию: x₁ ≤ x₂ ≤ … ≤ xₙ.
- 2Вычисли i
Найди i = n · p%.
- 3i — не целое
Округли i вверх до ближайшего целого j; процентиль — j-е значение xⱼ.
- 4i — целое
Процентиль — среднее i-го и (i + 1)-го значений: (xᵢ + xᵢ₊₁)/2.
Рост 12 учеников (в см, уже по возрастанию): 152, 155, 158, 160, 161, 163, 165, 166, 168, 170, 172, 175. Найдите 1) 25-й процентиль, 2) 80-й процентиль, 3) 50-й процентиль.
Показать решениеСкрыть решение
2) i = 12 · 80% = 9,6 — не целое, j = 10: x₁₀ = 170 см.
3) i = 12 · 50% = 6: (x₆ + x₇)/2 = (163 + 165)/2 = 164 см — как и должно быть, это медиана.
Чему равен 70-й процентиль данных 12, 15, 18, 20, 21, 24, 25, 28, 30, 35?
A) 25 B) 28 C) 26,5 D) 24,5
Показать решениеСкрыть решение
A берёт только x₇ — это правило для нецелого i; B сразу берёт x₈; D усредняет x₆ и x₇ — ошибка в счёте.
Меры разброса: размах, дисперсия и стандартное отклонение
У Айсель и Эльвина одинаковое среднее, но разный разброс. Простейшая мера — размах (极差): наибольшее значение минус наименьшее; он находится быстро, но зависит лишь от двух значений. Дисперсия (方差) учитывает все значения: это среднее квадратов отклонений от среднего. Квадратный корень из неё — стандартное отклонение (标准差) — измеряется в тех же единицах, что и данные. Чем меньше дисперсия, тем стабильнее (кучнее) данные.
- Rразмах (
极差) - s²дисперсия (
方差) - sстандартное отклонение (
标准差), в единицах данных - xᵢ − x̄отклонение значения от среднего
Китайские школьные учебники, а значит, и CSCA делят на n. (В вузовской статистике используют и «выборочную дисперсию» с делением на n − 1; здесь она не нужна.) Вторая форма — среднее квадратов минус квадрат среднего — быстрее, когда x̄ не целое.
1) Айсель: 7, 8, 8, 9, 8; Эльвин: 6, 10, 7, 9, 8. Найдите размах и дисперсию каждого. Кто стабильнее?
2) Найдите дисперсию и стандартное отклонение данных 2, 4, 4, 4, 5, 5, 7, 9.
3) У десяти чисел среднее 5 и дисперсия 4. Чему равна сумма их квадратов?
Показать решениеСкрыть решение
2) x̄ = 40/8 = 5; квадраты отклонений 9, 1, 1, 1, 0, 0, 4, 16, сумма 32; s² = 32/8 = 4, s = 2.
3) Из s² = (Σxᵢ²)/n − x̄²: Σxᵢ² = n(s² + x̄²) = 10 · (4 + 25) = 290.
- aкоэффициент масштаба
- bсдвиг
- x̄, sx²среднее и дисперсия исходных данных
- ȳ, sy²среднее и дисперсия новых данных
Медиана, мода и процентили меняются так же, как среднее (при a > 0); размах и стандартное отклонение умножаются на |a|. Сдвиг b разброс никогда не меняет.
1) У данных среднее 6 и дисперсия 4. Каждое значение x заменили на 3x − 2. Найдите новое среднее, дисперсию и стандартное отклонение.
2) Каждое значение набора данных уменьшили на 5. Как изменятся среднее и дисперсия?
3) Среднесуточная температура имеет среднее 20 °C и стандартное отклонение 5 °C. В градусах Фаренгейта F = 1,8C + 32. Найдите среднее, стандартное отклонение и дисперсию в °F.
Показать решениеСкрыть решение
2) Среднее уменьшится на 5; дисперсия не изменится (a = 1).
3) Среднее: 1,8 · 20 + 32 = 68 °F; стандартное отклонение: 1,8 · 5 = 9 °F; дисперсия: 9² = 81.
У данных x₁, x₂, …, x₁₀ среднее 5 и стандартное отклонение 2. Каковы среднее и дисперсия данных 2x₁ − 1, 2x₂ − 1, …, 2x₁₀ − 1?
A) 9 и 16 B) 9 и 4 C) 9 и 15 D) 10 и 8
Показать решениеСкрыть решение
B — это новое стандартное отклонение (2 · 2 = 4), а не дисперсия; C вычитает 1 и из дисперсии, хотя сдвиг её не меняет; D забывает −1 в среднем и умножает дисперсию на a вместо a².
- m, nчисленности двух групп (слоёв)
- x̄, s₁²среднее и дисперсия первой группы
- ȳ, s₂²среднее и дисперсия второй группы
- w̄, s²среднее и дисперсия всех m + n значений
Применяется для стратифицированных выборок: каждая группа вносит свою дисперсию плюс квадрат расстояния от своего среднего до общего. Общая дисперсия — никогда не просто взвешенное среднее s₁² и s₂².
1) Средний рост 30 мальчиков — 170 см, 20 девочек — 160 см. Найдите средний рост всех 50 учеников.
2) Группа A: 30 значений, среднее 60, дисперсия 20. Группа B: 20 значений, среднее 70, дисперсия 30. Найдите среднее и дисперсию всех 50 значений.
Показать решениеСкрыть решение
2) w̄ = (30 · 60 + 20 · 70)/50 = 64. s² = [30 · (20 + 4²) + 20 · (30 + 6²)]/50 = (30 · 36 + 20 · 66)/50 = (1080 + 1320)/50 = 48. (Взвешенное среднее дисперсий (30 · 20 + 20 · 30)/50 = 24 слишком мало: оно не учитывает разрыв между средними.)
Чтение диаграмм «ствол — листья» и столбчатых диаграмм
В диаграмме «ствол — листья» (茎叶图) каждое значение делят на ствол (здесь цифра десятков) и лист (цифра единиц): строка 7 | 0 3 3 3 8 означает 70, 73, 73, 73, 78. В отличие от гистограммы она сохраняет все исходные значения, а листья обычно записаны по возрастанию, поэтому медиану, моду и размах можно прочитать сразу. Две группы часто сравнивают двусторонней диаграммой: общие стволы посередине, листья одной группы слева, другой — справа.
| Ствол (десятки) | Листья (единицы) |
|---|---|
| 5 | 8 |
| 6 | 2 5 7 |
| 7 | 0 3 3 3 8 |
| 8 | 1 4 6 9 |
| 9 | 0 5 |
Какое утверждение верно для диаграммы «ствол — листья» выше?
A) Медиана равна 78
B) Мода равна 73, размах — 37
C) 80-й процентиль равен 86
D) Баллов 80 и выше — 5
Показать решениеСкрыть решение
C: i = 15 · 80% = 12 — целое, поэтому 80-й процентиль равен (x₁₂ + x₁₃)/2 = (86 + 89)/2 = 87,5. D: в строках 8 и 9 — 4 + 2 = 6 баллов, а не 5.
Столбчатая диаграмма (条形图) показывает количество (или долю в процентах) для каждой категории или каждого отдельного значения. Между столбцами есть промежутки, и читают их высоту, а не площадь. Столбчатая диаграмма числовых значений — это просто таблица частот в виде рисунка: считай с неё частоты и находи среднее взвешенное. Не путай её с гистограммой, у которой столбцы примыкают друг к другу, а смысл несёт площадь.
Как об этом спрашивает CSCA
- Выборка: сколько единиц из каждого слоя (nᵢ = n · Nᵢ/N), объём выборки по одному слою, k-й номер при систематическом отборе и «каждая единица попадает с вероятностью n/N».
- Гистограммы: неизвестная высота из «вся площадь = 1», перевод площадей в количества, оценка среднего (по серединам), моды (самый высокий столбец) и медианы (площадь 0,5).
- Центр и процентили: медиана и мода списка, неизвестное значение по среднему (сумма = n · x̄), p-й процентиль по i = n · p%.
- Разброс: дисперсия короткого списка, «какая группа стабильнее?» (меньшая дисперсия), среднее и дисперсия ax + b, объединение двух групп.
- Диаграммы: чтение диаграммы «ствол — листья» или столбчатой диаграммы — обычно в форме «какое утверждение верно?».
| Термин (по-английски) | 中文 | Pinyin |
|---|---|---|
| генеральная совокупность — population | 总体 | zǒngtǐ |
| выборка / объём выборки — sample / sample size | 样本 / 样本量 | yàngběn / yàngběnliàng |
| простая случайная выборка — simple random sampling | 简单随机抽样 | jiǎndān suíjī chōuyàng |
| стратифицированная выборка — stratified sampling | 分层随机抽样 | fēncéng suíjī chōuyàng |
| частота / относительная частота — frequency / relative frequency | 频数 / 频率 | pínshù / pínlǜ |
| гистограмма — histogram | 频率分布直方图 | pínlǜ fēnbù zhífāngtú |
| ширина интервала — class width | 组距 | zǔjù |
| среднее — mean | 平均数 | píngjūnshù |
| медиана — median | 中位数 | zhōngwèishù |
| мода — mode | 众数 | zhòngshù |
| процентиль — percentile | 百分位数 | bǎifēnwèishù |
| размах — range | 极差 | jíchā |
| дисперсия / стандартное отклонение — variance / standard deviation | 方差 / 标准差 | fāngchā / biāozhǔnchā |
| диаграмма «ствол — листья» — stem-and-leaf plot | 茎叶图 | jīngyètú |
| столбчатая диаграмма — bar chart | 条形图 | tiáoxíngtú |
Главное
- Стратифицированная выборка: nᵢ = n · Nᵢ/N; при любом способе отбора каждая единица попадает в выборку с вероятностью n/N.
- Гистограмма: высота = относительная частота ÷ ширина интервала, поэтому каждая площадь — относительная частота, а сумма площадей равна 1.
- По гистограмме: среднее ≈ Σ середина × относительная частота, мода ≈ середина самого высокого столбца, медиана — точка, левее которой площадь 0,5.
- p-й процентиль: i = n · p%; не целое → округли вверх; целое → среднее i-го и (i + 1)-го значений по возрастанию.
- s² = Σ(xᵢ − x̄)²/n = (Σxᵢ²)/n − x̄²; чем меньше дисперсия, тем стабильнее данные.
- y = ax + b: ȳ = a·x̄ + b, sy² = a²·sx²; сдвиг никогда не меняет разброс.
Проверь себя
Вопросов: 12. Каждый правильный ответ приносит XP.
Тематический тест: 20 вопросов · 25 мин
Урок пройден? Проверьте себя тестом на время по этой теме.