Перейти к содержанию
Educora
Средний30 мин22 / 68

Числовые характеристики данных

Способы отбора выборки, таблицы частот и гистограммы (относительная частота / ширина интервала), среднее, медиана, мода и процентили, размах, дисперсия и стандартное отклонение, как их меняет y = ax + b, чтение диаграмм «ствол — листья» и столбчатых диаграмм.

Проверь себя
В этом уроке ты узнаешь
  • Составлять стратифицированную и систематическую выборки и знать, что вероятность попасть в выборку равна n/N.
  • Читать таблицы частот и гистограммы (относительная частота / ширина интервала) и оценивать по ним среднее, моду и медиану.
  • Вычислять среднее, медиану, моду, процентили, размах, дисперсию и стандартное отклонение, в том числе для y = ax + b и для объединения двух групп.
  • Читать диаграммы «ствол — листья» и столбчатые диаграммы и сравнивать стабильность двух наборов данных.

Айсель и Эльвин тренируются в одном стрелковом клубе. За пять выстрелов Айсель набрала 7, 8, 8, 9, 8 очков, а Эльвин — 6, 10, 7, 9, 8: у обоих в среднем по 8 очков, но на соревнования тренер может отправить только одного. Одно среднее этот вопрос не решает — нужно ещё число, которое показывает, насколько стабильны результаты. Этот урок охватывает пункт программы «Числовые характеристики данных: среднее, дисперсия и др.»: как берут выборку, как группируют данные в таблицы и гистограммы и какие числа описывают центр и разброс данных. Сама случайность — тема урока «Классическая вероятность», а колоколообразная кривая, которую часто образуют сгруппированные данные, изучается в уроке «Нормальное распределение».

Генеральная совокупность, выборка и способы отбора

Определение
Генеральная совокупность, единица, выборка, объём выборки

Генеральная совокупность — всё множество объектов, которые мы хотим изучить (например, все 1200 учеников школы); каждый объект — её единица. Выборка — часть совокупности, которую действительно измеряют; число её элементов — объём выборки n. Выборку изучают, чтобы судить обо всей совокупности, поэтому её нужно брать случайно, и она должна хорошо представлять совокупность.

  • Простая случайная выборка (简单随机抽样): у каждой единицы — и даже у каждой группы из n единиц — одинаковый шанс попасть в выборку. Её получают жеребьёвкой (методом лотереи) или с помощью случайных чисел; она подходит для небольших совокупностей без явных групп.
  • Стратифицированная (расслоенная) выборка (分层随机抽样): совокупность делят на непересекающиеся, заметно различающиеся группы (слои) — классы, возрастные группы, цеха — и из каждого слоя берут простую случайную выборку, пропорциональную его численности.
  • Систематическая выборка (系统抽样): N единиц нумеруют и делят на n равных частей, шаг k = N/n. В первой части случайно выбирают начало l (1 ≤ l ≤ k), затем берут номера l, l + k, l + 2k, …
  • При всех трёх способах каждая единица попадает в выборку с одной и той же вероятностью n/N — любимый вопрос CSCA.
nᵢ = n · Nᵢ / Nnᵢ = n · Nᵢ / N
где:
  • nᵢчисло единиц, взятых из i-го слоя
  • Nᵢчисленность i-го слоя
  • n, Nобъём выборки и численность совокупности

Пропорциональное распределение: доля n/N одинакова во всех слоях и равна вероятности того, что данная единица попадёт в выборку.

Разобранные примеры: выборка

1) В старшей школе 500 учеников 10-го класса, 400 — 11-го и 300 — 12-го. Берут стратифицированную выборку из 60 учеников. Сколько учеников берут из каждого класса?
2) На заводе три цеха: 600, 400 и 200 рабочих. В стратифицированную выборку попали 15 рабочих первого цеха. Каков объём выборки?
3) 800 учеников пронумерованы 001–800, систематической выборкой отбирают 40. В первой группе выпал номер 007. Каков пятый номер и какова вероятность того, что данный ученик попадёт в выборку?

Показать решение
1) Доля 60/1200 = 1/20: 500/20 = 25, 400/20 = 20, 300/20 = 15 (проверка: 25 + 20 + 15 = 60).
2) 15/600 = 1/40 — одна и та же доля для всех цехов, поэтому n = 1200/40 = 30.
3) k = 800/40 = 20, номера: 007, 027, 047, 067, 087. Каждый ученик попадает в выборку с вероятностью 40/800 = 1/20.

Таблицы частот и гистограммы

Когда значений много, их группируют. Находят размах (разность наибольшего и наименьшего значений), выбирают ширину интервала и число интервалов и считают, сколько значений попало в каждый интервал: это частота fᵢ (频数). Разделив её на объём выборки, получают относительную частоту fᵢ/n (频率). Сумма частот равна n, а сумма относительных частот — 1: быстрая проверка любой таблицы.

Определение
Гистограмма относительных частот (频率分布直方图)

Диаграмма сгруппированных данных: интервалы стоят вплотную на горизонтальной оси, а высота каждого столбца равна относительной частоте, делённой на ширину интервала. Поэтому площадь столбца равна относительной частоте интервала, а сумма площадей всех столбцов равна 1.

wᵢ = hᵢ · d, (h₁ + h₂ + … + hₖ) · d = 1, x̄ ≈ m₁w₁ + m₂w₂ + … + mₖwₖ
где:
  • hᵢвысота i-го столбца (относительная частота / ширина интервала)
  • dширина интервала
  • wᵢотносительная частота i-го интервала (площадь столбца)
  • mᵢсередина i-го интервала

Оценки по гистограмме: среднее ≈ Σ середина интервала × относительная частота; мода ≈ середина самого высокого столбца; медиана — точка x, левее которой площадь равна 0,5.

относительная частота / ширина интервала0,0050,0100,0200,025a405060708090100балл
Баллы 200 учеников (ширина интервала 10). Площадь каждого столбца = высота × 10 = относительная частота интервала.
Разобранные примеры: чтение гистограммы

Гистограмма выше показывает тестовые баллы 200 учеников.
1) Найдите a.
2) Сколько учеников набрали 80 баллов и больше?
3) Оцените среднее, моду и медиану баллов.

Показать решение
1) Вся площадь равна 1: (0,005 + 0,010 + 0,020 + a + 0,025 + 0,010) · 10 = 1, т. е. 0,070 + a = 0,1 и a = 0,030.
2) Относительная частота [80; 100]: (0,025 + 0,010) · 10 = 0,35; 0,35 · 200 = 70 учеников.
3) Относительные частоты: 0,05; 0,1; 0,2; 0,3; 0,25; 0,1.
Среднее ≈ 45 · 0,05 + 55 · 0,1 + 65 · 0,2 + 75 · 0,3 + 85 · 0,25 + 95 · 0,1 = 2,25 + 5,5 + 13 + 22,5 + 21,25 + 9,5 = 74.
Мода ≈ середина самого высокого столбца = 75.
Медиана: левее 70 площадь 0,05 + 0,1 + 0,2 = 0,35; в интервале [70; 80) высотой 0,03 нужно добрать 0,15: 0,15 ÷ 0,03 = 5, значит, медиана ≈ 70 + 5 = 75.
Задание в стиле CSCA: медиана по гистограмме

Рост 400 учеников показан на гистограмме относительных частот с интервалами [150; 160), [160; 170), [170; 180), [180; 190] (в см). Высоты столбцов: 0,02; 0,04; 0,03 и 0,01. Оцените медиану роста.
A) 165 см B) 167,5 см C) 168 см D) 170 см

Показать решение
Относительные частоты: 0,2; 0,4; 0,3; 0,1. Левее 160 площадь 0,2, в интервале [160; 170) нужно добрать 0,3: 0,3 ÷ 0,04 = 7,5. Медиана ≈ 160 + 7,5 = 167,5 см (B).
A — это мода (середина самого высокого столбца), C — оценка среднего (155 · 0,2 + 165 · 0,4 + 175 · 0,3 + 185 · 0,1 = 168), а D — лишь граница интервала, на которой накопленная площадь впервые превышает 0,5.

Меры центра: среднее, медиана, мода и процентили

Определение
Среднее, медиана, мода

Среднее x̄ (平均数) — сумма значений, делённая на их число. Медиана (中位数) — серединное значение данных, упорядоченных по возрастанию (при чётном числе значений — среднее двух серединных). Мода (众数) — значение, которое встречается чаще всего; мод может быть несколько.

x̄ = (x₁ + x₂ + … + xₙ)/n, x̄ = (x₁f₁ + x₂f₂ + … + xₖfₖ)/nx̄ = (x₁ + x₂ + … + xₙ)/n, x̄ = (x₁f₁ + x₂f₂ + … + xₖfₖ)/n
где:
  • xᵢзначения (во второй формуле — различные значения)
  • fᵢих частоты, f₁ + … + fₖ = n
  • nчисло всех значений

Вторая форма (среднее взвешенное) применяется для таблицы частот или столбчатой диаграммы. Помни и другое: сумма всех значений = n · x̄.

Разобранные примеры: среднее, медиана, мода

1) Найдите среднее, медиану и моду данных 7, 3, 9, 5, 9, 12, 4, 9, 5.
2) В опросе 40 учеников назвали число книг, прочитанных за прошлый месяц: 0 книг — 4 ученика, 1 — 10, 2 — 12, 3 — 8, 4 — 6. Найдите среднее, медиану и моду.
3) Среднее шести чисел равно 8. Число 13 убрали. Каково среднее оставшихся пяти?

Показать решение
1) Сумма 63, x̄ = 63/9 = 7. По возрастанию: 3, 4, 5, 5, 7, 9, 9, 9, 12; пятое значение — медиана: 7. Мода — 9 (три раза).
2) x̄ = (0 · 4 + 1 · 10 + 2 · 12 + 3 · 8 + 4 · 6)/40 = 82/40 = 2,05. Медиана — среднее 20-го и 21-го значений; накопленные частоты 4, 14, 26, поэтому оба равны 2: медиана 2. Мода — 2 (12 учеников).
3) Сумма была 6 · 8 = 48; без 13 остаётся 35, новое среднее 35/5 = 7.
Определение
Процентиль (百分位数)

p-й процентиль — такое значение, что примерно p% данных не больше его, а примерно (100 − p)% — не меньше его. 50-й процентиль — это медиана; 25-й и 75-й процентили — нижний и верхний квартили. Китайские учебники (и CSCA) вычисляют его по правилу ниже.

  1. 1
    Упорядочь

    Расположи n значений по возрастанию: x₁ ≤ x₂ ≤ … ≤ xₙ.

  2. 2
    Вычисли i

    Найди i = n · p%.

  3. 3
    i — не целое

    Округли i вверх до ближайшего целого j; процентиль — j-е значение xⱼ.

  4. 4
    i — целое

    Процентиль — среднее i-го и (i + 1)-го значений: (xᵢ + xᵢ₊₁)/2.

Разобранные примеры: процентили

Рост 12 учеников (в см, уже по возрастанию): 152, 155, 158, 160, 161, 163, 165, 166, 168, 170, 172, 175. Найдите 1) 25-й процентиль, 2) 80-й процентиль, 3) 50-й процентиль.

Показать решение
1) i = 12 · 25% = 3 — целое: (x₃ + x₄)/2 = (158 + 160)/2 = 159 см.
2) i = 12 · 80% = 9,6 — не целое, j = 10: x₁₀ = 170 см.
3) i = 12 · 50% = 6: (x₆ + x₇)/2 = (163 + 165)/2 = 164 см — как и должно быть, это медиана.
Задание в стиле CSCA: процентиль

Чему равен 70-й процентиль данных 12, 15, 18, 20, 21, 24, 25, 28, 30, 35?
A) 25 B) 28 C) 26,5 D) 24,5

Показать решение
Данные упорядочены, n = 10: i = 10 · 70% = 7 — целое, поэтому процентиль равен (x₇ + x₈)/2 = (25 + 28)/2 = 26,5 (C).
A берёт только x₇ — это правило для нецелого i; B сразу берёт x₈; D усредняет x₆ и x₇ — ошибка в счёте.

Меры разброса: размах, дисперсия и стандартное отклонение

У Айсель и Эльвина одинаковое среднее, но разный разброс. Простейшая мера — размах (极差): наибольшее значение минус наименьшее; он находится быстро, но зависит лишь от двух значений. Дисперсия (方差) учитывает все значения: это среднее квадратов отклонений от среднего. Квадратный корень из неё — стандартное отклонение (标准差) — измеряется в тех же единицах, что и данные. Чем меньше дисперсия, тем стабильнее (кучнее) данные.

R = xₘₐₓ − xₘᵢₙ, s² = [(x₁ − x̄)² + (x₂ − x̄)² + … + (xₙ − x̄)²]/n = (x₁² + x₂² + … + xₙ²)/n − x̄², s = √s²R = xₘₐₓ − xₘᵢₙ, s² = [(x₁ − x̄)² + (x₂ − x̄)² + … + (xₙ − x̄)²]/n = (x₁² + x₂² + … + xₙ²)/n − x̄², s = √s²
где:
  • Rразмах (极差)
  • s²дисперсия (方差)
  • sстандартное отклонение (标准差), в единицах данных
  • xᵢ − x̄отклонение значения от среднего

Китайские школьные учебники, а значит, и CSCA делят на n. (В вузовской статистике используют и «выборочную дисперсию» с делением на n − 1; здесь она не нужна.) Вторая форма — среднее квадратов минус квадрат среднего — быстрее, когда x̄ не целое.

Разобранные примеры: дисперсия и стандартное отклонение

1) Айсель: 7, 8, 8, 9, 8; Эльвин: 6, 10, 7, 9, 8. Найдите размах и дисперсию каждого. Кто стабильнее?
2) Найдите дисперсию и стандартное отклонение данных 2, 4, 4, 4, 5, 5, 7, 9.
3) У десяти чисел среднее 5 и дисперсия 4. Чему равна сумма их квадратов?

Показать решение
1) Оба средних равны 8. Айсель: отклонения −1, 0, 0, 1, 0; s² = (1 + 0 + 0 + 1 + 0)/5 = 0,4, размах 9 − 7 = 2. Эльвин: отклонения −2, 2, −1, 1, 0; s² = (4 + 4 + 1 + 1 + 0)/5 = 2, размах 10 − 6 = 4. Результаты Айсель стабильнее, тренер отправляет Айсель.
2) x̄ = 40/8 = 5; квадраты отклонений 9, 1, 1, 1, 0, 0, 4, 16, сумма 32; s² = 32/8 = 4, s = 2.
3) Из s² = (Σxᵢ²)/n − x̄²: Σxᵢ² = n(s² + x̄²) = 10 · (4 + 25) = 290.
yᵢ = axᵢ + b ⇒ ȳ = a·x̄ + b, sy² = a²·sx², sy = |a|·sx
где:
  • aкоэффициент масштаба
  • bсдвиг
  • x̄, sx²среднее и дисперсия исходных данных
  • ȳ, sy²среднее и дисперсия новых данных

Медиана, мода и процентили меняются так же, как среднее (при a > 0); размах и стандартное отклонение умножаются на |a|. Сдвиг b разброс никогда не меняет.

Разобранные примеры: y = ax + b

1) У данных среднее 6 и дисперсия 4. Каждое значение x заменили на 3x − 2. Найдите новое среднее, дисперсию и стандартное отклонение.
2) Каждое значение набора данных уменьшили на 5. Как изменятся среднее и дисперсия?
3) Среднесуточная температура имеет среднее 20 °C и стандартное отклонение 5 °C. В градусах Фаренгейта F = 1,8C + 32. Найдите среднее, стандартное отклонение и дисперсию в °F.

Показать решение
1) ȳ = 3 · 6 − 2 = 16; sy² = 3² · 4 = 36; sy = 3 · 2 = 6.
2) Среднее уменьшится на 5; дисперсия не изменится (a = 1).
3) Среднее: 1,8 · 20 + 32 = 68 °F; стандартное отклонение: 1,8 · 5 = 9 °F; дисперсия: 9² = 81.
Задание в стиле CSCA: ax + b

У данных x₁, x₂, …, x₁₀ среднее 5 и стандартное отклонение 2. Каковы среднее и дисперсия данных 2x₁ − 1, 2x₂ − 1, …, 2x₁₀ − 1?
A) 9 и 16 B) 9 и 4 C) 9 и 15 D) 10 и 8

Показать решение
Среднее: 2 · 5 − 1 = 9. Дисперсия x равна 2² = 4, новая дисперсия 2² · 4 = 16 (A).
B — это новое стандартное отклонение (2 · 2 = 4), а не дисперсия; C вычитает 1 и из дисперсии, хотя сдвиг её не меняет; D забывает −1 в среднем и умножает дисперсию на a вместо a².
w̄ = (m·x̄ + n·ȳ)/(m + n), s² = {m·[s₁² + (x̄ − w̄)²] + n·[s₂² + (ȳ − w̄)²]}/(m + n)w̄ = (m·x̄ + n·ȳ)/(m + n), s² = {m·[s₁² + (x̄ − w̄)²] + n·[s₂² + (ȳ − w̄)²]}/(m + n)
где:
  • m, nчисленности двух групп (слоёв)
  • x̄, s₁²среднее и дисперсия первой группы
  • ȳ, s₂²среднее и дисперсия второй группы
  • w̄, s²среднее и дисперсия всех m + n значений

Применяется для стратифицированных выборок: каждая группа вносит свою дисперсию плюс квадрат расстояния от своего среднего до общего. Общая дисперсия — никогда не просто взвешенное среднее s₁² и s₂².

Разобранные примеры: объединение двух групп

1) Средний рост 30 мальчиков — 170 см, 20 девочек — 160 см. Найдите средний рост всех 50 учеников.
2) Группа A: 30 значений, среднее 60, дисперсия 20. Группа B: 20 значений, среднее 70, дисперсия 30. Найдите среднее и дисперсию всех 50 значений.

Показать решение
1) w̄ = (30 · 170 + 20 · 160)/50 = (5100 + 3200)/50 = 166 см (не 165: мальчиков больше).
2) w̄ = (30 · 60 + 20 · 70)/50 = 64. s² = [30 · (20 + 4²) + 20 · (30 + 6²)]/50 = (30 · 36 + 20 · 66)/50 = (1080 + 1320)/50 = 48. (Взвешенное среднее дисперсий (30 · 20 + 20 · 30)/50 = 24 слишком мало: оно не учитывает разрыв между средними.)

Чтение диаграмм «ствол — листья» и столбчатых диаграмм

В диаграмме «ствол — листья» (茎叶图) каждое значение делят на ствол (здесь цифра десятков) и лист (цифра единиц): строка 7 | 0 3 3 3 8 означает 70, 73, 73, 73, 78. В отличие от гистограммы она сохраняет все исходные значения, а листья обычно записаны по возрастанию, поэтому медиану, моду и размах можно прочитать сразу. Две группы часто сравнивают двусторонней диаграммой: общие стволы посередине, листья одной группы слева, другой — справа.

Ствол (десятки)Листья (единицы)
58
62 5 7
70 3 3 3 8
81 4 6 9
90 5
Баллы 15 учеников одного класса: 58, 62, 65, …, 95.
Задание в стиле CSCA: диаграмма «ствол — листья»

Какое утверждение верно для диаграммы «ствол — листья» выше?
A) Медиана равна 78
B) Мода равна 73, размах — 37
C) 80-й процентиль равен 86
D) Баллов 80 и выше — 5

Показать решение
n = 15, медиана — 8-е значение: 58, 62, 65, 67, 70, 73, 73, 73 → 73, а не 78 (A неверно). Мода 73 (три раза), размах 95 − 58 = 37: верно B.
C: i = 15 · 80% = 12 — целое, поэтому 80-й процентиль равен (x₁₂ + x₁₃)/2 = (86 + 89)/2 = 87,5. D: в строках 8 и 9 — 4 + 2 = 6 баллов, а не 5.

Столбчатая диаграмма (条形图) показывает количество (или долю в процентах) для каждой категории или каждого отдельного значения. Между столбцами есть промежутки, и читают их высоту, а не площадь. Столбчатая диаграмма числовых значений — это просто таблица частот в виде рисунка: считай с неё частоты и находи среднее взвешенное. Не путай её с гистограммой, у которой столбцы примыкают друг к другу, а смысл несёт площадь.

Интерактив
Загрузка симуляции…
Среднее, медиана, мода, размах, дисперсия (VAR.P делит на n, как в CSCA) и стандартное отклонение — в реальном времени.

Как об этом спрашивает CSCA

  • Выборка: сколько единиц из каждого слоя (nᵢ = n · Nᵢ/N), объём выборки по одному слою, k-й номер при систематическом отборе и «каждая единица попадает с вероятностью n/N».
  • Гистограммы: неизвестная высота из «вся площадь = 1», перевод площадей в количества, оценка среднего (по серединам), моды (самый высокий столбец) и медианы (площадь 0,5).
  • Центр и процентили: медиана и мода списка, неизвестное значение по среднему (сумма = n · x̄), p-й процентиль по i = n · p%.
  • Разброс: дисперсия короткого списка, «какая группа стабильнее?» (меньшая дисперсия), среднее и дисперсия ax + b, объединение двух групп.
  • Диаграммы: чтение диаграммы «ствол — листья» или столбчатой диаграммы — обычно в форме «какое утверждение верно?».
Термин (по-английски)中文Pinyin
генеральная совокупность — population总体zǒngtǐ
выборка / объём выборки — sample / sample size样本 / 样本量yàngběn / yàngběnliàng
простая случайная выборка — simple random sampling简单随机抽样jiǎndān suíjī chōuyàng
стратифицированная выборка — stratified sampling分层随机抽样fēncéng suíjī chōuyàng
частота / относительная частота — frequency / relative frequency频数 / 频率pínshù / pínlǜ
гистограмма — histogram频率分布直方图pínlǜ fēnbù zhífāngtú
ширина интервала — class width组距zǔjù
среднее — mean平均数píngjūnshù
медиана — median中位数zhōngwèishù
мода — mode众数zhòngshù
процентиль — percentile百分位数bǎifēnwèishù
размах — range极差jíchā
дисперсия / стандартное отклонение — variance / standard deviation方差 / 标准差fāngchā / biāozhǔnchā
диаграмма «ствол — листья» — stem-and-leaf plot茎叶图jīngyètú
столбчатая диаграмма — bar chart条形图tiáoxíngtú
CSCA можно сдавать на английском или китайском, поэтому учи оба названия.

Главное

  • Стратифицированная выборка: nᵢ = n · Nᵢ/N; при любом способе отбора каждая единица попадает в выборку с вероятностью n/N.
  • Гистограмма: высота = относительная частота ÷ ширина интервала, поэтому каждая площадь — относительная частота, а сумма площадей равна 1.
  • По гистограмме: среднее ≈ Σ середина × относительная частота, мода ≈ середина самого высокого столбца, медиана — точка, левее которой площадь 0,5.
  • p-й процентиль: i = n · p%; не целое → округли вверх; целое → среднее i-го и (i + 1)-го значений по возрастанию.
  • s² = Σ(xᵢ − x̄)²/n = (Σxᵢ²)/n − x̄²; чем меньше дисперсия, тем стабильнее данные.
  • y = ax + b: ȳ = a·x̄ + b, sy² = a²·sx²; сдвиг никогда не меняет разброс.

Проверь себя

Вопросов: 12. Каждый правильный ответ приносит XP.

1 / 12
Что показывает площадь столбца гистограммы относительных частот?

Тематический тест: 20 вопросов · 25 мин

Урок пройден? Проверьте себя тестом на время по этой теме.

Начать тест