Вероятностные закономерности получают статистическое выражение (вероятности осуществляются приближённо в виде частот, а математические ожидания — в виде средних) в силу больших чисел закона.
Простейшие приёмы статистического описания. Изучаемая совокупность из n объектов может по какому-либо качественному признаку А разбиваться на классы A1, A2, ..., Ar. Соответствующее этому разбиению статистическое распределение задаётся при помощи указания численностей (частот) n1, n2, ..., nr, (где
) отдельных классов. Вместо численностей ni часто указывают соответствующие относительные частоты (частости) hi = ni / n (удовлетворяющие, очевидно, соотношению
). Если изучению подлежит некоторый количественный признак, то его распределение в совокупности из n объектов можно задать, перечислив непосредственно наблюдённые значения признака: х1, x2, ..., xn, например, в порядке их возрастания. Однако при больших n такой способ громоздок и в то же время не выявляет отчётливо существенных свойств распределения (подробнее о способах изображения и простейших характеристиках распределения одного количественного признака см. Распределения). При сколько-либо больших n на практике обычно совсем не составляют полных таблиц наблюдённых значений xi, а исходят во всей дальнейшей работе из таблиц, содержащих лишь численности классов, получающихся при группировке наблюдённых значений по надлежаще выбранным интервалам.
Например, в первом столбце таблицы 1а даны результаты измерения 200 диаметров деталей, группированные по интервалам длиной 0,05 мм. Основная выборка соответствует нормальному ходу технологического процесса, 1-я, 2-я и 3-я выборки сделаны через некоторые промежутки времени для проверки устойчивости этого нормального хода производства. В таблице 1б результаты измерения деталей основной выборки даны при группировке по интервалам длиной 0,25 мм.
Обычно группировка по 10—20 интервалам, в каждый из которых попадает не более 15—20 % значений xi, оказывается достаточной для довольно полного выявления всех существенных свойств распределения и надёжного вычисления по групповым численностям основных характеристик распределения (см. о них ниже). Составленная по таким группированным данным гистограмма наглядно изображает распределение. Гистограмма, составленная на основе группировки с маленькими интервалами, обычно многовершинная и не отражает наглядно существенных свойств распределения.
В качестве примера на рис. 1 дана гистограмма распределения 200 диаметров, соответствующая данным первого столбца таблицы 1а, а на рис. 3 — гистограмма того же распределения (соответствующая таблица не приводится ввиду её громоздкости) при интервале 0,01 мм. С другой стороны, группировка по слишком крупным интервалам может привести к потере ясного представления о характере распределения и к грубым ошибкам при вычислении среднего и других характеристик распределения (см. таблицу 1б и соответствующую гистограмму на рис. 2).
В пределах М. с. вопрос об интервалах группировки может быть рассмотрен только с формальной стороны: полноты математического описания распределения, точности вычисления средних по сгруппированным данным и так далее. О группировке, имеющей целью выделить качественно различные группы в изучаемой совокупности, см. Статистические группировки.
При изучении совместного распределения двух признаков пользуются таблицами с двумя входами. Примером совместного распределения двух качеств, признаков может служить таблица 2а. В общем случае, когда по признаку А материал разбит на классы A1, A2, ..., Ar, а по признаку В — на классы B1, B2, ..., Bs, таблица состоит из численностей nij объектов, принадлежащих одновременно классам Ai и Bj). Суммируя их по формулам
,
,
получают численности самих классов Ai и Bj; очевидно, что
,
где n — численность всей изучаемой совокупности. В зависимости от целей дальнейшего исследования вычисляют те или иные из относительных частот
hij = nij / n, hi. = ni. / n, h.j = n..j / n, hi(j) = nij / n.j, h(i)j = nij / ni..
Например, при изучении влияния вдыхания сыворотки на заболевание гриппом по таблице 2а естественно вычислить относительные частоты, данные в таблице 2б.
Таблица 2а. — Распределение заболевших и не заболевших гриппом среди работников Центрального универмага в Москве, вдыхавших и не вдыхавших противогриппозную сыворотку (1939)
Не заболевшие Заболевшие Всего Не вдыхавшие 1675 150 1825 Вдыхавшие 497 4 501 Всего 2172 154 2326Таблица 2б. — Относительные частоты (соответствующие данным таблицы 2а)
Не заболевшие Заболевшие Всего Не вдыхавшие 0,918 0,082 1,000 Вдыхавшие 0,992 0,008 1,000Пример таблицы для совместного распределения двух количеств, признаков см. в статье Корреляция. Таблица 1а служит примером смешанного случая: материал группируется по одному качеств, признаку (принадлежность к основной выборке, произведённой для определения среднего уровня производственного процесса, и к трём выборкам, произведённым в различные моменты времени для проверки сохранения этого нормального среднего уровня) и по одному количеств, признаку (диаметр деталей).
Простейшими сводными характеристиками распределения одного количественного признака являются среднее
,
и среднее квадратичное отклонение
,
где
![]()
При вычислении
, S2 и D по группированным данным пользуются формулами
,
![]()
или
,
где r — число интервалов группировки, ak — их середины (в случае таблицы 1а — 13,07; 13,12; 13,17; 13,22 и т. д.). Если материал сгруппирован по слишком крупным интервалам, то такой подсчёт даёт слишком грубые результаты. Иногда в таких случаях полезно прибегать к специальным поправкам на группировку. Однако эти поправки имеет смысл вводить лишь при условии выполнения определённых вероятностных предположений.