Метод группировок позволяет также измерить вариацию (изменчивость, колеблемость) признаков. При относительно малом числе единиц совокупности вариация измеряется на основе ранжированного ряда единиц, образующих совокупность. Ряд называется ранжированным, если единицы расположены по возрастанию (убыванию) признака.

Однако ранжированные ряды довольно малопоказательны тогда, когда необходима сравнительная характеристика вариации. Кроме того, во многих случаях приходится иметь дело со статистическими совокупностями, состоящими из большого числа единиц, которые практически трудно представить в виде конкретного ряда. В связи с этим для первоначального общего ознакомления со статистическими данными и особенно для облегчения изучения вариации признаков исследуемые явления и процессы обычно объединяют в группы, а результаты группировки оформляют в виде групповых таблиц.

Если в групповой таблице имеется всего две графы - группы по выделенному признаку (варианты) и численности групп (частоты или частости), она называется рядом распределения.

Ряд распределения - простейшая разновидность структурной группировки по одному признаку, отображенная в групповой таблице с двумя графами, в которых содержатся варианты и частоты признака. Во многих случаях с такой структурной группировки, т.е. с составления рядов распределения, начинается изучение исходного статистического материала.

Структурная группировка в виде ряда распределения может быть превращена в подлинную структурную группировку, если выделенные группы будут охарактеризованы не только частотами, но и другими статистическими показателями. Главное предназначение рядов распределения - изучение вариации признаков. Теорию рядов распределения подробно разрабатывает математическая статистика.

Ряды распределения делят на атрибутивные (группировка по атрибутивным признакам, например деление населения по полу, национальности, семейному положению и т.д.) и вариационные (группировка по количественным признакам).

Вариационный ряд представляет собой групповую таблицу, которая содержит две графы: группировку единиц по одному количественному признаку и численность единиц в каждой группе. Интервалы в вариационном ряду образуются обычно равные и закрытые. Вариационным рядом является следующая группировка населения России по величине среднедушевых денежных доходов (табл. 3.10).

Таблица 3.10

Распределение численности населения России по величине среднедушевых доходов в 2004-2009 гг.

Группы населения по величине среднедушевых денежных доходов, руб./мес

Численность населения в группе, в % к итогу

8 000,1-10 000,0

10 000,1-15 000,0

15 000,1-25 000,0

Свыше 25 000,0

Все население

Вариационные ряды в свою очередь подразделяются на дискретные и интервальные. Дискретные вариационные ряды объединяют варианты дискретных признаков, изменяющихся в узких пределах. Примером дискретного вариационного ряда может служить распределение российских семей по числу имеющихся детей.

Интервальные вариационные ряды объединяют варианты либо непрерывных признаков, либо изменяющихся в широких пределах дискретных признаков. Интервальным является вариационный ряд распределения населения России по величине среднедушевых денежных доходов.

Дискретные вариационные ряды на практике применяются не слишком часто. Между тем составление их несложно, поскольку состав групп определяется конкретными вариантами, которыми реально обладают изучаемые группировочные признаки.

Более широко распространены интервальные вариационные ряды. При их составлении возникает сложный вопрос о количестве групп, а также о величине интервалов, которые должны быть установлены.

Принципы решения этого вопроса изложены в главе о методологии построения статистических группировок (см. параграф 3.3).

Вариационные ряды представляют собой средство свертывания или сжатия многообразной информации в компактную форму, по ним можно составить достаточно ясное суждение о характере вариации, изучить различия признаков явлений, входящих в исследуемую совокупность. Но важнейшее значение вариационных рядов состоит в том, что на их основе исчисляются особые обобщающие характеристики вариации (см. главу 7).

Особое место в статистическом анализе принадлежит определению среднего уровня изучаемого признака или явления. Средний уровень признака измеряют средними величинами.

Средняя величина характеризует общий количественный уровень изучаемого признака и является групповым свойством статистической совокупности. Она нивелирует, ослабляет случайные отклонения индивидуальных наблюдений в ту или иную сторону и выдвигает на первый план основное, типичное свойство изучаемого признака.

Средние величины широко используются:

1. Для оценки состояния здоровья населения: характеристики физического развития (рост, вес, окружность грудной клетки и пр.), выявления распространенности и длительности различных заболеваний, анализа демографических показателей (естественного движения населения, средней продолжительности предстоящей жизни, воспроизводства населения, средней численности населения и др.).

2. Для изучения деятельности лечебно-профилактических учреждений, медицинских кадров и оценки качества их работы, планирования и определения потребности населения в различных видах медицинской помощи (среднее число обращений или посещений на одного жителя в год, средняя длительность пребывания больного в стационаре, средняя продолжительность обследования больного, средняя обеспеченность врачами, койками и пр.).

3. Для характеристики санитарно-эпидемиологического состояния (средняя запыленность воздуха в цехе, средняя площадь на одного человека, средние нормы потребления белков, жиров и углеводов и т. д.).

4. Для определения медико-физиологических показателей в норме и патологии, при обработке лабораторных данных, для установления достоверности результатов выборочного исследования в социально-гигиенических, клинических, экспериментальных исследованиях.

Вычисление средних величин выполняется на основе вариационных рядов. Вариационный ряд – это однородная в качественном отношении статистическая совокупность, отдельные единицы которой характеризуют количественные различия изучаемого признака или явления.

Количественная вариация может быть двух типов: прерывная (дискретная) и непрерывная.

Прерывный (дискретный) признак выражается только целым числом и не может иметь никаких промежуточных значений (например, число посещений, численность населения участка, число детей в семье, степень тяжести болезни в баллах и др.).

Непрерывный признак может принимать любые значения в определенных пределах, в том числе и дробные, и выражается лишь приближенно (например, вес – для взрослых можно ограничиться килограммами, а для новорожденных – граммами; рост, артериальное давление, время, потраченное на прием больного, и т. д.).



Цифровое значение каждого отдельного признака или явления, входящего в вариационный ряд, называется вариантой и обозначается буквой V . В математической литературе встречаются и другие обозначения, например x или y.

Вариационный ряд, где каждая варианта указана один раз, называется простым. Такие ряды используются в большинстве статистических задач в случае компьютерной обработки данных.

При увеличении числа наблюдений, как правило, встречаются повторяющиеся значения вариант. В этом случае создается сгруппированный вариационный ряд , где указывается число повторений (частота, обозначается буквой «р »).

Ранжированный вариационный ряд состоит из вариант, расположенных в порядке возрастания или убывания. Как простой, так и сгруппированный ряды могут быть составлены с ранжированием.

Интервальный вариационный ряд составляют с целью упрощения последующих вычислений, выполняемых без использования компьютера, при очень большом числе единиц наблюдения (более 1000).

Непрерывный вариационный ряд включает значения вариант, которые могут выражаться любыми значениями.

Если в вариационном ряде значения признака (варианты) заданы в виде отдельных конкретных чисел, то такой ряд называют дискретным .

Общими характеристиками значений признака, отражаемого в вариационном ряду, являются средние величины. Среди них наиболее применяемые: средняя арифметическая величина М, мода Мо и медиана Me. Каждая из этих характеристик своеобразна. Они не могут подменить друг друга и лишь в совокупности достаточно полно и в сжатой форме представляют собой особенности вариационного ряда.

Модой (Мо) называют значение наиболее часто встречающейся варианты.

Медиана (Me) – это значение варианты, делящей ранжированный вариационный ряд пополам (с каждой стороны медианы находится половина вариант). В редких случаях, когда имеется симметричный вариационный ряд, мода и медиана равны между собой и совпадают со значением средней арифметической.

Наиболее типичной характеристикой значений вариант является средняя арифметическая величина(М ). В математической литературе она обозначается .

Средняя арифметическая величина (M, ) – это общая количественная характеристика определенного признака изучаемых явлений, составляющих качественно однородную статистическую совокупность. Различают среднюю арифметическую простую и взвешенную. Средняя арифметическая простая вычисляется для простого вариационного ряда путем суммирования всех вариант и делением этой суммы на общее количество вариант, входящих в данный вариационный ряд. Вычисления проводятся по формуле:

,

где: М - средняя арифметическая простая;

ΣV - сумма вариант;

n - число наблюдений.

В сгруппированном вариационном ряду определяют взвешенную среднюю арифметическую. Формула ее вычисления:

,

где: М - средняя арифметическая взвешенная;

ΣVp - сумма произведений вариант на их частоты;

n - число наблюдений.

При большом числе наблюдений в случае ручных вычислений может применяться способ моментов.

Средняя арифметическая имеет следующие свойства:

· сумма отклонений вариант от средней (Σd ) равна нулю (см. табл. 15);

· при умножении (делении) всех вариант на один и тот же множитель (делитель) средняя арифметическая умножается (делится) на тот же множитель (делитель);

· если прибавить (вычесть) ко всем вариантам одно и то же число, средняя арифметическая увеличивается (уменьшается) на это же число.

Средние арифметические величины, взятые сами по себе, без учета вариабельности рядов, из которых они вычислены, могут не в полной мере отражать свойства вариационного ряда, в особенности когда необходимо сопоставление с другими средними. Близкие по значению средние могут быть получены из рядов с различной степенью рассеяния. Чем ближе друг к другу отдельные варианты по своей количественной характеристике, тем меньше рассеяние (колеблемость, вариабельность) ряда, тем типичнее его средняя.

Основными параметрами, которые позволяют оценить вариабельность признака, являются:

· Размах;

· Амплитуда;

· Среднее квадратическое отклонение;

· Коэффициент вариации.

Приблизительно о колеблемости признака можно судить по размаху и амплитуде вариационного ряда. Размах указывает на максимальную (V max) и минимальную (V min) варианты в ряду. Амплитуда (A m) является разностью этих вариант: A m = V max - V min .

Основной, общепринятой мерой колеблемости вариационного ряда являются дисперсия (D ). Но наиболее часто применяется более удобный параметр, вычисляемый на основе дисперсии - среднее квадратическое отклонение (σ ). Оно учитывает величину отклонения (d ) каждой варианты вариационного ряда от его средней арифметической (d=V - M ).

Поскольку отклонения вариант от средней могут быть положительными и отрицательными, то при суммировании они дают значение «0» (Sd=0 ). Чтобы избежать этого, величины отклонения (d ) возводятся во вторую степень и усредняются. Таким образом, дисперсия вариационного ряда является средним квадратом отклонений вариант от средней арифметической и вычисляется по формуле:

.

Она является важнейшей характеристикой вариабельности и применяется для вычисления многих статистических критериев.

Поскольку дисперсия выражается квадратом отклонений, ее величина не может использоваться в сопоставлении со средней арифметической. Для этих целей применяется среднее квадратическое отклонение , которое обозначается знаком «Сигма» (σ ). Оно характеризует среднее отклонение всех вариант вариационного ряда от средней арифметической величины в тех же единицах, что и сама средняя величина, поэтому они могут использоваться совместно.

Среднее квадратическое отклонение определяют по формуле:

Указанная формула применяется при числе наблюдений (n ) больше 30. При меньшем числе n значение среднего квадратического отклонения будет иметь погрешность, связанную с математическим смещением (n - 1). В связи с этим, более точный результат может быть получен с помощью учета такого смещения в формуле расчета стандартного отклонения:

стандартное отклонение (s ) – это оценка среднеквадратического отклонения случайной величины Х относительно её математического ожидания на основе несмещённой оценки её дисперсии.

При значениях n > 30 среднее квадратическое отклонение (σ ) и стандартное отклонение (s ) будут одинаковыми (σ =s ). Поэтому в большинстве практических пособий эти критерии рассматриваются как разнозначные. В программе Excel вычисление стандартного отклонения может быть выполнено функцией =СТАНДОТКЛОН(диапазон). А с целью расчета среднего квадратического отклонения требуется создать соответствующую формулу.

Среднее квадратическое или стандартное отклонение позволяет определить, насколько значения признака могут отличаться от среднего значения. Предположим, существуют два города с одинаковой средней дневной температурой в летний период. Один их этих городов расположен на побережье, а другой на континенте. Известно, что в городах, расположенных на побережье, различия дневных температур меньше, чем у городов, расположенных внутри континента. Поэтому среднее квадратическое отклонение дневных температур у прибрежного города будет меньше, чем у второго города. На практике это означает, что средняя температура воздуха каждого конкретного дня в городе, расположенного на континенте будет сильнее отличаться от среднего значения, чем в городе на побережье. Кроме того стандартное отклонение позволяет оценить возможные отклонения температуры от средней с требуемым уровнем вероятности.

Согласно теории вероятности, в явлениях, подчиняющихся нормальному закону распределения, между значениями средней арифметической, среднего квадратического отклонения и вариантами существует строгая зависимость (правило трех сигм ). Например, 68,3% значений варьирующего признака находятся в пределах М ± 1σ , 95,5% - в пределах М ± 2σ и 99,7% - в пределах М ± 3σ .

Величина среднего квадратического отклонения позволяет судить о характере однородности вариационного ряда и исследуемой группы. Если величина среднего квадратического отклонения небольшая, то это свидетельствует о достаточно высокой однородности изучаемого явления. Среднюю арифметическую в таком случае следует признать вполне характерной для данного вариационного ряда. Однако слишком малая величина сигмы заставляет думать об искусственном подборе наблюдений. При очень большой сигме средняя арифметическая в меньшей степени характеризует вариационный ряд, что говорит о значительной вариабельности изучаемого признака или явления или о неоднородности исследуемой группы. Однако сопоставление величины среднего квадратического отклонения возможно только для признаков одинаковой размерности. Действительно, если сравнивать разнообразие веса новорожденных детей и взрослых, мы всегда получим более высокие значения сигмы у взрослых.

Сравнение вариабельности признаков различной размерности может быть выполнено с помощью коэффициента вариации . Он выражает разнообразие в процентах от средней величины, что позволяет производить сравнение различных признаков. Коэффициент вариации в медицинской литературе обозначается знаком «С », а в математической «v » и вычисляемого по формуле:

.

Значения коэффициента вариации менее 10% свидетельствует о малом рассеянии, от 10 до 20% – о среднем, более 20% – о сильном рассеянии вариант вокруг средней арифметической.

Средняя арифметическая величина, как правило, вычисляется на основе данных выборочной совокупности. При повторных исследованиях под влиянием случайных явлений средняя арифметическая может изменяться. Это обусловлено тем, что исследуется, как правило, только часть возможных единиц наблюдения, то есть выборочная совокупность. Информация обо всех возможных единицах, представляющих изучаемое явление, может быть получена при изучении всей генеральной совокупности, что не всегда возможно. В то же время с целью обобщения данных эксперимента представляет интерес величина средней в генеральной совокупности. Поэтому для формулировки общего вывода об изучаемом явлении, результаты, полученные на основе выборочной совокупности, должны быть, перенесены на генеральную совокупность статистическими методами.

Чтобы определить степень совпадения выборочного исследования и генеральной совокупности, необходимо оценить величину ошибки, которая неизбежно возникает при выборочном наблюдении. Такая ошибка называется «Ошибкой репрезентативности » или «Средней ошибкой средней арифметической». Она фактически является разностью между средними, полученными при выборочном статистическом наблюдении, и аналогичными величинами, которые были бы получены при сплошном исследовании того же объекта, т.е. при изучении генеральной совокупности. Поскольку выборочная средняя является случайной величиной, такой прогноз выполняется с приемлемым для исследователя уровнем вероятности. В медицинских исследованиях он составляет не менее 95%.

Ошибку репрезентативности нельзя смешивать с ошибками регистрации или ошибками внимания (описки, просчеты, опечатки и др.), которые должны быть сведены до минимума адекватной методикой и инструментами, применяемыми при проведении эксперимента.

Величина ошибки репрезентативности зависит как от объема выборки, так и от вариабельности признака. Чем больше число наблюдений, тем ближе выборка к генеральной совокупности и тем меньше ошибка. Чем более изменчив признак, тем больше величина статистической ошибки.

На практике для определения ошибки репрезентативности в вариационных рядах пользуются следующей формулой:

,

где: m – ошибка репрезентативности;

σ – среднее квадратическое отклонение;

n – число наблюдений в выборке.

Из формулы видно, что размер средней ошибки прямо пропорционален среднему квадратическому отклонению, т. е. вариабельности изучаемого признака, и обратно пропорционален корню квадратному из числа наблюдений.

При выполнении статистического анализа на основе вычисления относительных величин построение вариационного ряда не является обязательным. При этом определение средней ошибки для относительных показателей может выполняться по упрощенной формуле:

,

где: Р – величина относительного показателя, выраженного в процентах, промилле и т.д.;

q – величина, обратная Р и выраженная как (1-Р), (100-Р), (1000-Р) и т. д., в зависимости от основания, на которое рассчитан показатель;

n – число наблюдений в выборочной совокупности.

Однако, указанная формула вычисления ошибки репрезентативности для относительных величин может применяться только в том случае, когда значение показателя меньше его основания. В ряде случаев расчета интенсивных показателей такое условие не соблюдается, и показатель может выражаться числом более 100% или 1000%о. В такой ситуации выполняется построение вариационного ряда и вычисление ошибки репрезентативности по формуле для средних величин на основе среднего квадратического отклонения.

Прогнозирование величины средней арифметической в генеральной совокупности выполняется с указанием двух значений – минимального и максимального. Эти крайние значения возможных отклонений, в пределах которых может колебаться искомая средняя величина генеральной совокупности, называются «Доверительные границы ».

Постулатами теории вероятностей доказано, что при нормальном распределении признака с вероятностью 99,7%, крайние значения отклонений средней будут не больше величины утроенной ошибки репрезентативности (М ± 3m ); в 95,5% – не больше величины удвоенной средней ошибки средней величины (М ± 2m ); в 68,3% – не больше величины одной средней ошибки (М ± 1m ) (рис. 9).

P%

Рис. 9. Плотность вероятностей нормального распределения.

Отметим, что приведенное выше утверждение справедливо только для признака, который подчиняется нормальному закону распределения Гаусса.

Большинство экспериментальных исследований, в том числе и в области медицины, связано с измерениями, результаты которых могут принимать практически любые значения в заданном интервале, поэтому, как правило, описываются моделью непрерывных случайных величин. В связи с этим в большинстве статистических методов рассматриваются непрерывные распределения. Одним из таких распределений, имеющим основополагающую роль в математической статистике, является нормальное, или гауссово, распределение .

Это объясняется целым рядом причин.

1. Прежде всего, многие экспериментальные наблюдения можно успешно описать с помощью нормального распределения. Следует сразу же отметить, что не существует распределений эмпирических данных, которые были бы в точности нормальными, поскольку нормально распределенная случайная величина находится в пределах от до , чего никогда не встречается на практике. Однако нормальное распределение очень часто хорошо подходит как приближение.

Проводятся ли измерения веса, роста и других физиологических параметров организма человека - везде на результаты оказывает влияние очень большое число случайных факторов (естественные причины и ошибки измерения). Причем, как правило, действие каждого из этих факторов незначительно. Опыт показывает, что результаты именно в таких случаях будут распределены приближенно нормально.

2. Многие распределения, связанные со случайной выборкой, при увеличении объема последней переходят в нормальное.

3. Нормальное распределение хорошо подходит в качестве приближенного описания других непрерывных распределений (например, асимметричных).

4. Нормальное распределение обладает рядом благоприятных математических свойств, во многом обеспечивших его широкое применение в статистике.

В то же время следует отметить, что в медицинских данных встречается много экспериментальных распределений, описание которых моделью нормального распределения невозможно. Для этого в статистке разработаны методы, которые принято называть «Непараметрическими».

Выбор статистического метода, который подходит для обработки данных конкретного эксперимента, должен производиться в зависимости от принадлежности полученных данных к нормальному закону распределения. Проверка гипотезы на подчинение признака нормальному закону распределения выполняется с помощью гистограммы распределения частот (графика), а также ряда статистических критериев. Среди них:

Критерий асимметрии (b );

Критерий проверки на эксцесс (g );

Критерий Шапиро – Уилкса (W ) .

Анализ характера распределения данных (его еще называют проверкой на нормальность распределения) осуществляется по каждому параметру. Чтобы уверенно судить о соответствии распределения параметра нормальному закону, необходимо достаточно большое число единиц наблюдения (не менее 30 значений).

Для нормального распределения критерии асимметрии и эксцесса принимают значение 0. Если распределение смещено вправо b > 0 (положительная асимметрия), при b < 0 - график распределения смещен влево (отрицательная асимметрия). Критерий асимметрии проверяет форму кривой распределения. В случае нормального закона g =0. При g > 0 кривая распределения острее, если g < 0 пик более сглаженный, чем функция нормального распределения.

Для проверки на нормальность по критерию Шапиро – Уилкса требуется найти значение этого критерия по статистическим таблицам при необходимом уровне значимости и в зависимости от числа единиц наблюдения (степеней свободы). Приложение 1. Гипотеза о нормальности отвергается при малых значениях этого критерия, как правило, при w <0,8.

Понятие вариационного ряда. Первым шагом систематизации материалов статистического наблюдения является подсчет числа единиц, обладающих тем или иным признаком. Расположив единицы в порядке возрастания или убывания их количественного признака и подсчитав число единиц с конкретным значением признака, получаем вариационный ряд. Вариационный ряд характеризует распределение единиц определенной статистической совокупности по какому–либо количественному признаку.

Вариационный ряд представляет собой две колонки, в левой колонке приводятся значения варьирующего признака, именуемые вариантами и обозначаемые (x), а в правой – абсолютные числа, показывающие, сколько раз встречается каждый вариант. Показатели этой колонки называются частотами и обозначаются (f).

Схематично вариационный ряд можно представить в виде табл.5.1:

Таблица 5.1

Вид вариационного ряда

Варианты (x)

Частоты (f)

В правой колонке могут использоваться и относительные показатели, характеризующие долю частоты отдельных вариантов в общей сумме частот. Эти относительные показатели именуют частостями и условно обозначают через , т.е. . Сумма всех частостей равна единице. Частости могут быть выражены и в процентах, и тогда их сумма будет равна 100%.

Варьирующие признаки могут носить разный характер. Варианты одних признаков выражаются в целых числах, например, число комнат в квартире, число изданных книг и т.д. Эти признаки именуют прерывными, или дискретными. Варианты других признаков могут принимать любые значения в определенных пределах, как, например, выполнение плановых заданий, заработная плата и др. Эти признаки называют непрерывными.

Дискретный вариационный ряд. Если варианты вариационного ряда выражены в виде дискретных величин, то такой вариационный ряд называют дискретным, его внешний вид представлен в табл. 5.2:

Таблица 5.2

Распределение студентов по оценкам, полученным на экзамене

Оценки (х)

Количество студентов (f)

В % к итогу ()

Характер распределения в дискретных рядах изображается графически в виде полигона распределения, рис.5.1.

Рис. 5.1. Распределение студентов по оценкам, полученным на экзамене.

Интервальный вариационный ряд. Для непрерывных признаков вариационные ряды строятся интервальные, т.е. значения признака в них выражаются в виде интервалов «от и до». При этом минимальное значение признака в таком интервале именуют нижней границей интервала, а максимальное – верхней границей интервала.

Интервальные вариационные ряды строят как для прерывных признаков (дискретных), так и для варьирующих в большом диапазоне. Интервальные ряды могут быть с равными и неравными интервалами. В экономической практике в большинстве своем применяются неравные интервалы, прогрессивно возрастающие или убывающие. Такая необходимость возникает особенно в тех случаях, когда колеблемость признака осуществляется неравномерно и в больших пределах.

Рассмотрим вид интервального ряда с равными интервалами, табл. 5.3:

Таблица 5.3

Распределение рабочих по выработке

Выработка, т.р. (х)

Число рабочих (f)

Кумулятивная частота (f´)

Интервальный ряд распределения графически изображается в виде гистограммы, рис.5.2.

Рис.5.2. Распределение рабочих по выработке

Накопленная (кумулятивная) частота. В практике возникает потребность в преобразовании рядов распределения в кумулятивные ряды, строящиеся по накопленным частотам. С их помощью можно определить структурные средние, которые облегчают анализ данных ряда распределения.

Накопленные частоты определяются путем последовательного прибавления к частотам (или частостям) первой группы этих показателей последующих групп ряда распределения. Для иллюстрации рядов распределения используются кумуляты и огивы. Для их построения на оси абсцисс отмечаются значения дискретного признака (или концы интервалов), а на оси ординат – нарастающие итоги частот (кумулята), рис.5.3.

Рис. 5.3. Кумулята распределения рабочих по выработке

Если шкалы частот и вариантов поменять местами, т.е. на оси абсцисс отражать накопленные частоты, а на оси ординат – значения вариантов, то кривая, характеризующая изменение частот от группы к группе, будет носит название огивы распределения, рис.5.4.

Рис. 5.4. Огива распределения рабочих по выработке

Вариационные ряды с равными интервалами обеспечивают одно из важнейших требований, предъявляемых к статистическим рядам распределения, обеспечение сравнимости их во времени и пространстве.

Плотность распределения. Однако частоты отдельных неравных интервалов в названных рядах непосредственно не сопоставимы. В подобных случаях для обеспечения необходимой сравнимости исчисляют плотность распределения, т.е. определяют, сколько единиц в каждой группе приходится на единицу величины интервала.

При построении графика распределения вариационного ряда с неравными интервалами высоту прямоугольников определяют пропорционально не частотам, а показателям плотности распределения значений изучаемого признака в соответствующих интервалах.

Составление вариационного ряда и его графическое изображение является первым шагом обработки исходных данных и первой ступенью анализа изучаемой совокупности. Следующим шагом в анализе вариационных рядов является определение основных обобщающих показателей, именуемых характеристиками ряда. Эти характеристики должны дать представление о среднем значении признака у единиц совокупности.

Средняя величина . Средняя величина представляет собой обобщенную характеристику изучаемого признака в исследуемой совокупности, отражающая ее типический уровень в расчете на единицу совокупности в конкретных условиях места и времени.

Средняя величина всегда именованная, имеет ту же размерность, что и признак у отдельных единиц совокупности.

Перед вычислением средних величин необходимо произвести группировку единиц исследуемой совокупности, выделив качественно однородные группы.

Средняя, рассчитанная по совокупности в целом называется общей средней, а для каждой группы – групповыми средними.

Существуют две разновидности средних величин: степенные (средняя арифметическая, средняя гармоническая, средняя геометрическая, средняя квадратическая); структурные (мода, медиана, квартили, децили).

Выбор средней для расчета зависит от цели.

Виды степенных средних и методы их расчета. В практике статистической обработки собранного материала возникают различные задачи, для решения которых требуются различные средние.

Математическая статистика выводит различные средние из формул степенной средней:

где средняя величина; x – отдельные варианты (значения признаков); z – показатель степени (при z = 1 – средняя арифметическая, z = 0 средняя геометрическая, z = - 1 – средняя гармоническая, z = 2 – средняя квадратическая).

Однако вопрос о том, какой вид средней необходимо применить в каждом отдельном случае, разрешается путем конкретного анализа изучаемой совокупности.

Наиболее часто встречающимся в статистике видом средних величин является средняя арифметическая . Она исчисляется в тех случаях, когда объем осредняемого признака образуется как сумма его значений у отдельных единиц изучаемой статистической совокупности.

В зависимости от характера исходных данных средняя арифметическая определяется различными способами:

Если данные несгруппированные, то расчет ведется по формуле простой средней величины

Расчет средней арифметической в дискретном ряду происходит по формуле 3.4.

Расчет средней арифметической в интервальном ряду. В интервальном вариационном ряду, где за величину признака в каждой группе условно принимается середина интервала, средняя арифметическая может отличаться от средней, рассчитанной по несгруппированным данным. Причем, чем больше величина интервала в группах, тем больше возможные отклонения средней, вычисленной по сгруппированным данным, от средней, рассчитанной по несгруппированным данным.

При расчете средней по интервальному вариационному ряду для выполнения необходимых вычислений от интервалов переходят к их серединам. А затем рассчитывают среднюю величину по формуле средней арифметической взвешенной.

Свойства средней арифметической. Средняя арифметическая обладает некоторыми свойствами, которые позволяют упрощать вычисления, рассмотрим их.

1. Средняя арифметическая из постоянных чисел равна этому постоянному числу.

Если х = а. Тогда .

2. Если веса всех вариантов пропорционально изменить, т.е. увеличить или уменьшить в одно и то же число раз, то средняя арифметическая нового ряда от этого не изменится.

Если все веса f уменьшить в k раз, то .

3. Сумма положительных и отрицательных отклонений отдельных вариантов от средней, умноженных на веса, равна нулю, т.е.

Если , то . Отсюда .

Если все варианты уменьшить или увеличить на какое- либо число, то средняя арифметическая нового ряда уменьшится или увеличится на столько же.

Уменьшим все варианты x на a , т.е. x ´ = x a.

Тогда

Среднюю арифметическую первоначального ряда можно получить, прибавляя к уменьшенной средней ранее вычтенное из вариантов числа a , т.е. .

5. Если все варианты уменьшить или увеличить в k раз, то средняя арифметическая нового ряда уменьшится или увеличится во столько же, т.е. в k раз.

Пусть , тогда .

Отсюда , т.е. для получения средней первоначального ряда среднюю арифметическую нового ряда (с уменьшенными вариантами) надо увеличить в k раз.

Средняя гармоническая. Средняя гармоническая это величина обратная средней арифметической. Ее используют, когда статистическая информация не содержит частот по отдельным вариантам совокупности, а представлена как их произведение (М= xf). Средняя гармоническая будет рассчитываться по формуле 3.5

Практическое применение средней гармонической – для расчета некоторых индексов, в частности, индекса цен.

Средняя геометрическая. При применении средней геометрической индивидуальные значения признака представляют собой, как правило, относительные величины динамики, построенные в виде цепных величин, как отношение к предыдущему уровню каждого уровня в ряду динамики. Средняя характеризует, таким образом, средний коэффициент роста.

Средняя геометрическая величина используется также для определения равноудаленной величины от максимального и минимального значений признака. Например, страховая компания заключает договоры на оказание услуг автострахования. В зависимости конкретного страхового случая страховая выплата может колебаться от 10000 до 100000 долл. в год. Средняя сумма выплат по страховке составит долл.

Средняя геометрическая это величина, используемая как средняя из отношений или в рядах распределения, представленных в виде геометрической прогрессии, когда z = 0. Этой средней удобно пользоваться, когда уделяется внимание не абсолютным разностям, а отношениям двух чисел.

Формулы для расчета следующие

где – варианты осредняемого признака; – произведение вариантов; f – частота вариантов.

Средняя геометрическая используется в расчетах среднегодовых темпов роста.

Средняя квадратическая. Формула средней квадратической используется для измерения степени колеблемости индивидуальных значений признака вокруг средней арифметической в рядах распределения. Так, при расчете показателей вариации среднюю вычисляют из квадратов отклонений индивидуальных значений признака от средней арифметической величины.

Средняя квадратическая величина рассчитывается по формуле

В экономических исследованиях средняя квадратическая в измененном виде широко используется при расчете показателей вариации признака, таких как дисперсия, среднее квадратическое отклонение.

Правило мажорантности. Между степенными средними существует следующая зависимость – чем больше показатель степени, тем больше значение средней, табл.5.4:

Таблица 5.4

Соотношение между средними величинами

Значение z

Соотношение между средними

Это соотношение называется правилом мажорантности.

Структурные средние величины. Для характеристики структуры совокупности применяются особые показатели, которые можно назвать структурными средними. К таким показателям относятся мода, медиана, квартили и децили.

Мода. Модой (Мо) называется наиболее часто встречающееся значение признака у единиц совокупности. Модой называется то значение признака, которое соответствует максимальной точке теоретической кривой распределения.

Мода широко используется в коммерческой практике при изучении покупательского спроса (при определении размеров одежды и обуви, которые пользуются широким спросом), регистрации цен. Мод в совокупности может быть несколько.

Расчет моды в дискретном ряду. В дискретном ряду мода – это варианта с наибольшей частотой. Рассмотрим нахождение моды в дискретном ряду.

Расчет моды в интервальном ряду. В интервальном вариационном ряду модой приближенно считают центральный вариант модального интервала, т.е. того интервала, который имеет наибольшую частоту (частость). В пределах интервала надо найти то значение признака, которое является модой. Для интервального ряда мода будет определяться формулой

где – нижняя граница модального интервала; – величина модального интервала; – частота, соответствующая модальному интервалу; – частота, предшествующая модальному интервалу; – частота интервала, следующего за модальным.

Медиана. Медианой () называется значение признака у средней единицы ранжированного ряда. Ранжированный ряд – это ряд, у которого значения признака записаны в порядке возрастания или убывания. Или медиана это величина, которая делит численность упорядоченного вариационного ряда на две равные части: одна часть имеет значение варьирующего признака меньшие, чем средний вариант, а другая – большие.

Чтобы найти медиану, сначала определяется ее порядковый номер. Для этого при нечетном числе единиц к сумме всех частот прибавляется единица и все делится на два. При четном числе единиц медиана отыскивается как значение признака у единицы, порядковый номер который определяется по общей сумме частот, деленной на два. Зная порядковый номер медианы, легко по накопленным частотам найти ее значение.

Расчет медианы в дискретном ряду. По данным выборочного обследования получены данные о распределении семей по числу детей, табл. 5.5. Для определения медианы сначала определим ее порядковый номер

В этих семьях количество детей равно 2, следовательно, = 2. Таким образом, в 50% семей число детей не превышает 2.

–частота накопленная, предшествующая медианному интервалу;

С одной стороны, это весьма положительное свойство т.к. в этом случае учитывается действие всех причин, воздействующих на все единицы изучаемой совокупности. С другой стороны, даже одно наблюдение, попавшее в исходные данные случайно, может существенным образом исказить представление об уровне развития изучаемого признака в рассматриваемой совокупности (особенно в коротких рядах).

Квартили и децили. По аналогии с нахождением медианы в вариационных рядах можно отыскать значение признака у любой по порядку единицы ранжированного ряда. Так, в частности, можно найти значение признака у единиц, делящих ряд на 4 равные части, на 10 и т.п.

Квартили. Варианты, которые делят ранжированный ряд на четыре равные части, называют квартилями.

При этом различают: нижний (или первый) квартиль (Q1) – значение признака у единицы ранжированного ряда, делящей совокупность в соотношении ¼ к ¾ и верхний (или третий) квартиль(Q3) – значение признака у единицы ранжированного ряда, делящий совокупность в соотношении ¾ к ¼.

– частоты квартильных интервалов (нижнего и верхнего)

Интервалы, в которых содержатся Q1 и Q3 определяют по накопленным частотам (или частостям).

Децили. Кроме квартилей рассчитывают децили – варианты, делящие ранжированный ряд на 10 равных частей.

Обозначаются они через D, первый дециль D1 делит ряд в соотношении 1/10 и 9/10, второй D2 – 2/10 и 8/10 и т.д. Вычисляются они по той же схеме, что и медиана и квартили.

И медиана, и квартили, и децили принадлежат к так называемым порядковым статистикам, под которым понимают вариант, занимающий определенное порядковое место в ранжированном ряду.

Вариационный ряд - это статистический ряд, показывающий распределение изучаемого явления по величине какого-либо количественного признака. Например, больных по возрасту, по срокам лечения, новорожденных по весу и т.п.

Варианта - отдельные значения признака, по которому проводится группировка (обозначается V ) .

Частота- число, показывающее, как часто встречается та или иная варианта (обозначается P ) . Сумма всех частот показывает общее число наблюдений и обозначается n . Разность между наибольшей и наименьшей вариантой вариационного ряда называется размахом или амплитудой .

Различают вариационные ряды:

1. Прерывные (дискретные) и непрерывные.

Ряд считается непрерывным, если группировочный признак может выражаться дробными величинами (вес, рост т.п.), прерывным, если группировочный признак выражается только целым числом (дни нетрудоспособности, число ударов пульса и т.п.).

2.Простые и взвешенные.

Простой вариационный ряд представляет собой ряд, в котором количественное значение варьирующего признака встречается один раз. Во взвешенном вариационном ряду количественные значения варьирующего признака повторяются с определённой частотой.

3. Сгруппированные (интервальные) и несгруппированые.

Сгруппированный ряд имеет варианты, объединённые в группы, объединяющие их по величине в пределах определённого интервала. В несгруппированном ряду каждой отдельной варианте соответствует определённая частота.

4. Четные и нечетные.

В чётных вариационных рядах сумма частот или общее число наблюдений выражено чётным числом, в нечётных ― нечётным.

5. Симметричные и асимметричные.

В симметричном вариационном ряду все виды средних величин совпадают или очень близки (мода, медиана, среднее арифметическое).

В зависимости от характера изучаемых явлений, от конкретных задач и целей статистического исследования, а также от содержания исходного материала, в санитарной статистике применяются следующие виды средних величин:

структурные средние (мода, медиана);

средняя арифметическая;

средняя гармоническая;

средняя геометрическая;

средняя прогрессивная.

Мода (М о ) - величина варьирующего признака, которая более часто встречается в изучаемой совокупности т.е. варианта, соответствующая наибольшей частоте. Находят ее непосредственно по структуре вариационного ряда, не прибегая к каким-либо вычислениям. Она обычно является величиной очень близкой к средней арифметической и весьма удобна в практической деятельности.

Медиана (М е ) - делящая вариационный ряд (ранжированный, т.е. значения вариант располагаются в порядке возрастания или убывания) на две равные половины. Медиана вычисляется при помощи так называемого нечетного ряда, который получают путем последовательного суммирования частот. Если сумма частот соответствует четному числу, тогда за медиану условно принимают среднюю арифметическую из двух средних значений.

Мода и медиана применяются в случае незамкнутой совокупности, т.е. когда наибольшая или наименьшая варианты не имеют точной количественной характеристики (например, до 15 лет, 50 и старше и т.п.). В этом случае среднюю арифметическую (параметрические характеристики) рассчитать нельзя.

Средня я арифметическая - самая распространенная величина. Средняя арифметическая обозначается чаще через М .

Различают среднюю арифметическую простую и взвешенную.

Средняя арифметическая простая вычисляется:

― в тех случаях, когда совокупность представлена простым перечнем знаний признака у каждой единицы;

― если число повторений каждой варианты нет возможности определить;

― если числа повторений каждой варианты близки между собой.

Средняя арифметическая простая исчисляется по формуле:

где V - индивидуальные значения признака; n - число индивидуальных значений;
- знак суммирования.

Таким образом, простая средняя представляет собой отношение суммы вариант к числу наблюдений.

Пример: определить среднюю длительность пребывания на койке 10 больных пневмонией:

16 дней - 1 больной; 17–1; 18–1; 19–1; 20–1; 21–1; 22–1; 23–1; 26–1; 31–1.

койко-дня.

Средняя арифметическая взвешенная исчисляется в тех случаях, когда индивидуальные значения признака повторяются. Ее можно вычислять двояким способом:

1. Непосредственным (среднеарифметическим или прямым способом) по формуле:

,

где P - частота (число случаев) наблюдений каждой варианты.

Таким образом, средняя арифметическая взвешенная представляет собой отношение суммы произведений вариант на частоты к числу наблюдений.

2. С помощью вычисления отклонений от условной средней (по способу моментов).

Основой для вычисления взвешенной средней арифметической является:

― сгруппированный материал по вариантам количественного признака;

― все варианты должны располагаться в порядке возрастания или убывания величины признака (ранжированный ряд).

Для вычисления по способу моментов обязательным условием является одинаковый размер всех интервалов.

По способу моментов средняя арифметическая вычисляется по формуле:

,

где М о - условная средняя, за которую чаще принимают величину признака, соответствующую наибольшей частоте, т.е. которая чаще повторяется (Мода).

i - величина интервала.

a - условное отклонение от условий средней, представляющее собой последовательный ряд чисел (1, 2 и т.д.) со знаком + для вариант больших условной средней и со знаком–(–1, –2 и т.д.) для вариант, которые ниже условной средней. Условное же отклонение от варианты, принятой за условную среднюю равно 0.

P - частоты.

- общее число наблюдений или n.

Пример: определить средний рост мальчиков 8 лет непосредственным способом (таблица1).

Т а б л и ц а 1

Рост в см

мальчиков P

Центральная

варианта V

Центральная варианта ― середина интервала ― определяется как полу сумма начальных значений двух соседних групп:

;
и т.д.

Произведение VP получают путем умножения центральных вариант на частоты
;
и т.д. Затем полученные произведения складывают и получают
, которую делят на число наблюдений (100) и получают среднюю арифметическую взвешенную.

см.

Эту же задачу решим по способу моментов, для чего составляется следующая таблица 2:

Т а б л и ц а 2

Рост в см (V)

мальчиков P

n=100

В качестве М о принимаем 122, т.к. из 100 наблюдений у 33 человек рост был 122см. Находим условные отклонения (a) от условной средней в соответствии с вышесказанным. Затем получаем произведение условных отклонений на частоты (aP) и суммируем полученные величины (
). В итоге получится 17. Наконец, данные подставляем в формулу:

При изучении варьирующего признака нельзя ограничиваться только вычислением средних величин. Необходимо вычислять и показатели, характеризующие степень разнообразия изучаемых признаков. Величина того или иного количественного признака неодинакова у всех единиц статистической совокупности.

Характеристикой вариационного ряда является среднее квадратичное отклонение (), которое показывает разброс (рассеивание) изучаемых признаков относительно средней арифметической, т.е. характеризует колеблемость вариационного ряда. Оно может определяться непосредственным способом по формуле:

Среднее квадратичное отклонение равняется квадратному корню из суммы произведений квадратов отклонений каждой варианты от средней арифметической (V–M) 2 на свои частоты деленной на сумму частот (
).

Пример вычисления: определить среднее число больничных листов, выдаваемых в поликлинике за день (таблица 3).

Т а б л и ц а 3

Число больничных

листов, выданных

врачом за день (V)

Число врачей (Р)

;

В знаменателе при числе наблюдений менее 30 необходимо от
отнимать единицу.

Если ряд сгруппирован с равными интервалами, тогда можно определить среднее квадратичное отклонение по способу моментов:

,

где i - величина интервала;

- условное отклонение от условной средней;

P - частоты вариант соответствующих интервалов;

- общее число наблюдений.

Пример вычисления : Определить среднюю длительность пребывания больных на терапевтической койке (по способу моментов) (таблица 4):

Т а б л и ц а 4

Число дней

пребывания на койке (V)

больных (Р)

;

Бельгийский статистик А. Кетле обнаружил, что вариации массовых явлений подчиняются закону распределения ошибок, открытому почти одновременно К. Гауссом и П. Лапласом. Кривая, отображающая это распределение, имеет вид колокола. По нормальному закону распределения колеблемость индивидуальных значений признака находится в пределах
, что охватывает 99,73% всех единиц совокупности.

Подсчитано, что если к средней арифметической прибавить и отнять 2, то в пределах полученных величин находится 95,45% всех членов вариационного ряда и, наконец, если к средней арифметической прибавить и отнять 1, то в пределах полученных величин будут находиться 68,27% всех членов данного вариационного ряда. В медицине с величиной
1связано понятие нормы. Отклонение от средней арифметической больше, чем на 1, но меньше, чем на 2является субнормальным, а отклонение больше, чем на 2ненормальным (выше или ниже нормы).

В санитарной статистике правило трех сигм применяется при изучении физического развития, оценке деятельности учреждений здравоохранения, оценке здоровья населения. Это же правило широко применяется в народном хозяйстве при определении стандартов.

Таким образом, среднее квадратичное отклонение служит для:

― измерения дисперсии вариационного ряда;

― характеристики степени разнообразия признаков, которые определяются коэффициентом вариации:

Если коэффициент вариации более 20% - сильное разнообразие, от 20 до 10% - среднее, менее 10% - слабое разнообразие признаков. Коэффициент вариации в известной мере является критерием надежности средней арифметической.

Вариация определяет различия в значениях какого-либо признака у разных единиц данной совокупности в один и тот же период (момент времени). Причиной вариации бывают разные условия существования разных единиц совокупности. Например, даже близнецы в процессе жизни приобретают различия в росте, весе, а также в таких признаках, как уровень образования, доход, количество детей и т.д.

Вариация возникает в результате того, что сами значения признака складываются под суммарным влиянием разнообразных условий, которые разным образом сочетаются в каждом отдельном случае. Таким образом, величина любого варианта объективна.

Вариация характерна всем без исключения явлениям природы и общества, кроме законодательно закрепленных нормативных значений отдельных социальных признаков. Исследования вариации в статистике имеют огромное значение, помогают познать сущность изучаемого явления. Нахождение вариации, выяснение ее причин, выявление влияния отдельных факторов дают важную информацию для внедрения научно обоснованных управленческих решений.

Средняя величина дает обобщенную характеристику признака совокупности, но она не раскрывает её строения. Среднее значение не показывает, как располагаются вокруг нее варианты осредненного признака, распределены ли они вблизи средней или отклоняются от нее. Средняя в двух совокупностях может быть одинаковой, но в одном варианте все индивидуальные значения отличаются от нее незначительно, а в другом - эти отличия велики, т.е. в первом случае вариация признака мала, а во втором - велика, это имеет очень важное значение для характеристики значимости средней величины.

Для того, чтобы руководитель организации, управляющий, научный работник могли изучать вариацию и управлять ей, статистикой разработаны специальные методы исследования вариации (система показателей). С их помощью вариация находится, характеризуются ее свойства. К показателям вариации относятся : размах вариации, среднее линейное отклонение, коэффициент вариации.

Вариационный ряд и его формы

Вариационный ряд - это упорядоченное распределение единиц совокупности чаще по возрастающим (реже убывающим) значениям признака и подсчет числа единиц с тем или иным значением признака. Когда численность единиц совокупности большая, ранжированный ряд становится громоздким, его построение занимает длительное время. В такой ситуации вариационный ряд строится с помощью группировки единиц совокупности по значениям изучаемого признака.

Существуют следующие формы вариационного ряда :

  1. Ранжированный ряд представляет собой, перечень отдельных единиц совокупности в порядке возрастания (убывания) изучаемого признака.
  2. Дискретный вариационный ряд - это таблица, состоящая из двух строк или граф: конкретных значений варьирующего признака х и числа единиц совокупности с данным значение f - признака частот. Он строится тогда, когда признак принимает наибольшее число значений.
  3. Интервальный ряд .

Размах вариации определяется как абсолютная величина разности между максимальными и минимальными значениями (вариантами) признака:

Размах вариации показывает только крайние отклонения признака и не отражает отдельных отклонений всех вариантов в ряду. Он характеризует пределы изменения варьирующего признака и зависим от колебаний двух крайних вариантов и абсолютно не связан с частотами в вариационном ряду, т. е. с характером распределения, что придает этой величине, случайный характер. Для анализа вариации нужен показатель, который отражает все колебания вариационного признака и даёт общую характеристику. Простейший показатель такого вида — среднее линейное отклонение.