Составить интервальный вариационный ряд. Построение интервального вариационного ряда для непрерывных количественных данных. По математической статистике

Группировка – это разбиение совокупности на группы, однородные по какому-либо признаку.

Назначение сервиса . С помощью онлайн-калькулятора Вы сможете:

построить вариационный ряд , построить гистограмму и полигон;
найти показатели вариации (среднюю, моду (в т.ч. и графическим способом), медиану, размах вариации, квартили, децили, квартильный коэффициент дифференциации, коэффициент вариации и другие показатели);

Инструкция . Для группировки ряда необходимо выбрать вид получаемого вариационного ряда (дискретный или интервальный) и указать количество данных (количество строк). Полученное решение сохраняется в файле Word (см. пример группировки статистических данных).

Если группировка уже осуществлена и заданы дискретный вариационный ряд или интервальный ряд , то необходимо воспользоваться онлайн-калькулятором Показатели вариации . Проверка гипотезы о виде распределения производится с помощью сервиса Изучение формы распределения .

Виды статистических группировок

Вариационный ряд . В случае наблюдений дискретной случайной величины одно и то же значение можно встретить несколько раз. Такие значения x i случайной величины записывают с указанием n i числа раз его появления в n наблюдениях, это и есть частота данного значения.
В случае непрерывной случайной величины на практике применяют группировку.

Типологическая группировка – это разделение исследуемой качественно разнородной совокупности на классы, социально–экономические типы, однородные группы единиц. Для построения данной группировки используйте параметр Дискретный вариационный ряд.
Структурной называется группировка , в которой происходит разделение однородной совокупности на группы, характеризующие ее структуру по какому–либо варьирующему признаку. Для построения данной группировки используйте параметр Интервальный ряд.
Группировка, выявляющая взаимосвязи между изучаемыми явлениями и их признаками, называется аналитической группировкой (см. аналитическая группировка ряда).

Принципы построения статистических группировок

Ряд наблюдений, упорядоченных по возрастанию, называется вариационным рядом . Группировочным признаком называется признак, по которому производится разбивка совокупности на отдельные группы. Его называют основанием группировки. В основание группировки могут быть положены как количественные, так и качественные признаки.
После определения основания группировки следует решить вопрос о количестве групп, на которые надо разбить исследуемую совокупность.

При использовании персональных компьютеров для обработки статистических данных группировка единиц объекта производится с помощью стандартных процедур.
Одна из таких процедур основана на использовании формулы Стерджесса для определения оптимального числа групп:

k = 1+3,322*lg(N)

Где k – число групп, N – число единиц совокупности.

Длину частичных интервалов вычисляют как h=(x max -x min)/k

Затем подсчитывают числа попаданий наблюдений в эти интервалы, которые принимают за частоты n i . Малочисленные частоты, значения которых меньше 5 (n i < 5), следует объединить. в этом случае надо объединить и соответствующие интервалы.
В качестве новых значений вариант берут середины интервалов x i =(c i-1 +c i)/2.

Во многих случаях, кота статистическая совокупность включает большое или тем более бесконечное число вариант, что чаще всего встречается при непрерывной вариации, практически невозможно и нецелесообразно формировать группу единиц для каждой варианты. В таких случаях объединение статистических единиц в группы возможно лишь на базе интервала, т.е. такой группы, которая имеет определенные пределы значений варьирующего признака. Эти пределы обозначаются двумя числами, указывающими верхнюю и нижнюю границы каждой группы. Применение интервалов приводит к формированию интервального ряда распределения.

Интервальный рад - это вариационный ряд, варианты которого представлены в виде интервалов.

Интервальный ряд может формироваться с равными инеравными интервалами, при этом выбор принципа построения этого ряда зависит главным образом от степени представительности и удобности статистической совокупности. Если совокупность достаточно велика (представительна) по числу единиц и вполне однородна по своему составу, то в основу формирования интервального ряда целесообразно положить равенства интервалов. Обычно по этому принципу образуют интервальный ряд по тем совокупностям, где размах вариации сравнительно невелик, т.е. максимальная и минимальная варианты различаются между собой обычно в несколько раз. При этом величина равных интервалов рассчитывается отношением размаха вариации признака к заданному числу образуемых интервалов. Для определения равного и нтервала может быть ииспользована формула Стерджесса (обычно при небольшой вариации интервальных признаков и большом числе единиц в статистической совокупности):

где х i - величина равного интервала; X max, X min- максимальная и минимальная варианты в статистической совокупности; n. - число единиц в совокупности.

Пример . Целесообразно рассчитать размер равного интервала по плотности радиоактивного загрязнения цезием – 137 в 100 населенных пунктах Краснопольского района Могилевской области, если известно, что начальная (минимальная) варианта равна I км/км 2 , конечная (максимальная) - 65 ки/км 2 . Воспользовавшись формулой 5.1. получим:

Следовательно, чтобы сформировать интервальный ряд с равными интервалами по плотности загрязнения цезием - 137 населенных пунктов Краснопольского района, размер равного интервала может составить 8 ки/км 2 .

В условиях неравномерного распределения т.е. когда максимальная иминимальная варианты сотни раз, при формировании интервального ряда можно применить принцип неравных интервалов. Неравные интервалы обычно увеличиваются по мере перехода к большим значениям признака.

По форме интервалы могут быть закрытыми и открытыми. Закрытыми принято называть интервалы, у которых обозначены как нижняя, так и верхняя границы. Открытые интервалы имеют только одну границу: в первом интервале – верхняя, в последнем - нижняя граница.

Оценку интервальных рядов, особенно с неравным интервалами, целесообразно проводить с учетом плотности распределения , простейшим способом расчета которого является отношение локальной частоты (или частости) к размеру интервала.

Для практического формирования интервального ряда можно воспользоваться макетом табл. 5.3.

Т а б л и ц а 5.3. Порядок формирования интервального ряда населённых пунктов Краснопольского района по плотности радиоактивного загрязнения цезием –137

Основное преимущество интервального ряда - его предельная компактность. в то же время в интервальном ряду распределения индивидуальные варианты признака скрыты в соответствующих интервалах

При графическом изображении интервального ряда в системе прямоугольных координат на оси абсцисс откладывают верхние границы интервалов, на ос ординат - локальные частоты ряда. Графическое построение интервального ряда отличается от построения полигона распределения тем, что каждый интервал имеет нижнюю и верхнею границы, а одному какому- либо значению ординаты соответствуют две абсциссы. Поэтому на графике интервального ряда отмечается не точка, как в полигоне, а линия, соединяющая две точку. Эти горизонтальные линии соединяются друг с другом вертикальными линиями и получается фигура ступенчатого многоугольника, который принято называть гистограммой распределения (рис.5.3).

При графическом построении интервального ряда по достаточно большой статистической совокупности гистограмма приближается к симметричной форме распределения. В тех же случаях, где статистическая совокупность невелика, как правило, формируется асимметричная гистограмма.

В некоторых случаях имеется целесообразность в формировании ряда накопленных частот, т.е. кумулятивного ряда. Кумулятивный ряд можно образовать на основе дискретного либо интервального ряда распределения. При графическом изображении кумулятивного ряда в системе прямоугольных координат на оси абсцисс откладывают варианты, на оси ординат - накопленные частоты (частости). Полученную при этом кривую линию принято называть кумулятой распределения (рис.5.4).

Формирование и графическое изображение различных видов вариационных рядов способствует упрощенному расчету основных статистических характеристик, которые подробно рассматриваются в теме 6, помогает лучше понять сущность законов распределения статистической совокупности. Анализ вариационного ряда приобретает особенное значение в тех случаях, когда необходимо выявить и проследить зависимость между вариантами и частотами (частостями). Эта зависимость проявляется в том, что число случаев, приходящихся на каждую варианту, определенным образом связано с величиной этой варианты, т.е. с возрастанием значений варьирующего признака частоты (частости) этих значений испытывают определенные, систематические изменения. Это означает, что числа в столбце частот (частостей) подвержены не хаотическим колебаниям, а изменяются в определенном направлении, в определенном порядке и последовательности.

Если частоты в своих изменениях обнаруживают определенную систематичность, то это означает, что мы находимся на пути к выявлению закономерности. Система, порядок, последовательность в изменении частот - это отражение общих причин, общих условий, характерных для всей совокупности.

Не следует считать, что закономерность распределения всегда дается в готовом виде. Встречается довольно много вариационных рядов, в которых частоты причудливо скачут, то возрастая, то уменьшаясь. В таких случаях целесообразно выяснить, с каким распределением имеет дело исследователь: то ли этому распределению вовсе не присущи закономерности, то его характер еще не выявлен: Первый случай встречается редко, второй же, второй же случай - явление довольно частое и весьма распространенное.

Так, при формировании интервального ряда общее число статистических единиц может быть небольшим, и в каждый интервал попадает малое число вариант (например, 1-3 единицы). В таких случаях рассчитывать на проявление какой-либо закономерности не приходится. Для того чтобы на основе случайных наблюдений получился закономерный результат, необходимо вступление в силу закона больших чисел, т.е. чтобы на каждый интервал приходилось бы не несколько, а десятки и сотни статистических единиц. С этой целью надо стараться, по возможности увеличивать число наблюдений. Это самый верный способ обнаружения закономерности в массовых процессах. Если же не представляется реальная возможность увеличить число наблюдений, то выявление закономерности может быть достигнуто уменьшением числа интервалов в ряду распределения. Уменьшая число интервалов в вариационном ряду, тем самым увеличивается численность частот в каждом интервале. Это означает, что случайные колебания каждой статистической единицы накладываются друг на друга, "сглаживается", превращаясь в закономерность.

Формирование и построение вариационных рядов позволяет получить лишь общую, приближенную картину распределения статистической совокупности. Например, гистограмма лишь в грубой форме выражает зависимость между значениями признака и его частотами (частостями) Поэтому вариационные ряды по существу являются лишь основой для дальнейшего, углубленного изучения внутренней закономерности статического распределения.

КОНТРОЛЬНЫЕ ВОПРОСЫ К ТЕМЕ 5

1. Что представляет собой вариация? Чем вызывается вариация признака в статистической совокупности?

2. Какие виды варьирующих признаков могут иметь место в статистике?

3. Что такое вариационный ряд? Какие могут быть виды вариационных рядов?

4. Что представляет собой ранжированный ряд? Какие его преимущества и недостатки?

5. Что такое дискретный ряд и какие его преимущества и недостатки?

6. Каков порядок формирования интервального ряда, какие его преимущества и недостатки?

7. Что представляет собой графическое изображение ранжированного, дискретного, интервального рядов распределения?

8. Что такое кумулята распределения и что она характеризует?

Важнейшим этапом исследования социально-экономических явлений и процессов является систематизация первичных данных и получение на этой основе сводной характеристики всего объекта при помощи обобщающих показателей, что достигается путем сводки и группировки первичного статистического материала.

Статистическая сводка - это комплекс последовательных операций по обобщению конкретных единичных фактов, образующих совокупность, для выявления типичных черт и закономерностей, присущих изучаемому явлению в целом. Проведение статистической сводки включает следующие этапы :

выбор группировочного признака;
определение порядка формирования групп;
разработка системы статистических показателей для характеристики групп и объекта в целом;
разработка макетов статистических таблиц для представления результатов сводки.

Статистической группировкой называется расчленение единиц изучаемой совокупности на однородные группы по определенным существенным для них признакам. Группировки являются важнейшим статистическим методом обобщения статистических данных, основой для правильного исчисления статистических показателей.

Различают следующие виды группировок: типологические, структурные, аналитические. Все эти группировки объединяет то, что единицы объекта разделены на группы по какому-либо признаку.

Группировочным признаком называется признак, по которому проводится разбиение единиц совокупности на отдельные группы. От правильного выбора группировочного признака зависят выводы статистического исследования. В качестве основания группировки необходимо использовать существенные, теоретически обоснованные признаки (количественные или качественные).

Количественные признаки группировки имеют числовое выражение (объем торгов, возраст человека, доход семьи и т. д.), а качественные признаки группировки отражают состояние единицы совокупности (пол, семейное положение, отраслевая принадлежность предприятия, его форма собственности и т. д.).

После того, как определено основание группировки следует решить вопрос о количестве групп, на которые надо разбить исследуемую совокупность. Число групп зависит от задач исследования и вида показателя, положенного в основание группировки, объема совокупности, степени вариации признака.

Например, группировка предприятий по формам собственности учитывает муниципальную, федеральную и собственность субъектов федерации. Если группировка производится по количественному признаку, то тогда необходимо обратить особое внимание на число единиц исследуемого объекта и степень колеблемости группировочного признака.

Когда определено число групп, то следует определить интервалы группировки. Интервал - это значения варьирующего признака, лежащие в определенных границах. Каждый интервал имеет свою величину, верхнюю и нижнюю границы или хотя бы одну из них.

Нижней границей интервала называется наименьшее значение признака в интервале, а верхней границей - наибольшее значение признака в интервале. Величина интервала представляет собой разность между верхней и нижней границами.

Интервалы группировки в зависимости от их величины бывают: равные и неравные. Если вариация признака проявляется в сравнительно узких границах и распределение носит равномерный характер, то строят группировку с равными интервалами. Величина равного интервала определяется по следующей формуле :

где Хmax, Хmin - максимальное и минимальное значения признака в совокупности; n - число групп.

Простейшая группировка, в которой каждая выделенная группа характеризуется одним показателем представляет собой ряд распределения.

Статистический ряд распределения - это упорядоченное распределение единиц совокупности на группы по определенному признаку. В зависимости от признака, положенного в основу образования ряда распределения, различают атрибутивные и вариационные ряды распределения.

Атрибутивными называют ряды распределения, построенные по качественным признакам, то есть признакам, не имеющим числового выражения (распределение по видам труда, по полу, по профессии и т.д.). Атрибутивные ряды распределения характеризуют состав совокупности по тем или иным существенным признакам. Взятые за несколько периодов, эти данные позволяют исследовать изменение структуры.

Вариационными рядами называют ряды распределения, построенные по количественному признаку. Любой вариационный ряд состоит из двух элементов: вариантов и частот. Вариантами называются отдельные значения признака, которые он принимает в вариационном ряду, то есть конкретное значение варьирующего признака.

Частотами называются численности отдельных вариант или каждой группы вариационного ряда, то есть это числа, которые показывают, как часто встречаются те или иные варианты в ряду распределения. Сумма всех частот определяет численность всей совокупности, ее объем. Частостями называются частоты, выраженные в долях единицы или в процентах к итогу. Соответственно сумма частостей равна 1 или 100%.

В зависимости от характера вариации признака различают три формы вариационного ряда: ранжированный ряд, дискретный ряд и интервальный ряд.

Ранжированный вариационный ряд - это распределение отдельных единиц совокупности в порядке возрастания или убывания исследуемого признака. Ранжирование позволяет легко разделить количественные данные по группам, сразу обнаружить наименьшее и наибольшее значения признака, выделить значения, которые чаще всего повторяются.

Дискретный вариационный ряд характеризует распределение единиц совокупности по дискретному признаку, принимающему только целые значения. Например, тарифный разряд, количество детей в семье, число работников на предприятии и др.

Если признак имеет непрерывное изменение, которые в определенных границах могут принимать любые значения («от - до»), то для этого признака нужно строить интервальный вариационный ряд . Например, размер дохода, стаж работы, стоимость основных фондов предприятия и др.

Примеры решения задач по теме «Статистическая сводка и группировка»

Задача 1 . Имеется информация о количестве книг, полученных студентами по абонементу за прошедший учебный год.

Построить ранжированный и дискретный вариационные ряды распределения, обозначив элементы ряда.

Решение

Данная совокупность представляет собой множество вариантов количества получаемых студентами книг. Подсчитаем число таких вариантов и упорядочим в виде вариационного ранжированного и вариационного дискретного рядов распределения.

Задача 2 . Имеются данные о стоимости основных фондов у 50 предприятий, тыс. руб.

Построить ряд распределения, выделив 5 групп предприятий (с равными интервалами).

Решение

Для решения выберем наибольшее и наименьшее значения стоимости основных фондов предприятий. Это 30,0 и 10,2 тыс. руб.

Найдем размер интервала: h = (30,0-10,2):5= 3,96 тыс. руб.

Тогда в первую группу будут входить предприятия, размер основных фондов которых составляет от 10,2 тыс. руб. до 10,2+3,96=14,16 тыс. руб. Таких предприятий будет 9. Во вторую группу войдут предприятия, размер основных фондов которых составит от 14,16 тыс. руб. до 14,16+3,96=18,12 тыс. руб. Таких предприятий будет 16. Аналогично найдем число предприятий, входящих в третью, четвертую и пятую группы.

Полученный ряд распределения поместим в таблицу.

Задача 3 . По ряду предприятий легкой промышленности получены следующие данные:

Произведите группировку предприятий по числу рабочих, образуя 6 групп с равными интервалами. Подсчитайте по каждой группе:

1. число предприятий
2. число рабочих
3. объем произведенной продукции за год
4. среднюю фактическую выработку одного рабочего
5. объем основных средств
6. средний размер основных средств одного предприятия
7. среднюю величину произведенной продукции одним предприятием

Результаты расчета оформите в таблицы. Сделайте выводы.

Решение

Для решения выберем наибольшее и наименьшее значения среднесписочного числа рабочих на предприятии. Это 43 и 256.

Найдем размер интервала: h = (256-43):6 = 35,5

Тогда в первую группу будут входить предприятия, среднесписочное число рабочих на которых составляет от 43 до 43+35,5=78,5 человек. Таких предприятий будет 5. Во вторую группу войдут предприятия, среднесписочное число рабочих на которых составит от 78,5 до 78,5+35,5=114 человек. Таких предприятий будет 12. Аналогично найдем число предприятий, входящих в третью, четвертую, пятую и шестую группы.

Полученный ряд распределения поместим в таблицу и вычислим необходимые показатели по каждой группе:

Вывод : Как видно из таблицы, вторая группа предприятий является самой многочисленной. В нее входят 12 предприятий. Самыми малочисленными являются пятая и шестая группы (по два предприятия). Это самые крупные предприятия (по числу рабочих).

Поскольку вторая группа самая многочисленная, объем произведенной продукции за год предприятиями этой группы и объем основных средств значительно выше других. Вместе с тем средняя фактическая выработка одного рабочего на предприятиях этой группы наибольшей не является. Здесь лидируют предприятия четвертой группы. На эту группу приходится и довольно большой объем основных средств.

В заключении отметим, что средний размер основных средств и средняя величина произведенной продукции одного предприятия прямо пропорциональны размерам предприятия (по числу рабочих).

При обработке больших массивов информации, что особенно актуально при проведении современных научных разработок, перед исследователем стоит серьезная задача правильной группировки исходных данных. Если данные имеют дискретный характер, то проблем, как мы видели, не возникает – необходимо просто подсчитать частотукаждого признака. Если же исследуемый признак имеет непрерывный характер (что имеет большее распространение на практике), то выбор оптимального числа интервалов группировки признака является отнюдь не тривиальной задачей.

Для группировки непрерывных случайных величин весь вариационный размах признакаразбивают на некоторое количество интервалов к.

Сгруппированным интервальным (непрерывным ) вариационным рядом называют ранжированные по значению признака интервалы (), гдеуказанные вместе с соответствующими частотами () числа наблюдений, попавших в г"-й интервал, или относительными частотами ():

Интервалы значений признака
Частота mi

Гистограмма и кумулята {огива), уже подробно рассмотренные нами, являются прекрасным средством визуализации данных, позволяющим получить первичное представление о структуре данных. Такие графики (рис. 1.15) строятся для непрерывных данных так же, как и для дискретных, только с учетом того, что непрерывные данные сплошь заполняют область своих возможных значений, принимая любые значения.

Рис. 1.15.

Поэтому столбцы на гистограмме и кумуляте должны соприкасаться, не иметь участков, куда не попадают значения признака в пределах всех возможных (т.е. гистограмма и кумулята не должны иметь "дырок" по оси абсцисс, в которые не попадают значения изучаемой переменной, как на рис. 1.16). Высота столбика соответствует частоте– числу наблюдений, попавших в данный интервал, или относительной частоте– доле наблюдений. Интервалы не должны пересекаться и имеют, как правило, одинаковую ширину.

Рис. 1.16.

Гистограмма и полигон являются аппроксимациями кривой плотности вероятности (дифференциальной функции) f(x) теоретического распределения, рассматриваемой в курсе теории вероятностей . Поэтому их построение имеет такое важное значение при первичной статистической обработке количественных непрерывных данных – по их виду можно судить о гипотетическом законе распределения.

Кумулята – кривая накопленных частот (частостей) интервального вариационного ряда. С кумулятой сопоставляется график интегральной функции распределения F(x) , также рассматриваемой в курсе теории вероятностей.

В основном понятия гистограммы и кумуляты связывают именно с непрерывными данными и их интервальными вариационными рядами, так как их графики являются эмпирическими оценками функции плотности вероятности и функции распределения соответственно.

Построение интервального вариационного ряда начинают с определения числа интервалов k. И эта задача, пожалуй, является самой сложной, важной и неоднозначной в изучаемом вопросе.

Число интервалов не должно быть слишком малым, так как при этом гистограмма получается слишком сглаженной (oversmoothed), теряет все особенности изменчивости исходных данных – на рис. 1.17 можно увидеть, как те же данные, по которым построены графики рис. 1.15, использованы для построения гистограммы с меньшим числом интервалов (левый график).

В то же время число интервалов не должно быть слишком велико – иначе мы не сможем оценить плотность распределения изучаемых данных по числовой оси: гистограмма получится недосглажепная (undersmoothed), с незаполненными интервалами, неравномерная (см. рис. 1.17, правый график).

Рис. 1.17.

Как же определить наиболее предпочтительное число интервалов?

Еще в 1926 г. Герберт Стерджес (Herbert Sturges) предложил формулу для вычисления количества интервалов, на которые необходимо разбить исходное множество значений изучаемого признака . Эта формула поистине стала сверхпопулярной – большинство статистических учебников предлагают именно ее, по умолчанию ее используют и множество статистических пакетов. Насколько это оправдано и во всех ли случаях – является весьма серьезным вопросом.

Итак, на чем основана формула Стерджеса?

Рассмотрим биномиальное распределение }