Вопросы после параграфа §57 на странице 268, ГДЗ по математике за 10 и 11 класс к учебнику Высоцкого. Вероятность и статистика базовый и углубленный уровни
Обе величины описывают связь массивов \(x = (x_1,\ \ldots,\ x_n)\) и \(y = (y_1,\ \ldots,\ y_n)\) и различаются только знаменателем: у статистической ковариации он равен \(n\), у выборочной — \(n - 1\).
\[\mathrm{cov}(x,\ y) = \frac{(x_1 - \overline{x})(y_1 - \overline{y}) + \ldots + (x_n - \overline{x})(y_n - \overline{y})}{n}, \qquad \mathrm{cov}_{\text{в}}(x,\ y) = \frac{n}{n - 1}\,\mathrm{cov}(x,\ y).\]
Выборочная ковариация нужна, когда пары наблюдений — выборка из генеральной совокупности: деление на \(n\) даёт заниженную по модулю оценку, а деление на \(n - 1\) — несмещённую.
Ответ: различие только в знаменателе — у статистической ковариации он равен \(n\), у выборочной равен \(n - 1\), поэтому \(\mathrm{cov}_{\text{в}}(x,\ y) = \dfrac{n}{n - 1}\mathrm{cov}(x,\ y)\); выборочная ковариация применяется, когда массив пар наблюдений является выборкой и нужна несмещённая оценка ковариации генеральной совокупности.
Множитель \(\dfrac{n}{n - 1}\) больше единицы, поэтому по модулю выборочная ковариация больше обычной; но знак у обеих величин один и тот же, и при отрицательной ковариации выборочная меньше обычной.
Пусть \(x = (1;\ 2;\ 3;\ 4)\) и \(y = (2;\ 4;\ 5;\ 9)\): \(\overline{x} = 2{,}5\), \(\overline{y} = 5\), отклонения массива \(x\) равны \(-1{,}5\); \(-0{,}5\); \(0{,}5\); \(1{,}5\), отклонения массива \(y\) равны \(-3\); \(-1\); \(0\); \(4\), сумма произведений отклонений равна \(4{,}5 + 0{,}5 + 0 + 6 = 11\), откуда \(\mathrm{cov}(x,\ y) = \dfrac{11}{4} = 2{,}75\), а \(\mathrm{cov}_{\text{в}}(x,\ y) = \dfrac{11}{3} \approx 3{,}667\) — выборочная ковариация больше.
При том же массиве \(x\) и массиве \(y = (9;\ 5;\ 4;\ 2)\) сумма произведений отклонений равна \(-11\), поэтому \(\mathrm{cov}(x,\ y) = -2{,}75\), а \(\mathrm{cov}_{\text{в}}(x,\ y) \approx -3{,}667\) — выборочная ковариация меньше.
При нулевой ковариации обе величины равны нулю.
Ответ: по модулю выборочная ковариация больше обычной в \(\dfrac{n}{n - 1}\) раза; при положительной ковариации выборочная больше обычной, при отрицательной — меньше, а при нулевой обе величины равны нулю.
Коэффициент корреляции \(\mathrm{r}_{x,\,y} = \dfrac{\mathrm{cov}(x,\ y)}{S_x S_y}\), где \(S_x\) и \(S_y\) — стандартные отклонения массивов. Модуль ковариации не превосходит произведения стандартных отклонений, \(|\mathrm{cov}(x,\ y)| \leqslant S_x S_y\), поэтому
\[-1 \leqslant \mathrm{r}_{x,\,y} \leqslant 1.\]
Значение \(1\) достигается, когда все точки \((x_k;\ y_k)\) лежат на одной возрастающей прямой, значение \(-1\) — когда все они лежат на одной убывающей прямой, значение \(0\) означает отсутствие линейной связи. Единиц измерения у коэффициента корреляции нет: в дроби единицы числителя и знаменателя сокращаются.
Ответ: наибольшее значение коэффициента корреляции равно \(1\) (все точки на одной возрастающей прямой), наименьшее равно \(-1\) (все точки на одной убывающей прямой); коэффициент корреляции безразмерен.
Значение \(0{,}999\) почти достигает наибольшего возможного значения \(1\): можно предположить очень сильную, почти жёсткую положительную линейную связь между случайными величинами \(X\) и \(Y\) — точки \((x_k;\ y_k)\) почти лежат на одной возрастающей прямой.
Это предположение, а не доказанный факт: число \(0{,}999\) получено по выборке, а выборочный коэффициент корреляции сам является случайной величиной; к тому же надёжно судить по нему о линейной связи можно тогда, когда обе величины распределены нормально.
Ответ: можно предположить, что между \(X\) и \(Y\) есть очень сильная, почти жёсткая положительная линейная связь и точки наблюдений почти лежат на одной возрастающей прямой; вывод остаётся предположением, потому что выборочный коэффициент корреляции сам случаен, а надёжно судить по нему о связи можно тогда, когда обе величины распределены нормально.
Обе величины описывают связь двух упорядоченных массивов данных \(x = (x_1,\ \ldots,\ x_n)\) и \(y = (y_1,\ \ldots,\ y_n)\) и различаются только знаменателем. Статистическая ковариация — среднее произведение отклонений от средних, знаменатель равен \(n\):
\[\mathrm{cov}(x,\ y) = \frac{(x_1 - \overline{x})(y_1 - \overline{y}) + \ldots + (x_n - \overline{x})(y_n - \overline{y})}{n}.\]
У выборочной ковариации знаменатель на единицу меньше:
\[\mathrm{cov}_{\text{в}}(x,\ y) = \frac{(x_1 - \overline{x})(y_1 - \overline{y}) + \ldots + (x_n - \overline{x})(y_n - \overline{y})}{n - 1} = \frac{n}{n - 1}\,\mathrm{cov}(x,\ y).\]
Выборочная ковариация нужна тогда, когда массив пар наблюдений — это выборка из генеральной совокупности и по выборке оценивают ковариацию всей совокупности. Деление на \(n\) даёт систематически заниженную по модулю оценку, а деление на \(n - 1\) делает оценку несмещённой. Так, при \(n = 12\) поправочный множитель равен \(\dfrac{12}{11}\), а при \(n = 100\) — уже \(\dfrac{100}{99}\): чем больше наблюдений, тем меньше разница между двумя величинами.
Ответ: различие только в знаменателе — у статистической ковариации он равен \(n\), у выборочной равен \(n - 1\), поэтому \(\mathrm{cov}_{\text{в}}(x,\ y) = \dfrac{n}{n - 1}\mathrm{cov}(x,\ y)\); выборочная ковариация применяется, когда массив пар наблюдений является выборкой и нужна несмещённая оценка ковариации генеральной совокупности.
Множитель \(\dfrac{n}{n - 1}\) больше единицы, поэтому по модулю выборочная ковариация больше обычной, если ковариация не равна нулю. Но «больше по модулю» и «больше» — не одно и то же: знак у обеих величин один и тот же, и при отрицательной ковариации выборочная оказывается меньше обычной.
Возьмём четыре пары наблюдений \(x = (1;\ 2;\ 3;\ 4)\) и \(y = (2;\ 4;\ 5;\ 9)\). Здесь \(\overline{x} = 2{,}5\), \(\overline{y} = 5\), отклонения массива \(x\) равны \(-1{,}5\); \(-0{,}5\); \(0{,}5\); \(1{,}5\), отклонения массива \(y\) равны \(-3\); \(-1\); \(0\); \(4\), и сумма произведений отклонений равна \(4{,}5 + 0{,}5 + 0 + 6 = 11\). Значит, \(\mathrm{cov}(x,\ y) = \dfrac{11}{4} = 2{,}75\), а \(\mathrm{cov}_{\text{в}}(x,\ y) = \dfrac{11}{3} \approx 3{,}667\) — выборочная ковариация больше.
Возьмём тот же массив \(x\) и массив \(y = (9;\ 5;\ 4;\ 2)\). Среднее прежнее, \(\overline{y} = 5\), отклонения равны \(4\); \(0\); \(-1\); \(-3\), сумма произведений отклонений равна \(-6 + 0 - 0{,}5 - 4{,}5 = -11\). Теперь \(\mathrm{cov}(x,\ y) = -2{,}75\), а \(\mathrm{cov}_{\text{в}}(x,\ y) \approx -3{,}667\) — выборочная ковариация меньше обычной.
Если ковариация равна нулю, то и выборочная ковариация равна нулю: величины совпадают.
Ответ: по модулю выборочная ковариация больше обычной в \(\dfrac{n}{n - 1}\) раза; при положительной ковариации выборочная больше обычной, при отрицательной — меньше, а при нулевой обе величины равны нулю.
Коэффициент линейной корреляции массивов \(x\) и \(y\) — это число \(\mathrm{r}_{x,\,y} = \dfrac{\mathrm{cov}(x,\ y)}{S_x S_y}\). Модуль ковариации не превосходит произведения стандартных отклонений: \(|\mathrm{cov}(x,\ y)| \leqslant S_x S_y\). Разделив обе части на положительное число \(S_x S_y\), получаем \(|\mathrm{r}_{x,\,y}| \leqslant 1\), то есть
\[-1 \leqslant \mathrm{r}_{x,\,y} \leqslant 1.\]
Наибольшее значение \(1\) достигается, когда все точки \((x_k;\ y_k)\) лежат на одной возрастающей прямой — это жёсткая положительная связь. Наименьшее значение \(-1\) достигается, когда все точки лежат на одной убывающей прямой, — жёсткая отрицательная связь. Значение \(0\) означает отсутствие линейной связи.
Единиц измерения у коэффициента корреляции нет никогда: в дроби единицы числителя и знаменателя сокращаются. Поэтому коэффициенты корреляции самых разных величин можно сравнивать между собой.
Ответ: наибольшее значение коэффициента корреляции равно \(1\) (все точки на одной возрастающей прямой), наименьшее равно \(-1\) (все точки на одной убывающей прямой); коэффициент корреляции безразмерен.
Значение \(0{,}999\) почти достигает наибольшего возможного значения \(1\). Значит, можно предположить очень сильную, почти жёсткую положительную линейную связь между случайными величинами \(X\) и \(Y\): точки \((x_k;\ y_k)\) почти лежат на одной возрастающей прямой, и большим значениям одной величины отвечают большие значения другой.
Это именно предположение, а не доказанный факт, и тому две причины. Во-первых, число \(0{,}999\) получено по выборке: коэффициент корреляции двух случайных величин — число, а выборочный коэффициент корреляции сам является случайной величиной, значение которой зависит от того, какая именно выборка получилась. Во-вторых, надёжные выводы о линейной связи по коэффициенту корреляции можно делать не всегда: его распределение известно не для любых совместных величин, а хорошо изучен случай, когда обе величины \(X\) и \(Y\) имеют нормальное распределение.
Ответ: можно предположить, что между \(X\) и \(Y\) есть очень сильная, почти жёсткая положительная линейная связь и точки наблюдений почти лежат на одной возрастающей прямой; вывод остаётся предположением, потому что выборочный коэффициент корреляции сам случаен, а надёжно судить по нему о связи можно тогда, когда обе величины распределены нормально.