Вопросы после параграфа §59 на странице 275, ГДЗ по математике за 10 и 11 класс к учебнику Высоцкого. Вероятность и статистика базовый и углубленный уровни
Неверно. Наклон оси диаграммы — это угловой коэффициент \(\hat{a} = \dfrac{\mathrm{cov}(x,\ y)}{S_x^2}\), а силу линейной связи измеряет коэффициент корреляции \(\mathrm{r}_{x,\,y} = \dfrac{\mathrm{cov}(x,\ y)}{S_x S_y}\): наклон зависит от единиц измерения, а коэффициент корреляции — нет.
Пусть \(S_x = 2\), \(S_y = 3\) и \(\mathrm{cov}(x,\ y) = 4{,}8\):
\[\hat{a} = \frac{4{,}8}{2^2} = 1{,}2, \qquad \mathrm{r}_{x,\,y} = \frac{4{,}8}{2 \cdot 3} = 0{,}8.\]
Станем измерять величину \(y\) в дециметрах вместо метров: значения массива \(y\) умножатся на \(10\), вместе с ними вырастут ковариация и стандартное отклонение \(S_y\), а \(S_x\) не изменится:
\[\hat{a} = \frac{48}{2^2} = 12, \qquad \mathrm{r}_{x,\,y} = \frac{48}{2 \cdot 30} = 0{,}8.\]
Связь та же, а наклон вырос в десять раз при прежнем коэффициенте корреляции: наклон отвечает на другой вопрос — на сколько в среднем меняется \(y\), когда \(x\) увеличивается на единицу.
Ответ: неверно; наклон оси диаграммы зависит от единиц измерения величин и показывает, на сколько в среднем меняется \(y\) при увеличении \(x\) на единицу, а силу линейной связи измеряет только коэффициент корреляции, который от единиц измерения не зависит.
Линейная регрессия — это приближённая модель связи двух случайных величин, в которой связь считается линейной, но не жёсткой: значения \(Y\) отклоняются от прямой \(y = ax + b\) на случайную величину \(\varepsilon\). Уравнение линейной регрессии:
\[Y = aX + b + \varepsilon.\]
Здесь \(a\) — угловой коэффициент, \(b\) — свободный член, \(\varepsilon\) — случайное отклонение; для наблюдения с номером \(k\) получается \(\varepsilon_k = y_k - (ax_k + b)\) — вертикальное отклонение точки \((x_k;\ y_k)\) от прямой. Сама эта прямая называется осью диаграммы рассеивания.
Ответ: линейная регрессия — это модель \(Y = aX + b + \varepsilon\), в которой \(X\) и \(Y\) связаны линейно, но не жёстко: значения \(Y\) отклоняются от прямой \(y = ax + b\) — оси диаграммы рассеивания — на случайную величину \(\varepsilon\).
Угловой коэффициент \(a\) и свободный член \(b\) подбирают так, чтобы сумма квадратов случайных отклонений была как можно меньше:
\[\varepsilon_1^2 + \varepsilon_2^2 + \ldots + \varepsilon_n^2 \to \min.\]
Берут именно квадраты: у самих отклонений разные знаки, и их сумму всегда можно обратить в нуль, а квадраты неотрицательны. Такой подбор даёт выборочные оценки коэффициентов:
\[\hat{a} = \frac{\mathrm{cov}(x,\ y)}{S_x^2}\ \text{и}\ \hat{b} = \overline{y} - \hat{a} \cdot \overline{x}.\]
Ответ: метод наименьших квадратов состоит в том, что угловой коэффициент и свободный член прямой подбирают так, чтобы сумма квадратов отклонений \(\varepsilon_1^2 + \varepsilon_2^2 + \ldots + \varepsilon_n^2\) была как можно меньше; он даёт оценки \(\hat{a} = \dfrac{\mathrm{cov}(x,\ y)}{S_x^2}\) и \(\hat{b} = \overline{y} - \hat{a} \cdot \overline{x}\).
Коэффициенты \(a\) и \(b\) самой модели \(Y = aX + b + \varepsilon\) — постоянные числа: они описывают связь двух случайных величин и от опыта не зависят, хотя и остаются неизвестными.
Вычисленные по наблюдениям \(\hat{a}\) и \(\hat{b}\) — случайные величины: они собраны из \(\mathrm{cov}(x,\ y)\), \(S_x^2\), \(\overline{x}\) и \(\overline{y}\), то есть целиком из выборки, и повторённый опыт даст другие значения. Потому оценки и пишут со шляпкой.
Ответ: сами коэффициенты \(a\) и \(b\) — постоянные неизвестные числа, а вычисленные методом наименьших квадратов оценки \(\hat{a}\) и \(\hat{b}\) — случайные величины, значения которых зависят от того, какая выборка получилась.
Шестнадцать пар «гематокрит — уровень гемоглобина» сняты у одной собаки: эрдельтерьер, возраст 10 лет, диагноз — хроническая почечная недостаточность. Выборка репрезентативна, когда её элементы попадают в неё случайно и независимо из той совокупности, о которой делается вывод.
Для популяции всех взрослых собак данные не репрезентативны: все шестнадцать пар относятся к одному животному, собаки других пород, других возрастов и здоровые в выборку не попали вовсе, а измерения, сделанные подряд у одной особи, зависимы — самочувствие собаки за короткий срок меняется мало.
Для совокупности собак той же породы и того же возраста данные не репрезентативны по той же причине: шестнадцать пар описывают одну особь, и отделить её индивидуальные особенности и течение болезни от общей для породы связи невозможно.
Ответ: нет в обоих случаях: шестнадцать пар сняты у одной десятилетней собаки породы эрдельтерьер с хронической почечной недостаточностью, измерения зависимы, и ни популяцию всех взрослых собак, ни совокупность собак этой породы и этого возраста они не представляют — для этого пары значений надо собирать у разных случайно выбранных собак нужной породы и возраста.
Неверно. Наклон оси диаграммы — это угловой коэффициент \(\hat{a} = \dfrac{\mathrm{cov}(x,\ y)}{S_x^2}\), а силу линейной связи измеряет коэффициент корреляции \(\mathrm{r}_{x,\,y} = \dfrac{\mathrm{cov}(x,\ y)}{S_x S_y}\). Знаменатели у них разные, и ведут себя эти числа по-разному: наклон зависит от единиц измерения, а коэффициент корреляции — нет.
Пусть по наблюдениям получилось \(S_x = 2\), \(S_y = 3\) и \(\mathrm{cov}(x,\ y) = 4{,}8\). Тогда
\[\hat{a} = \frac{4{,}8}{2^2} = 1{,}2, \qquad \mathrm{r}_{x,\,y} = \frac{4{,}8}{2 \cdot 3} = 0{,}8.\]
Станем измерять ту же величину \(y\) в единицах вдесятеро мельче — скажем, не в метрах, а в дециметрах. Все значения массива \(y\) умножатся на \(10\), вместе с ними в десять раз вырастут ковариация и стандартное отклонение \(S_y\), а \(S_x\) не изменится:
\[\hat{a} = \frac{48}{2^2} = 12, \qquad \mathrm{r}_{x,\,y} = \frac{48}{2 \cdot 30} = 0{,}8.\]
Наблюдения те же самые, связь та же самая, а наклон вырос в десять раз, тогда как коэффициент корреляции остался прежним. Наклон отвечает на другой вопрос: на сколько в среднем меняется \(y\), когда \(x\) увеличивается на единицу.
Ответ: неверно; наклон оси диаграммы зависит от единиц измерения величин и показывает, на сколько в среднем меняется \(y\) при увеличении \(x\) на единицу, а силу линейной связи измеряет только коэффициент корреляции, который от единиц измерения не зависит.
Линейная регрессия — это приближённая модель связи двух случайных величин, в которой связь считается линейной, но не жёсткой: значения \(Y\) отклоняются от прямой \(y = ax + b\) на какую-то случайную величину \(\varepsilon\). Уравнение линейной регрессии:
\[Y = aX + b + \varepsilon.\]
Здесь \(a\) — угловой коэффициент, \(b\) — свободный член, \(\varepsilon\) — случайное отклонение. Для наблюдения с номером \(k\) модель даёт \(y_k = ax_k + b + \varepsilon_k\), то есть \(\varepsilon_k = y_k - (ax_k + b)\), и число \(\varepsilon_k\) следует понимать как случайное вертикальное отклонение точки \((x_k;\ y_k)\) от прямой \(y = ax + b\). Сама эта прямая называется осью диаграммы рассеивания.
Если бы связь была жёсткой, все точки легли бы точно на прямую и все отклонения равнялись бы нулю. В модели линейной регрессии они не нули, но их стараются сделать как можно меньше.
Ответ: линейная регрессия — это модель \(Y = aX + b + \varepsilon\), в которой \(X\) и \(Y\) связаны линейно, но не жёстко: значения \(Y\) отклоняются от прямой \(y = ax + b\) — оси диаграммы рассеивания — на случайную величину \(\varepsilon\).
Ось диаграммы можно проводить по-разному, хоть на глаз. Метод наименьших квадратов, предложенный Гауссом, состоит в том, что угловой коэффициент \(a\) и свободный член \(b\) подбирают так, чтобы сумма квадратов случайных отклонений была как можно меньше:
\[\varepsilon_1^2 + \varepsilon_2^2 + \ldots + \varepsilon_n^2 \to \min.\]
Берут именно квадраты, а не сами отклонения: у отклонений разные знаки, и их сумму всегда можно обратить в нуль, тогда как квадраты неотрицательны и штрафуют промах в любую сторону. Такой подбор даёт выборочные оценки коэффициентов:
\[\hat{a} = \frac{\mathrm{cov}(x,\ y)}{S_x^2}\ \text{и}\ \hat{b} = \overline{y} - \hat{a} \cdot \overline{x}.\]
Ответ: метод наименьших квадратов состоит в том, что угловой коэффициент и свободный член прямой подбирают так, чтобы сумма квадратов отклонений \(\varepsilon_1^2 + \varepsilon_2^2 + \ldots + \varepsilon_n^2\) была как можно меньше; он даёт оценки \(\hat{a} = \dfrac{\mathrm{cov}(x,\ y)}{S_x^2}\) и \(\hat{b} = \overline{y} - \hat{a} \cdot \overline{x}\).
Коэффициенты \(a\) и \(b\) самой модели \(Y = aX + b + \varepsilon\) — постоянные числа: они описывают связь двух случайных величин, от опыта не зависят, хотя и остаются нам неизвестными. А вот вычисленные по наблюдениям \(\hat{a}\) и \(\hat{b}\) — случайные величины. Они собраны из \(\mathrm{cov}(x,\ y)\), \(S_x^2\), \(\overline{x}\) и \(\overline{y}\), то есть целиком из выборки, и повторённый опыт даст другую выборку и другие значения \(\hat{a}\) и \(\hat{b}\). Здесь то же самое, что с коэффициентом корреляции: коэффициент корреляции двух случайных величин — число, а выборочный коэффициент корреляции является случайной величиной, значение которой зависит от случившейся выборки. Потому оценки и пишут со шляпкой — чтобы не путать их с самими коэффициентами.
Ответ: сами коэффициенты \(a\) и \(b\) — постоянные неизвестные числа, а вычисленные методом наименьших квадратов оценки \(\hat{a}\) и \(\hat{b}\) — случайные величины, значения которых зависят от того, какая выборка получилась.
Речь о шестнадцати парах «гематокрит — уровень гемоглобина», снятых у одной собаки: эрдельтерьер, возраст 10 лет, диагноз — хроническая почечная недостаточность. Выборка репрезентативна, когда её элементы попадают в неё случайно и независимо из той самой совокупности, о которой делается вывод.
Для популяции всех взрослых собак эти данные не репрезентативны. Все шестнадцать пар относятся к одному животному — одной породы, одного возраста, да ещё и больному; собаки других пород, других возрастов и здоровые собаки в выборку не попали вовсе. К тому же измерения сделаны подряд у одной особи, и они зависимы: соседние результаты близки просто потому, что самочувствие собаки за короткий срок меняется мало.
Для совокупности собак той же породы и того же возраста данные тоже не репрезентативны, и главная причина та же: шестнадцать пар описывают одну-единственную особь, а не разных собак этой породы. Индивидуальные особенности животного и течение его болезни вошли во все шестнадцать измерений, и отделить их от общей для породы связи по такой выборке невозможно.
Ответ: нет в обоих случаях: шестнадцать пар сняты у одной десятилетней собаки породы эрдельтерьер с хронической почечной недостаточностью, измерения зависимы, и ни популяцию всех взрослых собак, ни совокупность собак этой породы и этого возраста они не представляют — для этого пары значений надо собирать у разных случайно выбранных собак нужной породы и возраста.