Расчёт коэффициента детерминации: формула, примеры и онлайн-калькулятор
- Коэффициент детерминации R² показывает долю разброса зависимой переменной, объяснённую моделью; значения от 0 до 1, где 1 — идеальная подгонка.
- Формула R² = 1 – (SS_res / SS_tot), где SS_res — сумма квадратов остатков, SS_tot — общая сумма квадратов.
- В Excel R² вычисляется функцией RSQ() или через тренд на графике; для быстрой проверки используйте онлайн-калькулятор.
- Высокий R² (0.9+) не гарантирует отсутствие ошибок — всегда проверяйте остатки на случайность.
- Для множественной регрессии применяйте скорректированный R², чтобы учесть количество предикторов.
- Что такое коэффициент детерминации и зачем он нужен?
- Формула коэффициента детерминации: разбор каждого символа
- Пример 1: Простая линейная регрессия — рост и вес
- Пример 2: Множественная регрессия — цена квартиры
- Пример 3: Нелинейная зависимость — скорость и тормозной путь
- Типичные ошибки при интерпретации R²
- Как быстро посчитать R² онлайн: калькулятор за 3 шага
- Мини-задачки для самопроверки
Что такое коэффициент детерминации и зачем он нужен?
Представьте, что вы заказываете пиццу и хотите понять, зависит ли время доставки от расстояния до пиццерии. Вы собрали данные: для 10 заказов записали расстояние (км) и время (мин). Теперь нужно узнать, насколько хорошо расстояние объясняет время. Коэффициент детерминации (R²) даёт ответ в процентах: 0,8 означает, что 80% изменчивости времени доставки объясняется расстоянием, а 20% — другими факторами (пробки, погода).
R² — это число от 0 до 1 (или от 0% до 100%). Чем ближе к 1, тем точнее модель. В статистике его используют для оценки качества регрессионных моделей. Если R² = 0, модель не работает — линия не лучше среднего значения. Если R² = 1, модель идеальна (в реальности почти не бывает).
Формула коэффициента детерминации: разбор каждого символа
Формула коэффициента детерминации выглядит устрашающе, но на самом деле это просто отношение. Вот она:
Где:
- SS_res (сумма квадратов остатков) — сумма квадратов разностей между фактическими значениями (y) и предсказанными по модели (ŷ). Показывает, какую ошибку делает модель.
- SS_tot (общая сумма квадратов) — сумма квадратов разностей между фактическими значениями (y) и их средним (ȳ). Показывает общий разброс данных.
Другими словами, R² = 1 − (ошибка модели) / (общий разброс). Если ошибка мала, R² близок к 1.
Ещё формулу можно записать через дисперсии: R² = 1 − (Var(остатков) / Var(y)). Но первый вариант удобнее для ручного счёта.
Пример 1: Простая линейная регрессия — рост и вес
Допустим, мы изучаем зависимость веса (y, кг) от роста (x, см) у 5 человек. Данные:
| Рост, x | Вес, y |
|---|---|
| 160 | 55 |
| 170 | 70 |
| 175 | 75 |
| 180 | 80 |
| 190 | 90 |
Шаг 1. Найдём среднее y: ȳ = (55+70+75+80+90)/5 = 74.
Шаг 2. Вычислим SS_tot: (55-74)² + (70-74)² + (75-74)² + (80-74)² + (90-74)² = 361+16+1+36+256 = 670.
Шаг 3. Построим модель линейной регрессии: ŷ = a + b·x. Найдём a и b по МНК. Для краткости: b = 1,05, a = -112,5. Тогда предсказания: для 160: ŷ=55,5; 170: ŷ=66; 175: ŷ=71,25; 180: ŷ=76,5; 190: ŷ=87.
Шаг 4. Вычислим SS_res: (55-55,5)² + (70-66)² + (75-71,25)² + (80-76,5)² + (90-87)² = 0,25+16+14,0625+12,25+9 = 51,5625.
Шаг 5. R² = 1 − 51,5625/670 ≈ 1 − 0,077 = 0,923. Это отлично: 92,3% изменчивости веса объясняется ростом.
Пример 2: Множественная регрессия — цена квартиры
Теперь усложним: оцениваем цену квартиры (y, млн руб.) по площади (x₁, кв.м) и расстоянию до метро (x₂, км). Данные для 6 квартир:
| Площадь, x₁ | До метро, x₂ | Цена, y |
|---|---|---|
| 30 | 0.5 | 4.0 |
| 40 | 1.0 | 5.5 |
| 50 | 0.8 | 6.0 |
| 60 | 1.5 | 7.0 |
| 70 | 2.0 | 8.5 |
| 80 | 2.5 | 9.0 |
Среднее y: ȳ = (4+5,5+6+7+8,5+9)/6 = 6,67. SS_tot: (4-6,67)²+... = 7,13+1,37+0,45+0,11+3,35+5,43 = 17,84.
По МНК построим модель: ŷ = 0,1·x₁ + 2·x₂ + 1. Получаем предсказания: 30,0.5: 0,1*30+2*0,5+1=3+1+1=5; 40,1:4+2+1=7; 50,0.8:5+1,6+1=7,6; 60,1.5:6+3+1=10; 70,2:7+4+1=12; 80,2.5:8+5+1=14. Сравните с фактическими: 4, 5.5, 6, 7, 8.5, 9 — видны большие остатки.
SS_res: (4-5)²+(5.5-7)²+(6-7.6)²+(7-10)²+(8.5-12)²+(9-14)² = 1+2,25+2,56+9+12,25+25 = 52,06.
R² = 1 − 52,06/17,84 = 1 − 2,92 = −1,92 (отрицательный) — модель ужасна. Причина: неправильные коэффициенты. В реальности модель бы подбирали иначе, но для примера показательно, что R² может быть ниже 0 при плохой модели.
- 1Соберите данные
Запишите пары (x,y) для каждого наблюдения.
- 2Найдите среднее y
Сложите все y и поделите на количество.
- 3Вычислите SS_tot
Сумма квадратов отклонений y от среднего.
- 4Постройте модель и найдите ŷ
Получите предсказанные значения.
- 5Вычислите SS_res
Сумма квадратов разностей y и ŷ.
- 6Примените формулу
R² = 1 - SS_res/SS_tot.
- 7Интерпретируйте результат
0 - плохо, 1 - идеально, проверьте остатки.
Пример 3: Нелинейная зависимость — скорость и тормозной путь
Из физики: тормозной путь (м) пропорционален квадрату скорости (км/ч). Данные:
| Скорость, x | Путь, y |
|---|---|
| 20 | 6 |
| 40 | 20 |
| 60 | 42 |
| 80 | 72 |
| 100 | 110 |
Если применить линейную регрессию, модель будет плохой. Преобразуем x в x²: новые данные: 400, 1600, 3600, 6400, 10000. Строим линейную регрессию y от x². Находим среднее y: (6+20+42+72+110)/5 = 50. SS_tot: (6-50)²+... = 1936+900+64+484+3600 = 6984.
Модель: ŷ = 0,011·x² + 0,5. Предсказания: для 400: 0,011*400+0,5=4,9; 1600: 18,1; 3600: 40,1; 6400: 70,9; 10000: 110,5. Остатки: 6-4,9=1,1 (1,21); 20-18,1=1,9 (3,61); 42-40,1=1,9 (3,61); 72-70,9=1,1 (1,21); 110-110,5=-0,5 (0,25). SS_res = 1,21+3,61+3,61+1,21+0,25 = 9,89.
R² = 1 − 9,89/6984 ≈ 0,9986. Модель почти идеальна.
🧠 Тест: проверьте понимание R²
1. Что означает R² = 0,85?
2. Может ли R² быть отрицательным?
3. SS_res = 20, SS_tot = 100. R² =?
4. Что делать с выбросами?
5. Какой R² считается хорошим?
Типичные ошибки при интерпретации R²
«Чем выше R², тем лучше модель» — это не всегда так. Высокий R² может быть из-за переобучения, особенно при малом числе наблюдений или большом количестве предикторов.
- Ошибка 1: Сравнение R² для моделей с разным числом предикторов. Всегда используйте скорректированный R².
- Ошибка 2: Принятие R²=0 как отсутствия связи. Возможна нелинейная зависимость.
- Ошибка 3: Игнорирование выбросов. Один выброс может сильно исказить R².
- Ошибка 4: Уверенность, что высокий R² означает причинно-следственную связь. Это корреляция, не более.
Всегда стройте график остатков: если они не случайны, модель неадекватна, даже при высоком R².
Как быстро посчитать R² онлайн: калькулятор за 3 шага
Вместо ручного счёта можно использовать наш Калькулятор коэффициента детерминации. Просто введите пары данных (x и y), и он мгновенно выдаст R², а также коэффициенты регрессии.
Инструкция:
- Откройте страницу калькулятора.
- Введите данные в поле «X» (независимая переменная) и «Y» (зависимая), разделяя числа запятыми или пробелами.
- Нажмите «Рассчитать» — получите R², уравнение регрессии и график.
Калькулятор подходит для проверки ручных расчётов и быстрого анализа. Также на сайте есть другие полезные инструменты: Калькулятор коэффициента вариации для оценки разброса данных, Калькулятор коэффициента трения для физиков, Калькулятор коэффициента атерогенности для здоровья, Калькулятор коэффициента распределения для химиков.
Мини-задачки для самопроверки
Попробуйте решить сами, а потом сверьтесь с ответами.
- Задача 1. Даны точки: (1,2), (2,4), (3,6). Найдите R² линейной регрессии y=2x. (Ответ: 1, так как модель идеальна).
- Задача 2. Те же точки, но модель y=2x+1. Предсказания: 3,5,7. Факт: 2,4,6. Найдите R². (Ответ: 0).
- Задача 3. SS_res=10, SS_tot=100. Чему равен R²? (Ответ: 0,9).
- Задача 4. Если модель хуже среднего, какой знак у R²? (Ответ: отрицательный).
- Задача 5. Можно ли получить R²>1? (Ответ: нет, максимум 1).
🧮 Посчитайте сами — инструменты по теме
🧭 Разделы по теме
Частые вопросы
Как интерпретировать коэффициент детерминации 0,75?
Это значит, что 75% изменчивости зависимой переменной объясняется моделью, а 25% — случайными факторами. В социальных науках это хороший результат, в точных — средний.
Чем отличается R² от скорректированного R²?
Скорректированный R² штрафует за добавление лишних предикторов, поэтому его используют в множественной регрессии. Обычный R² всегда растёт при добавлении переменных, даже если они бесполезны.
Какой коэффициент детерминации считается хорошим?
Зависит от области. В физике и инженерии R²>0,9 считается отличным, в экономике — 0,5-0,8, в социологии — 0,3-0,6. В любом случае, нужно смотреть на контекст.
Может ли R² быть больше 1?
Нет, R² всегда между 0 и 1 (или между 0% и 100%). Отрицательные значения возможны, если модель хуже, чем просто среднее значение.
Как посчитать R² в Excel?
Используйте функцию RSQ(известные_y; известные_x) или добавьте линию тренда на график и отметьте «Показать величину достоверности аппроксимации (R²)».
Что делать, если R² низкий?
Попробуйте добавить другие переменные, преобразовать данные (например, взять логарифм), удалить выбросы или использовать нелинейную модель. Иногда низкий R² говорит о том, что связь слабая.
Влияет ли количество данных на R²?
Да, при малой выборке R² может быть завышен. Чем больше данных, тем надёжнее оценка.
Можно ли сравнивать R² разных моделей?
Только если модели построены на одних и тех же данных и имеют одинаковое число предикторов. Иначе используйте скорректированный R² или информационные критерии (AIC, BIC).
Источники и нормативные документы
- Wikipedia: Коэффициент детерминации
- Statista: R² в анализе данных
- Курс «Статистика» на Coursera
- Росстат: методология регрессионного анализа