Расчёт коэффициента детерминации: формула, примеры и онлайн-калькулятор

📐 Математика и учёбаОбновлено: 20 июля 2026 г.5 мин чтения
Помните чувство, когда вы учили новую тему, а учитель рисовал на доске точки и линии, пытаясь объяснить, насколько хорошо линия регрессии описывает данные? Сейчас будет так же понятно, но без школьной доски. Мы разберём коэффициент детерминации — он же R² — на примерах из жизни: от пиццы до зарплаты. К концу статьи вы сможете не только считать его вручную, но и мгновенно проверять себя с помощью онлайн-калькулятора.
⚡ Коротко: главное
  • Коэффициент детерминации R² показывает долю разброса зависимой переменной, объяснённую моделью; значения от 0 до 1, где 1 — идеальная подгонка.
  • Формула R² = 1 – (SS_res / SS_tot), где SS_res — сумма квадратов остатков, SS_tot — общая сумма квадратов.
  • В Excel R² вычисляется функцией RSQ() или через тренд на графике; для быстрой проверки используйте онлайн-калькулятор.
  • Высокий R² (0.9+) не гарантирует отсутствие ошибок — всегда проверяйте остатки на случайность.
  • Для множественной регрессии применяйте скорректированный R², чтобы учесть количество предикторов.

Что такое коэффициент детерминации и зачем он нужен?

Представьте, что вы заказываете пиццу и хотите понять, зависит ли время доставки от расстояния до пиццерии. Вы собрали данные: для 10 заказов записали расстояние (км) и время (мин). Теперь нужно узнать, насколько хорошо расстояние объясняет время. Коэффициент детерминации (R²) даёт ответ в процентах: 0,8 означает, что 80% изменчивости времени доставки объясняется расстоянием, а 20% — другими факторами (пробки, погода).

R² — это число от 0 до 1 (или от 0% до 100%). Чем ближе к 1, тем точнее модель. В статистике его используют для оценки качества регрессионных моделей. Если R² = 0, модель не работает — линия не лучше среднего значения. Если R² = 1, модель идеальна (в реальности почти не бывает).

Формула коэффициента детерминации: разбор каждого символа

Формула коэффициента детерминации выглядит устрашающе, но на самом деле это просто отношение. Вот она:

R² = 1 − (SS_res / SS_tot)

Где:

  • SS_res (сумма квадратов остатков) — сумма квадратов разностей между фактическими значениями (y) и предсказанными по модели (ŷ). Показывает, какую ошибку делает модель.
  • SS_tot (общая сумма квадратов) — сумма квадратов разностей между фактическими значениями (y) и их средним (ȳ). Показывает общий разброс данных.

Другими словами, R² = 1 − (ошибка модели) / (общий разброс). Если ошибка мала, R² близок к 1.

Ещё формулу можно записать через дисперсии: R² = 1 − (Var(остатков) / Var(y)). Но первый вариант удобнее для ручного счёта.

Пример 1: Простая линейная регрессия — рост и вес

Допустим, мы изучаем зависимость веса (y, кг) от роста (x, см) у 5 человек. Данные:

Рост, xВес, y
16055
17070
17575
18080
19090

Шаг 1. Найдём среднее y: ȳ = (55+70+75+80+90)/5 = 74.

Шаг 2. Вычислим SS_tot: (55-74)² + (70-74)² + (75-74)² + (80-74)² + (90-74)² = 361+16+1+36+256 = 670.

Шаг 3. Построим модель линейной регрессии: ŷ = a + b·x. Найдём a и b по МНК. Для краткости: b = 1,05, a = -112,5. Тогда предсказания: для 160: ŷ=55,5; 170: ŷ=66; 175: ŷ=71,25; 180: ŷ=76,5; 190: ŷ=87.

Шаг 4. Вычислим SS_res: (55-55,5)² + (70-66)² + (75-71,25)² + (80-76,5)² + (90-87)² = 0,25+16+14,0625+12,25+9 = 51,5625.

Шаг 5. R² = 1 − 51,5625/670 ≈ 1 − 0,077 = 0,923. Это отлично: 92,3% изменчивости веса объясняется ростом.

Пример 2: Множественная регрессия — цена квартиры

Теперь усложним: оцениваем цену квартиры (y, млн руб.) по площади (x₁, кв.м) и расстоянию до метро (x₂, км). Данные для 6 квартир:

Площадь, x₁До метро, x₂Цена, y
300.54.0
401.05.5
500.86.0
601.57.0
702.08.5
802.59.0

Среднее y: ȳ = (4+5,5+6+7+8,5+9)/6 = 6,67. SS_tot: (4-6,67)²+... = 7,13+1,37+0,45+0,11+3,35+5,43 = 17,84.

По МНК построим модель: ŷ = 0,1·x₁ + 2·x₂ + 1. Получаем предсказания: 30,0.5: 0,1*30+2*0,5+1=3+1+1=5; 40,1:4+2+1=7; 50,0.8:5+1,6+1=7,6; 60,1.5:6+3+1=10; 70,2:7+4+1=12; 80,2.5:8+5+1=14. Сравните с фактическими: 4, 5.5, 6, 7, 8.5, 9 — видны большие остатки.

SS_res: (4-5)²+(5.5-7)²+(6-7.6)²+(7-10)²+(8.5-12)²+(9-14)² = 1+2,25+2,56+9+12,25+25 = 52,06.

R² = 1 − 52,06/17,84 = 1 − 2,92 = −1,92 (отрицательный) — модель ужасна. Причина: неправильные коэффициенты. В реальности модель бы подбирали иначе, но для примера показательно, что R² может быть ниже 0 при плохой модели.

Как вычислить R² за 5 шагов
  1. 1
    Соберите данные

    Запишите пары (x,y) для каждого наблюдения.

  2. 2
    Найдите среднее y

    Сложите все y и поделите на количество.

  3. 3
    Вычислите SS_tot

    Сумма квадратов отклонений y от среднего.

  4. 4
    Постройте модель и найдите ŷ

    Получите предсказанные значения.

  5. 5
    Вычислите SS_res

    Сумма квадратов разностей y и ŷ.

  6. 6
    Примените формулу

    R² = 1 - SS_res/SS_tot.

  7. 7
    Интерпретируйте результат

    0 - плохо, 1 - идеально, проверьте остатки.

Пошаговая инструкция ручного расчёта коэффициента детерминации.

Пример 3: Нелинейная зависимость — скорость и тормозной путь

Из физики: тормозной путь (м) пропорционален квадрату скорости (км/ч). Данные:

Скорость, xПуть, y
206
4020
6042
8072
100110

Если применить линейную регрессию, модель будет плохой. Преобразуем x в x²: новые данные: 400, 1600, 3600, 6400, 10000. Строим линейную регрессию y от x². Находим среднее y: (6+20+42+72+110)/5 = 50. SS_tot: (6-50)²+... = 1936+900+64+484+3600 = 6984.

Модель: ŷ = 0,011·x² + 0,5. Предсказания: для 400: 0,011*400+0,5=4,9; 1600: 18,1; 3600: 40,1; 6400: 70,9; 10000: 110,5. Остатки: 6-4,9=1,1 (1,21); 20-18,1=1,9 (3,61); 42-40,1=1,9 (3,61); 72-70,9=1,1 (1,21); 110-110,5=-0,5 (0,25). SS_res = 1,21+3,61+3,61+1,21+0,25 = 9,89.

R² = 1 − 9,89/6984 ≈ 0,9986. Модель почти идеальна.

🧠 Тест: проверьте понимание R²

1. Что означает R² = 0,85?

2. Может ли R² быть отрицательным?

3. SS_res = 20, SS_tot = 100. R² =?

4. Что делать с выбросами?

5. Какой R² считается хорошим?

Типичные ошибки при интерпретации R²

«Чем выше R², тем лучше модель» — это не всегда так. Высокий R² может быть из-за переобучения, особенно при малом числе наблюдений или большом количестве предикторов.
  • Ошибка 1: Сравнение R² для моделей с разным числом предикторов. Всегда используйте скорректированный R².
  • Ошибка 2: Принятие R²=0 как отсутствия связи. Возможна нелинейная зависимость.
  • Ошибка 3: Игнорирование выбросов. Один выброс может сильно исказить R².
  • Ошибка 4: Уверенность, что высокий R² означает причинно-следственную связь. Это корреляция, не более.

Всегда стройте график остатков: если они не случайны, модель неадекватна, даже при высоком R².

Как быстро посчитать R² онлайн: калькулятор за 3 шага

Вместо ручного счёта можно использовать наш Калькулятор коэффициента детерминации. Просто введите пары данных (x и y), и он мгновенно выдаст R², а также коэффициенты регрессии.

Инструкция:

  1. Откройте страницу калькулятора.
  2. Введите данные в поле «X» (независимая переменная) и «Y» (зависимая), разделяя числа запятыми или пробелами.
  3. Нажмите «Рассчитать» — получите R², уравнение регрессии и график.

Калькулятор подходит для проверки ручных расчётов и быстрого анализа. Также на сайте есть другие полезные инструменты: Калькулятор коэффициента вариации для оценки разброса данных, Калькулятор коэффициента трения для физиков, Калькулятор коэффициента атерогенности для здоровья, Калькулятор коэффициента распределения для химиков.

Мини-задачки для самопроверки

Попробуйте решить сами, а потом сверьтесь с ответами.

  1. Задача 1. Даны точки: (1,2), (2,4), (3,6). Найдите R² линейной регрессии y=2x. (Ответ: 1, так как модель идеальна).
  2. Задача 2. Те же точки, но модель y=2x+1. Предсказания: 3,5,7. Факт: 2,4,6. Найдите R². (Ответ: 0).
  3. Задача 3. SS_res=10, SS_tot=100. Чему равен R²? (Ответ: 0,9).
  4. Задача 4. Если модель хуже среднего, какой знак у R²? (Ответ: отрицательный).
  5. Задача 5. Можно ли получить R²>1? (Ответ: нет, максимум 1).

🧮 Посчитайте сами — инструменты по теме

🧭 Разделы по теме

Частые вопросы

Как интерпретировать коэффициент детерминации 0,75?

Это значит, что 75% изменчивости зависимой переменной объясняется моделью, а 25% — случайными факторами. В социальных науках это хороший результат, в точных — средний.

Чем отличается R² от скорректированного R²?

Скорректированный R² штрафует за добавление лишних предикторов, поэтому его используют в множественной регрессии. Обычный R² всегда растёт при добавлении переменных, даже если они бесполезны.

Какой коэффициент детерминации считается хорошим?

Зависит от области. В физике и инженерии R²>0,9 считается отличным, в экономике — 0,5-0,8, в социологии — 0,3-0,6. В любом случае, нужно смотреть на контекст.

Может ли R² быть больше 1?

Нет, R² всегда между 0 и 1 (или между 0% и 100%). Отрицательные значения возможны, если модель хуже, чем просто среднее значение.

Как посчитать R² в Excel?

Используйте функцию RSQ(известные_y; известные_x) или добавьте линию тренда на график и отметьте «Показать величину достоверности аппроксимации (R²)».

Что делать, если R² низкий?

Попробуйте добавить другие переменные, преобразовать данные (например, взять логарифм), удалить выбросы или использовать нелинейную модель. Иногда низкий R² говорит о том, что связь слабая.

Влияет ли количество данных на R²?

Да, при малой выборке R² может быть завышен. Чем больше данных, тем надёжнее оценка.

Можно ли сравнивать R² разных моделей?

Только если модели построены на одних и тех же данных и имеют одинаковое число предикторов. Иначе используйте скорректированный R² или информационные критерии (AIC, BIC).

Источники и нормативные документы

  1. Wikipedia: Коэффициент детерминации
  2. Statista: R² в анализе данных
  3. Курс «Статистика» на Coursera
  4. Росстат: методология регрессионного анализа

Ещё по теме «Математика и учёба»