Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.
- вероятность положительного класса для объекта x
- сигмоида: сжимает любое число в отрезок от 0 до 1
- логит — линейная комбинация признаков; при z = 0 вероятность ровно 0.5
Ключевые тезисы
- Обучается минимизацией логистических потерь (кросс-энтропии).
- Даёт хорошо откалиброванные вероятности — редкое и ценное свойство.
- Остаётся стандартным бейзлайном в скоринге и медицине из-за интерпретируемости.
Подробный разбор
3 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1От регрессии к вероятности
Почему нельзя просто предсказывать 0 и 1 линейной моделью.
Линейная функция принимает любые значения, а вероятность обязана лежать в . Сигмоида — монотонное отображение всей прямой в этот отрезок, поэтому её и надевают поверх линейной комбинации.
- сигмоида: сжимает число в интервал от 0 до 1
- истинное значение целевой переменной
- объект: вектор признаков
- веса модели — то, что подбирается при обучении
- вероятность (или плотность распределения)
- транспонирование: строка вместо столбца
- экспонента
Граница решения задаётся условием , то есть — это гиперплоскость. Значит, логистическая регрессия остаётся линейным классификатором, несмотря на нелинейную сигмоиду.
2Почему не MSE, а log loss
Вывод функции потерь из принципа максимального правдоподобия.
Считаем, что ответы порождены распределением Бернулли с параметром . Правдоподобие выборки — произведение вероятностей; логарифм превращает его в сумму, а минус — в задачу минимизации.
- истинное значение целевой переменной
- веса модели — то, что подбирается при обучении
- число объектов в выборке
- вероятность (или плотность распределения)
- функция потерь — то, что минимизируется при обучении
- суммирование по всем перечисленным элементам
- логарифм: превращает произведения в суммы и сжимает масштаб
- MSE с сигмоидой даёт невыпуклую задачу и почти нулевые градиенты при насыщении — обучение застревает.
- Log loss выпукла по : есть единственный минимум.
- Градиент получается предельно простым: .
3Порог и работа с дисбалансом
Модель выдаёт вероятность — решение принимаете вы.
Порог 0.5 не священен. Он оптимален только если ошибки FP и FN стоят одинаково и классы сбалансированы. В скоринге, медицине и фроде это почти никогда не так.
- ложные срабатывания: модель сказала «да», а это неправда
- пропуски: модель сказала «нет», а объект был положительным
- параметр C: цена нарушения зазора. Большое C — почти не прощаем ошибок
class_weight="balanced"перевзвешивает классы обратно их частоте.- Порог подбирается по валидации под нужный recall или под максимум F1 — но никогда по тесту.
- После перевзвешивания вероятности перестают быть калиброванными: если нужны честные вероятности, калибруйте отдельно.
Связанные темы
Качество вероятностей · Нейросеть по кирпичикам · Объяснение предсказаний · Качество классификации
Log Loss98%
Логарифмические потери · МетрикиОценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.
Calibration98%
Калибровка · Оценка моделейСоответствие предсказанных вероятностей реальным частотам событий.
Brier Score85%
Brier Score · МетрикиСреднеквадратичная ошибка предсказанных вероятностей: строгая правильная функция оценки, устойчивее log loss.
Perplexity85%
Перплексия · МетрикиЭкспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.
SHAP85%
SHAP · Интерпретируемость моделейРаспределение вклада признаков на основе значений Шепли из теории игр — с гарантиями аддитивности и согласованности.
LIME85%
LIME · Интерпретируемость моделейЛокальная аппроксимация сложной модели простой линейной в окрестности конкретного объекта.
Partial Dependence85%
Partial Dependence Plot · Интерпретируемость моделейПоказывает средний эффект признака на предсказание при усреднении по остальным признакам.
ICE85%
ICE-кривые · Интерпретируемость моделейIndividual Conditional Expectation: та же зависимость, но отдельной линией для каждого объекта.
Counterfactual explanations85%
Контрфактические объяснения · Интерпретируемость моделейМинимальное изменение входа, которое меняет решение модели: «что нужно поменять, чтобы кредит одобрили».
Permutation Importance85%
Перестановочная важность · Интерпретируемость моделейПризнак перемешивается, и измеряется падение качества модели — модельно-независимый и честный подход.
Accuracy85%
Доля правильных ответов · МетрикиДоля верных предсказаний среди всех. Понятна всем и обманчива при дисбалансе классов.
Precision85%
Точность · МетрикиКакая доля объектов, предсказанных положительными, действительно положительна.
Recall85%
Полнота · МетрикиКакая доля реально положительных объектов найдена моделью.
F185%
F1-мера · МетрикиГармоническое среднее точности и полноты — компромисс между ними одним числом.
ROC-AUC85%
ROC-AUC · МетрикиВероятность, что случайный положительный объект получит больший скор, чем случайный отрицательный.
PR-AUC85%
PR-AUC · МетрикиПлощадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.
MCC85%
Коэффициент Мэтьюса · МетрикиКорреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.
Perceptron80%
Перцептрон · Глубокое обучениеПростейший нейрон: взвешенная сумма входов и пороговая функция. Исторический старт всей области.
MLP80%
Многослойный перцептрон · Глубокое обучениеНесколько полносвязных слоёв с нелинейностями — универсальный аппроксиматор функций.
Activation functions80%
Функции активации · Глубокое обучениеНелинейности между слоями, без которых сеть не сложнее линейной модели.
Loss functions80%
Функции потерь · Глубокое обучениеФормализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.
Backpropagation80%
Обратное распространение ошибки · Глубокое обучениеЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.
Optimizers80%
Оптимизаторы · Глубокое обучениеПравила обновления весов по градиенту: от чистого SGD до адаптивных методов.