Foundations
Основы
Линейная алгебра, анализ, вероятность и оптимизация — язык, на котором записаны все модели. Без этих семи тем любая формула из следующих глав остаётся набором символов.
Linear Algebraактуально
Линейная алгебраВекторы и матрицы — способ описать данные и преобразования над ними. Обучение модели почти всегда сводится к последовательности матричных операций.
Calculusактуально
Математический анализПроизводные показывают, как изменится ошибка при малом изменении параметра. Именно это делает возможным градиентное обучение.
Multivariable Calculusактуально
Многомерный анализиз «Математический анализ»Функции многих переменных: частные производные, градиент, производная по направлению и линии уровня.
Matrixактуально
Матрицаиз «Математический справочник»Прямоугольная таблица чисел, задающая линейное преобразование или набор объектов.
Probabilityактуально
Теория вероятностейЯзык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.
Statisticsактуально
СтатистикаКак от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.
Information Theoryактуально
Теория информацииИзмеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.
Central Limit Theoremактуально
Центральная предельная теоремаиз «Теория вероятностей и распределения»Сумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.
Entropyактуально
Энтропияиз «Математический справочник»Мера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.
Optimizationактуально
ОптимизацияПоиск параметров, минимизирующих функцию потерь. Свойства задачи — выпуклость, гладкость, обусловленность — определяют, насколько это просто.
Numerical Methodsактуально
Численные методыКомпьютер считает приближённо. Понимание точности float, устойчивости и обусловленности спасает от NaN и «необъяснимых» расхождений.
Gradient Descentактуально
Градиентный спускиз «Оптимизация обучения»Итеративный шаг против градиента функции потерь — базовый алгоритм обучения.
5 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.