Обучает плотные векторы слов по контексту: близкие по смыслу слова оказываются рядом в пространстве.
Ключевые тезисы
- Две схемы: CBOW предсказывает слово по контексту, Skip-gram — наоборот.
- Negative sampling делает обучение вычислительно реальным.
- Знаменитая арифметика векторов: король − мужчина + женщина ≈ королева.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Skip-gram и CBOW
Две задачи, из которых рождаются векторы слов.
Гипотеза дистрибутивной семантики: слова, встречающиеся в похожих контекстах, имеют похожий смысл. Skip-gram предсказывает контекст по слову, CBOW — слово по контексту.
- веса модели — то, что подбирается при обучении
- вероятность (или плотность распределения)
- суммирование по всем перечисленным элементам
- транспонирование: строка вместо столбца
- логарифм: превращает произведения в суммы и сжимает масштаб
- экспонента
Знаменатель требует суммы по всему словарю — это неподъёмно. Negative sampling заменяет задачу: отличить настоящую пару «слово — контекст» от нескольких случайных.
Знаменитая векторная арифметика: . Направление в пространстве кодирует отношение.
2Детали обучения
Negative sampling, subsampling и размер окна.
- математическое ожидание — среднее по распределению
- сигмоида: сжимает число в интервал от 0 до 1
- веса модели — то, что подбирается при обучении
- число объектов в выборке
- номер или количество: индекс шага, число соседей, кластеров или позиций
- функция потерь — то, что минимизируется при обучении
- суммирование по всем перечисленным элементам
- – отрицательных примеров для малых корпусов, 2–5 для больших.
- Отрицательные слова берут из распределения — компромисс между частыми и редкими.
- Subsampling выбрасывает сверхчастые слова с вероятностью, зависящей от частоты: это ускоряет обучение и улучшает векторы редких слов.
- Маленькое окно (2–5) даёт синтаксическую близость, большое (10+) — тематическую.
Связанные темы
От слов к векторам
Tokenization75%
Токенизация · Обработка естественного языкаРазбиение текста на единицы, с которыми работает модель: слова, подслова или байты.
Bag of Words75%
Мешок слов · Обработка естественного языкаТекст представляется вектором частот слов, порядок полностью игнорируется.
TF-IDF75%
TF-IDF · Обработка естественного языкаВзвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.
GloVe75%
GloVe · Обработка естественного языкаСтроит эмбеддинги из глобальной матрицы совстречаемости слов, а не только из локальных окон.
FastText75%
FastText · Обработка естественного языкаПредставляет слово суммой векторов его символьных n-грамм, что даёт эмбеддинги даже для незнакомых слов.
Embeddings75%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.