Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
Ключевые тезисы
- Контекстные эмбеддинги (BERT, E5) зависят от окружения слова, статические — нет.
- Косинусная близость — стандартная мера сравнения.
- Векторные БД (FAISS, pgvector, Qdrant) обеспечивают поиск по миллионам векторов.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Статические и контекстные
Одно слово — один вектор или разные векторы в разных предложениях.
| Статические | Контекстные | |
|---|---|---|
| Примеры | Word2Vec, GloVe, FastText | BERT, E5, GTE |
| Омонимия | не различает: «замок» один вектор | различает по контексту |
| Скорость | просто таблица поиска | нужен прямой проход модели |
| Применение | лёгкие модели, признаки | поиск, RAG, классификация |
Для поиска обычно используют модели, специально обученные на парах «запрос — релевантный документ»: их пространство устроено так, что косинусная близость соответствует релевантности, а не просто тематической похожести.
2Векторный поиск на практике
Как искать по миллионам векторов за миллисекунды.
- распределение, предсказанное моделью
- норма — длина вектора
- скалярное произведение: мера согласованности векторов
- HNSW — многослойный граф соседства: быстрый поиск, высокая точность, большой расход памяти.
- IVF-PQ — разбиение на ячейки плюс квантование: компактно, подходит для очень больших коллекций.
- Практика: pgvector для миллионов векторов, Qdrant / FAISS — для десятков миллионов и выше.
ANN-поиск приближённый: параметр ef_search регулирует компромисс «полнота против скорости». Проверяйте recall индекса относительно полного перебора на выборке запросов.
Связанные темы
Прикладные задачи NLP · Представления и снижение размерности · Поиск, эмбеддинги и RAG · От слов к векторам · Мультимодальность
TF-IDF95%
TF-IDF · Обработка естественного языкаВзвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.
LLM95%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.
Semantic Search80%
Семантический поиск · Обработка естественного языкаПоиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.
RAG80%
Retrieval-Augmented Generation · Обработка естественного языкаЯзыковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.
RAG80%
RAG · Генеративный ИИПодмешивание найденных документов в контекст модели вместо хранения знаний в весах.
Agents80%
Агенты · Генеративный ИИLLM, которая планирует, вызывает инструменты и итеративно движется к цели.
NDCG80%
NDCG · МетрикиНормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.
MRR80%
Средний обратный ранг · МетрикиСреднее значение 1/rank первого релевантного результата.
MAP80%
Средняя усреднённая точность · МетрикиСреднее по запросам от average precision — учитывает и релевантность, и позиции.
Precision@K80%
Точность@K · МетрикиДоля релевантных объектов среди первых K позиций выдачи.
Recall@K80%
Полнота@K · МетрикиКакая доля всех релевантных объектов попала в топ-K.
Text classification75%
Классификация текстов · Обработка естественного языкаОтнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.
NER75%
Извлечение именованных сущностей · Обработка естественного языкаРазметка последовательности: находим в тексте имена, организации, даты, суммы.
Sentiment Analysis75%
Анализ тональности · Обработка естественного языкаОпределение эмоциональной окраски текста — от бинарной оценки до аспектной тональности.
BERT75%
BERT · Обработка естественного языкаДвунаправленный энкодер, предобученный на восстановлении замаскированных токенов.
F175%
F1-мера · МетрикиГармоническое среднее точности и полноты — компромисс между ними одним числом.
Precision75%
Точность · МетрикиКакая доля объектов, предсказанных положительными, действительно положительна.
Recall75%
Полнота · МетрикиКакая доля реально положительных объектов найдена моделью.
Tokenization75%
Токенизация · Обработка естественного языкаРазбиение текста на единицы, с которыми работает модель: слова, подслова или байты.
Bag of Words75%
Мешок слов · Обработка естественного языкаТекст представляется вектором частот слов, порядок полностью игнорируется.
Word2Vec75%
Word2Vec · Обработка естественного языкаОбучает плотные векторы слов по контексту: близкие по смыслу слова оказываются рядом в пространстве.
GloVe75%
GloVe · Обработка естественного языкаСтроит эмбеддинги из глобальной матрицы совстречаемости слов, а не только из локальных окон.
FastText75%
FastText · Обработка естественного языкаПредставляет слово суммой векторов его символьных n-грамм, что даёт эмбеддинги даже для незнакомых слов.
Multimodal Models75%
Мультимодальные модели · Компьютерное зрениеЕдиное пространство для изображений и текста — основа поиска по описанию и визуальных ассистентов.
Multimodal Models75%
Мультимодальные модели · Генеративный ИИЕдиная модель, принимающая и порождающая несколько модальностей: текст, изображения, звук.
Vision Transformers75%
Vision Transformers · Компьютерное зрениеИзображение режется на патчи, которые обрабатываются как последовательность токенов.
OCR75%
Оптическое распознавание текста · Компьютерное зрениеИзвлечение текста из изображений и сканов: детекция областей текста и его распознавание.
PCA70%
Метод главных компонент · Классическое машинное обучениеОртогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.
Dimensionality reduction70%
Снижение размерности · ДанныеПроекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.
Dimensionality Reduction70%
Снижение размерности · Обучение без учителяКомпактное представление данных, сохраняющее важную часть структуры.
Representation Learning70%
Обучение представлений · Обучение без учителяМодель сама учится полезным признакам, чаще всего через self-supervised задачи.
Autoencoders70%
Автоэнкодеры · Глубокое обучениеСеть учится восстанавливать вход через узкое место, получая сжатое представление.
Eigenvalue70%
Собственное значение · Математический справочникКоэффициент растяжения вдоль направления, которое преобразование не поворачивает.
Eigenvector70%
Собственный вектор · Математический справочникНаправление, сохраняющееся при линейном преобразовании с точностью до масштаба.