Адаптация предобученной модели под домен или формат на собственных данных.
Ключевые тезисы
- Лучше промптинга там, где важен стабильный стиль и формат ответа.
- Знания добавлять дообучением дорого — для этого есть RAG.
- Качество датасета важнее его размера.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Когда дообучать, а когда нет
Дообучение задаёт поведение, RAG — знания.
| Задача | Инструмент |
|---|---|
| Стабильный формат и стиль ответа | дообучение |
| Свежие или приватные факты | RAG |
| Узкий доменный язык (медицина, право) | дообучение + RAG |
| Быстрая проверка гипотезы | промптинг |
Данные важнее объёма: 1 000 тщательно выверенных примеров обычно дают лучший результат, чем 50 000 шумных. Обязательно держите отложенную выборку — переобучение проявляется как потеря общих способностей модели.
2Подготовка обучающих данных
Где на самом деле выигрывается качество.
- Соберите реальные запросы, а не придуманные.
- Напишите эталонные ответы в том формате, который нужен в проде.
- Уберите дубликаты и противоречия — модель выучит и их тоже.
- Отложите 10–15% как тест и никогда не обучайтесь на нём.
- Проверьте на утечку: тестовые примеры не должны встречаться в обучении даже в перефразированном виде.
Признак переобучения при дообучении LLM — потеря общих способностей: модель отлично решает вашу задачу и разучилась всему остальному. Держите небольшой набор общих проверок.
Связанные темы
Адаптация языковых моделей
Prompting80%
Промптинг · Генеративный ИИУправление поведением модели через формулировку запроса, без изменения весов.
LoRA80%
LoRA · Генеративный ИИОбучение низкоранговых добавок к весам вместо полного дообучения модели.
RLHF80%
RLHF · Генеративный ИИДообучение по человеческим предпочтениям: модель награды + оптимизация политики.
RAG80%
RAG · Генеративный ИИПодмешивание найденных документов в контекст модели вместо хранения знаний в весах.
PPO80%
PPO · Обучение с подкреплениемУстойчивый policy-gradient метод с ограничением величины обновления политики.
GPT80%
GPT · Обработка естественного языкаАвторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.