Практика ML

Weak Supervision

Слабая разметка

новинкаНовое или быстро растущее направление

Программная разметка эвристиками и правилами вместо ручной: быстро, шумно и часто достаточно.

Ключевые тезисы

  • Несколько несовершенных правил объединяются в одну метку с оценкой их надёжности.
  • LLM всё чаще используется как источник слабой разметки для холодного старта.
  • Валидационный набор всё равно должен быть размечен вручную — иначе оценка бессмысленна.
Тема также относится к главам:ДанныеРазметка и объём данных

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Функции разметки

Несколько несовершенных правил вместо одного идеального.

def lf_keyword(x):     return SPAM if "выигрыш" in x.text.lower() else ABSTAIN
def lf_links(x):       return SPAM if x.n_links > 5 else ABSTAIN
def lf_sender_age(x):  return HAM  if x.sender_days > 365 else ABSTAIN

Модель объединения (label model) оценивает надёжность каждого правила по их согласию друг с другом — без единой размеченной вручную метки — и выдаёт вероятностные метки для обучения.

2

LLM как источник разметки

Современный вариант слабой разметки.

  • Быстрый холодный старт: тысячи размеченных примеров за часы вместо недель.
  • Обязательна ручная проверка выборки: систематическая ошибка модели перейдёт в вашу модель целиком.
  • Валидационный и тестовый наборы всегда размечаются людьми.
  • Полезный приём: LLM размечает, человек проверяет только спорные случаи (низкая уверенность).

Связанные темы

Разметка и слабый надзор