или авторизуйтесь, если у вас он уже есть
Дистилляция знаний из больших LLM в компактные модели: практический опыт production-проектов
О чем
LLM показывают впечатляющее качество, но их эксплуатация часто оказывается слишком дорогой для production-сценариев. Возникает вопрос: всегда ли нужна модель на десятки или сотни миллиардов параметров для решения прикладной задачи?
В докладе расскажу о практическом опыте дистилляции знаний из больших локально развернутых LLM (GLM 5.1, GLM 5.2, Qwen3-122b) в компактные модели. Покажу, как использовать большие модели в качестве учителей и переносить их знания в более дешевые и быстрые модели без доступа к внутренним весам и логитам — только через black-box взаимодействие.
Основные тезисы
Почему дистилляция становится необходимостью
стоимость инференса больших моделей;
требования к инфраструктуре;
задержки и ограничения при работе в production;
когда использование большой LLM экономически не оправдано.
Black-box дистилляция на практике
что такое black-box knowledge distillation;
как организовать процесс обучения без доступа к внутренним представлениям модели-учителя;
генерация обучающих данных с помощью LLM-учителя;
типичные ошибки и ограничения подхода.
Кейс №1. Матчинг товаров по фото и описанию
постановка задачи;
организация обучения через LLM-учителя Qwen3-122b;
неожиданный результат: модель-ученик Qwen3.5-4b превзошла качество учителя;
почему это оказалось возможным.
Кейс №2. Классификатор интентов для умного поиска
использование Glm 5.1 для создания обучающей выборки;
перенос знаний в компактную модель;
выигрыш по стоимости и скорости.
Кейс №3. Генерация подзапросов для поисковой системы
улучшение качества поиска через query expansion;
обучение ученика на ответах большой модели Glm 5.2;
сравнение качества и производительности.
Практические выводы
когда дистилляция действительно окупается;
как выбирать учителя и ученика;
какие задачи подходят для дистилляции лучше всего;
где компактная модель может полностью заменить большую LLM.
Кому будет полезно
ML Engineers и Data Scientists;
инженерам, внедряющим LLM в production;
техническим руководителям и тимлидам;
всем, кто ищет способы снизить стоимость эксплуатации ИИ-систем без существенной потери качества.