Top.Mail.Ru
Разработка
Архитектура
От пилота к продакшену: почему ваш ИИ-проект упрётся не в модель, а в данные
3 октября
11.40-12.10
Green 8. Инфраструктура

Компания решает внедрить ИИ: локальная LLM, RAG по внутренним документам, дообучение под свой домен. Закупает GPU-серверы - самую заметную и обсуждаемую часть бюджета. А через пару месяцев обнаруживает: ускорители загружены на 30%, время ответа ассистента плавает, а дообучение идёт вдвое дольше расчётного. Модель ни при чём - байты не успевают приходить к GPU. Это типовой сценарий перехода ИИ-проекта от пилота к продакшену, и я разберу его на реальных кейсах внедрений.

В докладе:

Почему пилот работает, а продакшен - нет. На ноутбуке и на демо-стенде данных мало. В продакшене у ИИ-контура три разные нагрузки - дообучение, RAG/инференс и чекпоинты - с конфликтующими требованиями к инфраструктуре. «Сервер для ИИ» из коммерческого предложения не учитывает ни одну из них.

Цена простоя в деньгах, а не в терабайтах. Кластер из 4 узлов по 8 GPU теряет ~$42 000 в год только на сохранении состояния модели при дообучении. Формула на один слайд - примените к своему проекту прямо на докладе.

Кейс из практики внедрений: как мы осознанно отказались от «топовой» конфигурации (RDMA, Gen5), которую просил заказчик, показали расчётом, что она не ускорит его сценарии ни на процент, и куда на самом деле стоило направить разницу в бюджете.

Новая реальность агентских систем: длинные контексты и ИИ-агенты изменили профиль нагрузки за последние два года (KV-cache offload) - если вы внедряете агентов, ваш счёт за инфраструктуру устроен иначе, чем написано в гайдах 2024 года.

Единственный случай, когда дорогая инфраструктура окупается: клиентский ИИ-сервис с жёстким SLA на время ответа - и как понять, ваш это случай или нет, до подписания счёта.

Слушатель уйдёт с чек-листом: как до закупки посчитать реальную потребность своего ИИ-проекта, какие вопросы задать интегратору и вендору, и на чём можно сэкономить треть инфраструктурного бюджета без потери в результате.