Грубая оценка железа и бюджета под self-hosted ИИ-ассистент для сотрудников. Для обсуждения на звонке — крутите ползунки, цифры пересчитываются вживую.
Параметры нагрузки
Сколько людей получат доступ. Это не одновременные запросы — пересчитаем ниже.
Доля сотрудников, кто реально пользуется каждый день. Реалистично 40–60%.
Длинные ответы дольше занимают GPU → меньше одновременных пользователей.
RAG по документамПоиск по корп. базе знаний. Режет ёмкость в ~2,5 раза (KV-cache).
Машинная нагрузка (бот первой линии, агенты в процессах). Считается напрямую, не по людям — и обычно решает размер парка.
Резерв (отказоустойчивость, N+1)Запасная реплика, чтобы падение GPU не уронило сервис.
Режим пилота: масштабные параметры не учитываются — считаем минимальную конфигурацию под выбранную модель для проверки внедрения на 1–2 месяца.