Интерактивный технический расчет и сравнение производительности 4x RTX 3090 против 4x Tesla V100 32GB при контексте 35k (вход) / 2k (выход).
Обычный полный кэш занял бы гигантские 33+ ГБ. Движки вычислений оптимизируют гибридный кэш:
Размер KV слоев скользящего окна (Max 1024):
50 * 1024 * (2 * 16 * 256) * байты = 1.67 млрд эл.
Размер глобальных слоев (все 37 000):
10 * 37000 * (2 * 4 * 512) * байты = 1.51 млрд эл.
У V100 полезная емкость выше (122 ГБ против 90 ГБ), что позволяет значительно поднять параллельный батч.
На RTX 3090 без NVLink реальная шина ограничена 1800 ГБ/с. На V100 за счет NVLink 2.0 шина достигает 2500 ГБ/с.