Память для локальных LLM — кто сколько реально жрёт?
Короче, решил проверить, сколько памяти требуют разные локальные языковые модели, чтобы понимать, стоит ли вообще заморачиваться с запуском у себя. Оказалось, что цифры очень разные — от пары гигабайт до десятков. Всё зависит от размера модели (tiny, base, large), формата и оптимизаций типа квантования.
Если у вас 8 ГБ оперативки — можно ловить маленькие модели 4–6 ГБ, но на больших даже загрузиться не получится. На 16+ ГБ уже реально запускать что-то более серьезное, а 32+ ГБ позволит покрутить более продвинутые версии, особенно если модель должна работать быстро и без сбоев.
Важно не только объём памяти, но и её скорость. Например, swap на SSD помогает, но тормозит нещадно. Лучший вариант — много RAM и нормальная видеокарта, если модель поддерживает GPU-ускорение.