Сколько памяти нужно, чтобы запустить нормальную LLM дома
Если собрался запускать локальную языковую модель, сразу учти — памяти надо много, и сильно зависит от размера самой модели. Вот прикидка по вариантам, чем чаще пользуются:
- Модели на 7-8 миллиардов параметров обычно требуют от 12 до 16 ГБ видеопамяти, чтобы нормально работать. 8 ГБ в лучшем случае не хватит, будет сильный своп и лаги.
- Для ~13-15 миллиардов параметры уже нужна видюха с 24 ГБ памяти (например, RTX 3090 или аналог), иначе смысла мало — все равно тормоза страшные.
- Более крупные модели типа 30+ миллиардов параметров — это задача для серверов с 40+ ГБ видеопамяти, и на домашнем железе не потянешь.
- Если надо запускать LLM с меньшей нагрузкой, можно поискать оптимизированные модели с квантованием под 4-6 ГБ VRAM, но качество и скорость будут зажатые.
- На ОЗУ системы тоже смотрим — лучше иметь не меньше 32 ГБ, чтобы кэш и поддержка модели не съедали всё. Тем более если одновременно запускаешь что-то еще.
В общем, если хочешь без танцев с bfloat16 и прочими костылями — бери минимум 16 ГБ VRAM и 32 ГБ ОЗУ. Под LLM с миллиардами параметров на GPU ниже пользы не ждешь. А если просто для экспериментов — можно попробовать и более скромные варианты, но тогда жди, что пожрёшь много времени и нервов.
Кто что еще использовал из моделей? Какие у вас были требования по памяти?