Пробовал недавно поставить на домашний комп большую языковую модель — первое, что заметил, это зашкаливающий аппетит по оперативке. Вроде бы пишут, что для приличной LLM нужно от 8 ГБ VRAM и 16-32 ОЗУ, а на практике мне хватило лишь 24 ГБ ОЗУ и 10+ ГБ VRAM. Чем больше модель, тем круче нагрузка — иногда подтормаживает даже с выбранной оптимизацией.
Проверял, сколько съедается памяти через системный монитор, смотрел, как меняется при загрузке модели и инференсе — рост идет и в оперативке, и на видеокарте. Причем важно учитывать не только сам вес модели, но и промежуточные данные, кэши и работу с токенами. Для более лёгких моделей 7-13 ГБ на видеокарте хватает, но когда куда-то попадаешь на 30+ миллиардов параметров — тут уже без 24-48 ГБ VRAM или с кучей свопа не обойтись.
Если у вас нет большого объема памяти, можно попробовать более лёгкие варианты вроде quantization или работа через CPU с оптимизациями — но это уже тормозить будет. Главное — не ставить модель без понимания, как именно она распоряжается ресурсами, иначе рискуете просто вывалить систему.
Мне помогло постоянное профилирование через утилиты мониторинга памяти и тесты с разными моделями. А вы на чем держите локальные LLM? Сколько реально памяти жрёт?