Пробовал уже пару раз поднять большую языковую модель на домашнем компе без всяких облаков, но с каждым разом натыкаюсь на ограничения — то с памятью беда, то с GPU не догоняет. На что реально можно рассчитывать сейчас, если хочешь именно локальное решение? Вижу всякие проекты типа GPT4All, llama.cpp и подобных, но как там с качеством и стабильностью? Или проще всё-таки взять что-то пониже, чем пытаться впихнуть полноценную LLM в IDE с интеграцией? Был бы полезен сверенный чек-лист по ресурсам и рекомендациям — что нужно железом, какие модели без проблем запускаются локально, а что реально только с облаком. Кто что дергает у себя и как вообще не влететь с ожиданиями?
Если изначально нет мощного GPU и много памяти, то попытки запустить большую LLM локально — скорее головная боль. GPT4All и llama.cpp действительно оптимизированы под менее мощные машины, но с качеством всё ровно не идеал, это сильно упрощённые версии. Лично я проще беру более лёгкие модели или совсем мини, чтобы не убиваться с тормозами и памятью. Облако остаётся удобнее, если нужна нормальная производительность.