Запустил LLM локально — что дальше с производительностью и обновлениями?
Чувствую, что локальный запуск больших языковых моделей — тема постепенно набирает обороты, но столкнулся с парой вопросов, которые не совсем очевидны. С одной стороны, конечно, классно не зависеть от облака и сохранять данные у себя. Но при этом: что с производительностью на средних железках? Кто что использует — просто чтобы чат работал без лага и тормозов? И как у вас с обновлениями? Пока у меня модель тяжеловата, обновления выкачиваются в оффлайне не всегда удобно, и реально интересует, насколько это вообще жизнеспособно в долгосрочной перспективе. Какие есть проверенные решения? Может, кто-то поделится опытом, что реально работает, а что — переоценено?