Кто-нибудь пробовал поднять крупную языковую модель типа GPT на своей машине? С одной стороны, хочется автономности — не зависеть от онлайн-сервисов и тарифов, с другой — сильное железо у многих не всегда есть. При попытках запустить что-то вроде GPT-2 или даже GPT-J на локалке чаще сталкиваюсь с проблемами по памяти и быстродействию. Часто приходится резать модель или использовать 4-битное квантование, чтобы хоть что-то работало.
Проверяю, хватает ли виртуальной памяти, правильно ли настроено окружение (CUDA, тенсоры и т.д.), смотрю на совместимость с текущей ОС. Без правильных драйверов и библиотек нейросетевой движок просто не стартанёт. Из софта для локалки часто советуют llama.cpp и разного рода облегчённые форки — у них более свободные требования и более простая настройка, хотя точность падает.
Кто что считает оптимальным вариантом для запуска LLM оффлайн? Что важнее: качество, скорость или минимальный порог входа по железу? И как проверять, что модель реально работает, а не только грузится? Хотелось бы услышать про твики и реальные кейсы, чтобы понять, стоит ли заморачиваться с локалкой или проще отдать всё на облака.