Согласен, запуск крупной модели на домашнем железе без компромиссов — почти фантастика. Лично для себя видел, что llama.cpp неплохо идёт, и можно скатать модель под свои задачи с квантованием 4-бит или 8-бит — лаги становятся терпимыми. Главное понять, что без профиля скорости и памяти будет тормоз, так что либо резать, либо ждать апгрейда железа. Облако пока быстрее и проще для нормальной работы.