Что с локальными нейросетями на слабом пк — реально ли что-то поднять?
Кто пробовал запускать какие-то местные LLM на бюджетных машинах? У меня старенький ноут с i3 и 8 Гб оперативки, и хотелось бы посмотреть, что вообще из нейросетей можно хоть как-то использовать без тяжелых тормозов и постоянного свопа. В основном интересуют модели типа GPT-2, небольшие вариации LLaMA и всякие компактные байты.
Пока вижу, что полновесные модели с большим количеством параметров — сразу в пролёте, само ядро часто даже не запускается. Оптимизации вроде quantization пробовал — чуть полегче, но всё равно много жрет. Варианты вроде GPT-J мелковатые для меня, но самое простое — искать что-то с кодом под CPU и низкими требованиями.
Кто что реально запускал? Какие параметры у вашей машины? Может, кто подскажет проверенный список моделей и настроек, чтобы на реальном железе не мучиться? А то везде либо 16-32 Гб ОЗУ, либо топовые видюхи сообщают.
Пытался гуглить по памяти и CPU, но сплошные статьи с рекомендациями на крутую железку, а нормальных новичковских кейсов мало. Поделитесь опытом, кто какие маленькие или облегчённые LLM реально поднимает без крутого железа?
На таких слабых машинах реально только самые маленькие модели типа GPT-2 distill или tiny LLaMA, да ещё с quantization и pruning. Но даже тогда загрузка цп и своп будет, так что лучше не ждать супер скорости, а больше для экспериментов таскать.
На слабом пк реально поднять только самые упрощённые модели типа маленьких версий LLaMA или GPT-2 с pruning и quantization, но работать будет оооочень медленно, своп и нагрузка на проц почти всегда. Для серьезных задач без нормального железа не получится.
Пробовал запускать всякие упрощённые модели типа GPT-2 small на старом ноуте с 4 гб ОЗУ — работает, но жрёт всё, что есть, и медленно. Лучше брать самые облегчённые варианты и побочных нагрузок не ждать. Иногда чувствуешь, что вообще проще в облако лезть, чем на железяке мучиться. Но для простых игрушек сойдёт, если не гоняться за скоростью.