С M1 и M2 действительно стало проще что-то запускать локально — нейроны работают, но если модель чуть крупнее, всё сразу встаёт, особенно по памяти. Core ML помогает, но ждать суперскорости не стоит, пока это больше игрушка для мелких задач, чем реально серьёзный инструмент.