Локальные LLM на Apple M4: рабочая конфигурация с Qwen

2026-06-11

Qwen 3.5-9B Q4 в LM Studio даёт 40 токенов/сек на MacBook M4. Разбираем настройки, выбор модели и сценарии применения локального AI.

Проблема: «технически помещается» ≠ «работает"

MacBook Pro с чипом M4 и 24 ГБ памяти — мощная машина. Но когда дело доходит до запуска локальных языковых моделей, многие сталкиваются с одной и той же ситуацией: модель формально влезает в память, но работает настолько медленно, что использовать её невозможно.

Модели на 20-24 миллиарда параметров (даже в агрессивной квантизации Q3) при наличии запущенных браузера, редактора и мессенджеров оставляют слишком мало свободной памяти для нормальной работы. Результат — 3-5 токенов в секунду вместо ожидаемых 30-40.

Есть конфигурация, которая решает эту проблему.

Решение: Qwen 3.5-9B Q4 в LM Studio

Оптимальный вариант для M4 с 24 ГБ — это Qwen 3.5-9B при квантизации Q4, запущенная через LM Studio.

Что получаете:

Почему LM Studio, а не Ollama или llama.cpp? Для регулярного использования — удобное управление параметрами через интерфейс, встроенный OpenAI-совместимый API и простое переключение между моделями. llama.cpp даёт больше контроля, но требует значительно больше времени на настройку.

Ключевые параметры для режима thinking и кода:

```
temperature: 0.6
top_p: 0.95
repeat_penalty: 1.1
K Cache Quantization Type: Q8_0
```

Для включения thinking в LM Studio: выберите модель → Configuration → Inference → прокрутите вниз → добавьте нужный тег в поле Prompt Template.

Результат: для каких задач это работает

Локальная модель на M4 — не конкурент облачным SOTA-решениям для сложных автономных задач. Это инструмент с другой нишей применения.

Где локальная LLM выигрывает:

Где не стоит ожидать результатов: долгие автономные агентные цепочки, генерация сложных многофайловых проектов с нуля, задачи требующие глубокого reasoning на уровне GPT-4 класса.

Практический вывод прост: используйте интерактивный подход — небольшие задачи, итеративная работа, чёткие инструкции. Это даёт стабильный результат и не перегружает машину.

Локальный AI на MacBook — это про контроль и автономность, а не про замену облачных инструментов.

Опубликовано на ContentRun, внедрение ИИ в маркетинг и продажи. Что мы делаем.