Проблема: «технически помещается» ≠ «работает"
MacBook Pro с чипом M4 и 24 ГБ памяти — мощная машина. Но когда дело доходит до запуска локальных языковых моделей, многие сталкиваются с одной и той же ситуацией: модель формально влезает в память, но работает настолько медленно, что использовать её невозможно.
Модели на 20-24 миллиарда параметров (даже в агрессивной квантизации Q3) при наличии запущенных браузера, редактора и мессенджеров оставляют слишком мало свободной памяти для нормальной работы. Результат — 3-5 токенов в секунду вместо ожидаемых 30-40.
Есть конфигурация, которая решает эту проблему.
Решение: Qwen 3.5-9B Q4 в LM Studio
Оптимальный вариант для M4 с 24 ГБ — это Qwen 3.5-9B при квантизации Q4, запущенная через LM Studio.
Что получаете:
- ~40 токенов в секунду при включённом режиме thinking
- Контекстное окно 128K токенов
- Полноценная работа с инструментами (tool use для агентных сценариев)
- Остаётся достаточно памяти для параллельной работы других приложений
Почему LM Studio, а не Ollama или llama.cpp? Для регулярного использования — удобное управление параметрами через интерфейс, встроенный OpenAI-совместимый API и простое переключение между моделями. llama.cpp даёт больше контроля, но требует значительно больше времени на настройку.
Ключевые параметры для режима thinking и кода:
```
temperature: 0.6
top_p: 0.95
repeat_penalty: 1.1
K Cache Quantization Type: Q8_0
```
Для включения thinking в LM Studio: выберите модель → Configuration → Inference → прокрутите вниз → добавьте нужный тег в поле Prompt Template.
Результат: для каких задач это работает
Локальная модель на M4 — не конкурент облачным SOTA-решениям для сложных автономных задач. Это инструмент с другой нишей применения.
Где локальная LLM выигрывает:
- Работа с конфиденциальными данными без передачи в сторонние сервисы
- Офлайн-сценарии: командировки, нестабильный интернет, режим полёта
- Интерактивное кодирование: генерация функций, ревью кода, объяснения
- Исследование и планирование задач без API-лимитов
- Снижение зависимости от внешних сервисов в чувствительных проектах
Где не стоит ожидать результатов: долгие автономные агентные цепочки, генерация сложных многофайловых проектов с нуля, задачи требующие глубокого reasoning на уровне GPT-4 класса.
Практический вывод прост: используйте интерактивный подход — небольшие задачи, итеративная работа, чёткие инструкции. Это даёт стабильный результат и не перегружает машину.
Локальный AI на MacBook — это про контроль и автономность, а не про замену облачных инструментов.