Проверено 20 сентября 2026

Локальный ИИ агент. Сколько нужно памяти, какая будет скорость и когда он вам не нужен

Агент отличается от чата тем, что крутится в цикле и тащит в контекст историю своих шагов. Из за этого под него нужно считать память иначе, а скорость смотреть не по ощущению, а по времени всей цепочки. Ниже требования по памяти с учётом длинного контекста, замеренная скорость на нашем Mac mini M4 и честный список того, что всплывает на втором месяце.

Дисклеймер: страницу написал сервис аренды Mac, и в последнем разделе есть наши цены. Если ваше железо справляется, об этом написано прямым текстом в первом разделе.

Сначала о том, где мы не подходим

Когда локального агента заводить не стоит

Локальная модель почти всегда слабее топовой облачной на длинных цепочках рассуждений, а именно длинные цепочки агенту и нужны. Поэтому первый честный вопрос звучит так: у вас есть причина не отдавать данные наружу?

Если причины нет, облачная модель почти наверняка будет и умнее, и дешевле в пересчёте на задачу, потому что вы платите за токены, а не за железо, которое простаивает между запусками. Локальный агент оправдан там, где данные нельзя выпускать: персональные данные, врачебная тайна, чужой код по договору, внутренние документы. И ещё там, где важна предсказуемая стоимость при большом потоке однотипных запросов.

Второй честный вопрос про задачу. Если у шага нет машинного критерия успеха, то есть после действия нельзя объективно сказать получилось или нет, автономности не будет ни на локальной модели, ни на облачной. Это вопрос задачи, а не железа.

Главная цифра

Сколько памяти нужно, и почему агенту больше, чем чату

В памяти лежат не только веса модели. Рядом живёт KV кэш, который растёт вместе с длиной контекста, и он же превращает знакомую таблицу «какая модель влезет» в другую таблицу, когда речь про агента. Агент тащит в контекст историю шагов, результаты инструментов и инструкции, поэтому работает на 32K там, где человеку в чате хватает 8K.

Ниже требования для квантования Q4_K_M, самого ходового. Колонка «чат» посчитана на контекст 8K, колонка «агент» на 32K. Обратите внимание на строку с 14B, там разница ровно в одну ступень памяти, и именно на ней чаще всего ошибаются при выборе машины.

МодельВес, ГБПамять под чат, 8KПамять под агента, 32K
Llama 3.2 3B 3.2B1.98 ГБ8 ГБ
Mistral 7B 7.2B4.416 ГБ16 ГБ
Qwen 2.5 7B 7.6B4.616 ГБ16 ГБ
Llama 3.1 8B 8B4.916 ГБ16 ГБ
DeepSeek R1 Distill 8B 8B4.916 ГБ16 ГБ
Qwen 2.5 14B 14.8B916 ГБ24 ГБ
Qwen 2.5 32B 32.8B19.932 ГБ32 ГБ
Llama 3.3 70B 70.6B42.856 ГБ56 ГБ
Qwen 2.5 72B 72.7B44.156 ГБ64 ГБ

Считается это так: вес модели равен числу параметров, умноженному на биты на вес и делённому на восемь. Сверху рантайм добавляет около пятнадцати процентов, KV кэш зависит от контекста и архитектуры, и ещё примерно три гигабайта нужно оставить системе. Та же формула работает в нашем калькуляторе, так что цифры в таблице и в калькуляторе всегда совпадают.

Замеры, а не обещания

Скорость упирается в полосу памяти, а не в процессор

На каждый сгенерированный токен модель прочитывает все свои веса из памяти. Значит потолок скорости это полоса памяти, делённая на размер весов. Поэтому у Apple Silicon сравнивать надо не число ядер, а гигабайты в секунду: у базового M4 полоса 120 ГБ/с, у M4 Pro 273, у M4 Max 546.

Ниже наши собственные замеры на Mac mini M4, Ollama 0.31.2, macOS 15.3.1 (Sequoia), по 3 прогона на модель с отброшенным прогревом.

МодельГенерация, ток/сШаг агента на 500 токеновЦепочка из 10 шагов
Llama 3.2 3B 3B46.711 с1.8 мин
Mistral 7B 7B22.822 с3.7 мин
Qwen 2.5 7B 7B22.322 с3.7 мин
Llama 3.1 8B 8B21.224 с3.9 мин
DeepSeek R1 8B 8B2025 с4.2 мин
Qwen 2.5 14B 14B11.743 с7.1 мин

Две последние колонки важнее первой. Человеку в чате комфортно от пятнадцати токенов в секунду, это скорость чтения, и на базовом M4 любая модель до 8B это условие закрывает. Агенту скорость чтения не нужна, ему важно общее время цепочки. Если агент работает ночью по расписанию, четыре минуты на цепочку никому не мешают. Если он отвечает человеку в чате, четыре минуты это провал, и тогда надо либо резать число шагов, либо брать полосу шире.

Из чего это собирается

Три слоя и один список запретов

Слой первый, модель. Локально её держат через Ollama или llama.cpp. У Ollama есть совместимый с OpenAI эндпоинт, поэтому большинство библиотек подключаются к нему, если указать базовый адрес. Установка и выбор модели разобраны отдельно на странице про Ollama на Mac.

Слой второй, оркестрация. Тут развилка. Если агент должен жить в мессенджере и работать по расписанию, нужен шлюз, который всё это умеет из коробки. Если агент это часть вашего приложения, нужна библиотека, и вы пишете цикл сами. Выбирать между шлюзом и библиотекой надо до того, как начали писать код, потому что переезд потом дорогой.

Слой третий, инструменты. Всё, чем агент трогает внешний мир. Удобно делать их серверами MCP, тогда при смене оркестратора интеграции переписывать не придётся. И правило, которое экономит больше всего времени: пять хорошо описанных инструментов работают лучше тридцати, потому что чем их больше, тем хуже модель выбирает нужный.

И список запретов. До первого автономного запуска выпишите действия, которые необратимы, это деньги, удаление данных и любая отправка наружу от вашего имени. Каждое такое действие должно требовать явного подтверждения человека. Агент без этого списка это инцидент по расписанию, и цена ошибки тут не равна нулю.

Честно

Пять вещей, которые всплывают на втором месяце

Контекст растёт быстрее, чем кажется. Агент добавляет в историю результаты каждого инструмента, и машина, которой хватало на демонстрации, упирается в память на реальной задаче.

Составные отказы. Если шаг выполняется правильно в восьмидесяти пяти процентах случаев, цепочка из десяти шагов доходит до конца примерно в двадцати процентах. Короткая цепочка надёжнее длинной, и это не лечится моделью побольше.

Машина должна быть включена всегда. Агент без расписания бесполезен, а ноутбук вы закрываете. Отсюда либо сервер дома со всеми вопросами про электричество, шум и бэкапы, либо аренда.

Обновления ломают привычное. Новая версия модели с тем же именем может вести себя иначе на ваших промптах. Фиксируйте версии и держите журнал того, что менялось.

Простой стоит денег. Своё железо стоит одинаково и когда агент работает, и когда ждёт. Если загрузка низкая, честно посчитайте облако, оно может выйти дешевле.

Тут мы заинтересованное лицо

Когда своего железа не хватает

Если у вас уже есть Mac с нужным объёмом памяти и он может не выключаться, ничего покупать и арендовать не нужно. Аренда осмысленна в трёх случаях: своего железа с такой памятью нет, нужен зарубежный IP, или машина нужна на проект, а не навсегда.

КонфигурацияВ месяцПри оплате за годСамая крупная модель при 32K
Mac mini M4 16 ГБ$99$80Llama 3.1 8B, около 20.9 ток/с
Mac mini M4 32 ГБ$171$130Qwen 2.5 32B, около 5.4 ток/с
Mac mini M4 Pro 24 ГБ$200$147Qwen 2.5 14B, около 25.3 ток/с
Mac mini M4 Pro 64 ГБ$286$197Qwen 2.5 72B, около 5.5 ток/с
Mac Studio M4 Max 128 ГБ$471$305Mistral Large 2, около 6.5 ток/с

Машина выделенная, не общий сервер, с правами администратора, поэтому Ollama, Docker и свои сервисы ставятся как на свой компьютер. Железо стоит в Грузии, IP зарубежный, оплата USDT без карты. Минусы у этого тоже есть, и они перечислены на странице сравнения сервисов аренды, вместе с шестью конкурентами и их ценами на одну дату.

Частые вопросы

Коротко о главном

Сколько памяти нужно локальному ИИ агенту?

Считать надо не по модели, а по модели плюс контекст. Модель 8B в квантовании Q4 весит около 4.9 ГБ и требует 16 ГБ машины. Модель 14B при коротком контексте влезает в те же 16 ГБ, но агенту нужен длинный контекст, и на 32K той же 14B требуется уже 24 ГБ. Это главная ошибка при подборе железа под агента.

Почему агенту нужно больше памяти, чем чату с той же моделью?

Кроме весов модели в памяти лежит KV кэш, и он растёт вместе с длиной контекста. Агент тащит в контекст историю шагов, результаты инструментов и инструкции, поэтому работает на 32K там, где человеку в чате хватает 8K. Веса не изменились, а памяти нужно больше.

Какая скорость нужна агенту в токенах в секунду?

Человеку в чате комфортно от 15 токенов в секунду, это примерно скорость чтения. Агенту скорость чтения не важна, ему важно общее время цепочки. При 20 токенах в секунду шаг с ответом на 500 токенов занимает 25 секунд, а цепочка из десяти шагов это четыре минуты. Если агент работает по расписанию ночью, это нормально, если отвечает человеку, уже нет.

Можно ли держать локального агента на ноутбуке?

Технически да, практически нет. Агент бесполезен без расписания, а расписание требует машины, которая не уходит в сон и не закрывается вместе с крышкой. Ноутбук годится, чтобы собрать и отладить агента, но для постоянной работы нужна машина, которая всегда включена.

Локальная модель справится с агентом так же, как облачная?

На коротких задачах разница небольшая, на длинных цепочках рассуждений заметная и не в пользу локальной. Честный подход такой: держите локально то, что нельзя отдавать наружу, и не ждите от модели на 8B качества топовой облачной на десятишаговой задаче.

Собрать агента на выделенном Mac

Память под длинный контекст, машина, которая не засыпает, и полный доступ администратора. Оплата USDT за период без автосписаний, не подошло, не продлеваете.

Выбрать конфигурацию