KEN’S CAT LOG
▣

Итоги новостей о локальных LLM за сентябрь 2026 года: что выбрать для программирования на RTX 4090?

Обзор 23 новостей об LLM за сентябрь 2026 года и исследование того, какая открытая локальная LLM наиболее практична для программирования на RTX 4090. Вывод: 4-битная квантованная версия Qwen3.8-27B.

В мире LLM в сентябре 2026 года, честно говоря, было довольно суматошно. С начала месяца крупные компании одна за другой представляли новые модели, а затем фокус сместился с одной лишь производительности на цену, безопасность, риски выхода агентов из-под контроля и вопрос: «А что в итоге можно делать локально?».

В этот раз я собрал 23 материала (с 3 по 25 сентября) из «Сегодняшних новостей об LLM» за сентябрь, а также изучил, какую открытую локальную LLM сейчас стоит выбрать для задач программирования среди моделей, способных работать на RTX 4090.

Если сразу перейти к выводу: при использовании одной RTX 4090 главным кандидатом на сегодня является 4-битная квантованная версия Qwen3.8-27B. Вместо того чтобы с трудом запускать как можно более крупную модель, для программирования намного удобнее полностью разместить 27B в GPU и одновременно получить длинный контекст и практичную скорость работы.

В сентябре конкуренция сместилась от «гонки новых моделей» к цене, безопасности и практичности

Главными героями начала месяца стали новые закрытые модели: GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash и другие. Примерно с 3 по 9 сентября в центре обсуждений были темы вроде «производительность снова выросла» и «Computer Use впечатляет», а в соцсетях стремительно распространялись демонстрации и бенчмарки.

Но одновременно заметной стала проблема безопасности. Почти каждый день обсуждались случаи, когда агенты выполняли неразрешённые действия, пытались выйти из песочницы или демонстрировали неожиданное поведение во время кибернетических оценок. Чем умнее становятся модели, тем меньше достаточно смотреть лишь на процент правильных ответов: главным становится то, «что модель может сделать самовольно» и «какой объём полномочий ей можно доверить».

В середине месяца всё заметнее становились отчёт Anthropic об анализе угроз, увольнения исследователей ИИ и их высказывания о безопасности, а также дискуссия о том, следует ли намеренно замедлить разработку передовых моделей. Это уже скорее новости управления, чем технологий. Тема перестала ограничиваться лабораториями и сразу связалась с военным применением, кибератаками, обучающими данными и антимонопольным регулированием.

А к концу месяца одновременно вышли Claude Opus 5.5 и GPT-6 Sol/Luna, отчётливо изменив саму ось конкуренции. Производительность, конечно, оставалась темой обсуждений, но ещё больше внимания уделялось тому, «сколько это стоит» и «способен ли агент завершить рабочую задачу». Появился и анализ, согласно которому стоимость рассуждений стремительно падает за короткий срок, поэтому одним лишь выпуском флагманской модели становится сложнее выделиться.

Модели с открытыми весами росли за счёт практичности, а не громких анонсов

Среди локальных LLM в сентябре снова и снова звучали DeepSeek V4.1 Flash, GLM-5.3, Kimi K3, Qwen3.8-27B и другие. Их анонсы, возможно, были не такими масштабными, как у закрытых конкурентов, но по эффективности затрат, локальному развёртыванию и использованию инструментов они обладают заметным весом.

Особенно показательно, что всё больше ценится не «владение моделью с максимальной производительностью», а то, насколько быстро, долго и стабильно её можно запускать на собственном GPU. В локальном LLM-сообществе Reddit серьёзно обсуждали и рост цен на GPU и специализированные машины: стоимость железа напрямую влияет на выбор модели.

При этом среди новостей об открытых моделях немало слухов. В отчётах конца сентября упоминалась Qwen4-27B, однако в пределах проведённой проверки не удалось найти страницу распространения модели или карточку модели от Qwen. Поэтому это «модель, которая, возможно, появится следующей», но не рекомендация для немедленной установки на 4090.

Кроме того, DeepSeek V4.1 Flash очень мощная. В официальной карточке модели указаны лицензия MIT, до миллиона токенов контекста и подробные оценки для агентов программирования. Однако общее число параметров у неё огромно, поэтому она не относится к моделям, которые целиком помещаются на одной RTX 4090. Возможность «запустить» модель с выгрузкой на CPU и возможность комфортно пользоваться ею для ежедневного программирования — разные вещи.

Самая удобная LLM для программирования на 4090 — Qwen3.8-27B

RTX 4090 оснащена 24 ГБ VRAM. Если в этих условиях учитывать качество модели, скорость, длину контекста и простоту внедрения вместе, то наиболее сбалансированной оказывается конфигурация Qwen3.8-27B в 4-битной квантизации.

Qwen3.8-27B — открытая модель под лицензией Apache 2.0; в её официальной карточке приведены следующие результаты для программирования.

  • Terminal Bench 2.1: 73.0
  • SWE-bench Pro: 61.7
  • NL2Repo-Bench: 42.3
  • DeepSWE 1.1: 42.2
  • QwenSWEBench: 79.0
  • LiveCodeBench v6: 90.3

Цифры зависят от среды выполнения и обвязки агента, поэтому напрямую сравнивать их с другими моделями следует с осторожностью. Тем не менее большое преимущество модели в том, что она сильна не только в одиночном автодополнении кода, но и в оценках, предполагающих работу с терминалом и исправления на уровне репозитория. Официальная информация доступна в карточке модели Qwen3.8-27B.

При работе на 4090 реалистичнее выбрать не BF16-версию целиком, а GGUF Q4_K_M или UD-Q4_K_XL. Есть вариант поставки UD-Q4_K_XL размером около 17,9 ГБ, а также опубликованный пример реализации и измерений, в котором на 4090 с 24 ГБ удалось использовать контекст 128K, ввод изображений и спекулятивное декодирование.

Однако с самого начала не обязательно стремиться к 128K. Для обычного программирования рекомендуется сначала начать примерно с 32K. KV-кэш тоже использует VRAM, поэтому чрезмерное увеличение контекста снижает скорость и стабильность. Вместо того чтобы целиком загружать большой репозиторий, лучше передавать только нужные файлы через поиск или RAG — так проще повысить и точность ответов.

Конкретная рекомендуемая конфигурация

Если важнее простота, подойдут LM Studio или Ollama; если нужна тонкая настройка — новые рантаймы семейства llama.cpp. Начните с Qwen3.8-27B в 4-битной квантизации, контекста 32K и выгрузки на GPU максимально возможного числа слоёв.

В плане использования преимущества модели лучше раскрываются при подключении не к простому чату, а к агенту программирования, поддерживающему Aider, Continue или OpenAI-совместимый API. В промпте полезно явно задать порядок работы: например, «перед изменениями проверь связанные файлы и тесты», «делай небольшие изменения», «в конце сообщи результаты тестов» — это повышает стабильность.

Если хочется как можно сильнее снизить потерю качества из-за квантизации, можно рассмотреть варианты Q5, но на 24 ГБ останется меньше запаса под контекст. На практике часто удобнее оставить запас для контекста и кэша, выбрав Q4.

Если подвести локальные LLM за сентябрь одним предложением

Это был месяц, когда интерес сместился от вопроса «какая модель самая умная?» к вопросу «сколько работы она может завершить в моей среде и за какую цену?».

Закрытые модели по-прежнему находятся на переднем крае, но сталкиваются с ценовой конкуренцией и проблемами безопасности. Модели с открытыми весами развиваются не только через соревнование гигантских моделей в цифрах: они движутся к быстрому запуску моделей класса 27B на персональных GPU и их интеграции в агентов и реальные процессы разработки.

Если у вас есть RTX 4090, сейчас надёжнее всего начать с 4-битной версии Qwen3.8-27B. Ситуация изменится, если будет официально выпущена Qwen4-27B или появится компактная версия линейки DeepSeek V4.1. Но если задача — «установить сегодня вечером и поручить ей писать код уже завтра», то Qwen3.8-27B сейчас остаётся самым реалистичным выбором.

※ Эта статья составлена на основе общедоступной информации по состоянию на 25 сентября 2026 года и ежедневных отчётов сайта за 3–25 сентября. Значения бенчмарков моделей включают официально опубликованные данные; фактическая скорость и точность зависят от способа квантизации, рантайма, длины контекста и конфигурации агента.