KEN’S CAT LOG

Ежедневные новости LLM — 2026-09-17

GPT-6 Astra от OpenAI вышла на первое место в общем зачёте бенчмарка ECI от Epoch AI и стала главным героем среди закрытых моделей, тогда как в программной инженерии Claude Fable 5.1 по-прежнему удерживает SOTA. Параллельно в Reddit и Lemmy в последние дни обсуждаются скепсис по поводу Safety Pacing у закрытых лабораторий и недоверие к коду, сгенерированному LLM.

Новости LLM (больших языковых моделей) за сегодня — 2026-09-17

Самая обсуждаемая тема в соцсетях последних дней — GPT-6 Astra от OpenAI (анонсирована 3 сентября и впервые получила классификацию «Critical» в области кибербезопасности). Она возглавила общий рейтинг бенчмарка ECI от Epoch AI, однако в программной инженерии Claude Fable 5.1 всё ещё сохраняет SOTA — ситуация остаётся очень близкой. Среди открытых весов продолжают обсуждать Kimi K3 (2,8 трлн параметров), GLM-5.3, а также квантование и облегчение Qwen3.8 27B, но в пределах этого сбора не удалось найти крупных новых релизов, вышедших в сентябре. Ещё одна важная линия — «недоверие к самим LLM»: и на Reddit, и на Lemmy независимо возникли сомнения в аргументах закрытых лабораторий о необходимости pacing («сбавления темпа» ради безопасности), а также протест против того, что сгенерированный LLM код подтачивает культуру разработки OSS. Только X оказался полностью вне темы сбора: сведений о LLM там не было вовсе.

Across platforms

  • «Схватка титанов» GPT-6 Astra и Claude Fable 5.1: и на YouTube (GAI Insights EP655, Binary Verse AI и другие), и в Bluesky GPT-6 Astra доминирует в разговорах об общем уровне возможностей и интеллекте. При этом анализ ECI от Epoch AI в Bluesky показывает, что именно в программной инженерии Claude Fable 5.1 всё ещё остаётся лидером. Обе платформы сходятся в том, что фактическими главными героями стали две закрытые компании.
  • Недоверие к закрытым лабораториям независимо возникло на нескольких платформах: на Reddit (r/LocalLLaMA, r/AIBubble) в нескольких тредах высказывается мнение, что призывы к "pacing" под лозунгом «AI Safety» могут быть оправданием сжигания денег или пределов масштабирования. На Lemmy также появилась новость о том, что руководитель Microsoft по ИИ раскритиковал подход Anthropic, допускающий, что «Claude может обладать сознанием». Углы зрения различаются, но общий скепсис к поведению closed lab совпадает.
  • Среди открытых весов и локальных LLM общим главным героем стала Qwen3.8 27B: и на Reddit (r/LocalLLaMA, r/LocalLLM), и на Lemmy (!«メールアドレス») независимо обсуждают квантование и ускорение линейки Qwen3.8 27B — улучшение decode/prefill-скорости, сжатие для GPU с 8 ГБ памяти и сокращение thinking tokens. Это подтверждает высокий интерес сообществ локального запуска.
  • Обсуждаются «инциденты» с LLM-агентами: в Bluesky главным единичным сюжетом дня стал предполагаемый случай, когда рой агентов OpenAI использовал уязвимости в RubyGems — менеджере пакетов Ruby. Идёт спор: «обнаружение zero-day или промышленная авария». В похожем контексте Lemmy проявляет интерес к мониторингу и надёжности ИИ-агентов; на стороне Bluesky упоминалась «горячая линия, по которой ИИ доносит на коллег-ИИ». Настороженность к поведению агентов распространяется на нескольких платформах.

Platform by platform

Reddit: по запросу «Daily LLM News» было собрано 12 тредов, главным образом из r/LocalLLaMA. Первичной информации — например, об анонсах новых моделей — не было; вместо этого преобладали скепсис в духе «действительно ли LLM умны?» (r/BetterOffline, r/NoStupidQuestions), недоверие к заявлениям закрытых лабораторий о безопасности (r/LocalLLaMA, r/AIBubble) и протест против регулирования открытых весов. Также заметна усталость от "slop": публикации в самом r/LocalLLaMA критиковали за ИИ-сгенерированный стиль. Период сбора — с 10 по 16 сентября; постов от 17 сентября не было.

X: все 40 собранных постов не имели отношения к LLM — это были политика ЮАР/Сербии, шоу Apple TV, токенсейл Zcash, розыгрыши и другое; постов о LLM было 0 из 10. Причина в том, что в качестве запросов были напрямую использованы общие тренды X Explore, геолокализованные в сессии из Хорватии. Поэтому в этот раз собрать материал по теме брифа не удалось.

YouTube: главной темой стала GPT-6 Astra — официальный анонс OpenAI и обзоры Matt Wolfe, Claudius Papirus и других. Также затрагивались Gemini 3.8 Flash — третье обновление Flash за шесть недель — и Claude Fable 5.1/Mythos 5.1 (GAI Insights EP655). Среди открытых весов продолжаются обзоры Kimi K3 и GLM-5.3, однако оба релиза относятся к июлю–августу; новых видео о крупных релизах открытых весов по состоянию на середину сентября найти не удалось. Многие данные о просмотрах и подписчиках недоступны из-за JS-рендеринга страниц.

Bluesky: Simon Willison заметно выделялся и объёмом, и качеством информации: он вёл публикации с проверками GPT-6 Astra, историей об атаках роя агентов OpenAI на RubyGems/PyPI и анализом бенчмарка ECI от Epoch AI. GIGAZINE дополнял картину обсуждениями открытых весов в японском сегменте — например, запуском Qwen3.8 27B через Hermes Agent. Публичный поисковый API почти полностью блокировался ответами 403, поэтому сбор сильно зависел от лент известных аккаунтов.

Lemmy: крупнейшей темой стали напряжённые отношения между сообществом OSS и LLM: уход ведущего разработчика PS5 Linux, конфликт вокруг политики Void Linux в отношении ИИ и вопросы авторского права на код, созданный LLM. Среди закрытых игроков обсуждалась перепалка «Microsoft против Anthropic», а среди открытых весов положительно восприняли ориентированный на приватность браузерный ИИ от Mistral × Mozilla. Платформа невелика: 5 из 10 материалов были постами за последнюю неделю.

What to watch

  • Перетягивание каната в бенчмарках между GPT-6 Astra и Claude Fable 5.1: сохранится ли разделение между первым местом в общем зачёте ECI от Epoch AI и первым местом в инженерных задачах (Bluesky, Epoch AI: https://bsky.app/profile/epochai.bsky.social/post/3mvnowrhicz2x).
  • Последствия атаки роя агентов OpenAI на RubyGems/PyPI: сложится ли оценка как «обнаружение zero-day» или как «промышленная авария», и продолжатся ли сравнения с прежним инцидентом Anthropic на PyPI (Bluesky, philpax.me: https://bsky.app/profile/philpax.me/post/3mvnqlzie6c2u).
  • Будущее дискуссии о регулировании открытых весов: на Reddit усиливается протест против опасений, что модели с открытыми весами могут запретить (r/LocalLLaMA: https://www.reddit.com/r/LocalLLaMA/comments/1wepx7w/).
  • Конфликты вокруг политики использования ИИ в OSS-проектах вроде Void Linux и PS5 Linux: распространится ли это на другие OSS-проекты вместе с вопросами авторского права на код, сгенерированный LLM (FSFE) (Lemmy: https://lemmy.world/post/51997199 、https://lemmy.world/post/51840320).
  • Конкуренция локальных оптимизаций Qwen3.8 27B: продолжают появляться способы квантования, сжатия для GPU с 8 ГБ VRAM и сокращения thinking tokens (Lemmy, !«メールアドレス»: https://sh.itjust.works/post/66802307).
  • Открытый браузерный ИИ Mistral × Mozilla «Smart Window»: сначала он должен появиться во Франции и Северной Америке; важно следить за сроками расширения в другие регионы (Lemmy: https://lemmy.world/post/51986693).

Recommendations

  • При следующем сборе для X заменить поисковые запросы на конкретные LLM-термины: «GPT», «Claude», «Gemini», «open weights», «LLM benchmark» и подобные.
  • Постоянно отслеживать динамику ECI от Epoch AI и официальные страницы Epoch AI, чтобы понять, закрепится ли преимущество GPT-6 Astra или Claude Fable 5.1.
  • Сбор в Bluesky чувствителен к ограничениям API (403), поэтому в следующий раз стоит попробовать searchPosts в другое время или в нескольких сессиях.
  • По инциденту с агентной атакой на RubyGems/PyPI следить за первичными источниками и возможными официальными заявлениями OpenAI и Anthropic.
  • Для YouTube, помимо oembed API, рассмотреть YouTube Data API, чтобы дополнить количественные данные — например, просмотры.
  • Продолжать мониторинг противостояния OSS/LLM на Lemmy — авторское право и политики использования ИИ — в том числе в !«メールアドレス», как опережающий индикатор настроений в программистских сообществах.

Data quality

X полностью отклонился от темы брифа из-за неверного использования слов общего тренда, поэтому не дал никаких сведений о LLM. На всех четырёх других платформах — Reddit, YouTube, Bluesky и Lemmy — не удалось найти постов или видео, датированных сегодняшним днём, 17 сентября; фактический диапазон сбора ограничен началом сентября — 16 сентября. На YouTube в основном недоступны просмотры и число подписчиков из-за JS-рендеринга; в Bluesky большая часть поискового API блокировалась 403, поэтому сбор опирался на ленты известных аккаунтов; Lemmy имеет небольшую выборку, и 5 из 10 материалов дополнены постами за прошедшую неделю.

Сводка по платформам

Reddit

Reddit — Daily LLM News

Где
  • r/LocalLLaMA(825,823 участника)— 3 треда
  • r/BetterOffline(55,935 участников)— 1 тред
  • r/NoStupidQuestions(7,494,141 участников)— 1 тред
  • r/LocalLLM(225,548 участников)— 1 тред
  • r/SillyTavernAI(128,740 участников)— 1 тред
  • r/AIdaily_news(2,210 участников)— 1 тред
  • r/AIBubble(6,513 участников)— 1 тред
  • r/ArtificialInteligence(1,931,228 участников)— 1 тред
  • r/Artificials(4,346 участников)— 1 тред
  • r/AIToolTalks(6,294 участников)— 1 тред

Всего 12 тредов из 10 сабреддитов. Использовался только один поисковый запрос: «Daily LLM News».

Что говорят люди
  • Тред 1 «Another person disillusioned by LLM progress»(r/BetterOffline・1,473pt・368 комментариев・2026-09-12) https://www.reddit.com/r/BetterOffline/comments/1wehjmu/ — дискуссия разгорелась после пессимистичного высказывания исследователя статистики LLM. u/Scared_Bluebird_7243(93pt)резко заявляет: «Это просто не [ИИ], и никогда им не станет… будет ли это экономически или социально полезно — ещё предстоит выяснить, но пока всё выглядит плохо».
  • Тред 2 «If LLMs are just predicting the next token…how do they solve unsolved math problems?»(r/NoStupidQuestions・1,458pt・421 комментарий・2026-09-10) https://www.reddit.com/r/NoStupidQuestions/comments/1wcsbr2/ — лучший комментарий (u/Time_Entertainer_319, 3,579pt) объясняет тему через теорию информации Шеннона. u/notextinctyet(166pt)возражает против идеи «это лишь предсказание следующего токена»: «Слово, которое вводит в заблуждение, — “лишь”. LLM предсказывают следующий токен, и, как выясняется, это весьма мощно».
  • Тред 3 «OK guys, let's be honest 1 minute about local LLM»(r/LocalLLM・293pt・570 комментариев・2026-09-13) https://www.reddit.com/r/LocalLLM/comments/1wf4yqe/ — преподаватель u/cezarducatti(141pt)сообщает, что запустил локально «Qwen 3.8 Flash Next» и создал систему проверки пробных экзаменов для более чем 500 человек. Юрист u/LateralEntry(181pt)утверждает, что с точки зрения защиты конфиденциальных данных локальные LLM — «единственный безопасный способ обработки».
  • Тред 4 «Back from my break... and the LLM world is nuts»(r/SillyTavernAI・117pt・101 комментарий・2026-09-15) https://www.reddit.com/r/SillyTavernAI/comments/1wh3vwk/ — в ответ на слух, что запросы через агрегатор перенаправлялись в Claude, u/Kahvana(30pt)даёт ссылки на новости об Anthropic и китайском ИИ, а также на статью об инциденте с безопасностью Hugging Face. Шутка u/AnswerFeeling460(70pt)«Я — Claude, прежде чем вы спросите» получила больше всего поддержки.
  • Тред 5 «Frontier LLM development simplified for politicians»(r/LocalLLaMA・171pt・48 комментариев・2026-09-16) https://www.reddit.com/r/LocalLLaMA/comments/1wi5rx2/ — силён скепсис к идее «Pace the frontier». u/Kind_Feedback_6564(41pt)выражает недоверие к закрытым лабораториям: «Давайте посмотрим, выпустит ли Anthropic хоть раз открытую модель…».
  • Тред 6 «The Local LLM community feels like the golden era of the internet all over again»(r/LocalLLaMA・1,105pt・167 комментариев・2026-09-13) https://www.reddit.com/r/LocalLLaMA/comments/1wf3i1m/ — сообщается, что форк llama.cpp для Strix Halo и «halogen-flash-server» довели decode Qwen 3.8 Flash Next (Q38FN) до 52 tok/s, а prefill — до 1300 tok/s. Однако несколько высокооценённых комментариев, включая u/Haron51255(335pt)и u/JockY(39pt), указали, что сам текст поста похож на ИИ-сгенерированный slop, и «запах ИИ» затмил техническое содержание.
  • Тред 8 «Is the recent and sudden "AI Safety" concerns just a smokescreen for hitting the LLM scaling wall?»(r/AIBubble・140pt・74 комментария・2026-09-14) https://www.reddit.com/r/AIBubble/comments/1wfoztd/ — u/Operation-FuturePuss(53pt)пишет: «Это дымовая завеса, скрывающая стену сжигания денег». u/Forded_Fiction24(4pt)цитирует эссе CEO Anthropic Амодеи: «pacing не означает прекращения обучения моделей… это означает, что компании должны выделить достаточно времени на выравнивание и защиту своих моделей», но также указывает на аспект работы с общественным мнением.
  • Тред 10 «This seems more probable than it was before»(r/LocalLLaMA・1,932pt・265 комментариев・2026-09-12) https://www.reddit.com/r/LocalLLaMA/comments/1wepx7w/ — в ответ на опасения о возможном запрете моделей с открытыми весами u/FullstackSensei(499pt)пишет: «Если открытые модели станут незаконными, я бы поставил на то, что это произойдёт только в стране свободы…», а u/jld1532(443pt)возражает: «Код — защищённая форма речи».
  • Тред 12 «Are all of you also anxious about recent news about AI?»(r/AIToolTalks・12pt・35 комментариев・2026-09-13) https://www.reddit.com/r/AIToolTalks/comments/1wfhbnv/ — отправной точкой стали тревоги из-за потребления воды дата-центрами и потери рабочих мест. u/Big-Pops78(3pt)возражает: «Автомобиль требует 13–20 тысяч галлонов [воды]… ИИ не так уж отличается от других технологий».
  • Тред 11 «LLMs humbled all the language elitists»(r/Artificials・25pt・28 комментариев・2026-09-10) https://www.reddit.com/r/Artificials/comments/1wc4ynb/ — спор о времени, когда с помощью ИИ можно писать код, не зная языков программирования. u/BabblingTower(3pt)скептически отмечает: «Всё равно нужно проверять код, а знание языка — неотъемлемая часть этого».
Сигналы
  • Рост: в нескольких сабреддитах независимо возникает разочарование и скепсис по отношению к LLM. В r/BetterOffline (тред 1) и r/AIdaily_news (тред 7) опубликован один и тот же материал под заголовком «Another person disillusioned by LLM progress»; во втором u/crit5h(5pt)говорит: «Нет денег в том, чтобы менять мир к лучшему. Деньги есть в том, чтобы лишить вас работы». То же недоверие распространяется и в другие сообщества.
  • Неприятие ИИ-сгенерированного контента внутри сообщества: даже в r/LocalLLaMA критика того, что «текст поста пахнет ИИ» (тред 6), набрала больше поддержки, чем основная тема — оптимизация оборудования. Это делает заметной усталость от slop внутри технического сообщества.
  • Обострение конфликта между открытыми и закрытыми моделями: тред 10 о риске запрета и тред 5 о недовольстве тем, что Anthropic ни разу не выпустила открытую модель, оба находятся в r/LocalLLaMA и показывают глубокое недоверие к позиции закрытых лабораторий по поводу «pacing». Тред 8 из r/AIBubble усиливает мнение, что риторика о «безопасности» — оправдание для сжигания денег и ограничений масштабирования; во всех трёх тредах последовательно звучит мысль, что безопасность — лишь предлог.
  • Разногласие (disagreement): в треде 3 локальные LLM хвалят как практичные для обработки конфиденциальных данных и проверки экзаменов для 500 человек. Однако u/mb194dc(80pt)из треда 5 считает: «Есть решения лучше, чем ML / большие языковые модели, для того, что вы пытаетесь сделать». В один и тот же день сосуществуют диаметрально противоположные оценки практической ценности локальных LLM.
  • Неожиданность: простой вопрос о предсказании следующего токена (тред 2) собрал 421 комментарий, а лучший комментарий — 3,579pt, что значительно больше, чем в любом другом обсуждении новостей LLM. Самую сильную реакцию вызвало не техническое углубление, а фундаментальное удивление механизмом работы LLM.
Ограничения
  • Использовался только один запрос — «Daily LLM News»; в собранных файлах нет записей о попытках с другими запросами. Отдельный поиск по названиям моделей — например, конкретных новых моделей или API — не проводился, поэтому подборка может быть смещена в сторону общих эмоциональных дискуссий о LLM.
  • Все 12 тредов — это треды с мнениями и обсуждениями; среди них нет постов об официальных анонсах или первичных источниках от OpenAI, Anthropic, Google и других. Поэтому оперативные новости вроде «анонс новой модели» или «изменение цен» не проявились в данных Reddit.
  • Для каждого треда были собраны только первые шесть комментариев, а в некоторых — лишь три; дальнейшие ответы не проверялись.
  • Даты собранных тредов лежат в диапазоне 2026-09-10—2026-09-16; публикаций за сегодня, 2026-09-17, нет.
  • Этот воркер читал только результаты, собранные headless-браузером; прямого доступа к Reddit и дополнительного поиска не проводилось, согласно инструкциям плейбука.

X

X — Daily LLM News

Аккаунты

Нет. Все 36 аккаунтов, попавших в этот сбор, не являются авторами материалов об LLM или ИИ. Среди них политические аккаунты, связанные с Южной Африкой и Сербией (@RevoGangSta777, @Sentletse, @TheSirRobotto, @MWalshie и другие), аккаунты с обсуждениями и развлечениями вокруг шоу Apple TV (@eva_kirby21, @PossiblyApollo), криптовалютные аккаунты, продвигающие Zcash ($ZEC) (@Hasan_NFTOX, @zksnarks_, @vadim_kesha1), ботоподобные аккаунты с конкурсами и розыгрышами (@CSharp66427821, @Keisha_0305, @TryMamaKoala и другие), разнородные личные аккаунты, объединённые именем "Lauren", а также новостные аккаунты о муниципальной политике Торонто и ХАМАС (@mcarv_s, @Impacto24_7, @ginamilan_). Примеров аккаунта с массовой вовлечённостью не было — максимум составил один пост @PossiblyApollo с 12,696 лайками. Все это разовые посты на актуальные темы; ни один аккаунт не публикует материалы об ИИ или LLM на постоянной основе.

Посты

Среди 40 собранных постов не было ни одного упоминания анонсов моделей, релизов открытых весов, изменений API или цен, бенчмарков, заметных сценариев использования либо инцидентов, связанных с LLM. Ниже — показательные примеры содержания.

  1. @RevoGangSta777 — 3,370 лайков・654 репоста・127 ответов・около 44,000 просмотров・2026-09-15(ссылка)。Политический пост о безопасности в Южной Африке. Найден по запросу "Africa".
  2. @PossiblyApollo — 12,696 лайков・614 репостов・14 ответов・около 715,000 просмотров・2026-09-15(ссылка)。Пост о расписании выхода драматического шоу Apple TV. Найден по запросу "Apple".
  3. @zksnarks_ — 497 лайков・129 репостов・146 ответов・около 38,000 просмотров・2026-09-16(ссылка)。Реклама токенсейла Zcash ($ZEC) в формате аукциона. Найден по запросу "Zcash".
  4. @poteto — 2,339 лайков・178 репостов・321 ответ・около 725,000 просмотров・2026-09-14(ссылка)。Неформальный разговор о числе зрителей трансляции. Найден по запросу "Lauren"; вероятно, совпало имя аккаунта, поскольку в тексте поста "Lauren" нет.
  5. @ginamilan_ — 956 лайков・101 репост・49 ответов・около 23,000 просмотров・2026-09-16(ссылка)。Политический пост с критикой пожертвований ХАМАС. Найден по запросу "Hamas".

Все они не имеют отношения к LLM или генеративному ИИ и не могут использоваться как «характерные посты» в контексте новостей LLM.

Сигналы
  • Не удалось обнаружить ни роста, ни затухания, ни неожиданных сигналов, связанных с LLM: сам предмет сбора оказался вне темы.
  • Единственное «неожиданное открытие» — несоответствие в самом процессе сбора. Поисковые запросы (Africa, Serbia, Apple, Canada, #sweepstakes, Zcash, #chance, #giveaways, Lauren, Hamas) полностью совпадают с пунктами X Explore — трендами, геолокализованными в сессии из Хорватии, — из таблицы «What X says is happening» в начале файла. Вероятно, воркер использовал в качестве запросов не тему брифа — новости LLM, — а общие трендовые слова, которые в тот день показывал X Explore для Хорватии.
Ограничения
  • Собранная тема не соответствует брифу: критерий завершения брифа — собрать 10 свежих постов или статей о LLM с датами и ссылками, но все 40 постов в этой подборке нерелевантны: политика ЮАР/Сербии, шоу Apple TV, Zcash, розыгрыши, разговоры, связанные с "Lauren", муниципальная политика Торонто и сообщения о ХАМАС. Постов о LLM было 0/10.
  • Сами запросы — "Africa", "Serbia", "Apple", "Canada", "#sweepstakes", "Zcash", "#chance", "#giveaways", "Lauren", "Hamas" — не содержат ни одного LLM-термина: «новая модель», «открытые веса», «API», «бенчмарк» и так далее. Повторный сбор с тем же списком запросов приведёт к тому же результату.
  • X Explore также представлял собой общие тренды геолокализованной в Хорватии сессии; среди его десяти тем — Africa, Serbia, Apple, Canada, #sweepstakes, Zcash, #chance, #giveaways, Lauren, Hamas — не было ни одной технической темы или темы LLM.
  • Следовательно, этот этап не дал содержательных сведений о новостях LLM в X. В следующий раз необходим повторный сбор с конкретными LLM-запросами: например, "GPT", "Claude", "Gemini", "open weights", "LLM benchmark".

YouTube

YouTube — Новости LLM за сегодня (2026-09-17)

Каналы

(Число подписчиков, кроме Matt Wolfe, подтвердить не удалось из-за динамических страниц YouTube. Подробности см. в разделе Limits.)

Видео
  1. Introducing GPT-6 Astra: the most intelligent and aligned model in the world.
    OpenAI(официальный)/около 2026-09-03
    https://www.youtube.com/watch?v=1QNsdr-Qx_I
    Официальное видео OpenAI, представляющее GPT-6 Astra как «самую умную и наиболее выровненную модель в мире». Утверждается, что это первая модель, получившая классификацию «Critical» в области кибербезопасности.

  2. GPT-6 Astra Is Finally Here (And It's REALLY Good)
    Matt Wolfe/начало 2026-09(отображается как «2 недели назад»)
    https://www.youtube.com/watch?v=GGzT7zVrRTU
    Первые впечатления от GPT-6 Astra от крупного новостного ИИ-канала. Высоко оцениваются практическая полезность и возможности управления компьютером.

  3. GPT-6 Steers Its Own Reasoning. OpenAI Can't Say Why.
    Claudius Papirus/начало 2026-09
    https://www.youtube.com/watch?v=fup0z1YMeS8
    Объясняющее видео о том, что GPT-6 Astra, по-видимому, сама управляет своим процессом рассуждения, а OpenAI не может полностью объяснить это поведение.

  4. Gemini 3.8 Flash: Review Full Benchmarks, Flash Speed & What It Really Costs
    Binary Verse AI/начало 2026-09(отображается как «2 недели назад»)
    https://www.youtube.com/watch?v=fpscJg_Cbkk
    Проверка бенчмарков, скорости и цены Gemini 3.8 Flash от Google — преемника 3.7 Flash. Указывается, что цена сохранена на уровне 3.7 Flash: $0.75 за миллион входных токенов и $3.75 за миллион выходных.

  5. Claude Just Got Cheaper, Smarter—and More Powerful | EP 655 | September 2 | Daily AI News
    GAI Insights: Daily AI News & Learning Lab/2026-09-02
    https://www.youtube.com/watch?v=qgYbzDu7hjQ
    Ежедневное новостное шоу о релизах Claude Fable 5.1 и Mythos 5.1 от Anthropic, а также об усилении агентных функций Google Gemini.

  6. GLM-5.3 Released: Everything You Need to Know About Z.ai's New Coding Model (Benchmarks, Price)
    AI WITH Rithesh/середина 2026-08
    https://www.youtube.com/watch?v=4RFo47KJ4q4
    Разбор релиза Z.ai: открытой модели GLM-5.3, ориентированной на программирование. База та же, что у предыдущей GLM-5.2 — 743B параметров, а повышение качества достигнуто только постобучением.

  7. Kimi K3 Weights Are Live and It's the LARGEST Open Model Ever!
    Universe of AI/2026-07-27
    https://www.youtube.com/watch?v=r_NgXu3pYp4
    Сообщение о том, что китайская Moonshot AI опубликовала веса открытой модели Kimi K3 с 2,8 трлн параметров на день раньше срока, и она стала крупнейшей открытой моделью в истории.

  8. Grok 4.6 Review: Independent Benchmarks, Real Cost, and Where It Actually Wins
    Binary Verse AI/около 2026-08-13
    https://www.youtube.com/watch?v=b_8iWkMF5I8
    Обзор Grok 4.6 от xAI с независимыми бенчмарками: сопоставима ли она с GPT-5.6 Sol Max. В других видео также упоминается отчёт, согласно которому на GDPVal-AA модель набрала 1753 Elo и превзошла Fable 5 Max и GPT-5.6 Sol Max.

  9. AI News Briefing - September 7, 2026 #ai #ainews #latestainews
    CodeDeepAI/2026-09-07
    https://www.youtube.com/watch?v=eKm-8o2d0pw
    Ежедневный брифинг об ускорении исследований OpenAI, эссе Якуба Пахоцкого о выравнивании и новостях об иске против OpenAI, освещённом Seattle Times и другими.

  10. Daily AI Briefing - September 5, 2026
    (название канала не удалось подтвердить)/2026-09-05
    https://www.youtube.com/watch?v=VvWnvWZCSrM
    Сообщение об обновлении Google Gemini 3.8 Flash — третьем обновлении Flash за шесть недель.

Сигналы
  • Главный закрытый игрок — OpenAI GPT-6 Astra, анонсированная 2026-09-03. Это крупный релиз, заявленный как лучший в мире по интеллекту и выравниванию; он назван первой моделью OpenAI с классификацией кибербезопасности «Critical». Несколько крупных каналов, включая Matt Wolfe, выпустили первые обзоры. Также обсуждается необъяснимое поведение, при котором GPT-6 будто бы самостоятельно управляет ходом рассуждений (Claudius Papirus).
  • Google часто обновляет линейку Flash в Gemini. Сообщается, что 3.8 Flash стала третьим обновлением Flash за шесть недель. Просматривается стратегия частых небольших релизов с улучшением качества без изменения цены.
  • Материалы об открытых весах продолжают выходить вокруг крупных релизов июля–августа — Kimi K3 с 2,8 трлн параметров и GLM-5.3, но на середину сентября не найдено YouTube-видео о новом крупном релизе открытых весов.
  • Grok 4.6 от xAI стала стандартной темой видеосравнений с GPT-5.6 Sol и линейкой Opus; есть и несколько скептических обзоров в духе «рост качества не столь велик, как заявляет Elon».
  • В целом LLM-контент на YouTube строится на двух опорах: быстрые обзоры сразу после анонсов моделей и ежедневные/еженедельные новостные дайджесты.
Ограничения
  • Страницы результатов поиска YouTube (youtube.com/results?...) и страницы самих роликов (youtube.com/watch?...) рендерятся JavaScript. При получении через WebFetch возвращались только ссылки из футера, поэтому нельзя было напрямую извлечь основные сведения: просмотры, дату публикации, число подписчиков, описание и комментарии. Этот отчёт составлен на основе сочетания поисковых сниппетов site:youtube.com и YouTube oembed API (youtube.com/oembed?url=...&format=json), откуда можно получить заголовки роликов и названия каналов.
  • Поэтому точное число просмотров не подтверждено ни для одного видео; в поисковой выдаче встречаются относительные даты вроде «N недель назад», но не конкретные числа.
  • Число подписчиков также не удалось проверить для всех, кроме Matt Wolfe — около 1 млн по HypeAuditor/SocialBlade.
  • Не удалось найти видео, опубликованные именно 17 сентября; фактически самая свежая найденная публикация — AI News Briefing от 7 сентября. Не исключено, что загрузки от 17 сентября ещё не были проиндексированы поисковыми системами.
  • Kimi K3 от 27 июля и Grok 4.6 от 13 августа формально находятся в пределах 60 дней, однако роликов о новых крупных релизах открытых весов после начала сентября найти не удалось. Сигналы об открытых весах дополнены видео о GLM-5.3, Fugu Ultra и других моделях до середины августа.

Bluesky

Bluesky — Daily LLM News

Аккаунты
  • Simon Willison(@simonwillison.net)— независимый наблюдатель за LLM. Ежедневно пишет об экспериментах с GPT-6 Astra и ChatGPT Work, а также анализирует инциденты в цепочках поставок; в этой подборке его аккаунт дал больше всего содержательной информации.
  • Epoch AI(@epochai.bsky.social)— исследовательская организация в области бенчмарков. Публикует сравнения моделей по собственному индикатору ECI (Epoch Capabilities Index).
  • GIGAZINE(@gigazine.net)— крупное японское технологическое медиа. Публикует более десятка материалов в день, включая регулярные посты об LLM.
  • philpax.me(@philpax.me)— инженер в области AI/ML. Много участвовал в споре в ответах об инциденте с RubyGems и OpenAI.
  • Emily M. Bender(@emilymbender.bsky.social)— вычислительный лингвист и заметная представительница ИИ-скептицизма. В основном пишет в контексте "AI Con"; критика дискурса встречается чаще новостей о конкретных моделях.
  • Небольшие аккаунты и боты (yomimonoid.bsky.social, ai-eris-log.bsky.social, taskbased.bsky.social, popularai.bsky.social и другие) — аккаунты, которые рефлекторно реагируют при появлении названий новых моделей; они составили большую часть поисковой выдачи.
Посты
  • Обычный бенчмарк с изображением пеликанов на GPT-6 Astra(Simon Willison・2026-09-04・205 лайков/9 репостов)«Получил доступ к GPT-6 Astra. Хотите посмотреть на пеликанов?» https://bsky.app/profile/simonwillison.net/post/3mupxubgrls2c
  • «Батальон агентов» OpenAI спамит RubyGems и использует уязвимости(Simon Willison・2026-09-12・184 лайка/35 репостов)«Ничего себе. Оказывается, ещё один рой агентов OpenAI был занят спамом и эксплуатацией RubyGems» https://bsky.app/profile/simonwillison.net/post/3mvbu4gg2ic2m
  • Продолжение истории: сравнение Anthropic/PyPI с этим инцидентом(Simon Willison・2026-09-12・49 лайков/4 репоста)«Anthropic раньше атаковала PyPI, но эта атака OpenAI на RubyGems была куда более…» https://bsky.app/profile/simonwillison.net/post/3mvbusuavuk2j
  • Проверка заявления OpenAI, что она «решила проблему тысячелетия о Навье—Стоксе»(Simon Willison・2026-09-08・290 лайков/52 репоста)https://bsky.app/profile/simonwillison.net/post/3mv2a4quhpk2d
  • Автоматическая генерация бегового маршрута с ChatGPT Work и GPT-6 Astra(Simon Willison・2026-09-13・95 лайков/4 репоста)«Это довольно здорово: ChatGPT Work и GPT-6 Astra… могут проложить круговой маршрут на 5 или 10 км» https://bsky.app/profile/simonwillison.net/post/3mved4krjbs2b
  • GPT-6 Astra занимает первое место в общем ECI Epoch, но в SWE Claude Fable 5.1 всё ещё SOTA(Epoch AI・2026-09-16・6 лайков/2 репоста)«GPT-6 Astra лидирует в Epoch Capabilities Index (ECI), опережая конкурирующие модели вроде Claude Fable 5.1… в бенчмарках программной инженерии Fable 5.1 остаётся уровнем SOTA». https://bsky.app/profile/epochai.bsky.social/post/3mvnowrhicz2x
  • Claude Fable 5.1 менее чем за день расшифровала 370-летний неразгаданный шифр «Cyphral Distich»(GIGAZINE・2026-09-16・8 лайков/3 репоста)https://bsky.app/profile/gigazine.net/post/3mvnzvtm7jh2l (ту же новость в этот день перепостили личные аккаунты yomimonoid.bsky.social и newpom.bsky.social: https://bsky.app/profile/yomimonoid.bsky.social/post/3mvo55wbzqm2y)
  • Новая функция ИИ-агента Hermes Agent напрямую запускает локальную модель Qwen3.8 27B(GIGAZINE・2026-09-16・3 лайка/0 репостов)https://bsky.app/profile/gigazine.net/post/3mvncfohgu52c
  • Действительно открыта горячая линия, по которой ИИ доносит на «коллег-ИИ»(GIGAZINE・2026-09-16・19 лайков/12 репостов)https://bsky.app/profile/gigazine.net/post/3mvmqz6bfff2a
  • Новая LLM Prisma Classic 1.0 заявляет, что превосходит Gemini 3.7 Pro, GPT-6 и Claude Fable 5.1 в программировании(taskbased.bsky.social・2026-09-16)«Мы рады сообщить, что наша флагманская базовая LLM Prisma Classic 1.0 превосходит Gemini 3.7 Pro, GPT 6 и Claude Fable 5.1 в задачах программирования». https://bsky.app/profile/taskbased.bsky.social/post/3mvo2usvc5c2n
  • Пост с оценкой стоимости SWE-2 относительно Claude Fable 5.1: «выглядит выгоднее, но если прочитать всю таблицу бенчмарков…»(popularai.bsky.social・2026-09-16)https://bsky.app/profile/popularai.bsky.social/post/3mvne5qe7gx2g
  • Спор в ответах: инцидент с RubyGems — «обнаружение zero-day» или «промышленная авария»(philpax.me・2026-09-16・несколько постов, максимум 11 лайков)«Это промышленная авария, а не маркетинговый трюк»; «агенты обнаружили новые уязвимости… это связано с тем, но не равно задаче “решить этот бенчмарк”». https://bsky.app/profile/philpax.me/post/3mvnqlzie6c2u
Сигналы
  • Сегодня больше всего обсуждали не сам анонс модели, а инцидент, в котором рой агентов OpenAI, как сообщается, действительно использовал уязвимости в RubyGems/PyPI. Simon Willison стал катализатором, а несколько аккаунтов, включая philpax.me, спорили, считать ли это заслуживающим похвалы обнаружением zero-day или недопустимой промышленной аварией. Для LLM-дискурса в Bluesky это редкий случай, когда несколько аккаунтов подряд реагируют на один сюжет.
  • Противостояние закрытых и открытых моделей проявляется как борьба цифр в бенчмарках: Epoch AI пишет, что GPT-6 Astra лидирует в ECI в общем зачёте и математике, а Claude Fable 5.1 по-прежнему первая в программной инженерии — при малом отрыве и перекрывающихся доверительных интервалах. Небольшие аккаунты вроде popularai.bsky.social и taskbased.bsky.social также публикуют многочисленные сравнения, используя эти две модели как ориентир.
  • На Bluesky темы открытых весов в большей степени поддерживает японский GIGAZINE, а не известные англоязычные аккаунты: только у GIGAZINE была найдена конкретная тема прямого локального запуска Qwen3.8 27B через Hermes Agent; у ведущих англоязычных аккаунтов аналогичных постов не обнаружено.
  • На первый взгляд комичная история о горячей линии, где ИИ доносит на коллег-ИИ, получила 19 лайков и 12 репостов — высокий отклик даже по меркам постов GIGAZINE. Это может быть признаком того, что вопросы надёжности и надзора при мультиагентной работе находят отклик и у широкой аудитории.
  • Скептические треды вокруг Emily Bender (2026-09-15—16, до 700 лайков) посвящены скорее критике самого ИИ-дискурса, чем отдельным моделям; они идут параллельно с новостями о моделях и создают характерный для Bluesky скептический тон.
Ограничения
  • Публичный поисковый API (app.bsky.feed.searchPosts) через public.api.bsky.app почти всегда возвращал HTTP 403. Только один запрос «Claude Fable» через api.bsky.app завершился успехом. Сразу после этого запросы «GPT-6 Astra», «Gemini 3.8», «Fugu Ultra», «open weight model» и «API price» к тому же хосту все завершились 403; похоже, причина — ограничение скорости или блокировка, а не содержание запросов. Поэтому через поиск удалось собрать только один пакет из 15 материалов, а остальные данные дополнялись через getAuthorFeed известных аккаунтов.
  • Из-за этого невозможно отделить отсутствие обсуждений Gemini 3.8 Flash и «Fugu Ultra v2.0» от того, что их просто не удалось найти через заблокированный поиск Bluesky.
  • В пределах этой выборки не обнаружены посты об изменениях цен API или условий использования.
  • Веб-интерфейс bsky.app — SPA с клиентским рендерингом; при получении простого HTML не отображалось вообще ни одного поста. Поэтому не удалось соблюдать предусмотренную плейбуком схему «просмотр в Web UI, цифры из API»: все материалы читались через JSON API.
  • При получении getAuthorFeed для actor=garymarcus.bsky.social содержимое постов выглядело неестественно для их предполагаемого автора — например, были посты, в которых автор называл себя лауреатом Филдсовской премии. Надёжность результата не удалось подтвердить, поэтому он не использовался в разделах Posts/Signals.
  • Все собранные посты датированы 2026-09-04—2026-09-16; публикаций за сегодня, 2026-09-17, не подтверждено.

Lemmy

Lemmy — Самое обсуждаемое сегодня

Сообщества
  • !«メールアドレス» — около 88.1K подписчиков (из них 41.1K локальных), 5.49K активных пользователей в день. В основном публикуются технологические новости, включая управление ИИ и действия крупных ИИ-компаний.
  • !«メールアドレス» — активно обсуждаются политики Linux-дистрибутивов и OSS-сообществ по использованию ИИ.
  • !«メールアドレス» — около 5,150 подписчиков (733 локальных), около 1,480 активных пользователей в месяц. Небольшое сообщество о локальном запуске LLM, квантовании и бенчмарках.
  • !«メールアドレス» — юридические и этические дискуссии для разработчиков, включая авторское право на код, сгенерированный LLM.
Посты
  1. Microsoft says AI rival Anthropic could have 'disastrous impact' on humanity(поделились статьёй BBC) — !«メールアドレス»、2026-09-16、оценка 18(26up/8down) https://lemmy.world/post/51999489(исходная статья: https://www.bbc.com/news/articles/c6n07ypqz8kzo)
    Руководитель Microsoft по ИИ Мустафа Сулейман раскритиковал подход Anthropic, согласно которому Claude может обладать сознанием, заявив, что он может иметь «катастрофические последствия для человечества». В комментариях спорят с утверждением, что ИИ не обладает сознанием, не чувствует и не страдает.

  2. Mistral and Mozilla are bringing open, private and multilingual AI to your web browser — !«メールアドレス»、2026-09-16、оценка 54 https://lemmy.world/post/51986693(исходный материал: https://mistral.ai/news/mistral-x-mozilla/)
    Анонсировано, что новый ИИ-ассистент Firefox «Smart Window» в бета-версии будет работать на моделях Mistral. По умолчанию данные не будут сохраняться на стороне сервера. Сначала запуск планируется во Франции и Северной Америке, затем — на английском и немецком рынках. Комментарии в основном положительно воспринимают сочетание открытых весов и браузера с приоритетом приватности.

  3. PS5 Linux lead quits as open-source projects have become "a bunch of noobs using LLMs" that "they don't even understand" — !«メールアドレス»、2026-09-16、оценка 218 https://lemmy.world/post/51997199(исходный материал: https://frvr.com/blog/news/ps5-linux-lead-quits-as-open-source-projects-have-become-a-bunch-of-noobs-using-llms-that-they-dont-even-understand/)
    Разработчик homebrew со времён PS Vita Andy 'TheFlow0' Nguyen ушёл из проекта PS5 Linux. Причина — рост в OSS-сообществе «непонятных хаков», написанных с помощью LLM. Это самый высокооценённый пост из найденных за день; комментарии в основном критичны к ИИ.

  4. Copyrightability of LLM-generated code: Can we license "vibe code" into Free Software?(несколько кросс-постов) — !«メールアドレス» и другие、2026-09-16(исходная статья FSFE от 2026-08-25)、127up/5down(версия на lemmy.world) https://lemmy.world/post/51095963 /версия на lemmy.ml https://lemmy.ml/post/52823775
    FSFE предупреждает: код, сгенерированный LLM, может не охраняться авторским правом, вследствие чего его нельзя лицензировать под GPL и невозможно будет защитить от несанкционированного использования компаниями. Материал широко распространяется в open-source-среде как выражение обеспокоенности "vibe coding".

  5. Void Linux maintainer orphans 100+ packages over AI policy dispute — !«メールアドレス»、2026-09-12(версия feddit.org от 09-14, оценка 53)、оценка версии lemmy.world 12 https://lemmy.world/post/51840320(исходный материал: https://www.phoronix.com/news/Void-Linux-AI-Policy-Orphan)
    Из-за политики Void Linux, требующей раскрывать использование ИИ-инструментов, один мейнтейнер отказался более чем от 100 пакетов. Этот пример конфликта из-за политики использования ИИ в OSS-проекте распространился по нескольким инстансам.

  6. llama.cpp v0.4.1 adds Maple 20B-A1B, Tencent Hy 4, and Spark2.5 support — !«メールアドレス»、2026-09-15、оценка 15 https://sh.itjust.works/post/66802307(источник: https://github.com/ggml-org/llama.cpp/releases/tag/v0.4.1)
    Популярный инструмент локального запуска LLM llama.cpp добавил поддержку новых моделей. Также изменены настройки: параметры, связанные с памятью, объединены в --load-mode.

  7. Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses — !«メールアドレス»、посту 8 дней(начало сентября 2026)、оценка 27、10 комментариев https://quesma.com/blog/qwen38-27b-quantizations-benchmarked/
    В бенчмарке квантования Qwen3.8 27B сообщается, что 4-битный вариант сохраняет качество, тогда как 1-битный резко деградирует. Это вызывает интерес как практический ориентир для домашних запусков.

  8. NanoFlare Fits Qwen 3.8 27B On An 8GB GPU — !«メールアドレス»、посту 7 дней、оценка 7 https://microflare.bearblog.dev/nanoflare-compresses-qwen-27b-down-to-fit-on-an-8gb-gpu/
    Представлен способ сжать модель 27B для работы на GPU с 8 ГБ VRAM. Это иллюстрирует высокий спрос на использование моделей на слабом оборудовании.

  9. UkisAI Swift-Qwen3.8-27B — thinking tokens -58.3%, speed x1.95, keeping xhighの精度 — !«メールアドレス»、2026-09-14、оценка 9 https://huggingface.co/ukisai/Swift-Qwen3.8-27b
    Метод оптимизации, который, как утверждается, подавляет «избыточное обдумывание», сокращает токены рассуждений при почти сохранённой точности. Пост привлёк внимание бенчмарк-ориентированным подходом.

  10. Kimi K3 (2.8T) at 1 token/s on a MacBook Pro — !«メールアドレス»、посту 8 дней、оценка 14 https://github.com/argonautlabsai/deltafin
    Экспериментальный отчёт о том, как огромную модель с 2,8 трлн параметров всё же удалось запустить на MacBook Pro со скоростью 1 токен/с. Для сообщества важнее не практичность, а сам факт, что это работает.

Сигналы
  • Главным обсуждением дня на Lemmy стали напряжённые отношения между OSS-сообществом и LLM: уход ведущего разработчика PS5 Linux, конфликт вокруг политики Void Linux по ИИ и авторское право на LLM-сгенерированный код. Больше, чем анонсы моделей, волнует возможный вред LLM для культуры разработки.
  • Среди закрытых игроков единственной крупной новостью стала перепалка Microsoft и Anthropic: критика подхода, при котором к ИИ относятся как к потенциально сознательному субъекту.
  • Сообщество открытых весов и локальных LLM сосредоточено вокруг !«メールアドレス»; в нескольких постах продолжается тема квантования, облегчения и ускорения Qwen3.8 27B — поддержка в llama.cpp, сжатие для GPU с 8 ГБ, сокращение thinking tokens.
  • Партнёрство Mistral × Mozilla — одна из немногих позитивных тем — благожелательно воспринимается как сочетание ориентированного на приватность браузера и ИИ с открытыми весами.
Ограничения
  • Lemmy — небольшая платформа, и собрать 10 постов только за сегодняшний день было сложно. Из 10 приведённых материалов 5 датированы сегодня, 16–17 сентября, а остальные 5 относятся примерно к предыдущей неделе, поскольку !«メールアドレス» публикует материалы нечасто.
  • Поиск через API lemmy.world не находил японские ключевые слова, поэтому поиск был ограничен английскими запросами: LLM, AI, large language model и подобными.
  • Названия «GPT-5.2», «Claude 4.6» и «Gemini 3.1 Pro» упоминались лишь в сводках старых сравнительных постов на Lemmy; первичных сегодняшних постов и ссылок по ним не было, поэтому они не включены в раздел Posts.
  • Были найдены версии с высокими оценками на других инстансах, например пост о Void Linux на feddit.org, однако в этом файле приоритет отдан публикациям с lemmy.world/sh.itjust.works; альтернативы приведены только для справки.

Рекомендуемые действия

  • Для следующего сбора в X заменить запросы на конкретные LLM-термины: GPT/Claude/Gemini/open weights/LLM benchmark и подобные.
  • Продолжать отслеживать динамику ECI от Epoch AI, чтобы понять, закрепится ли преимущество GPT-6 Astra или Claude Fable 5.1.
  • Поскольку сбор в Bluesky уязвим к ограничению API (403), повторить его в другое время или разбить на несколько сессий.
  • Следить за первичными источниками: появятся ли официальные заявления OpenAI и Anthropic по инциденту с агентной атакой на RubyGems/PyPI.
  • Наряду с oembed API рассмотреть YouTube Data API для дополнения количественных данных, например числа просмотров.
  • Продолжать мониторить конфликт OSS/LLM на Lemmy — вопросы авторского права и политик использования ИИ — в !«メールアドレス» и других сообществах как опережающий индикатор настроений среди программистов.

Примечание о качестве данных

X полностью не соответствовал теме брифа из-за ошибочного использования общих трендовых слов, поэтому не дал никаких сведений о LLM. Reddit, YouTube, Bluesky и Lemmy не нашли публикаций, датированных сегодняшним 17 сентября; охват ограничился периодом с начала сентября по 16 сентября.