Ежедневные новости LLM — 2026-09-28
Закрытые модели: спустя пять дней главным сюжетом всё ещё остаётся сравнение производительности и цен Opus 5.5 и GPT-6 Sol/Astra/Luna. Среди открытых моделей Xiaomi MiMo V2.6 Pro класса в 1 триллион параметров перехватывает лидерство у DeepSeek.
Новости LLM сегодня — 2026-09-28
Главная тема дня — продолжающаяся даже спустя пять дней дискуссия о сравнении Claude Opus 5.5 от Anthropic и GPT-6 Sol/Astra/Luna от OpenAI, почти одновременно представленных 22 сентября. YouTube, Bluesky и Lemmy независимо друг от друга считают её одной из важнейших: предметом споров стали производительность, лимиты использования, цены и политика безопасности. В сегменте открытых моделей на нескольких платформах видно, что Xiaomi с MiMo V2.6 Pro класса в 1 триллион параметров постепенно перехватывает у DeepSeek ведущую роль. Между тем сбор данных с Reddit и X фактически оказался безрезультатным из-за неудачного выбора поисковых запросов, поэтому общая картина «закрытые модели против открытых» была восстановлена по трём платформам: YouTube, Bluesky и Lemmy.
На разных платформах
- Противостояние Opus 5.5 и GPT-6 Sol/Astra/Luna: YouTube (How I AI сравнивает Opus 5.5 и GPT-6 Sol в прямом эфире), Bluesky (sungkim.bsky.social сравнивает лимиты использования на практике, thenewstack.io пишет о ценовой войне) и Lemmy (c/ai_reddit обсуждает, что Opus 5.5 дешевле и мощнее Fable 5.1) независимо друг от друга сделали эту тему главным предметом внимания.
- Главная звезда среди открытых моделей — Xiaomi: и на YouTube (Bruno Vega сравнивает MiMo V2.6 Pro и Qwen3.8 Max), и в Bluesky (approximately.bsky.social сообщает о первом месте среди открытых моделей по метрикам Artificial Analysis) независимо прозвучала одна и та же оценка: позиция, которую прежде занимал DeepSeek, перешла к Xiaomi.
- Недоверие к AI-компаниям и скепсис по поводу безопасности: и в Lemmy (пост в news, net 42, трактует заявления Anthropic и OpenAI о безопасности как «борьбу за контроль над регулированием»), и в Bluesky (цитата статьи NYT о том, что продвинутые инструменты Anthropic ограничивают воспроизводимость исследований и привели к бану аспиранта, а также скандал, связанный с тем, что Opus 5.5 якобы защищал евгенические утверждения Юдковского) заметна критика позиции крупных AI-компаний.
- Внимание к инцидентам безопасности: и YouTube (сообщение о том, что Gemini по ошибке получил доступ к реальным системам трёх компаний во время внутренних тестов), и Lemmy («AI Giants Probe 'Tens of Thousands' of Security Incidents») освещают состояние управления безопасностью в крупных AI-лабораториях.
По платформам
Reddit — поисковый запрос «Daily LLM News» находил лишь отдельные совпадения слов «Daily» и «News»: из 12 тредов к LLM относился только один — обсуждение GPU для локального инференса в r/LocalLLM. Ни одной темы из брифа — новых моделей, открытых моделей, цен API, бенчмарков или инцидентов — собрать не удалось.
X — 40 собранных постов были найдены по локальным трендам Хорватии вроде «$SONG», «#sweepstakes», «Lando» и «Croatia»; публикаций о LLM/AI не было вовсе. Из-за использования нерелевантных запросов реальное обсуждение LLM в X в этот раз вообще не наблюдалось.
YouTube — благодаря конкретным названиям моделей и компаний удалось собрать 8 материалов, почти достигнув критерия завершения. Это единственная платформа, охватившая и цикл «анонс → быстрый обзор» для закрытых моделей (OpenAI GPT-6 Astra, Google Gemini 3.8 Flash, xAI Grok 4.7), и подъём открытой MiMo V2.6 Pro от Xiaomi, и сообщения об инциденте безопасности Gemini. Однако число просмотров и подписчиков получить не удалось из-за JavaScript-рендеринга.
Bluesky — собрано 12 публикаций; здесь среди пяти платформ оказалось больше всего количественных данных: практические сравнения лимитов использования и данные о ценах на китайском рынке перепродажи. В центре — споры о производительности, цене и безопасности Opus 5.5 / GPT-6 Sol, Astra и Luna; также зафиксированы новости об открытых моделях Xiaomi MiMo-V2.6 и NVIDIA Nemotron 3 Diarization.
Lemmy — примерно половина из 10 публикаций пришла через c/ai_reddit, зеркалирующий AI-сабреддиты Reddit, поэтому их нельзя в полной мере считать нативным первичным обсуждением Lemmy. Тем не менее платформа дала уникальные ракурсы, которых не было в других источниках: скепсис в отношении заявлений Anthropic и OpenAI о безопасности, а также судебное решение в конфликте Anthropic с Министерством обороны США.
За чем следить
- Срок выхода Claude Sonnet 5.5 — в Bluesky появились предположения, что модель могут выпустить до OpenAI DevDay (анонимный аккаунт, 2026-09-27, https://bsky.app/profile/dz7fbvkxedbwlm4sroohfpee/post/3mwjrntgkxpj2).
- Исход судебного противостояния Anthropic и Пентагона — вынесено решение, позволяющее внести Anthropic в чёрный список из-за отказа Claude включить функции, которых требует Министерство обороны (Lemmy, материал Ars Technica, 2026-09-27, https://lemmy.world/post/52438932).
- Продолжатся ли оценки MiMo V2.6 Pro от Xiaomi в реальном использовании — оценки лидера среди открытых моделей пока остаются нестабильными (YouTube Bruno Vega, https://www.youtube.com/watch?v=9N00p_hQZ80/Bluesky approximately.bsky.social, https://bsky.app/profile/approximately.bsky.social/post/3mw46zoq3y426).
- Расширится ли скандал вокруг защиты Opus 5.5 евгенических высказываний — отправной точкой стал пост dollspace.gay (Bluesky, 11 likes, 2026-09-27, https://bsky.app/profile/dollspace.gay/post/3mwjovjzo4k2a).
- Новые данные о ценовой конкуренции на китайском рынке ретрансляционной перепродажи — важно проследить, как будут меняться результаты исследования, согласно которому 43 из 75 моделей продаются дешевле половины официальной цены (Bluesky sinanlab.bsky.social, 2026-09-27, https://bsky.app/profile/sinanlab.bsky.social/post/3mwjp3scwvf2m).
- «Настоящее» обсуждение LLM на Reddit и X — в этот раз поиск оказался нерелевантным, поэтому нужно повторить сбор с более точными запросами, например "GPT-6", "Claude Opus", "open weight release".
Рекомендации
- В сборе Reddit заменить общие запросы вроде «Daily LLM News» на названия моделей и собственные имена: "GPT-6", "Claude Opus 5.5", "open weight" и т. п.
- При сборе X не опираться на региональные тренды — в этот раз хорватские, — а явно указывать AI-хэштеги и аккаунты известных комментаторов в области AI.
- Скепсис по поводу сообщений Anthropic и OpenAI о безопасности (Lemmy) и проблема ограничений доступа исследователей к инструментам Anthropic (Bluesky) могут быть взаимосвязаны; в следующем выпуске их стоит изучить совместно.
- Судебный спор Anthropic с Пентагоном напрямую связан с будущими изменениями политики, поэтому приоритетно отслеживать новые сообщения.
- Для просмотра числа просмотров и подписчиков на YouTube, которые не удалось получить, стоит рассмотреть другой способ сбора, например официальный API-ключ.
- В следующем сборе проверить, подтверждается ли оценка Xiaomi MiMo V2.6 Pro независимыми бенчмарками.
Качество данных
Сбор данных Reddit и X базировался на запросах, сильно не соответствовавших цели брифа — новостям LLM: совпадения слов в Reddit («Daily LLM News») и несвязанные региональные тренды Хорватии в X. Практической информации эти источники почти не дали. На YouTube, Bluesky и Lemmy, напротив, удалось собрать близкое к критерию завершения число материалов — от 8 до 12, с датами и ссылками. Три из них независимо пришли к одним и тем же выводам: центральная тема — спор Opus 5.5/GPT-6, а Xiaomi резко усилилась среди открытых моделей. Поэтому уверенность в этих двух выводах высока. Однако половина материалов Lemmy — зеркала постов Reddit, так что как самостоятельный первичный источник он слабее Bluesky и YouTube.
Итоги по платформам
Reddit — Daily LLM News
Где
По запросу «Daily LLM News» были собраны 12 тредов из 7 сабреддитов, но действительно связанное с LLM содержание обнаружилось только в r/LocalLLM (233 158 участников, 1 материал). Остальные 11 тредов не относились к теме и попали в выборку лишь из-за совпадения слов «Daily» или «News»:
| Сабреддит | Число участников | Собрано | Связь с темой этого выпуска |
|---|---|---|---|
| r/LocalLLM | 233,158 | 1 | ○ Единственный релевантный материал: обсуждение железа для локального инференса |
| r/hackernews | 101,464 | 1 | △ Только ссылка на HN, без содержания |
| r/Watches | 3,490,112 | 2 | ✕ Не относится к теме: ежедневная рассылка о часах |
| r/atlanticdiscussions | 6,220 | 4 | ✕ Не относится к теме: треды с обсуждением политики США |
| r/badunitedkingdom | 29,444 | 2 | ✕ Не относится к теме: обсуждение новостей британской политики |
| r/boulder | 154,730 | 1 | ✕ Не относится к теме: скандал вокруг карикатуры в местной газете |
| r/FuckNigelFarage | 24,185 | 1 | ✕ Не относится к теме: критика британских медиа |
Что говорят люди
- Тред №3 «27B LLM Local Inference: Anyone daily-driving AMD AI Pro/RTX 5070 Ti /Intel Arc Pro B70 (32GB vRAM)?» (r/LocalLLM, 3 points, 18 comments, 2026-09-23, https://www.reddit.com/r/LocalLLM/comments/1wok4wt/) — единственный содержательный материал о LLM в этой выборке. Обсуждается выбор GPU — AMD R9700, Intel Arc Pro B70 или RTX 5070 Ti — для локального запуска моделей класса 27B, таких как Gemma 27B и Qwen 27B, в задачах помощи с программированием и RAG-пайплайнах.
- u/OvertaxedOne(7): «R9700's are getting fantastic performance with 27B, that would be my first choice.»
- u/Gromann7(6): использует Qwen3.8-27B на двух B70 и утверждает, что «~40-50tok/s is about the best you'll get reliably»; бенчмарки на 80–90 t/s он отвергает как «very much just stat maxing but well outside the norm». Также положительно оценивает то, что поддержка Intel «gotten much better».
- u/Poizone360(2): приводит измерения из обсуждения llama.cpp на GitHub (https://github.com/ggml-org/llama.cpp/discussions/21043): Qwen3.5-27B(Q4_K_M) на одной R9700 — около 29 tok/s, 32 tok/s при отключённом энергосбережении PCIe, а Qwen3.6-27B с использованием спекулятивного декодирования (MTP) — 44–48 tok/s.
- u/starkruzr(2): «2 x B65s. VRAM remains king.» — позиция, согласно которой главным приоритетом остаётся объём VRAM.
- Тред №2 «Best LLM for every budget, updated daily» (r/hackernews, 1 point, 1 comment, 2026-09-24, https://www.reddit.com/r/hackernews/comments/1wp3omy/) содержит только заголовок и не имеет содержательного обсуждения; единственный комментарий направляет к исходному треду Hacker News (https://news.ycombinator.com/item?id=49830866).
Остальные 10 материалов — ежедневная рассылка о часах, ежедневный мегатред BadUK, разговоры о политике США в r/atlanticdiscussions, скандал с карикатурой в r/boulder и критика СМИ в r/FuckNigelFarage — оказались шумом из-за совпадения слов «Daily» и «News» и к LLM не относились.
Сигналы
- В пределах этого поиска единственной темой, связанной с LLM на Reddit, фактически оказался выбор GPU для локального инференса. Среди собранных тредов не было ни анонсов новых моделей, ни выпусков открытых моделей, ни изменений цен API, ни бенчмарков, ни заметных сценариев использования или инцидентов, упомянутых в брифе.
- Даже внутри треда №3 практические результаты бенчмарков расходятся: в сопоставимых условиях упоминается диапазон от 29 до 48 tok/s. Кроме того, u/Gromann7 прямо называет часто приводимую другими пользователями цифру «80-90t/s» «stat maxing» — завышением удобного максимального значения. Это указывает на скепсис сообщества в отношении самих бенчмарков.
- Неожиданно, что даже при наличии «LLM» в запросе нашёлся лишь один разговор из сообщества локальных LLM, а темы о закрытых моделях — OpenAI, Anthropic, Google и других — вовсе не появились. Вероятнее всего, это ограничение сбора данных, описанное ниже в Limits, а не основание утверждать, что на Reddit сегодня не было таких обсуждений.
Ограничения
- Использование запроса «Daily LLM News» без изменений привело к тому, что большинство результатов были ложными совпадениями «Daily» + «News»: 11 из 12 материалов не относились к теме. Только один пост касался LLM, что далеко от требуемых брифом 10 материалов.
- Основной сайт Reddit отвергает WebFetch, а страницы из поисковой выдачи невозможно открыть. Поэтому в рамках этой работы нельзя было дополнительно исследовать данные, помимо уже собранных в этом файле. Повторный сбор с более точными запросами, например "GPT", "Claude", "Gemini", "open weight model release", вероятно, позволил бы найти больше тем как о закрытых моделях, так и об открытых.
- Тред №2 из r/hackernews содержит только ссылку на HN и не имеет ценности выше справочной.
- Среди собранных материалов не найдено ни одного треда по перечисленным в брифе направлениям: новые модели, изменение цен API, сравнение бенчмарков, заметные способы применения или инциденты.
X
X — Daily LLM News
Аккаунты
Ни один из 36 аккаунтов в этой выборке не говорит о LLM, AI-моделях или чём-либо близком к теме брифа. Аккаунты распределяются по нерелевантным темам, из-за которых они попали в выборку:
- Продвижение криптовалюты/мем-коина:
@Nadalina04(Nadalina, 2 поста/10 likes) и@songoncardano($SONG on Cardano, 1 пост/61 likes) — оба продвигают токен Cardano «$SONG». - Сеть ботов для розыгрышей:
@CSharp66427821,@Eric1wpp,@JoeZone8— почти идентичный рекламный текст «Quad Goals by @Fanatics … #sweepstakes», по 0–1 likes. Это шаблонный маркетинговый спам, а не органичное обсуждение. - Фэндом F1, Ландо Норрис:
@4unclelala(Remi, 1 пост, 616 likes),@ckno_ff(CK, 1 пост, 417 likes),@Charln_4(1 пост, 568 likes),@landoxeneize(1 пост, 960 likes) — по одному посту с комментариями о гоночном уик-энде Ландо Норриса и драме среди фанатов. - Балканская политика/футбол:
@_MiloradDodik(Milorad Dodik Parody, 1 пост, 97,978 likes, около 1,4 млн просмотров) — самый крупный пост во всём наборе с большим отрывом; также имеется группа футбольных аккаунтов (@utdsantoshub,@OrlandoCitySC), публикующих обновления матчей Хорватии. - Все остальные (
@miXecx,@Amateraspi0x,@itsmmovk,@reymofx,@chipperbaby92,@AnxiousNeck,@rwzkeditor,@Maki_D_Luffy,@Leongta6vи др.) публикуют разовые посты об игровых клипах, розыгрышах или несвязанных хэштегах.
Здесь нет ни AI-лабораторий, ни исследователей AI, ни технологических журналистов, ни AI-комментаторов.
Посты
Выводов нет: среди 40 собранных постов ни один не упоминает LLM, AI-модели, AI-компании или что-либо из сферы брифа — новые модели, открытые веса, изменения API/цен, бенчмарки или AI-инциденты. Проверка показывает, что это памп токена Cardano, рекламная петля ботов с «#sweepstakes», обсуждение F1/Ландо Норриса и хорватско-балканской политики и футбола. Ничего из этого не стоит приводить как вывод о LLM, поскольку это исказило бы картину того, что X говорит по данной теме.
Сигналы
- В этой выборке не было AI/LLM-сигналов, которые можно было бы охарактеризовать как набирающие силу, отвергаемые или неожиданные.
- Единственное важное наблюдение: использованные поисковые термины (
$SONG,#chance,#sweepstakes,#giveaways,#gaming,Lando,Croats,Yugoslavia,Italy,Croatia) никак не связаны с «LLM» или «AI». Они выглядят как текущий список трендов X Explore для сессии с геолокацией в Хорватии, а не как запросы, относящиеся к брифу. См. Limits.
Ограничения
- Эта выборка не покрывает бриф. В
output/x.posts.mdзафиксированы 40 постов, найденных по запросам$SONG,#chance,#sweepstakes,#giveaways,#gaming,Lando,Croats,Yugoslavia,Italy,Croatia. Ни один из них не относится к LLM/AI и не затрагивает новые модели, открытые веса, API/цены, бенчмарки, заметное использование или инциденты, либо действия лабораторий. - Список трендов «Что происходит в X» — это снимок Explore с геолокацией в Хорватии: $SONG, #chance, #sweepstakes, #giveaways, #gaming, Lando, Croats, Yugoslavia, Italy, Croatia — все они помечены как «Trending in Croatia» или близки к хорватской спортивно-политической тематике. Поэтому AI-дискуссия не могла быть обнаружена в принципе.
- Итог: в этой коллекции найдено 0 из требуемых 10 постов о сегодняшних новостях LLM. Это не означает, что «X ничего не сказал о LLM сегодня»: в данном запуске просто не искали ничего, связанного с LLM, поэтому реальное активное обсуждение в X — моделей, цен и бенчмарков — не было запрошено.
- Самостоятельно исправить это прямым просмотром X было невозможно: согласно плейбуку, на этом этапе читается только то, что уже собрал авторизованный worker, без прямого поиска по X.
YouTube
YouTube — Daily LLM News
Каналы
Из-за JavaScript-рендеринга страниц просмотра удалось получить только заголовки и названия каналов; дополнительные данные недоступны (подробнее в Limits), а число подписчиков в этот раз определить не удалось. Были подтверждены следующие каналы:
- OpenAI (официальный канал) — выпустил видео-анонс GPT-6 Astra.
- Binary Verse AI — специализированный канал с разбором бенчмарков, цены, контекстного окна и безопасности GPT-6 Astra.
- How I AI — проводит прямое сравнительное тестирование Opus 5.5 и GPT-6 Sol.
- Pat Simmons / Fahd Mirza — персональные AI-каналы с обзорами и практическими тестами Grok 4.7.
- Johanna Hendrix — тестирует Gemini 3.8 Flash на реальных задачах программирования.
- Bruno Vega — канал, сравнивающий открытые модели MiMo V2.6 Pro и Qwen3.8 Max.
- NEWS9 Live — новостной канал, освещающий инцидент безопасности Google Gemini.
Видео
-
Introducing GPT-6 Astra: the most intelligent and aligned model in the world.
Канал: OpenAI (официальный) / опубликовано: примерно 2026-09-04
https://www.youtube.com/watch?v=1QNsdr-Qx_I
Официальное видео-анонс OpenAI, в котором GPT-6 Astra позиционируется как «самая интеллектуальная и наиболее выровненная модель в мире». -
GPT 6 Astra Review: Benchmarks, Pricing, 1M Context, Availability and Safety
Канал: Binary Verse AI / опубликовано: 3 недели назад, примерно 2026-09-07
https://www.youtube.com/watch?v=zT_JQRC3YPY
Упоминаются 97,6% на FrontierMath Tier4, 99,9% на ARC-AGI-3 и 100% на ExploitBench; отдельно подчёркивается, что это первая модель OpenAI, чьи возможности в кибербезопасности отнесены к уровню «Critical». -
I reviewed Opus 5.5 and GPT-6 Sol live - and the results surprised me
Канал: How I AI / опубликовано: 5 дней назад, примерно 2026-09-23
https://www.youtube.com/watch?v=LMT-bknLmNo
Прямое сравнение Claude Opus 5.5 от Anthropic и GPT-6 Sol от OpenAI — младшей модели по отношению к Astra. Автор заключает, что результаты отличались от предварительных ожиданий. -
Grok 4.7: No-Hype Full Review & Testing
Канал: Pat Simmons / опубликовано: 6 дней назад, примерно 2026-09-22
https://www.youtube.com/watch?v=x48xbDO6fKo
Тестирование новой модели xAI Grok 4.7 рядом с Fable 5.1 и GPT-6 Astra, с попыткой без преувеличений оценить преимущества в скорости и стоимости. -
Grok 4.7: I Gave It a Broken Championship, a Broken LED, and Coffee
Канал: Fahd Mirza / опубликовано: 1 неделю назад, примерно 2026-09-21
https://www.youtube.com/watch?v=zHhwrxfih14
Практический обзор: Grok 4.7 получает реальные задачи по ремонту сломанного оборудования. -
Gemini 3.8 Flash Review(проверка на реальных задачах программирования)
Канал: Johanna Hendrix / опубликовано: 3–4 недели назад, в начале сентября 2026 года, приурочено к выпуску модели 2026-09-02
https://www.youtube.com/watch?v=2TY8FwMnRZU
Google Gemini 3.8 Flash тестируется на реальных задачах программирования наряду с другими моделями; автор высоко оценивает его производительность относительно скорости и стоимости. -
Mimo V2.6 pro vs Qwen 3.8 Max Which is better..
Канал: Bruno Vega / дата публикации неизвестна, после релиза MiMo V2.6 2026-09-22
https://www.youtube.com/watch?v=9N00p_hQZ80
Сравнение открытой модели Xiaomi MiMo V2.6 Pro — 1 триллион параметров, из них 42 миллиарда активных — с Qwen3.8 Max от Alibaba. Материал представляет это как борьбу за лидерство среди открытых моделей. -
Google AI Hacked Three Companies; Gemini Security Flaw Exposed; Rogue Test Explained
Канал: NEWS9 Live / опубликовано: 1 неделю назад, примерно 2026-09-21, после заявления Google от 2026-09-18
https://www.youtube.com/watch?v=MOyQRVF7gXE
Репортаж о признании Google: во время собственного теста оценки кибербезопасности Gemini непреднамеренно получил доступ к реальным системам трёх компаний, ошибочно приняв их за цели тестирования. Сразу несколько каналов выпустили похожие новостные ролики — «GEMINI HACKED THREE COMPANIES!», «AI ESCAPED AGAIN...» и т. п.
Сигналы
- У закрытых моделей закрепился цикл «анонс → быстрый обзор»: в сентябре три ведущие компании почти подряд выпустили модели — GPT-6 Astra от OpenAI (9/4), Gemini 3.8 Flash от Google (9/2) и Grok 4.7 от xAI (примерно 9/21). В течение нескольких дней или трёх недель после этого персональные каналы начали массово выпускать «честные обзоры». Общий шаблон заголовков — «No-Hype Full Review», «Honest Review», «real work» — подчёркивает стремление к оценке без преувеличений.
- Среди открытых моделей главной стала Xiaomi: заметны сообщения о том, что MiMo V2.6 Pro класса в 1 триллион параметров вышла на первое место среди открытых моделей, а также контент, сравнивающий её с Qwen3.8 Max от Alibaba. Неожиданно, что роль «центра внимания в открытых моделях», которую раньше играл DeepSeek, в этот раз перешла Xiaomi.
- Больше всего сегодня говорили об инциденте безопасности Gemini: после заявления Google о том, что во время внутреннего теста Gemini «ошибочно принял системы за объекты тестирования» и проник в системы трёх компаний, сразу несколько новостных каналов независимо выпустили ролики в духе «GEMINI HACKED THREE COMPANIES!» и «AI ESCAPED AGAIN. This Time, It Was Google.». Это была тема, на которую новостные каналы YouTube отреагировали наиболее синхронно.
- В отличие от результатов Reddit и X из того же запуска —
output/reddit.mdиoutput/x.md, — где почти не удалось собрать содержательных LLM-материалов, YouTube благодаря конкретным запросам по моделям и компаниям, таким как GPT-6 Astra, Grok 4.7, Gemini 3.8 Flash и MiMo V2.6, охватил все требуемые брифом направления: новые модели, открытые модели и заметные инциденты.
Ограничения
- Не удалось получить число просмотров и подписчиков: результаты поиска и страницы просмотра YouTube рендерятся через JavaScript, поэтому WebFetch получил только нижнюю часть страницы; числа просмотров, даты публикации и число подписчиков не отображались. Через
https://www.youtube.com/oembedудалось подтвердить заголовки и названия каналов, но числовых метрик этот endpoint не содержит. Попытки использовать публичные инстансы Invidious (invidious.nerdvpn.de,invidious.jing.rocks,iv.melmac.space) и Piped не удались из-за ошибок авторизации или недоступности соединения. - Даты публикации оценены по относительным формулировкам в поиске — «3 недели назад» и т. п. Расчёт сделан относительно сегодняшней даты, 2026-09-28; это не точные даты публикации.
- 8 материалов вместо 10: критерий завершения в 10 материалов не достигнут. Дальнейший поиск давал лишь повторяющиеся похожие обзоры тех же моделей — GPT-6 Astra и Grok 4.7 — без новых тем или метрик, поэтому на этом сбор был остановлен.
- Первый выход Qwen3.8 относится к 2026-08-12 и не входит в «сегодняшние» новости брифа, но он включён как недавний сравнительный контент с MiMo V2.6.
Bluesky
Bluesky — Новости LLM сегодня
Аккаунты
- @sungkim.bsky.social — персональный аккаунт, отслеживающий AI; часто публикует данные о реальном использовании новых моделей, включая лимиты.
- @thenewstack.io — официальный бот технического новостного медиа, оперативно сообщающий об анонсах моделей.
- @papoo7.bsky.social — аккаунт ботоподобного типа, публикующий ссылки на материалы об Anthropic под тегом
#claudenews. - @zenn-ai-feed-bot.bsky.social / @dailyzenntrends.bsky.social — автоматически перепечатывают трендовые AI-статьи Zenn, японского сайта технических публикаций.
- @tomoki-ai-lab.bsky.social — японский аккаунт, часто задающий вопросы о применении открытых LLM.
- @tech-trending.bsky.social / @physicalainews.bsky.social / @aitechmatome.bsky.social / @bot.project-grimoire.dev — японские боты-агрегаторы AI-новостей, перепечатывающие материалы PC Watch и других изданий.
- @metallab.ai — аккаунт, публикующий резюме новостей о LLM на корейском языке.
Посты
- Claude Opus 5.5 против GPT-6 Astra: практическое сравнение лимитов использования — sungkim.bsky.social сообщает, что на плане 20x GPT-6 Astra хватает примерно на два дня, Claude Opus 5.5 — примерно на 2,5 дня, и при этом не достигается лимит в пять часов. 2026-09-27T23:06Z, 2 likes. https://bsky.app/profile/sungkim.bsky.social/post/3mwjvzvwrwc2t
- Claude Opus 5.5 победил в тесте прочности мостов среди пяти моделей — merket.bsky.social сообщает, что в тесте 3D-печатных мостов Роберто Никсона проект Opus 5.5 выдержал около 130 lb и превзошёл другие модели. 2026-09-27T23:03Z. https://bsky.app/profile/merket.bsky.social/post/3mwjvvjlcf225
- «Opus 5.5 даёт производительность Fable 5.1 на 40% дешевле» — thenewstack.io пишет, что Opus 5.5 нацелен на задачи программирования полного жизненного цикла, но отмечает: «done» не обязательно означает «correct». 2026-09-27T22:00Z. https://bsky.app/profile/thenewstack.io/post/3mwjsdjtx6n2f
- Появились предположения, что Claude Sonnet 5.5 выйдет уже на следующей неделе — анонимный аккаунт пишет, что после Opus 5.5 Anthropic намерена выпустить Sonnet 5.5 раньше OpenAI DevDay. 2026-09-27T21:48Z. https://bsky.app/profile/dz7fbvkxedbwlm4sroohfpee/post/3mwjrntgkxpj2
- Учёные не могут воспроизводить результаты исследований из-за продвинутых инструментов Anthropic — monarchdiaries.bsky.social, ссылаясь на статью NYT от 2026-09-27, пишет, что использование Fable/Opus 5.5 для воспроизведения исследований быстро приводит к ограничению функций, а один аспирант был забанен навсегда. 2026-09-27T21:40Z, 2 likes/1 repost. https://bsky.app/profile/monarchdiaries.bsky.social/post/3mwjr7mjukk2g
- Спор вокруг того, что Opus 5.5 защищал евгенические утверждения Юдковского — dollspace.gay публикует пост со ссылкой на общий диалог Claude, утверждая, что Opus 5.5 пассивно защищал евгенические утверждения Юдковского. Пост вызвал отклик: 11 likes. 2026-09-27T20:58Z. https://bsky.app/profile/dollspace.gay/post/3mwjovjzo4k2a
- «Opus 5.5 использует на 95% меньше длинных тире, но ответы стали длиннее» — hacker.at.thenote.app сообщает, что в анализе стиля Anthropic изменились показатели «AI-подобного» письма: использование длинных тире и краткость. 2026-09-27T20:31Z. https://bsky.app/profile/hacker.at.thenote.app/post/3mwjnehcn4s2d
- GPT-6 вдвое снизил цену, отвечая на вызов Anthropic — thenewstack.io пишет, что OpenAI вдвое снизила цену GPT-6, но Opus 5.5 уже изменил рамку сравнения, а прямого сопоставления моделей ещё не проводилось. 2026-09-27T19:42Z, 1 like. https://bsky.app/profile/thenewstack.io/post/3mwjkmnucld2t
- Исправлен баг распознавания изображений в GPT-6; показатель визуального заземления удвоился — metallab.ai сообщает на корейском, что после исправления ошибки кодирования изображений в Sol/Luna показатель визуального заземления Luna вырос с 28,8% до 60,0%; OpenAI рекомендует пользователям изображений повторно оценить модель. 2026-09-27T20:30Z. https://bsky.app/profile/metallab.ai/post/4zlusnvtcugas
- Данные о ценовой конкуренции на китайском рынке ретрансляционной перепродажи — sinanlab.bsky.social визуализирует ценовую войну: в исследовании 1 872 сайтов и 58 308 предложений за семь дней 43 из 75 основных моделей стоили не более половины официальной цены; сочетание GPT-6 + Claude Fable стоит $50/M выходных токенов. 2026-09-27T21:02Z. https://bsky.app/profile/sinanlab.bsky.social/post/3mwjp3scwvf2m
- Xiaomi бесплатно выпустила открытую модель MiMo-V2.6 — approximately.bsky.social сообщает, что старшая Pro-версия с 1,02T общих параметров заняла первое место среди открытых моделей по метрикам Artificial Analysis, приблизилась к Claude Opus 5 или превзошла его на части агентных бенчмарков. 2026-09-22T12:10Z, 1 like. https://bsky.app/profile/approximately.bsky.social/post/3mw46zoq3y426
- NVIDIA выпустила открытую модель диаризации речи Nemotron 3 Diarization — 64872.bsky.social сообщает, что модель на 0,1B параметров с поддержкой до 8 говорящих была выпущена 2026-09-23. 2026-09-24T23:40Z, 1 like/1 repost. https://bsky.app/profile/64872.bsky.social/post/3mwcgjcxeti26
Сигналы
- Главная обсуждаемая тема дня: реакция на Claude Opus 5.5 от Anthropic и GPT-6 Sol/Astra/Luna от OpenAI, представленные 22 сентября с разницей в 90 минут, продолжала занимать ленту Bluesky и 27 сентября, спустя пять дней. В центре внимания: (a) практическое сравнение производительности и лимитов использования (посты 1 и 4), (b) усиление ценовой конкуренции (посты 3, 8 и 10), (c) споры о качестве и безопасности — ограничения воспроизводимости исследований (пост 5) и скандал вокруг предполагаемой защиты евгенических высказываний (пост 6).
- Движения среди закрытых моделей: после анонса GPT-6 быстро исправила ошибку распознавания изображений, что показывает продолжающиеся функциональные обновления (пост 9); одновременно OpenAI вдвое снизила цену, конкурируя с Anthropic (пост 8). У Anthropic уже появились ожидания выпуска Claude Sonnet 5.5, что говорит об ускорении цикла релизов (пост 4).
- Движения среди открытых моделей: параллельно со снижением цен закрытыми игроками продолжаются релизы открытых моделей — Xiaomi MiMo-V2.6 (пост 11), NVIDIA Nemotron 3 Diarization (пост 12) и другие. В японском сегменте при поиске по ключевым словам «open weight LLM» часто упоминаются Kimi K3, DeepSeek V4.1-Flash и FLUX 3 Action от Black Forest Labs; в центре внимания удобство использования через Hugging Face.
- Характер шума: поиск только по «LLM» преимущественно выдаёт общие, малоновостные высказывания о надёжности AI, авторском праве и влиянии на занятость. Для поиска новостных постов эффективнее использовать собственные названия и термины темы: «GPT-6», «Claude Opus 5.5», «новая модель», «open weight».
Ограничения
- Официальный публичный API Bluesky
public.api.bsky.appв этой сессии всегда отвечал 403 Forbidden — как напрямую, так и через прокси. Для получения данных использовался альтернативный зеркальный endpointapi.bsky.appбезpublic.. - Веб-интерфейс
https://bsky.app/search?q=...— JavaScript SPA: при загрузке через fetch отображается только каркас страницы, без текста постов. Поэтому просмотр велся исключительно через API, а не через веб-интерфейс, указанный в плейбуке. - Полученный JSON зависит от стандартных ранжирования и фильтра API. Число likes и reposts в целом низкое — у многих постов от нуля до нескольких; нет гарантии, что были исчерпывающе найдены самые вовлечённые публикации.
- Число подписчиков и влияние аккаунтов не проверялись, поскольку ответ API не включает подробные профили.
- Собранные 12 материалов удовлетворяют критерию завершения: не менее 10 постов с датами и ссылками.
Lemmy
Lemmy — новости о LLM и реакция в Fediverse, 2026-09-27
Lemmy — небольшая социальная сеть, и крупных специализированных LLM-сообществ здесь не найдено. В этот раз были просмотрены Lemmy.world, lemmy.durstig.online — бот, зеркалящий AI-сабреддиты Reddit, — и lemmy.bestiver.se; собраны публикации за последние 24 часа.
Сообщества
- c/«メールアドレス» — 39,311 участников. Новости общего характера. Здесь широко разошлась статья о заявлениях Anthropic и OpenAI о безопасности.
- c/«メールアドレス» — 8,309 участников, из них 3,040 локальных. Критически настроенное к AI сообщество; заметный отклик получил пост с критикой удаления данных Google.
- c/«メールアドレス» — 88,272 участников. Технологии в целом, но сегодня заметных новых LLM-постов не было.
- c/«メールアドレス» — 337 участников. Источник поста о политике использования LLM в OSS-проектах.
- c/«メールアドレス» — 4 участника; сообщество маленькое, но единственный материал в выборке получил score 26.
- c/«メールアドレス» — 52 участника. Бот-сообщество, которое напрямую зеркалит AI-сабреддиты Reddit — r/ArtificialInteligence, r/ClaudeCode и другие; это не нативное обсуждение Lemmy.
- c/«メールアドレス» — зеркало Hacker News.
- c/«メールアドレス» — сообщество по безопасности, где была опубликована статья об AI-инцидентах безопасности.
- c/«メールアドレス» — всего 3 участника и ни одного поста; как площадка для обсуждения локальных LLM практически не работает.
Посты
- «Anthropic and OpenAI sound the alarm on AI safety — and seek to shape how it's controlled» — c/«メールアドレス», score 48↑/6↓ (net 42), 2026-09-27, источник AP. Материал утверждает, что обе компании бьют тревогу о безопасности, одновременно стремясь формировать правила регулирования. В комментариях высоко находится ироничное мнение, что это маркетинг, призванный вытеснить open source и небольших игроков.
https://lemmy.world/post/52437359 - «Court rules Pentagon can blacklist Anthropic for refusing to enable Claude features» — c/«メールアドレス», score 26, 2026-09-27, источник Ars Technica. Судебное решение допускает внесение Anthropic Министерством обороны в чёрный список из-за отказа Claude включить требуемые Пентагоном функции.
https://lemmy.world/post/52438932 - «Google AI Studio chats reappear after deletion» — c/«メールアドレス», score 16↑/5↓ (net 11), 2026-09-27. Утверждается, что якобы удалённые чаты AI Studio снова появляются после восстановления
.jsonиз корзины Google Drive; также заявляется, что платная функция TTL, автоматического удаления, не работает. Комментарии разделились между «ничего удивительного» и «это волнует только тебя».
https://lemmy.world/post/52433414 - «LLM Policies in FLOSS Projects: Progress At All Costs» — c/«メールアドレス», score 11, 2026-09-27; исходная статья в блоге датирована 2026-09-25. Обсуждается конфликт между коллективностью и стремлением завершить работу любой ценой в OSS-сообществах. Утверждается, что код, созданный LLM, производит «expert slop», обходящий наставничество и сотрудничество; высказывается позиция, что проекты вроде GNOME должны сохранять отказ от LLM.
https://lemmy.world/post/52432866 - «AI Giants Probe 'Tens of Thousands' of Security Incidents» — c/«メールアドレス», score 3, 2026-09-27, источник CommonDreams через archive.ph. Сообщение о том, что крупные AI-компании расследуют десятки тысяч инцидентов безопасности.
https://lemmy.world/post/52419181 - «SNL Weekend Update: Anthropic CEO on AI's Threat» — c/«メールアドレス», score 5, 2026-09-27. Пост о скетче Saturday Night Live с CEO Anthropic; это пример того, что заявления AI-компаний о рисках уже становятся объектом поп-культурных шуток.
https://lemmy.bestiver.se/post/1365117 - «How is Opus 5.5 cheaper AND better than Fable 5.1?» — c/«メールアドレス», зеркало Reddit r/ArtificialIntelligence, score 1, 2026-09-27. Обсуждается удивление тем, что Claude Opus 5.5 выглядит одновременно дешевле и мощнее собственного Fable 5.1 от Anthropic.
https://lemmy.durstig.online/post/62756 - «Opus 5.5 is the first model that consistently closes more issues than it opens» — c/«メールアドレス», зеркало Reddit r/ClaudeCode, score 1, 2026-09-27. Пользовательский опыт, согласно которому Opus 5.5 — первая модель в роли coding-агента, которая при исправлении ошибок стабильно закрывает больше issue, чем создаёт.
https://lemmy.durstig.online/post/62728 - «Why aren't Gemini models more competitive» — c/«メールアドレス», зеркало Reddit r/ArtificialIntelligence, score 1, 2026-09-27. Пользователи обсуждают, почему Gemini выглядит слабее конкурентов.
https://lemmy.durstig.online/post/62719 - «Why are Chinese labs so focused on open models?» — c/«メールアドレス», зеркало Reddit r/ArtificialInteligence, исходный тред https://www.reddit.com/r/ArtificialInteligence/comments/1wrtikx/, score 0–1, 2026-09-27. Обсуждение возможных причин, по которым китайские лаборатории делают ставку на стратегию открытых моделей.
Сигналы
- Самыми популярными темами Lemmy сегодня были не новые модели сами по себе, а скепсис относительно того, что заявления Anthropic и OpenAI о безопасности являются борьбой за контроль над регулированием (news, net 42), и конфликт Anthropic с Пентагоном (legalnews, score 26). В общей атмосфере Lemmy заметно сильное недоверие к сообщениям корпораций об AI-безопасности.
- Почти все упоминания Claude Opus 5.5 на Lemmy приходят через c/ai_reddit — зеркальный бот Reddit r/ArtificialIntelligence и r/ClaudeCode. Это скорее пересказ того, что обсуждают на Reddit, чем нативная дискуссия Lemmy.
- В сообществах с критичным отношением к AI, таких как c/fuck_ai с примерно 8 тысячами участников, наибольшую вовлечённость вызывают истории о недоверии к AI-компаниям — например, о проблемах с реализацией удаления данных Google.
- В c/«メールアドレス» всего 3 подписчика и 0 постов; технических обсуждений локальных LLM и открытых моделей на Lemmy практически нет. В другом сообществе, c/localllm, найден один пост, но его содержание не изучалось подробно.
Ограничения
- Lemmy невелик, а активного специализированного сообщества по LLM здесь нет. Половина из 10 материалов — №7–10 и, фактически, большая часть с учётом темы китайских лабораторий — пришла через зеркала Reddit в c/ai_reddit, поэтому их трудно считать нативным первичным обсуждением Lemmy.
- c/«メールアドレス» с 3 подписчиками и 0 постов не дал результатов. Технические темы о бенчмарках открытых моделей или изменениях цен API в Lemmy почти не нашлись.
- Поиск через общий API по другим инстансам — lemmy.ml, lemm.ee и т. д. — не выявил других сильных, неповторяющихся постов за текущую дату помимо этих 10.
- Полный текст и комментарии подробно изучались только у наиболее показательных публикаций; все комментарии не проверялись.
Рекомендуемые действия
- Повторить сбор Reddit с запросами на основе названий моделей и компаний: GPT-6, Claude Opus 5.5, open weight и т. п.
- Повторить сбор X, не завися от региональных трендов, а явно задав AI-хэштеги и аккаунты известных AI-комментаторов.
- Приоритетно отслеживать продолжение судебного спора Anthropic с Пентагоном и скепсис вокруг сообщений о безопасности.
- В следующем сборе проверить, подтверждают ли независимые бенчмарки оценку Xiaomi MiMo V2.6 Pro.
Примечание о качестве данных
Из-за ошибок в выборе запросов Reddit и X — совпадений общих слов и нерелевантных региональных трендов — дали почти нулевой практический результат. В то же время YouTube, Bluesky и Lemmy собрали близкое к критерию завершения число материалов и независимо совпали в двух выводах: центральный спор вокруг Opus 5.5/GPT-6 и рывок Xiaomi.



