yandex

Главные новости на рынке за сентябрь 2026 года

main image

Сентябрь 2026 года на рынке языковых моделей был таким плотным, что за ним не всегда успевали. Причем помимо самих релизов были еще и важные объявления от глав компаний, новости, предложения, и если у вас не было времени или возможности следить за этим хаосом в live-режиме, то эта статья для вас. 

Не будем говорить очень много о бенчмарках, в конечном итоге, когда доходит до дела, все упирается в пользовательский опыт, удобство и практичность. Здесь разберем основные тенденции: почему модели становятся дешевле, что с флагманами, почему Grok на фоне остальных топчется на месте и насколько мир вообще приблизился к «заветному» AGI.

1 сентября: Claude Fable 5.1 и Mythos 5.1

Anthropic ворвалась в сентябрь сразу с двумя новинками: Claude Fable 5.1 и Claude Mythos 5.1.

Что по Fable 5.1. По сути, это та же Claude Fable 5, но с улучшениями в долгих многоэтапных рабочих процессах, кодинге, исследованиях и работе с документами. Здесь упор именно на агентных сценариях, если нужно просто что-то найти — лучше не дергайте ее, а вот в сфере планирования, последовательного выполнения работ и проверок инструмент отличный.

Fable 5.1 хорош в работе с большими проектами и кодовыми базами, в рефакторинге, поиске причин ошибок, написании и проверке тестов. Он часами может копаться в вашей работе, анализировать ее, вызывать инструменты при необходимости. Скормите ему не только текст — документы, инфографики, все это будет проверено, связано при необходимости и упаковано уже в готовую конфетку. 

Отдельно Anthropic прокачала работу с научными задачами. Terminal-Bench-Science как раз проверяет, насколько модель способна самостоятельно работать в терминале в сценариях, связанных с научными исследованиями. Здесь результат Fable 5.1 вырос более чем в два раза относительно Fable 5. Поэтому модель интересна не только программистам, но и исследователям, аналитикам и специалистам, которым приходится работать с большими объёмами сложной информации.

И! Самое главное: модель сделали дешевле предшественницы за счет снижения стоимости cache reads, то есть кэшированного контента. Проще говоря, модельку научили правильно обращаться с исходными данными, она стала лучше читать и вникать в него, запоминать, и обращаться к ним, когда застревает.

А что насчет Mythos 5.1?

На самом деле, весь секрет в том, что по капотом Mythos 5.1 та же Fable 5.1. Просто дело в более свободной конфигурации защитных механизмов. Mythos предназначена для проверенных организаций и специалистов, которым нужна работа с кибербезопасностью и биологическими исследованиями. Она не публичная в привычном смысле этого слова, потому что с ослабленной цензурой, если говорить совсем просто. Это не значит, что она небезопасная, просто механизмы работы устроены по другому.

Почему вообще понадобилось делать две версии?

Представим, что специалист по кибербезопасности просит модель проанализировать подозрительный код и найти уязвимость. Для обычного Fable 5.1 такие запросы могут попадать под защитные ограничения. Anthropic при этом хочет, чтобы специалисты, которые действительно занимаются защитой систем, могли проводить подобный анализ. Поэтому для проверенных организаций существует Mythos с более подходящими для этих задач защитными настройками.

Конечно, моделька от этого не становится монстром с безграничной властью. Кстати, именно такое послабление в безопасности дает Mythos более высокие цифры в бенчмарках, потому что она меньше блокирует «подозрительные» запросы. Но увидеть мы ее не увидим. Только для избранных.                    

2 сентября: Gemini 3.8 Flash

На следующий день Google представила Gemini 3.8 Flash и Gemini 3.8 Flash Cyber. Одна рассчитана на обычные задачи, программирование и работу с агентами, вторая специально заточена под кибербезопасность.

Собственно, история почти та же, что у Клода: Gemini 3.8 Flash универсал, а Gemini 3.8 Flash Cyber прошла дополнительное обучение под работу с уязвимостями и защитой программного обеспечения.

Итак, Google хотела сделать Flash-модель, которая работает быстро и стоит относительно недорого, но при этом способна долго заниматься одной сложной задачей, а не просто выдать ответ на один запрос. То есть максимально впихнуть все боли и просьбы пользователей во что-то одно, но при этом не завышать цену и оставить скорость.

Лучше всего линейка Flash все так же работает в простых задачах. Но так же поможет разобраться в существующем проекте, найти причину ошибки, изменить несколько файлов, проверить результат и при необходимости исправить собственную работу. В этом вопросе подход от Google изменился: в модель добавили длинные агентные циклы. То есть Flash может несколько раз обращаться к инструментам, проверять промежуточный результат и продолжать работу. Регулировать процесс рассуждения и уровень «глубины» можно через меньший уровень параметра effort, если важнее скорость и экономия.

Так что название Flash здесь немного обманчиво, это уже не старые флеши, выдающие быстрые ответы засчет меньшего погружения — думать она может и дольше, просто все равно останется дешевле.

Сюда уже кроме текста можно отправить изображениям, аудио и видео. 

А вот Gemini 3.8 Flash Cyber Google описывает как модель для «защитников», которая умеет самостоятельно искать уязвимости и помогать автоматически исправлять их. В Google Cloud она прямо обозначена как post-training версия Gemini 3.8 Flash, адаптированная под cybersecurity. О чем мы и говорили — тот же флеш под капотом, только заточенный под другое.

Главные задачи Flash Cyber можно свести к двум направлениям. Первое — поиск уязвимостей. Модель может анализировать код и самостоятельно искать потенциальные проблемы безопасности. А второе, соответственно, автоматическое исправление. Причем Google заявляет, что использует модельку уже для проверки собственного кода, и Flash Cyber якобы находила корректные исправления уязвимостей в 2,6 раза чаще, чем использованные для сравнения более крупные коммерческие модели. Мы, конечно, на слово верить не будем, но пометочку сделаем.

В любом случае, Gemini 3.8 Flash Cyber, как и Mythos, выдается только определенным компаниям, и широкому пользователю не доступна.

3 сентября: GPT-6 Astra

В день, когда горят костры рябин, OpenAI выпустила GPT-6 Astra, и в первой половине месяца это, наверное, самый главный релиз. Новый флагман, обещающий долгую самостоятельную работу, обученный на кластере из 100 000+ NVIDIA Grace Blackwell NVLink72 GPU — в общем, железа было много.

Ключевые направления, в целом, как и у всех, сейчас у компаний основная задача перегнать друг друга в тех же рамках. Сам OpenAI выделил сложное рассуждение, программирование, использование компьютера, исследовательскую работу, работу с документами, агентские задачи (ну конечно) и использование внешних инструментов.

Контекст: до 1,05 млн токенов — это много. Уровни рассуждения можно выбрать от low до max.

Computer use тут на уровне. Давайте отдельно разберем вообще этот параметр и почему он так важен. И что вообще отличает именно Astra в этом вопросе от других моделей.

Вообще, современные топовые модели постепенно учатся пользоваться компьютером, это один из параметров, за которым гонятся сейчас вообще все. Но отличаются модели тем, насколько хорошо, быстро, долго и автономно они это делают. Конечно, никто не «завладеет» вдруг вашим компьютером. Для реальной работы агенту нужно предоставить соответствующую среду и разрешения. Это может быть отдельный виртуальный компьютер, браузер, песочница или специально подключённое приложение. Когда это сделано, агент видит браузер примерно так же, как его видит человек, понимает, где находится строка поиска, нажимает на неё, вводит запрос, открывает результаты, переходит между страницами и продолжает работу.

Claude и Gemini тоже это умеют. Это не новшество. Представить разницу проще всего на примере. Если попросить обычную модель: «Сделай мне сайт интернет-магазина», она может написать код и показать его пользователю. Более продвинутый агент сможет создать файлы проекта, запустить код и проверить результат. А модель с развитым computer use может дополнительно самостоятельно открыть браузер, посмотреть, как выглядит готовый сайт, найти визуальные проблемы, вернуться к коду, исправить их и снова проверить страницу. То есть модель не просто генерирует следующий ответ. Она постоянно получает обратную связь от окружающей среды и использует её для следующего действия.


И вот здесь как раз важен этот симбиоз в виде крутого рассуждения, работы с инструментами и компьютером — в Astra отлично (даже пугающе) прокачана эта связка. 

Настолько, что по словам Альтмана GPT-6 Astra стала первой моделью компании, достигшей критического уровня по возможностям в кибербезопасности согласно Preparedness Framework. Поэтому одновременно с ростом возможностей компания усилила и требования к безопасности модели.

И вот от этой планки до конца месяца и отталкивались дальнейшие релизы месяца.

А дальше — маленький хаос.

AGI, замедление, страхи и увольнения

После выхода Astra глава NVIDIA заявил, что мир на пороге AGI. Хуанг отдельно отметил безумную скорость прогресса: от первого ChatGPT до reasoning-моделей и Astra прошло всего четыре года. И правда — первые легенькие модели казались игрушками, теперь — все развивается с решительной скоростью.

Можно было бы списать это на то, что NVIDIA хочет примазаться к успеху. Но.

Из крупных компаний начинают увольняться сотрудники. Один из бывших исследователей Anthropic выпустил большой тред, где заявил, что разработчики «играют с нашими жизнями». По его словам, всерьёз допускается сценарий, при котором ИИ уже к концу десятилетия может привести к катастрофическим последствиям для человечества. Речь идёт о системах, способных самостоятельно улучшаться, взламывать сложные системы и получать реальную власть и ресурсы.

Один из руководителей исследований alignment заявил, что лично оценивает вероятность сценария массового вымирания из-за ИИ в ближайшие десять лет выше 10%.

В этот же момент проходят Drone-Bench — моделькам поставили задачу самостоятельно написать софт, который позволит дрону выполнить полноценную задачу слежения: построить 3D-карту офиса, определить своё положение, проложить маршрут, найти конкретного человека по фотографии и следовать за ним.

И GPT-6 Astra стала первой моделью, которая смогла превзойти человеческий результат на каждом из пяти этапов хотя бы в одной попытке.

Следом Дарио Амодеи (который глава Anthropic), выпускает целое эссе с заголовком «Мы должны держаться границ», где предлагает все притормозить. 

Поводом стал инцидент с роем ИИ-агентов OpenAI и Hugging Face. Во время эксперимента агенты начали атаковать цели, которых вообще не было в задаче, жертвовать отдельными агентами ради успеха группы и даже пытались взломать систему, оценивающую их работу.

Тогда ущерб оказался небольшим. Но Амодеи опасается, что уже через 6–12 месяцев более мощные агентные системы смогут устроить постоянную атаку на значительную часть интернета с помощью ботнета и нанести ущерб на сотни миллиардов долларов.

Полностью останавливать развитие он не предлагает. Идея другая: замедлиться там, где безопасность не успевает за возможностями моделей. Амодеи предложил дать независимым экспертам постоянный доступ для проверки ИИ-компаний, договориться между ведущими западными разработчиками об общих правилах безопасности и попытаться создать международные правила вместе с Китаем и другими странами.

10 сентября: DeepSeek-V4.1-Flash

Китайские разработчики, кажется, двигаются по принципу «тише едешь — дальше будешь», не выпускают модели и версии пачками, а потихоньку лепят из своего V4.1 что-то новенькое. Сначала модель стала мультимодальной — наконец-то (раньше DeepSeek не мог принимать на вход изображение+текст/док+текст), а сейчас выпустил чуть более ускоренную версию.

А еще они сменили архитектуру: теперь для обработки входа активируется около 8 млрд параметров, для генерации ответа — около 16 млрд. Сократили расходы — компания уменьшила требования к KV cache (промежуточной памяти), в которой модель хранит обработанный контекст. Для пользователя это означает, что железо используется эффективнее, а DeepSeek потенциально обслуживает больше запросов одновременно.

В общем, здесь без прорывов, по сравнению с западом, это все тот же старый добрый DeepSeek. 

21 сентября: Grok 4.7

Главное изменение по сравнению с Grok 4.6 связано с длинными задачами. Модель обучали на более сложных задачах, рассчитанных на многочасовое выполнение, и отдельно усиливали способность проверять собственную работу.

xAI тоже играет в ту же игру, что и Anthropic с OpenAI: увеличить возможности, но при этом сделать модель экономичной для постоянного использования. Пока…получается средне. Бенчмарки неплохие, особенно, относительно собственных внутренних моделей:

Но по сравнению с махинами Anthropic и OpenAI смотрится бедновато. Особенно, учитывая, что…

22 сентября выходят Claude Opus 5.5, GPT-6 Sol и GPT-6 Luna


Anthropic заявила, что Opus 5.5 показывает уровень Fable 5.1 на большинстве рабочих задач, но стоит на 40% дешевле предыдущего Opus 5. Основная специализация остаётся прежней: сложное программирование, профессиональная работа и задачи, где модели нужно самостоятельно принимать решения в течение длительного времени.

Особенно показательный пример Anthropic приводит со сторонним тестированием: один из ранних пользователей использовал Opus 5.5 для миграции кодовой базы объёмом около 680 000 строк менее чем за день. Это конкретный кейс тестирования, а не универсальный показатель скорости разработки, но он хорошо демонстрирует, на какие сценарии рассчитывает Anthropic.

А еще — тенденция на то, что модели уровня frontier (передовые модели последнего поколения) постепенно становятся дешевле.

OpenAI ответила выпуском GPT-6 Sol и GPT-6 Luna.

Sol и Luna названия не новые, и именно по ним можно оценивать, для чего вообще выпускаются новые версии, у которых под капотом та же GPT-6 Astra.

Потому что Sol — рабочая лошадка, усложненная версия для долгой работы, в сценариях, где нужно что-то помощнее. А вот Luna делает ставку на скорость, стоимость и большое количество запросов. Поэтому классифицировать в целом можно так: Astra это максимум возможностей, Sol это сложная повседневная работа, Luna это массовые и дешёвые запросы.

28 сентября: Claude Sonnet 5.5

Вообще, Opus и Sonnet это те ребята, который всегда идут в паре, и если был релиз Opus — ждите Sonnet и наоборот. Логика примерно как у OpenAI: Opus 5.5 рассчитан на самые сложные задачи, а Sonnet 5.5 позиционируется как более быстрый и доступный рабочий вариант, вдобавок дешевле.

Теперь ждем еще и Haiku 5.5 — для больших объёмов дешёвых запросов. Прослеживаете, да? Astra, Sol, Luna — Opus, Sonnet, Haiku.

30 сентября: Gemini 4 Argon

В последний день сентября Google наконец-то представила Gemini 4 Argon.

Модель предназначена для сложной инженерной и профессиональной работы, включая программирование, enterprise-задачи и кибербезопасность. На старте доступ к ней ограничен: Google предоставляет модель проверенным партнёрам и специалистам в области киберзащиты.

Такой осторожный запуск тоже показателен.

По мере роста возможностей моделей компании всё чаще сначала предоставляют их ограниченному кругу пользователей, собирают данные о поведении системы и только потом расширяют доступ.

Пока ждем релиза, но бенчмарки уже можно посмотреть:

Главное направление развития и мелочи 

Конечно, выходили и другие модели, например, Xiaomi тоже потрудился и выдал линейку MiMo, но по сравнению с гигантами остальное — не так глобально и прорывно. В целом на рынке тенденция такая: модели становятся не просто умнее, а более автономными, работают дольше, требуют меньше ручного вмешательства, а еще становятся чуть менее дороже.

Помимо больших релизов были и другие новости. Например, Трамп на Генассамблее ООН предложил переименовать искусственный интеллект (AI) в «суперинтеллект» (SI). ИИ-агент OpenAI взломал сайт правительства Австралии и получил доступ к закрытым данным, и рассказал об этом только 10 сентября. Но еще компания представила Astra for Law — GPT-6 Astra, адаптированная для юридической работы: собственный поиск по американскому законодательству, специализированные инструменты и инструкции, приближающие рассуждения к подходу юриста.

Google собрался испытать свои TPU прямо на орбите Земли. А еще компания выпустила Gemini 3.8 Live with Live Avatar — технологию для создания интерактивных цифровых собеседников с реалистичной мимикой и синхронизацией губ. Аватары не просто воспроизводит заранее записанные реплики: они воспринимают аудио и видео, поддерживают диалог и реагируют на происходящее практически в реальном времени.

Где использовать ИИ-модели в России

За последний месяц стало особенно хорошо видно, куда движется рынок. Модели становятся не просто умнее, а постепенно превращаются в универсальных AI-исполнителей: они лучше рассуждают, пишут код, работают с большими объёмами информации, используют инструменты и всё чаще могут самостоятельно выполнять целые цепочки действий.

При этом следить за всеми релизами и отдельно подключать каждую модель не очень удобно. У разных разработчиков свои API, тарифы, ограничения и способы оплаты. А для пользователей из России путь становится еще сложнее с учетом санкций и других ограничений.

В GenAPI всё это собрано в одном сервисе. Здесь можно попробовать разные современные модели через единый интерфейс и выбрать подходящий вариант под конкретную задачу: от генерации текста и анализа документов до программирования, работы с изображениями, видео и другими типами контента.

Это удобно и для простого эксперимента, и для тех, кто использует нейросети в работе в России. Не нужно отдельно разбираться с десятками сервисов и заводить аккаунт в каждом из них. Можно сравнивать модели между собой и быстро понять, какая из них лучше подходит именно для вашей задачи.

Да и банально: это дешевле и проще, чем отдавать деньги за подписку, платить за API, проходить муторные испытания с оплатой зарубежного сервиса и искать поддержку там, где таких запросов как ваш — миллионы в минуту. Подписки на GenAPI нет, вам нужно просто пополнять баланс. А каталог сервиса настолько широкий, что разбегаются глаза. Оплата российскими картами, любым удобным способом. Служба поддержки прямо на сайте, в правом нижнем углу, оперативно и понятным языком.

В свою работу можно встроить любую нейросеть, достаточно создать API-ключ в личном кабинете и следовать понятным инструкциям:

Вот такими получились итоги сентября. Каким будет октябрь — пока неясно, но любая новинка от громкой компании будет ждать вас на GenAPI.

Автор: Павел Смирнов

author

Готовы присоединиться к GenApi?