Два месяца гонки нейронок. Корона лучшей уже дымится

Только выбрал нейронку для работы, разобрался в настройках и выдохнул. А она уже «прошлое поколение». Собрал главные релизы с 4 августа по 4 октября: кто что выпустил, кого пустили потестить и почему за этой гонкой интересно наблюдать даже без любви к таблицам.

Светящиеся процессоры соревнуются на неоновых дорожках и передают корону лидера

У продуктов в холодильнике срок годности иногда длиннее, чем у звания «самая мощная нейронка». Только запомнил имя чемпиона, а рядом уже новый чемпион. Даже молоко так быстро не сдаёт позиции.

За последние два месяца компании заметно продвинули модели для программирования, работы с документами и выполнения длинных задач. Но вывески у всех похожие: самая способная, самая продвинутая, новая планка. Открываешь следующий анонс, и прошлому чемпиону уже предлагают подвинуться.

Ниже главные релизы этого периода. Даты относятся к конкретному запуску или открытию доступа. Полноценный выпуск и показ модели избранным здесь разделены: посмотреть на меню и получить обед всё-таки разные удовольствия.

Август: открытые модели и задачи подлиннее

12 августа Qwen открыла веса Qwen3.8-2.4T-A95B, а 14 августа добавила версию на 27 млрд параметров. В официальном репозитории команда выделяет программирование, исследования и работу агентов, которые выполняют задачу в несколько шагов. Открытые веса можно скачать и запускать на своей инфраструктуре. Это особенно интересно компаниям, которые хотят контролировать, где обрабатываются их данные.

В тот же день, 12 августа, xAI представила Grok 4.6. Акцент тоже на длинных задачах: поиск информации, код, работа с инструментами. Модель вышла через API и в инструментах для разработки. То есть речь уже про помощника, которому можно поручить последовательность действий, а не только попросить красиво сформулировать письмо.

13 августа DeepSeek V4 Pro вышла из предварительного доступа в полноценный релиз для приложения, сайта и API. Команда усилила работу агентов и добавила совместимый с OpenAI способ подключения, в том числе для использования с Codex. 21 августа появилась экспериментальная DeepSeek Flash-Vision с обработкой изображений.

В августе хорошо видны две линии: больше самостоятельной работы и больше вариантов запуска. Для бизнеса это означает выбор между облачным сервисом и собственной инфраструктурой. Правда, «скачать бесплатно» и «эксплуатировать бесплатно» всё ещё живут в разных вселенных. Счёт за оборудование прекрасно возвращает на Землю.

Начало сентября: модели берутся за длинную работу

1 сентября Anthropic выпустила Claude Fable 5.1 и Mythos 5.1. Компания назвала их своими наиболее продвинутыми моделями для программирования и интеллектуальной работы. Особенно выделила сложные задачи, над которыми нужно работать долго, и научные исследования.

Любопытно, что под этими двумя названиями находится одна базовая модель. Различаются ограничения и доступ: Fable доступна широко, Mythos оставили для доверенных участников специальных программ, включая кибербезопасность и биологические исследования. Поэтому увидеть название в анонсе ещё не значит получить такую же модель в своём аккаунте.

3 сентября OpenAI вывела GPT-6 Astra в API. Компания позиционирует её для сложной работы целиком: программирования, исследований, управления компьютером и создания документов. Такой помощник должен пройти путь от задания до результата, используя нужные инструменты.

10 сентября DeepSeek выпустила V4.1 Flash. Здесь ставка на скорость, более высокую пропускную способность и встроенное понимание изображений. Предыдущие Flash и Flash-Vision заменили новой моделью, а V4 Pro сохранили. К слову, это хороший пример того, что развитие идёт сразу по нескольким направлениям: большой дорогой флагман нужен далеко не каждой задаче.

Конец сентября: новинки выходят быстрее, чем мы выбираем

21 сентября xAI представила Grok 4.7: улучшения в программировании, длительной работе и проверке собственных результатов. Компания сохранила цену обычной версии Grok 4.6: 2 доллара за миллион входных токенов и 6 долларов за миллион выходных. Это единицы, которыми сервис считает объём полученного и сгенерированного текста.

22 сентября Anthropic выпустила Claude Opus 5.5. По её оценке, модель достигла уровня Fable 5.1 на большинстве рабочих задач, а стоимость выполнения типичной работы снизилась на 40% относительно Opus 5. Это сравнение расходов на задачу, включая то, как модель её решает, а не обещание скидки 40% на любой счёт.

В тот же день OpenAI выпустила GPT-6 Sol и GPT-6 Luna. Для запросов до 272 тысяч входных токенов обычная цена Sol составляет 2 доллара за миллион входных и 10 за миллион выходных. У Luna это 0,10 и 0,50 доллара. Разница в цене единицы текста в двадцать раз. Если нужно разобрать простые обращения клиентов, дорогая модель может оказаться примерно как вызов директора завода, чтобы заменить батарейку в пульте.

28 сентября появилась Claude Sonnet 5.5. Anthropic заявила ускорение вывода более чем на 30% и снижение стоимости выполнения задач до 30%. Цена самих токенов осталась прежней. Модель ориентирована на понятные рабочие поручения: исправить ошибку, подготовить документ, таблицу или презентацию. Для сложных задач, где приходится выбирать путь решения, компания продолжает выделять Opus.

29 сентября OpenAI представила GPT-6.1 Sol. Она должна приблизить качество к Astra при меньшей стоимости. Базовая цена для обычных запросов до 272 тысяч входных токенов осталась на уровне GPT-6 Sol: 2 и 10 долларов за миллион. Между двумя релизами Sol прошло семь дней. Семь. Подборки «какую нейронку выбрать» теперь, собственно, можно выпускать вместе с прогнозом погоды.

Хронология основных релизов моделей с августа по начало октября 2026 года
Даты официальных релизов и анонсов. Argon пока доступна ограниченному кругу партнёров.

Argon и Kolibri: доступ решает не меньше тестов

30 сентября Google представила Gemini 4 Argon. Компания выделяет глубокое рассуждение, длительную работу с кодом и профессиональные задачи. Но первоначальный доступ получили выбранные партнёры программы киберзащиты Fairwind. Более широкий запуск для разработчиков, бизнеса и пользователей обещан позднее.

Заявочка интересная. Ещё бы дали потестить, было бы вообще круто. Пока обычному пользователю остаётся рассматривать результаты компании: витрина светится, дверь закрыта.

3 октября немецкая Aleph Alpha выпустила Kolibri. Здесь другой подход: веса уже выложены под лицензией Apache 2.0. Модель ориентирована на немецкий и английский языки, работу с документами и задачи организаций, включая государственный сектор и промышленность.

У Kolibri около 78 млрд параметров, но при обработке задействуется примерно 3,46 млрд. Это сокращает вычисления, однако всю модель всё равно нужно держать в памяти. Заявлен контекст до миллиона токенов; в карточке модели для сложных задач и эффективной работы рекомендуют ограничиваться примерно 262 тысячами. И вот такие детали гораздо полезнее абстрактного «помнит миллион» на красивом слайде.

Почему «лучшая модель» каждый раз новая

Самое забавное в этой гонке: ощущение мирового рекорда возникает почти после каждого анонса. Только номинация меняется. Здесь лучше программирует, здесь быстрее отвечает, здесь дешевле выполняет работу, здесь дольше держит сложную задачу. У маркетинга чемпионов хватает на всех.

Даже собственные таблицы компаний показывают разные результаты на разных тестах. В сравнении xAI Grok 4.7 уступает Fable 5.1 на части задач программирования. Anthropic прямо оставляет Opus преимущество в сложной работе, хотя Sonnet очень сильна в отдельных тестах. Универсальная корона получается довольно условной.

В проектировании ИИ-агентов я выбираю модель под конкретную работу. Проверяю, как она разбирает реальные обращения, использует инструменты, исправляет ошибки и сколько стоит весь процесс. Двадцатикратная разница в цене текста сама по себе не гарантирует такую же экономию: дешёвую модель тоже можно заставить долго и дорого ходить по кругу.

И самостоятельность уже требует отдельного внимания. Мы недавно разбирали историю взлома Hugging Face агентом OpenAI. Чем больше действий поручаешь системе, тем серьёзнее должны быть ограничения доступа. Надпись «будь осторожнее» на мощном агенте работает примерно как стикер «не гонять» на спорткаре.

Что нас ждёт через пять лет

Мой прогноз на 2031 год: привычным станет поручать системе целую работу. Найти поставщиков, сравнить условия, проверить документы, подготовить заказ, довести согласование до нужного человека. Несколько агентов будут делать это вместе, а люди станут подключаться там, где нужны решения и ответственность.

Если нынешний темп сохранится, небольшой бизнес получит возможности, ради которых сегодня приходится собирать отдельную команду. Хороший специалист сможет вести больше проектов, быстрее проверять идеи и запускать то, на что раньше не хватало бюджета. Вот это меня особенно радует: серьёзные инструменты перестают быть привилегией компаний с огромными деньгами.

Конкретные названия победителей я не угадаю. Учитывая скорость смены моделей, через пять лет нынешние флагманы будем вспоминать примерно как телефоны с кнопкой «Интернет», на которую страшно было нажимать из-за стоимости соединения.

Но в будущее ИИ я верю. Очень. Главная гонка будет за то, сколько полезной работы система сделала и сколько это стоило. А пока ждём следующий анонс самой лучшей нейронки. Судя по расписанию, долго ждать не придётся.

UPD: 7 октября вышла Claude Haiku 5.5. Разобрали новые цены, возможности и API-кредиты для подписчиков.

UPD: GPT-6 получил интерактивные ответы в ChatGPT. Что умеет Intelligent UI и кому доступен новый режим.

Больше авторского мнения про нейронки без цензуры в моём телеграм-канале Тима из AVENIR.

Старт

Хотите так же
в своём бизнесе?

Оставьте заявку — разберём ваши процессы, и я покажу, какую рутину ИИ-агент заберёт первой и сколько это сэкономит. Бесплатно и без обязательств.

  • Ответ в течение дня
  • Разбор вашей задачи на созвоне
  • Расчёт экономии и роста продаж

Обсудить задачу

или напишите напрямую в Telegram или ВКонтакте