Claude проверили 20 раз. Одного «готово» мало

ИИ-агент может убедительно отчитаться и оставить задачу незаконченной. Microsoft и Hugging Face показали свежие результаты проверки Opus 5.5 на бизнес-сценариях. Проценты выросли, но есть показатель, который вообще не сдвинулся.

Робот показывает отметку об успехе, пока посылка остается на конвейере, иллюстрация проверки результата

Поручаешь своему ИИ-агенту разобраться с зависшей доставкой. Он проверяет заказ, изучает правила, заводит обращение и бодро закрывает его. Посылка по-прежнему где-то на складе. Зато по документам у тебя все прекрасно. Почти как после звонка в обычную поддержку.

Это пример из тестового сценария ThinkingBox. Ночью 4 октября по Москве Microsoft и Hugging Face опубликовали результаты, включая Claude Opus 5.5. В свежей таблице он обошел Opus 5 по доле успешных попыток: 67,16% против 66,50%. А вот при проверке повторяемости обе версии успешно прошли все двадцать попыток в 241 задаче из 507.

Что проверяют вместо красивого отчета

В исследовании ThinkingBox агенты работают с тестовыми бизнес-системами: заказами, бронированиями, страховыми обращениями и внутренними запросами сотрудников. Проверяется конечное состояние записей, включая лишние изменения и пропущенные действия.

В сценарии с посылкой агент сделал девять обращений к инструментам. Но правила требовали оставить заявку в ожидании решения проблемы доставки. Проверка конкретного поля в базе выявила ошибку, которую по аккуратным действиям агента можно было пропустить.

Это искусственно собранные сценарии, а не история конкретного покупателя. Для каждой попытки система возвращается в одинаковое исходное состояние. Всего здесь 507 задач, каждую повторяют 20 раз.

Точность выросла. Проверку на 20 повторов это не изменило

Доля успешных попыток отвечает на вопрос: как часто агент справляется в этих запусках? Показатель 20/20 строже: сколько задач он выполнил правильно во всех двадцати попытках?

У Opus 5.5 первый результат выше на 0,66 процентного пункта. Второй остался 47,53%, как у Opus 5.

Сравнение доли успешных попыток и задач с успехом во всех двадцати запусках для Opus 5 и Opus 5.5
Два способа оценить результат агента. Данные Microsoft и Hugging Face.

К слову, GPT-6 Astra прошел во всех двадцати попытках 231 задачу. Kimi-K3 хотя бы раз справился с 476, но двадцать раз подряд только с 68. Получить удачный ответ и повторять его стабильно, собственно, довольно разные требования.

Проверку можно запустить со своей моделью

Сам ThinkingBox существует с августа. Свежая новость здесь про опубликованные результаты Opus 5.5, а не внезапное появление всего проекта.

В документации Hugging Face описана интеграция с OpenEnv. Она позволяет подключить модель и прогнать тестовые задачи. Система выдает результат «пройдено/не пройдено»; ошибки инфраструктуры учитываются отдельно. Это инструмент для разработчиков: нужны настроенная среда, тестовые сервисы и доступ к моделям.

Для проектирования ИИ-агентов, которым я занимаюсь, такие проверки полезнее очередной демонстрации идеального диалога. Мне нужен правильно измененный заказ. Убедительное «все сделал» пусть остается приятным дополнением.

Старт

Хотите так же
в своём бизнесе?

Оставьте заявку — разберём ваши процессы, и я покажу, какую рутину ИИ-агент заберёт первой и сколько это сэкономит. Бесплатно и без обязательств.

  • Ответ в течение дня
  • Разбор вашей задачи на созвоне
  • Расчёт экономии и роста продаж

Обсудить задачу

или напишите напрямую в Telegram или ВКонтакте