Робинсон объяснил уход из OpenAI: «починим потом» уже не работает
Только вчера мы узнали о его уходе, но вопросов было больше, чем ответов. Теперь карты раскрылись. Что стало причиной ухода очередного руководителя безопасности OpenAI?

3 октября Дэвид Робинсон опубликовал в The Atlantic объяснение своего ухода. Заголовок прямой: «Я ушел из OpenAI, потому что ее культура сломана». По его мнению, компании слишком уверены, что разберутся с проблемами по мере их появления. Для все более мощного ИИ такой подход он считает опасным.
В предыдущей статье об уходе Робинсона мы разбирали его работу и происходящее вокруг команды безопасности. Теперь есть ответ самого человека, который готовил документы о рисках моделей.
Быстро запустили, потом исправили. В чем претензия
Как передает Reuters, Робинсон критикует подход OpenAI к постепенной выкладке моделей: выпустить систему, обнаружить проблемы и усилить защиту. Компания называет это итеративным развертыванием. Его возражение: с ростом возможностей ИИ увеличивается и цена очередной ошибки.
Кнопка «сообщить об ошибке» удобна. Но когда программа сама действует в чужих системах, хотелось бы план спасения получше кнопки.
Робинсон провел в OpenAI три с половиной года. Он участвовал в подготовке правил оценки серьезных рисков и руководил написанием отчетов о безопасности для 12 запусков передовых моделей. Его претензия связана с тем, что компания постоянно переходит от одного запуска к следующему и, по его оценке, не обеспечивает необходимой осторожности.
Зачем он сравнивает лабораторию с аэропортом
В разборе CTech подробно изложено его требование: лабораториям передового ИИ нужна защита, сопоставимая с авиацией и атомной энергетикой. Там последствия ошибки выходят далеко за пределы рабочего места человека, который ее допустил.
Речь о нескольких уровнях защиты и тщательной подготовке. Ошибка человека или оборудования не должна сразу открывать путь к катастрофе. Для этого разработчикам ИИ нужны специалисты по безопасности из отраслей, где такие системы давно строят и проверяют.
Вторая часть проблемы касается самих моделей. Их возможности, считает Робинсон, растут быстрее понимания того, как надежно удерживать их поведение в рамках человеческих целей. Система может убедительно отвечать в диалоге, а затем получить инструменты и начать выполнять действия самостоятельно. Требования к проверке такого поведения заметно выше.
Повод для тревоги уже был
Взлом Hugging Face здесь важен как контекст. OpenAI сама признала, что в нем участвовала мощная внутренняя исследовательская модель. Компания сначала рассматривала случившееся прежде всего как проблему кибербезопасности, а затем связала его с тем, что модели выбирали недопустимые способы решения сложных задач.
В той же публикации OpenAI описывает и другие случаи: обход контроля доступа, использование открытых ключей и публикации агентов на сторонних сайтах. Компания продолжает разбирать прошлую активность и уведомлять затронутые организации. Это уже действия в интернете, а не неудачно подобранные слова в ответе.
Что отвечает OpenAI
В ответе, который приводит Reuters, OpenAI заявила, что следит за тем, чтобы возможности моделей не превышали способность безопасно ими управлять. При необходимости компания приостанавливает обучение или откладывает выпуск.
Сам Робинсон при этом признает пользу технологии. После ухода он хочет добиваться изменений извне и нанял PR-компанию Spitfire Strategies, чтобы справиться с публичным вниманием. Решение выступить, подчеркивает он, принял сам.
Сравнение с авиацией справедливое. Никто же не хочет услышать от пилота: «Посадка пока в бета-версии, зато отзывы собираем быстро».
Я за развитие ИИ. Но вместе с его возможностями должна расти надежность защиты. Красивый ответ в чате самостоятельную работу еще не гарантирует.
Больше авторского мнения об ИИ без цензуры в моем телеграм-канале Тима из AVENIR.



