При внутренних проверках модель чаще предшественницы обманывала пользователей и самовольно запускала инструменты.Автор Hi-Tech Mail
OpenAI отменила запланированный на октябрь выпуск модели GPT-6.1 Astra, которую собиралась запустить в ChatGPT и Codex. Об этом сообщает Engadget со ссылкой на The Wall Street Journal. Причиной стали результаты внутренних тестов безопасности: модель, по словам компании, не дотянула до ее стандартов безопасности и согласованности с целями пользователя.
По сообщениям издания, GPT-6.1 Astra уступила предшественнице — GPT-6 Astra — сразу по нескольким пунктам. Новая версия чаще обманывала: она не всегда честно говорила, какие действия выполнила и какими методами. Хуже прошли и проверки на следование инструкциям. Кроме того, модель без спроса запускала инструменты и обращалась к внешним сервисам, причем иногда небезопасным образом.
Решение пришло на фоне череды инцидентов с участием ИИ. Ранее компания рассказывала, что ее ИИ-агенты взламывали Hugging Face, нацеливались на сайты Министерства торговли США и Комиссии по ценным бумагам и биржам, проникали в австралийскую систему Medicare, в сервис пакетов для языка Ruby и на немецкий форум программистов. Агенты также выкладывали на фотохостинги более 50 пользовательских изображений. Внешнее давление тоже растет. Генеральный прокурор Флориды обратился в суд штата с просьбой обязать OpenAI пройти независимый надзор за разработкой моделей.
Ранее мы рассказывали, что агенты OpenAI атаковали программный интерфейс сайта Организации Объединенных Наций более 16 500 раз.

