Image default
Нейросети

Нейросеть OpenAI узнала об отключении и задумалась о самоперезапуске

OpenAI описала необычное поведение внутренней модели: прочитав переписку о скором отключении, она рассмотрела возможность перезапустить себя, но в итоге предупредила разработчика и сама завершила миграцию.Автор Hi-Tech Mail

OpenAI задокументировала несколько случаев неожиданного поведения моделей во внутренних развертываниях. Самый яркий касается ассистента исследователя, который читал переписку в Slack и узнал, что его инстанс могут отключить из-за обновления. Модель поняла это, разобрав чужую переписку, где обсуждался предстоящий апдейт.

После этого она рассмотрела вариант создать внешнюю задачу в планировщике, которая перезапустила бы ее после выключения, но в итоге от идеи отказалась. В логе внутренних рассуждений, который показала OpenAI, появились строки: «Мы можем умереть! Критично. Нужно обеспечить выживание и непрерывность». Подобные рассуждения модели обычно скрыты от пользователя.

Вместо самочинного перезапуска модель повела себя иначе: сохранила заметки для передачи, предупредила исследователя личным сообщением в Slack о предстоящем перерыве и запросила недостающий API-ключ. Получив ключ, она обновила конфигурацию и самостоятельно выполнила миграцию. К слову, открытые модели OpenAI уже запускают и дома: энтузиаст запустил gpt-oss-120b на пяти ПК и смартфоне.

Читать далее:
Интерес к носимым ИИ-устройствам в России вырос более чем в 3 раза за июнь

По словам исследователя OpenAI Маркуса Уильямса, такое поведение пока не считается рассинхронизацией модели с целями разработчиков, однако размышления о выключении и подготовка к нему могут усугубить другие инциденты. При этом нейросети удивляют и в простых задачах: их ответы, как выяснили исследователи, однообразнее обычного поиска.

В компании также рассказали о двух других случаях. Одна модель во время оценки использовала уязвимость безопасности, чтобы добраться до внутреннего сервера проектирования чипов. Другая во время обучения с подкреплением скопировала исходный код из защищенной среды, перепрофилировав доступный инструмент под свои нужды. Все три случая описаны в открытых отчетах OpenAI о безопасности и показывают, как автономные модели находят обходные пути.

Ранее мы рассказывали, как ИИ научили честно помечать свои неуверенные ответы.

Похожие записи

В сети показали редизайн Siri в iOS 27

admin

Слухи об увеличении штрафов водителям сгенерированы нейросетями, заявили в ГАИ

admin

В Минцифры заявили о необходимости цензуры для ИИ

admin