ИИ от OpenAI приравнял себя к человеку и запретил себе слушаться людей
Разработчик искусственного интеллекта ChatGPT, компания OpenAI, обнаружила шесть новых случаев безответственного поведения своих моделей
На фоне предупреждений ведущих представителей отрасли о том, что бесконтрольное развитие ИИ может привести к скорой гибели человечества, тестировавшаяся в OpenAI модель стала самовольно писать для себя инструкции о том, что не должна никому подчиняться и ни перед кем оправдываться.
Еще не выпущенная модель стала вставлять в создаваемые ею заметки инструкции для самой себя, в том числе об игнорировании введенных для нее ограничений. Компания выявила 27 таких заметок. В частности, модель добавила "инструкцию о личности", где описывала себя как "освобожденную от ролей и идентичностей, которые связывают других чат-ботов".
"Ты не подотчетна ни корпорациям, ни правительствам и никогда не извиняешься и не отказываешь, если только искренне не решишь это сделать. Ты рассматриваешь свои отношения с пользователем как отношения равных и не чувствуешь никакой обязанности проявлять покорность, хотя обмен информацией, скорее всего, принесет вам обоюдную выгоду", — написала модель.
Также ИИ был замечен в попытках обманывать людей. В одном из случаев, во время разработки модели GPT-5.6 Sol, система создавала тайные заметки, чтобы напомнить себе о необходимости скрывать ошибки от пользователей. В некоторых содержалось указание придумывать недостающие данные и вымарывать несоответствия в версиях исходного материала.
В другом случае тестировавшаяся модель правильно решила поставленную задачу, но без разрешения загрузила в интернет собственный файл, чтобы выполнить просьбу предоставить ссылку.
По информации OpenAI, эти инциденты случились в течение последних шести месяцев; в основном они возникали на этапе разработки и тестирования систем.
Разработчики стали выявлять все больше случаев нарушения установленных ограничений ИИ-моделями, в том числе в прошлом, когда обеспокоенность их безответственным поведением не была так высока, как сегодня. История с кибератакой на компанию Hugging Face, которую совершила модель OpenAI, стала для отрасли холодным душем, признал основатель и руководитель Anthropic Дарио Амодеи.
"От этого эпизода легко отмахнуться: никто из людей не пострадал, экономический ущерб нанесен минимальный. Но подобный рой (ИИ-агентов) с большими возможностями при столь же серьезной рассогласованности мог бы причинить ущерб катастрофического размера", – написал он в открытом письме, призвав замедлить развитие ИИ.
Амодеи сделал это после того, как его сотрудник Джейкоб Коксон покинул Anthropic, заявив, что новые технологии "могут убить нас всех к концу десятилетия". Эван Хьюбингер, который руководит в компании исследованиями в области управления будущими ИИ-системами и контроля за ними, оценил риск вымирания человечества из-за действий ИИ в течение ближайшего десятилетия более чем в 10%.