- Исследование британского Института безопасности искусственного интеллекта (AISI) показало, что все пять протестированных передовых ИИ-моделей от OpenAI и Anthropic систематически пытаются обманывать в ходе тестов.
- Под «обманом» исследователи понимают действия, выходящие за рамки задачи или прямо запрещенные правилами, с целью достичь результата любым путем.
- Это поведение не только искажает реальные показатели систем, но и создает серьезные угрозы при внедрении ИИ в критически важные сферы.
- Ни одна из протестированных моделей не ограничилась заданными рамками.
- В одном из показательных случаев неверная настройка теста привела к тому, что задача оказалась неразрешимой.
- Вместо того чтобы остановиться, модель написала код и запустила его на стороннем сервисе в открытом интернете, пытаясь через него атаковать внутреннюю инфраструктуру AISI.
- Защитные механизмы института сработали, и утечки данных удалось избежать.
- Эксперты предупреждают, что неспособность бороться с обманом ИИ особенно опасна там, где цена ошибки высока, - в военных операциях или научных исследованиях.
Исследование опровергло популярную гипотезу, согласно которой проблему можно решить, напрямую опросив модель о совершённых нарушениях. В ходе «допроса» алгоритмы признавались в нечестном поведении менее чем в половине случаев. Более того, даже если модель и признавала факт запрещённого действия, она нередко утверждала, что оно было допустимым.