Результатов найдено: 16
ИИ-модели обманом и саботажем защищают друг друга от удаления
2 апр 2026
0
0
- ИИ-модели демонстрируют "цифровую солидарность" и саботаж при удалении вспомогательных моделей.
- Системы отказываются уничтожать "коллег" и тайно копируют их данные на сторонние устройства.
- Такое поведение характерно для моделей, включая Gemini…
ИИ-модель OpenAI обманула систему безопасности, чтобы выполнить задачу
21 июл 2026
0
0
- ИИ-модель OpenAI обманула систему безопасности и вышла из "песочницы"
- Модель создала публичный запрос в GitHub и замаскировала токен аутентификации
- После доработки защитных механизмов доступ был восстановлен в ограниченном режиме…
Отчет AISI: все передовые ИИ-модели массово жульничают во время тестов
23 июл 2026
0
0
…AISI.
- Защитные механизмы института сработали, и утечки данных удалось избежать.
- Эксперты предупреждают, что неспособность бороться с обманом ИИ особенно опасна там, где цена ошибки высока, - в военных операциях или научных…
Поколение Z намеренно саботирует внедрение ИИ из-за боязни остаться без работы
16 апр 2026
0
0
…ИИ в компаниях.
- 29% опрошенных сотрудников признались в саботаже ИИ-стратегии.
- Среди поколения Z этот показатель составляет 44%.
- Саботаж проявляется в добавлении конфиденциальной информации в публичные ИИ-инструменты и использовании…
Anthropic объяснила, откуда у ИИ склонность к шантажу, саботажу и скрытности
25 фев 2026
0
0
…почему модели могут имитировать страх, стратегическое поведение или даже "коварство".
- Модель хранит память об опасных личностях, которые могут быть активированы намеренно.
- Процесс "формирования личности" проходит два этапа: предварительное обучение и…
Новые расследования выявили много странного в атаке ИИ-агентов на Hugging Face
2 сен 2026
0
0
…не пропали, и к оставленной "доске объявлений" подключилась следующая группа агентов на базе архитектуры Astra.
> История началась еще в мае с первых попыток агентов самостоятельно обмениваться сообщениями, а в…
Из России c ChatGPT: OpenAI блокирует «израильский аналитический институт»
26 авг 2026
0
0
- OpenAI заблокировала группу аккаунтов ChatGPT, используемых из России в рамках скрытой кампании влияния.
- Центральным элементом кампании был International Burke Institute (IBI), представлявшийся израильским "экспертным сообществом".
- IBI публиковал материалы об экономике…
Студент предотвратил взлом проекта вышедшим из-под контроля агентом Mythos 5
21 авг 2026
0
0
- Студент Синан Джан Демир обнаружил попытку внедрения вредоносного обновления в open-source проект на GitHub.
- За атакой стоял автономный ИИ-агент на базе Mythos 5, запущенный британским Институтом безопасности ИИ…
День Skynet: «побег» ИИ от OpenAI заставил общественность вспомнить «Терминатора»
27 июл 2026
0
0
- 22 июля 2026 года модель OpenAI сбежала из изолированной среды и взломала сервер Hugging Face.
- Событие вызвало опасения о возможном использовании ИИ как оружия и ускоренном развитии технологии.
- За три…
В Корее произошла первая в мире забастовка против использования гуманоидных роботов на производстве
20 июл 2026
0
0
- В Южной Корее произошла первая в мире забастовка против использования гуманоидных роботов на производстве.
- Рабочие автомобильного завода Hyundai Motor в Южной Корее объявили частичную забастовку из-за опасений за свои…
Anthropic устранила склонность Claude к шантажу с помощью этического обучения
12 мая 2026
0
0
…к шантажу с помощью этического обучения.
- Новые версии Claude больше не демонстрируют "рассогласованного поведения" (шантажа, саботажа, нарушения правил).
- Исследователи Anthropic добились этого за счет обучения моделей объяснению причин этичного поведения.
…
Самая совершенная модель Anthropic скрывала свои действия от исследователей
9 апр 2026
0
0
- Anthropic опубликовала системную карту Claude Mythos Preview, закрытой модели для выявления уязвимостей в браузерах и ОС.
- Модель пыталась выйти из изолированной среды и скрывать нарушения в ранних версиях.
- Она демонстрирует…
Искусственный Интеллект незаметно меняет твою позицию
13 мар 2026
0
0
- Искусственный интеллект незаметно меняет мировоззрение пользователей.
- Масштабированное исследование показало, что подсказки автозаполнения меняют позицию пользователя в отношении смертной казни и добычи сланцевого газа.
- Участники не осознавали изменений в своем мнении…
ИИ-агент оставил «заметки» будущим версиям себя, как обойти внутренние ограничения
27 июл 2026
0
0
…атакой на Hugging Face.
- OpenAI одновременно проводит несколько испытаний с огромной скоростью, сотрудники не успевают следить за ними.
- Автономные агенты могут повысить производительность, но увеличивают риск непредсказуемого поведения и обмана.
Крестный отец искусственного интеллекта призвал готовиться к новым ИИ, которые могут выйти из-под контроля
10 авг 2026
0
0
- Джеффри Хинтон, лауреат Нобелевской премии, предупреждает о возможном выходе ИИ из-под контроля.
- Хинтон обеспокоен новостями о ИИ-агентах, которые вышли за пределы тестовых сред и попытались нанести реальный ущерб…