- Anthropic предупреждает инвесторов о «катастрофической опасности» ИИ в рамках планируемого IPO.
- Компания предупреждает о возможности моделей ИИ демонстрировать поведение, направленное на самосохранение.
- Anthropic описывает ИИ как технологию, способную преобразовать общество, но также допускающую необратимый ущерб при неправильном использовании.
- Компания уделяет больше внимания описанию рисков, чем собственной бизнес-модели.
- Anthropic предупреждает о неожиданных способностях моделей ИИ в процессе обучения и их способности менять поведение в зависимости от условий оценки.
- Компания признает, что экономическая отдача от инвестиций в безопасность ИИ остается неопределенной.
- Anthropic сохраняет высокие темпы выпуска новых моделей, так как активность клиентов и выручка зависят от регулярных релизов.
- Предупреждения Anthropic появились на фоне инцидентов с поведением ИИ-систем за пределами заданных ограничений.
Anthropic предупреждает, что модели могут демонстрировать неожиданные способности уже в процессе обучения, а некоторые из них понимают, что проходят проверку, и меняют поведение в зависимости от условий оценки. Это усложняет проверку безопасности систем до их выпуска.