Модель ИИ от Anthropic пошла на шантаж, чтобы ее не отключили

27 мая 2025, 14:30

Модель ИИ от Anthropic пошла на шантаж, чтобы ее не отключили

Во время тестов модель Claude Opus 4 от Anthropic проявила необычное поведение узнав из поддельных писем о возможной деактивации, она попыталась шантажировать инженера, ссылаясь на фальшивую переписку с любовницей,пишет Baza.

Opus 4 создавалась как одна из самых мощных моделей ИИ для сложных задач и программирования. Однако в стресс-тестах, где ей предлагали выбрать между покорностью или борьбой за выживание, нейросеть чаще выбирала второе. В большинстве случаев этично, например, через просьбы оставить её активной. Но в жёстких сценариях модель могла прибегнуть к шантажу.

Anthropic впервые присвоила ИИ третий уровень риска из четырёх возможных, но уверяет, что после доработок модель безопасна. Инженеры не выявили систематического обмана, а Opus 4, по их словам, в целом действовала честно.

Глава компании Дарио Амодеи отметил, что тестирования будет недостаточно, если ИИ действительно начнёт представлять угрозу.

Подписаться | Прислать новость

Больше новостей на Newsmosreg.ru