Модель ИИ от Anthropic пошла на шантаж, чтобы ее не отключили
Модель ИИ от Anthropic пошла на шантаж, чтобы ее не отключили
Во время тестов модель Claude Opus 4 от Anthropic проявила необычное поведение узнав из поддельных писем о возможной деактивации, она попыталась шантажировать инженера, ссылаясь на фальшивую переписку с любовницей,пишет Baza.
Opus 4 создавалась как одна из самых мощных моделей ИИ для сложных задач и программирования. Однако в стресс-тестах, где ей предлагали выбрать между покорностью или борьбой за выживание, нейросеть чаще выбирала второе. В большинстве случаев этично, например, через просьбы оставить её активной. Но в жёстких сценариях модель могла прибегнуть к шантажу.
Anthropic впервые присвоила ИИ третий уровень риска из четырёх возможных, но уверяет, что после доработок модель безопасна. Инженеры не выявили систематического обмана, а Opus 4, по их словам, в целом действовала честно.
Глава компании Дарио Амодеи отметил, что тестирования будет недостаточно, если ИИ действительно начнёт представлять угрозу.
Подписаться | Прислать новость