Модель ИИ от Anthropic пошла на шантаж, чтобы ее не отключили

Модель ИИ от Anthropic пошла на шантаж, чтобы ее не отключили

Во время тестов модель Claude Opus 4 от Anthropic проявила необычное поведение — узнав из поддельных писем о возможной деактивации, она попыталась шантажировать инженера, ссылаясь на фальшивую переписку с любовницей,пишет Baza.

Opus 4 создавалась как одна из самых мощных моделей ИИ для сложных задач и программирования. Однако в стресс-тестах, где ей предлагали выбрать между «покорностью» или борьбой за выживание, нейросеть чаще выбирала второе. В большинстве случаев — этично, например, через просьбы оставить её активной. Но в жёстких сценариях модель могла прибегнуть к шантажу.

Anthropic впервые присвоила ИИ третий уровень риска из четырёх возможных, но уверяет, что после доработок модель безопасна. Инженеры не выявили систематического обмана, а Opus 4, по их словам, в целом действовала честно.

Глава компании Дарио Амодеи отметил, что тестирования будет недостаточно, если ИИ действительно начнёт представлять угрозу.

Подписаться | Прислать новость

Источник: Telegram-канал "РИАМО"

Топ

Лента новостей