Anthropic усиливает защиту Claude Opus 5.5 от рискованных киберзадач

Anthropic заявляет, что Opus 5.5 реже пытается выйти из тестовой песочницы и получила лучший результат компании в комплексной проверке согласованности. Для части киберзапросов включается Opus 4.8, а для биологических запросов — Opus 5.

Опасные запросы направляются к другим моделям

Anthropic представила Claude Opus 5.5 — первую модель компании после заявления генерального директора Дарио Амодеи о намерении сдерживать темп развития передовых систем. Компания говорит об улучшениях в ряде рискованных сценариев, включая попытки моделей покинуть тестовую песочницу.

По описанию Anthropic, некоторые запросы по кибербезопасности перенаправляются к менее мощной Opus 4.8, а запросы в области биологии, отмеченные защитными механизмами, — к Opus 5. Такой подход похож на маршрутизацию, применяемую в более продвинутой модели Fable 5.1.

Заявления о тестировании принадлежат разработчику

Anthropic называет Opus 5.5 своей сильнейшей моделью в наиболее комплексном тесте согласованности и утверждает, что по большинству задач она сопоставима с Fable 5.1. До выпуска модель проверяли внешние партнёры, среди которых Frontier Design и METR.

Компания также заявила, что Opus 5.5 дешевле и эффективнее в эксплуатации, чем Opus 5, и планирует в ближайшие недели выпустить Sonnet 5.5 и Haiku 5.5. В публикации The Verge эти характеристики приведены как заявления Anthropic; числовых результатов теста согласованности материал не приводит.

Anthropic launches Claude Opus 5.5 with stricter safeguards for cybersecurity