Самая агентная модель линейки Sonnet

30 июня 2026 года Anthropic выпустила Claude Sonnet 5 — по формулировке компании, «самую агентную» модель линейки Sonnet: планирование, работа с браузером и терминалом, автономная работа на уровне, который недавно требовал более крупных и дорогих моделей. Позиционирование — производительность, близкая к Opus 4.8, при заметно более низкой цене; существенный шаг вперёд относительно Sonnet 4.6 в рассуждениях, использовании инструментов, коде и работе со знаниями.

Иллюстрация к материалу «Claude Sonnet 5: самый agentic Sonnet, default для Free и Pr»: работа программиста с кодом

Доступность и цена

С 30 июня Sonnet 5 доступна на всех тарифах: модель по умолчанию для Free и Pro, доступна на Max, Team и Enterprise, работает в Claude Code и Claude Platform под идентификатором claude-sonnet-5. Вводная цена действует до 31 августа 2026 года: $2 за миллион входных и $10 за миллион выходных токенов, затем цена вырастет до $3 и $15 соответственно. Новый токенизатор, как у Opus 4.7, может давать в 1,0–1,35 раза больше токенов на тот же ввод — вводные цены рассчитаны так, чтобы переход был примерно нейтральным по стоимости.

Результаты на бенчмарках

Кривые соотношения цены и качества на бенчмарках BrowseComp и OSWorld-Verified показывают устойчивое улучшение относительно Sonnet 4.6 и более широкий диапазон соотношения цены и качества, чем у Opus 4.8; при повышенных усилиях на части задач модель может сравняться с Opus 4.8. Среди примеров раннего доступа: сквозное обновление тарифа в Salesforce вместе с письмом о запуске — раньше подобные задачи останавливались на середине; воспроизведение теста без предварительного запроса → исправление → проверка через stash; сильные результаты на исправлении устаревшего кода и состояний гонки; заметный прогресс в юридических исследованиях у клиента Eve, компьютерном использовании в страховой компании Pace и скорости получения инсайтов в ClickHouse.

Безопасность

По данным автоматизированного поведенческого аудита, у модели в целом ниже показатели нежелательного поведения по сравнению с 4.6, лучше отказ от вредоносных запросов и устойчивость к внедрению вредоносных инструкций в промпт, ниже уровень галлюцинаций и подстраивания под мнение пользователя. При этом уровень рассогласованного поведения выше, чем у Opus 4.8 и превью-версии Mythos, хотя автоматизированный аудит в целом безопаснее, чем у 4.6. По кибербезопасности: модель не проходила намеренного обучения кибернавыкам, показала 0% полностью рабочих эксплойтов на оценке уязвимостей Firefox — заметно ниже, чем у Opus и Mythos, а защитные механизмы для киберзадач включены по умолчанию, как у Opus 4.7 и 4.8, но мягче, чем у Fable 5. Полный разбор — в системной карте Sonnet 5. Независимое тестирование Artificial Analysis подтвердило заявленные возможности, но оценило стоимость примерно в $2,29 за задачу — примерно на 15% дороже Opus 4.8, поскольку Sonnet 5 использует заметно больше токенов на ту же работу.

Бенчмарки: где Sonnet 5 обгоняет Opus 4.8

На бенчмарке для работы со знаниями GDPval-AA v2 Sonnet 5 набрал 1618 очков — чуть выше, чем у Opus 4.8 (1615), и заметно выше Sonnet 4.6 (1395); это единственный из опубликованных бенчмарков, где новый Sonnet обходит текущую топовую модель Anthropic. На остальных агентных тестах разрыв с Opus 4.8 сохраняется, но заметно сократился по сравнению с Sonnet 4.6.

Без использования инструментов на Humanity's Last Exam Sonnet 5 показывает 43,2% против 49,8% у Opus 4.8 — разрыв заметно больше, чем при использовании инструментов (57,4% против 57,9%), то есть именно agentic-возможности подтягивают Sonnet 5 к уровню Opus 4.8 сильнее, чем чистые рассуждения без инструментов.

Бенчмарк

Sonnet 5

Opus 4.8

Sonnet 4.6

SWE-bench Pro

63,2%

69,2%

58,1%

Terminal-Bench 2.1

80,4%

82,7%

67,0%

OSWorld-Verified

81,2%

83,4%

78,5%

GDPval-AA v2 (очки)

1618

1615

1395

Официальные источники

Факты проверены 3 августа 2026 г.