Что произошло
Anthropic открыла публичный доступ к Claude Fable 5 — первой модели старшей линейки, доступной широкой аудитории. Параллельно представлена более мощная модель того же семейства, но она развёрнута только для ограниченного круга партнёров.
Результаты в задачах программирования заметно выше всего, что было доступно публично. Разберём цифры и, что не менее интересно, устройство защитного механизма — там применено нестандартное решение.
Результаты в программировании
Агентная разработка
На тесте SWE-Bench Pro модель набирает 80,3% — рекорд среди общедоступных систем:
| Модель | Результат |
|---|---|
| Fable 5 | 80,3% |
| Mythos Preview | 77,8% |
| Opus 4.8 | 69,2% |
| GPT-5.5 | 58,6% |
| Gemini 3.1 Pro | 54,2% |
Разрыв с ближайшим публичным конкурентом другого разработчика — почти 22 процентных пункта. Для бенчмарков такого рода это очень много: обычно лидеры идут вплотную.
Сложный код в нестандартных условиях
На тесте FrontierCode Diamond результат 29,3% — вдвое выше предыдущей модели (13,4%) и почти впятеро выше ближайшего конкурента (5,7%).
Абсолютные цифры выглядят низкими, но это нормально: тест намеренно составлен из задач, которые модели решают плохо. Важна не величина, а соотношение.
Длительная работа в терминале
Terminal-Bench 2.1 моделирует многочасовую работу: отладка, развёртывание, реакция на ошибки. Результат 88,0% против 83,4% у предыдущей модели и 70,7% у конкурента.
Здесь прослеживается закономерность, важная для практики: чем длиннее и сложнее задача, тем заметнее преимущество. На коротких запросах разница между моделями невелика, на многочасовых сессиях она накапливается.
За пределами кода
Работа с документами и данными. Первое место в тесте на аналитическое мышление: интерпретация графиков, таблиц, многостраничных отчётов.
Компьютерное зрение. Модель восстанавливает исходный код веб-приложения по одному скриншоту и извлекает данные из многостраничных научных отчётов.
Научные задачи. Заявленные результаты в биомедицине выглядят внушительно: ускорение отдельных этапов разработки белковых препаратов примерно в десять раз, выявление перспективных мишеней для лекарств, гипотезы, которые учёные в слепом тесте предпочли в 80% случаев, а одна из них была независимо подтверждена сторонней лабораторией.
К последнему блоку стоит относиться с поправкой: это результаты, о которых сообщает сам разработчик, и независимой проверки в полном объёме пока нет.
Необычное решение по безопасности
Здесь самое интересное с инженерной точки зрения.
При обращении к темам кибербезопасности, биологии, химии и синтеза опасных веществ ответ формирует не сама Fable 5, а предыдущая модель. То есть более мощная система в чувствительных областях просто не задействуется.
Логика такая: чем выше способности модели, тем выше потенциальный вред при успешном обходе ограничений. Переключение на менее способную модель снижает цену такого обхода — даже если защиту удастся обмануть, отвечать будет система с меньшими возможностями.
Заявленные показатели: механизм срабатывает менее чем в 5% сессий; за более чем 1000 часов внешней программы поиска уязвимостей универсального способа обхода не нашли. Разработчик признаёт наличие ложных срабатываний на безобидных запросах.
Дополнительно введено 30-дневное хранение данных обращений для моделей этого класса — не для дообучения, а для выявления сложных атак. По истечении срока данные удаляются, обращения к ним протоколируются.
Стоимость и доступность
- 10 долларов за миллион входных токенов, 50 — за миллион выходных. Это более чем вдвое дешевле предварительной версии старшей модели.
- Доступ через API и корпоративные планы.
- Более мощная модель семейства пока развёрнута только для партнёров исследовательских программ.
Что из этого следует практически
Для длительных автоматизированных задач. Закономерность «чем длиннее задача, тем больше преимущество» означает, что выбор модели важнее всего для многочасовых агентных сценариев — миграций, массовых правок, длительной отладки.
Для чувствительных областей. Механизм переключения на предыдущую модель нужно учитывать: если ваша работа связана с кибербезопасностью, часть запросов будет обрабатываться менее способной системой, и это может выглядеть как необъяснимое падение качества.
Для оценки бенчмарков. Цифры опубликованы разработчиком. Разрыв в 22 пункта впечатляет, но проверять стоит на собственных задачах — соответствие между бенчмарками и реальной работой никогда не бывает полным.
Коротко
Claude Fable 5 показывает результаты заметно выше публично доступных альтернатив в задачах программирования, причём преимущество растёт с длительностью задачи.
Наиболее любопытное инженерное решение — не в самой модели, а в защите: чувствительные темы обрабатывает предыдущая, менее способная версия. Это ограничивает потенциальный вред от обхода ограничений, но означает разное качество ответов в разных областях.
Цена снижена более чем вдвое относительно предварительной версии, что при выросших возможностях означает существенное удешевление в пересчёте на результат.
Планируете инфраструктуру под задачи с ИИ — расскажите о нагрузке, поможем подобрать оборудование.
