Anthropic выпустила Claude Opus 5.5 сегодня, 22 сентября. Модель стоит 4 доллара за миллион входных токенов и 20 за миллион выходных - на 20 процентов дешевле Opus 5, который держал планку 5 и 25. Контекст остался прежним, миллион токенов, максимальный ответ - 128 тысяч. Идентификатор в API: claude-opus-5-5.
Прирост в бенчмарках крупный, но интереснее другое. Четыре изменения в API возвращают 400-ю ошибку на коде, который спокойно работал вчера. Пятое ничего не ломает и не ругается - просто ваш интерфейс замолкает посреди длинной задачи. Ниже разбор цифр, расчёт реальной экономии на живом бюджете и чек-лист, что проверить до переключения прода.
Цифры релиза#
Anthropic опубликовала семь замеров. Собрал те, где есть сравнение с предыдущим Opus и с конкурентами.
| Бенчмарк | Opus 5.5 | Opus 5 | GPT-6 Astra | Fable 5.1 |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 66,4% | 52,3% | 57,9% | 55,8% |
| FrontierCode v1.1 | 54,4% | 48,0% | 53,3% | 50,3% |
| CursorBench 4.0 | 57,8% | 46,6% | - | 51,8% |
| GDPval-AA v2.1 (Elo) | 1846 | 1708 | 1542 | 1735 |
| AutomationBench | 40,0% | 26,9% | 41,4% | 31,4% |
| OSWorld 2.0 | 81,8% | 74,0% | - | 80,7% |
| Chartography | 89,0% | 83,4% | - | 88,4% |
Скачок в Terminal-Bench на четырнадцать пунктов - это много даже по меркам гонки релизов. Обратите внимание на строчку AutomationBench: там Opus 5.5 обошел Opus 5 в полтора раза, но GPT-6 Astra все равно впереди на 1,4 пункта. Anthropic эту строчку в свою таблицу поставила, хотя могла бы и не ставить. Честная выкладка, редкий случай.
Что за этими процентами стоит в работе. Модель выдаёт токены больше чем на 30 процентов быстрее Opus 5 и на той же задаче тратит их меньше. Один из тестировщиков прогнал миграцию кодовой базы на 680 тысяч строк меньше чем за день - работа, на которую команда инженеров закладывает недели. На переписывании HAProxy с C на Rust модель уложилась в 9,5 часа против 12 у более дорогой Fable 5.1 и обошлась на 51 процент дешевле.
Из цифр партнеров: Quantium закрыли задачу за 11 промптов и 3 часа вместо 38 промптов и 4 дней, Optiver получили качество Opus 5 за половину ходов и токенов, Deloitte поймали 72 процента багов на минимальном уровне усилий против 56 процентов у Opus 5.
+30%скорость выдачи токенов против Opus 5 680 000строк кода мигрировано меньше чем за день -85%попыток выйти за границы контейнераПоследняя цифра - про безопасность. На собственном автоматизированном поведенческом аудите Anthropic модель показала лучший результат среди всего, что компания тестировала. Внешние проверки провели Frontier Design и METR. Прибавились два новых классификатора: биологический и на попытки вытащить внутренние рассуждения модели в текст ответа.
Где экономия не такая, как в пресс-релизе#
Прайс упал везде. Вход - с 5 до 4 долларов, выход - с 25 до 20, запись в кэш на пять минут - с 6,25 до 5, на час - с 10 до 8. Сильнее всего подешевело чтение из кэша: было 0,5 доллара за миллион, стало 0,2. Это минус 60 процентов на самой массовой статье расходов любого агента, который гоняет один и тот же системный промпт сотни раз в день.
А теперь считаем на живом бюджете, потому что минус 20 процентов в прайсе и минус 20 процентов в счёте - разные вещи.
Агент обрабатывает 300 миллионов входных токенов и 20 миллионов выходных в месяц, 80 процентов входа читается из кэша.
На Opus 5: 240 млн из кэша по 0,5 доллара - это 120 долларов, 60 млн обычного входа по 5 - это 300, выход 20 млн по 25 - это 500. Итого 920 долларов.
На Opus 5.5 по новому прайсу: 48 + 240 + 400 = 688 долларов. Экономия 232 доллара, четверть счёта.
Но при том же уровне усилий Opus 5.5 думает больше, чем Opus 5. Если выход вырастет хотя бы в полтора раза, до 30 миллионов токенов, счёт будет 888 долларов. Экономия усыхает до 32 долларов, то есть до трех с половиной процентов.
Это не придирка на пустом месте. Anthropic сама пишет: на одном и том же уровне усилий модель склонна думать больше за ход, особенно на xhigh и max. Плюс дефолтный уровень переехал с high на medium, так что запрос без явного параметра теперь считается по-другому, чем считался на Opus 5. В обе стороны.
Хорошая новость в том, что medium у новой модели по замерам Anthropic догоняет или обгоняет high у Opus 5 на кодинге и офисных задачах, а на части кодовых тестов к нему близко подходит даже low. То есть экономия там есть, но берётся она не автоматом при смене идентификатора, а пересбором уровня усилий под свои задачи.
Четыре изменения, которые валят рабочий код#
Вот тут начинается то, ради чего стоит читать документацию, а не пресс-релиз.
1. Мышление больше нельзя выключить. На Opus 5 параметр thinking со значением disabled принимался при уровне усилий high и ниже. На Opus 5.5 и он, и ручной бюджет через budget_tokens возвращают 400. Поле thinking убирается совсем, а вместо него ставится уровень усилий: там, где мышление отключали ради экономии, берем уровень пониже. Ответ теперь может начинаться с блока мышления, поэтому блоки контента выбираются по полю type, а не по позиции.
2. Принудительный вызов инструмента не поддерживается. tool_choice со значением any или tool тоже даёт 400 - включая метод подсчёта токенов, о чём легко забыть. Работает auto и none. Если вам нужен гарантированно валидный JSON, ставьте строгий режим инструментов или структурированный вывод, а в промпте прямым текстом пишите, когда инструмент применяется.
3. Блоки мышления привязаны к модели и к разговору. Каждый блок помнит, кто его произвёл. Opus 5.5 читает блоки от Opus 5 и более ранних Opus, Sonnet и Haiku, но не от Fable и Mythos. В обратную сторону его блоки читают только Fable 5.1 и Mythos 5.1. Практический вывод для тех, у кого стоит переключатель моделей или запасная модель: разговор, переехавший с Opus 5.5 на любую другую модель, продолжится без накопленных рассуждений. И отдельно: API проверяет, не менялся ли системный промпт, список инструментов или прошлые сообщения с момента, когда блок был создан. Для аккаунтов, созданных с 31 августа 2026 года, правка задним числом с последующим воспроизведением блока вернёт 400. Разговор держим только на дозапись.
4. Старый инструмент управления компьютером отвалился. На Claude API и Google Cloud computer_20251124 больше не принимается, вместо него объявляется набор computer_toolset_20260801 - без бета-заголовка, без имени и без размеров экрана. Агентский цикл придётся поправить: действие теперь лежит в поле name самого блока, за ход их может прийти несколько, и в каждом результате нужно возвращать toolset_name. На Amazon Bedrock старый инструмент продолжает работать, там менять нечего.
Первые три изменения действуют и на Fable 5.1. Если вы держите две модели за одним фасадом и рассчитывали, что запасная подхватит от Opus 5.5 контекст рассуждений, - подхватят его только Fable 5.1 и Mythos 5.1. Остальные пойдут на голом тексте диалога.
Пятое изменение, которое не даёт ошибки#
Это самое неприятное, потому что в логах будет тишина.
На Opus 5 короткие заметки, которые модель пишет между вызовами инструментов - "нашел вот это, теперь иду сюда", - приходили обычными текстовыми блоками. На Opus 5.5 они приезжают блоками мышления с пометкой прогресса. По умолчанию их текстовое поле пустое. Ни один запрос не падает, статус 200, все хорошо.
А в интерфейсе пользователь двадцать минут смотрит на пустоту, пока агент молча перемалывает задачу.
Лечится настройкой отображения: значение updates (пока в бете, с заголовком thinking-display-updates-2026-08-18) отдаёт краткую выжимку каждой заметки, оставляя сами рассуждения скрытыми, а summarized отдаёт и то и другое вперемешку. Дальше каждый непустой блок рендерится перед тем вызовом инструмента, к которому он относится.
Второй сюрприз того же рода - автономные агенты. Opus 5.5 регулярно отчитывается о ходе работы, и часть таких отчётов заканчивает ход текстом без вызова инструмента. Цикл, который считает такой ход завершением задачи, просто остановится на середине. Anthropic советует держать список подзадач, который модель сама обновляет, и на текстовый конец хода отвечать коротким сообщением с перечнем незакрытых пунктов. И ограничивать себя двумя-тремя автопродолжениями, чтобы по-настоящему застрявший запуск все-таки останавливался и попадал на разбор человеку.
Что показали независимые замеры#
Сервис ревью кода CodeRabbit прогнал Opus 5.5 через свой конвейер в двух конфигурациях и выложил цифры в день релиза. Набор из 80 открытых паттернов ошибок и отдельный набор из 13 сложных случаев.
На простом наборе прирост оказался косметическим: полнота 63,8 процента против 61,3 у базовой модели, точность даже чуть просела - 38,6 против 39,3. А вот на сложных случаях разрыв другой: стандартная конфигурация поймала 8 проблем из 13 против 5 у базовой, максимальная - 10 из 13. Точность на этом наборе выросла с 29,4 до 66,7 процента.
Расплата - токены. Стандартная конфигурация съела на 49 процентов больше на первом наборе и на 41 процент больше на втором, максимальная - плюс 58 и плюс 60 процентов. Вывод авторов: лучший баланс даёт стандартная конфигурация, а дополнительные усилия максимальной дают смешанный результат.
Читается это так: прибавка Opus 5.5 приходит там, где задача действительно сложная, и оплачивается расходом токенов. Ровно тот случай, когда расчёт из блока выше перестает быть теоретическим.
Кому апгрейд окупается прямо сейчас#
Три сценария, где прибавка видна в деньгах, а не в таблице бенчмарков.
Агенты, которые кликают по чужому интерфейсу. OSWorld вырос с 74 до 81,8 процента, и Anthropic отдельно отмечает: на дефолтном уровне усилий модель повторила результат, которого Opus 5 добивался только на заметно более высоком. Для сценариев, где бот работает руками в 1С, Битриксе или CRM клиента, это прямая экономия - каждый промах по кнопке стоит повторного прогона. Мы такие вещи собираем в автоматизации на ИИ, и модель под капотом там заменяемая как раз ради подобных релизов.
Разбор документов, где смысл висит на расположении. Chartography 89 процентов, но важнее формулировка Anthropic: даже на минимальном уровне усилий модель снимает значения с плотных графиков точнее, чем Opus 5 на максимальном, тратя малую долю выходных токенов. Плюс ситуации, где значение определяется не текстом, а положением: какие блоки соединяет стрелка на схеме, что изменилось между двумя версиями чертежа, во сколько начинается встреча на скриншоте календаря. Если у вас в обработке стоят костыли для картинок, написанные под старые модели, половину можно выносить.
Длинные автономные прогоны. Терминальный бенчмарк прибавил четырнадцать пунктов, и это тот класс задач, где агент работает часами без человека: аудит кодовой базы, миграция, прогон тестов до зеленого. В наших Telegram-ботах длинные цепочки отвечают за квалификацию лидов, и меньше зависших диалогов - это напрямую меньше потерянных заявок.
Чего апгрейд не даёт. Русский язык Anthropic по-прежнему не меряет - все бенчмарки англоязычные. Если модель будет работать с русскоязычным контентом клиента, это отдельный замер на ваших данных, и закладывать его в план нужно до переключения, а не после. Та же история была с Opus 4.7 и с Fable 5 - ни один релиз-пост этого вопроса не закрывает.
Чек-лист перед переключением прода#
Порядок, в котором это делается без сюрпризов.
- Поменять идентификатор на
claude-opus-5-5. На Amazon Bedrock он пишется с префиксом:anthropic.claude-opus-5-5. - Вычистить
thinkingсо значениямиdisabledиenabledс ручным бюджетом. Вместо них - явный уровень усилий. - Поставить уровень усилий руками, не полагаясь на дефолт. Он теперь
medium, а былhigh. - Заменить
tool_choiceсо значениямиanyиtoolнаautoплюс строгий режим инструментов или структурированный вывод. - Для управления компьютером на Claude API и Google Cloud перейти на набор
computer_toolset_20260801и поправить агентский цикл. - Поднять
max_tokens. Мышление считается в этот лимит, даже когда его содержимое вам не возвращают, и потолок, подобранный под Opus 5 с выключенным мышлением, обрежет ответ. Anthropic для длинных агентских ходов рекомендует ставить максимум - 128 тысяч. - Если интерфейс показывает текст между вызовами инструментов, включить отображение обновлений и рендерить непустые блоки мышления.
- Добавить обработку отказа: ответ приходит со статусом 200, но с причиной остановки
refusalи категорией. Категорий стало больше - прибавились биология и попытка вытащить рассуждения. - Прогнать свои задачи на обеих моделях параллельно и пересчитать стоимость закрытой задачи, а не цену за миллион токенов.
Отдельно про инструменты миграции: в Claude Code есть встроенный навык, который прогоняет замену идентификатора и правки параметров по всей кодовой базе командой /claude-api migrate this project to claude-opus-5-5, а потом выдаёт список пунктов на ручную проверку. Перед запуском он спрашивает границы правок. Это экономит час механической работы, но девятый пункт чек-листа за вас никто не сделает.
Если нужен подрядчик на встраивание Claude или другой модели в рабочий процесс - напишите нам, разберем задачу и посчитаем, где у вас узкое место: в модели, в промптах или в самом процессе. Про то, какие задачи вообще имеет смысл отдавать агентам, а какие ломаются об реальность, отдельно писали в разборе ИИ-агентов для бизнеса.
Частые вопросы
01Сколько стоит Claude Opus 5.5?
4 доллара за миллион входных токенов и 20 за миллион выходных. У Opus 5 было 5 и 25, то есть базовый прайс упал на 20 процентов. Чтение из кэша подешевело сильнее - с 0,5 до 0,2 доллара за миллион. Пакетная обработка через Batch API идёт за полцены: 2 и 10 долларов.02Чем Opus 5.5 отличается от Opus 5?
Выдаёт токены больше чем на 30 процентов быстрее и на тех же задачах тратит их меньше. Terminal-Bench 4.0 вырос с 52,3 до 66,4 процента, агентский рейтинг GDPval - с 1708 до 1846 Elo. Из практического: мышление больше нельзя выключить, дефолтный уровень усилий опустился с high до medium, а знания модели обновлены до июня 2026 года.03Что сломается при переходе на Claude Opus 5.5?
Четыре вещи возвращают 400-ю ошибку: отключенное мышление, ручной бюджет на мышление, принудительный вызов инструмента через tool_choice со значением any или tool и старый инструмент computer_20251124 на Claude API и Google Cloud. Пятое изменение ошибку не даёт: текст между вызовами инструментов приезжает в блоках мышления и по умолчанию приходит пустым.04Claude Opus 5.5 доступен бесплатно?
Нет. Модель работает через Claude API и облака AWS, Google Cloud и Microsoft Foundry, везде по счётчику токенов. Бесплатного тарифа с Opus у Anthropic нет, а дешевле обычно выходит не бесплатный доступ, а правильно подобранный уровень усилий и кэширование промпта.05Стоит ли сразу переводить продакшен на Opus 5.5?
Сначала прогнать свои задачи на обеих моделях параллельно. Экономия на прайсе реальная, но при том же уровне усилий модель думает больше, чем Opus 5, и выходных токенов может стать заметно больше. На ревью кода независимые замеры показали рост расхода токенов на 40-60 процентов.06Какой уровень effort выбрать на Opus 5.5?
Начинать с medium - это дефолт модели. По данным Anthropic, на кодинге и офисных задачах medium догоняет или обгоняет Opus 5 на high, а на части кодовых тестов к нему близко подходит даже low. Уровни xhigh и max держать для работы, где прирост качества вы измерили.
Источники#
- Introducing Claude Opus 5.5 - анонс Anthropic, бенчмарки, цены, цитаты партнеров.
- Claude Opus 5.5 overview - спецификация модели: контекст, лимиты, прайс, доступность.
- What's new in Claude Opus 5.5 - что перестало работать и какие функции поддерживаются.
- Migrating to Claude Opus 5.5 - чек-лист миграции и примеры кода до и после.
- Prompting Claude Opus 5.5 - калибровка усилий, автономные прогоны, работа с визуальным вводом.
- Claude Opus 5.5 Code Review Benchmarks - независимые замеры CodeRabbit на ревью кода.

