Бенчмарки растут, а модель тупеет: почему Anthropic пришлось оправдываться за скрытую «деградацию» Claude

Скандал вокруг скрытого эксперимента Anthropic с Claude Code показал: для разработчиков стабильность важнее красивых бенчмарков.

Бенчмарки растут, а модель тупеет: почему Anthropic пришлось оправдываться за скрытую «деградацию» Claude

«Модель снова поглупела» — эта фраза давно стала главным мемом сообщества разработчиков. Долгое время создатели ИИ списывали подобные жалобы на субъективные ощущения пользователей. Однако недавний скандал вокруг Claude Code и флагманской модели Opus 5 от Anthropic предоставил сообществу прямые доказательства: разработчиков тайно вовлекают в скрытые эксперименты, урезающие возможности ИИ без предупреждения.

История началась с того, что разработчик под ником argofowl потратил почти целый рабочий день на поиск странного бага. Модель Claude Code выдавала нетипично слабые результаты, допускала примитивные ошибки и сбоила при генерации кода. После долгих проверок собственного окружения автор заглянул в реальные логи API-запросов и обнаружил поразительную деталь.

В настройках Claude Code был четко выставлен максимальный уровень рассуждений — «high». Однако в логе запроса стояло значение «10», которое в предыдущих версиях соответствовало минимальному уровню («low»).

Как выяснилось, начиная с версии Claude Code 2.1.236, Anthropic без каких-либо пометок в чейнджлоге включила часть пользователей в закрытый эксперимент по «сжатию шкалы усилий (effort)» для сессий модели Fable 5. На практике это вылилось в классический A/B-тест на живых пользователях.

Главное возмущение разработчиков вызвало не само изменение параметров, а полная непрозрачность: программисты часами отлаживали свои проекты, не подозревая, что на самом деле стали подопытными в негласном тестировании вендора.

После того как скриншоты разлетелись по соцсети X, на связь вышел инженер Claude Code Тарик Шихипар (Thariq Shihipar). Он подтвердил факт проведения тестов конфигураций API на части аудитории, заявив, что это «изменение внутренней шкалы маппинга, не влияющее на реальную производительность».

Однако дискуссия быстро переросла в обсуждение флагманской Opus 5. Пользователи и блогеры массово пожаловались на резкую «деградацию» флагмана:

Модель начала лениться и срезать углы при выполнении инструкций.

При указании на ошибки она впадала в бесконечный цикл извинений («Вы правы, моя оплошность»), продолжая плодить новые баги и тратить время на бесконечные бесполезные самоисправления.

В итоге инженерам Anthropic пришлось публично признать, что поведение Opus 5 в реальных сценариях сейчас «крайне нестабильно», а стабилизация модели стала главным внутренним приоритетом компании.

Скандал обнажил ключевую проблему всей индустрии генеративного ИИ: полный разрыв между синтетическими тестами и реальным пользовательским опытом.

На бумаге Opus 5 демонстрирует безупречные результаты (SWE-bench Pro — 79,2%, Terminal-Bench — 86,7%, общий балл — 82,72). Но в повседневной работе пользователи сталкиваются с многословием, упрямством и потерей контекста.

В отличие от классического ПО, где действуют стандарты версионирования (SemVer), прозрачные журналы изменений и возможность отката на стабильную версию, индустрия больших языковых моделей превратилась в «черный ящик». Под одним и тем же названием модели на стороне сервера провайдер в любой момент может:

Запустить фоновый A/B-тест;

Сменить квантование весов для экономии ресурсов;

Перенаправить трафик через более дешевый маршрутизатор моделей;

Урезать вычислительный бюджет на шаг рассуждения (inference budget).

Когда языковые модели претендуют на статус критически важной инфраструктуры для бизнеса и разработчиков, стабильность становится главным условием контракта доверия. Красивые графики бенчмарков годятся для маркетинговых презентаций и раундов финансирования, но реальное доверие инженеров держится исключительно на предсказуемости инструмента.