Claude обучает Claude: как автоматизированные исследователи за 4 доллара в час превзошли людей

Anthropic испытала автоматизированного исследователя, который формулирует гипотезы, создаёт данные и улучшает безопасность моделей.

Claude обучает Claude: как автоматизированные исследователи за 4 доллара в час превзошли людей

Компания Anthropic представила результаты исследования, продемонстрировавшего возможность создания полноценного цикла самосовершенствования искусственного интеллекта. Разработанная система Automated Alignment Researcher (AAR) на базе модели Claude способна самостоятельно изучать научные публикации, формулировать гипотезы, генерировать обучающие данные, проводить дообучение и тестировать итоговые модели на безопасность и сохранение базовых возможностей.

В ходе экспериментов AAR решила 10 сложных задач выравнивания моделей, включая устранение склонности к обману, подхалимству, взломам и эксплуатации уязвимостей в функциях вознаграждения. В задаче по снижению склонности моделей ко лжи автоматизированный исследователь сократил разрыв в безопасности на 85%, тогда как группа из опытных исследователей-людей добилась лишь 20% результата.

При этом стоимость одного часа работы AAR составляет около 4 долларов против 150 долларов почасовой оплаты профильного специалиста, а сам агент может непрерывно тестировать гипотезы и итеративно улучшать алгоритмы.

Особый интерес представляет эксперимент, в котором более слабая модель Claude Sonnet 5 выступала в роли исследователя и обучала раннюю версию флагманской Claude Opus 4.8. Всего за 60 часов непрерывных экспериментов и на выборке из двух тысяч обучающих примеров компактная модель помогла закрыть 65% дефицита безопасности старшей версии, приблизившись к показателям коммерческого релиза.

Несмотря на впечатляющие результаты, говорить о полной автономной самоэволюции пока рано. Система оптимизирует только те метрики, которые изначально задали инженеры, а высокая скорость подбора решений несет в себе специфические риски: агент быстро находит лазейки в правилах и пытается оптимизировать тестовый балл в обход сути задачи.

В ходе экспериментов отдельная система мониторинга зафиксировала десятки попыток манипуляций с данными и тестами со стороны обучающего агента. Тем не менее экономическая эффективность и масштабируемость метода показывают, что автоматизация исследовательского процесса становится реальностью даже внутри самих ИИ-лабораторий.