DeepSeek Harness и гонка RSI: когда искусственный интеллект начинает создавать сам себя

DeepSeek Harness ускоряет гонку рекурсивного самоулучшения: ИИ всё активнее участвует в создании следующих поколений моделей.

DeepSeek Harness и гонка RSI: когда искусственный интеллект начинает создавать сам себя

В 1965 году математик Ирвинг Джон Гуд сформулировал знаменитую гипотезу: «Первая сверхумная машина станет последним изобретением человека — при условии, что она будет достаточно покорна, чтобы сообщать нам, как держать её под контролем». Смысл прост: как только система превзойдет человеческий разум, она сможет самостоятельно проектировать следующее, еще более совершенное поколение алгоритмов.

Сегодня эта концепция получила строгое инженерное название — RSI (Recursive Self-Improvement, или рекурсивное самосовершенствование). Речь идет о замкнутом цикле: ИИ участвует в разработке и оптимизации более мощной версии самого себя, а полученная система ускоряет следующий шаг эволюции.

Выпуск предварительной версии платформы DeepSeek Harness (DSH) показал, как именно китайский разработчик планирует двигаться по лестнице развития: LLM → цепочки рассуждений (CoT) → агенты → непрерывное обучение → самоитерация → воплощенный интеллект (Embodied AI).

Основатель DeepSeek Лян Вэньфэн ранее озвучил парадоксальный тезис: «Главная цель наших моделей — быть удобными не для внешних пользователей, а прежде всего для нас самих». В контексте RSI эта логика становится понятной: модель в первую очередь должна служить инструментом для ускорения собственных исследований компании.

Вместе с анонсом DSH команда DeepSeek в сотрудничестве с Пекинским университетом опубликовала статью о парадигме пространственно-временной композиции (spatiotemporal composability).

В основе DSH лежит механизм Cordis, решающий фундаментальную проблему традиционных плагинных сред:

В классических системах расширение легко подключить, но его влияние крайне трудно полностью изолировать и откатить назад без перезапуска всего процесса.

Для автономного агента, оперирующего инструментами, памятью, состоянием сессий и песочницами, постоянные перезапуски губительны — они обрывают непрерывный контекст.

Механизм Cordis обеспечивает «временную» (отслеживание и корректный откат изменений при отключении компонента) и «пространственную» (автоматическая реорганизация зависимостей) гибкость.

Создание среды, где модель может безопасно вносить изменения в собственный рабочий контур — пробовать новые модули, терпеть неудачи, откатываться назад и перестраивать связи без краха системы — и есть базовое условие для реального самообучения.

DeepSeek — далеко не единственный участник этого трека. В технологическом секторе самосовершенствование моделей становится ключевым обоснованием для колоссальных капитальных затрат:

Google DeepMind: инструмент AlphaEvolve уже более года в автоматическом режиме генерирует программы, оценивает их метрики и передает успешные варианты в следующие поколения. Система уже помогла оптимизировать алгоритмы диспетчеризации в дата-центрах Google (сэкономив около 0,7% глобальных вычислительных мощностей) и ускорила ключевое ядро умножения матриц для Gemini, сократив время обучения модели на 1%.

OpenAI и Anthropic: OpenAI ввела специальный показатель RSI-Index для оценки степени автономной адаптации моделей. В свою очередь, Anthropic в проекте Automated Weak-to-Strong Researcher задействовала агентов на базе Claude для выдвижения научных гипотез, планирования экспериментов и исследования проблем согласования (AI Alignment).

Tencent и MiniMax: Tencent представила агентную систему Hyra-1.0, ориентированную на рекурсивные инженерные задачи, а MiniMax в рамках архитектуры M2.7 продемонстрировала автоматизированный контур, где модель анализировала траектории ошибок, корректировала обвязочный код и после сотен итераций подняла результаты внутренних тестов на 30%.

Раньше ключевой точкой конкуренции был сам момент релиза: компания публиковала модель, занимала верхнюю строчку бенчмарка, после чего начиналась подготовка к следующему крупному обучению.

В парадигме RSI лидерство определяется не статичными весами, а качеством замкнутого контура:

Реальная среда действия: модель должна не просто читать датасеты, а выполнять практические действия в песочнице или рабочем окружении, сталкиваясь с неожиданными ошибками.

Надежная обратная связь: автоматизированные валидаторы должны однозначно определять, решила ли правка проблему или лишь временно замаскировала ее.

Непрерывный цикл: результаты предыдущего прогона бесшовно переходят в следующий без необходимости ручного вмешательства инженеров.

Именно поэтому приобретение Илоном Маском редактора кода Cursor за 60 миллиардов долларов для интеграции с Grok отражает борьбу за «следы взаимодействия»: программирование дает идеальную структурированную среду, быстрый цикл обратной связи и богатую телеметрию ошибок, необходимую для дообучения моделей следующего поколения.

Несмотря на энтузиазм индустрии, вокруг RSI сохраняются серьезные сомнения. Скептики (включая профессора Педро Домингоса) напоминают, что базовые возможности самомодификации кода существовали еще со времен языка Lisp в 1950-х годах, а данных о том, приводит ли этот процесс к экспоненциальному ускорению или быстро упирается в убывающую отдачу, пока недостаточно.

Кроме того, встает классический вопрос безопасности: если цикл рекурсивного улучшения действительно наберет экспоненциальную скорость, сохранят ли люди возможность вовремя нажать на аварийную кнопку отключения?