Разговоры о дороговизне искусственного интеллекта обычно сводятся к цене вычислений, но на самом деле это вопрос бизнес-модели. Сегодня почти все сервисы привязаны к облаку: пользователь отправляет запрос, удалённый дата-центр разворачивает кластеры GPU, модель с сотнями миллиардов параметров выполняет тяжёлые матричные расчёты, и результат возвращается по сети.
Пока речь идёт о том, чтобы изредка пересказать статью или поправить письмо, это терпимо. Но когда ИИ встраивается в производственный процесс и должен ночами читать тысячи внутренних документов, вызывать внешние инструменты и повторять попытки при ошибках, одна команда человека превращается в сотни и тысячи последовательных вычислений. При оплате за токены счёт растёт стремительно.
Только за один месяц несколько тысяч сотрудников могут израсходовать триллионы токенов, а стоимость вычислений составит несколько миллионов долларов.
Дело не в том, много это или мало, а в том, что при такой модели расходы почти невозможно предсказать заранее. В традиционном IT директор мог рассчитать бюджет, зная число лицензий.
В эпоху агентов никто не скажет, сколько циклов рассуждений потребует сложная задача и сколько раз придётся обращаться к внешним сервисам. Опросы показали, что более половины руководителей не увидели от ИИ ни роста доходов, ни снижения издержек, и лишь около двенадцати процентов получили и то и другое.
Ещё важнее то, что поштучная оплата подавляет саму инициативность ИИ. Чтобы система могла действовать самостоятельно, ей нужна свобода пробовать, ошибаться, откатываться и проверять себя.
Но если каждая попытка стоит денег, компании ставят лимиты на вызовы и бюджет, а пользователи боятся запускать агента надолго. Это как ехать в такси с секундомером: даже если водитель уверяет, что ищет короткую дорогу, пассажир нервничает и просит остановиться. ИИ нужен простор для «бесполезных» вычислений, а значит, его работа должна быть достаточно дешёвой.
Один из выходов — локальные модели. Данные не покидают устройство, работа возможна без сети, а расходы вместо оплаты за каждый вызов превращаются в более-менее фиксированные затраты на железо и электричество.
Токены бесплатны, платите за электричество. Это не отменяет издержек, но меняет их структуру и снимает психологический барьер.
История уже знает подобные переходы. Пока интернет был dial-up и оплачивался по времени, люди экономили каждую минуту. С приходом широкополосного доступа и Wi-Fi они перестали считать трафик, и именно тогда расцвели стриминг, короткие видео и мобильные платежи.
Похожее произошло с софтом: дорогие корпоративные лицензии уступили место подписке, и программы пришли в компании, которым раньше были не по карману.
Сегодняшние облачные модели с оплатой за токены — это эпоха коммутируемого доступа. Настоящий взрыв начнётся, когда ИИ станет таким же дешёвым и незаметным в использовании, как офисный пакет на компьютере или ежемесячная плата за интернет.
Вопрос не в том, насколько ещё поумнеют модели, а в том, сможем ли мы сделать интеллект настолько дешёвым и непрерывным, чтобы люди наконец доверили ему дела, а не считали каждую его мысль.