Американская компания TypeSafeAI выпустила модель Jev, которая не пишет ни слова. Ей дают материал и несколько готовых вариантов ответа, а она лишь выбирает наиболее подходящий и сообщает число, означающее степень уверенности. Никаких объяснений, никакого кода, никакого диалога.
Это выглядит как шаг назад по сравнению с большими языковыми моделями, но именно в этом заключается ставка компании. Обычный чат-бот продаёт написанные слова, а Jev продаёт одно суждение.
Слова — это единица услуги, а суждение — это деталь. Деталь можно внести в закупочный список, посчитать её себестоимость и вызывать тысячи раз прямо из кода.
Если такая деталь достаточно дёшева, в программном обеспечении появится множество точек принятия решений, где раньше вызывать ИИ просто не имело смысла.
Журналисты провели собственное тестирование на китайских финансовых материалах: отчёты девяти крупных компаний, вопросы о макроэкономике, отраслевых циклах и конкретных показателях.
Всего сто девяносто вызовов модели, и общая стоимость оказалась меньше одной десятой доллара. В первом раунде из сорока пяти проверок Jev ответил безошибочно, причём каждый вопрос задавался трижды и ответ ни разу не менялся.
Но самое интересное произошло там, где модель колебалась. В единственном случае, где она не была полностью уверена, речь шла о переломном моменте в цикле свиноводства, и её сомнение оказалось осмысленным: она выбирала между двумя близкими сценариями, а не металась наугад.
Однако стоит вернуть модели арифметику, как картина меняется. В вопросах, где нужно было посчитать или сравнить темпы роста вблизи пограничного значения, ошибки становились системными.
В одном случае Jev десять раз подряд ошибся на одной и той же задаче, причём с высокой уверенностью, и не признал ошибку даже после того, как из материала убрали лишние данные.
Это самое опасное: модель не знает, что она не знает. Когда она признаётся в неуверенности, её можно отправить на ручную проверку. Но когда она уверенно выбирает неверный вариант, распознать проблему без независимой проверки почти невозможно.
Сама уверенность в этой архитектуре означает лишь, насколько модель склоняется к одному из предложенных вариантов, а не насколько этот вариант правилен.
Тесты также показали, что вокруг такой модели неизбежно вырастает целая инфраструктура.
Программа берёт на себя извлечение данных и расчёты, Jev выполняет последнее смысловое суждение, сомнительные случаи уходят человеку, а объяснить результат пользователю может уже обычная языковая модель.
Настоящая стоимость лежит не в API, а в подготовке данных, в аккуратно составленных вариантах ответов и в порогах уверенности, настроенных на конкретном бизнесе.
При этом Jev не является чем-то уникальным по своим возможностям: похожие модели для классификации и ранжирования давно работают внутри поиска, модерации и финансового анализа.
Разница лишь в том, что кто-то впервые упаковал это в отдельный коммерческий продукт с собственной единицей измерения. И если такие «детали суждения» действительно подешевеют до почти нуля, изменится не только структура расходов на ИИ, но и сам способ считать его экономику.