Jev: когда суждение ИИ продают по частям

Американская компания TypeSafeAI выпустила модель Jev, которая не пишет ни слова. Ей дают материал и несколько готовых вариантов ответа, а она лишь выбирает наиболее подходящий и…

Jev: когда суждение ИИ продают по частям

Американская компания TypeSafeAI выпустила модель Jev, которая не пишет ни слова. Ей дают материал и несколько готовых вариантов ответа, а она лишь выбирает наиболее подходящий и сообщает число, означающее степень уверенности. Никаких объяснений, никакого кода, никакого диалога.

Это выглядит как шаг назад по сравнению с большими языковыми моделями, но именно в этом заключается ставка компании. Обычный чат-бот продаёт написанные слова, а Jev продаёт одно суждение.

Слова — это единица услуги, а суждение — это деталь. Деталь можно внести в закупочный список, посчитать её себестоимость и вызывать тысячи раз прямо из кода.

Если такая деталь достаточно дёшева, в программном обеспечении появится множество точек принятия решений, где раньше вызывать ИИ просто не имело смысла.

Журналисты провели собственное тестирование на китайских финансовых материалах: отчёты девяти крупных компаний, вопросы о макроэкономике, отраслевых циклах и конкретных показателях.

Всего сто девяносто вызовов модели, и общая стоимость оказалась меньше одной десятой доллара. В первом раунде из сорока пяти проверок Jev ответил безошибочно, причём каждый вопрос задавался трижды и ответ ни разу не менялся.

Но самое интересное произошло там, где модель колебалась. В единственном случае, где она не была полностью уверена, речь шла о переломном моменте в цикле свиноводства, и её сомнение оказалось осмысленным: она выбирала между двумя близкими сценариями, а не металась наугад.

Однако стоит вернуть модели арифметику, как картина меняется. В вопросах, где нужно было посчитать или сравнить темпы роста вблизи пограничного значения, ошибки становились системными.

В одном случае Jev десять раз подряд ошибся на одной и той же задаче, причём с высокой уверенностью, и не признал ошибку даже после того, как из материала убрали лишние данные.

Это самое опасное: модель не знает, что она не знает. Когда она признаётся в неуверенности, её можно отправить на ручную проверку. Но когда она уверенно выбирает неверный вариант, распознать проблему без независимой проверки почти невозможно.

Сама уверенность в этой архитектуре означает лишь, насколько модель склоняется к одному из предложенных вариантов, а не насколько этот вариант правилен.

Тесты также показали, что вокруг такой модели неизбежно вырастает целая инфраструктура.

Программа берёт на себя извлечение данных и расчёты, Jev выполняет последнее смысловое суждение, сомнительные случаи уходят человеку, а объяснить результат пользователю может уже обычная языковая модель.

Настоящая стоимость лежит не в API, а в подготовке данных, в аккуратно составленных вариантах ответов и в порогах уверенности, настроенных на конкретном бизнесе.

При этом Jev не является чем-то уникальным по своим возможностям: похожие модели для классификации и ранжирования давно работают внутри поиска, модерации и финансового анализа.

Разница лишь в том, что кто-то впервые упаковал это в отдельный коммерческий продукт с собственной единицей измерения. И если такие «детали суждения» действительно подешевеют до почти нуля, изменится не только структура расходов на ИИ, но и сам способ считать его экономику.

Автор материалов и основатель сервиса SMSLab Строева Марина — аналитик, эксперт по искусственному интеллекту, автор книг о данных, рынках, экономической истории и AI.

Смотреть все новости