Китайский рынок больших языковых моделей переживает необычный период: практически каждый крупный разработчик заявляет, что его модель является «лучшей в Китае» или даже входит в число сильнейших в мире.
Alibaba говорит о Qwen как о модели, уступающей лишь лучшим решениям Anthropic, Moonshot AI называет Kimi одним из самых мощных открытых решений, Zhipu делает ставку на лидерство в программировании, DeepSeek подчёркивает высокие результаты в инженерных тестах, а ByteDance продвигает Doubao через успехи в математике и других специализированных задачах.
На первый взгляд эти утверждения противоречат друг другу. На самом деле проблема заключается в другом: каждая компания выбирает собственный критерий, в котором её модель оказывается первой.
Одна лучше справляется с программированием, другая — с китайским языком, третья — дешевле конкурентов, четвёртая показывает лучший результат на конкретном тесте. Поэтому вопрос «кто лучший?» имеет смысл только в том случае, если сравнивать модели по единым независимым критериям.
Если использовать сразу несколько крупных международных и китайских систем оценки, картина становится гораздо понятнее. Наиболее честный вывод на конец лета 2026 года заключается в том, что китайский рынок возглавляет дуэт Kimi K3 и Qwen3.8-Max.
При этом их сильные стороны заметно различаются: Kimi лучше подтверждён международными тестами и практическими проверками, а Qwen особенно силён в китайском языке и обладает мощнейшей экосистемой.
Одним из наиболее показательных ориентиров считается Artificial Analysis — независимая платформа, которая оценивает модели сразу по нескольким направлениям, включая математику, рассуждения, знания и программирование.
По данным на начало августа, Kimi K3 набрала 57 баллов и заняла четвёртое место среди почти двух сотен моделей. Для открытой модели это особенно важный результат: Kimi стала одним из самых высоко оценённых решений с открытыми весами и приблизилась к мировым лидерам.
Другие китайские модели заметно отстают. GLM-5.2 получила около 51 балла, а DeepSeek V4 Flash — около 50. При этом Qwen3.8-Max на момент публикации ещё не имела оценки Artificial Analysis, поэтому заявления о её положении в мировом рейтинге пока нельзя напрямую подтвердить этой системой. Предыдущая версия Qwen показывала результат около 56,6 балла, но переносить его автоматически на новую модель было бы некорректно.
Второй важный источник — Arena, где модели сравниваются в слепом режиме реальными пользователями. Человек видит ответы двух анонимных систем и выбирает лучший, а затем на основе миллионов таких сравнений рассчитывается рейтинг.
Здесь Qwen3.8-Max занимает восьмое место в общем рейтинге, а Kimi K3 — двенадцатое. Разница между ними минимальна, поэтому говорить о безоговорочном превосходстве одной модели было бы неправильно. Однако в специализированных практических задачах преимущество Kimi становится заметнее.
Особенно сильный результат Kimi показывает в веб-разработке: модель занимает второе место в мировом рейтинге, уступая только одной из флагманских моделей Anthropic. В программировании она также входит в число лучших, а в задачах, связанных с автономными ИИ-агентами, находится в первой пятёрке. Это делает Kimi наиболее универсальной китайской моделью по международным практическим тестам.
Qwen3.8-Max, напротив, особенно хорошо показывает себя в комплексной оценке китайского языка. В китайском тестировании SuperCLUE она занимает первое место, опережая Kimi. Это важный результат для пользователей, которым нужны тексты, анализ документов, работа с китайским языком и повседневные офисные задачи.
Таким образом, два главных конкурента фактически поделили лидерство. Kimi получает преимущество там, где важны международная проверка, программирование и работа автономных агентов. Qwen сильнее выглядит в китайском языке и выигрывает за счёт огромной экосистемы открытых моделей и инструментов.
При этом на рынке остаются и другие серьёзные игроки.
DeepSeek, который ещё недавно считался главным китайским конкурентом американских моделей, сегодня уже не занимает первое место, но по-прежнему остаётся чрезвычайно сильным. Его главное преимущество — сочетание качества и стоимости. Старшие модели DeepSeek хорошо показывают себя в сложных задачах рассуждения, а более дешёвая версия V4 Flash рассчитана на массовое использование и большое количество обращений со стороны ИИ-агентов.
Именно DeepSeek в начале 2025 года стал символом технологического рывка китайского ИИ. Выход R1 показал, что сильную модель можно создавать с гораздо более высокой эффективностью использования вычислительных ресурсов, чем многие предполагали. Однако рынок развивается настолько быстро, что даже несколько месяцев без крупных обновлений способны изменить расстановку сил. В 2026 году DeepSeek уже приходится догонять Kimi и Qwen.
У Zhipu другая стратегия. GLM-5.2 особенно хорошо проявляет себя в программировании и специализированных инженерных задачах. В отдельных международных рейтингах по программированию модель занимала первое место. Но её результаты в комплексных тестах пока не позволяют поставить её рядом с Kimi и Qwen по совокупности возможностей.
У ByteDance ситуация ещё интереснее. Doubao обладает огромной пользовательской базой в Китае и показывает сильные результаты в китайских тестах. Однако у этой модели есть существенный недостаток с точки зрения международного сравнения: она пока недостаточно представлена в независимых глобальных рейтингах. Поэтому оценить её реальное место в мировом масштабе значительно сложнее.
Если попытаться дать максимально простой ответ, то сегодня Kimi K3 выглядит сильнейшей китайской моделью по совокупности независимых международных подтверждений. Она занимает высокие позиции сразу в нескольких независимых системах оценки, особенно хорошо работает с программированием и ИИ-агентами и стала одной из наиболее заметных открытых моделей в мире.
Qwen3.8-Max находится практически рядом и имеет собственные преимущества. Она лучше проявляет себя в китайском языке, занимает более высокое место в общем рейтинге Arena и обладает экосистемой Qwen, которая за несколько лет стала одной из крупнейших в мире среди открытых ИИ-моделей.
Поэтому говорить о безусловном единоличном чемпионе пока рано. Более точное описание китайского рынка — это противостояние Kimi и Qwen, за которыми следуют DeepSeek, GLM и Doubao, каждый из которых имеет собственную сильную сторону.
При этом сама идея рейтинга «лучшей модели» становится всё менее однозначной. Для пользователя гораздо важнее задача. Модель, которая лучше всех пишет код, не обязательно будет лучшей для китайского текста. Самая мощная система может оказаться слишком дорогой для массового использования, а дешёвая модель может быть предпочтительнее для миллионов ежедневных запросов.
Есть и ещё один важный фактор — скорость развития отрасли. Разрыв между лидерами сегодня измеряется уже не годами, а месяцами. Пока Kimi получает наиболее убедительное международное подтверждение своего лидерства, Qwen ждёт новых независимых оценок, DeepSeek готовит следующие поколения моделей, а ByteDance и Zhipu продолжают наращивать свои разработки.
Поэтому правильнее говорить не о раз и навсегда определённом победителе, а о коротких окнах лидерства. Ещё недавно главным именем китайского ИИ был DeepSeek, теперь в центре внимания находятся Kimi и Qwen. Через несколько месяцев ситуация может снова измениться.
Но один принцип остаётся неизменным: если компания называет свою модель «первой», нужно прежде всего посмотреть, в каком именно рейтинге она первая и кто находится рядом с ней в том же рейтинге. Чем больше независимых тестов подтверждает результат, тем ближе такой титул к реальному лидерству.
На сегодняшний день наиболее убедительный ответ выглядит так: Kimi K3 — лидер по совокупности международных независимых проверок, Qwen3.8-Max — лидер в китайском языке и один из главных центров открытой ИИ-экосистемы. А окончательный победитель китайской гонки больших моделей ещё не определён.