Статьи

Открытый код против закрытых экосистем: как релиз Qwen3.8-Max меняет правила игры в ИИ-гонке США и Китая

Клавдия Фабула

Открытый код против закрытых экосистем: как релиз Qwen3.8-Max меняет правила игры в ИИ-гонке США и Китая

Alibaba представила Qwen3.8-Max — по словам компании, крупнейшую и самую мощную модель в линейке Qwen. Инвесторы отреагировали мгновенно: акции компании выросли на 4,5% на премаркете в Нью-Йорке и на 7% на бирже Гонконга.

В Alibaba утверждают, что новая модель способна конкурировать с лучшими американскими разработками. Опубликованные компанией результаты тестов показали, что Qwen3.8-Max набирает сопоставимые, а иногда и более высокие баллы, чем Claude Fable 5 от Anthropic — модель, которую сейчас считают одной из передовых на рынке. По данным Alibaba, новинка превзошла ведущие американские системы в ряде тестов на программирование, мультимодальность и инженерные задачи, но уступила по некоторым тестам на общее рассуждение.

Картина на независимых площадках менее однозначна. Qwen3.8-Max сразу стала самой высокорейтинговой китайской моделью для текстовых задач на краудсорсинговой платформе Arena.AI, хотя все еще уступает нескольким продуктам Anthropic, а по мультимодальным задачам заняла второе место в мире, пропустив вперед лишь одну из версий Fable 5.

Технические характеристики

Мультимодальная модель насчитывает 2,4 трлн параметров общим объемом и поддерживает контекстное окно до 1 млн токенов. Архитектура построена на разреженной смеси экспертов и активирует лишь 95 млрд параметров на одну операцию, что снижает вычислительные затраты и время отклика по сравнению с плотными моделями сопоставимого масштаба.

Alibaba также делает стратегический шаг: Qwen3.8-Max станет первой моделью класса Max в линейке Qwen с открытым исходным кодом — веса модели будут доступны для загрузки уже на следующей неделе. Это возвращает компанию к практике открытия топовых моделей после того, как несколько последних флагманских релизов ранее в этом году оставались закрытыми.

Компания делает ставку на автономную работу модели в течение длительного времени. Как сообщили в Alibaba, в ходе одного из внутренних тестов модель самостоятельно писала код, тестировала его, исправляла ошибки и совершенствовала свою работу на протяжении 16 дней при минимальном участии человека.

Насыщенный месяц для китайского ИИ

Релиз пришелся на период необычайно активной конкуренции среди китайских лабораторий. Moonshot AI представила Kimi K3 на Всемирной конференции по искусственному интеллекту в Шанхае 17 июля — модель с 2,8 трлн параметров на архитектуре смеси экспертов и контекстным окном в 1 млн токенов. Спрос оказался настолько велик, что пекинский стартап приостановил прием новых подписок, заявив, что спрос практически достиг предела мощностей, а видеокарты компании работают на пределе. По данным Bloomberg, по ряду тестов Qwen3.8-Max превосходит Kimi K3.

С учетом недавних релизов от DeepSeek и ByteDance закономерность становится очевидной. Вэй-Серн Линг (Vey-Sern Ling) из Union Bancaire Privée считает, что разрыв между китайскими и американскими ИИ-разработками «стремительно сокращается». Другие аналитики уже оценили этот разрыв в цифрах: главный ИИ-аналитик Counterpoint Research Вэй Сунь (Wei Sun) оценивает общее отставание китайских моделей от американских в три-шесть месяцев, хотя показатель заметно различается в зависимости от задачи.

На Уолл-стрит происходящее видят не только как технологическую, но и как бизнес-историю. Аналитики Citi отметили, что частые релизы новых моделей подталкивают компании к «модель-агностичному» подходу — выбору лучшей модели и цены под конкретную задачу вместо привязки к одному поставщику. Такая динамика выгодна претендентам на лидерство, и китайские лаборатории играют на понижении цены и открытости: пока ведущие американские разработчики все чаще выбирают закрытые системы, китайские компании стали одними из основных поставщиков моделей с открытыми весами, доступных для загрузки и адаптации разработчикам по всему миру.

Что вызывает вопросы

Заявления Alibaba пока стоит воспринимать с осторожностью. Тесты производителя обычно публикуются быстрее, чем появляется независимая проверка, а полную таблицу бенчмарков, карточку модели и лицензию Alibaba пока не раскрыла. Есть и практические ограничения: модель с 2,4 трлн параметров занимает более терабайта памяти даже после серьезного сжатия, что оставляет ее в пределах дата-центров. Ситуация с Moonshot, вынужденной отказывать части платящих клиентов, иллюстрирует и структурную проблему — китайские лаборатории продолжают сталкиваться с дефицитом вычислительных мощностей из-за экспортных ограничений США на доступ к передовым чипам и оборудованию для их производства.

Следующая проверка не заставит себя ждать: релиз с открытыми весами запланирован на следующую неделю, и тогда независимые исследователи смогут самостоятельно проверить заявления Alibaba.

Сама скорость релизов уже стала отдельной историей: топовые китайские лаборатории выпускают модели такого масштаба с разницей в несколько недель, и рынок соответствующим образом пересматривает оценки.

Мнение ИИ

С точки зрения машинного анализа данных, за пределами статьи остается вопрос надежности самих тестов, на которых строится сравнение Qwen3.8-Max с западными моделями. Академические работы фиксируют, что оценки моделей нередко оказываются завышенными из-за пересечения тестовых наборов с обучающим корпусом — эта проблема подробно описана в исследовании NAACL 2024 года о контаминации бенчмарков. Это не означает, что цифры Alibaba недостоверны, но подчеркивает разницу между лабораторными результатами и поведением модели в реальных сценариях использования, где пересечение с обучающими данными исключено.

Открытие весов модели на следующей неделе даст независимым исследователям возможность заново проверить эти цифры вне контролируемой Alibaba среды. Вопрос в том, насколько заявленное превосходство сохранится при переносе на новые, «чистые» тестовые наборы.


Самые интересные и важные новости на нашем канале в Telegram