ai models15 мин чтения

Анонимная модель сожгла 26 триллионов токенов за четыре дня. Прайс-лист появился позже: 24 цента.

20 августа 2026 года на OpenRouter появилась модель без лаборатории, без карточки и без цены — под именем stealth/ox-alpha. Через четыре дня пользователи OpenCode прогнали через неё 26 триллионов токенов. Через шесть дней Z.AI признала её своей: GLM-5.3-Flash, 320 миллиардов параметров, лицензия MIT, 0,15 доллара за миллион входных токенов. Почему лаборатории теперь выпускают модели без собственного имени, что на самом деле измеряют эти цифры трафика и что смешанная цена в 24 цента делает с экономикой речевых конвейеров.

K
Ken Jo
#ox-alpha#glm#z-ai#zhipu#stealth-model#openrouter#open-weight#ai-pricing#ai-models

20 августа 2026 года на OpenRouter появилась модель под идентификатором stealth/ox-alpha. Никакой лаборатории рядом. Ни карточки модели, ни таблицы бенчмарков, ни анонса. В поле цены стояло 0 долларов на входе, 0 долларов на выходе. Зато у неё было контекстное окно на 1 048 576 токенов, приём текста, изображений и видео и однострочное описание про долгосрочную разработку программного обеспечения.

Через четыре дня OpenCode сообщил, что его пользователи прогнали через неё 26 триллионов токенов.

Через шесть дней Z.AI подтвердила Bloomberg, что модель принадлежит ей, выложила веса под лицензией MIT и приложила прайс-лист: пятнадцать центов за миллион входных токенов, пятьдесят центов за миллион выходных. Имя — GLM-5.3-Flash. Слово «Flash» в этой фразе выполняет колоссальную работу, и именно поэтому мы пишем этот текст.

Это комментарий, а не репортаж о релизе. Дальше — хронология шести дней с цифрами трафика и необходимыми оговорками, аргумент о том, почему лаборатории всё чаще выпускают модели без чьего-либо имени, характеристики и независимые оценки теперь, когда личность раскрыта, явный список утверждений, которые мы не смогли проверить, и подробный расчёт того, что смешанная цена в 24 цента делает со стоимостью обработки речи. Это прямое продолжение нашего сравнения «до и после» о возвращении локальных моделей, и вывод направлен туда же: цена компетентного машинного интеллекта продолжает падать — быстрее, чем закладывает большинство продуктовых планов.

Коротко:

  • Трафик был настоящий и рекордный. 26 триллионов токенов на OpenCode за четыре дня при 327 000 уникальных пользователей и 11,6 триллиона на OpenRouter за три дня — крупнейший запуск модели в истории OpenRouter против прежнего максимума в 4,4 триллиона.
  • Личность подтверждена первоисточником. 26 августа 2026 года Z.AI сообщила Bloomberg, что Ox Alpha — модель серии GLM; на собственной странице OpenRouter теперь написано, что скрытая модель «была разработана и эксплуатировалась ZAI, раскрыта как ZAI GLM-5.3-Flash».
  • Главное здесь — цена. 320 миллиардов параметров суммарно при 18 миллиардах активных, лицензия MIT, 0,15 доллара на входе и 0,50 на выходе за миллион токенов — смешанная цена 0,24 доллара против 10,00 долларов у закрытого флагмана полугодовой давности, которого она обходит на 12,1 балла в Intelligence Index от Artificial Analysis.

Хронология шести дней: от анонимного появления Ox Alpha на OpenRouter 20 августа 2026 года до подтверждения Z.AI 26 августа, что это GLM-5.3-Flash с весами под лицензией MIT

Вся история от начала до конца заняла меньше недели. Источники — в конце текста.

Шесть дней, в том порядке, в котором всё происходило

20 августа: модель появляется на OpenRouter и одновременно внутри OpenCode — открытого терминального агента для программирования, созданного Даксом Раадом. OpenCode подаёт её как бесплатную, практически безлимитную, без сохранения данных по собственному маршруту, и заявляет, что обеспечил мощности до 100 триллионов токенов в сутки.

С 21 по 24 августа: использование растёт каждый день без исключения. Эндпоинт активности моделей OpenRouter зафиксировал 27,0 миллиона запросов 21 августа, 54,4 миллиона 22 августа (плюс 101,2 %), 63,9 миллиона 23 августа и 70,3 миллиона 24 августа.

24 августа: OpenCode публикует цифры. 26 триллионов токенов за первые четыре дня, 327 000 уникальных пользователей и 8 328 244 завершённых сессии — в среднем 3,2 миллиона токенов на сессию и около 25 сессий на пользователя. Это вывело Ox Alpha на второе место среди моделей, которые отслеживает OpenCode: впереди DeepSeek V4 Flash с 33 триллионами, позади MiMo-V2.5 от Xiaomi с 12 триллионами. OpenRouter отдельно сообщил об 11,6 триллиона токенов за первые три полных дня, назвав это крупнейшим запуском модели в истории платформы; прежний рекордсмен за то же стартовое окно выдал 4,4 триллиона.

25 августа: API моделей OpenRouter, отсортированный по обработанным токенам за прошедшую неделю, ставит Ox Alpha на первое место среди 558 возвращённых моделей. За пределами лаборатории никто не знает, кто её сделал.

26 августа: Z.AI подтверждает Bloomberg, что Ox Alpha — новая модель её серии GLM. Веса выходят той же ночью. В собственном посте о запуске компания пишет, что тестировала GLM-5.3-Flash анонимно под именем ox-alpha на OpenCode и OpenRouter, «чтобы собрать отзывы пользователей», а страница скрытой модели на OpenRouter дополняется формулировкой: модель «была разработана и эксплуатировалась ZAI, раскрыта как ZAI GLM-5.3-Flash».

Цифра трафика настоящая. Но это не приговор о качестве.

Именно здесь большая часть публикаций свернула не туда, поэтому давайте точно определим, что измеряют эти 26 триллионов токенов.

Они измеряют пропускную способность бесплатного эндпоинта с окном в миллион токенов, который потребляют в основном агенты для программирования. Панель самого OpenCode показывает, что 93 % входных токенов были отданы из кеша — тот же контекст репозитория, перечитанный снова и снова в течение длинной сессии. Рейтинг, отсортированный по обработанным токенам, даёт колоссальное механическое преимущество любой бесплатной модели с огромным окном: агентские каркасы заново подают контекст, повторяют неудавшиеся вызовы инструментов и возвращают вывод инструментов в промпт. Длинные сессии раздувают цифру по своему устройству.

Показатель в 100 триллионов токенов в сутки требует того же отношения. Это OpenCode описывал совокупную сервисную мощность, а не отданное потребление и не квоту на пользователя. Фактическое потребление за первые четыре дня составило в среднем около 6,5 триллиона токенов в сутки — 6,5 % заявленного потолка. Аналитик Teortaxes отметил, что генерация 100 триллионов выходных токенов в сутки при 80 токенах в секунду потребовала бы порядка 580 000 GPU-эквивалентов — ровно тот тип числа, который должен заставить спросить, что именно считают, прежде чем его пересказывать.

Столбчатая диаграмма ежедневных запросов к Ox Alpha на OpenRouter: рост с 27,0 миллиона 21 августа 2026 года до 70,3 миллиона 24 августа 2026 года

Ежедневное число запросов по данным эндпоинта активности моделей OpenRouter, снимок кеша от 25 августа 2026 года. Платформа может пересматривать значения.

Так что же трафик действительно доказывает? Что бесплатная модель фронтирного класса с окном в миллион токенов, помещённая в те два места, где агенты для программирования уже живут, насыщает спрос за 24 часа. Это результат дистрибуции, и результаты дистрибуции сами по себе достойны изучения. О том, хороша ли модель на вашем репозитории, он не говорит ничего.

Почему лаборатория сегодня выпускает модель без собственного имени

Здесь начинается поворот, и мы его чётко обозначаем: всё выше — измерения, дальше — наше прочтение.

Анонимный выпуск покупает лаборатории три вещи, которые иначе не купить. Назовём эту комбинацию дивидендом анонимности.

Первое — чистая оценка. Любой релиз с именем приземляется внутрь предубеждения. Модель из китайской лаборатории оценивают по шкале «на удивление хороша для открытой»; модель из американской фронтирной лаборатории — по шкале «оправдывает ли она подорожание». Уберите имя, и разработчику останется реагировать только на выход. Оценки, пришедшие в течение скрытой недели, делали люди, вообще не знавшие, чью модель они хвалят, — самая дорогая вещь в маркетинге ИИ и самая дешёвая, если получить её, просто ничего не сказав.

Второе — маховик. Загадка и есть кампания. Никто не пишет криминалистический разбор про рядовое обновление версии, но неделя сравнения отпечатков токенизатора, анализа слоя обслуживания и догадок производит огромный объём публикаций, за которые лаборатории не пришлось платить. Раскрытие затем приземляется на аудиторию, уже вложившуюся в ответ. Z.AI получила неделю бесплатного внимания и день запуска со встроенной развязкой.

Третье — телеметрия того масштаба, который трудно купить за деньги. 8,3 миллиона завершённых агентских сессий реальной, грязной, приближённой к продакшену работы — это датасет. На странице Ox Alpha в OpenRouter было указано, что промпты и ответы сохраняются провайдером и явно не используются для обучения — к этому мы вернёмся через минуту. Но даже одно сохранение даёт режимы отказов, распределения задержек, доли ошибок при вызове инструментов и кривые деградации на длинном контексте по сотням тысяч реальных репозиториев. Внутренний набор тестов такого не даёт.

Эта строка об условиях работы с данными заслуживает отдельного примечания, потому что это единственное по-настоящему необычное в этой истории. Из четырнадцати скрытых листингов, которые OpenRouter вёл с апреля 2025 года, тринадцать несли ту или иную версию формулировки «промпты и ответы логируются провайдером и могут использоваться для улучшения модели». Только у Ox Alpha было написано иначе: сохраняются, для обучения не используются. Успокаивает ли это вас — зависит от того, какой вес вы придаёте строчке текста на странице модели маршрутизирующей платформы. Это как минимум осознанный выбор, и это первый раз, когда скрытый листинг его делает.

Кодовое имя стало отдельным жанром

Это не новый приём. Это схема с пятью подтверждёнными из первых рук случаями, и знание этой истории — то, что позволяет откалибровать следующий случай.

Кодовое имяЧем оказаласьКто подтвердилДатаДоказательство
Quasar AlphaGPT-4.1, предрелизный снимок OpenAIСобственный блог OpenRouter14.04.2025Первоисточник
Optimus AlphaGPT-4.1, снимок ближе к финальномуСобственный блог OpenRouter14.04.2025Первоисточник
Horizon Alpha / Horizon BetaРанние контрольные точки GPT-5OpenRouter, «GPT-5 is now live»07.08.2025Первоисточник
Sonoma Dusk Alpha / Sonoma Sky AlphaxAI Grok 4 Fast, без рассуждений и с рассуждениямиТолько вывод сообществаСообщалось, не подтверждено
Hunter Alpha / Healer AlphaXiaomi MiMoСобственная команда MiMo в Xiaomi18.03.2026Первоисточник
Owl AlphaMeituan LongCat-2.0-PreviewБлог Meituan и @Meituan_LongCat30.06.2026Первоисточник
Cypher Alpha / Aurora AlphaТак и не раскрытыОтсутствует
Ox AlphaZ.AI GLM-5.3-FlashZ.AI — Bloomberg; страница OpenRouter дополнена26.08.2026Первоисточник

Из этой таблицы следуют две вещи. Семь из тринадцати исторических листингов в итоге были подтверждены заявлением из первых рук — раскрываемость заметно лучше, чем подсказывает фольклор. И три из этих подтверждений пришли от лаборатории, а не от OpenRouter, поэтому подборки, следящие только за блогом OpenRouter, систематически недосчитываются. Второе: жанр сменил сцену. Строки 2025 года — это OpenAI и xAI. Строки 2026 года — Xiaomi, Meituan и Z.AI. Китайские лаборатории не изобрели скрытый релиз; они поставили его на поток.

Раскрытие: 320 миллиардов всего, 18 миллиардов активных, MIT

Теперь характеристики — из карточки самой Z.AI, а не из чьего-либо пересказа.

GLM-5.3-Flash описан авторами как «первая нативно мультимодальная модель серии GLM-5» с 320 миллиардами параметров суммарно и 18 миллиардами активных в конфигурации «смесь экспертов», обученная на мультимодальном корпусе объёмом 30 триллионов токенов. Архитектура впервые в серии сочетает разреженное и линейное внимание, плюс приём, который в статье назван Manifold-Constrained Hyper-Connections. Контекстное окно — 1 048 576 токенов, максимальный единичный ответ — 131 072 токена. Глубина рассуждений выведена в параметр reasoning_effort со значениями low, high и max; по умолчанию max. Лицензия — MIT: не индивидуальная «общественная» лицензия с порогом по числу пользователей, а именно MIT.

Собственное утверждение Z.AI о возможностях стоит процитировать дословно, потому что оно сдержаннее окружающих публикаций: модель «превосходит GLM-5.2 на бенчмарках и реальных нагрузках при цене в десять раз ниже, приближаясь к Claude Opus 4.8 на бенчмарках программирования и агентных задач». Приближаясь. Не превосходя.

Для независимой оценки: Artificial Analysis уже провела измерения. GLM-5.3-Flash набирает 57 баллов в Artificial Analysis Intelligence Index при медиане 29 для сопоставимых моделей с открытыми весами. Прогон полного набора тестов обошёлся в 138,02 доллара расходов на API — цифру мы приводим потому, что это самое честное отдельное число во всём тексте о том, во сколько сегодня обходится использование интеллекта, близкого к фронтиру. Та же оценка отмечает две реальные слабости: при 45 выходных токенах в секунду модель медленная, и она сгенерировала 150 миллионов токенов за прохождение индекса против медианы в 110 миллионов, то есть многословна. Многословность — это счёт, даже когда цена за токен мала.

Настоящая новость в том, что модель класса Flash набрала 57

Поставим цифры рядом, используя ту же смешанную пропорцию вход-выход 3:1, которую Epoch AI применяет для сравнения цен.

Claude Opus 4.6 MaxQwen3.8-27BGLM-5.3-Flash
Выпуск05.02.202614.08.202626.08.2026
ВесаЗакрытыеApache 2.0MIT
Intelligence Index44,952,057
Цена за 1 млн входных$5,00$0,45$0,15
Цена за 1 млн выходных$25,00$3,20$0,50
Смешанная (3:1)$10,00$1,09$0,24

Горизонтальная столбчатая диаграмма в логарифмическом масштабе: смешанная цена за миллион токенов падает с десяти долларов у Claude Opus 4.6 Max до доллара девяти центов у Qwen3.8-27B и двадцати четырёх центов у GLM-5.3-Flash

Длина столбца — цена, число справа от каждого столбца — балл интеллекта. Artificial Analysis и OpenRouter, данные получены 31 августа 2026 года.

GLM-5.3-Flash стоит в 42 раза меньше февральского закрытого флагмана и набирает на 12,1 балла больше в том же независимом индексе. По сравнению с открытой моделью 27B, о которой мы писали десять дней назад, она в 4,6 раза дешевле и на 5 баллов лучше. Оба разрыва образовались за полгода.

Это та же кривая, которую наш текст про Qwen3.8 измерял с другого конца: ряд Epoch AI с фиксированным порогом, где балл на бенчмарке держат постоянным и отслеживают самую дешёвую модель, которая его достигает, показал падение цены за производительность уровня GPT-4 с 37,50 доллара за миллион токенов в марте 2023 года до 0,18 доллара в феврале 2025 года — в 208 раз за 23 месяца. GLM-5.3-Flash показывает, как эта кривая выглядит, когда достигает нынешнего фронтира, а не трёхлетней давности.

И обратите внимание на класс. Это не флагман. «Flash» в номенклатуре любой лаборатории означает дешёвого, быстрого, рассчитанного на объём брата той модели, которой вас на самом деле хотят впечатлить. Интересен не тот факт, что китайская лаборатория выпустила сильную модель. Интересно, что бюджетная позиция теперь достаточно близка к фронтиру, чтобы неделя анонимных очных сравнений не выдала игру сразу.

Четыре вещи, которые мы не смогли проверить, — помечаем как есть

Восторг вокруг этого релиза в отдельных местах обгоняет доказательства. Вот эти места.

Утверждение, что Ox Alpha «превосходит GPT-5.6» в тестах на контексте в миллион токенов, взято из сторонних публикаций, а не из опубликованной методики, которую мы могли бы изучить; к тому же ориентир для сравнения у самой Z.AI — Claude Opus 4.8, а не GPT-5.6. Считайте сравнение с GPT-5.6 непроверенным утверждением сообщества.

Широко цитируемый результат 80 % pass@1 на DeepSWE несопоставим с показателями выше 96 % на SWE-bench Verified, которые ставят рядом в тех же таблицах. Другой каркас, другой набор задач, другая сложность. Любая таблица, помещающая их в соседние строки, производит рейтинг, которого не существует.

Заявление Z.AI о том, что вся скрытая неделя обслуживалась на отечественных китайских ускорителях с трёхкратным улучшением сквозного обслуживания и стоимостью за токен, сопоставимой с оборудованием NVIDIA, исходит от вендора и не проходило независимого аудита. Если оно подтвердится — это самая значимая деталь всей истории; пока это утверждение из пресс-релиза.

И бесплатное превью было субсидией, а не тарифом. Оно закончилось. Текущие цены — 0,15 и 0,50 доллара, с промо-скидкой 50 %, действующей до 9 сентября 2026 года 16:00 UTC. То есть честное установившееся число — то, что без скидки, и планировать бюджет надо от 0,15 / 0,50 доллара, а не от цены этой недели.

Что 24 цента делают с конвейером, который слушает, переводит и резюмирует

Речевые продукты необычно чувствительны к цене токенов, потому что они порождают расшифровки и затем читают их снова и снова. Каждый последующий шаг — вычитка, перевод, резюмирование, ответы на вопросы — заново поглощает тот же текст. Вот арифметика, со всеми допущениями на виду.

  1. Начните с реальной единицы работы. Часовая встреча двух человек при темпе около 130 слов в минуту даёт примерно 7 800 слов. С метками говорящих и таймкодами считаем расшифровку как 12 000 токенов.
  2. Добавьте проход резюмирования. Полная расшифровка на вход, структурированные заметки на выход: 12 000 входных токенов, около 800 выходных.
  3. Добавьте живой перевод на три языка. Каждый проход читает расшифровку и пишет сопоставимый объём: 12 000 на вход и 12 000 на выход, трижды.
  4. Сложите встречу целиком. 48 000 входных токенов и 36 800 выходных.
  5. Оцените дважды. По тарифу GLM-5.3-Flash 0,15 / 0,50 доллара такая встреча стоит 2,6 цента. По тарифу Claude Opus 4.6 5,00 / 25,00 доллара та же встреча стоит 1,16 доллара.

Разница в 45 раз на одном часе аудио — это не оптимизация строки в смете. Это разница между функцией, использование которой вы тщательно считаете, и функцией, которую вы оставляете включённой по умолчанию. При 1,16 доллара за встречу перевод на три языка для каждого пользователя — решение, которое кто-то в финансах должен утвердить. При 2,6 цента это галочка.

Именно эта часть истории переживёт кодовое имя. Скрытый релиз был маркетинговым манёвром, и хорошим. Устойчивый же факт в том, что дешёвый класс в линейке лаборатории средней величины сегодня выдаёт 57 баллов индекса за смешанные 24 цента, с приложенной лицензией MIT — чтобы вы могли запустить модель сами, если цена когда-нибудь двинется не туда.

Итог: интересные цены находятся уже не на фронтире

Три года вопрос о выборе модели звучал так: «насколько близко к фронтиру вы можете себе позволить быть». Шесть дней Ox Alpha ответили на другой: сколько возможностей теперь лежит ниже флагманского класса, оценено как товар широкого потребления и выпускается лабораториями, достаточно уверенными, чтобы тестировать это со снятым именем.

Дивиденд анонимности выплачивается, только если модель достаточно хороша, чтобы пережить неделю без бренда. Z.AI его получила. Следующее кодовое имя, которое появится на маршрутизирующей платформе, заслуживает того же обращения, что и Ox Alpha: прогоните его на собственных задачах, прежде чем кто-нибудь скажет вам, чьё оно, — потому что на эту неделю это единственная честная оценка, которая кому-либо достаётся.


Где здесь Telli.sh: именно из-за этой кривой мы строим свой речевой конвейер на слое провайдеров движков, а не вокруг API одного поставщика. Telli.sh маршрутизирует расшифровку, перевод и резюмирование через взаимозаменяемые движки, поэтому ступенька вниз по этой ценовой кривой приходит как более качественные заметки по прежней цене, а не как объявление о смене тарифов. Того, что не даёт ни один релиз модели, здесь остаётся немало: надёжно записать час аудио, различать говорящих, переводить вживую на 15 языков и оставить заметки, которые вы сможете найти поиском и в следующем квартале.

Начать живую AI-заметку

Источники


Вернуться в блог