你好, камрад!

Xiaomi сделала то, от чего у OpenAI глаза на лоб полезут. Их флагманская модель MiMo-V2.5-Pro с триллионом параметров теперь выдаёт больше 1000 токенов в секунду на обычных, серийно доступных GPU. Не на Groq с кастомными ASIC, не на Cerebras с wafer-scale — а на стандартном 8-GPU узле.

Как это работает

Совместно с командой TileRT Xiaomi применила то, что они называют extreme model-system codesign. По факту — два ключевых трюка: FP4-квантование MoE-экспертов (модель почти не теряет в качестве, но резко сокращает объём пересылаемых данных) и DFlash — спекулятивная декодировка, где маленькая draft-модель предсказывает целый блок токенов за раз, а большая модель проверяет. Причём draft-модель использует Sliding Window Attention — сложность не растёт с длиной контекста.

На практике это выглядит так: игра Snake собирается за 10 секунд, macOS-интерфейс — за минуту.

Для контекста — MiMo-V2-Flash, запущенный в декабре 2025, выдавал 150 токенов/сек. То есть разница — почти на порядок. По сравнению с ChatGPT (~60 токенов/сек) — быстрее в 15+ раз.

Цена скорости

API UltraSpeed стоит в 3 раза дороже обычного MiMo-V2.5-Pro. Но Xiaomi честно говорит: «3× цена, 10× опыт». Обычный тариф — 6 юаней за миллион токенов на выходе. UltraSpeed пока только по заявкам, с 9 по 23 июня, приоритет — у корпоративных клиентов. Одобренным пользователям — бесплатный Chat-доступ на две недели с ограничениями: 10 входов в очередь в день, сессии до 30 минут.

TileRT — тихий герой

TileRT со своей стороны сделала архитектуру, где операторы не запускаются каждый раз заново, а постоянно живут в GPU. Warp Specialization — разные варпы делают разную работу, Data Movement и Tensor Compute перекрываются. Это позволило убрать «Execution Gaps» — микросекундные паузы между операторами, которые на скорости 1000 токенов/сек становятся критическим узким местом.

Личный опыт

Я сам пользуюсь этой моделью. И могу сказать честно: она реально медленная в сравнении с DeepSeek, которым я тоже пользуюсь. И по качеству — откровенно тупая, если сравнивать. DeepSeek даёт ей сто очков вперёд и по скорости, и по уму.

Но то, что Xiaomi разогнала её до 1000+ токенов/сек — это действительно прорыв. Особенно учитывая цену: обычный тариф — 6 юаней за миллион токенов. Дешевизна такая, что даже с посредственным качеством модель становится юзабельной. В этом смысле ускорение — абсолютный вин.

Тем не менее, лично я модель Xiaomi рекомендовать не буду. Это полностью основано на моём опыте. Рассматривайте другие варианты — на рынке есть модели и умнее, и быстрее.

Короче: Xiaomi завезла скорость, которую раньше показывали только на кастомном железе, на обычные серверные GPU. Если это доберётся до продакшена — рынок AI-инференса ждёт перетряска.

Товары из Китая t.me/XFCstore_bot 💬 Беседа t.me/ChatMarkVictorsonOriginals