DeepSeek известна открытыми моделями уровня фронтира при скромных бюджетах. И тут лаборатория выложила в открытый доступ шесть инструментов для программирования ускорителей Huawei Ascend.
Что именно выложено
Состав набора повторяет инфраструктуру, на которой DeepSeek обучала свои модели на железе NVIDIA, но теперь перенесенную на Ascend. DeepGEMM отвечает за матричные операции, DeepEP — за межчиповый обмен данными в MoE-моделях, FlashMLA — за внимание на длинном контексте, TileKernels — за стандартные векторные вычисления, DeepSelect — за фильтрацию данных.
Поверх этого, в набор входит TileLang, высокоуровневый язык для ядер ИИ-ускорителей, который DeepSeek позиционирует как более простую альтернативу CUDA. По данным Startup Fortune, набор покрывает большинство операторов, использованных при обучении DeepSeek V4. DeepSeek назвала приоритетом создание «универсального, простого в программировании» высокоуровневого языка как основы независимой экосистемы GPU-софта.
Предпосылки
Анонс вышел сразу после Huawei Connect 2026, где Huawei показала новое поколение Ascend и суперноды. Железо у Huawei в последние два года появлялось быстрее, чем софт для него. По оценке, которую приводит Startup Fortune, Ascend 910C дает около 60% инференс-производительности NVIDIA H100. Цифра из одного источника и относится к прошлому поколению, для Ascend 950, независимых замеров пока нет.
Главная проблема Huawei всегда лежала в экосистеме. CUDA удерживает клиентов на NVIDIA, потому что миграция означает месяцы переписывания кода. А теперь стек перенесла лаборатория с реальным опытом обучения фронтирных моделей, и для остальных китайских команд это совсем другой уровень доверия, чем документация вендора. Они получают проверенные на продакшен-нагрузке ядра и готовый путь миграции.
Вторая половина анонса касается железа. Суперноду на 128 чипах Ascend 950 Huawei проектирует вместе с DeepSeek. И здесь логика та же, что у крупных американских лабораторий с их собственными кластерами. Для MoE-моделей узким местом становится обмен данными между чипами, поэтому DeepEP и топология суперноды оптимизируются под одну и ту же нагрузку. Если исходить из опыта NVIDIA с NVL72, эффективность обучения и обслуживания больших MoE-моделей определяет прежде всего плотная связность внутри стойки, а пиковая производительность одного чипа здесь вторична. Отставание Ascend по отдельному чипу Huawei, судя по всему, собирается компенсировать масштабом и связностью.
Эффект для рынка
Для NVIDIA это медленная, но структурная угроза на китайском рынке, который и так закрыт для ее топовых чипов экспортными ограничениями. Раньше китайские компании мирились с Ascend вынужденно. Открытый стек DeepSeek снижает цену этой вынужденности и может ускорить переход даже там, где серые поставки NVIDIA еще возможны.
TileLang как высокоуровневый язык ядер конкурирует с Triton от OpenAI и Mojo от Modular. Если он действительно окажется переносимым между разными ускорителями, в мире может появиться второй центр притяжения для кода ядер, помимо CUDA. И вырастет он в Китае.