Два года подряд планирование ИИ-инфраструктуры строилось на одном допущении: подождите квартал — и то же самое будет стоить дешевле. Модель станет умнее при той же цене, токен подешевеет, а видеокарты за счет обновлений софта и новых линеек выдадут больше мощности. Допущение работало настолько стабильно, что превратилось в проектную константу: закладываем текущую цену, через полгода она сама себя окупит.
В августе константа сломалась сразу с трех сторон. DeepSeek первой из крупных лабораторий подняла цены на API — на 355–371% в пиковые часы — и ввела тарификацию по времени суток. Micron на Hot Chips показала цифру, после которой разговор про «дешевеющее железо» заканчивается: в двухкристальных GPU-сборках память занимает около 90% площади кремния и стоит впятеро дороже DDR5 за бит. А китайские лаборатории выпустили в открытый доступ веса на 1,7 и 2,4 триллиона параметров, которые скачать можно, но развернуть проблемно.
Hot Chips 2026: вендоры показали железо на год вперед
Конференция в Стэнфорде 24–25 августа в этом году оказалась плотнее обычного: почти все крупные игроки одновременно раскрыли архитектуры, которые поедут в стойки в 2027. Общий тренд у всех докладов один — сами вычисления уперлись в память и в сеть, и почти каждая инженерная фича так или иначе касается перемещения данных, а не арифметики.
NVIDIA: Vera Rubin NVL72 и 45-градусная вода
Итак, по порядку. Флагманом стала стойка Vera Rubin NVL72. Правда, гигантские заявленные цифры из презентации NVIDIA относятся не к одиночной стойке, а к целой сети суперкомпьютеров (конфигурации DSX). Если смотреть первоисточник, общие мощности поражают: 2 ZFLOPS NVFP4 на инференсе и 1,4 ZFLOPS на обучении, 11 ПБ памяти HBM4 и суммарная пропускная способность 800 ПБ/с.

NVLink 6 дает 3,6 ТБ/с all-to-all на GPU в домене из 72 ускорителей — плюс 130 TFLOPS вычислений прямо в сети. Вычислительные лотки собраны без кабелей и без вентиляторов: охлаждение жидкостное, теплой водой при 45 °C, то есть без чиллеров вообще. Референсный дизайн «AI Factory» рассчитан на 100 МВт.
Отдельно по сети. Spectrum-X теперь масштабируется до 512 000 GPU без лишнего яруса коммутации (коммутатор Spectrum-6 выдает 102,4 Тбит/с). Сетевые карты ConnectX-9 дают до 1600 Гбит/с на один GPU. При восьмиплоскостной схеме отказ одной плоскости отнимает лишь 10% полосы, а аппаратное восстановление связи идет в 11 раз быстрее софтверного. BlueField-4 получил 64 ядра Arm Neoverse V2 на 1,7 ГГц и 800 Гбит/с собственной сетевой полосы. На NVMe-oF он выдает 1,6 Тбит/с на восьми ядрах и 20 млн IOPS на шестнадцати.
AMD: MI455X и стойка Helios
AMD ответила ускорителем MI455X: 432 ГБ HBM4 при 23,3 ТБ/с. Против MI355X с ее 288 ГБ HBM3E это рост пропускной способности примерно в 2,9 раза. Пик на MXFP4 — 40,26 PFLOPS, до четырех раз к предыдущему поколению; MXFP6 и MXFP8 — по 20,13 PFLOPS.

Архитектура чипа. Сборка чиплетная: восемь вычислительных кристаллов сделаны по техпроцессу N2, фабрик-кристаллы и I/O на N3P. Вокруг них установлены 12 стеков HBM4, все это объединено упаковкой CoWoS-L и дает 256 активных процессорных блоков (WGP). Внутри системы интерфейс Infinity Fabric выдает 1,8 ТБ/с на направление, а для внешних подключений используется PCIe Gen6.
Стойка Helios. Она объединяет 72 графических процессора в одном шасси высотой 44OU. Общие характеристики: 31 ТБ памяти HBM4, пропускная способность 1,7 ПБ/с и общая мощность 2,9 EFLOPS. Сетевая подсистема стойки построена на коммутаторах Broadcom и выдает 260 ТБ/с на внутренние связи (scale-up) и 43 ТБ/с на внешние (scale-out). Хосты — 96-ядерные EPYC Venice, питание через 50-вольтовый DC-busbar, охлаждение жидкостное с blind-mate разъемами.
Google: TPU v8 разъехался на два чипа
Самое интересное архитектурное решение месяца — Google развела обучение и инференс по разным кристаллам.
Для обучения создан TPU v8t. Он получил шесть стеков HBM. Суперпод из 9 600 таких чипов на 300 стойках выдает 121 EFLOPS на FP4 и 2 ПБ общей памяти. Сеть Virgo масштабируется до 134 000 TPU с полосой 47 Пбит/с; в ней впервые охладили оптику жидкостью. Энергоэффективность (perf/W) выросла примерно вдвое по сравнению с TPU v7 Ironwood.

Для инференса разработан TPU v8i. Здесь архитектура иная: восемь стеков HBM дают больше памяти на единицу вычислительной мощности, плюс увеличена доля быстрой SRAM. Топология BoardFly сокращает маршрут данных максимум до семи прыжков вместо 16 у прежнего 3D-тора. Движок Collective Acceleration Engine берет коллективные операции на себя прямо на I/O-кристалле. С ARM-процессорами Axion чипы связываются в пропорции 2:1.
Meta*, Intel, Arm и Groq
Meta* показала MTIA 300 (3-нм вычислительный кристалл плюс 5-нм I/O, 216 ГБ HBM3e, 72 processing elements) и MTIA 400. Старшая модель получила восемь стеков HBM3e с пропускной способностью 9,4 ТБ/с, внутреннюю шину на Ethernet со скоростью 1,2 ТБ/с и выдает 12 PFLOPS на FP4. По сравнению с MTIA 200 производительность на вычислениях FP16 выросла в 15 раз, а пропускная способность памяти — в 46 раз. Один домен масштабирования объединяет до 72 таких чипов.
Intel показала инференс-GPU Crescent Island. Он имеет 160 ГБ памяти LPDDR5X в базовой версии (до 480 ГБ в кастомных вариантах), архитектуру Xe3p, 32 ядра Xe и 256 движков XMX. Также Intel анонсировала Xeon 7 «Diamond Rapids» на техпроцессе Intel 18A-P: до 256 производительных ядер без SMT, 1,28 ГБ кэша последнего уровня, 16 каналов DDR5 со скоростью до 8000 MT/s (до 12 800 с MRDIMM) и 128 линий PCIe 6.0. В дата-центрах процессоры, по прогнозам, появятся в 2027 году.
Arm представила серверный CPU под агентские нагрузки: до 136 ядер Neoverse V3 на чип, TSMC N3P, больше 50 млрд транзисторов на чиплет, двенадцать каналов DDR5 и 845 ГБ/с при DDR5-8800, 300 Вт TDP. Groq показала Groq 3 LPX с 3400 выходными токенами в секунду на Gemma 4 31B при контексте 100 000 токенов.
Memory wall: HBM4 по 31–36$ за гигабайт и потолок в 775 микрон
Пока все считали флопсы, Micron на той же конференции показала слайд, который объясняет экономику всего остального. Разрыв между скоростью процессоров и пропускной способностью памяти не сокращается — он расширяется каждое поколение.
Цифры Micron:
- HBM требует примерно втрое больше кремния, чем DDR5, на ту же емкость;
- кристалл HBM4 несет 256 банков против 32 у DDR5;
- в двухкристальных GPU-сборках память занимает около 90% площади кремния;
- HBM стоит примерно впятеро дороже DDR5 за бит;
- компьют растет примерно втрое каждые два года, пропускная способность HBM — менее чем вдвое.
SK hynix добавила физику. Потолок толщины стека подняли с 720 микрон (так было до HBM3E включительно) до 775 микрон — вровень с толщиной логической пластины. А для 20-Hi обсуждают уже 825–900. Тепловая нагрузка между поколениями HBM выросла в 2,2 раза, и гибридное соединение против MR-MUF снижает тепловое сопротивление примерно на 35% на 20-Hi. При этом для HBM4E гибридное соединение исключено — окно для него сдвинулось к HBM5, то есть ориентировочно на 2029–2030 годы.
По оценке Fubon Research, которую 13 августа ретранслировала TrendForce, HBM4 для GPU NVIDIA идет по 31–32$ за гигабайт против 17–18$ у HBM3E. Для прочих производителей GPU и кастомных ASIC — 35–36$ за гигабайт. Прогноз на третий квартал: контрактные цены обычной DRAM плюс 13–18% квартал к кварталу, NAND — плюс 10–15%.
Дальше начинается то, что чувствует на себе любой, кто в этом году собирал железо или хотя бы принимал в этом участие. В середине августа комплект 32 ГБ DDR5-6000 в рознице стоил около 392$ — против 72$ годом ранее. Набор на 128 ГБ ушел на 3 399$, вдесятеро выше исторического минимума, а по высокоемким комплектам годовой рост приближается к 500%: 64 ГБ DDR5-5600 подорожали со 191$ до 1 118$. Контрактные цены DDR5 прибавили 90–95% в первом квартале и еще 58–63% во втором.
Корейские вендоры при этом законтрактованы. Samsung подписала с Broadcom соглашение по роадмапу HBM4 плюс turnkey-контракт на 2 нм и продвинутую упаковку на сумму порядка 200 млрд $, SK Group и NVIDIA — комплексное соглашение более чем на 500 млрд $. Емкость памяти распродана до конца 2026 года, часть контрактов простирается до 2030-го.
Практический вывод простой: если вы планируете локальный инференс в ближайшее время, память — основная статья расходов, и оптимизация KV-кэша перестала быть дополнением.
Открытые веса ушли в терабайты: Qwen3.8-Max, DeepSeek V4-Pro, GLM-5.3-Flash, Hy4
За три недели августа в открытый доступ ушли веса четырех моделей, каждая из которых год назад считалась бы фронтиром. Общий объем того, что теперь можно скачать с Hugging Face, измеряется терабайтами.
Qwen3.8-Max: 2,4 триллиона параметров и лицензия с условиями
API открыли 3 августа, веса выложили 12–13. Модель имеет 2,4 трлн параметров, из которых активны 95 млрд. Архитектура построена по принципу MoE на 512 экспертов: на каждый токен активируются 10 маршрутизируемых и один общий. Сеть состоит из 92 слоев, использует комбинацию gated attention и DeltaNet, а обучалась методом multi-token prediction. Нативное контекстное окно составляет 262 144 токена с расширением до 1 010 000.
Бенчмарки из карточки модели: Terminal-Bench 2.1 — 86,6, SWE-bench Pro — 67,7, GPQA Diamond — 92,6. Для сравнения, GPT-5.6 Sol на Terminal-Bench 2.1 дает 88,8, Claude Opus 4.8 — 84,6. API стоит 2$ за миллион входных и 6$ за миллион выходных.
Ложка дегтя — лицензия. Она кастомная: продукты с более чем 100 млн MAU или выручкой свыше 20 млн $ обязаны указывать имя модели в интерфейсе, MaaS-бизнесы с выручкой свыше 50 млн $ в год лицензируются отдельно. В открытых весах, кроме того, только текст — vision и video остались за API.
DeepSeek V4-Pro: 1,7 трлн под MIT
13 августа. Вышла модель на 1,7 трлн параметров, лицензия MIT — то есть вообще без оговорок. Она поддерживает форматы FP8 для KV-кэша, FP4 для кэша индексатора и MxFP4. Модуль спекулятивного декодирования DSpark включается одним флагом. Доступны три уровня «глубины рассуждений»: low, high и max. Число активных параметров разработчики не раскрыли ни в карточке, ни в документации.
Результаты тестов: Terminal-Bench 2.1 — 87,9, Cybergym — 83,3, DeepSWE — 62,7. В рейтинге Artificial Analysis Intelligence Index модель набрала 53 балла, заняв пятое место из 1 105.
GLM-5.3-Flash: та самая «Ox Alpha»
26 августа Z.ai выложила под MIT первую нативно мультимодальную модель линейки GLM-5, обученную на 30 трлн мультимодальных токенов. 320 миллиардов параметров, из них 18 миллиардов — активных. Контекст 1 048 576, вывод до 131 072 токенов.
Архитектурно это гибрид линейного и разреженного внимания: линейное отвечает за локальные зависимости, разреженное — за глобальный retrieval. IndexPool сжимает KV-кэш в 4,4 раза, механизм Manifold-Constrained Hyper-Connections отвечает за эффективность масштабирования. Относительно GLM-4.5 вдвое сокращены и активные параметры, и число слоев.
В тестах модель набрала: Terminal-Bench 2.1 — 84,3 (у Opus 4.8 — 85,0), DeepSWE v1.1 — 63,4 (против 46,2 у GLM-5.2). В рейтинге Artificial Analysis Intelligence Index результат составил 57 баллов, что выше, чем у DeepSeek V4-Pro. Миллион входных токенов стоит 0,15$, выходных — 0,50$, что в 10 раз дешевле предшественника.
За неделю до релиза модель работала на OpenRouter и OpenCode анонимно под кодовым именем Ox Alpha и вызвала волну догадок об авторстве. Обслуживалась она при этом полностью на китайских ускорителях отечественного производства.
Tencent Hy4-preview: 770B под Apache 2.0
В конце месяца Tencent выложила модель на 770 млрд параметров (49 млрд активных) под лицензией Apache 2.0 — одной из самых свободных среди августовских релизов. Архитектура включает 256 маршрутизируемых экспертов и один общий, 78 слоев с Gated DeepSeek Sparse Attention и контекст в 1 млн токенов. Вместе с базовыми весами опубликованы FP8-квантованная версия, пайплайн для файнтюнинга и набор инструментов для компрессии AngelSlim.

Рантаймы догнали релизы
Отдельно стоит отметить то, что обычно остается за кадром. Зазор между выходом весов и возможностью их нормально обслуживать схлопнулся почти до нуля. SGLang получил поддержку Kimi K3 в день релиза, а в vLLM 0.28 приехали sparse MLA на декоде для DeepSeek V4, спекулятивное декодирование DSpark с приростом около 60% к TTFT и Decode Context Parallel для Kimi-K3 со слитыми ядрами FlashKDA — это примерно 17 ГиБ экономии памяти на каждом GPU. SGLang в версии 0.5.18 ускорил декод DeepSeek-V4-Pro на B200 с 320 до 169 микросекунд.
Еще год назад «подождать месяц, пока рантайм научится» было нормой — теперь на сроки пилота это влияет сильнее, чем очередные пять пунктов на бенчмарке. Единственное, о чем стоит знать заранее при обновлении: в vLLM 0.28 bitsandbytes вынесен в отдельный плагин, Transformers подняты до 5.15.0, а calculate_kv_scales и override_attention_dtype удалены. Тем показательнее, что узкое место все равно осталось — просто оно уже не в софте.
Что здесь на самом деле важно
Первое — архитектурный сдвиг стал повсеместным. Разработчики начали массово отказываться от классического Attention на длинных текстах в пользу собственных гибридных алгоритмов. У Qwen это Gated DeltaNet, у Moonshot — Kimi Delta Attention, у GLM — сочетание линейного и разреженного внимания (с mHC и IndexPool), у Hunyuan — Gated DeepSeek Sparse Attention, а у NVIDIA Nemotron — Mamba-2 с MoE. Классические тяжелые подходы окончательно ушли из фронтира. Параллельно развивается экстремальная разреженность: у вышедшей 26 августа Qwen3.8-Flash-Next активны всего 6 млрд параметров из 125 млрд, а слой n-gram эмбеддингов вынесен в системную RAM, а не в память GPU. Обучение этой модели, по заявлению Alibaba, обошлось в одну девятую от Qwen3.7-Plus.
Второе — лицензии начали расходиться. По данным августовского отчета Hugging Face «State of Open Models: Summer 2026», среди китайских релизов крупнее 20B Apache 2.0 занимает 59%, MIT — 22%, некоммерческих ограничений почти нет. Среди американских релизов того же класса Apache/MIT — только 29%, кастомные условия — 41%, еще 30% выходят без внятной декларации. То есть в этом сегменте китайские открытые релизы формально свободнее американских. Но на самых крупных моделях — Qwen3.8-Max, Kimi K3 — впервые пошел откат к ограничительным условиям.

Третье — разрыв «скачали» и «запустили». По данным из того же отчета, модели меньше 1B дают 83% всех скачиваний за всю историю, модели крупнее 100B — 1%. Терабайтные веса — это витрина, а работает индустрия на мелочи. И только один репозиторий на платформе попадает одновременно в топ-25 по скачиваниям и в топ-25 по лайкам.
Четвертое — безопасность отстает от возможностей. Отчет SaferAI от 4 августа: GLM-5.2 отстает от GPT-5.5 и Claude Opus 4.7 по кибер- и биовозможностям «всего на несколько месяцев», но не отказалась ни от одной протестированной наступательной задачи. Claude Opus 4.7 отказывалась настолько последовательно, что CyberGym на ней не удалось прогнать целиком.
Meta* вернулась к открытым весам — 30B под Apache 2.0
10 августа Meta* выложила Muse Glimmer: 30 млрд параметров, лицензия Apache 2.0. Это первый open-weights релиз компании со времен Llama 4 — спустя 16 месяцев закрытой политики.
Модель заточена под локальные always-on агентские сценарии, и вся ее инженерия — про то, чтобы влезть в бюджет памяти обычной машины:
- гибридное внимание дает KV-кэш около 1,8 ГБ при полном контексте 128K;
- квантизация K-Quant-Dynamic в 4 бита ужимает модель с 55+ ГБ до менее чем 20 ГБ при минимальной деградации на агентских задачах;
- целевое железо — MacBook M4-Max/M5-Max и RTX 5090, бюджет памяти 24–32 ГБ;
- спекулятивное декодирование DFlash ускоряет генерацию в 3,1 раза на RTX 5090, в 1,8 раза на M5 Max и в 1,5 раза на M4 Max.
Лицензия здесь важнее бенчмарков. Apache 2.0 — это отсутствие потолка по MAU и отсутствие acceptable-use оговорок, которые были во всех лицензиях Llama. Для продуктовых команд, которые упирались именно в юридические условия, а не в качество, это разблокировка.
Теперь про качество. Независимая оценка Artificial Analysis: Intelligence Index 35 — на пять пунктов выше Gemma 4 31B при сопоставимом размере, но ниже Qwen3.6 27B с ее 38. На агентских задачах отставание заметнее: GDPval-AA v2 Elo 953 против 1 141 у Qwen3.6 27B, при том что человеческий baseline — 1 000. И отдельно неприятное: hallucination rate 82% против 49% у Qwen3.6 27B. Цифру стоит читать правильно — это метрика AA-Omniscience, где высокие значения нормальны для всего класса компактных моделей, а не «доля неверных ответов». Но разрыв в тридцать три пункта с моделью сопоставимого размера говорит ровно об одном: калибровка знаний у Muse Glimmer отстает от ее же уровня интеллекта. Модель уверенно говорит то, чего не знает.

Отдельно стоит отметить, что Meta* не отдает модель через собственный API — только веса на Hugging Face и сторонние провайдеры. Интеграции сделаны с llama.cpp, MLX, ExecuTorch, Ollama, LM Studio, vLLM и SGLang.
Цукерберг приложил к выкладке эссе с призывом ослабить американские ограничения на обучающие данные для открытых моделей, сохранив при этом экспортный контроль на кремний. Ключевая формулировка: «Я не считаю, что ограничение доступа к иностранным open source моделям — эффективное решение. Наша цель должна быть в том, чтобы американские open source модели были лучшими в мире».
Финансовый фон у этого разворота специфический: capex Meta* на 2026 год — 130 млрд $, при этом свободный денежный поток за второй квартал упал на 91% год к году.
DeepSeek подняла цены и ввела peak/off-peak
16 августа вступил в силу новый прайс DeepSeek. Это первый случай, когда крупная лаборатория не снизила, а подняла цены на API — и заодно ввела тарификацию по времени суток.
Новая сетка (off-peak / peak, за миллион токенов):
| Модель | Input, cache hit | Input, cache miss | Output |
| deepseek-v4-flash | 0,007$ / 0,014$ | 0,22$ / 0,44$ | 0,66$ / 1,32$ |
| deepseek-v4-pro | 0,022$ / 0,044$ | 0,66$ / 1,32$ | 1,98$ / 3,96$ |
Контекст у всех моделей — 1M токенов, максимальный вывод до 384K. Относительно прежних тарифов пиковая цена на output выросла на 371% для V4-Flash (с 0,28$ до 1,32$) и на 355% для V4-Pro (с 0,87$ до 3,96$). Но в off-peak рост куда скромнее — 136% и 127% соответственно, а по input он укладывается в диапазон 51–214%. Фигурирующие местами «+1 100%» относятся исключительно к cache-hit input, то есть к самой дешевой строке прайса. Сама DeepSeek формулирует изменение как «более рациональное распределение ресурсов», не комментируя причины прямо.
Чтобы оценить масштаб разворота, стоит вспомнить, с чего месяц начинался. 1 августа Axios писал ровно противоположный сюжет: DeepSeek V4 Flash по 0,28$ за миллион выходных токенов против 25$ у Claude Opus 4.8 и 30$ у GPT-5.6 Sol — то есть дешевле примерно на 99%. Через две недели этот разрыв сократился впятеро.

И встречное движение с другой стороны: 21 августа OpenAI снизила цены на GPT-5.6 Sol — input с 5$ до 4$ (минус 20%), output с 30$ до 20$ (минус 33%). Скидка действует три месяца, до 21 ноября, и распространяется на Fast mode, long-context, Batch и Flex.
Практический вывод для тех, кто считает юнит-экономику фичи: дельта между открытыми и проприетарными моделями перестала быть двумя порядками. Она все еще в пользу открытых, но теперь это разница в разы, а не в сто раз, — и на этой дистанции начинают весить накладные расходы на самостоятельное развертывание, о которых говорит раздел про память.
Агенты Anthropic вышли в GA — и потянулись к лабораторному железу
19 августа Anthropic перевела в стадию общего доступа сразу три вещи, которые до этого жили в превью, а 27-го показала спецификацию, выводящую агентов за пределы экрана
Computer Use, Skills API и Files API в GA
Главное изменение в Computer Use — агент теперь выполняет несколько действий за один шаг вместо одного действия на вызов API. Это напрямую режет и латентность, и стоимость задачи. Отдельно: нагрузки под HIPAA теперь допустимы в рамках BAA.
Новый Browser Use tool читает структуру страницы вместе со скриншотами и целится в DOM-элементы, а не в пиксельные координаты. Для всех, кто хоть раз отлаживал агента, который промахивался мимо кнопки после смены разрешения, — это принципиальная разница.
Skills API — версионируемые «папки экспертизы», которые исполняются в песочнице кодового исполнения Anthropic, то есть хостить их не нужно. Files API дает хранение документов с автоистечением, пятикратно поднятые лимиты и 1 ТБ на организацию. Документы передаются по ID вместо повторной отправки в каждом запросе.
Claude in Chrome и цифры по prompt injection
Расширение для Chrome вышло в общий доступ (GA) на всех платных тарифных планах. Оно поддерживает автономное выполнение действий — то есть работает без ручного подтверждения каждого шага, а безопасность транзакций валидируется через специальный safety-классификатор.
Anthropic также опубликовала замеры успешности атак методом внедрения подсказок с включенными защитными проверками и классификатором. У моделей Sonnet 5, Opus 5 и Mythos 5 показатель успешности атак составил ровно 0%. У Fable 5 он равен 0,3%, а у прошлой Opus 4.5 — 16,7%. Последняя цифра наглядно иллюстрирует, насколько быстро разработчики закрывали эту уязвимость в течение последнего года.

Model Hardware Standard: агенты в физическом мире
27 августа вышел предварительный исследовательский релиз стандарта MHS, который позволяет агентам обнаруживать лабораторные и производственные приборы и управлять ими через единый интерфейс. Базовые примитивы здесь — чтение и запись. Стандарт работает рядом с MCP, а не вместо него: MCP, CLI и code API остаются тремя механизмами управления, вместе дающими оркестрацию нескольких устройств одной командой.
Результаты у партнеров, которые уже интегрировались:
- QuEra Computing: успешность relock лазера 99,3% против 58% на baseline, время relock — 6 секунд против 150;
- Carnegie Mellon: интеграция прибора за 8 часов вместо недель;
- University of Washington: подключение прибора менее чем за неделю вместо месяцев;
- Tetsuwan Scientific: точность дозирования на 12–17% лучше заводской спецификации.
Безопасность реализована лимитами на уровне драйверов: в тестах заблокированы шесть индуцированных режимов отказа — отсутствующий планшет, повернутый планшет, занятый ридер, отключенная камера, недостижимое устройство и аварийный останов. Пока стандарт закрытый, open source обещан позже. Ждем.
NVIDIA удвоила выручку, а гарантия под ЦОД OpenAI похудела на 145 млрд $
Отчет за второй квартал 2027 финансового года, опубликованный 26 августа показал выручку 96,2 млрд $ — плюс 106% год к году и плюс 18% квартал к кварталу. Ключевым драйвером по-прежнему считаются дата-центры — 89,0 млрд $, плюс 117% год к году. Валовая маржа 75,0%, EPS non-GAAP 2,22$ против ожиданий аналитиков в районе 2,06–2,09$.
Гайденс на третий квартал — 108,0 млрд $ ±2%. Примечательно, что в эти ожидания компания превентивно заложила нулевую выручку от поставок вычислительных систем для дата-центров в Китай. Параллельно NVIDIA продолжила агрессивный возврат капитала инвесторам: объем обратного выкупа акций за отчетный квартал составил около 19,7 млрд $.
Такой прогноз подкреплен запуском нового флагмана. Vera Rubin вышла в полномасштабное производство, стойки уже работают у CoreWeave, Google Cloud, Microsoft Azure, Oracle Cloud Infrastructure и Nebius.
Как 250 млрд $ превратились в 105 млрд $
17 августа объявили, что NVIDIA гарантирует до 105 млрд $ условных обязательств по лизинговым и энергетическим платежам под дата-центр OpenAI в центральном Огайо — на землях бывшего уранообогатительного комплекса.
Параметры: аренда на 20 лет, 8 IT-гигаватт вычислительной мощности, около 10 ГВт новой генерации (в том числе 9,2 ГВт газовой), 35 000 строительных рабочих мест и 2 500 постоянных. Первые мощности — с 2028 года. SB Energy строит и владеет объектом, NVIDIA вкладывает в нее дополнительно 1,5 млрд $.
Интереснее динамика самой цифры. В июле обсуждалась гарантия до 250 млрд $, 14 августа она сжалась до «менее 120 млрд $», 17 августа — до 105 млрд $. То есть на 145 млрд $ ниже первых сообщений.
На публикации о 250 млрд $ акции NVIDIA внутри дня падали на 4,5% — рынок читал схему как круговое финансирование. Вендор финансирует инфраструктуру, которая создает спрос на его же чипы.
Stripe покупает OpenRouter
Были и сообщения о сделке более чем на 7 млрд $. Для контекста: в мае OpenRouter привлек 113 млн $ Series B при оценке около 1,3 млрд $, то есть оценка выросла более чем впятеро за три месяца. Метрики платформы — 8 млн пользователей и доступ к более чем 400 моделям.
Логика покупателя простая. Слой маршрутизации между моделями перестал быть удобной оберткой и стал инфраструктурой, через которую проходит трафик и биллинг. Роутер — это место, где считаются деньги, а Stripe как раз про это.
Регуляторика и российский рынок: ЕС начал штрафовать, Россия готовит обязательную маркировку
Обязательства для провайдеров крупных моделей формально действовали с августа 2025 года, но без полномочий Еврокомиссии по принуждению — а теперь она начала их реально применять: запрашивать документацию, оценивать модели и штрафовать. Максимальный штраф — до 15 млн € или 3% мирового оборота компании, смотря что больше. Заодно заработало требование маркировать ИИ-контент не просто плашкой на экране, а меткой, которую можно распознать программно — то есть чат-бот обязан сообщать, что он бот, а сгенерированная картинка должна нести технический след своего происхождения. Системы высокого риска (найм, образование, кредитный скоринг) при этом получили отсрочку до конца 2027 года — их пока решили не трогать.
В России в это же время в Госдуму внесли похожий по духу законопроект — поправку к ФЗ №243-ФЗ, которая превращает маркировку ИИ-контента из права в обязанность владельцев крупных моделей, с вступлением в силу 1 марта 2027 года. Уязвимость та же, что и в европейской версии: видимый водяной знак стирается редактированием, а метаданные теряются при конвертации файла, так что многое будет держаться на добросовестности крупных площадок, а не на технической защите.
На рынке тем временем случилась куда более масштабная перемена. За первое полугодие 2026-го российские компании прогнали через китайские модели — в первую очередь Qwen, GLM и Kimi — больше токенов, чем за весь 2025 год, в 11 раз. При этом само железо под запуск моделей подорожало почти втрое: минимальный комплект серверов с GPU для развертывания одной модели обходился в 13,7 млн рублей в 2025 году, а теперь — 38,8 млн.
А вот с внедрением все не так гладко, как с закупкой моделей. Исследование «Инфосистемы Джет» показало: 86% крупных российских компаний уже пробуют LLM, но по-настоящему в промышленной эксплуатации — только половина из них. С ИИ-агентами разрыв еще резче: проекты есть почти у 60% компаний, а в реальном проде работают лишь 15%. Главные тормоза — дороговизна серверов и юридические риски, и почти половина компаний пока не видит от ИИ устойчивого экономического эффекта. Проще говоря: модели скачивать научились быстро, а довести их до продакшена — заметно дольше, чем казалось в начале года.
Финальные мысли
Август зафиксировал смену дефицита: узким местом стала память — и это надолго. Контракты на HBM у корейских вендоров расписаны до конца 2026 года, часть тянется до 2030-го, а гибридное соединение отложено до HBM5, то есть до 2029–2030 годов. Ждать удешевления памяти в ближайшие полтора года неоткуда — а значит, и цена инференса больше не будет падать сама собой. Разворот DeepSeek в этой логике — первый случай, который просто случился раньше остальных.
Отсюда два следствия. Гонка моделей сместится с размера на эффективность: линейное и разреженное внимание, сжатие KV-кэша и экстремальная разреженность вроде 6 млрд активных параметров из 125 у Qwen3.8-Flash-Next перестают быть исследовательскими приемами и становятся условием, при котором модель вообще имеет смысл разворачивать.
И второе, менее очевидное: преимущество получит не тот, кто выбрал правильную модель, а тот, кто умеет ее эксплуатировать. Веса теперь есть у всех и почти бесплатно — а вот 38,8 млн рублей на минимальный комплект серверов и инженеры, которые доведут пилот до прода, есть далеко не у всех. Именно здесь в ближайший год и разойдутся те, кто получает от ИИ эффект, и те, кто продолжает считать пилоты.
А как август повлиял на ваши планы по железу и бюджету на инференс — пересматриваете ли вы расчеты после подорожания памяти и разворота цен на API? Делитесь опытом в комментариях.
*Признана в России экстремистской организацией, а ее деятельность запрещена на территории страны решением Тверского районного суда Москвы от 21 марта 2022 года.