1. Что подтверждено: первый внешний раунд и оценка около $52 млрд

В июне 2026 года DeepSeek завершила первый внешний раунд финансирования. Его объём составил около 50 млрд юаней (примерно $7,4 млрд). Важно не смешивать привлечённую сумму с оценкой компании: раскрытие Anhui Korrun (开润股份) указывает, что 2,9 млрд юаней за косвенную долю 0,8265% соответствуют оценке 350,88 млрд юаней — около $51,82 млрд. Независимое раскрытие Jiuan Medical о вложении через структуру Shixiang согласуется с этой картиной.

Это не «официально объявленная DeepSeek оценка»: расчёт основан на публичных раскрытиях компаний-партнёров и изменениях в корпоративных записях. По состоянию на дату обновления именно они являются наиболее проверяемым основанием для цифры около $52 млрд.

Состав раунда раскрывался не единым cap table, а в регуляторных документах и репортажах деловых СМИ. В него входили:

  • Лян Вэньфэн — около 20 млрд юаней;
  • Tencent — около 10 млрд юаней;
  • CATL — около 5 млрд юаней;
  • JD.com, NetEase, IDG Capital, Monolith и Shixiang;
  • Государственный фонд развития индустрии ИИ Китая (NAIIF).

Нельзя относить к инвесторам DeepSeek PIF, Mubadala, ADIA, GIC или Temasek: на 6 сентября 2026 года их присутствие в капитале DeepSeek публичными раскрытиями не подтверждено. Это распространённая путаница со сделками других AI-компаний, в том числе Zhipu, MiniMax, Anthropic и xAI.

2. Анатомия сделки: капитал без передачи контроля

Особенность раунда — не только размер, а юридическая конструкция. По сообщениям The Information и Reuters, деньги большинства участников поступали в limited partnership, которым единолично управлял Лян Вэньфэн, а не напрямую в операционную компанию. Такие LP не получили голосующих прав и согласились на пятилетний запрет на выход.

Практический эффект: финансовые инвесторы получили экономическое участие, но не механизм вмешательства в стратегию, исследования или управление DeepSeek. Для основателя это снизило риск давления на краткосрочную монетизацию и сохранило контроль над лабораторией после привлечения внешнего капитала. Исключение, о котором сообщалось в материалах о структуре сделки, — NAIIF: его доля оформлена напрямую, с голосом и без пятилетнего lock-up.

Этот вывод следует читать аккуратно: условия сделки описаны источниками СМИ и последующими корпоративными раскрытиями, а не опубликованным DeepSeek договором. Поэтому они не заменяют полный юридический cap table.

3. $74 млрд и IPO в Шанхае: что является слухом, а что — фактом

В конце августа 2026 года South China Morning Post сообщала со ссылкой на источники о возможном новом раунде: ориентир оценки 500 млрд юаней (около $74 млрд) и вероятное привлечение порядка 50 млрд юаней. В публикации также обсуждалась подготовка к возможному дебюту на Shanghai STAR Market в 2027 году.

Это не подтверждённый закрытый раунд и не объявленное IPO. На дату обновления нет пресс-релиза DeepSeek о завершении этой сделки; в открытом реестре Shanghai Stock Exchange нет эмитента DeepSeek / 深度求索 с поданным проспектом. Следовательно, нельзя писать, что компания «подала предварительный проспект» или что разместит $8–12 млрд.

Цифра $8,6 млрд, которая иногда сопровождает этот сюжет, относится не к DeepSeek, а к IPO производителя памяти CXMT. Это отдельный эмитент и отдельная сделка. Потенциальная оценка DeepSeek в сообщениях источников также не равна объёму будущего размещения.

Шанхайская фондовая биржа и котировки технологического сектора STAR Market

4. Реальная связь DeepSeek со STAR Market: Unitree Robotics

Фактическая связь DeepSeek с площадкой STAR Market на эту дату обратная: DeepSeek выступила стратегическим (институциональным) инвестором IPO Unitree Robotics (宇树科技, 688836). В стратегическом размещении ей выделили пакет примерно на 140,8 млн юаней. То есть DeepSeek была инвестором листинга робототехнической компании, а не его эмитентом.

Этот факт не доказывает подготовку DeepSeek к собственному IPO. Он показывает участие компании в экосистеме китайской embodied-AI/робототехники и должен рассматриваться отдельно от неподтверждённых сообщений о её возможном листинге.

5. Алгоритмический фундамент оценки: что действительно показывают технические отчёты

Финансовую оценку нельзя выводить из одной лишь стоимости обучения, но её контекст — инженерная эффективность моделей DeepSeek. Ниже — формулировки, которые поддерживаются первичными техническими источниками.

MLA: экономия памяти KV-кэша

В DeepSeek-V2 механизм Multi-Head Latent Attention (MLA) сжимает ключи и значения в латентное представление:

c_t^KV = W^DKV · h_t (где c_t^KV — сжатое латентное представление ключей/значений на шаге t, W^DKV — матрица понижающей проекции, h_t — скрытое состояние модели на шаге t)

В сравнении с плотной DeepSeek-67B авторы V2 указывают сокращение KV-кэша на 93,3% и рост максимальной пропускной способности генерации в 5,76 раза. Это не означает «10–12 раз больше сессий» при любых нагрузках: итоговая ёмкость сервиса зависит также от контекста, памяти ускорителя, батчинга и реализации инференса.

DeepSeekMoE, DualPipe и FP8

В DeepSeek-V3 применяется fine-grained DeepSeekMoE: 256 экспертов малой размерности; для каждого токена активируются 8 routed experts и 1 shared expert. Архитектура V3 имеет 671 млрд суммарных параметров, из которых около 37 млрд активируются на токен.

DualPipe — схема pipeline-параллелизма, в которой прямой и обратный проходы перекрываются с межузловыми коммуникациями. Технический отчёт описывает принцип перекрытия, но не даёт оснований приписывать ему универсальную цифру «1,8% bubble overhead»; она здесь намеренно не используется. V3 также применяет кастомный FP8 mixed-precision training framework с fine-grained quantization.

Авторы оценивают полный официальный training V3 в 2,788 млн H800 GPU-часов: 2,664 млн на pre-training, 119 тыс. на context extension и 5 тыс. на post-training. При расчётной арендной цене $2 за GPU-час это $5,576 млн (округлённо $5,58 млн). Это не полная стоимость разработки: в неё не включены предшествующие R&D, оборудование, данные и зарплаты.

6. R1-Zero, Pure RL и значение открытых весов

DeepSeek-R1-Zero обучалась с Pure Reinforcement Learning на основе GRPO без предварительного SFT. В отчёте авторы описывают появление у модели поведения само-проверки и «Aha! moment» в ходе RL. Это наблюдение из эксперимента, а не доказательство человеческого понимания или универсальной надёжности рассуждений.

Полная DeepSeek-R1 дополнительно использует cold-start data и многоэтапный пайплайн обучения. Одновременно DeepSeek выпустила дистиллированные модели 1.5B, 7B, 8B, 14B, 32B и 70B. Их собственный код и веса распространяются по MIT License, однако для производных на Qwen и Llama необходимо одновременно соблюдать условия лицензий соответствующих базовых моделей. «Открытые веса» не тождественны отсутствию всех юридических ограничений.

Исторические тарифы API и их статус

Следующие тарифы следует сохранять только как исторический ориентир публичной ценовой политики DeepSeek:

Семейство

Ввод при cache miss, $/1M токенов

Вывод, $/1M токенов

DeepSeek-V3 / chat

$0,14

$0,28

DeepSeek-R1 / reasoner

$0,55

$2,19

По состоянию на сентябрь 2026 года API и линейка моделей менялись, поэтому эти значения нельзя автоматически использовать для нового бюджета или выдавать за действующий прайс. Актуальную стоимость нужно проверять непосредственно в официальной документации перед расчётом.

Источники