Стоимость обучения DeepSeek: не $6 млн, а $1,3 млрд
В своём последнем отчёте независимая исследовательская компания SemiAnalysis выдвинула интересное заявление насчёт DeepSeek — нового, но перспективного игрока на рынке ИИ.
В частности, ранее создатели DeepSeek говорили, что стоимость его обучения составляет около $6 млн, что довольно мало на фоне конкурентов.
Однако отчёт SemiAnalysis развенчивает эту цифру, заявляя, что она не учитывает несколько критических факторов.
В частности, по словам исследователей, оценка в $6 млн в первую очередь учитывает расходы на предварительное обучение GPU, игнорируя значительные инвестиции в исследования и разработки, инфраструктуру и другие существенные расходы, понесенные компанией.
В отчёте подчёркивают, что капитальные расходы (CapEx) DeepSeek на серверное оборудование составляют колоссальные $1,3 млрд.
Значительная часть этих финансов была направлена на эксплуатацию и поддержку обширных кластеров GPU, которые являются основой её вычислительных мощностей.
Также авторы пишут, что DeepSeek располагает примерно 50 тысячами графических процессоров Hopper. Но это не означает наличие 50 тысяч H100, как предполагали некоторые.
Вместо этого инвентарь GPU включает смесь различных моделей, таких как H800, H100, а также H20 — специализированную версию, разработанную NVIDIA для китайского рынка в ответ на экспортные ограничения США.
Однако авторы отчёта хвалят организационную структуру DeepSeek. В отличие от некоторых крупных ИИ-лабораторий, DeepSeek управляет собственными дата-центрами и использует упрощённую модель работы, что повышает её гибкость и эффективность.
Что касается производительности, то анализ показывает: в плане способностей к рассуждению модель DeepSeek R1 сопоставима с OpenAI o1. Однако отчёт не называет DeepSeek безоговорочным лидером по всем ключевым показателям.
Хотя ценовая стратегия DeepSeek и привлекла внимание людей, однако тот же Google Gemini Flash 2.0, обладающий аналогичными возможностями, оказывается ещё более экономичным при доступе через API-сервисы.
Это ставит DeepSeek перед необходимостью найти баланс между производительностью и стоимостью для достижения успеха в будущем.
А вот что западные компании могут у DeepSeek перенять, так это прорывную технологию Multi-Head Latent Attention (MLA). Она позволяет снизить затраты на вывод данных на 93,3% за счёт уменьшения объёма кеширования key-value (KV).
В отчёте высказывается предположение, что операционные расходы могут снизиться в пять раз к концу года благодаря высокой адаптивности DeepSeek по сравнению с её более крупными и бюрократизированными конкурентами.
Тем не менее масштабирование бизнеса на фоне ужесточающихся экспортных ограничений США представляет собой серьёзную проблему. И решать её DeepSeek предстоит с особой осторожностью.