Стоимость обучения DeepSeek: не $6 млн, а $1,3 млрд

В своём последнем отчёте независимая исследовательская компания SemiAnalysis выдвинула интересное заявление насчёт DeepSeek — нового, но перспективного игрока на рынке ИИ.

В частности, ранее создатели DeepSeek говорили, что стоимость его обучения составляет около $6 млн, что довольно мало на фоне конкурентов.

Однако отчёт SemiAnalysis развенчивает эту цифру, заявляя, что она не учитывает несколько критических факторов.

В частности, по словам исследователей, оценка в $6 млн в первую очередь учитывает расходы на предварительное обучение GPU, игнорируя значительные инвестиции в исследования и разработки, инфраструктуру и другие существенные расходы, понесенные компанией.

В отчёте подчёркивают, что капитальные расходы (CapEx) DeepSeek на серверное оборудование составляют колоссальные $1,3 млрд.

Значительная часть этих финансов была направлена на эксплуатацию и поддержку обширных кластеров GPU, которые являются основой её вычислительных мощностей.

Также авторы пишут, что DeepSeek располагает примерно 50 тысячами графических процессоров Hopper. Но это не означает наличие 50 тысяч H100, как предполагали некоторые.

Вместо этого инвентарь GPU включает смесь различных моделей, таких как H800, H100, а также H20 — специализированную версию, разработанную NVIDIA для китайского рынка в ответ на экспортные ограничения США.

Однако авторы отчёта хвалят организационную структуру DeepSeek. В отличие от некоторых крупных ИИ-лабораторий, DeepSeek управляет собственными дата-центрами и использует упрощённую модель работы, что повышает её гибкость и эффективность.

Что касается производительности, то анализ показывает: в плане способностей к рассуждению модель DeepSeek R1 сопоставима с OpenAI o1. Однако отчёт не называет DeepSeek безоговорочным лидером по всем ключевым показателям.

Хотя ценовая стратегия DeepSeek и привлекла внимание людей, однако тот же Google Gemini Flash 2.0, обладающий аналогичными возможностями, оказывается ещё более экономичным при доступе через API-сервисы.

Это ставит DeepSeek перед необходимостью найти баланс между производительностью и стоимостью для достижения успеха в будущем.

А вот что западные компании могут у DeepSeek перенять, так это прорывную технологию Multi-Head Latent Attention (MLA). Она позволяет снизить затраты на вывод данных на 93,3% за счёт уменьшения объёма кеширования key-value (KV).

В отчёте высказывается предположение, что операционные расходы могут снизиться в пять раз к концу года благодаря высокой адаптивности DeepSeek по сравнению с её более крупными и бюрократизированными конкурентами.

Тем не менее масштабирование бизнеса на фоне ужесточающихся экспортных ограничений США представляет собой серьёзную проблему. И решать её DeepSeek предстоит с особой осторожностью.

Читать дальше

Потерял работу — как быстро аннулируют твой рабочий ВНЖ? Узнали у специалиста по легализации

Потерял работу — как быстро аннулируют твой рабочий ВНЖ? Узнали у специалиста по легализации

Что происходит с рабочим видом на жительство после увольнения в Польше: сроки уведомления воеводы, 30 дней на поиск новой работы и реальные сроки аннулирования карты побыта на практике.

С сайта беларуского МВД исчезла онлайн-проверка запрета на выезд из Беларуси. Говорят, узнавайте лично

С сайта беларуского МВД исчезла онлайн-проверка запрета на выезд из Беларуси. Говорят, узнавайте лично

Сервис проверки временного ограничения на выезд из Беларуси удалён с сайта МВД. Теперь информацию можно получить только при личном обращении в миграционный отдел по месту жительства.

Так как же всё-таки доносить документы в Варшаве без электронного подтверждения?

Так как же всё-таки доносить документы в Варшаве без электронного подтверждения?

Практическое руководство по подаче документов в Варшаве через систему MOS без обязательного электронного подтверждения, с пояснениями от иммиграционных экспертов о сверке оригиналов и копий.