Нацеливание на рынок ИИ-инференции с низкой задержкой: Nvidia (NVDA.US) Groq 3 LPX массово производится, первые системы будут развернуты в NEBIUS (NBIS.US)
В понедельник Nvidia объявила, что система Groq 3 LPX уровня стойки вышла на стадию массового производства, что знаменует собой коммерциализацию технологии низкой задержки AI-инференции после приобретения компанией активов, связанных с Groq, примерно за 20 миллиардов долларов в прошлом году.
По данным приложения Zhihui Caijing, компания Nvidia (NVDA.US) в понедельник объявила, что система стойки Groq 3 LPX вышла на этап полномасштабного массового производства, что ознаменовало коммерциализацию этой технологии низкой задержки для AI-инференции после того, как компания в прошлом году потратила около 20 миллиардов долларов на приобретение активов, связанных с Groq. Первые системы будут развернуты у облачного провайдера AI Nebius (NBIS.US) и планируются к запуску позже в этом году.
Старший директор Nvidia Дион Харрис сообщил СМИ, что Groq 3 LPX будет развернут в дата-центрах Nebius вместе с центральным процессором Nvidia Vera и графическим процессором Rubin.
Быстрый выход продуктов Groq на массовое производство отражает, что по мере перехода AI-приложений от обучения моделей к реальному внедрению, AI-инференция с низкой задержкой становится новым направлением, за которое Nvidia ведет особенно острую конкуренцию. Особенно это важно для таких приложений, как AI-агенты и AI-программирование, где модели должны постоянно генерировать контент с более высокой скоростью, сокращая тем самым время ожидания для пользователей.
В декабре прошлого года Nvidia приобрела связанные с Groq активы стартапа по производству AI-чипов за около 20 миллиардов долларов, совершив крупнейшую сделку в истории компании.
Ключевая особенность архитектуры чипа Groq заключается в интеграции 500 МБ высокоскоростной SRAM в сам чип, что позволяет уменьшить узкие места передачи данных, которые могут возникнуть при обращении к традиционной памяти, и тем самым повысить скорость ответа при инференции AI-моделей.
В отличие от основных GPU Nvidia, которые производит TSMC (TSM.US), чипы Groq производятся компанией Samsung.
В настоящее время Nvidia интегрирует 256 чипов Groq 3 в одну стойку LPX. Согласно данным Nvidia, основанным на эталонных тестах Artificial Analysis, система Groq 3 LPX способна генерировать примерно 3400 токенов в секунду.
Для генеративного AI токен можно рассматривать как базовую единицу процесса обработки и генерации текста моделью. Чем выше скорость генерации токенов в секунду, тем быстрее AI реагирует на запросы пользователей, что особенно важно для таких чувствительных к задержкам приложений, как AI-программирование и реальные AI-агенты.
Харрис отметил, что для облачных компаний, предоставляющих услуги инференции AI, меньшая задержка позволяет предлагать премиум-сервисы с более высокой стоимостью клиентам, для которых важна высокая скорость отклика.
Тем не менее, чипы Groq не предназначены для замены традиционных GPU Nvidia.
GPU по-прежнему остаются основой современных AI-вычислительных инфраструктур: они могут не только обучать AI-модели, но и выполнять задачи инференции, кроме того, их универсальность позволяет использовать их для различных моделей и архитектур.
Чипы типа Groq с низкой задержкой более специализированы на определенных этапах инференции AI, в особенности — на этапе «декодирования» при генерации контента моделями.
Харрис уточнил: «Речь не идет о замене GPU — используется самый подходящий по цене и производительности процессор для разных частей рабочей нагрузки».
Это свидетельствует о том, что Nvidia пытается выстроить более детализированную архитектуру AI-вычислений: CPU Vera и GPU Rubin продолжают брать на себя широкие задачи AI-обработки, тогда как чипы Groq оптимизированы для инференции с высокой чувствительностью к задержке.
По мере того, как отрасль AI переходит от масштабного обучения моделей к этапу быстрого роста спроса на инференцию, конкуренция на рынке инференции с низкой задержкой усиливается.
AMD (AMD.US) ранее в этом году также объявила об интеграции своей стойки AI-систем с чипами Cerebras (CBRS.US), также сосредоточившись на AI-инференции с низкой задержкой.
Значимость этого сегмента увеличивается благодаря росту популярности таких приложений, как AI-программирование. Как сообщает издание, последняя представленная OpenAI ультрабыстрая модель Ultrafast обещает скорость до 750 токенов в секунду и работает на базе чипов Cerebras.
При этом, по данным стандартных тестов, приведённых Nvidia, Groq 3 LPX способен достигать 3400 токенов в секунду. Однако параметры тестирования и сценарии использования разных систем могут существенно различаться, поэтому эти показатели нельзя напрямую сопоставлять как окончательные измерения производительности.
В это же время Nvidia ускоряет поставки системы Vera Rubin, платформа уже перешла к производственной фазе в начале этого года.
Генеральный директор Nvidia Дженсен Хуанг в марте, представляя Vera Rubin и Groq 3 LPX, прогнозировал, что совокупные продажи с нынешних чипов Blackwell до нового поколения Vera Rubin могут достичь 1 трлн долларов к 2027 году.
Хуанг тогда также сообщил, что в центре данных, предназначенных для AI-программирования, он планирует выделить под чипы Groq около четверти пространства, а остальное полностью отдать платформам Vera Rubin.
Такая конфигурация ещё больше подчеркивает акцент Nvidia на рынок инференции с низкой задержкой. В условиях стремительного развития AI-агентов, AI-программирования и приложений генеративного AI в реальном времени, скорость инференции становится важнейшим конкурентным фактором для облачных провайдеров и AI-разработчиков.
Полноценный выход Groq 3 LPX на массовое производство означает, что Nvidia идет к диверсификации архитектуры: от компании, фокусирующейся на GPU для AI, к поставщику различных вычислительных архитектур под специфические AI-нагрузки.
Далее рынок будет следить за свежими финансовыми результатами Nvidia. Компания опубликует отчет в эту среду, и помимо спроса на Blackwell и Vera Rubin, коммерциализация Groq и успехи AI-инференции могут стать новыми фокусами для инвесторов.
Дисклеймер: содержание этой статьи отражает исключительно мнение автора и не представляет платформу в каком-либо качестве. Данная статья не должна являться ориентиром при принятии инвестиционных решений.
Вам также может понравиться
На фоне военной напряженности в Иране экономика Германии неожиданно растет: ВВП за второй квартал пересмотрен до 0,3%, а сильный экспорт поддерживает рост третий квартал подряд.
По последним данным, опубликованным во вторник Федеральным статистическим ведомством Германии, крупнейшая экономика Европы во втором квартале продемонстрировала темпы роста, превышающие предварительные оценки.


С наступлением сентября Bank of America выпускает «Инвестиционное Откровение»: акции могут потерять позиции, а основная роль в портфеле перейдёт к сырьевым товарам во главе с золотом
По мере приближения сентября, в недавнем отчёте Bank of America были выделены ключевые сезонные тенденции, на которые инвесторам стоит обратить внимание, особенно с учётом того, что рынок вступает во второй год четырёхлетнего президентского цикла в США.

Джексон-Хоул становится ключевой битвой за государственные облигации США: Bank of America предупреждает, что если Уолш не даст сигнал о повышении ставки, доходность 30-летних облигаций может превысить 5,5%.
Bank of America считает, что на фоне усиления обратного выкупа долгосрочных облигаций со стороны Министерства финансов и давления на доллар, если Уорш сможет чётко выразить готовность бороться с инфляцией и при необходимости возобновить повышение ставок, это поможет стабилизировать рынок и сгладить доходную кри вую. В противном случае, если он будет избегать заявлений по политике, доходность 30-летних государственных облигаций может достичь уровня 5,5%, а доллар столкнется с новым раундом давления на снижение.
