Hitech logo

Кейсы

Cerebras представила CS-4 — систему ускорения ИИ, которая в 30 раз быстрее GPU

TODO:
Екатерина ШемякинскаяСегодня, 01:41 PM

Cerebras Systems представила CS-4 — стоечную систему для ускорения работы ИИ-моделей. По данным компании, она в два раза быстрее предыдущей CS-3 и обеспечивает до 10 раз большую пропускную способность на ватт. Это должно повысить эффективность дата-центров, где стоимость электроэнергии становится одним из главных ограничений при масштабировании ИИ.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

CS-4 рассчитана прежде всего на быстрый инференс — генерацию ответов уже обученными моделями. В тесте с GPT-OSS-120B система показала более 4400 токенов в секунду на пользователя, что, по заявлению Cerebras, до 30 раз выше показателей сопоставимых GPU-решений. Высокая скорость особенно важна для ИИ-агентов, которым приходится не только генерировать ответы, но и многократно обращаться к инструментам и обрабатывать дополнительные запросы.

В основе CS-4 лежат три процессора Wafer Scale Engine 3 Turbo (WSE-3T), каждый из которых содержит 4 трлн транзисторов, 900 тыс. ядер, оптимизированных для ИИ, и 44 ГБ встроенной памяти. Один процессор обеспечивает до 250 PFLOPS вычислений и пропускную способность памяти 43,2 Пбайт/с. Вся система достигает 750 PFLOPS, 129,6 Пбайт/с по памяти и 7,2 Тбит/с по вводу-выводу.

CS-4 стала первой системой на новой платформе Cerebras Nexus. Компания переработала не только процессоры, но и конструкцию стойки: вычислительный модуль, питание, охлаждение и ввод-вывод объединены в компактные модульные блоки. В новом Wafer-Scale Backpack на 50% меньше компонентов, а доля автоматизированного производства выросла на 60%. Это позволяет сократить время развертывания с нескольких дней до нескольких часов.

Еще одно изменение касается энергоснабжения. Преобразователь питания перенесли с 50 мм от процессора до 0,5 мм, что должно снизить потери энергии и позволить подавать на WSE-3T вдвое больше мощности. Компания также вдвое увеличила пропускную способность ввода-вывода до 2,4 Тбит/с на процессор и снизила задержку связи между пластинами до двух микросекунд. Это позволяет объединять системы в крупные кластеры и, по заявлению Cerebras, поддерживать модели с более чем 50 трлн параметров.

Cerebras уже сотрудничает с AMD и AWS: их процессоры могут использоваться для обработки входных данных, а WSE — для сверхбыстрой генерации токенов. Такой подход может увеличить общую пропускную способность до пяти раз по сравнению с обычной конфигурацией.

Первые поставки CS-4 должны начаться в третьем квартале 2026 года. Выход системы происходит на фоне роста спроса на быстрый ИИ-инференс. Cerebras сообщила, что ее облачный бизнес во втором квартале вырос на 281% год к году, а контракты на дата-центры уже достигли 600 МВт.