abptel-bigLogo

Что стимулирует рост спроса на оптические компоненты 400G и 800G в центрах обработки данных для ИИ?

Взрывной рост искусственного интеллекта (ИИ) и крупномасштабного машинного обучения (МО) произвел революцию в структуре и операционных потребностях современных центров обработки данных. С увеличением количества графических процессоров (GPU) в кластерах ИИ до десятков тысяч на одно задание обучения, спрос на высокоскоростное соединение с низкой задержкой внутри центров обработки данных резко возрос. Этот спрос стимулирует быструю модернизацию до оптических каналов 400G и 800G, необходимых для сетей с низкой переподпиской и практически неблокирующей пропускной способностью, обеспечивающих работу рабочих нагрузок ИИ. От достижений в области коммутационных микросхем до энергоэффективности оптических модулей, от экономических соображений до перехода к дорожным картам 1.6T, эта статья исследует основные движущие силы этой оптической эволюции. Читатели получат представление о том, как трафик между центрами обработки данных, управляемый графическими процессорами, развивающиеся сетевые протоколы и передовые инновации в области управления питанием и тепловым режимом формируют будущее связи в центрах обработки данных.

Как масштабирование кластеров GPU и трафик между серверами ускоряют проектирование сетей 400G и 800G

Крупномасштабный центр обработки данных для ИИ, демонстрирующий взаимосвязанные кластеры графических процессоров, обеспечивающие обмен данными между регионами.

Центры обработки данных для ИИ требуют более быстрой оптики, поскольку кластеры графических процессоров больше не работают как традиционные серверные фермы. По мере того, как количество задач обучения увеличивается с сотен ускорителей до тысяч или даже десятков тысяч, сеть становится частью самой вычислительной системы. Каждый узел должен постоянно обмениваться состояниями модели, градиентами и параметрами. Этот трафик в основном состоит из восток-западПередача данных происходит между серверами, а не в направлении север-юг к пользователям или хранилищу. В результате получается сеть, которая должна обеспечивать огромную пропускную способность при очень низкой и предсказуемой задержке.

Это важно, потому что выполнение больших задач ИИ регулируется коллективной коммуникацией. Такие операции, как all-reduce и all-gather, заставляют множество графических процессоров синхронизироваться одновременно. Если сеть зависает, дорогостоящие ускорители простаивают. Именно поэтому операторы ИИ стремятся к очень низкому уровню перегрузки, часто близкому к неблокирующему, на уровнях обучения. Более высокие скорости портов помогают более эффективно достичь этой цели. Канал 400G или 800G обеспечивает большую пропускную способность на каждом участке, уменьшает задержку сериализации и позволяет построить тот же кластер с меньшим количеством физических каналов и меньшим количеством этапов. На практике это повышает эффективность масштабирования и сокращает время обучения.

Кластерная архитектура усиливает этот сдвиг. Современные серверы с графическими процессорами предоставляют многотерабитную пропускную способность сети, часто через несколько высокоскоростных портов. Как только каждый сервер может передавать терабиты трафика в сеть, старые архитектуры 100G и 200G становятся структурно ограничивающими. Поэтому операторы строят плотные сети типа «лист-магистраль» или многоуровневые сети Клоса, а в некоторых случаях и топологии типа «стрекоза», чтобы сохранить разнообразие путей и снизить количество переходов. Высокоскоростная коммутация делает эти архитектуры практичными, но также многократно увеличивает потребность в оптических интерфейсах. Каждое дополнительное соединение магистрали, каждый восходящий канал с низкой переподпиской и каждая стратегия выхода увеличивают количество оптических интерфейсов, необходимых в рамках кластера.

Выбор кабелей также зависит от топологии. Короткие медные соединения работают только на ограниченном расстоянии в стойке. За пределами этого диапазона сети искусственного интеллекта в значительной степени зависят от параллельной одномодовой оптики и структурированных волоконно-оптических сетей. Это одна из причин, почему такие детали, как полярность MPO, чистота разъемов и допустимые потери, становятся операционными вопросами, а не второстепенными вопросами, касающимися кабелей. Для команд, планирующих создание плотных сетей искусственного интеллекта, это руководство поможет... Бюджет потерь MPO/MTP 400G/800G и полярность особенно актуально.

Суть в том, что спрос на 400G и 800G обусловлен не только оптикой, но и физикой распределенного ИИ. Более крупные кластеры создают более синхронизированный трафик между серверами, а этот трафик требует более плоских, быстрых и низколатентных сетей. После принятия этих архитектурных решений высокоскоростная оптика становится единственным практическим способом масштабирования системы.

Как коммутационные микросхемы, SerDes и оптические модули ускоряют рост спроса на 400G и 800G в центрах обработки данных для ИИ.

Крупномасштабный центр обработки данных для ИИ, демонстрирующий взаимосвязанные кластеры графических процессоров, обеспечивающие обмен данными между регионами.

Переход от проектирования кластеров ИИ к реальным потребностям в оптических решениях происходит на уровне коммутатора. Как только операторы решают, что им нужны более плоские коммутационные сети, меньший объем переподписки и более быстрая коллективная связь, следующим ограничением становится пропускная способность каждого порта коммутатора. Именно поэтому достижения в области микросхем коммутаторов и SerDes стали прямым двигателем внедрения 400G и стремительного роста 800G.

Предыдущие поколения коммутаторов 12.8T и 25.6T сделали 400G практичным в масштабируемом режиме. Они обеспечили операторам большую плотность размещения на лицевой панели и большую гибкость без увеличения количества стоек. Но настоящим переломным моментом для сетей искусственного интеллекта стал класс 51.2T. Благодаря SerDe-серверам PAM4 с пропускной способностью 112 Гбит/с на линию, это поколение поддерживает 64 собственных порта 800G или гораздо больше соединений 400G через разветвление. Это важно, потому что сети искусственного интеллекта строятся не только на основе высокой скорости. Они строятся на основе полезной мощности, эффективной кабельной разводки и возможности сохранения полосы пропускания на нескольких уровнях сети. Коммутаторы с большей мощностью уменьшают количество блоков, переходов и каналов, необходимых для достижения заданной цели, что превращает прогресс в области микросхем в немедленное потребление оптики.

Скрытый двигатель здесь — эволюция SerDes. Переход от 50 Гбит/с на линию к 112 Гбит/с на линию электрического ввода-вывода меняет экономику всей коммутационной сети. Это позволяет одному порту передавать вдвое большую пропускную способность без удвоения габаритов на передней панели. Это также обеспечивает более плавный переход. Собственный порт 800 Гбит/с может служить одним восходящим каналом 800 Гбит/с, двумя каналами 400 Гбит/с или ответвлениями на более низких скоростях там, где это необходимо. На практике такая гибкость позволяет операторам смешивать поколения, при этом стандартизируя использование более новых коммутационных платформ. Результатом является более быстрое наращивание объемов оптических сетей 400 Гбит/с и 800 Гбит/с.

Конструкция оптических модулей развивалась параллельно. На скорости 400 Гбит/с широко использовались модули DR4 и FR4, поскольку они обеспечивают баланс между дальностью действия, использованием волокна и простотой развертывания. На скорости 800 Гбит/с рынок выбирает между подходами типа DR8, DR4 и FR4 в зависимости от расстояния, оптоволоконной сети и теплового бюджета. Выбор форм-фактора также становится стратегическим. Модули с более высокой скоростью часто создают настолько высокие тепловые нагрузки, что воздушный поток и конструкция лицевой панели влияют на возможности коммутатора в производственной среде. Для команд, планирующих структурированную кабельную сеть, количество разъемов и полярность также становятся критически важными на этих скоростях, особенно при параллельной оптике и разветвлениях, как описано в этом руководстве. Бюджет потерь MPO/MTP 400G/800G и полярность.

Именно поэтому спрос на 800G растет еще до того, как 1.6T станет массовым. Кремниевые компоненты готовы, экосистема модулей расширяется, а 800G уже решает насущные проблемы масштабирования ИИ. Более новые оптические подходы могут снизить энергопотребление или повысить плотность размещения компонентов, но суть проста: когда коммутационные чипы обеспечивают больше высокоскоростных линий, центры обработки данных, работающие с ИИ, начинают закупать больше высокоскоростной оптики.

Почему ограничения по энергопотреблению, тепловым характеристикам и форм-факторам ускоряют внедрение оптики 400G и 800G в центрах обработки данных для ИИ?

Крупномасштабный центр обработки данных для ИИ, демонстрирующий взаимосвязанные кластеры графических процессоров, обеспечивающие обмен данными между регионами.

Переход на оптические сети 400G и 800G в центрах обработки данных для ИИ — это не только вопрос пропускной способности. Это также вопрос... плотность мощности История. По мере масштабирования кластеров ИИ каждый добавленный порт коммутатора для поддержания низкого уровня перегрузки также приводит к увеличению тепловыделения, перегрузке лицевой панели и нагрузке на систему охлаждения. Это существенно меняет проектирование оптических систем на практике. Операторы больше не выбирают модули только по дальности действия и стоимости. Они балансируют между мощностью на порт, характеристиками воздушного потока, плотностью разъемов и удобством обслуживания на тысячах каналов связи.

На частоте 800 Гбит/с этот компромисс становится гораздо более острым. Полностью укомплектованный коммутатор с большим количеством портов может выделять более киловатта только на оптику. Это делает габариты модуля столь же важными, как и сам микросхемный блок коммутатора. Большие форм-факторы становятся предпочтительнее, поскольку они могут рассеивать больше тепла и поддерживать более агрессивные конструкции радиаторов. Меньшие форматы по-прежнему важны там, где плотность критически важна, но запас по тепловому режиму часто определяет, что можно реально развернуть в масштабе. В сетях искусственного интеллекта, где порты быстро заполняются и сильно нагреваются при длительной нагрузке, теоретическая плотность мало что значит, если запас по охлаждению невелик.

Выбор дальности действия также подчиняется той же логике. Параллельная одномодовая оптика привлекательна для коротких и средних участков в центрах обработки данных, поскольку она обеспечивает низкую задержку и позволяет избежать более ресурсоемкой обработки сигнала. Подходы с разделением по длинам волн уменьшают количество волокон, что упрощает прокладку кабелей, но могут увеличивать оптическую сложность и тепловую нагрузку. В результате форм-фактор, волоконно-оптическая сеть и архитектура модулей должны планироваться вместе, а не по отдельности. Это особенно актуально, когда операторы рассматривают каналы связи типа DR4, DR8 или FR4 для разных уровней инфраструктуры искусственного интеллекта. Кабельная часть этого решения тесно связана с полярностью, количеством разъемов и потерями на входе, что становится более важным при переходе на высокоскоростные линии связи. Практическим справочником является это руководство по Бюджет потерь MPO/MTP 400G/800G и полярность.

Проблема нехватки мощности также обуславливает рост интереса к оптическим решениям с меньшим энергопотреблением. Конструкции, в которых отсутствует или уменьшена встроенная обработка сигнала, позволяют снизить энергопотребление на несколько ватт на модуль, что в совокупности приводит к существенной экономии на уровне стойки. Однако эта экономия достигается за счет более жестких электрических допусков и меньшего запаса прочности для несовершенных каналов. Это делает их привлекательными в основном для контролируемых условий на коротких расстояниях, а не в качестве универсальной замены.

Всё это объясняет, почему внедрение 800G растёт, несмотря на сложности с тепловым проектированием. Для обеспечения той же суммарной пропускной способности требуется меньше каналов связи, а новые оптические системы могут повысить пропускную способность на ватт, несмотря на более высокое абсолютное энергопотребление. В центрах обработки данных для ИИ это сочетание имеет значение: оптимальная оптическая схема — та, которая соответствует тепловым параметрам. и предотвращает ожидание графическими процессорами подключения к сети.

Почему центры обработки данных, ориентированные на ИИ, так агрессивно инвестируют в оптику 400G и 800G?

Крупномасштабный центр обработки данных для ИИ, демонстрирующий взаимосвязанные кластеры графических процессоров, обеспечивающие обмен данными между регионами.

Резкий рост спроса на оптические компоненты 400G и 800G — это не только техническая проблема, но и проблема распределения капитала. Бюджеты на инфраструктуру ИИ увеличились, поскольку теперь эффективность использования дорогостоящих ускорителей определяется сетевыми возможностями. Когда тысячи процессоров ожидают синхронизационного трафика, стоимость более медленной коммутационной сети быстро превышает стоимость более быстрой оптики. Это меняет логику закупок. Операторы больше не покупают трансиверы как периферийные компоненты. Они финансируют их как критически важные активы, обеспечивающие высокую производительность кластера и сокращающие время обучения.

Этот сдвиг наиболее заметен в структуре расходов на гипермасштабные решения. Крупные развертывания ИИ требуют гораздо больше оптических каналов, чем традиционные облачные модули, поскольку сети обучения проектируются с очень низким уровнем перегрузки. Большее количество каналов, больше уровней и коммутаторы с более высокой разрядностью увеличивают количество модулей. Переход с 400G на 800G может повысить стоимость модуля в краткосрочной перспективе, но при этом улучшить экономику всей сети за счет уменьшения количества уровней коммутаторов, сложности кабельной разводки и количества физических каналов, необходимых для достижения заданной цели бисекционного поиска. Именно поэтому покупатели все чаще моделируют оптические каналы на уровне... система уровень, а не простой уровень порта. Полезный способ сформулировать этот компромисс — это... реальная стоимость порта центра обработки данныхгде необходимо оценивать одновременно оптику, волоконно-оптическую сеть, электроэнергию и эксплуатационные расходы.

Условия в цепочке поставок усиливают эту срочность. Спрос сосредоточен вокруг узкого набора высокоскоростных компонентов: передовых электрических интерфейсов, цифровых сигнальных процессоров, лазеров, фотонных модулей и высокопроизводительной упаковки. Если какой-либо из этих уровней становится менее надежным, сроки поставки увеличиваются, а развертывание кластеров откладывается. Для операторов ИИ задержка в развитии сети может привести к простою гораздо большего капитала, чем сама оптическая составляющая. Именно поэтому двойное снабжение, стандартизация проектирования и квалификация от разных поставщиков стали стратегическими приоритетами. Широкая экосистема 400G по-прежнему предлагает здесь преимущество зрелости, особенно для распространенных диапазонов. Но 800G быстро набирает объемы производства по мере повышения выхода годной продукции и наращивания объемов производства.

Региональная политика и торговые ограничения добавляют еще один фактор. Даже там, где доступ к ведущим ускорителям ограничен, спрос на высокоскоростные сети Ethernet остается высоким, поскольку отечественным кластерам ИИ по-прежнему необходимы плотные оптические межсоединения. Это способствует локализованной сборке модулей и диверсификации цепочек поставок, особенно на рынках, стремящихся к большему контролю над критически важными инфраструктурными ресурсами.

В результате, 400G остается основным стандартом для развертывания сетей с ограниченным бюджетом и переходных решений, в то время как 800G становится предпочтительным вариантом для новых крупномасштабных сетей искусственного интеллекта. В следующей главе эта экономическая логика развивается на основе демонстрации того, как выбор протоколов, межсайтовая связь и путь к 1.6 Тл будут определять следующую волну спроса на оптические сети.

Почему выбор протоколов, расширение DCI и план развития до 1.6 Тл ускоряют внедрение оптических сетей 400G и 800G в центрах обработки данных для ИИ?

Крупномасштабный центр обработки данных для ИИ, демонстрирующий взаимосвязанные кластеры графических процессоров, обеспечивающие обмен данными между регионами.

По мере расширения кластеров ИИ за пределы отдельных залов и даже отдельных зданий, выбор протокола все больше определяет требования к оптике. Ethernet с RoCEv2 и InfiniBand теперь конкурируют не столько по заявленной скорости, сколько по эффективности передачи коллективного трафика в масштабе. Задачи обучения генерируют синхронизированные пакеты, внутрисетевые передачи и постоянные перегрузки в направлении «восток-запад». Это делает крайне важными низкую задержку в хвосте распределения, предсказуемое поведение потерь и эффективную обработку перегрузок. На практике обе сети подталкивают операторов к плотному развертыванию 400G и быстрому переходу на 800G, поскольку одной лишь настройки протокола недостаточно для преодоления физических ограничений пропускной способности.

Для сетей Ethernet привлекательность заключается в широте экосистемы и операционной стабильности. Крупные операторы могут запускать ИИ параллельно с хранением данных и облачными сетями, используя привычные инструменты, а затем настраивать управление перегрузкой, ECN, очереди и балансировку нагрузки для трафика GPU. InfiniBand по-прежнему имеет преимущество в средах с высокой степенью оптимизации для обучения, особенно там, где наиболее важны управление потоком на основе кредитов и устоявшиеся программные стеки. Однако оба пути ведут к одному и тому же: больше оптических портов, более высокая скорость портов и более плоские сети. Как только кластеры достигают десятков тысяч ускорителей, каждый дополнительный сетевой уровень или перегруженный восходящий канал напрямую влияют на эффективность масштабирования. Именно поэтому оптические сети 800G становятся практичной единицей расширения, в то время как 400G остается массовым уровнем для более широкой совместимости и расширения сети.

Это давление ещё больше усиливается по мере распространения инфраструктуры ИИ по кампусам крупных городов. Межсоединение центров обработки данных (DCI) больше не ограничивается только аварийным восстановлением или базовой мобильностью рабочих нагрузок. Оно всё чаще поддерживает объединение кластеров, перемещение контрольных точек и соединение суперподов между зданиями с практически бесшовной пропускной способностью. Когерентные модули 400G и появляющиеся модули 800G делают это возможным без затрат и габаритов традиционных внешних транспортных полок. В результате возникает мультипликативный эффект: высокоскоростное межсоединение центров обработки данных увеличивает спрос на высокоскоростную клиентскую оптику внутри каждого объекта, поскольку сети проектируются с учётом тех же предположений для 400G и 800G на периферии сети.

Следующий этап перехода уже влияет на текущие решения о закупках. Дорожная карта к 1.6 Тбит/с обещает еще один скачок в плотности базовых станций и полосы пропускания, но в ближайшей перспективе она не вытеснит 800G. Вместо этого она укрепляет позиции 800G как базового уровня развертывания, поскольку операторам нужны оптоволоконные сети, стратегии подключения и конструкции коммутаторов, способные плавно переходить между поколениями. Именно поэтому форм-фактор, гибкость разветвления и дисциплина прокладки кабелей сейчас имеют такое большое значение. Для команд, планирующих эти миграции, такие детали, как полярность MPO и бюджеты потерь, быстро становятся стратегическими, а не просто операционными, как описано в этом документе. Руководство по типичным ошибкам при миграции с 400G на 800GВ этом смысле протоколы, DCI и 1.6 Тл — это не отдельные истории. Вместе они объясняют, почему спрос на 400 Гбит/с остается высоким, в то время как 800 Гбит/с становится основной архитектурой для масштабируемого ИИ.

Заключение

В современную эпоху искусственного интеллекта стремительный рост размеров кластеров графических процессоров и объёма трафика данных в центрах обработки данных стимулирует спрос на оптические технологии 400G и 800G. Высокоскоростные оптические технологии теперь незаменимы для масштабируемой, эффективной и устойчивой инфраструктуры обучения и вывода данных для ИИ. От инноваций в коммутационных кремниевых модулях и оптических модулях до стратегий управления питанием и перспектив 1.6 Тл — каждое достижение напрямую решает проблемы пропускной способности, задержки и энергопотребления в гипермасштабных развертываниях. Непрерывная эволюция оптической связи, подпитываемая миллиардными капитальными инвестициями, гарантирует, что рабочие нагрузки ИИ будут готовы достичь прорывных уровней производительности, оставаясь при этом экономически эффективными и устойчивыми.

Обратитесь в ABPTEL за консультацией по высокоскоростной оптике, кабелям MTP/MPO и решениям для межсоединений центров обработки данных, которые помогут ускорить внедрение искусственного интеллекта.

Подробнее: https://abptel.com/contact/

О нас

Компания ABPTEL предлагает высокоскоростные оптические трансиверы, кабельные системы MTP/MPO, кабели DAC и AOC, коммутаторы PoE, решения FTTA и волоконно-оптические инструменты. Эти решения разработаны для проектов в области центров обработки данных, искусственного интеллекта, телекоммуникаций и сетевой инфраструктуры, ориентированных на масштабируемость, экономичность и надежную работу.


Обратитесь в ABPTEL

Ищете подходящее оптическое оборудование для вашего центра обработки данных с поддержкой ИИ, кластера графических процессоров или проекта FTTA? Компания ABPTEL осуществляет доставку из Шэньчжэня, предлагает поддержку OEM/ODM-производителей, быстрые сроки поставки и консультации инженерного уровня перед продажей.

💬 Получите ценовое предложение в течение 12 часов: Связаться с Кэнди · WhatsApp +86 188 1445 5697 · candy@abptel.com

Сеть центров обработки данных гипермасштабного уровня для искусственного интеллекта, включающая взаимосвязанные стойки, высокоскоростную оптику и современные коммутаторы.

Свяжитесь с нами

Просто укажите свое имя, адрес электронной почты и краткое описание вашего запроса в этой форме. Мы свяжемся с вами в течение 24 часов.

× Как я могу вам помочь?