Рабочие нагрузки ИИ совершают революцию в оптической связи центров обработки данных, требуя беспрецедентной скорости, эффективности и низкой задержки. По мере масштабирования распределенного обучения на десятках тысяч ускорителей оптические технологии должны развиваться, чтобы справляться с огромным трафиком между серверами, одновременно балансируя энергоэффективность и стоимость. Базовые стандарты, такие как IEEE 802.3df и 802.3dj, способствуют развитию скоростей от 800G до 1.6T, меняя стратегии подключения. Эта трансформация влияет на топологии сети, выбор физического уровня, кабельную разводку, технологии DCI и вопросы устойчивого развития, что делает крайне важным для архитекторов и инженеров ориентироваться в этих изменениях. Каждая глава этой статьи посвящена основным аспектам этого сдвига: от эволюции оптических стандартов до экономики масштабирования готовых к ИИ сетей, помогая заинтересованным сторонам создавать надежные и перспективные инфраструктуры.
От 400 Гбит/с до 1.6 Тл: дорожная карта стандартов и скорости, меняющая оптику центров обработки данных для ИИ.

Развитие сетевых технологий для ИИ выводит оптические соединения на новый этап стандартизации, где увеличение скорости уже не является простым обновлением. Это архитектурные решения, учитывающие особенности распределенного обучения. По мере масштабирования кластеров от сотен до тысяч ускорителей, каналы 100G и 200G быстро становятся ограничивающим фактором. Именно поэтому рынок быстро перешел на 400G и сейчас стандартизирует 800G, готовясь к 1.6T. Этот сдвиг тесно связан с тем, как рабочие нагрузки ИИ потребляют пропускную способность: прерывистый трафик между серверами, строгие окна синхронизации и низкая устойчивость к дрожанию сигнала.
Технической основой этого перехода является переход от сигнализации NRZ к PAM4, сначала со скоростью 50 Гбит/с на линию, затем 100 Гбит/с и 112 Гбит/с, а теперь и к электрическим и оптическим линиям 200 Гбит/с и 224 Гбит/с. PAM4 удваивает пропускную способность на символ, но делает это с более жесткими запасами по сигналу. Этот компромисс вынуждает сильнее полагаться на прямую коррекцию ошибок и обработку сигнала. На практике каждый скачок скорости порта также представляет собой компромисс между дальностью действия, мощностью, тепловым запасом и задержкой. Для сетей искусственного интеллекта это важно, поскольку оптическая эффективность не может достигаться за счет чрезмерной задержки на нескольких коммутационных узлах.
Именно здесь текущая дорожная карта стандартов приобретает особое значение. Предыдущие поколения Ethernet определили базовые блоки 200G и 400G, которые сейчас широко распространены в больших кластерах. Более новые работы по 800G и 1.6T формализуют следующий этап, включая оптические интерфейсы 100G и 200G на линию, одномодовые варианты для коротких и средних расстояний, а также более высокоскоростные электрические интерфейсы ввода-вывода. Эти определения не являются абстрактными. Они определяют базис коммутаторов, стратегии разветвления, выбор кабельной сети и то, что операторы смогут развернуть в масштабе в течение следующих двух лет. Для читателей, сравнивающих существующие классы модулей, этот обзор Трансиверы 400G против 800G Это помогает понять, почему 800G становится стандартным решением для кластеров ИИ, а не нишевым премиальным уровнем.
Выбор форм-фактора также показывает, как стандарты адаптируются к требованиям искусственного интеллекта. На скорости 400 Гбит/с ведущие подключаемые форматы могут комфортно сосуществовать. На скорости 800 Гбит/с тепловая плотность становится гораздо более важным фактором, поэтому часто предпочтение отдается конструкциям с большим запасом по охлаждению. На скорости 1.6 Тбит/с задача снова усложняется, поскольку большее количество линий и электрические интерфейсы класса 224 Гбит/с доводят плотность лицевой панели, конструкцию разъемов и отвод тепла до предельных значений.
В результате, лидерство в скорости оптической связи для ИИ больше не сводится только к заявленной пропускной способности. Речь идет о том, какие стандарты могут обеспечить более высокую плотность портов, приемлемый уровень тепловыделения, допустимые накладные расходы на коррекцию ошибок и четкие пути перехода от современных модулей 800G к будущим сетям 1.6T. Эта основа, сочетающая стандарты и скорость, ставит следующий вопрос: как организовать эти каналы связи в топологии, обеспечивающие эффективное перемещение коллективного трафика.
Разработка оптических сетей для ИИ: почему технологии Clos, RDMA и сети малого диаметра сегодня определяют возможности подключения центров обработки данных

По мере увеличения скорости портов, более сложной задачей становится не просто передача большего количества битов. Речь идёт о формировании инфраструктуры таким образом, чтобы задачи ИИ не застревали в точках синхронизации. Большие кластеры для обучения генерируют повторяющиеся пакеты операций all-reduce, all-gather и reduce-scatter на тысячах ускорителей. Эти обмены создают серьёзные проблемы, связанные с передачей данных, быстрым накоплением очереди и задержкой в хвосте, что может значительно увеличить время выполнения задачи по сравнению с тем, что показывают графики пропускной способности. Именно поэтому ИИ подталкивает оптические соединения в центрах обработки данных к топологиям с высокой пропускной способностью, предсказуемыми путями и минимальным количеством оптических и коммутационных каскадов.
Наиболее распространенный ответ по-прежнему таков: ткань Клос с высоким радиксомОсобенно в двухуровневых архитектурах для модулей ИИ. Его привлекательность заключается как в практическом, так и в теоретическом аспекте. Clos предлагает единообразную маршрутизацию, удобство в эксплуатации и простой способ масштабирования пропускной способности между узлами сети при сохранении низкого количества переходов. В кластерах ИИ этот низкий диаметр имеет значение, поскольку каждый дополнительный переход увеличивает задержку сериализации, задержку коррекции ошибок (FEC), обработку DSP и риск возникновения очередей. Даже если каждый этап добавляет всего наносекунды, совокупная задержка быстро достигает уровня микросекунд. Топология, которая выглядит эффективной на бумаге, может показывать низкую производительность, если она усиливает дрожание во время коллективных операций.
Это давление также возрождает интерес к альтернативным решениям, таким как конструкции типа «стрекоза» и «плоская бабочка». Они обещают меньшее количество переходов в больших масштабах и меньшую разветвленность кабельной сети между модулями. Но их реальная ценность в условиях искусственного интеллекта зависит от того, насколько предсказуемыми останутся маршрутизация, управление перегрузкой и обработка сбоев при всплесках коллективного трафика. Многие операторы по-прежнему предпочитают Clos, потому что программное обеспечение, телеметрия и модели устранения неполадок достаточно зрелые. Другими словами, выбор топологии теперь неотделим от эксплуатационной пригодности.
Транспортное поведение имеет такое же важное значение. Технологии искусственного интеллекта все больше полагаются на... Семантика RDMA Поскольку накладные расходы ЦП, задержки повторной передачи и шумовые хвосты задержки неприемлемы во время строго синхронизированных этапов обучения. InfiniBand давно лидирует в этом направлении благодаря управлению потоком на основе кредитов, адаптивной маршрутизации и аппаратной поддержке коллективного ускорения. Сети на основе Ethernet сокращают этот разрыв благодаря улучшениям RoCE, улучшенной сигнализации ECN, точному регулированию скорости и новым усилиям по снижению зависимости от PFC. Цель проста: сохранить низкую задержку под нагрузкой, не превращая управление перегрузкой в источник блокировки начала очереди.
Эти архитектурные решения напрямую влияют на оптику. Сеть с меньшим количеством переходов и более чистым поведением трафика может лучше использовать высокоскоростные каналы связи, не теряя производительности на буферизацию и восстановление. Это одна из причин, почему операторы ИИ, переходящие с 400G на 800G, также пересматривают схемы разветвления, кабельные схемы и размещение коммутаторов, как это видно из обсуждений вокруг Трансиверы 400G против 800G для сетей искусственного интеллекта в центрах обработки данныхВ инфраструктуре ИИ топология больше не является логическим наложением на оптический слой. Она становится одной из главных сил, определяющих структуру этого оптического слоя.
Выбор оптических модулей для масштабируемых систем искусственного интеллекта: модули, физические уровни и переход от 800G к 1.6T.

Физический уровень теперь является стратегическим проектным решением в инфраструктуре ИИ, а не деталью закупки. Как только обучающие кластеры начали передавать синхронизированный трафик между тысячами ускорителей, выбор оптических модулей и физического уровня стал определять время выполнения заданий, энергопотребление стойки и даже то, насколько масштабируемой может быть сеть до того, как будут исчерпаны допустимые пределы задержки. Именно поэтому переход от 400G к 800G, а вскоре и к 1.6T, — это не просто повышение скорости. Это перепроектирование управления электрическими и оптическими границами.
В основе этого перехода лежит переход от более старых методов сигнализации к 100G и 200G на полосу PAM4PAM4 повышает эффективность использования полосы пропускания, но делает это с более жесткими запасами по сигналу. Это требует более сильной прямой коррекции ошибок, большей эквализации и более строгого управления каналом. В кластерах ИИ эти компромиссы имеют значение, поскольку каждый переход накапливает задержку. Задержка FEC и DSP может казаться небольшой по отдельности, однако в сети малого диаметра они потребляют значительную часть микросекундного бюджета, от которого зависят коллективные операции.
Именно поэтому архитектура модулей имеет такое же значение, как и скорость портов. Традиционные подключаемые модули на базе DSP остаются практичным выбором для многих развертываний, поскольку они обеспечивают надежную совместимость и лучшую устойчивость к несовершенствам каналов. Они особенно полезны там, где важна гибкость в отношении дальности действия, включая короткие одномодовые каналы внутри модуля и более длинные каналы, протянувшиеся через коридоры. Но их энергопотребление значительно на скорости 800 Гбит/с, а ранние модули 1.6T еще больше увеличивают тепловые затраты. В плотных кластерах ИИ оптика может потреблять киловатты на стойку, превращая выбор трансивера в проблему охлаждения в той же мере, что и в проблему организации сети.
Это давление объясняет растущий интерес к линейный привод подключаемая оптикаУдаление модуля DSP позволяет снизить энергопотребление и задержку, что хорошо согласуется с архитектурой ИИ для коротких линий связи, построенной на основе предсказуемой кабельной разводки и продуманной конструкции хост-системы. Недостатком является уменьшение запаса прочности. Целостность сигнала становится более чувствительной к потерям на плате, вариациям разъемов и совместимости с продукцией разных производителей. Для операторов, готовых учитывать эти ограничения при проектировании, LPO предлагает путь к повышению ватт на бит. Более подробно об этом пути миграции см. это руководство. Разработка оптических систем 400G и 800G для искусственного интеллекта.
Выбор форм-фактора отражает те же реалии. Запас тепловой мощности имеет свои особенности. OSFP Особенно привлекательными они становятся на скорости 800G, в то время как системы следующего поколения 1.6T движутся в сторону более крупных конструкций, способных поддерживать электрический ввод-вывод 224G и более высокие требования к охлаждению. В то же время одномодовая оптика, такая как варианты DR и FR, становится стандартом для новых модулей ИИ, поскольку она обеспечивает гибкость в отношении дальности действия, не привязывая кабельную сеть к одной топологии. С появлением линий 224G медь остается ценным материалом только на самых коротких расстояниях, а оптика становится доминирующим средством передачи данных почти везде в остальных случаях.
Масштабирование ИИ за пределами единой инфраструктуры: экономика DCI и новая стоимость оптической связи.

По мере того, как кластеры ИИ разрастаются за пределы одного зала или кампуса, оптическая связь перестает быть лишь вопросом проектирования стоек. Она становится проблемой межсоединений центров обработки данных, определяемой потребностью в пропускной способности, чувствительностью к задержке и необходимостью соблюдения бюджетных ограничений. Крупные задачи обучения все чаще охватывают несколько зданий, городских площадок и региональных центров обработки данных. Этот сдвиг повышает важность когерентной оптики, планирования волоконно-оптических сетей и экономической целесообразности перемещения огромных наборов данных и состояний моделей без превращения сети в основное узкое место.
Внутри кампуса давление уже очевидно. Технологии искусственного интеллекта стремительно переходят от 400G к 800G, а 1.6T — следом. Операторам на разных площадках необходимы аналогичные скачки в пропускной способности межсоединений. Многосайтовое обучение, распределенное контрольное сохранение и удаленный доступ к хранилищам данных — все это обеспечивает устойчивый трафик между центрами обработки данных за пределами традиционных границ центров обработки данных. Именно поэтому компактные когерентные подключаемые модули стали центральным элементом масштабирования ИИ. Они позволяют операторам расширять высокоскоростные каналы связи на расстояния в пределах городских агломераций с помощью гораздо более простых архитектур, чем старые транспортные наложения. По мере того, как 400ZR становится стандартом, а появляются когерентные варианты 800G, грань между внутренним расширением инфраструктуры и региональной стратегией межсоединений продолжает размываться.
Экономические аспекты столь же кардинально меняют ситуацию, как и технологии. В сетях искусственного интеллекта оптика перестала быть просто погрешностью округления в спецификации материалов. На скорости 800 Гбит/с каждый канал передает значительную мощность модуля, и каждый коммутатор может поддерживать десятки таких каналов. В больших сетях ускорителей потребление энергии оптикой быстро достигает мегаваттного масштаба. Это делает решения, касающиеся энергопотребления на бит, затрат на охлаждение и плотности трансиверов на уровне печатных плат, столь же важными, как и решения, касающиеся сети. Это также меняет стратегию закупок. Операторы моделируют не только первоначальную стоимость портов, но и энергопотребление в течение всего жизненного цикла, логистику замены, использование оптоволокна и запас по миграции к конструкциям с пропускной способностью 200 Гбит/с на линию. Практический результат — гораздо более четкая ориентация на то, где ближняя параллельная оптика, дуплексная оптика или когерентные каналы обеспечивают наилучшую отдачу.
Кабельная разводка и эксплуатация напрямую влияют на эту отдачу. Одномодовое оптоволокно становится стандартом, поскольку оно поддерживает как ближние сети AI, так и более длинные сети DCI без необходимости последующей перестройки среды передачи. Выбор разъемов, стратегия разветвления и простота коммутационного поля влияют на скорость масштабирования кластеров и безопасность их переконфигурации. Даже, казалось бы, незначительные решения, касающиеся оптики DR, FR и LR, теперь имеют экономические последствия, особенно при масштабировании на тысячи портов. Для более глубокого понимания этих компромиссов см. этот обзор. Трансиверы 400G DR4, FR4 и LR4.
Эти факторы, влияющие на стоимость, также объясняют, почему устойчивость цепочки поставок стала частью сетевой архитектуры. Сроки поставки, доступность DSP, выход годных лазеров и региональные ограничения в области поставок могут задерживать расширение кластера так же неизбежно, как и ограничения по мощности или охлаждению. В центрах обработки данных для ИИ экономика межсоединений теперь определяет решения по топологии, сроки развертывания и даже то, насколько масштабируемым может быть обучение, прежде чем устойчивость станет следующим жестким ограничением.
Разработка устойчивых оптических соединений по мере масштабирования центров обработки данных для ИИ до 800G и выше.

Переход к инфраструктуре масштаба ИИ сделал устойчивость оптических систем ключевой проблемой проектирования сети, а не второстепенной проблемой закупок. По мере того, как кластеры переходят от 400G к 800G и готовятся к 1.6T, оптика теперь определяет плотность мощности, стратегию охлаждения, модели обслуживания и долгосрочную экономику. Один высокоскоростной канал может потреблять десятки ватт на обоих концах. Умножив это на тысячи портов, получаем существенную долю энергопотребления объекта. Во многих сетях ИИ ограничивающим фактором является уже не только число коммутаторов или пропускная способность. Речь идет о том, может ли оптический уровень передавать больше битов без превышения теплового и энергетического лимитов.
Это давление меняет подход операторов к оценке каждого варианта подключения. Пассивный медный кабель по-прежнему обеспечивает наилучший профиль энергопотребления на очень коротких расстояниях, но его практическая дальность сокращается с увеличением скорости передачи данных. При 112G PAM4, и тем более при 224G, медный кабель становится труднопроходимым на расстоянии более нескольких метров. Это приводит к переходу на одномодовые оптические кабели, особенно для развертывания в масштабе рядов и модулей. Одномодовые конструкции также обеспечивают более удобные пути миграции между зонами покрытия DR и FR, упрощают будущие обновления скорости и позволяют избежать некоторых ограничений, связанных с многомодовыми кабелями в плотных средах с искусственным интеллектом. В результате получается архитектура с большим количеством оптических компонентов, но ее необходимо тщательно проектировать, чтобы избежать неконтролируемого роста энергопотребления.
Архитектура модулей теперь имеет такое же значение, как и дальность действия. Традиционные подключаемые модули на основе DSP остаются наиболее гибким вариантом, но они увеличивают как энергопотребление, так и задержку. Для рабочих нагрузок ИИ такое сочетание обходится дорого. Коллективный трафик чувствителен к задержкам в микросекундном масштабе, а повторяющиеся этапы коррекции ошибок и обработки сигналов накапливаются на нескольких участках. Именно поэтому подключаемые оптические модули с линейным приводом привлекают внимание для коротких каналов связи ИИ. За счет удаления DSP модуля они могут снизить энергопотребление и уменьшить задержку, хотя только там, где условия канала строго контролируются. Компромисс заключается в более узком диапазоне и более строгих требованиях к конструкции хоста, разъемам и совместимости. Для многих операторов это делает LPO привлекательным в предсказуемых кабельных сетях, в то время как традиционные подключаемые модули остаются более безопасными в более широких зонах покрытия.
Та же логика устойчивого развития распространяется и на упаковку. Оптика, расположенная близко к основной упаковке или в одной упаковке, обещает меньшие электрические потери, лучшую энергоэффективность и более высокую плотность размещения на передней панели. Однако она усложняет замену, техническое обслуживание и планирование жизненного цикла. Этот баланс между эффективностью и удобством обслуживания становится центральным элементом проектирования сетей для ИИ. Даже организация кабелей и чистота приобретают большее значение при такой плотности размещения, особенно при параллельной оптике и развертывании с большим количеством ответвлений, что требует соблюдения строгих правил в отношении организации кабелей. Проблемы миграции MPO/MTP на скорости 400G и 800G Это часть устойчивого развития, а не только качество установки. В этом смысле устойчивая оптическая связь для ИИ — это не просто выбор одной технологии. Это дисциплинированное сочетание эффективности физического уровня, теплового реализма, простоты эксплуатации и путей модернизации, которые позволят выдержать следующий скачок в пропускной способности.
Заключение
Обучающие нагрузки для ИИ приводят к кардинальным изменениям в оптической связи центров обработки данных, расширяя границы скорости, задержки и пропускной способности. По мере того, как операторы внедряют 800G и готовятся к подключению 1.6T, обеспечение устойчивого функционирования этих сетей при одновременном управлении затратами и сложностью становится критически важным. Идя в ногу с достижениями в области стандартов, коммутационных матриц и методов охлаждения, инженеры и проектировщики могут гарантировать, что их архитектуры не только соответствуют сегодняшним требованиям ИИ, но и масштабируются для решения задач распределенных рабочих нагрузок завтрашнего дня.
Обратитесь в компанию ABPTEL по вопросам высокоскоростной оптики, кабельной системы MTP/MPO и решений для межсоединений центров обработки данных.
Подробнее: https://abptel.com/contact/
О нас
Компания ABPTEL поставляет высокоскоростные оптические трансиверы, кабельные системы MTP/MPO, кабели DAC и AOC, коммутаторы PoE, решения FTTA и волоконно-оптические инструменты для проектов в области центров обработки данных, искусственного интеллекта, телекоммуникаций и сетевой инфраструктуры.
Обратитесь в ABPTEL
Ищете подходящее оптическое оборудование для вашего центра обработки данных с поддержкой ИИ, кластера графических процессоров или проекта FTTA? Компания ABPTEL осуществляет доставку из Шэньчжэня, предлагает поддержку OEM/ODM-производителей, быстрые сроки поставки и консультации инженерного уровня перед продажей.
- 🔥 Трансиверы OSFP / QSFP-DD 400G и 800G — для обучающих моделей ИИ и гипермасштабируемых спиновых листов
- 📡 Высокоплотная кабельная система MPO/MTP — 12/24/32-волоконный кабель для центров обработки данных высокой плотности
- ⚡ Кабели AOC и DAC — Короткие соединительные кабели для графических процессоров, совместимые с OEM-производителями.
- 🧩 Модули SFP / SFP+ / SFP28 / QSFP28 — Оптические трансиверы 1G–100G
- 📋 Кабельные решения для центров обработки данных — комплексное руководство по проектированию
- ❓ Читайте наш FAQ — совместимость, полярность, сроки поставки, минимальный объем заказа
💬 Получите ценовое предложение в течение 12 часов: Связаться с Кэнди · WhatsApp +86 188 1445 5697 · candy@abptel.com




