شبكة فيرجو

Google Cloud lanza la red Virgo para conectar millones de aceleradores de inteligencia artificial

Written by

Picture of فريقنا

فريقنا

Communications Consultant

En un paso que redefine la infraestructura de la computación en la nube, Google Cloud ha presentado una arquitectura de red innovadora diseñada específicamente para satisfacer las enormes demandas de entrenamiento y ejecución de modelos avanzados de inteligencia artificial con una eficiencia sin precedentes.

Durante su conferencia anual «Cloud Next», celebrada esta semana en Las Vegas, Google Cloud anunció el lanzamiento de la red Virgo, una arquitectura de red avanzada diseñada específicamente para conectar cientos de miles de aceleradores de inteligencia artificial dentro de un ámbito de computación integrado y eficiente.

La compañía describió este sistema pionero como un enfoque que transforma todo el campus tecnológico en una única supercomputadora, reemplazando las redes tradicionales de los centros de datos públicos por un tejido de red diseñado con precisión para satisfacer las exigencias masivas y complejas de las operaciones de entrenamiento y ejecución de modelos avanzados de inteligencia artificial. Esta tendencia refleja un profundo reconocimiento de que la inteligencia artificial generativa y los grandes modelos de lenguaje requieren una infraestructura sin precedentes para operar con total eficiencia.

Una arquitectura de red tridimensional que mejora la flexibilidad

La nueva estructura divide las redes de los centros de datos en tres capas distintas e independientes, lo que permite una enorme flexibilidad en la gestión del flujo de información. La primera capa está dedicada a elevar el nivel de conectividad dentro de un mismo rack, mientras que la segunda actúa como un tejido dedicado a transferir datos de un acelerador a otro a través de los diferentes racks. La tercera capa es una interfaz frontal que se conecta a la red existente «Jupiter» de Google, garantizando así un acceso fluido al almacenamiento y a los recursos informáticos generales.

Este ingenioso diseño de ingeniería permite actualizar cada capa de forma independiente, evitando que todo el sistema sufra interrupciones o perturbaciones al actualizar o desarrollar uno de los componentes, lo que garantiza la continuidad de las operaciones y de los proyectos de investigación sin ningún parón costoso.

Reducción de la latencia y aislamiento eficiente de fallos

En esencia, este sistema avanzado se basa en conmutadores de alta capacidad vinculados a un diseño plano de dos capas que no obstruye el tráfico de datos, lo que según Google contribuye significativamente a reducir la latencia al disminuir el número de niveles de red en comparación con los diseños tradicionales anteriores.

Además, el diseño multinivel, que incluye dominios de control independientes, ofrece la ventaja de aislar los fallos de manera eficaz. Si se produce algún fallo de hardware dentro de un nivel, el problema se contiene inmediatamente para que todo el sistema no colapse y la avería no se propague al resto de las partes de la red interconectada.

Capacidad masiva para conectar procesadores

Utilizando sus nuevos chips «TPU v8e» [Nota: traducido como TPU 8T según el texto original], la avanzada red Virgo puede conectar unos 134 000 procesadores con un ancho de banda masivo de hasta 47 petabits por segundo dentro de un único tejido de red de un centro de datos. Al ampliar el alcance para incluir múltiples centros de datos en diferentes ubicaciones geográficas, esta asombrosa cifra aumenta a más de un millón de procesadores conectados en una gigantesca red de entrenamiento en la nube.

En cuanto a las configuraciones basadas en GPU de NVIDIA, el sistema admite hasta 80 000 procesadores gráficos en un solo sitio y llega hasta los 960 000 procesadores al interconectar varios sitios. Estas cifras reflejan el poder transformador positivo de este sistema para acelerar el entrenamiento de modelos gigantescos de inteligencia artificial.

Monitoreo preciso y rendimiento duplicado

Las estadísticas reveladas por la compañía indican que el nuevo sistema ofrece cuatro veces el ancho de banda por acelerador en comparación con la generación anterior, además de una reducción del 40 por ciento en la latencia. Las innovaciones no se limitan a esto, sino que la nueva arquitectura incluye tecnologías de medición precisa de datos vitales que operan en fracciones de milisegundo, junto con la detección automática de nodos de red lentos o que dejan de responder. Esta característica es crucial para proteger las tareas de entrenamiento de inteligencia artificial de fallos localizados que podrían desperdiciar miles de horas de computación.

Revisión integral de la infraestructura en la nube

Este anuncio se produjo como parte de un plan más amplio para renovar la infraestructura tecnológica presentado en la conferencia «Cloud Next 2026», cuyos eventos se extendieron del 22 al 24 de abril en el complejo Mandalay Bay. Además de la red, la compañía lanzó la octava generación de procesadores de inteligencia artificial, divididos en procesadores dedicados al entrenamiento («TPU 8T») y otros dedicados a la inferencia y ejecución («TPU 8I»).

  • Lanzamiento de innovaciones revolucionarias en el ámbito del almacenamiento en la nube «Managed Lustre».
  • Provisión de capacidades de producción para el almacenamiento de datos de hasta 10 terabytes por segundo.
  • Soporte ilimitado para gestionar los parámetros de los modelos de inteligencia artificial en constante expansión.

En una publicación técnica que explica los detalles del nuevo sistema, la compañía declaró con total claridad, citando:

«La era de la inteligencia artificial exige un replanteamiento radical de la infraestructura física de la computación en la nube y de las redes en particular».

Asimismo, la empresa enfatizó que, a medida que el tamaño de los modelos de inteligencia artificial crece exponencialmente, las redes tradicionales se enfrentan a puntos de colapso inevitables en cuanto a ancho de banda, velocidad de respuesta y capacidad para manejar los flujos masivos y concurrentes de datos que caracterizan a las operaciones de entrenamiento de inteligencia artificial a gran escala en la actualidad, lo que convierte a esta innovación en una necesidad urgente para anticiparse al futuro.

Preguntas frecuentes

¿Cuál es la tecnología destacada anunciada recientemente por Google Cloud?

La empresa anunció un sistema de red nuevo e innovador destinado a conectar cientos de miles de aceleradores de inteligencia artificial en un entorno informático integrado, funcionando este sistema como una supercomputadora conectada.

¿Cómo gestiona el nuevo sistema de red los fallos y problemas técnicos?

El sistema se basa en un diseño multinivel con dominios de control independientes, lo que permite aislar los fallos con total precisión en un solo nivel y evitar que se propaguen para afectar a otras partes de la red o del centro de datos.

¿Cuántos procesadores puede conectar el sistema al mismo tiempo?

El sistema puede conectar unos 134 000 procesadores en un solo centro de datos, y esta cifra supera la barrera del millón de procesadores al interconectar varios centros de datos en diferentes ubicaciones geográficas para crear una red de entrenamiento gigante.

¿Dónde y cuándo se anunciaron estas innovaciones tecnológicas?

Estas innovaciones se dieron a conocer durante la conferencia anual «Cloud Next 2026», celebrada en la ciudad de Las Vegas del 22 al 24 de abril.

شارك هذا الموضوع:

شارك هذا الموضوع:

اترك رد

Deja un comentario

الفئات

المنشورات الأخيرة

Discover more from Buzzinga

Subscribe now to keep reading and get access to the full archive.

Continue reading