El proyecto de modelos de mundo representa la máxima prioridad de ByteDance para 2026, respaldado por enormes presupuestos de entrenamiento y un cambio fundamental hacia la computación en la nube visual.
Índice del artículo:
- Supervisión personal directa de Zhang Yiming
- Generación de mundos en la nube para las gafas Pico
- La apuesta estratégica de ByteDance por el video
- Presupuestos excepcionales y competencia con el modelo Genie
- El desafío de hardware dirigido a Meta y Apple
- Financiación bancaria y el futuro de la plataforma Seedance
- Preguntas frecuentes
Supervisión personal directa de Zhang Yiming
Fuentes cercanas informaron a la agencia Bloomberg que el multimillonario chino Zhang Yiming, fundador de ByteDance —la empresa matriz de TikTok—, supervisa personalmente el desarrollo de un sistema revolucionario de inteligencia artificial clasificado como «modelo de mundo». Este sistema cuenta con la capacidad de generar video espacial instantáneo en tiempo real, con expectativas de un posible lanzamiento oficial tan pronto como el próximo mes.
El nuevo proyecto se basa en el actual sistema de generación de video de la compañía conocido como «Seedance», y permitirá a los usuarios y creadores de contenido generar mundos virtuales totalmente interactivos destinados a transmisiones en directo, series cortas y videojuegos. Esta iniciativa sitúa a la empresa china en competencia directa con Meta y Alphabet en este terreno tecnológico virgen, cuyo objetivo es simular entornos físicos en respuesta a las acciones del usuario.
Generación de mundos en la nube para las gafas Pico
Zhang coordina los esfuerzos en las distintas divisiones de negocio de ByteDance, movilizando recursos masivos de potencia de cálculo e inteligencia artificial para llevar a buen puerto el proyecto, aunque las fuentes recalcan que el cronograma está sujeto a cambios según los resultados de las pruebas técnicas. El modelo está dirigido principalmente a los usuarios de las gafas «Pico», la filial de hardware de realidad extendida y virtual de la compañía, generando mundos tridimensionales que interactúan de forma inmediata con la voz y los movimientos de quien lleva el dispositivo.
Las especificaciones filtradas indican que el sistema es capaz de transmitir video interactivo a una tasa cercana a los 20 fotogramas por segundo y con una latencia ultrabaja de apenas 0,05 segundos. La innovación fundamental radica en realizar los procesos de renderizado y procesamiento gráfico en servidores en nube en lugar de procesar los datos de manera local en los visores, lo que reduce los requisitos de potencia informática en los dispositivos y contribuye a abaratarlos para los consumidores, desplazando la competencia desde las especificaciones de hardware hacia la potencia de los modelos, la infraestructura y la distribución de contenidos.
La apuesta estratégica de ByteDance por el video
Esta tendencia refleja un giro estratégico global por parte de ByteDance en el sector de la inteligencia artificial. El medio tecnológico 36Kr informó a principios de este año que ByteDance catalogó los modelos de mundo como su máxima prioridad para 2026, asignando un presupuesto para datos de entrenamiento que supera las ocho cifras en yuanes chinos, lo que equivale a entre tres y cuatro veces lo que gastan sus competidores directos.
Los resultados de las pruebas internas iniciales a principios de 2026 señalaron que la compañía se encuentra apenas un 10 por ciento por detrás de los estándares internacionales líderes, tomando como referencia de comparación y evaluación el modelo «Genie» desarrollado por Google.
Presupuestos excepcionales y competencia con el modelo Genie
Bloomberg situó la implicación directa de Zhang Yiming en sintonía con las visiones de destacados científicos de la inteligencia artificial como la doctora Fei-Fei Li y el profesor Yann LeCun, quienes sostienen que los modelos fundamentados en la percepción visual y física constituyen la senda real para construir sistemas inteligentes capaces de interactuar con el mundo real.
El equipo de investigación «Seed» de ByteDance pavimentó el camino hacia este momento mediante una serie de lanzamientos consecutivos, destacando la presentación de la actualización «Seedance 2.5» en julio pasado, la cual dotó al sistema de la capacidad de generar clips de audio y video sincronizados de 30 segundos en un solo intento, con controles espaciales y de cámara notablemente mejorados.
El desafío de hardware dirigido a Meta y Apple
El enfoque de procesamiento en la nube adoptado por ByteDance plantea un reto indirecto para Meta y Apple, firmas que han invertido decenas de miles de millones de dólares en el desarrollo de costosos y complejos visores de realidad mixta y virtual sin lograr hasta la fecha una adopción masiva generalizada.
En lugar de competir en la precisión del hardware interno y en auriculares costosos, ByteDance busca proporcionar contenido espacial de máxima calidad a través de dispositivos de bajo coste alimentados directamente por centros de datos centralizados, lo que podría permitirle romper las barreras de adopción masiva en los mercados globales.
Financiación bancaria y el futuro de la plataforma Seedance
Como respaldo a esta ambiciosa visión, ByteDance obtuvo la semana pasada un préstamo bancario por valor de 30 000 millones de dólares y estudia destinar gastos de capital e inversión de hasta 70 000 millones de dólares para construir su infraestructura y ampliar sus servidores de inteligencia artificial. Aplicaciones populares como la herramienta de edición CapCut y el asistente inteligente chino Doubao dependen del motor Seedance, que se ha consolidado también como una utilidad preferida por estudios de cine independientes y creadores de contenido digital en todo el mundo.
Preguntas frecuentes
Pregunta: ¿Qué es el modelo de mundo que desarrolla ByteDance?
Respuesta: Es un modelo de inteligencia artificial que genera entornos y videos espaciales interactivos en tiempo real en respuesta a las entradas, voces y movimientos del usuario.
Pregunta: ¿Por qué confía ByteDance en el procesamiento en la nube en lugar de hacerlo dentro de las gafas?
Respuesta: Se apoya en la nube para reducir el consumo de hardware, abatir el coste de las gafas Pico y hacer que la tecnología esté ampliamente disponible con un retraso inferior a 0,05 segundos.
Pregunta: ¿Cuál es el volumen de inversiones que ByteDance destina a su infraestructura de inteligencia artificial?
Respuesta: La compañía obtuvo un préstamo de 30 000 millones de dólares y contempla inyectar inversiones de capital de hasta 70 000 millones de dólares para ampliar su infraestructura.