La capacidad del modelo Flash para activar tan solo 16.000 millones de parámetros de un total de 552.000 millones otorga a los desarrolladores una eficiencia operativa fantástica que rompe las ecuaciones de coste tradicionales.
Índice del artículo:
- Salto rápido al sexto puesto mundial en 72 horas
- Arquitectura de mezcla de expertos y reducción de parámetros activos
- Ventana de contexto de un millón de tokens y reingeniería de la memoria caché
- Dominio de los modelos chinos por vigésima semana consecutiva
- Resultados de las pruebas de rendimiento y superioridad en visión artificial
- Desafíos de inferencia y ausencia de directrices de memoria RAM
- Preguntas frecuentes
Salto rápido al sexto puesto mundial en 72 horas
La empresa emergente china DeepSeek lanzó su nuevo modelo multimodal «V4.1 Flash» el pasado 10 de septiembre, un sistema inteligente construido sobre la arquitectura de «mezcla de expertos» que cuenta con 552.000 millones de parámetros informáticos en su estructura base, aunque solo activa una parte minúscula de ellos durante la inferencia y el procesamiento de instrucciones, marcando un cambio radical en cómo los grandes modelos de lenguaje equilibran la enorme escala con la eficiencia operativa.
En apenas tres días desde su lanzamiento oficial, el modelo escaló hasta la sexta posición mundial en el volumen total de consumo de tokens a través de la reconocida plataforma internacional OpenRouter, según datos de la plataforma de seguimiento financiero Gilonghui, lo que demuestra la abrumadora aceptación comercial por parte de desarrolladores y empresas hacia sus servicios económicos.
Arquitectura de mezcla de expertos y reducción de parámetros activos
El nuevo modelo reemplaza oficialmente a las versiones anteriores de DeepSeek, «V4 Flash» y «V4 Flash Vision», de modo que todas las solicitudes de programación a través de las API se dirigen ahora automáticamente a la versión actualizada. A partir del 14 septiembre, la compañía también comenzó a redirigir temporalmente todas las peticiones del modelo «V4 Pro» hacia V4.1 Flash, facturando a los clientes con las tarifas más económicas del nuevo modelo hasta la llegada de la variante «V4.1 Pro».
El modelo se basa en una arquitectura de codificador y decodificador causal; a pesar de su gran tamaño total de 552.000 millones de parámetros, su diseño inteligente activa solo 8.000 millones de parámetros al procesar textos de entrada y 16.000 millones al generar respuestas y salidas, en comparación con los 13.000 millones de parámetros activos de la versión anterior, que contaba con un total de 284.000 millones.
Ventana de contexto de un millón de tokens y reingeniería de la memoria caché
El modelo admite una enorme ventana de contexto de conocimiento que abarca hasta un millón de tokens completos, utilizando un sistema de memoria caché completamente rediseñado que almacena unos 890 bytes por token, lo que representa una cuarta parte de la huella de tamaño que la versión anterior consumía en la memoria de vídeo de las tarjetas gráficas.
Para las empresas y organizaciones que gestionan cargas de trabajo computacionales masivas y flujos de datos ininterrumpidos, esta drástica reducción en el consumo de memoria podría resultar mucho más importante y atractiva que una simple mejora en los resultados de las pruebas teóricas. La compañía ha publicado los pesos del modelo de forma gratuita en la plataforma Hugging Face bajo la licencia de código abierto MIT.
Dominio de los modelos chinos por vigésima semana consecutiva
El consumo total mundial de tokens de inteligencia artificial alcanzó los 127 billones durante la semana del 7 al 13 de septiembre, lo que supone un incremento superior al 10 por ciento respecto a la semana anterior. Los modelos de IA chinos acapararon aproximadamente 61,17 billones de tokens, manteniendo su supremacía sobre los modelos estadounidenses por vigésima semana consecutiva.
El modelo V4.1 Flash registró un consumo de 4,94 billones de tokens en sus primeros tres días, mientras que el modelo «MiMo V2.5» de Xiaomi subió un 230 por ciento para situarse en el quinto puesto. En un contexto relacionado, Alibaba Cloud lanzó el 13 de septiembre su plataforma alojada para el modelo a través de interfaces de programación integradas con las herramientas de desarrollo Coder y Codex.
Resultados de las pruebas de rendimiento y superioridad en visión artificial
En su máxima capacidad de inferencia y razonamiento lógico, el V4.1 Flash obtuvo resultados sobresalientes al registrar 74,2 puntos en el test DeepSWE, 90,6 puntos en TerminalBench y 88,1 puntos en la prueba de ciberseguridad CyberGym, según las evaluaciones oficiales de DeepSeek.
Asimismo, el modelo demostró capacidades visuales multimodales avanzadas, registrando 95,6 puntos en la prueba de lectura y comprensión de documentos ilustrados DocVQA y 56.5 puntos en la compleja prueba de comprensión visual MMU Pro, lo que lo convierte en un competidor feroz frente a los modelos de pago más potentes a nivel mundial.
Desafíos de inferencia y ausencia de directrices de memoria RAM
A pesar de estos avances, el V4.1 Flash se queda atrás respecto a su hermano mayor, el V4 Pro, en ciertos parámetros de razonamiento lógico profundo, obteniendo 45,2 puntos en el test de contexto largo LongBench 2 en comparación con los 51,5 puntos del modelo de mayor tamaño.
Del mismo modo, DeepSeek ha recibido críticas por no haber publicado los requisitos necesarios de memoria de vídeo, los estándares de velocidad de inferencia instantánea ni las directrices sobre el tamaño de los lotes para su ejecución local, lo que deja la carga de la planificación de ingeniería y las pruebas de despliegue sobre los propios hombros de los desarrolladores para descubrir los límites operativos del modelo.
Preguntas frecuentes
Pregunta: ¿En qué arquitectura de programación se basa el modelo DeepSeek V4.1 Flash?
Respuesta: Se basa en la arquitectura de mezcla de expertos con un tamaño de 552.000 millones de parámetros, activando únicamente 16.000 millones para generar respuestas con una eficiencia superior.
Pregunta: ¿Qué posición global alcanzó el modelo tras tres días desde su lanzamiento oficial?
Respuesta: Ascendió al sexto puesto mundial en volumen de consumo de tokens en la plataforma OpenRouter, con un consumo cercano a los 5 billones de tokens.
Pregunta: ¿Cómo redujo el nuevo modelo el consumo de memoria de las tarjetas gráficas en comparación con las versiones anteriores?
Respuesta: Rediseñó la memoria caché para consumir 890 bytes por token, es decir, una cuarta parte del tamaño que utilizaba la generación anterior.