Krzysztof Śmiałowski / Software & AI
Sobre mí Noticias Chat AI ↗ Contacto

← Todas las noticias

DeepSeek lanza V4.1 Flash - un millón de tokens de contexto, imágenes y precios decenas de veces más bajos que los de Anthropic

10 septiembre 2026

Este artículo ha sido creado con una solución que, bajo supervisión humana, orquesta una granja de modelos de IA para tareas como la investigación, la verificación, la corrección y la traducción.

DeepSeek lanza V4.1 Flash - un millón de tokens de contexto, imágenes y precios decenas de veces más bajos que los de Anthropic

Cada lanzamiento de DeepSeek sigue el mismo guion. La empresa enseña gráficos en los que su modelo supera a OpenAI y Anthropic, y luego todo internet se pasa unos días comprobando cuánto hay de cierto. Hoy, 10 de septiembre, DeepSeek ha publicado V4.1 Flash - el modelo más pequeño de la nueva familia V4.1 y, como escribió en X el investigador de la empresa Zizheng Pan, «nuestro primer modelo insignia con soporte multimodal nativo». Los pesos están en Hugging Face bajo licencia MIT, así que cualquiera puede ejecutar el modelo por su cuenta. La publicación de DeepSeek en X acumulaba 3,4 millones de visualizaciones tras doce horas.

Las cifras impresionan sobre todo por el contraste. El modelo tiene 552 000 millones de parámetros en una arquitectura mixture of experts, pero en cada token se activan solo 8000 millones al leer la entrada y 16 000 millones al generar la respuesta - DeepSeek lo llama diseño asimétrico Causal Encoder-Decoder. A eso se suman 196 000 millones de parámetros de memoria Engram, que pueden alojarse en un SSD convencional. El contexto es de un millón de tokens, varios libros gruesos a la vez, y una respuesta puede llegar a 384 000 tokens. La caché KV ocupa 890 bytes por token, la cuarta parte que en el Flash anterior, y de ahí viene en buena parte el bajo coste de las conversaciones largas. Los usuarios de Hacker News miden en la API entre 250 y 400 tokens por segundo.

Precios en horas valle: 0,02 RMB por millón de tokens de entrada leídos de la caché, 1 RMB por la entrada normal y 4 RMB por la salida - unos 0,15 y 0,60 dólares. En horas punta, de lunes a viernes de 9:00 a 12:00 y de 14:00 a 18:00 hora de Pekín (de 3:00 a 6:00 y de 8:00 a 12:00, hora peninsular española), las tarifas se duplican. A modo de comparación, Claude Fable 5 cuesta 10 dólares por millón de tokens de entrada y 50 dólares por millón de salida, así que en horas valle DeepSeek es 66 y 83 veces más barato, respectivamente. Donde mejor se ve es en las tareas agénticas largas. El usuario k9294 recalculó en Hacker News el consumo de tokens de una sola sesión de programación (447 turnos, 36,5 millones de tokens leídos de la caché) con las tarifas de ambos modelos: 55 dólares a precios de GPT-6 Astra, entre 36 y 73 centavos a precios de V4.1 Flash. Otro usuario, mmastrac, procesó 2100 millones de tokens con la versión preview en dos días y pagó 22 dólares.

Artificial Analysis calculó en agosto que una sola tarea de su batería de pruebas costaba 3 centavos en el V4 Flash anterior y 3,15 dólares en Fable 5, más de cien veces más. Solo que ese cálculo se apoyaba todavía en los precios antiguos, más bajos, de DeepSeek. Las primeras pruebas independientes del nuevo modelo aparecieron en X en cuestión de horas. Paweł Huryn dio a 23 modelos dos repositorios con 105 errores ocultos que corregir. Resultados seleccionados: GPT-5.6 Luna (max) corrigió 33 por 1,80 dólares, Claude Opus 5 (max) 27 por 51,33 dólares, Grok 4.6 (xhigh) 27 por 16,96 dólares, DeepSeek V4.1 Flash (max) 24 por 1,08 dólares. El mencionado mmastrac resumió tras dos días de trabajo: «algo por encima de Opus 4.8, no del todo Opus 5, no Fable».

¿Y qué hay de «vencer a OpenAI y Anthropic»? En la tabla de DeepSeek en Hugging Face, el nuevo modelo supera a Claude Opus 5 en DeepSWE (74,2 frente a 74,0), Terminal-Bench 2.1 y AutomationBench, pero pierde en GPQA Diamond (90,9 frente a 93,4), Terminal-Bench 3.0 (30,0 frente a 43,3) y Humanity's Last Exam sin herramientas (36,8 frente a 56,3). En la última versión del Intelligence Index independiente, publicada el 7 de septiembre, el V4 Flash anterior tiene 35 puntos, el V4 Pro de agosto 36, mientras que Claude Opus 5 tiene 51, Fable 5 50 y GPT-5.6 Sol 47. Artificial Analysis todavía no ha medido V4.1 Flash. Es más honesto hablar de la mejor relación calidad-precio que de un modelo mejor. Aunque con semejante diferencia de precio todavía hay mucho de qué hablar.

También hay otra cara. El V4 Flash anterior tenía 284 000 millones de parámetros; el nuevo tiene casi el doble. «Ya no es realmente flash», escribió el usuario de Hacker News revolvingthrow, y otro, petu, estimó que para una velocidad útil en casa hacen falta unos 384 GB de memoria, es decir, tres equipos Nvidia Spark o cuatro tarjetas RTX Pro 6000. Otros respondieron que flash significa velocidad, no tamaño, y que este modelo es el doble de rápido que su predecesor. Ambas partes tienen razón - el modelo simplemente ya no cabe en un portátil.

Un detalle interesante del aviso a los clientes de la API: a partir del 14 de septiembre (6:00, hora peninsular) todas las peticiones a V4 Pro se redirigirán a V4.1 Flash y se facturarán a tarifas Flash. DeepSeek escribe que las pruebas realizadas por diversos terceros dieron ventaja al nuevo modelo, más pequeño, sobre el antiguo buque insignia en resultados, coste, velocidad y tiempo de ejecución total. V4.1 Pro llegará más adelante, sin fecha. El modelo ya es compatible con Tencent (WorkBuddy, CodeBuddy) y OpenCode.

Conviene tener presente el calendario. En mayo DeepSeek anunció que la rebaja del 75 % en el precio de V4 Pro sería permanente. A mediados de agosto subió los precios entre un 50 y un 1100 %, introdujo tarifas punta y valle y puso V4 Pro a unas tres veces la tarifa de Flash. Según las informaciones, la empresa está captando unos 8000 millones de dólares con una valoración de 74 000 millones de dólares, prepara su salida a bolsa en el STAR Market de Shanghái, construye centros de datos y diseña sus propios chips. La rebaja de hoy es del 32 % en la entrada, del 57 % en la caché y del 9 % en la salida, y las acciones de MiniMax cayeron en Hong Kong un 9 %, las de Z.ai un 10 % y las de Alibaba más de un 3 %. Ser «el más barato» es, por tanto, un concepto relativo - y depende de la hora del día.

Mixture of experts (MoE) - una arquitectura en la que el modelo se compone de muchas subredes especializadas («expertos») y en cada token activa solo unas pocas. Gracias a ello el modelo puede ser enorme y procesar con tanta rapidez y a tan bajo coste como un modelo decenas de veces más pequeño. Caché KV - el lugar donde el modelo guarda el contenido ya procesado de la conversación para no recalcularlo con cada palabra nueva; cuanto más pequeña sea por token, más baratas salen las sesiones largas.