Modelos / SEÑAL VERIFICADA
DeepSeek V4-Flash es el modelo de crecimiento más rápido en Ollama
Ollama amplía capacidad en EE.UU. y Europa tras confirmar que DeepSeek-V4-Flash-0731 es su modelo de mayor crecimiento en uso de tokens, a más de 100 tokens por segundo y sin retención de datos.

El precio de DeepSeek V4-Flash, de 0,28 dólares por millón de tokens de salida, ya sugería que la economía de correr agentes en producción estaba cambiando. La demanda parece haberle dado la razón a esa lectura, y quien lo confirma es una plataforma de terceros, no la propia DeepSeek.
Ollama publicó el 4 de agosto que DeepSeek-V4-Flash-0731 es el modelo de crecimiento más rápido en uso de tokens en toda su historia, y que por eso está ampliando capacidad en Estados Unidos y Europa. Los datos que acompañan el anuncio:
- Más de 100 tokens por segundo en la plataforma.
- Cero retención de datos, las consultas no se guardan.
- Se ejecuta con ollama run deepseek-v4-flash:0731-cloud.
DeepSeek-V4-Flash es una vista previa de la serie V4, un modelo de expertos mezclados (Mixture-of-Experts, MoE) de 284 mil millones de parámetros totales con 13 mil millones activos, pensado para razonamiento eficiente sobre una ventana de contexto de 1 millón de tokens. Ofrece tres modos de razonamiento: sin pensamiento, pensamiento y máximo pensamiento.
El detalle de la retención importa tanto como la velocidad. Buena parte de la resistencia a usar modelos baratos en trabajo real no viene de la calidad, sino de dónde terminan los datos, sobre todo en equipos que tocan código de clientes. Una plataforma que corre el modelo en la nube sin guardar las consultas responde a esa objeción sin obligar a montar hospedaje propio (self-hosting).
Conviene leer el anuncio en su marco: Ollama informa sobre su propio tráfico y no publicó cifras absolutas de tokens ni comparación con otros modelos de su catálogo. Es un indicador de dirección, no una medición independiente del mercado.
Para quien corre agentes desde LATAM, la combinación de un precio de salida de 0,28 dólares por millón de tokens, más de 100 tokens por segundo y cero retención de datos en una plataforma que escala capacidad cambia el cálculo de qué modelo usar en producción. DeepSeek advierte además que adoptará pronto precios de hora pico, con un recargo del doble en ciertas franjas de Beijing, un matiz que conviene vigilar al proyectar costos.
Para más detalles:
