Modelos / SEÑAL VERIFICADA
DeepSeek lanza V4-Flash-Vision-Exp, multimodal para agentes
DeepSeek publicó V4-Flash-Vision-Exp en su plataforma de API: mantiene las capacidades de texto y agentes de V4-Flash, suma visión con imágenes tokenizadas a 384 tokens cada una, y llegó junto a una Files API gratuita. DeepSeek Harness 0.1.1 ya lo soporta.

El costo de agregar ojos a un agente acaba de bajar. DeepSeek lanzó V4-Flash-Vision-Exp, la variante experimental multimodal de su modelo económico, disponible desde hoy en su plataforma de API con el identificador deepseek-v4-flash-vision-exp. La promesa de la empresa es directa: no perder nada en texto y ganar entrada de imágenes para los flujos agénticos.
Según el anuncio oficial, el modelo mantiene las capacidades de V4-Flash en texto, incluidos agentes, razonamiento y conocimiento general. El salto está en los benchmarks agénticos multimodales, donde DeepSeek afirma que V4-Flash-Vision-Exp se acerca al rendimiento de Opus 4.8 de Anthropic. Al ser un anuncio del propio proveedor y un modelo experimental, la comparación queda por verificar con evaluaciones independientes.
Lo operativo para quien construye agentes:
- Facturación por imagen tokenizada: cada imagen cuesta hasta 384 tokens, al mismo precio de V4-Flash.
- Entrada mixta: acepta texto e imagen juntos, vía base64, URLs externas o la Files API.
- Compatibilidad: funciona con Chat Completions, Messages y Responses, y la empresa reporta operación sin fricción con los frameworks de agentes existentes.
- Files API: el servicio para subir una imagen una vez y reutilizarla por
file_iden peticiones posteriores es gratuito y salió junto con el modelo.
El mismo día, DeepSeek publicó DeepSeek Harness 0.1.1 con soporte directo para el nuevo modelo, así que probarlo dentro de ese entorno no requiere configuración adicional. Para los equipos que ya corren agentes con V4-Flash por precio, la pregunta ahora es cuántos flujos ganan realmente con visión a ese costo marginal.
Fuentes utilizadas:
