DeepSeek presentó una versión experimental de V4 Flash capaz de combinar instrucciones escritas con imágenes. El modelo está dirigido a desarrolladores y puede utilizarse para describir fotografías, interpretar gráficos y obtener información de capturas de pantalla.
¿Qué puede analizar?
El nuevo modelo se llama DeepSeek-V4-Flash-Vision-Exp. Su principal diferencia frente a la versión convencional de V4 Flash es la capacidad de analizar contenido visual junto con una pregunta o instrucción escrita.
Por ejemplo, una aplicación podría enviar una captura de pantalla y pedir una explicación de los elementos visibles. También podría entregar un gráfico para solicitar un resumen o una fotografía para obtener una descripción general.
DeepSeek afirma que el modelo mantiene capacidades de texto similares a V4 Flash y mejora su desempeño en tareas de agentes que requieren comprensión visual. Estas comparaciones proceden de evaluaciones de la propia compañía y pueden variar según cada uso.
Tres formas de enviar imágenes
Los desarrolladores pueden incluir una imagen directamente en la solicitud, proporcionar una dirección pública para que DeepSeek la descargue o cargar el archivo previamente para reutilizarlo mediante su identificador.
Estas opciones permiten trabajar tanto con imágenes locales como con archivos disponibles en internet o almacenados previamente en la plataforma.
Formatos compatibles
El modelo admite imágenes JPEG, PNG, GIF y WebP. DeepSeek revisa el contenido real del archivo para reconocer su formato, en lugar de depender únicamente de la extensión de su nombre.
La documentación reconoce archivos GIF, aunque no confirma que el modelo analice toda la animación como si fuera un video. Por eso, la compatibilidad con GIF no debe confundirse con análisis de secuencias audiovisuales completas.
Comprende imágenes, pero no las genera
DeepSeek-V4-Flash-Vision-Exp está diseñado para comprender imágenes. La documentación oficial no lo presenta como un generador ni como una herramienta para editar fotografías.
Tampoco significa que reconocerá perfectamente todos los textos, gráficos o elementos de una imagen. Los resultados pueden variar según la calidad del archivo, su resolución y la claridad de la instrucción.
Disponibilidad experimental
El modelo ya puede utilizarse mediante la API de DeepSeek con el identificador deepseek-v4-flash-vision-exp.
Su nombre termina en Exp porque continúa en fase experimental. Sus capacidades, límites y forma de acceso pueden cambiar antes de que DeepSeek publique una versión estable. Las fuentes oficiales no confirman que la función esté habilitada automáticamente en todas las cuentas de las aplicaciones web o móvil.



