Skip to main content
La comprensión de imágenes permite a un modelo leer imágenes y devolver texto. Puede enviar capturas de pantalla, fotografías, imágenes de productos, recibos, gráficos o borradores de diseño y luego pedirle al modelo que describa, compare, clasifique o extraiga información.
Para llamadas compatibles con OpenAI, la comprensión de imágenes suele utilizar chat/completions tanto con entrada de texto como de imagen. Los modelos disponibles dependen de las etiquetas de visión que se muestran en el catálogo de modelos.

Casos de uso

  • Control de calidad de captura de pantalla: explica la pantalla de una aplicación, la página de la consola, la captura de pantalla de error o la interfaz de usuario del producto.
  • Extracción de documentos: extraiga monto, fecha, proveedor o campos de recibos y facturas.
  • Revisión de productos y activos: identificar objetos, colores, estilo, composición y contexto de uso.
  • Comprensión del gráfico: resuma la tendencia de un gráfico o explique las diferencias visuales.

Flujo de trabajo sugerido

1

Elige un modelo de visión

Filtre los modelos que admiten la entrada de imágenes y copie el nombre del modelo.
2

Preparar la entrada de imagen

Proporcione una URL de imagen accesible o datos de imagen Base64 según los requisitos del modelo.
3

Solicite un resultado específico

Dígale al modelo si necesita una descripción, comparación, extracción de campos o salida JSON.
Para una extracción de campo confiable, combine la comprensión de la imagen con salida estructurada.

ejemplo de API

Los ejemplos de cURL, Python y Node.js para la comprensión de imágenes se mantienen en Visión y generación de imágenes. Usan gpt-5.4.

Próximos pasos