Para llamadas compatibles con OpenAI, la comprensión de imágenes suele utilizar
chat/completions tanto con entrada de texto como de imagen. Los modelos disponibles dependen de las etiquetas de visión que se muestran en el catálogo de modelos.Casos de uso
- Control de calidad de captura de pantalla: explica la pantalla de una aplicación, la página de la consola, la captura de pantalla de error o la interfaz de usuario del producto.
- Extracción de documentos: extraiga monto, fecha, proveedor o campos de recibos y facturas.
- Revisión de productos y activos: identificar objetos, colores, estilo, composición y contexto de uso.
- Comprensión del gráfico: resuma la tendencia de un gráfico o explique las diferencias visuales.
Flujo de trabajo sugerido
1
Elige un modelo de visión
Filtre los modelos que admiten la entrada de imágenes y copie el nombre del modelo.
2
Preparar la entrada de imagen
Proporcione una URL de imagen accesible o datos de imagen Base64 según los requisitos del modelo.
3
Solicite un resultado específico
Dígale al modelo si necesita una descripción, comparación, extracción de campos o salida JSON.
ejemplo de API
Los ejemplos de cURL, Python y Node.js para la comprensión de imágenes se mantienen en Visión y generación de imágenes. Usangpt-5.4.
