> ## Documentation Index
> Fetch the complete documentation index at: https://docs.moxus.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Comprensión de imágenes

> Utilice modelos con capacidad visual para leer imágenes, responder preguntas, comparar contenido y extraer información estructurada.

La comprensión de imágenes permite a un modelo leer imágenes y devolver texto. Puede enviar capturas de pantalla, fotografías, imágenes de productos, recibos, gráficos o borradores de diseño y luego pedirle al modelo que describa, compare, clasifique o extraiga información.

<Info>
  Para llamadas compatibles con OpenAI, la comprensión de imágenes suele utilizar `chat/completions` tanto con entrada de texto como de imagen. Los modelos disponibles dependen de las etiquetas de visión que se muestran en el catálogo de modelos.
</Info>

## Casos de uso

* Control de calidad de captura de pantalla: explica la pantalla de una aplicación, la página de la consola, la captura de pantalla de error o la interfaz de usuario del producto.
* Extracción de documentos: extraiga monto, fecha, proveedor o campos de recibos y facturas.
* Revisión de productos y activos: identificar objetos, colores, estilo, composición y contexto de uso.
* Comprensión del gráfico: resuma la tendencia de un gráfico o explique las diferencias visuales.

## Flujo de trabajo sugerido

<Steps>
  <Step title="Elige un modelo de visión">
    Filtre los modelos que admiten la entrada de imágenes y copie el nombre del modelo.
  </Step>

  <Step title="Preparar la entrada de imagen">
    Proporcione una URL de imagen accesible o datos de imagen Base64 según los requisitos del modelo.
  </Step>

  <Step title="Solicite un resultado específico">
    Dígale al modelo si necesita una descripción, comparación, extracción de campos o salida JSON.
  </Step>
</Steps>

<Tip>
  Para una extracción de campo confiable, combine la comprensión de la imagen con [salida estructurada](/es/guide/structured-output).
</Tip>

## ejemplo de API

Los ejemplos de cURL, Python y Node.js para la comprensión de imágenes se mantienen en [Visión y generación de imágenes](/es/guide/vision-and-image#image-understanding). Usan `gpt-5.4`.

## Próximos pasos

* [Visión y generación de imágenes](/es/guide/vision-and-image#image-understanding)
* [Salida estructurada](/es/guide/structured-output)
