La disponibilidad multimodal depende del modelo seleccionado y de las restricciones de la clave API. Verifique las etiquetas de capacidad del modelo en el catálogo de modelos antes de llamar a un modelo.
Comprensión de imágenes
Lea imágenes para obtener descripciones, reconocimiento, comparaciones, extracción y control de calidad visual.
Generación de imágenes
Genere imágenes a partir de indicaciones o edite imágenes existentes con modelos compatibles.
archivos PDF
Utilice documentos para resúmenes, control de calidad, extracción de campos y resultados estructurados.
Archivos de rebajas
Agregue archivos README, documentos, registros de cambios y notas como contexto de texto en conversaciones o llamadas API.
Cómo elegir un módulo
Comience desde el tipo de entrada. Utilice la comprensión de imágenes para fotografías y capturas de pantalla, la generación de imágenes para la creación visual, archivos PDF para flujos de trabajo de documentos y archivos Markdown para documentos de texto legibles, como archivos README, notas y registros de cambios. Cuando necesite datos posteriores predecibles, combine el módulo con resultados estructurados.Archivos de rebajas
La conversación admite cargas directas de.md y .markdown. En llamadas API, lea el contenido de Markdown y colóquelo en messages.content; el modelo lo recibe como contexto de texto normal.
