Patrones de procesamiento
Documentos cortos
Extrae el texto y pásalo directamente como contexto cuando el documento sea corto y esté bien estructurado.
Documentos largos
Divide por sección, página o fragmento de contenido para que la información sea más fácil de ubicar y referenciar en una conversación.
Flujo de trabajo sugerido
1
Extrae el texto y las referencias de página
Conserva los encabezados, los números de página y el contexto de las tablas para que las respuestas puedan citar su fuente.
2
Divide los documentos largos en fragmentos
Divide los PDF grandes por tema o rango de páginas para evitar enviar contexto no relacionado.
3
Elige un formato de salida
Usa prosa para resúmenes, JSON para extracción y tablas Markdown para limpieza de tablas.
Ejemplo de API
Para las llamadas a la API, un enfoque común es extraer primero el texto del PDF en tu backend y luego incluir el contenido relevante enmessages.content. Los ejemplos a continuación leen contract.pdf, lo resumen y extraen campos clave.
Coloca el PDF en la raíz del proyecto: la carpeta que contiene el archivo .py o .mjs y desde donde ejecutas el comando. PDF_PATH = "contract.pdf" es el nombre de archivo que se debe leer. Si tu archivo se llama invoice.pdf, cámbialo a PDF_PATH = "invoice.pdf". El nombre, la extensión y las mayúsculas/minúsculas deben coincidir exactamente con el archivo. Usa la ruta local completa cuando el archivo esté fuera de la raíz del proyecto. No subes el PDF por separado: el código lee el archivo y envía su texto extraído en la solicitud.
PdfReader no viene incorporado en Python. Se importa desde el paquete pypdf. En el ejemplo de Node.js, PDFParse se importa desde pdf-parse. Python y Node.js usan gestores de paquetes diferentes: ejecuta el siguiente comando en la carpeta de tu proyecto para Python; para Node.js, elige npm o pnpm.
El ejemplo de Python requiere
openai y pypdf. Si py no está disponible en Windows, usa python -m pip install openai pypdf. El ejemplo de Node.js requiere openai y pdf-parse instalados mediante npm o pnpm. Si el PDF es un documento escaneado, ejecuta OCR antes de enviar el texto extraído.