> ## Documentation Index
> Fetch the complete documentation index at: https://docs.moxus.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Respuestas en streaming

> Transmite la salida del modelo de forma incremental en lugar de esperar la respuesta completa.

El streaming devuelve la salida del modelo en pequeños fragmentos a medida que se genera. Úsalo para interfaces de chat, generación de contenido extenso, registros de agentes y cualquier flujo de trabajo en el que los usuarios deban ver el progreso de inmediato.

## Habilitar el streaming

Configura `stream` como `true` en el cuerpo de la solicitud:

```json theme={null}
{
  "model": "gpt-5.4-mini",
  "messages": [{"role": "user", "content": "Write a short poem about spring."}],
  "stream": true
}
```

## Formato de la respuesta

Las respuestas en streaming usan eventos enviados por el servidor (server-sent events). Cada evento comienza con `data:` y contiene un fragmento parcial de la finalización:

```text theme={null}
data: {"id":"chatcmpl-xxx","object":"chat.completion.chunk","choices":[{"index":0,"delta":{"role":"assistant","content":""},"finish_reason":null}]}

data: {"id":"chatcmpl-xxx","object":"chat.completion.chunk","choices":[{"index":0,"delta":{"content":"Spring"},"finish_reason":null}]}

data: {"id":"chatcmpl-xxx","object":"chat.completion.chunk","choices":[{"index":0,"delta":{"content":" arrives"},"finish_reason":null}]}

data: {"id":"chatcmpl-xxx","object":"chat.completion.chunk","choices":[{"index":0,"delta":{},"finish_reason":"stop"}]}

data: [DONE]
```

Puntos clave:

* El texto incremental está en `choices[0].delta.content`.
* Concatena todos los valores de `delta.content` en orden para construir la respuesta final.
* El último fragmento normal incluye un `finish_reason` como `stop`.
* El stream termina con `data: [DONE]`.

## Ejemplo con cURL

`-N` deshabilita el almacenamiento en búfer de la salida de cURL para que cada fragmento SSE aparezca en cuanto llega. Reemplaza `sk-your-key` en el comando con tu clave real.

```bash theme={null}
curl -N https://moxus.ai/v1/chat/completions \
  -H "Authorization: Bearer sk-your-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.4-mini",
    "messages": [{"role": "user", "content": "Write a short poem about spring."}],
    "stream": true
  }'
```

## Ejemplo en Python

Reemplaza `sk-your-key` en `API_KEY` con tu clave real, luego itera sobre el stream devuelto:

```python theme={null}
import httpx
from openai import OpenAI

API_KEY = "sk-your-key"

client = OpenAI(
    api_key=API_KEY,
    base_url="https://moxus.ai/v1",
    # Connect directly to Moxus AI without reading system or terminal proxy variables.
    http_client=httpx.Client(trust_env=False, timeout=60.0),
)

for chunk in client.chat.completions.create(
    model="gpt-5.4-mini",
    messages=[{"role": "user", "content": "Write a short poem about spring."}],
    stream=True,
    # Optional: receive token usage in the final chunk. Remove stream_options when it is not needed or unsupported.
    stream_options={"include_usage": True},
):
    if chunk.usage:
        print(f"\nUsage: {chunk.usage}")
    if not chunk.choices:
        continue
    delta = chunk.choices[0].delta.content or ""
    print(delta, end="", flush=True)

print()
```

## Ejemplo en Node.js

Reemplaza `sk-your-key` en `API_KEY` con tu clave real:

```javascript theme={null}
import OpenAI from "openai";

const API_KEY = "sk-your-key";

const client = new OpenAI({
  apiKey: API_KEY,
  baseURL: "https://moxus.ai/v1",
});

const stream = await client.chat.completions.create({
  model: "gpt-5.4-mini",
  messages: [{ role: "user", content: "Write a short poem about spring." }],
  stream: true,
  // Optional: receive token usage in the final chunk. Remove stream_options when it is not needed or unsupported.
  stream_options: { include_usage: true },
});

for await (const chunk of stream) {
  if (chunk.usage) {
    console.log("\nUsage:", chunk.usage);
  }
  const delta = chunk.choices[0]?.delta?.content || "";
  process.stdout.write(delta);
}
```

## Cuándo usar streaming

| Escenario                                | Recomendación                                                      |
| ---------------------------------------- | ------------------------------------------------------------------ |
| UI de chat o asistente interactivo       | Usar streaming                                                     |
| Artículos largos, informes o resúmenes   | Usar streaming                                                     |
| Procesamiento por lotes en segundo plano | Sin streaming es más simple                                        |
| Análisis JSON estricto                   | Transmite solo si concatenas y analizas después de la finalización |

## Próximos pasos

* [Llamado a funciones](/es/guide/function-calling)
* [Salida estructurada](/es/guide/structured-output)
