Formato de la respuesta
Semantara devuelve las respuestas en el formato de OpenAI. Tu código existente las procesa sin cambios.
{ "id": "chatcmpl-...", "object": "chat.completion", "created": 1700000000, "model": "gpt-4o-mini", "choices": [ { "index": 0, "message": { "role": "assistant", "content": "..." }, "finish_reason": "stop" } ], "usage": { "prompt_tokens": 24, "completion_tokens": 112, "total_tokens": 136 }}El contenido está en choices[0].message.content. El campo model refleja el modelo que
resolvió la petición realmente — útil con proxy/auto, donde el enrutamiento elige por ti.
finish_reason
Indica por qué terminó la generación:
| Valor | Significado |
|---|---|
stop | El modelo terminó de forma natural. |
length | Se alcanzó el tope de max_tokens. La respuesta quedó cortada — sube max_tokens si necesitas más. Ver Parámetros. |
usage
usage trae el conteo real de tokens de tu proveedor: prompt_tokens, completion_tokens y
total_tokens.
Sin campos adicionales
La respuesta es OpenAI-compat pura: Semantara no agrega campos ni headers propios al cuerpo. La información de caché y de ahorro vive en la Consola, no en la respuesta.