Ir al artículo
ELSELAND AI
ES
Jugar en móvil
Bosque reflejado en el agua como ilustración de un contexto visual repetido

Caché de prompts de GPT-6 Astra: por qué una petición no reutiliza la caché

Una petición repetida vuelve sin entrada en caché. Antes de reorganizar el prompt, comprueba si la primera podía establecer un prefijo reutilizable, si la segunda lo conservó y qué informa realmente la respuesta. La caché de prompts de GPT-6 Astra procesa entradas; no garantiza que preguntas parecidas cuesten menos.

Esta guía propone un diagnóstico basado en documentación oficial. No presenta una tasa de aciertos medida, garantiza ahorros ni implica haber probado una cuenta de API.

Lectura rápida

Puntos clave

  • Revisa la petición real, no solo el último mensaje del usuario.
  • Reutilizar la caché no equivale a reutilizar una respuesta terminada.
  • Mejora la eficiencia sin conservar instrucciones obsoletas.
01

Clasificar un fallo de caché

No consideres resuelto el problema porque una llamada posterior parezca más rápida. La red, las colas, la longitud de salida y las herramientas también afectan al tiempo total.

ComprobaciónPreguntaSiguiente acción
Identidad de la petición¿Ambas llamadas usaron la configuración prevista?Comparar las versiones registradas
Material estable¿Dónde aparece la primera diferencia inesperada?Separar entradas fijas y variables
Definiciones de herramientas¿Cambiaron nombres, descripciones o esquemas?Versionar el conjunto de herramientas
Historial¿Se reescribió una conversación anterior?Registrar las transformaciones del historial
Tiempo y conservación¿Seguía cumpliéndose la política de reutilización?Revisar la documentación actual del modelo
Medición¿Estás mirando el uso real de caché?Comparar uso y registros de diagnóstico
02

Leer el uso antes de cambiar el prompt

Guarda un diagnóstico seguro que identifique plantilla, modelo, versión de herramientas e historial. Evita secretos y contenido privado en registros sin restricciones. Un hash o una comparación controlada permite detectar cambios sin exponer todos los valores.

Revisa usage.input_tokens_details.cached_tokens junto con cache_write_tokens y el total input_tokens. Los tokens en caché indican entrada reutilizada; los tokens de escritura en caché son otro componente de facturación. Un cero inicial no demuestra un defecto: compáralo con una petición posterior que cumpla las condiciones. No deduzcas reutilización solo de una respuesta rápida.

Compara después la petición conocida con la siguiente que esperabas que aprovechara su caché. Localiza la primera diferencia inesperada. Mover todas las instrucciones desde el principio crea otro experimento sin explicar el fallo original.

Entre los candidatos están una marca de tiempo variable al inicio, herramientas en otro orden, un resumen reescrito o instrucciones modificadas. Son elementos que investigar, no causas demostradas en tu cuenta.

03

La misma pregunta no implica el mismo prefijo

La guía oficial de caché de prompts explica la reutilización del estado intermedio de claves y valores para un prefijo coincidente. No almacena respuestas terminadas: la petición siguiente aún procesa entrada nueva y genera una respuesta.

Por eso dos preguntas distintas pueden compartir un comienzo útil y dos casi idénticas pueden no reutilizar la parte esperada. Importa qué precede al material variable.

Piensa en la petición como un documento versionado que ensambla la aplicación. Incluye instrucciones, herramientas e historial. Mirar solo el último mensaje oculta buena parte de las pruebas.

04

Hacer un experimento controlado del prefijo

Empieza con una petición de referencia y una variación muy delimitada. Mantén tarea, requisitos de salida y herramientas disponibles. Registra si el prefijo previsto coincide antes de interpretar el uso.

Prueba una sola causa sospechosa. Si un campo dinámico sobra en la sección estable, muévelo únicamente tras comprobar que conservas el significado de la tarea. No elimines contexto relevante para mejorar una métrica.

Repite con suficientes ejemplos para distinguir un patrón reproducible de una observación aislada. Hasta ejecutar el experimento, describe el cambio como una solución propuesta.

Esto facilita revertir: si baja la calidad, podrás identificar el cambio exacto de estructura sin deshacer varias optimizaciones mezcladas.

Usa una hoja de tres peticiones: A establece la referencia; B conserva el material estable y cambia el elemento; C altera solo un campo sospechoso. Registra versiones, intervalo, tokens en caché y aceptación de salida. Es un diseño experimental, no una salida de API: no incluye tasas inventadas.

Imagina un equipo que evalúa descripciones de objetos con una guía de estilo y un esquema fijos. La guía y el esquema permanecen, los datos del objeto cambian. Es un contexto razonable para investigar la reutilización.

Ahora imagina que la aplicación añade un identificador nuevo antes de la guía en cada llamada. Examina cómo se construye la petición antes de culpar al modelo, y comprueba que cualquier reorganización siga separando los datos de las instrucciones.

Para definir descripciones de objetos, explora juegos RPG y anota cómo las etiquetas del inventario comunican función y límites. Usa tus notas en una guía de estilo; no copies los textos ni presentes los juegos como ejemplos de caché de Astra.

PeticiónMantenerCambiarRegistrar
A: referenciaModelo, herramientas, guía y esquemaObjeto inicialUso de entrada y salida aceptada
B: candidata a reutilizaciónMismo prefijo y configuraciónSolo el objeto después del material estableEntrada en caché y corrección de salida
C: causa sospechosaTodo salvo la variable elegidaUn campo o un cambio de ordenDiferencias en reutilización y calidad
05

Comprobar aparte los cambios de razonamiento

La documentación de razonamiento describe una actualización de configuración de GPT-6 Astra para cambiar el esfuerzo entre respuestas conservando el prefijo original. Entre sus condiciones está el modo estándar de un solo agente.

No supongas que reescribir una configuración en cualquier punto tiene el mismo efecto. Sigue el mecanismo documentado de tu integración y verifica el comportamiento resultante.

Esto importa cuando alternas análisis difíciles y tareas rutinarias. El objetivo no es congelar los ajustes para siempre, sino modificarlos deliberadamente sin reconstruir por accidente contexto ajeno al cambio.

06

Separar ahorro de caché y coste total

La página del modelo GPT-6 Astra distingue precios de entrada, entrada en caché y salida. Consulta las tarifas vigentes al implementar; este artículo no promete un porcentaje fijo de ahorro.

Evalúa la tarea aceptada, no solo un componente rebajado. Si la optimización alarga respuestas, añade reintentos o rompe el formato, el proceso completo puede empeorar aunque reutilice parte de la entrada.

Presenta el comportamiento de caché junto con la calidad. Conserva al menos aceptación, tiempo y uso informado. Un panel que solo muestre aciertos crecientes puede ocultar una peor experiencia.

La evaluación de estilo también necesita comprobar si las etiquetas ayudan al jugador a entender una acción. Explora juegos de navegador en Elseland AI y escribe tus propias pruebas. La colección sirve para jugar; no demuestra rendimiento de caché ni procedencia del modelo.

07

Conservar la corrección antes de optimizar

Una petición favorable a la caché no es necesariamente buena. Si cambia la aplicación, mantén exacta la definición de herramientas; si el usuario corrige un requisito, conserva la corrección. Reutilizar contexto obsoleto no es una optimización útil.

Fija criterios antes de cambiar la estructura: deben mantenerse los campos requeridos, la salida debe responder a la tarea actual y ninguna instrucción antigua debe prevalecer sobre la nueva.

Conserva la reorganización solo si la eficiencia observada supera también las pruebas de aceptación. Si mejora la métrica pero la respuesta sigue instrucciones antiguas, revierte. Busca un resultado correcto con menos procesamiento repetido, no aciertos a cualquier precio.

Fuentes y lecturas adicionales

  1. Guía oficial de caché de prompts

    Comportamiento y campos consultados el 14 de septiembre de 2026. No se afirman aciertos ni ahorros medidos.

  2. Página del modelo GPT-6 Astra

    Solo categorías de precios; comprueba las tarifas actuales. No contiene previsiones de precios.

  3. Documentación de razonamiento

    Condiciones de las actualizaciones de razonamiento; no garantizan reutilización ante cualquier cambio.

Siguiente paso

Descansa de la depuración

Juega a algo nuevo.Encontrar un juego de navegador