Gemini Context Caching: Cómo diseñar prompts con prefijos estáticos para ahorrar un 90% en la API
Gemini Context Caching: Cómo diseñar prompts con prefijos estáticos para ahorrar un 90% en la API
Aprende a estructurar tus prompts mediante prefijos estáticos en Google Gemini para activar Context Caching y reducir hasta un 90% el coste en tokens de entrada.
El uso intensivo de modelos de lenguaje en producción suele enfrentarse a un obstáculo crítico: el coste acumulativo de procesar una y otra vez los mismos documentos extensos. Implementar Gemini Context Caching mediante una arquitectura estricta de prompts permite reutilizar tokens de entrada ya procesados, alcanzando un descuento directo del 90% en la tarifa de tokens de entrada cuando se produce un acierto en caché (cache hit) y reduciendo de forma sustancial el Time-To-First-Token (TTFT).
Aspectos clave del Context Caching
- Ahorro del 90%: Los tokens de entrada leídos desde la caché tienen una reducción tarifaria del 90% respecto a los tokens estándar.
- Prefijos obligatorios: La coincidencia de caché implícita opera estrictamente desde el token 0; cualquier carácter dinámico inicial invalida el resto del contexto.
- Umbrales mínimos: Requiere un mínimo de 2.048 tokens en la familia Gemini 2.5 y a partir de 4.096 tokens en modelos de generación Gemini 3.
- Dos modalidades: Caching Implícito (automático por coincidencia de prefijo) y Caching Explícito (vía endpoint
cachedContentscon TTL configurable).
Descuento en coste de tokens leídos de caché
Tokens mínimos requeridos en Gemini 2.5
Tokens mínimos requeridos en Gemini 3
TTL por defecto en Caching Explícito
1. Anatomía de la técnica: Reutilización de la matriz KV en Gemini
Cuando un modelo procesa un prompt extenso (como un manual técnico, un repositorio de código o un contrato legal), calcula representaciones internas denominadas matriz de atención Key-Value (KV cache). En solicitudes tradicionales, este cálculo computacional se ejecuta y se factura desde cero en cada llamada a la API.
Con Gemini Context Caching, los tokens calculados previamente se almacenan temporalmente. Si una nueva solicitud comparte exactamente el mismo inicio de texto (prefix match), el motor de inferencia salta la fase de precalculado para ese bloque, acelerando la respuesta inicial y reduciendo radicalmente el consumo de recursos.
2. Modalidades de Gemini Context Caching: Implícito vs. Explícito
Google Gemini admite dos mecanismos para gestionar la persistencia y reutilización de contexto:
| Característica | Caching Implícito | Caching Explícito |
|---|---|---|
| Activación | Automática por defecto (Gemini 2.5 y posteriores) | Manual mediante endpoint cachedContents |
| Persistencia | Oportunista (depende de la frecuencia temporal de peticiones) | Determinista (garantizada según TTL asignado) |
| Coste de almacenamiento | Sin coste adicional por hora | Coste horario por 1M tokens/hora almacenados |
| Umbral de activación | 2.048 tokens (Gemini 2.5) / 4.096 tokens (Gemini 3) | 2.048 tokens (Gemini 2.5) / 4.096 tokens (Gemini 3) |
3. La regla arquitectónica del prompt: Prefijos estáticos vs. Colas dinámicas
Para garantizar que la API reconozca la coincidencia de tokens, la estructura del prompt debe ser estricta. El emparejamiento funciona de izquierda a derecha comenzando en el token 0. Si insertas una marca de tiempo, un identificador de sesión o el nombre del usuario al principio del prompt, invalidarás la caché de todo el contenido que aparezca después.
Define el rol, reglas de formato, tono y restricciones de seguridad globales sin variables dinámicas.
Inserta la documentación, fragmentos de código fuente, manuales o transcripciones completas que superen el umbral mínimo de tokens.
Coloca al final del payload la consulta puntual, variables de sesión o datos contextuales específicos de la solicitud.
4. Plantilla de diseño de prompts para Context Caching
A continuación se ilustra cómo formular un prompt estructurado adecuadamente para optimizar tokens en un asistente de soporte técnico o análisis documental:
Estructura del Payload Recomendada
[BLOQUE ESTÁTICO 1: SYSTEM INSTRUCTIONS – PREFIJO INMUTABLE]
“Eres un asistente de soporte técnico senior especializado en la infraestructura de la empresa. Responde con precisión técnica basándote únicamente en el manual de operaciones adjunto. Si la información no está en el texto, indícalo explícitamente.”
[BLOQUE ESTÁTICO 2: BASE DOCUMENTAL – PREFIJO INMUTABLE (>2.048 TOKENS)]
“— INICIO DOCUMENTACIÓN TÉCNICA Y POLÍTICAS —
[Aquí se adjuntan 5.000 tokens de especificaciones de red, diagramas textuales, tablas de enrutamiento y guías de resolución de incidencias]
— FIN DOCUMENTACIÓN TÉCNICA —“
[BLOQUE DINÁMICO: CONSULTA DEL USUARIO – COLA FINAL]
“Ticket ID: 84920
Usuario: Operador_3
Pregunta: ¿Cuál es el procedimiento de failover para el clúster regional de base de datos en caso de pérdida de enlace primario?”
5. Cuándo usar y cuándo evitar Context Caching
A pesar del potencial de ahorro del 90% en lectura de tokens, esta técnica no es aplicable a todos los escenarios debido a sus restricciones de volumen y arquitectura de costes:
- Cuándo usarlo: Chatbots de atención al cliente sobre manuales extensos, agentes que analizan repositorios de código completos en múltiples iteraciones, o análisis repetitivo de contratos legales voluminosos.
- Cuándo evitarlo: Consultas aisladas sin recurrencia temporal (no amortizan el coste de almacenamiento horario en caching explícito), prompts ligeros que no alcancen los 2.048 tokens de umbral o flujos de trabajo donde los documentos de referencia cambian en cada llamada.
Checklist de depuración de prompts con Context Caching
- El prefijo estático supera el umbral mínimo (2.048 tokens en Gemini 2.5 / 4.096 en Gemini 3).
- No existen IDs, timestamps ni variables dinámicas antes del bloque de conocimiento estático.
- Se ha verificado el campo
usage_metadataen la respuesta de la API para confirmar los tokens descontados. - En Caching Explícito, el TTL configurado (por defecto 1 hora) se ajusta al volumen previsto de consultas concurrentes.
🚀 ¿Quieres estar siempre actualizado en IA?
Únete a nuestra comunidad donde compartimos noticias, herramientas, guías y oportunidades sobre inteligencia artificial.
Preguntas frecuentes
¿Qué sucede si mi prompt tiene menos de 2.048 tokens?
La API de Gemini procesará la solicitud con la tarifa y latencia estándar de tokens de entrada, ya que no alcanza el umbral mínimo necesario para activar el almacenamiento en caché.
¿El almacenamiento en caché explícito tiene un coste adicional?
Sí. Además de la tarifa reducida por los tokens leídos con acierto en caché, el almacenamiento explícito aplica un coste por el tiempo que los tokens permanecen almacenados (precio por 1M tokens/hora).
¿Puedo cambiar las instrucciones del sistema sin perder la caché del documento adjunto?
No. Dado que la coincidencia de prefijos inicia en el token 0, cualquier modificación en las instrucciones del sistema al inicio alterará toda la secuencia e invalidará el contenido posterior almacenado en caché.
Fuentes consultadas
🔥 Sigue Eduky Blog para más contenido sobre IA
Noticias, herramientas, automatizaciones y guías prácticas para mantenerte siempre al día.



Publicar comentario