Blog · Práctico

Cómo ahorrar tokens en IA: gastar menos sin perder calidad

Lo que se procesa en cada mensaje que envías a una IA Lo que entra en cada mensaje Instrucciones del sistema Historial de la conversación Documentos que pegaste Herramientas Tu pregunta Tu pregunta es la capa más pequeña. Todo lo demás viaja contigo en cada mensaje.
El agujero casi nunca está en cómo escribes la pregunta.

El token más caro es el que pagas dos veces porque la primera respuesta no te sirvió. ¿Cómo se ahorran tokens al usar una inteligencia artificial? Mantén pequeño el contexto, pide una salida concreta, corta las conversaciones que ya arrastran medio mundo y usa el modelo potente solo cuando el trabajo lo pide. Si trabajas con una API o con agentes, añade caché, recuperación selectiva y medición.

Lo que casi nadie ordena bien es el orden. Primero quitas desperdicio. Después bajas de modelo. Si empiezas recortando el prompt hasta dejarlo en los huesos, gastarás menos en la primera petición y más en las cuatro correcciones que vienen detrás.

Aquí tienes el método completo, tanto si usas ChatGPT, Claude o Gemini en una pestaña como si trabajas con Claude Code, una API o un agente conectado a herramientas.

Qué es un token y dónde se te van

Un token es una unidad pequeña de texto que el modelo usa para leer y para escribir. No equivale a una palabra: una palabra puede ser uno, dos o varios tokens, y el reparto cambia según el idioma, el modelo y su tokenizador. En castellano solemos salir peor parados que en inglés, por cierto.

La cuenta real tiene más piezas de las que parece:

  • Tokens de entrada: tu mensaje, las instrucciones del sistema, el historial de la conversación, los documentos y, en un agente, la descripción de sus herramientas.
  • Tokens de salida: la respuesta que genera la IA.
  • Tokens de razonamiento: el trabajo interno de los modelos que piensan antes de responder. Según la herramienta puede que no lo veas entero, pero cuenta para tu uso o para tu factura.
  • Tokens de herramientas: búsquedas, resultados de APIs, archivos, logs y cualquier bloque que vuelva a entrar en la conversación.
  • Tokens en caché: contexto repetido que el proveedor reconoce y cobra más barato. Sigue ocupando sitio; solo cuesta menos procesarlo.

Esa última distinción vale oro. Ahorrar tokens y ahorrar dinero no son lo mismo. La caché puede bajarte el coste sin reducir ni un token de los que ve el modelo. Cambiar a un modelo más barato baja la factura aunque el texto mida exactamente igual. Y una respuesta más corta sí reduce tokens de salida, esa sí.

Si usas una suscripción normal de ChatGPT, Claude o Gemini, no recibes una factura por token. Da igual: el principio te afecta. Las conversaciones pesadas se comen antes tus límites, tardan más y acumulan más ruido.

La regla que explica casi todo

Cada mensaje nuevo arrastra todo lo que la IA necesita recordar de la conversación. Si el chat lleva dentro 30.000 tokens entre útiles e inútiles, una pregunta de siete palabras obliga al modelo a procesar otra vez buena parte de esos 30.000.

La misma pregunta en el mensaje 1 y en el mensaje 20 Mensaje 1 Tu pregunta 7 palabras Mensaje 20 Todo lo anterior, otra vez Tu pregunta Mismas 7 palabras. Detrás van 30.000 tokens de conversación vieja. Un chat eterno cuesta, aunque escribas poco.
La pregunta es igual de corta. Lo que se procesa detrás, no.

Por eso el agujero grande casi nunca está en escribir "por favor" o en poner dos adjetivos de más. Está en:

  • mantener abierto un chat eterno;
  • pegar documentos completos para preguntar por tres párrafos;
  • cargar veinte herramientas que no vas a usar;
  • pedir respuestas enormes que luego nadie lee;
  • dejar que un agente dé vueltas sin una condición clara de parada;
  • gastar cinco intentos vagos donde cabía un briefing decente.

Optimizar bien se parece a ordenar una mesa de trabajo. Dejas encima lo que hace falta para esta tarea y guardas el resto.

15 formas de ahorrar tokens sin empeorar el resultado

Van ordenadas a propósito. Las primeras quitan desperdicio, las últimas tocan el precio. Si lo haces al revés, acabas pagando los reintentos.

El orden en el que conviene atacar el gasto de tokens Por dónde atacar, en este orden 1 Mide dónde se va el gasto 2 Quita el contexto inútil 3 Acota la salida 4 Cachea y filtra 5 Baja de modelo Empezar por el 5 es lo más tentador y lo que peor sale: el modelo pequeño falla, corriges tres veces y gastas más que si no tocas nada.
Primero quitas basura. Bajar de modelo es lo último, no lo primero.

1. Mide antes de tocar nada

Optimizar a ojo es una forma muy elegante de perder la tarde. Averigua primero qué se está comiendo los tokens: entrada, salida, razonamiento, documentos, herramientas o una conversación que lleva abierta desde el martes.

En una API, guarda como mínimo, por petición: modelo, tokens de entrada, tokens de salida, tokens leídos y escritos en caché, tokens de razonamiento si el proveedor los enseña, número de llamadas a herramientas, coste total y, sobre todo, si el resultado sirvió.

Anthropic tiene un endpoint para contar tokens antes de enviar el mensaje, y Gemini hace lo mismo con countTokens. Después de responder, los proveedores devuelven el uso real en los metadatos.

No midas solo "coste por llamada". Mide coste por tarea resuelta. Una petición barata seguida de tres correcciones sale más cara que una buena a la primera.

2. Abre un chat nuevo cuando cambies de trabajo

Si estabas preparando una propuesta comercial y ahora quieres revisar un contrato, abre otra conversación. El historial anterior no te ayuda y viaja de polizón en todos los mensajes siguientes.

Esto lo pregunto en todas las formaciones: cuánta gente abre un chat nuevo al cambiar de tarea. Suele levantar la mano una persona por sala. El resto arrastra una conversación de tres semanas donde conviven un email a un proveedor, un texto para LinkedIn y una duda de Excel.

Tampoco hace falta abrir un chat por frase. Dentro de una misma tarea, el historial te evita repetir datos. El corte sensato es el cambio de objetivo: un chat, un resultado principal.

3. Da un briefing pequeño, pero completo

"Hazme un post" tiene pocos tokens y es un prompt carísimo. La respuesta te sale genérica, corriges el tono, después el público, luego la longitud, y acabas explicando lo que podías haber explicado al principio.

Un briefing eficiente lleva cinco cosas: qué quieres conseguir, el contexto que cambia la respuesta, para quién es, las restricciones que importan y cómo debe quedar la salida. Nada de autobiografía si no afecta, y nada de repetir la misma norma en tres apartados.

Si quieres entrar en esto con calma, lo desarrollo en la guía de cómo usar ChatGPT, con plantillas listas para copiar.

4. Define la salida antes de pedirla

"Sé breve" sirve de poco. "Dame cinco acciones, una línea por acción, ordenadas por impacto" sirve mucho más.

Puedes limitar el número de puntos, las palabras aproximadas, las columnas de una tabla, los campos de un JSON, el número de alternativas, el nivel de detalle y qué debe omitir.

La salida cuesta más que la entrada en muchas APIs. Pedir 120 palabras cuando necesitas 120 palabras es una decisión de producto, no tacañería.

5. No pidas diez opciones si vas a elegir entre tres

Generar alternativas parece gratis porque tarda segundos. Ni es gratis ni te ayuda tanto. Si necesitas un asunto de email, tres propuestas distintas te dan más criterio que veinte variaciones de la misma idea.

Empieza con pocas. Si ninguna abre un camino decente, pide otra ronda explicando qué falló. La segunda petición tendrá dirección; la lista de veinte no la tenía.

6. Pide preguntas previas solo cuando eviten retrabajo

"Hazme las preguntas que necesites antes de empezar" ahorra muchos tokens en una tarea ambigua. También puede montarte una entrevista absurda para algo que se resolvía en un minuto.

Úsalo en encargos con decisiones reales: una estrategia, una propuesta, una automatización o un texto que tiene que sonar a ti. Sáltatelo para corregir un párrafo o resumir una página. Una versión más controlada:

Antes de empezar, hazme como máximo tres preguntas, pero solo si la respuesta cambiaría de forma material el resultado. Si no, continúa.

7. Sustituye el historial por un resumen de trabajo

Cuando una conversación sigue siendo útil pero ya pesa demasiado, pide un resumen operativo y llévatelo a un chat nuevo.

No pidas "resume esta conversación" a secas. Pide exactamente lo que necesitas conservar:

Crea un resumen para continuar este trabajo en un chat nuevo. Conserva objetivo, decisiones tomadas, datos confirmados, restricciones, tono, trabajo pendiente y próximos pasos. Elimina intentos descartados y conversación social. Máximo 600 palabras.

Ese resumen pasa a ser tu nueva base. Has comprimido el contexto sin fingir que el trabajo anterior no existió.

8. Pega el fragmento, no el almacén entero

Si quieres revisar una cláusula, pega la cláusula y las dos que la condicionan. Si quieres depurar un error, trae el mensaje, la parte del stack trace que importa y el código de alrededor. Si quieres analizar las ventas de mayo, no mandes cinco años de CRM por si acaso.

Para sistemas que consultan mucha documentación, la solución seria es la recuperación selectiva: buscar primero los fragmentos que tienen que ver con la pregunta y enviar al modelo solo esos. Es lo que llaman RAG. Nada mágico: una biblioteca que te trae a la mesa los tres libros que tocan en vez de volcarte la estantería encima.

Si trabajas a menudo con documentación propia, echa un ojo a Gemini Notebook, que hace justo esto con tus fuentes y te cita la página.

9. Preprocesa antes de que la IA lea

Un modelo no debería leerse 10.000 líneas de log para encontrar cuatro errores si una búsqueda normal las extrae antes. Filtra, agrupa, quita duplicados y corta ruido con código o con la propia herramienta que genera los datos.

La documentación de Claude Code lo ejemplifica bien: filtrar un log enorme para devolver solo las líneas con errores convierte decenas de miles de tokens en unos cientos. La IA debería hacer la parte que pide criterio. Una expresión regular no necesita cobrar por pensar.

10. Limpia las instrucciones permanentes

Los asistentes personalizados, los agentes y las herramientas de programación cargan un archivo de instrucciones en cada petición. Con el tiempo eso se convierte en un trastero: reglas duplicadas, excepciones antiguas, ejemplos que ya no corrigen ningún fallo y párrafos escritos para modelos de hace un año.

Poda: cada norma aparece una sola vez, las reglas generales se quedan en la base, las instrucciones de una tarea concreta se cargan solo cuando toca, los ejemplos se conservan si arreglan un error medido y lo obsoleto se borra.

OpenAI recomienda exactamente eso: prompts más ligeros, solo las herramientas relevantes y cada instrucción dicha una vez. En sus pruebas internas con agentes de código, las configuraciones con prompts de sistema más limpios redujeron los tokens totales entre un 41% y un 66% y además subieron la puntuación de las evaluaciones entre un 10% y un 15% (guía oficial). Menos contexto y mejor resultado a la vez, que es la parte que sorprende a casi todo el mundo.

11. Reutiliza plantillas, pero no copies el relleno

Una buena plantilla te evita cinco mensajes de aclaración. Una plantilla de 2.000 palabras para pedir un correo de seis líneas hace justo lo contrario.

Guarda la estructura estable (objetivo, público, datos, restricciones y formato) y rellena solo lo que cambia. Si un apartado te queda vacío casi siempre, sobra. Si una explicación no cambia la respuesta, también.

12. Usa caché para lo que se repite

Si una API recibe una y otra vez las mismas instrucciones, herramientas, ejemplos o documentos, la caché de prompts baja mucho el coste y la latencia. El truco está en colocar lo estable arriba y lo variable abajo.

Cómo ordenar el prompt para que la caché funcione El orden que hace que la caché acierte 1 · Instrucciones estables 2 · Herramientas 3 · Estilo y ejemplos 4 · Documentación común 5 · Datos de esta petición 6 · Pregunta del usuario Prefijo estable: se cachea Cambia cada vez Una fecha colada en el bloque 1 invalida la caché de todo lo que va debajo.
La coincidencia depende de un prefijo idéntico. Lo que cambia, al final.

Tanto Anthropic como Google recomiendan poner el contenido grande y común al principio. Escribir en caché cuesta algo más que la entrada normal (en Anthropic, un 25% de recargo), y se amortiza en cuanto la segunda petición acierta.

Y la letra pequeña, que se olvida siempre: la caché abarata el contexto repetido, no lo elimina. Los tokens cacheados siguen ocupando ventana, y la salida no se abarata por arte de magia.

13. Elige modelo y esfuerzo según la tarea

No necesitas el modelo más potente para clasificar tickets, sacar tres campos de una factura o cambiar el formato de una fecha. Reserva el grande y el razonamiento alto para arquitectura, estrategia, diagnóstico difícil o decisiones donde equivocarse cuesta dinero.

TrabajoPrimera opciónEscalar cuando…
Clasificar, etiquetar, extraerModelo pequeñofalla el formato o el criterio
Resumir y transformar textoModelo medio o pequeñohay matices delicados
Redacción profesionalModelo medioel tono o la precisión no llegan
Estrategia, código complejo, diagnósticoModelo potentedesde el principio si el riesgo lo justifica

Esto no reduce el número de tokens, pero sí el coste por token. Bajar el nivel de razonamiento en tareas sencillas sí evita trabajo interno que no aporta. OpenAI recomienda probar el mismo nivel de esfuerzo y uno inferior sobre tareas reales; Anthropic aconseja reservar el modelo más caro para las decisiones complejas y tirar de uno más económico en el trabajo corriente.

Si te estás decidiendo entre proveedores, lo comparo con más detalle en ChatGPT vs Gemini vs Claude para empresa.

14. Pon límites a los agentes

Un chatbot responde. Un agente busca, abre archivos, llama herramientas, prueba, falla, vuelve a probar y te llena el contexto con todo lo que encuentra por el camino. Ahí es donde se disparan los tokens de verdad.

Antes de soltarlo, define qué resultado debe entregar, qué fuentes o carpetas puede consultar, cuántos intentos permite la tarea, qué evidencia conserva, cuándo debe parar y qué acciones necesitan permiso.

Si una cadena de cinco herramientas produce megas de resultados intermedios, procesa esos datos fuera del contexto y devuelve solo un resumen estructurado. Anthropic separa cuatro remedios para este problema: buscar las herramientas bajo demanda en vez de cargarlas todas, ejecutar las cadenas de llamadas como un único script, cachear las definiciones estables y borrar los resultados antiguos que ya cumplieron su función.

15. Evalúa calidad y ahorro juntos

No cantes victoria porque el contador haya bajado. Comprueba si la tarea sigue saliendo bien.

Prepara diez o veinte casos representativos y compara antes y después: porcentaje de tareas correctas, número de reintentos, tokens totales por tarea, coste por tarea resuelta, tiempo hasta el resultado e intervención humana necesaria.

Quitar un 30% de tokens y duplicar las correcciones no es optimizar. Es mover el coste de sitio.

Un prompt antes y después

Imagina que tienes que responder a la reclamación de un cliente.

Prompt demasiado corto:

Responde a este cliente de forma profesional.

La IA no sabe qué quieres conseguir, qué puedes ofrecer ni cuánto debe ocupar. Te devolverá un correo correcto, largo y genérico. Luego vienen las correcciones.

Prompt inflado:

Eres un experto de talla mundial en atención al cliente, comunicación, psicología, persuasión, negociación, experiencia de usuario, marketing, ventas y fidelización. Debes ser siempre amable, profesional, empático, humano, cercano, claro, conciso, resolutivo, educado, positivo y orientado a soluciones. Nunca debes ser agresivo, antipático, robótico, frío, distante, confuso, ambiguo, repetitivo ni excesivamente largo…

Mucho decorado y ninguna decisión. Este lo veo cada semana, y suele venir de alguna plantilla descargada de internet.

Prompt eficiente:

Responde como responsable de atención al cliente. El pedido llegó con dos días de retraso. Queremos disculparnos y ofrecer envío gratis en la próxima compra, pero no un reembolso. Escribe un email de 90 a 120 palabras, cercano y directo, en español de España. Incluye asunto. No inventes plazos ni condiciones.

El tercero no es el más corto. Es el que tiene menos papeletas de obligarte a volver.

Cómo ahorrar tokens en Claude Code

Claude Code merece apartado propio porque una sesión de programación arrastra mucho más que tus mensajes: instrucciones del proyecto, archivos leídos, resultados de comandos, herramientas MCP, respuestas anteriores y razonamiento. Anthropic sitúa el coste medio en unos 13 dólares por desarrollador y día activo en despliegues de empresa, así que aquí los hábitos se notan en la factura.

Mira qué llena el contexto

Usa /usage para ver el consumo de la sesión y /context para ver qué está ocupando la ventana. En los planes de pago, /usage reparte además el gasto por skills, subagentes, plugins y cada servidor MCP. Sin ese diagnóstico es fácil pasarte media hora recortando prompts mientras el problema real son ocho servidores MCP conectados y un archivo de instrucciones de mil líneas.

Usa /clear entre tareas no relacionadas

Si has terminado el login y ahora vas a rehacer la facturación, empieza limpio. La documentación lo dice sin rodeos: el contexto viejo desperdicia tokens en todos los mensajes siguientes. Y hay un detalle que casi nadie tiene en cuenta: /compact cuesta tokens porque tiene que leerse la conversación entera para resumirla, mientras que /clear no cuesta nada. Si no necesitas continuidad, limpia en vez de compactar.

Compacta con intención

En una tarea larga, /compact cambia el historial por un resumen. Dile qué quieres conservar:

/compact conserva las decisiones de arquitectura, los archivos modificados, los tests que fallan y el siguiente paso

Mejor hacerlo antes de que la conversación sea un vertedero. Claude Code compacta solo cuando se acerca al límite, pero un resumen dirigido sabe mejor qué no debe perder.

Cuidado con las pausas largas

Este me costó entenderlo. La caché tiene caducidad: una hora en las suscripciones y cinco minutos por defecto con clave de API. Si te vas a comer y vuelves dos horas después, el primer mensaje no encuentra caché y reprocesa el contexto entero a precio completo. Volver a una sesión enorme después de un parón es de las cosas más caras que puedes hacer sin darte cuenta.

Haz peticiones con un blanco concreto

"Mejora este repositorio" invita a explorar medio proyecto. "Añade validación del email en src/auth/register.ts y cubre los casos X e Y" acota archivos, búsquedas y pruebas.

Para tareas complejas, planificar antes te ahorra una implementación equivocada entera. Para una corrección evidente de dos líneas, planificar cuesta más de lo que ahorra. Otra vez lo mismo: depende del tamaño del error que quieras evitar.

Mantén pequeño CLAUDE.md

Ese archivo se carga al empezar y se queda ahí ocupando sitio aunque estés con algo que no tiene nada que ver. Las instrucciones especializadas que solo hacen falta de vez en cuando encajan mejor en skills, que se cargan bajo demanda. Anthropic apunta a menos de 200 líneas como referencia, no como ley sagrada.

Desactiva lo que no uses y delega lo verboso

Revisa servidores MCP, plugins y herramientas. Aunque Claude Code aplaza parte de las definiciones y solo entran los nombres hasta que se usan, cada integración suma. Si no la necesitas en esta sesión, fuera.

Y cuando algo genera muchísima salida (correr los tests, procesar logs, leer documentación), delégalo a un subagente: la parrafada se queda en su contexto y a ti te vuelve solo el resumen.

Baja modelo o esfuerzo cuando el trabajo es mecánico

Modelo potente para el problema difícil; uno más económico para búsquedas, transformaciones o subtareas acotadas. Reduce el esfuerzo de razonamiento cuando no veas mejora medible. Pensar más no convierte una tarea sencilla en una tarea mejor resuelta. A veces solo la encarece.

¿Cómo hacer que Opus gaste menos tokens?

No hay un truco secreto reservado a una versión de Opus. Los nombres, los precios y los tokenizadores cambian; los sitios donde se desperdician tokens son siempre los mismos. El modelo recibe demasiado historial, lee archivos que no necesita, devuelve más texto del que vas a usar o dedica razonamiento alto a una tarea mecánica.

Si cambias de modelo, no des por hecho que el mismo prompt consumirá lo mismo. Cada familia tokeniza distinto y gestiona de otra forma el razonamiento o las herramientas. Cuenta la carga completa con el modelo que vas a usar y compara sobre tareas reales, no sobre una frase suelta.

Después, ataca en este orden:

  1. limpia el historial o usa /clear al cambiar de tarea;
  2. compacta las sesiones largas con un foco explícito;
  3. reduce archivos, logs y resultados de herramientas;
  4. acota la petición para evitar exploración innecesaria;
  5. reserva el modelo más potente para lo que de verdad lo necesita;
  6. baja el esfuerzo de razonamiento en tareas simples;
  7. compara tokens por tarea resuelta, no por mensaje.

Cambiar "explícame detalladamente" por "sé breve" no compensa una sesión que reenvía cien mil tokens de contexto en cada mensaje.

Cómo optimizar tokens en una API o un agente

Aquí el problema deja de ser una sensación y aparece en la factura. También es donde puedes afinar más.

Separa el presupuesto por capas

No pongas un único límite global. Define presupuesto para contexto fijo, datos recuperados, historial, herramientas, razonamiento y salida final. Si el total se pasa, sabrás qué recortar. Sin esa separación, todo parece "el prompt" y no lo es.

Cuenta antes y registra después

Usa el contador del proveedor antes de enviar cargas grandes y los metadatos de uso después. Las estimaciones de "una palabra son tantos tokens" valen para una charla de bar, no para controlar producción. Las imágenes, los PDF, las herramientas y los distintos tokenizadores rompen la regla enseguida.

Recupera solo lo que la pregunta necesita

En un sistema con documentos, fija número máximo de fragmentos, longitud máxima por fragmento, umbral mínimo de relevancia, eliminación de duplicados y diversidad de fuentes cuando haga falta.

Más contexto no garantiza más verdad. Si la respuesta necesita dos párrafos del manual, mandar cuarenta páginas diluye la señal y encima cobra por el ruido.

Resume el estado, no toda la conversación

Guarda por separado hechos duraderos, decisiones, preferencias y tareas abiertas. No conviertas cada "gracias" ni cada intento fallido en memoria de larga duración.

En agentes, elimina los resultados de herramientas que ya se transformaron en una conclusión. OpenAI y Anthropic ofrecen mecanismos de compactación o edición de contexto para sesiones largas; si tu plataforma no los tiene, hazlo en tu propia capa de estado.

Mantén estable el prefijo de caché

Ordena de lo más estable a lo más variable. Evita timestamps, identificadores de petición o valores dinámicos antes del bloque cacheable. Y comprueba en los metadatos si hay lecturas de caché de verdad: una función "activada" que nunca acierta no ahorra nada. Esto lo he visto ya varias veces, y siempre se descubre mirando las métricas, nunca leyendo el código.

Carga herramientas bajo demanda

Un catálogo de cincuenta funciones puede consumir miles de tokens antes de que el usuario haya preguntado nada. Expón solo las herramientas del dominio actual, o usa búsqueda de herramientas para cargar la definición completa cuando toque usarla.

Comprime las llamadas intermedias

Si un agente consulta cinco endpoints y luego une, filtra y ordena los resultados, ese trabajo puede correr en código. Devuelve al modelo solo las filas finales y la evidencia que necesita para redactar. Cada resultado intermedio que entra en el chat puede reaparecer en las siguientes vueltas.

Pon topes y condiciones de parada

Define máximo de iteraciones, reintentos por herramienta, tiempo, tokens y coste. Añade una salida de fallo clara para que el agente no repita la misma búsqueda con palabras distintas hasta fundir el presupuesto. Es el fallo más caro que veo en agentes recién montados, y lo cuento con más detalle en agentes de IA para empresas.

Usa lotes si el tiempo no importa

Procesar en batch o en diferido abarata tareas masivas según el proveedor. No reduce tokens, así que colócalo en la columna correcta: es una optimización de precio y capacidad, no de contexto.

Calcula el coste completo

La cuenta útil se parece a esto:

coste = entrada sin caché + escritura de caché + lectura de caché + salida + razonamiento + llamadas a herramientas

Cada término lleva la tarifa del modelo y del proveedor. No copies precios de un artículo viejo, que cambian cada dos por tres. Mira las páginas oficiales de modelos y precios de OpenAI, los precios de Anthropic o la caché de Gemini cuando hagas números.

Trucos que parecen buenos y no lo son

"Quita espacios y escribe con abreviaturas"

Puede ahorrar algo o puede no ahorrar nada, porque el tokenizador no cuenta caracteres de forma lineal. Y si el prompt se vuelve ambiguo, el remedio sale más caro que la enfermedad. Cuenta tokens de verdad. No conviertas tus instrucciones en un SMS de 2003.

"El prompt más corto siempre es mejor"

Falso. El prompt eficiente lleva toda la información que cambia la respuesta y nada que no la cambie.

"Abre un chat nuevo para cada mensaje"

También falso. Pierdes contexto útil y acabas repitiéndolo. Abre uno nuevo cuando cambia la tarea o cuando el historial viejo pesa más de lo que ayuda.

"La caché reduce tokens"

Reduce el coste y la latencia del contexto repetido. Los tokens cacheados siguen dentro de la ventana, y generar la salida no se abarata.

"Usa siempre el modelo barato"

Si el pequeño falla y el grande acierta, el barato te sale caro. Enruta por dificultad y escala cuando haya una señal concreta: confianza baja, formato inválido, caso de riesgo alto o fallo en una evaluación.

"Dale todo por si acaso"

Es el equivalente digital de vaciarle un archivador encima de la mesa a alguien y pedirle rapidez. Recupera primero, genera después.

"Pídele que piense al máximo en todo"

El razonamiento alto tiene sentido cuando una mejora pequeña de calidad vale lo que cuesta. Para extraer un número o cambiar un formato, no.

Un plan de limpieza en 20 minutos

Si quieres notar la diferencia hoy mismo, haz esto:

  1. Mira tus tres conversaciones o tareas más caras.
  2. Separa cuánto viene de entrada, salida, razonamiento y herramientas.
  3. Corta una conversación que mezcle temas.
  4. Reduce a tres las alternativas que pides por defecto.
  5. Convierte una petición habitual en una plantilla con objetivo, contexto, restricciones y formato.
  6. Fija una longitud de salida razonable.
  7. Quita una instrucción duplicada de tu asistente o de tu archivo base.
  8. Desactiva una herramienta que no uses.
  9. Filtra un documento, un log o un dataset antes de mandarlo al modelo.
  10. Prueba la misma tarea con un modelo o un esfuerzo inferior y compara.

Con eso ya habrás tocado los cuatro mandos que importan: contexto, reintentos, salida y modelo.

La idea que merece quedarse

Ahorrar tokens tiene poco que ver con hablarle peor a la IA. Tiene que ver con organizar mejor el trabajo que le das.

Un buen sistema le entrega el contexto justo, una tarea concreta y un final reconocible. Reutiliza lo estable, recupera solo lo relevante, limpia lo que ya no sirve y mide el resultado completo. La tecnología cambia cada pocos meses y los precios todavía más, pero ese criterio envejece bien.

Si trabajas con una IA en una pestaña, empieza por separar chats y pedir salidas concretas. Si trabajas con Claude Code, vigila el contexto, limpia entre tareas y compacta con intención. Si construyes con APIs, añade medición, caché, recuperación selectiva, enrutado de modelos y límites de agente.

No hacen falta veinte trucos raros. Hace falta dejar de pagar por el mismo ruido una y otra vez.

La otra mitad del trabajo es conseguir que cada petición llegue más cerca de lo que querías a la primera. Eso es justo lo que trabajamos en el curso de Prompt Engineering en Barcelona: tus tareas, tus herramientas y tus casos encima de la mesa. Sin fórmulas mágicas y sin memorizar prompts de catálogo. Si lo que quieres es que lo aprenda tu equipo entero, lo monto in-company.

David Carrasco Pamies

David Carrasco PamiesImparte formación de IA presencial en Barcelona y es ponente internacional en conferencias del sector. Más sobre mí.

Preguntas frecuentes

Lo que más me preguntan sobre el gasto de tokens

¿Lo vemos juntos?

Que cada petición te salga bien a la primera

Media hora para contarme tu caso. Te digo qué formación encaja y si se cubre con Fundae. Te respondo yo.

Hablar conmigo