E l 7 de octubre Anthropic puso su modelo más pequeño a 0,10 dólares por millón de tokens de entrada. Diez céntimos por un millón de palabras-y-pico suena a gratis, y es el tipo de cifra que invita a montar algo encima sin hacer cuentas. El problema no está en ese número: está en que la factura no la decide el precio por millón, la decide cuántos millones mueves — y en una conversación de diez turnos mueves muchos más de los que has escrito.
Un token no es una palabra, y de ahí viene el descuadre
Los modelos no cobran por palabras ni por caracteres: cobran por tokens, los fragmentos en los que el modelo parte el texto antes de procesarlo. Un token puede ser una palabra corta y frecuente, un trozo de palabra larga, un signo de puntuación o incluso un espacio. «de» es un token; «desproporcionadamente» son varios.
La regla que más circula dice que un token equivale a unas 0,75 palabras, o que 1.000 tokens son unas 750 palabras. Esa proporción no está inventada, pero está medida en inglés, y es la primera razón por la que a mucha gente le sale una factura mayor que su estimación. Los tokenizadores se construyeron sobre corpus dominados por el inglés, así que las palabras inglesas frecuentes tienden a tener su propio token y las de otros idiomas se parten en trozos.
La consecuencia práctica es sencilla: cualquier cálculo que hagas con la regla de 0,75 palabras por token te va a quedar corto si escribes en español. Cuánto, lo vemos ahora.
El impuesto del español: lo mismo, pero más caro
Varias mediciones independientes han comparado el mismo texto traducido a distintos idiomas pasándolo por el tokenizador de OpenAI. Un banco de pruebas reproducible publicado en GitHub con la librería tiktoken encontró que un párrafo técnico necesita en torno a un 55% más de tokens en español que en inglés; un análisis distinto del mismo tipo de texto sobre GPT-4o midió un 58,9%. Los dos apuntan a lo mismo: por el mismo contenido pagas alrededor de una vez y media.
Los idiomas con alfabeto no latino salen bastante peor — hay mediciones de hasta cinco veces para el telugu — pero eso a ti te da igual. Lo que te afecta es que tu caso no es el caso base de los ejemplos de la documentación.
Un aviso sobre estas cifras: están medidas sobre el tokenizador de OpenAI, que es público. Anthropic y Google usan los suyos y no los publican, así que el número exacto para Claude o Gemini puede variar. La dirección se mantiene en los tres; la magnitud, mídela tú. Casi todos los proveedores ofrecen un endpoint para contar tokens antes de enviar la petición, y es la forma honesta de salir de dudas.
¿Conviene entonces escribir los prompts en inglés?
Para la parte fija y larga —las instrucciones de sistema que viajan en cada llamada— puede tener sentido, y es un ahorro real en tokens de entrada. Para el contenido del usuario, no decides tú. Y hay un coste que no aparece en la factura: traducir las instrucciones al inglés cuando el modelo tiene que responder en español añade un salto de idioma que a veces se nota en el resultado, sobre todo en matices de registro. La decisión sensata es medirlo en tu caso con una evaluación mínima antes de darlo por bueno, no asumirlo. Si no tienes montada esa comprobación, la tienes explicada en la guía de cómo saber si tu agente funciona de verdad.
No hay un precio: hay tres
Toda tarifa de API tiene al menos dos columnas, y casi siempre una tercera que es la que de verdad cambia las cuentas.
Entrada y salida
La entrada es todo lo que le mandas: instrucciones de sistema, historial, documentos adjuntos, resultados de herramientas. La salida es lo que genera. Mirando los catálogos de octubre de 2026 aparece un patrón que se repite con una regularidad llamativa: la salida cuesta cinco veces la entrada. Pasa en 0,10$/0,50$, en 2$/10$, en 4$/20$ y en 10$/50$. No es casualidad: generar token a token es secuencial y ocupa el acelerador, mientras que leer la entrada se paraleliza.
De ahí sale la primera intuición útil, y es contraintuitiva: lo que suele engordar la factura no es que el modelo escriba mucho, es que le mandas mucho. Una respuesta de 300 tokens cuesta lo mismo que 1.500 tokens de entrada, y 1.500 tokens de entrada es poco más de una página.
La caché, que es la tercera columna
Si varias llamadas empiezan exactamente con el mismo texto —el típico prompt de sistema largo—, puedes marcar ese prefijo para que el proveedor lo guarde. Escribir en la caché cuesta más que la entrada normal; leer de ella cuesta mucho menos, del orden de un 90% menos. El punto de equilibrio llega enseguida: con la caché corta, una sola lectura ya compensa lo que pagaste por escribirla.
En Haiku 5.5 la lectura de caché está en 0,01$ por millón, una décima parte de su entrada ya barata. Los multiplicadores exactos, en cambio, varían de un modelo a otro y las tablas de terceros se contradicen entre sí: para esto conviene ir a la página oficial del proveedor y no fiarse de un blog. La caché por defecto dura unos minutos y se renueva sin coste cada vez que se lee, lo que la hace muy rentable en conversaciones activas y bastante inútil en llamadas espaciadas.
Y un descuento que casi nadie usa
Si lo que haces no necesita respuesta inmediata —clasificar un histórico, resumir mil documentos, etiquetar un backlog—, las APIs por lotes aplican alrededor de un 50% de descuento a cambio de procesarlo cuando haya hueco. Es el descuento más grande que puedes conseguir sin tocar una línea de tu lógica, y se queda sin usar porque el modo interactivo es el que viene por defecto en los ejemplos.
El mapa de precios en octubre de 2026
Dólares por millón de tokens, tarifa estándar, sin descuentos por caché ni por lotes. Sirve para ver los órdenes de magnitud, que es lo que importa al elegir:
| Modelo | Entrada $/M | Salida $/M |
|---|---|---|
| GPT-6 Luna (OpenAI) | 0,10 | 0,50 |
| Claude Haiku 5.5 (Anthropic)hasta 100.000 tokens de entrada | 0,10 | 0,50 |
| GLM-5.3-Flash (Z.ai) | 0,15 | 0,50 |
| GPT-6 Sol (OpenAI) | 2 | 10 |
| Gemini 4 Argon (Google)tarifa introductoria, pasará a 4/20 | 2 | 10 |
| Claude Opus 5.5 (Anthropic) | 4 | 20 |
| GPT-6 Astra (OpenAI)por encima de 272.000 tokens: 20/75 | 10 | 50 |
| Claude Fable 5.1 (Anthropic) | 10 | 50 |
Lo que salta a la vista es que no hay un precio de la IA: hay un factor cien entre el extremo barato y el caro de la misma semana. Y los modelos pequeños de 2026 no son los modelos pequeños de hace dos años: Haiku 5.5 trae un millón de tokens de ventana de contexto, igual que modelos que cuestan cien veces más. Para clasificar, extraer campos, enrutar o resumir, el modelo de 0,10$ hace el trabajo.
Las cifras de Anthropic están contrastadas con su propia página de precios. Las de OpenAI vienen de coberturas y agregadores de terceros que coinciden entre sí, no de la página oficial, así que confírmalas antes de presupuestar. Y las tarifas se mueven: esta tabla tiene fecha, trátala como una foto.
Los tramos que rompen el titular
Aquí está el detalle que convierte una estimación razonable en una sorpresa a fin de mes: varios de estos precios solo valen hasta un tamaño de petición, y a partir de ahí suben de golpe.
El caso más claro es el de Haiku 5.5. Sus 0,10$/0,50$ valen para peticiones de hasta 100.000 tokens de entrada. Por encima de esa línea pasa a 0,50$/2,50$: cinco veces más, sin transición. Es decir, el titular del «90% más barato» describe un tramo, no el modelo. Un chat suelto no cruza esa línea casi nunca. Un agente que arrastra historial, adjuntos y resultados de herramientas la cruza, y lo hace sin avisarte.
GPT-6 Astra tiene su propio escalón, en 272.000 tokens, donde pasa de 10$/50$ a 20$/75$. Y Gemini 4 Argon salió con 2$/10$ anunciando desde el primer día que son tarifas introductorias y que pasarán a 4$/20$ — mérito de Google por publicarlo, pero si has presupuestado con el precio de lanzamiento tienes un duplicado pendiente.
Al mismo tiempo, el suelo gratuito se está estrechando: desde el 9 de octubre el plan gratuito de Gemini se quedó solo con Flash-Lite. Lo cubrimos en la noticia del cambio, y la lección vale para cualquier capa gratuita: es una decisión comercial, no una propiedad del producto, y puede cambiar en un aviso. Si has montado algo encima, ten preparado a dónde te mueves.
La regla que conviene interiorizar: el precio que anuncia un laboratorio es el suelo de su tarifa, no su tarifa. Antes de elegir modelo por precio, busca en la página de precios dónde están los escalones y calcula en qué lado de la línea cae tu petición típica.
Dónde se va el dinero: en el historial, no en la pregunta
Esta es la parte que no es intuitiva y es la que explica la mayoría de facturas inesperadas. Una API de chat no recuerda nada entre llamadas: en cada turno le reenvías la conversación completa para que sepa de qué hablabais. O sea que el historial se paga una vez por turno, y no una vez.
Las cuentas de un caso corriente. Un asistente de soporte con un prompt de sistema de 2.000 tokens; el usuario escribe unos 150 tokens por mensaje y el modelo responde unos 300. Una conversación de diez turnos:
- Turno 1: entran 2.150 tokens (sistema + pregunta).
- Turno 2: entran 2.600 (sistema + pregunta 1 + respuesta 1 + pregunta 2).
- Turno 10: entran unos 6.200, porque van los nueve turnos anteriores enteros.
- Total de la conversación: unos 41.750 tokens de entrada y 3.000 de salida.
El usuario escribió 1.500 tokens en toda la conversación. Tú pagas por casi 42.000 de entrada, unas 28 veces más. Y crece de forma cuadrática: duplicar los turnos no duplica el coste, lo multiplica por algo más de tres.
Lo que eso cuesta depende del modelo elegido, y aquí la tabla de antes deja de ser abstracta. Esa misma conversación, diez mil veces:
- Con Haiku 5.5 o GPT-6 Luna (0,10$/0,50$): alrededor de 57 dólares.
- Con GPT-6 Astra o Fable 5.1 (10$/50$): alrededor de 5.675 dólares.
Cien veces, por el mismo trabajo. No significa que el modelo caro nunca valga la pena — si una de cada cinco respuestas del pequeño está mal y acaba en un humano, el cálculo cambia entero. Significa que la elección de modelo es la decisión de coste, y que conviene tomarla por tramos: el modelo bueno donde se nota, el pequeño en el resto.
Con agentes esto se agrava, porque los resultados de herramientas también son entrada: una búsqueda que devuelve tres páginas de texto mete esas tres páginas en todos los turnos siguientes. Si quieres el fondo de por qué la conversación tiene que reenviarse y cómo gestionan esto las distintas estrategias de memoria, está en ventana de contexto y memoria.
Cinco palancas, por orden de rentabilidad
1. Medir antes de optimizar
Casi todas las respuestas de la API devuelven el recuento de tokens de entrada y salida. Regístralo por llamada desde el primer día, junto con qué tipo de petición era. Sin eso estás adivinando, y la intuición falla justo en lo que cuenta: casi siempre resulta que el gasto está concentrado en un puñado de llamadas que nadie había mirado.
2. Repartir por dificultad
Es la palanca con más recorrido, porque es la que mueve el factor cien. Clasificar, enrutar, extraer campos o decidir si algo necesita atención: modelo pequeño. Redactar la respuesta final delicada o razonar sobre un caso raro: modelo grande. La mayoría de los sistemas que funcionan en producción son así, y no un solo modelo caro para todo.
3. Cachear el prefijo estable
Si tu prompt de sistema ocupa 2.000 tokens y viaja en cada turno, es el candidato obvio. En el ejemplo de antes, cachearlo baja la entrada facturada de unos 41.750 a unos 26.000 tokens: en torno a un 38% menos sin tocar nada del comportamiento. La condición es que el prefijo sea idéntico byte a byte, así que pon al principio lo que no cambia y al final lo que varía — un timestamp mal colocado al inicio del prompt invalida la caché en cada llamada y es un error muy común.
4. Recortar el historial
No todas las conversaciones necesitan recordarlo todo. Las estrategias que funcionan son mantener una ventana de los últimos N turnos, resumir lo viejo en un párrafo, o guardar fuera los datos que el modelo puede volver a pedir cuando los necesite. Cualquiera de las tres rompe el crecimiento cuadrático, que es lo que importa.
5. Mandar por lotes lo que no es urgente
Un 50% de descuento por aceptar que algo se procese más tarde. Revisa qué parte de tu carga es realmente interactiva: suele ser menos de lo que parece.
Una palanca que no está en la lista: añadir agentes. Dividir el trabajo entre varios agentes mejora algunas tareas, pero multiplica las llamadas y cada agente arrastra su propio contexto — es una decisión de calidad que se paga en factura. Cuándo compensa y cuándo no, en varios agentes o uno solo.
Cuándo la API sale más cara que una suscripción
Si lo que haces es trabajar tú con un asistente —escribir, revisar, programar—, la suscripción plana casi siempre gana, y por bastante. Veinte o treinta dólares al mes compran un volumen de uso interactivo que por API costaría mucho más, porque el proveedor asume que no vas a usarla ocho horas seguidas sin parar.
La API empieza a tener sentido cuando se cumple alguna de estas tres: necesitas que el proceso corra sin ti delante, necesitas integrarlo en un producto que usan otros, o tu volumen es tan irregular que pagar una cuota fija por asiento no cuadra. Para todo lo demás, la suscripción es la opción barata.
Y hay una tercera vía que conviene no descartar antes de poner una tarjeta: un modelo abierto corriendo en tu propio ordenador. No tiene coste por token — lo pagas en memoria, en disco y en velocidad —, y para clasificar, resumir o extraer campos de textos que preferirías no mandar fuera, da de sobra. Cómo montarlo y qué modelo aguanta tu máquina, en IA local: correr modelos en tu ordenador.
Cuando ya tengas un volumen estimado, échale el número a la calculadora de coste de API en lugar de hacerlo a mano: pide consultas al mes y precio por millón, y te da el coste mensual. Hazlo dos veces, con el modelo pequeño y con el grande, y verás si la decisión está realmente reñida o no.
Lo único que de verdad hay que llevarse de esta guía: mide los tokens de entrada de tu llamada típica antes de elegir modelo. Esa cifra, cruzada con los escalones de la tarifa, decide tu factura mucho más que el precio del titular.


