Costo de Claude Platform: los aciertos de caché superan a un modelo más barato
El costo de Claude Platform bajó hasta 73% en las pruebas de Anthropic del Sept 8, 2026 vía caché y effort. Sé dueño del agente; paga el uso, no mi suscripción.
Las pruebas de agente de soporte de Anthropic bajaron el costo de Claude Platform un 14.6% tras una sola auditoría de prompts, y un benchmark de retail cayó 73% cuando el prompt caching se colocó bien. Eso salió el 8 de septiembre de 2026, en una nota de Claude Platform de Lance Martin. No es un SKU más barato. Es un recordatorio de que la mayor parte de la factura es trabajo desperdiciado, no el nombre del modelo en la factura.
Si ya tienes un agente de Telegram, esto es consejo operativo.
¿Qué impulsa de verdad el costo de Claude Platform?
El costo de Claude Platform es sobre todo prefill, bucles de tools y ajustes de “pensar más” — no un asiento que me pagas a mí. Los cache misses, los rituales de prompt que sobran y el esfuerzo máximo en un FAQ de reservas son donde se va el dinero.
Antes de que Claude responda, procesa el prompt a un estado de trabajo. Anthropic llama a eso prefill, y es la parte cara del input. El prompt caching guarda ese estado. La siguiente solicitud que empieza con el mismo prefijo lo lee en vez de recomputarlo. Las lecturas de caché se facturan a una fracción del input completo. En Claude Fable 5.1, Anthropic listó las lecturas de prompt-cache a $0.25 por millón de tokens frente a $1.00 en Fable 5.
El truco es mecánico. La caché está anclada a un solo modelo. El prefijo tiene que ser exacto al byte. Expira. Un timestamp en el system prompt, una lista de tools reordenada o un cambio de esfuerzo a mitad de conversación pueden fallarla. Si un agente se queda bloqueado en un tool más tiempo que el TTL, la reescritura puede costar 1.25× el input normal. Yo dejo tools, política y el mapa de campos del CRM primero; la conversación en vivo después.
¿Los prompts de “sé exhaustivo” que sobran suben la factura?
En los modelos frontier de Claude, las instrucciones que sobran de “verifica dos veces” y “sé lo más exhaustivo posible” suben el costo de Claude Platform al agregar llamadas extra a tools. La auditoría de prompts de Anthropic recortó el costo 14.6% y subió la precisión 5.3% en un set de atención al cliente.
Plantaron esos anti-patrones al migrar un benchmark de soporte de Opus 4.8 a Opus 5. Opus 5 seguía el coaching viejo con más rigor: la verificación duplicaba las consultas de pedidos, y “sé lo más exhaustivo posible” se convertía en docenas de búsquedas en la knowledge base. Quita los rituales y desaparecen las llamadas extra a tools.
¿Cada trabajo de dueño de negocio debería correr a máximo esfuerzo?
No. El esfuerzo es un dial, no una medalla de calidad. Los números de Fable 5 de Anthropic en FrontierCode Diamond pasaron de 11.5% a $5.35 por tarea en esfuerzo bajo a 30.9% a $19.00 en máximo — unas 2.7× el puntaje por unas 3.5× el costo.
En Humanity’s Last Exam sin tools, Fable 5.1 sacó cerca de 53% en esfuerzo bajo por unos $0.30 por pregunta y cerca de 61% en máximo por unos $2.23. El último tramo sumó cerca de medio punto por 46% más de costo, dentro del ruido de corrida a corrida. Anthropic dijo que Fable 5.1 en esfuerzo bajo empató a Fable 5 en esfuerzo alto en CursorBench 3.2 a un tercio del costo.
Eso coincide con el control de costo de agentes de IA: un presupuesto de dinero y un presupuesto de acciones. La caché y el esfuerzo mantienen la factura del modelo dentro del presupuesto. Los cortes duros siguen fuera del modelo.
Lo que esto no cambia para un comprador de pequeña empresa
Afinar el costo de Claude Platform no contesta tu teléfono ni reemplaza un agente de Telegram de $2,000–$4,000 que es tuyo. Solo cambia qué tan cara es la capa del modelo una vez que el flujo de trabajo ya existe.
Sigo implementando la misma forma que uso para IA para pequeñas empresas: un disparador, una acción, un sistema de registro, un humano para las excepciones. LegalBench bajó cerca de 58% con caching, esfuerzo bajo y batch. tau2-bench retail bajó cerca de 73% con breakpoints de caché explícitos. OfficeQA Pro pasó de $136.20 a $64.87. Esas son sus evals, no tu cola de Jobber.
Un Agente de IA para Telegram cuesta $2,000–$4,000 una vez. Tú eres dueño del setup. Sigues pagando a Anthropic por tokens. Esos tokens no deberían desperdiciarse en cache misses e instrucciones de “piensa paso a paso” que sobran. Si quieres ese cableado mapeado a tu CRM, manda el formulario corto de auditoría — te respondo con el mapa de reemplazo en menos de 24 horas.


