Currículo abierto · edición verificadaContribuir en GitHub
Proyecto4 min712 palabras

Plantilla de análisis de costes

El objetivo es explicar cuánto costó operar el sistema, por qué, cómo cambia a escala y qué palanca reduciría coste sin cruzar el gate de calidad. Usa factura/usage reales y conserva la tarifa vigente aplicada; no copies

FuenteMejorar esta página

El objetivo es explicar cuánto costó operar el sistema, por qué, cómo cambia a escala y qué palanca reduciría coste sin cruzar el gate de calidad. Usa factura/usage reales y conserva la tarifa vigente aplicada; no copies cifras de un tutorial.

1. Periodo y unidad económica#

Declara:

  • periodo UTC, entorno y commit/digest;
  • requests totales, exitosas, abstenidas y fallidas;
  • unidad principal: coste por tarea completada, no solo por llamada;
  • moneda e impuestos incluidos/excluidos;
  • fecha y enlaces de cada tarifa oficial;
  • créditos/free tiers separados del coste económico real.

2. Desglose real#

Rellena con datos del dashboard y factura:

Componente Unidad Volumen real Tarifa vigente Coste Fuente/evidencia
modelo de routing tokens entrada/salida
modelo de generación tokens entrada/salida/reasoning
embeddings de ingesta tokens
embeddings de query tokens
jueces/evaluación llamadas/tokens
vector DB almacenamiento/operaciones
API/compute horas/vCPU/RAM
observabilidad eventos/GB
red/egress GB
monitor/servicios mes
total

Cuenta evaluación, retries y tools: son parte del producto. Muestra créditos en una columna aparte; si el proveedor regaló 20 €, el coste observado puede ser 0, pero el coste recurrente no lo es.

3. Fórmulas reproducibles#

Para una llamada:

coste_llm =
  input_uncached_tokens / 1_000_000 * tarifa_input
  + cached_input_tokens / 1_000_000 * tarifa_cached_input
  + output_tokens / 1_000_000 * tarifa_output
  + cargos_de_tools

Para una tarea multi-paso:

coste_tarea = suma(coste_llm de cada intento)
             + embeddings_query
             + búsquedas/reranking
             + tools externas
             + porción de infraestructura y observabilidad

coste_por_tarea_exitosa = coste_total_periodo / tareas_exitosas

No atribuyas coste compartido dividiendo solo entre requests si batch, ingesta o evaluación sirven a otro volumen. Explica el driver elegido.

4. Distribución, no solo media#

Reporta p50/p95/p99 de tokens, llamadas y coste por tarea. Añade:

Segmento/ruta tareas éxito tokens p50/p95 coste p50/p95 motivo
cache hit
Luna/volumen
Terra/equilibrio
Sol/insignia
tool error/retry
evaluación

Los nombres GPT-5.6 reflejan el catálogo de agosto de 2026. Si cambian, conserva aquí el alias y snapshot reales del experimento; no reescribas el pasado con el nombre nuevo.

5. Proyección 1×, 10× y 100×#

Separa coste variable, escalonado y fijo:

Escenario tareas/mes tokens/tarea cache hit concurrencia pico coste variable infra escalonada total
observado 1×
crecimiento 10×
crecimiento 100×
estrés (p95 + retries)

No multipliques todo linealmente: una instancia salta por escalones, free tiers desaparecen, los descuentos/batch pueden entrar y rate limits fuerzan otra arquitectura. Incluye un escenario de peor caso con entrada larga y proveedor inestable.

6. Palancas y experimentos#

Para cada optimización, calcula ahorro y pérdida/riesgo medidos:

Palanca Hipótesis Ahorro mensual Impacto calidad Impacto p95 Evidencia Decisión
reducir contexto ablation
cache semántico falsos hits + hit rate
routing de tiers eval pareada
batch para eval/ingesta factura/run
modelo local coste total GPU

Una optimización solo se promueve si mantiene gates críticos. Ahorrar 30 % empeorando abstención de seguridad no es ahorro: desplaza coste a incidentes.

7. Break-even de self-hosting#

Compara:

API mensual = volumen_tokens * tarifa_efectiva + herramientas
self-host mensual = GPU + CPU/RAM + disco + egress + observabilidad
                    + horas de operación/guardia + capacidad ociosa

Calcula utilización y throughput requeridos, replicas para alta disponibilidad y reserva de picos. Incluye evaluación del modelo cuantizado. Un modelo que cabe en VRAM pero no supera el gate no es una alternativa.

8. Conclusión ejecutiva#

Termina con cinco cifras: coste total, coste medio y p95 por tarea exitosa, driver dominante, proyección 10× y ahorro de la siguiente palanca aprobada. Añade el mayor riesgo de la proyección y qué señal te avisará de que el supuesto dejó de cumplirse.