Módulo I — Fundamentos de LLMs y APIs (0,5 ECTS)
Tiempo estimado: 15–18 horas (semanas 1–2 del programa). Hito de salida: un cliente multi-proveedor capaz de invocar OpenAI, Anthropic y Amazon Bedrock detrás de una interfaz propia, registrando tokens, latencia y motivo
Tiempo estimado: 15–18 horas (semanas 1–2 del programa). Hito de salida: un cliente multi-proveedor capaz de invocar OpenAI, Anthropic y Amazon Bedrock detrás de una interfaz propia, registrando tokens, latencia y motivo de parada.
Este módulo construye el vocabulario técnico que usarás durante todo el programa. No pretende que entrenes un transformer desde cero: pretende que entiendas qué ocurre entre el texto de entrada y el siguiente token, que puedas anticipar el efecto de la tokenización y los parámetros de muestreo, y que sepas integrar tres APIs sin ocultar sus diferencias importantes.
Objetivos de aprendizaje#
Al terminar deberías ser capaz de:
- Explicar la arquitectura decoder-only, self-attention, máscara causal, KV cache y el coste del contexto sin recurrir a analogías incorrectas.
- Tokenizar texto, medir diferencias entre idiomas y estimar el impacto sobre contexto y coste.
- Elegir
temperature,top_py límites de salida según la tarea, comprobando siempre el motivo de parada. - Leer una respuesta de OpenAI y Anthropic, incluyendo contenido tipado y uso de tokens.
- Invocar un foundation model con la Converse API de Amazon Bedrock sin incrustar credenciales.
- Encapsular proveedores bajo un contrato propio sin borrar sus metadatos ni sus errores.
- Elegir familia y tamaño de modelo con una evaluación del caso real, no por un ranking aislado.
Estructura#
modulo-01-fundamentos-llm/
├── README.md
├── teoria/
│ ├── 01-arquitectura-transformer.md
│ ├── 02-tokenizacion.md
│ ├── 03-parametros-generacion.md
│ ├── 04-panoramica-modelos.md
│ └── 05-aws-ia-bedrock.md
├── labs/
│ ├── 01_primer_llamada_openai.py
│ ├── 02_primer_llamada_anthropic.py
│ ├── 03_tokenizacion_comparada.py
│ ├── 04_parametros_generacion.py
│ └── 05_bedrock_inference.py
└── ejercicios.md ← enunciados y criterios verificables
Orden recomendado#
| # | Teoría | Práctica | Horas |
|---|---|---|---|
| 1 | Arquitectura transformer | Ejercicio 1 | 3 |
| 2 | Tokenización | Lab 03 + ejercicios 2–3 | 3 |
| 3 | Parámetros de generación | Lab 04 + ejercicios 4–5 | 3 |
| 4 | Panorámica de modelos | Labs 01–02 + ejercicios 6–7 | 3 |
| 5 | AWS IA y Bedrock | Lab 05 + ejercicio 8 | 2 |
| 6 | Integración | Ejercicios 9–10: cliente multi-proveedor | 3+ |
Preparación y ejecución#
Completa primero el setup general. Los labs 03 y los ejercicios de atención son locales. Los labs 01, 02 y 04 consumen una cantidad pequeña de API. El lab 05 requiere una cuenta AWS con acceso explícito al modelo elegido y puede generar coste.
uv sync
source .venv/bin/activate
python modulo-01-fundamentos-llm/labs/03_tokenizacion_comparada.py
Los nombres de modelo se pueden cambiar mediante OPENAI_MODEL, ANTHROPIC_MODEL y
BEDROCK_MODEL_ID. Los alias de modelos cambian con el tiempo: antes de ejecutar un curso
guardado durante meses, contrasta disponibilidad y precio en la documentación oficial.
Criterio de superación#
- Puedes explicar a otra persona el cálculo de atención de una cabeza y resolver el ejercicio 1.
- Has ejecutado los cinco labs y has provocado al menos un caso de truncado o error controlado.
- El cliente del ejercicio 10 devuelve el mismo tipo de resultado para los tres proveedores, conserva la metadata original útil y no contiene claves en el código.
- Puedes justificar, con una mini-evaluación, qué modelo usarías para una tarea concreta.