Inference Engineering: qué es y qué se optimiza (TTFT, tokens/s, VRAM, costo)
Capítulo 01 // 4 min
Correr modelos de verdad: local, cuantización, VRAM, serving, medición y costos.
Guía: lista cerrada sobre un tema, de principio a fin.
Actualizado:
Capítulo 01 // 4 min
Capítulo 02 // 3 min
Capítulo 03 // 3 min
Capítulo 04 // 3 min
Capítulo 05 // 3 min
Capítulo 06 // 4 min
Capítulo 07 // 3 min
Capítulo 08 // 3 min