Categoría: Notas

Píldoras breves que explican conceptos técnicos de forma clara y minimalista. Sin rodeos.

  • Distribución t de Student. ¿Cómo decidir cuando todavía tienes poca información?

    La distribución t de Student es una herramienta estadística utilizada para extraer conclusiones cuando solo disponemos de una muestra pequeña y desconocemos la variabilidad real de la población. En lugar de asumir una precisión que no tenemos, incorpora la incertidumbre propia de trabajar con pocos datos, permitiendo realizar estimaciones e inferencias de forma más fiable.

    Tomar decisiones con pocas observaciones es como intentar juzgar un libro leyendo solo unos capítulos, puedes hacerte una idea, pero conviene ser más prudente que si lo hubieras leído entero. William Sealy Gosset desarrolló esta distribución mientras trabajaba en Guinness, donde necesitaban controlar la calidad de la cerveza sin analizar toda la producción. Cuantos menos datos tenemos, mayor debe ser nuestra cautela.

  • Prefect. ¿Por qué un proyecto de datos acaba necesitando un orquestador?

    Automatizar una tarea es sencillo. Automatizar decenas de tareas que dependen unas de otras es un problema completamente distinto. Cuando un proyecto pasa de juguete a monstruo, el desafío deja de ser escribir código y pasa a ser coordinar ejecuciones, gestionar dependencias, controlar errores y saber en qué punto ha fallado un proceso.

    Prefect es el orquestador que utilizo actualmente para resolver ese problema. Permite definir flujos de trabajo en Python, programar su ejecución y monitorizar cada paso del pipeline. Conceptos como Flow, Task, State y Scheduler son la base sobre la que organiza procesos complejos sin convertirlos en un caos.

    Enlaces de interés: https://docs.prefect.io/

  • Reducción dimensional. ¿Por qué descartar información puede hacer a un modelo más inteligente?

    La reducción dimensional engloba un conjunto de técnicas que transforman datos con muchas variables en una representación más sencilla, intentando conservar la información realmente importante. Su objetivo no es comprimir por comprimir, sino eliminar el ruido y las redundancias para facilitar el análisis, la visualización y el aprendizaje de modelos.

    Reducir dimensiones es como reducir un cuento a su moraleja: inevitablemente se pierden detalles, pero permanece la idea esencial. Métodos como PCA, t-SNE, UMAP o los autoencoders siguen filosofías distintas, pero todos persiguen el mismo objetivo: representar la realidad con menos dimensiones sin perder aquello que realmente importa.

    Enlaces: Unsupervised Dimensionality Reduction, La mirada bizantina