CodeForge

Python de Cero a Experto / Ruta datos e IA

Explorar y filtrar datos

Teoría22 min20 XP

Tener los datos en un DataFrame es solo el comienzo: el análisis empieza cuando les haces PREGUNTAS. ¿Cuál es el promedio? ¿Qué filas superan cierto valor? ¿Cuáles cumplen dos condiciones? Pandas hace esto con una elegancia asombrosa: describe te da un resumen estadístico instantáneo, y el filtrado con máscaras booleanas selecciona exactamente las filas que buscas. Hoy aprendes a interrogar tus datos —la habilidad central del análisis—.

El interrogatorio a los datos

describe y value_counts

df["valor"].describe() te da de golpe las estadísticas clave de una columna numérica: cuántos valores hay (count), el promedio (mean), la desviación estándar (std), el mínimo y máximo, y los cuartiles (25%, 50% que es la mediana, 75%). Es lo primero que haces con un dataset nuevo: entender la forma de tus números. value_counts() cuenta cuántas veces aparece cada valor en una columna —perfecto para variables de categoría ("¿cuántos gastos hay de cada tipo?")—. Dos líneas, y ya conoces tus datos.

Filtrar filas

¿Qué hace df[(df['categoria'] == 'comida') & (df['valor'] > 5000)] y qué da describe()?

Mini-reto

Interroga un dataset de gastos: 1) crea un DataFrame con al menos 6 gastos (nombre, valor, categoria); 2) usa describe() sobre la columna valor y value_counts() sobre categoria; 3) filtra los gastos mayores al promedio (df[df["valor"] > df["valor"].mean()]); 4) filtra con dos condiciones combinadas (por ejemplo, categoría "comida" Y valor mayor a 5000, con & y paréntesis); 5) muestra los 3 gastos más caros ordenando con sort_values. Cada pregunta, una línea.

Qué sigue

Ya filtras y resumes. La próxima lección trae la operación más poderosa del análisis: AGRUPAR (groupby) — calcular totales, promedios y conteos POR grupo (por categoría, por mes)— y transformar datos creando columnas nuevas. Es donde los datos revelan sus patrones: "¿cuánto gasté en cada categoría?".