CodeForge

Python de Cero a Experto / Ruta datos e IA

Pandas: Series y DataFrames

Teoría22 min20 XP

Si NumPy son números en bruto, PANDAS es la herramienta que los organiza en TABLAS etiquetadas —la estructura de casi todo dato del mundo real—. Su estrella es el DATAFRAME: una tabla con columnas nombradas, como una hoja de cálculo con superpoderes. Con Pandas cargas, exploras, filtras y transformas datos con una facilidad que hace de Python el lenguaje nº1 para análisis. Y corre aquí, en vivo. Hoy conoces las Series y los DataFrames, los cimientos de todo análisis de datos.

La hoja de cálculo programable

Crear un DataFrame

La primera vez que corras esto, se descargará Pandas (unos segundos la primera vez); luego es rápido:

pd.DataFrame(datos) crea una tabla desde un diccionario donde cada clave es una COLUMNA. Al imprimirlo, ves una tabla formateada con un índice de filas (0, 1, 2...) y las columnas nombradas. df.shape te da (filas, columnas) y df.columns los nombres. Esta tabla —con datos de tipos distintos, etiquetada, manejable por código— es la estructura central del análisis de datos. En la práctica, cargarías los datos de un CSV (pd.read_csv), Excel (pd.read_excel) o una API, pero aquí los creamos a mano para aprender.

Columnas, filas y valores

¿Qué es un DataFrame, qué es una Series, y qué hace df['valor'].mean()?

Mini-reto

Crea y explora una tabla de Mi Bolsillo: 1) construye un DataFrame con columnas nombre, valor y categoria (al menos 5 gastos); 2) imprime su shape, sus columns, y las primeras filas con head; 3) obtén la columna valor y calcula su suma, promedio y máximo; 4) muestra la primera fila con iloc[0]. Observa cómo el DataFrame se imprime como una tabla ordenada.

Qué sigue

Ya cargas y ojeas datos. La próxima lección trae lo que hace a Pandas indispensable: EXPLORAR y FILTRAR —ver estadísticas de un vistazo con describe, y seleccionar exactamente las filas que cumplen condiciones—. El arte de hacerle preguntas a tus datos y obtener respuestas.