Dos archivos del dataset Inside Airbnb (Boston), comprimidos conxz para caber bajo el limite de 25 MiB por archivo de Cloudflare. pandas los lee directo desde la URL, sin paquetes extra. Sin comprimir pesan 12,5 MB y 74,4 MB.
Archivos
| Archivo | Filas | Columnas | Comprimido |
|---|---|---|---|
| listings.csv.xz | 4,378 | 90 | 1.2 MB |
| reviews.csv.xz | 252,910 | 6 | 18.4 MB |
listings: Anuncios: propiedad, host, ubicacion, precio, amenities y puntuacion.
reviews: Comentarios: listing_id, fecha, reviewer y texto.
En Colab
import pandas as pd
BASE = "https://mateusgaribaldi.com/datos/si-actividad1"
HEADERS = {"User-Agent": "Mozilla/5.0"}
listings = pd.read_csv(f"{BASE}/listings.csv.xz", storage_options=HEADERS)
reviews = pd.read_csv(f"{BASE}/reviews.csv.xz", storage_options=HEADERS)
listings.shape # (4378, 90)
reviews.shape # (252910, 6)Cloudflare bloquea el User-Agent por defecto de Python (Python-urllib, error 1010), asi que hay que mandar unUser-Agent de navegador con storage_options.pd.read_csv detecta el formato xz solo, no hace falta instalar nada.