Saltar al contenido principal
🇬🇧 English 🇧🇷 Português 🇩🇪 Deutsch
Convertidor de imágenes Convertidor de vídeo Convertidor de audio Convertidor de documentos
Herramientas Guías Formatos Precios API
Iniciar sesión
Guía

Apache Parquet: El Formato de Archivo Columnar para Big Data

PC Por Pablo Cirre

Preguntas frecuentes

Parquet almacena los datos columna por columna en lugar de fila por fila. Al consultar SELECT AVG(salario) WHERE edad > 28 en una tabla de 1.000 columnas, Parquet lee solo los trozos de columna de salario y edad — omitiendo completamente las otras 998 columnas. Además, cada trozo de columna almacena estadísticas min/max, lo que permite omitir grupos de filas enteros sin leer sus datos (inserción de predicados). CSV debe escanear cada byte de cada fila. La combinación de omisión de columnas e inserción de predicados hace que Parquet sea típicamente 10–100x más rápido para analítica.

En KaijuConverter cada archivo se procesa en un contenedor aislado, cifrado en tránsito (TLS 1.3) y en reposo, y se elimina automáticamente tras 60 minutos con sobrescritura multi-pass. Nunca entrenamos modelos con, compartimos ni analizamos contenido de usuarios. Para máxima privacidad en material extremadamente sensible, usa herramientas offline (ImageMagick, FFmpeg, LibreOffice) bajo tu control.

Se recomienda ZSTD (Zstandard) para nuevos archivos — logra mejores ratios de compresión que Snappy (el predeterminado más común) siendo aún suficientemente rápido en descompresión para cargas de trabajo interactivas. Snappy es una buena opción predeterminada si la velocidad de descompresión es crítica. GZIP/Brotli dan los archivos más pequeños pero la descompresión más lenta. Establece la compresión en pandas: `df.to_parquet("archivo.parquet", compression="zstd")`.

En el 95% de casos sí — ImageMagick, FFmpeg y LibreOffice en servidor producen resultados idénticos a los de tu equipo. Escritorio gana para: archivos muy grandes (varios GB), lotes de miles de archivos, pipelines automatizados o contenido demasiado sensible para subir. KaijuConverter admite hasta 25 MB por archivo en el plan gratuito (hasta 2 GB en planes de pago).

El particionamiento Hive es una convención de nomenclatura de directorios donde los valores de partición se codifican en los componentes de la ruta: ventas/anio=2023/mes=01/datos.parquet. Los motores de consulta (Spark, DuckDB, Athena, Polars) reconocen automáticamente esta estructura y omiten particiones de directorio enteras cuando la cláusula WHERE filtra por columnas de partición — sin leer ningún metadato de archivo Parquet. Particiona por columnas que filtres con más frecuencia (fecha, región, categoría) pero evita particionar por columnas de muy alta cardinalidad como user_id, que crea millones de archivos diminutos.

La mayoría de conversiones de formato son lossy por diseño — JPG, MP3, MP4, WebP descartan información perceptual para reducir tamaño. Pasar por intermedios lossy multiplica la pérdida. Para minimizar el drift: convierte desde el máster original, sube la calidad y evita ir y volver entre formatos lossy.

Usa DuckDB: `SELECT * FROM read_parquet("datos/*.parquet") WHERE anio = 2023`. DuckDB lee solo los trozos de columna necesarios y omite grupos de filas basándose en estadísticas — todo sin cargar los archivos en memoria. También soporta rutas con comodines y directorios con particionamiento Hive. Alternativamente, usa AWS Athena (SQL sobre archivos Parquet en S3, pago por bytes escaneados) o Apache Spark para consultas distribuidas sobre conjuntos de datos muy grandes.

Sí — KaijuConverter acepta varios archivos a la vez y devuelve un ZIP. Para lotes muy grandes (miles de archivos) usa herramientas de línea de comandos o nuestra API: <code>find . -name "*.heic" -exec magick {} {.}.jpg \;</code> y one-liners similares escalan a millones de archivos en local.

Usamos cookies y tecnologías similares para personalizar contenido y anuncios, y para analizar el tráfico. Más información sobre cookies.