Saltar al contenido principal
🇬🇧 English 🇧🇷 Português 🇩🇪 Deutsch
Convertidor de imágenes Convertidor de vídeo Convertidor de audio Convertidor de documentos
Herramientas Guías Formatos Precios API
Iniciar sesión
Guía

CSV: Guía Técnica Completa de Valores Separados por Comas

PC Por Pablo Cirre

Conversiones relacionadas

Pon en práctica lo que acabas de aprender — convierte tus archivos ahora en segundos, gratis y sin registro.

Preguntas frecuentes

Las causas más comunes: (1) Codificación incorrecta — Excel asume Windows-1252 o el locale del sistema por defecto; si tu archivo es UTF-8 sin BOM, los caracteres acentuados se verán corruptos. Solución: guarda con BOM UTF-8 (Python encoding='utf-8-sig'). (2) Delimitador incorrecto — si tu CSV usa puntos y coma (común en locales europeos) pero Excel espera comas, todos los datos aparecen en la columna A. Solución: usa el asistente de importación de Excel (Datos → Desde texto) y especifica el delimitador. (3) Colisión de formato numérico — Excel auto-convierte cosas como '1-2' (un código de producto) a una fecha. Solución: importa via el asistente y marca la columna como Texto.

Envía <strong>PDF</strong> cuando el documento es final y el layout debe preservarse tal cual (contratos, facturas, certificados). Envía <strong>DOCX</strong> cuando los revisores deben editar, comentar o usar control de cambios. Muchos equipos envían ambos: PDF como versión canónica + DOCX para feedback editable. PDF/A es el adecuado para archivado legal (ISO 19005).

CSV usa comas como delimitadores de campo; TSV (Valores Separados por Tabuladores) usa caracteres de tabulador (`\t`). TSV tiene una ventaja práctica: los caracteres de tabulador casi nunca aparecen en datos reales, por lo que los archivos TSV raramente necesitan entrecomillado de campos. CSV requiere entrecomillar cualquier campo que contenga una coma. TSV es preferido en bioinformática y muchas herramientas Unix. CSV es el estándar universal para la mayoría del software empresarial. Ambos son texto plano y pueden procesarse con el mismo módulo `csv` de Python usando `delimiter='\t'`.

Round-trip entre formatos similares (DOCX ↔ ODT, DOCX → PDF) suele ser seguro. Round-trip con funciones específicas del formato (macros de Word, tablas complejas, notas al pie) suele perder fidelidad. Las fuentes incrustadas sobreviven solo si origen y destino lo soportan (PDF sí, DOCX sí, HTML plano no). Previsualiza siempre antes de borrar el original.

Usa procesamiento en trozos con pandas: `for trozo in pd.read_csv('enorme.csv', chunksize=10000): procesar(trozo)`. Cada trozo es un DataFrame de 10.000 filas y pandas carga solo un trozo a la vez. Alternativamente, usa `csv.reader` de Python directamente en un generador — lee una línea a la vez con uso de memoria constante. Para consultas tipo SQL en CSVs grandes, considera `duckdb.read_csv('archivo.csv')` que usa el motor de consultas vectorizado de DuckDB. Evita `pd.read_csv('enorme.csv')` sin chunking en archivos de más de unos cientos de MB.

Si el PDF contiene texto real (no imágenes escaneadas), <code>pdftotext</code> de poppler-utils o <a href="/es/convert/pdf-a-txt">PDF a TXT</a> funcionan en segundos. Si el PDF es escaneado, necesitas OCR — Tesseract es el estándar open-source. Las herramientas PDF de KaijuConverter detectan automáticamente texto vs. imagen y enrutan según el caso.

No. CSV no tiene sistema de tipos — cada campo es un string. La inferencia de tipos se deja completamente al consumidor. Parsers como pandas realizan detección heurística de tipos: columnas de dígitos se convierten en enteros o floats; strings de fecha ISO 8601 pueden convertirse en objetos datetime con `parse_dates=True`. Pero esta inferencia puede fallar: los códigos postales pierden ceros iniciales, los números de teléfono se convierten en enteros, y los strings de fecha en formatos ambiguos se parsean diferente por parsers de locale estadounidense vs europeo. Para datos tabulares con tipos fiables, usa Parquet (binario columnar con esquema), Apache Arrow o SQLite.

Edición ligera (anotaciones, firmas, campos de formulario) es viable en cualquier lector PDF. Edición estructural (cambiar párrafos, reemplazar imágenes) es incómoda — PDF es un formato de presentación, no de edición. El flujo robusto es: mantén el origen DOCX/MD/HTML como máster y regenera el PDF cuando haya cambios. Las herramientas que "editan PDF" hacen ingeniería inversa del layout y suelen romperlo.

Usamos cookies y tecnologías similares para personalizar contenido y anuncios, y para analizar el tráfico. Más información sobre cookies.