Todo proyecto de datos empieza con una pregunta sencilla: ¿qué forma tienen estos datos? La respuesta decide dónde puedes almacenarlos, qué herramientas pueden leerlos y cuánto trabajo hace falta antes de poder analizarlos. Data+ agrupa los datos en tres formas: estructurados, semiestructurados y no estructurados.
Los datos estructurados siguen un esquema fijo: cada registro tiene los mismos campos, cada campo tiene un tipo definido y los datos encajan de forma natural en filas y columnas. Una tabla de pedidos en una base de datos relacional, con las columnas OrderID, CustomerID, OrderDate y Amount, es el ejemplo clásico. Las hojas de cálculo organizadas como tablas limpias también son estructuradas. Como la forma se conoce de antemano, puedes consultar los datos estructurados directamente con SQL, y son el tipo más fácil de agregar, unir y graficar.
Los datos semiestructurados llevan sus propias etiquetas, pero no obligan a que todos los registros tengan la misma forma. JSON y XML son los ejemplos comunes: cada valor está junto a una clave o dentro de una etiqueta que indica qué es, pero un registro puede tener campos que otro no tiene, y los valores pueden estar anidados (un pedido que contiene una lista de líneas de artículos). Los archivos de log con pares key=value, los encabezados de correo electrónico y muchas respuestas de API son semiestructurados. Normalmente analizas (parse) o aplanas estos datos en tablas antes del análisis, y las bases de datos modernas y herramientas como pandas pueden leerlos directamente.
Los datos no estructurados no tienen un modelo de datos que una consulta pueda usar. El texto libre en correos, mensajes de chat y documentos, los PDF, las imágenes, el audio y el video entran aquí. La mayor parte de los datos del mundo es no estructurada y a menudo contiene información valiosa, como el motivo por el que un cliente está insatisfecho, pero necesitas procesamiento adicional para convertirla en campos analizables. Algunos ejemplos son el procesamiento de lenguaje natural para puntuar el sentimiento, el reconocimiento óptico de caracteres para extraer texto de formularios escaneados, o etiquetas asignadas por una persona o un modelo.
Presta atención a los casos mixtos. Un correo electrónico es semiestructurado en sus encabezados (From, To, Date) y no estructurado en su cuerpo. Un archivo CSV es estructurado si todas las filas tienen las mismas columnas, aunque sea solo un archivo de texto. Una tabla de base de datos puede contener una columna no estructurada, como un campo de comentarios. Cuando una pregunta te pida clasificar datos, fíjate si un esquema consistente los describe, si se autodescriben con claves o etiquetas, o si no tienen ningún modelo.
Términos clave
- Structured data (datos estructurados)
- Datos que siguen un esquema fijo de campos y tipos, como las filas de una tabla relacional.
- Semi-structured data (datos semiestructurados)
- Datos autodescriptivos con claves o etiquetas pero con una forma flexible, como JSON o XML.
- Unstructured data (datos no estructurados)
- Datos sin un modelo predefinido que las consultas puedan usar, como texto libre, imágenes, audio y video.
- Schema (esquema)
- La definición de los campos, tipos y relaciones que se espera que sigan los datos.
Un equipo de soporte quiere saber por qué cancelan los clientes. Los datos de las cuentas y las fechas de cancelación están en una tabla estructurada del CRM, los metadatos de los tickets llegan como JSON desde la API del helpdesk, y los motivos reales están en transcripciones de chat en texto libre. El analista une los datos estructurados y los JSON por ID de cliente y luego usa un paso de clasificación de texto para etiquetar cada transcripción con un motivo, convirtiendo el texto no estructurado en una columna que se puede contar.
Comprueba lo que sabes
Una API web devuelve registros donde algunos objetos contienen una clave opcional 'discount' y una lista anidada de artículos. ¿Cómo se clasifican estos datos?
Semiestructurados. Se autodescriben con claves, pero no todos los registros comparten un esquema fijo.
¿Por qué los datos no estructurados suelen necesitar procesamiento adicional antes del análisis?
No tienen campos que las consultas puedan filtrar o agregar, así que primero debes extraer características como el sentimiento, palabras clave o el texto de las imágenes.