Data+ / Lecciones en español · English
Lecciones de Data+ DA0-002
- Datos estructurados, semiestructurados y no estructurados, con ejemplos de cada uno
- Bases de datos relacionales: tablas, claves primarias y foráneas, normalización y relaciones
- Bases de datos no relacionales: almacenes de documentos, clave-valor, familias de columnas y grafos
- Tipos de datos: cadenas, enteros, decimales, fechas y horas, booleanos y conversión de tipos
- Formatos de archivo: CSV, TSV, JSON, XML, Parquet, hojas de cálculo y archivos planos
- Data warehouses, data marts, data lakes y lakehouses; OLTP vs. OLAP
- Modelado dimensional: tablas de hechos y dimensiones, esquemas en estrella y copo de nieve, dimensiones de cambio lento
- Entornos de datos: on-premises vs. nube, y herramientas como hojas de cálculo, clientes SQL, notebooks y plataformas de BI
- Lenguajes para análisis: SQL, Python y R, y cuándo usar cada uno
- Conceptos de IA y automatización para analistas: machine learning, IA generativa, modelos de lenguaje grandes, NLP y RPA
- Métodos de adquisición de datos: extracciones de bases de datos, API, web scraping, exportaciones de archivos, encuestas y muestreo
- ETL vs. ELT y pipelines de datos: por lotes vs. streaming, cargas completas vs. incrementales
- Escribir consultas SQL: SELECT, WHERE, ORDER BY, GROUP BY y HAVING
- Combinar datos: joins internos, izquierdos, derechos y completos, uniones y anexado
- Problemas de calidad de datos: duplicados, valores faltantes, valores inválidos, valores atípicos, formatos inconsistentes y redundancia
- Manejo de datos faltantes: eliminación, imputación y marcado
- Transformación de datos: parsing, división y concatenación de campos, conversión de tipos, recodificación y variables derivadas
- Escalado y agrupación: normalización, estandarización, binning y agregación
- Reorganizar datos: pivotar y despivotar, formato ancho vs. largo, filtrar y ordenar
- Optimización de consultas: índices, filtrar pronto, evitar SELECT *, subconjuntos y tablas temporales
- Medidas de tendencia central: media, mediana y moda, y cómo las afecta el sesgo
- Medidas de dispersión: rango, varianza, desviación estándar, rango intercuartílico y percentiles
- Distribuciones: distribución normal, asimetría, la regla empírica y los z-scores
- Estadística descriptiva en la práctica: conteos, frecuencias, porcentajes, cambio porcentual y razones
- Estadística inferencial: muestras vs. poblaciones, intervalos de confianza, pruebas de hipótesis y p-values
- Errores Tipo I y Tipo II, significancia estadística y tamaño de muestra
- Correlación vs. causalidad, y regresión lineal simple
- Tipos de análisis: exploratorio, descriptivo, diagnóstico, predictivo, prescriptivo y de tendencias
- Análisis de desempeño: KPI, métricas, metas y variación respecto al plan
- Elegir herramientas y funciones de análisis: fórmulas de hojas de cálculo, agregados y funciones de ventana de SQL, bibliotecas de Python y R
- Verificar y solucionar problemas en los resultados: comprobaciones de sensatez, conciliación y errores de cálculo comunes
- Elegir un gráfico: barras, líneas, circular, dispersión, histograma, diagrama de caja, mapa de calor, mapa y tabla
- Diseño de dashboards: distribución, público, KPI, filtros, drill-down e interactividad
- Principios de diseño: color, etiquetas, títulos, escalas y ejes, accesibilidad y cómo evitar gráficos engañosos
- Tipos de reportes: estáticos vs. dinámicos, ad hoc vs. recurrentes, de autoservicio y resúmenes ejecutivos
- Comunicar hallazgos: conocer al público, contar historias con datos e indicar las limitaciones
- Elementos de un reporte: información de portada, metodología, fuentes de datos, fechas de actualización, avisos y apéndices
- Entrega y actualización: actualización programada, datos en tiempo real vs. instantáneas, suscripciones y distribución
- Control de versiones de reportes, guías de estilo e imagen corporativa
- Solución de problemas en reportes y dashboards: datos desactualizados, filtros rotos, totales incorrectos y bajo rendimiento
- Roles de gobernanza de datos: propietario, administrador (steward), custodio y consumidor de datos
- Metadatos, diccionarios de datos, catálogos de datos y linaje de datos
- Dimensiones de la calidad de datos: exactitud, completitud, consistencia, validez, oportunidad y unicidad
- Control de calidad de datos: reglas de validación, perfilado, métricas de calidad y monitoreo
- Gestión de datos maestros y fuente única de verdad
- Datos sensibles: PII, PHI y datos de tarjetas de pago; niveles de clasificación de datos
- Privacidad y cumplimiento: GDPR, HIPAA, PCI DSS, soberanía de datos y políticas de retención
- Proteger los datos: control de acceso y mínimo privilegio, enmascaramiento, anonimización, seudonimización y cifrado
- Ciclo de vida de los datos: recolección, almacenamiento, uso, intercambio, archivado y eliminación segura