Lecciones en español / Data+ / Hoja de repaso · English
Hoja de repaso de Data+ DA0-002
Dominio 1: Data concepts and environments (18%)
Consejos para el examen
- JSON y XML son los ejemplos típicos de datos semiestructurados. Si una pregunta menciona campos anidados, claves opcionales o etiquetas, elige semiestructurados; si menciona fotos, grabaciones o texto libre, elige no estructurados.
- Si una pregunta te pide qué columna vincula dos tablas, la respuesta es la clave foránea en la tabla del lado 'muchos'. Si pregunta qué elimina los datos repetidos del cliente en cada fila de pedido, la respuesta es la normalización.
- Relaciona la palabra clave con el tipo: registros JSON flexibles significa documentos; búsqueda solo por ID significa clave-valor; escrituras masivas de series de tiempo significa familias de columnas; relaciones y saltos significa grafos.
- Los números con los que nunca haces cálculos (códigos postales, teléfonos, IDs) deben ser texto. Para dinero, elige decimal en lugar de float.
- Columnar más comprimido más analítica significa Parquet. Datos anidados de una API significa JSON. Intercambio tabular simple, universal y sin tipos significa CSV.
- Schema on write significa warehouse; schema on read significa lake. Transacciones significa OLTP; análisis significa OLAP.
- Las medidas van en los hechos; las descripciones van en las dimensiones. Conservar el historial significa SCD Type 2; sobrescribir significa Type 1. Dimensiones divididas en subtablas significa copo de nieve.
- Código reproducible más narrativa significa notebook; dashboards interactivos para usuarios de negocio significa plataforma de BI; capacidad elástica y de pago por uso significa nube.
- Consultar y agregar datos donde viven apunta a SQL; automatización y machine learning apuntan a Python; análisis estadístico intensivo apunta a R. Espera tener que leer fragmentos cortos de código y decir qué hacen.
- La automatización de interfaz basada en reglas es RPA, no machine learning. Predecir una etiqueta conocida es aprendizaje supervisado; encontrar grupos sin etiquetas es no supervisado. Los resultados de un LLM siempre deben validarse.
Términos clave
- Structured data (datos estructurados)
- Datos que siguen un esquema fijo de campos y tipos, como las filas de una tabla relacional.
- Semi-structured data (datos semiestructurados)
- Datos autodescriptivos con claves o etiquetas pero con una forma flexible, como JSON o XML.
- Unstructured data (datos no estructurados)
- Datos sin un modelo predefinido que las consultas puedan usar, como texto libre, imágenes, audio y video.
- Schema (esquema)
- La definición de los campos, tipos y relaciones que se espera que sigan los datos.
- Primary key (clave primaria)
- Una columna o conjunto de columnas cuyos valores identifican de forma única cada fila y nunca son nulos.
- Foreign key (clave foránea)
- Una columna que hace referencia a la clave primaria de otra tabla, vinculando las tablas y haciendo cumplir la integridad referencial.
- Normalization (normalización)
- Organizar las tablas en formas normales (1NF, 2NF, 3NF) para que cada hecho se almacene una sola vez, reduciendo la redundancia y las anomalías de actualización.
- Junction table (tabla de unión)
- Una tabla que contiene pares de claves foráneas y resuelve una relación de muchos a muchos.
- Document store (almacén de documentos)
- Una base de datos NoSQL que almacena documentos autocontenidos, a menudo anidados y parecidos a JSON, con campos flexibles.
- Key-value store (almacén clave-valor)
- Una base de datos NoSQL que guarda y recupera valores mediante una clave única, optimizada para búsquedas rápidas.
- Column-family store (almacén de familias de columnas)
- Una base de datos NoSQL distribuida cuyas filas contienen conjuntos variables de columnas agrupadas en familias, adecuada para cargas de escritura intensas.
- Graph database (base de datos de grafos)
- Una base de datos que almacena nodos y relaciones como datos de primera clase, optimizada para recorrer conexiones.
- String (cadena)
- Un tipo de dato de texto que guarda caracteres; se usa para nombres y para identificadores de aspecto numérico, como los códigos postales.
- Decimal (numeric)
- Un tipo numérico exacto con precisión y escala fijas, adecuado para montos de dinero.
- Floating point (punto flotante)
- Un tipo numérico aproximado guardado en binario que puede introducir pequeños errores de redondeo.
- Casting (conversión de tipos)
- Convertir explícitamente un valor de un tipo de dato a otro, por ejemplo de texto a fecha.
- CSV
- Comma-separated values (valores separados por comas): un archivo plano de texto con un registro por línea y campos delimitados por comas.
- JSON
- Un formato de texto de pares clave-valor y arreglos que admite anidamiento; común en las API.
- Parquet
- Un formato de archivo binario, columnar y comprimido, que guarda los tipos de datos y está hecho para consultas analíticas.
- Delimiter (delimitador)
- El carácter que separa los campos en un archivo plano, como una coma, una tabulación o una barra vertical (pipe).
- OLTP
- Online transaction processing (procesamiento de transacciones en línea): sistemas optimizados para muchas lecturas y escrituras pequeñas y rápidas que hacen funcionar el negocio.
- OLAP
- Online analytical processing (procesamiento analítico en línea): sistemas optimizados para consultas analíticas complejas, principalmente de lectura, sobre datos históricos.
- Data warehouse (almacén de datos)
- Un repositorio central de datos históricos integrados, limpios y estructurados, modelados para reportes (schema on write).
- Data lake (lago de datos)
- Un repositorio de datos sin procesar en formatos nativos donde la estructura se aplica al leerlos (schema on read).
- Data mart
- Un subconjunto temático de datos al estilo warehouse para un equipo o función.
- Fact table (tabla de hechos)
- Una tabla de medidas numéricas de eventos de negocio con una granularidad definida, con claves foráneas a las dimensiones.
- Dimension table (tabla de dimensiones)
- Una tabla de atributos descriptivos (como producto, cliente o fecha) que se usan para filtrar y agrupar los hechos.
- Star schema (esquema en estrella)
- Un diseño con una tabla de hechos central unida directamente a tablas de dimensiones desnormalizadas.
- Snowflake schema (esquema en copo de nieve)
- Un esquema en estrella cuyas dimensiones están normalizadas en subtablas relacionadas.
- Slowly changing dimension, SCD (dimensión de cambio lento)
- Un método para manejar cambios en los atributos de las dimensiones; el Type 1 sobrescribe y el Type 2 agrega una fila nueva para conservar el historial.
- On-premises (local)
- Infraestructura que la organización posee y opera en sus propias instalaciones.
- Cloud (nube)
- Cómputo y almacenamiento alquilados bajo demanda a un proveedor, a menudo como servicios administrados que se cobran por uso.
- Notebook
- Un documento interactivo que combina código ejecutable, resultados y texto narrativo, como Jupyter.
- BI platform (plataforma de BI)
- Software que se conecta a los datos, los modela y publica dashboards y reportes interactivos.
- SQL
- Un lenguaje declarativo para consultar y administrar datos en bases de datos relacionales.
- pandas
- Una biblioteca de Python para trabajar con datos tabulares en DataFrames.
- R
- Un lenguaje de programación y entorno diseñado para computación estadística y gráficos.
- Declarative language (lenguaje declarativo)
- Un lenguaje en el que indicas el resultado que quieres en lugar de los pasos para producirlo.
- Supervised learning (aprendizaje supervisado)
- Machine learning entrenado con ejemplos etiquetados para predecir una etiqueta o un valor en datos nuevos.
- Large language model, LLM (modelo de lenguaje grande)
- Un modelo fundacional entrenado con grandes cantidades de texto que genera e interpreta lenguaje.
- Natural language processing, NLP (procesamiento de lenguaje natural)
- Técnicas que permiten a las computadoras analizar y generar lenguaje humano, como el análisis de sentimiento.
- Robotic process automation, RPA (automatización robótica de procesos)
- Bots de software que repiten tareas de interfaz de usuario basadas en reglas, como la captura de datos, sin aprender.
Dominio 2: Data acquisition and preparation (22%)
Consejos para el examen
- Si existe una API, casi siempre es la respuesta preferida frente al scraping. En encuestas, busca el método de muestreo que garantiza que todos los subgrupos estén representados: el estratificado.
- Transformar antes de cargar es ETL; transformar dentro del warehouse después de cargar es ELT. Necesidades del orden de segundos significa streaming. Solo filas modificadas significa incremental.
- Una condición sobre una sola fila significa WHERE; una condición sobre un total, un conteo o un promedio significa HAVING. Las comparaciones con NULL necesitan IS NULL, nunca = NULL.
- 'Incluir registros aunque no tengan coincidencia' significa un outer join (normalmente LEFT). 'Apilar archivos con las mismas columnas' significa UNION o append. Si un join aumenta el número de filas de forma inesperada, sospecha de claves duplicadas.
- Conoce la solución que corresponde a cada problema: deduplicar los duplicados, estandarizar los formatos inconsistentes, validar los valores inválidos, investigar los valores atípicos antes de eliminarlos, e imputar o marcar los valores faltantes.
- Para datos numéricos sesgados, como ingresos o precios de viviendas, la imputación por la mediana es mejor que por la media. Reemplazar los espacios en blanco con cero casi siempre es incorrecto, salvo que cero sea el valor real.
- Dividir un campo en varios significa parsing; unir varios en uno significa concatenación; crear una nueva columna calculada significa una variable derivada.
- Rango de 0 a 1 significa normalización min-max; media 0 y desviación estándar 1 significa estandarización. No promedies promedios; agrega a partir de los totales subyacentes.
- De columnas a filas es despivotar (unpivot); de filas a columnas es pivotar (pivot). Las herramientas de BI y las bases de datos generalmente quieren el formato largo.
- Indexa las columnas por las que filtras y haces joins, filtra lo antes posible y nombra solo las columnas que necesitas. Filtrar después de que los datos llegan a la herramienta de BI es la respuesta lenta.
Términos clave
- API
- Una interfaz que permite a los programas solicitar datos a un sistema de forma documentada y estructurada, a menudo por HTTPS y devolviendo JSON.
- Web scraping
- Extraer datos descargando e interpretando páginas web; se usa cuando no hay una API disponible.
- Stratified sampling (muestreo estratificado)
- Dividir una población en grupos y muestrear aleatoriamente dentro de cada grupo.
- Sampling bias (sesgo de muestreo)
- Error sistemático que ocurre cuando una muestra no representa a la población que debería describir.
- ETL
- Extract, transform, load: los datos se transforman en una capa separada antes de cargarlos en el destino.
- ELT
- Extract, load, transform: los datos sin procesar se cargan primero y se transforman dentro del sistema de destino.
- Incremental load (carga incremental)
- Una carga que procesa solo los registros nuevos o modificados desde la ejecución anterior.
- Change data capture, CDC (captura de datos de cambios)
- Una técnica que identifica y entrega los cambios realizados en una base de datos de origen, a menudo a partir de su registro de transacciones.
- WHERE
- Una cláusula que filtra filas individuales antes de agrupar.
- GROUP BY
- Una cláusula que combina en grupos las filas con los mismos valores para agregarlas.
- HAVING
- Una cláusula que filtra grupos después de la agregación, lo que permite condiciones sobre funciones de agregación.
- Aggregate function (función de agregación)
- Una función como COUNT, SUM, AVG, MIN o MAX que resume muchas filas en un solo valor.
- Inner join
- Devuelve solo las filas con claves coincidentes en ambas tablas.
- Left join
- Devuelve todas las filas de la tabla izquierda más las coincidencias de la derecha, con NULL donde no hay coincidencia.
- UNION ALL
- Apila las filas de dos conjuntos de resultados con las mismas columnas y conserva los duplicados; UNION los elimina.
- Fan-out
- Duplicación de filas causada por unir con una tabla que tiene valores de clave repetidos, lo que infla los totales.
- Duplicate record (registro duplicado)
- Un registro que representa la misma entidad o el mismo evento que otro registro del conjunto de datos.
- Invalid value (valor inválido)
- Un valor que rompe las reglas de un campo en cuanto a tipo, rango, formato o valores permitidos.
- Outlier (valor atípico)
- Un valor que se encuentra lejos de la mayoría de los demás; puede ser un error o un extremo real.
- Redundancy (redundancia)
- Guardar los mismos datos en varios lugares, lo que crea el riesgo de inconsistencias entre las copias.
- Listwise deletion (eliminación por lista)
- Eliminar todos los registros que tengan un valor faltante en cualquier campo que use el análisis.
- Imputation (imputación)
- Reemplazar los valores faltantes con valores estimados, como la media, la mediana, la moda o la predicción de un modelo.
- Missing at random (faltante al azar)
- Cuando la probabilidad de que falte un valor no está relacionada con el propio valor faltante, de modo que los datos restantes siguen siendo representativos.
- Imputation flag (indicador de imputación)
- Una columna indicadora que marca qué valores se rellenaron en lugar de haberse observado.
- Parsing (análisis sintáctico)
- Extraer partes significativas de una cadena o un documento estructurado, como dividir un nombre por una coma.
- Concatenation (concatenación)
- Unir dos o más valores en una sola cadena.
- Recoding (recodificación)
- Asignar a los valores existentes valores nuevos, estandarizados o agrupados.
- Derived variable (variable derivada)
- Un campo nuevo calculado a partir de campos existentes, como el margen de ganancia o los días hasta el envío.
- Min-max normalization (normalización min-max)
- Reescalar los valores a un rango fijo, normalmente de 0 a 1, usando el mínimo y el máximo.
- Standardization (estandarización)
- Convertir los valores en z-scores con media 0 y desviación estándar 1.
- Binning (agrupación en intervalos)
- Agrupar valores continuos en rangos o categorías.
- Aggregation (agregación)
- Resumir filas detalladas en totales o estadísticas de un nivel superior, como por mes y por región.
- Wide format (formato ancho)
- Una organización con una fila por sujeto y las mediciones repetidas repartidas en columnas.
- Long (tidy) format (formato largo u ordenado)
- Una organización con una fila por observación, que usa columnas de atributo y de valor.
- Pivot (pivotar)
- Reorganizar datos largos en anchos, convirtiendo valores de fila en encabezados de columna con celdas agregadas.
- Unpivot / melt (despivotar)
- Reorganizar datos anchos en largos, convirtiendo los encabezados de columna en valores de una nueva columna de atributo.
- Index (índice)
- Una estructura de datos que acelera la búsqueda de filas por los valores de una columna, a costa de almacenamiento y escrituras más lentas.
- Execution plan (plan de ejecución)
- La descripción que hace la base de datos de cómo ejecutará una consulta, incluidos los recorridos, los joins y el uso de índices.
- Temporary table (tabla temporal)
- Una tabla que guarda un resultado intermedio durante la sesión actual para que los pasos posteriores puedan reutilizarlo.
- Common table expression, CTE (expresión de tabla común)
- Una subconsulta con nombre definida con WITH que hace que las consultas complejas sean más fáciles de leer.
Dominio 3: Data analysis (24%)
Consejos para el examen
- Datos sesgados o con valores atípicos significa elegir la mediana. Datos categóricos significa la moda. Sesgo a la derecha significa media mayor que la mediana.
- Memoriza los límites de valores atípicos del IQR: Q1 − 1.5 × IQR y Q3 + 1.5 × IQR. La desviación estándar muestral divide entre n − 1; la poblacional divide entre N.
- Apréndete de memoria 68-95-99.7 y z = (x − media) ÷ SD. Un histograma con dos picos sugiere dos poblaciones que deberían analizarse por separado.
- El cambio porcentual siempre se divide entre el valor anterior. Distingue los puntos porcentuales de los porcentajes. Compara grupos de distintos tamaños con razones o tasas, no con totales brutos.
- p < alpha significa rechazar la hipótesis nula; de lo contrario, no se rechaza, nunca se 'acepta' ni se 'demuestra'. Muestras más grandes significan intervalos de confianza más estrechos.
- Falso positivo es Tipo I (alpha); falso negativo es Tipo II (beta). Las muestras más grandes aumentan la potencia (menos errores Tipo II) con el mismo alpha; la tasa de error Tipo I la fija alpha, no el tamaño de la muestra.
- r está entre −1 y 1, y el signo indica la dirección. En el examen, la correlación nunca es prueba de causalidad. Sustituye los números en la ecuación de regresión con cuidado: multiplica la pendiente por x y luego suma el intercepto.
- Relaciona la palabra de la pregunta: qué pasó es descriptivo, por qué es diagnóstico, qué pasará es predictivo, qué deberíamos hacer es prescriptivo. El perfilado abierto de datos nuevos es exploratorio.
- Un KPI necesita una definición medible y una meta. El porcentaje de variación se divide entre el plan. Conoce la diferencia entre indicadores adelantados y rezagados, con un ejemplo de cada uno.
- GROUP BY reduce las filas; las funciones de ventana conservan todas las filas. Totales acumulados, clasificaciones y comparaciones con el periodo anterior apuntan a funciones de ventana.
- Si un total es exactamente el doble o sospechosamente alto después de un join, sospecha de fan-out por claves duplicadas. Si desaparecieron registros, sospecha de un inner join o de un filtro olvidado.
Términos clave
- Mean (media)
- La suma de los valores dividida entre su cantidad; sensible a los valores atípicos.
- Median (mediana)
- El valor central de los datos ordenados; robusto frente a valores atípicos y sesgo.
- Mode (moda)
- El valor más frecuente; la única medida central para datos categóricos.
- Right skew (sesgo a la derecha)
- Una distribución con una cola larga de valores altos, donde la media suele ser mayor que la mediana.
- Standard deviation (desviación estándar)
- La raíz cuadrada de la varianza; la distancia típica de los valores respecto de la media, en las propias unidades de los datos.
- Variance (varianza)
- El promedio de las desviaciones al cuadrado respecto de la media.
- Interquartile range, IQR (rango intercuartílico)
- Q3 menos Q1: la dispersión del 50% central de los datos.
- Percentile (percentil)
- El valor por debajo del cual cae un porcentaje indicado de las observaciones.
- Normal distribution (distribución normal)
- Una distribución simétrica en forma de campana en la que la media, la mediana y la moda son iguales.
- Empirical rule (regla empírica)
- En una distribución normal, alrededor del 68%, el 95% y el 99.7% de los valores caen dentro de 1, 2 y 3 desviaciones estándar de la media.
- Z-score
- El número de desviaciones estándar a las que un valor está de la media: (x − media) ÷ SD.
- Bimodal distribution (distribución bimodal)
- Una distribución con dos picos, que a menudo indica dos grupos mezclados.
- Frequency distribution (distribución de frecuencias)
- Una tabla o un gráfico que muestra con qué frecuencia aparece cada valor o categoría.
- Percent change (cambio porcentual)
- (nuevo − anterior) ÷ anterior × 100: el cambio relativo respecto del valor anterior.
- Percentage point (punto porcentual)
- La diferencia aritmética entre dos porcentajes; por ejemplo, pasar del 4% al 5% es 1 punto.
- Ratio (razón)
- Una comparación entre dos cantidades, como agentes por cada 1,000 clientes.
- Population vs sample (población vs. muestra)
- El grupo completo de interés frente al subconjunto que realmente se mide para estimarlo.
- Confidence interval (intervalo de confianza)
- Un rango, calculado a partir de una muestra, que probablemente contiene el valor real de la población con un nivel de confianza indicado.
- Null hypothesis (hipótesis nula)
- La afirmación por defecto de que no hay efecto ni diferencia, contra la cual una prueba busca evidencia.
- p-value
- La probabilidad de obtener resultados al menos tan extremos como los observados, suponiendo que la hipótesis nula es verdadera.
- Type I error (error Tipo I)
- Un falso positivo: rechazar una hipótesis nula que en realidad es verdadera; su probabilidad es alpha.
- Type II error (error Tipo II)
- Un falso negativo: no rechazar una hipótesis nula que en realidad es falsa; su probabilidad es beta.
- Statistical power (potencia estadística)
- La probabilidad (1 − beta) de que una prueba detecte un efecto que realmente existe.
- Practical significance (significancia práctica)
- Si un efecto es lo bastante grande como para importar en el mundo real, independientemente de su p-value.
- Correlation coefficient, r (coeficiente de correlación)
- Un valor de −1 a +1 que mide la fuerza y la dirección de una relación lineal.
- Confounding variable (variable de confusión)
- Una tercera variable que influye en las dos variables estudiadas y crea una asociación engañosa.
- Slope (pendiente)
- En la regresión, el cambio promedio de y por cada aumento de una unidad en x.
- R-squared (coeficiente de determinación)
- La proporción de la variación de la variable dependiente que explica el modelo.
- Exploratory data analysis (análisis exploratorio de datos)
- Investigación inicial y abierta de los datos para entender su estructura, calidad y patrones.
- Diagnostic analysis (análisis diagnóstico)
- Análisis que explica por qué ocurrió un resultado, a menudo profundizando y segmentando.
- Predictive analysis (análisis predictivo)
- Análisis que usa datos históricos para pronosticar resultados o probabilidades futuros.
- Prescriptive analysis (análisis prescriptivo)
- Análisis que recomienda la mejor acción, a menudo usando optimización o simulación.
- KPI
- Un indicador clave de desempeño: una métrica vinculada a un objetivo estratégico, con una meta definida.
- Leading indicator (indicador adelantado)
- Una medida que cambia antes que un resultado y ayuda a predecirlo.
- Lagging indicator (indicador rezagado)
- Una medida que refleja resultados que ya ocurrieron.
- Variance to plan (variación respecto al plan)
- La diferencia entre los resultados reales y la meta o el presupuesto, a menudo expresada también como porcentaje del plan.
- Window function (función de ventana)
- Una función de SQL que calcula sobre un conjunto de filas relacionadas usando OVER, sin reducirlas a grupos.
- PARTITION BY
- La parte de la definición de una ventana que reinicia el cálculo para cada grupo, como cada región.
- XLOOKUP
- Una función de hoja de cálculo que busca una clave en un rango y devuelve el valor correspondiente de otro rango.
- LAG
- Una función de ventana que devuelve un valor de una fila anterior; se usa para comparaciones entre periodos.
- Sanity check (comprobación de sensatez)
- Una prueba rápida de si un resultado es plausible, como comparar su magnitud con lo esperado.
- Reconciliation (conciliación)
- Comparar los resultados con una fuente independiente de confianza para confirmar que coinciden.
- Control total (total de control)
- Una suma o un conteo conocidos que se usan para verificar que los datos se procesaron de forma completa y correcta.
- Integer division (división entera)
- La división de números enteros que descarta el residuo, como 7 / 2 que devuelve 3 en algunos dialectos de SQL.
Dominio 4: Visualization and reporting (20%)
Consejos para el examen
- Tendencia en el tiempo significa líneas; comparación de categorías significa barras; relación significa dispersión; distribución significa histograma o diagrama de caja; partes de un todo con pocas categorías significa gráfico circular o barra apilada al 100%.
- Adapta el tipo de dashboard al público: estratégico para ejecutivos, táctico para gerentes, operativo para personal que trabaja en tiempo real. Coloca los KPI clave arriba a la izquierda.
- Las barras empiezan en cero. No codifiques significado solo con el color. Una paleta divergente sirve para valores por encima y por debajo de la meta; una paleta secuencial sirve para valores de bajo a alto.
- Un registro formal que no debe cambiar significa estático. Monitoreo continuo con interacción significa dinámico. Una pregunta puntual significa ad hoc. Usuarios de negocio que construyen sus propias vistas significa autoservicio.
- Empieza con la conclusión ante los ejecutivos, adapta el detalle al público e indica siempre las limitaciones. Los hallazgos correlacionales deben presentarse como asociaciones, no como causas demostradas.
- El detalle que respalda pero satura va en un apéndice. Qué tan actuales son los datos se responde con la fecha de actualización o de corte. Cómo se produjeron las cifras se responde con la metodología.
- Necesidades operativas de reaccionar al momento significan tiempo real; la historia formal de cierre de mes significa instantánea. Si un reporte programado muestra datos viejos, revisa si la actualización se ejecutó después de la carga previa y si falló.
- Copias contradictorias apuntan a control de versiones con números, fechas y un registro de cambios, además de una única ubicación oficial. Fuentes, colores y formatos consistentes apuntan a una guía de estilo.
- Datos viejos significa revisar el historial de actualizaciones, las credenciales y las cargas previas. Un filtro que no afecta a un visual significa revisar las relaciones y las conexiones del segmentador. Totales duplicados significa sospechar de claves duplicadas o de joins de muchos a muchos.
Términos clave
- Histogram (histograma)
- Un gráfico de la distribución de una variable numérica, con barras adyacentes que muestran los conteos en cada rango de valores (bin).
- Box plot (diagrama de caja)
- Un gráfico que resume una distribución con su mediana, cuartiles, bigotes y valores atípicos.
- Choropleth map (mapa de coropletas)
- Un mapa que sombrea áreas geográficas según el valor de una medida.
- Scatter plot (diagrama de dispersión)
- Un gráfico que representa dos variables numéricas una frente a la otra, con un punto por registro.
- KPI card (tarjeta de KPI)
- Un visual de dashboard que muestra una sola medida clave, normalmente con una comparación con la meta o con un periodo anterior.
- Drill-down
- Navegar desde datos resumidos hacia niveles más detallados de una jerarquía dentro de un visual.
- Slicer / filter (segmentador o filtro)
- Un control interactivo que limita los datos que se muestran en los visuales de un dashboard.
- Wireframe
- Un bosquejo sencillo de la distribución de un dashboard que se usa para acordar el contenido antes de construirlo.
- Sequential palette (paleta secuencial)
- Tonos de un mismo color de claro a oscuro, que se usan para valores ordenados de bajo a alto.
- Diverging palette (paleta divergente)
- Dos tonos contrastantes alrededor de un punto medio neutro, que se usan para valores por encima y por debajo de una referencia.
- Truncated axis (eje truncado)
- Un eje de valores que no empieza en cero, lo que exagera las diferencias en los gráficos de barras.
- Chart junk
- Elementos visuales como efectos 3D y líneas de cuadrícula pesadas que no agregan información y distraen de los datos.
- Static report (reporte estático)
- Un reporte fijo, como un PDF, que captura los datos en un momento dado y no cambia.
- Dynamic report (reporte dinámico)
- Un reporte conectado a los datos que se actualiza y permite interacción, como filtrar y hacer drill-down.
- Ad hoc report (reporte ad hoc)
- Un reporte puntual creado para responder una pregunta específica.
- Self-service reporting (reportes de autoservicio)
- Permitir que los usuarios de negocio construyan sus propios reportes a partir de fuentes de datos gobernadas y confiables.
- Data storytelling (contar historias con datos)
- Presentar los hallazgos de datos como una narrativa estructurada de contexto, hallazgo y recomendación.
- Limitation (limitación)
- Una debilidad o restricción conocida de un análisis, como datos faltantes o una muestra pequeña.
- Assumption (supuesto)
- Una condición que se da por cierta en un análisis, como precios estables, y que los lectores deben conocer.
- Actionable insight (hallazgo accionable)
- Un hallazgo lo bastante específico como para que una parte interesada pueda decidir o actuar a partir de él.
- Methodology (metodología)
- La descripción de cómo se realizó el análisis, incluida la preparación de los datos y los cálculos.
- Data as-of date (fecha de corte de los datos)
- El momento que reflejan los datos del reporte, que se muestra para que los lectores sepan qué tan actuales son.
- Disclaimer (aviso)
- Una nota que limita cómo debe interpretarse o usarse el reporte, como 'cifras preliminares, no auditadas'.
- Appendix (apéndice)
- Una sección al final de un reporte que contiene detalle de apoyo, como tablas completas y definiciones.
- Scheduled refresh (actualización programada)
- Una actualización automatizada de los datos importados de un reporte en horarios establecidos.
- Live / direct connection (conexión en vivo o directa)
- Una conexión de reporte que consulta el origen cada vez que los usuarios interactúan, de modo que los datos siempre están actualizados.
- Snapshot (instantánea)
- Una copia almacenada de los valores de los datos en un momento dado, que se usa para reportar la historia tal como era.
- Subscription (suscripción)
- Una entrega programada de un reporte o un enlace a los usuarios, a menudo por correo electrónico.
- Version control (control de versiones)
- Registrar y gestionar los cambios de archivos o reportes a lo largo del tiempo, con la posibilidad de comparar y restaurar versiones.
- Change log (registro de cambios)
- Un registro de qué cambió en cada versión, cuándo, por qué y quién lo hizo.
- Style guide (guía de estilo)
- Un conjunto documentado de reglas sobre fuentes, colores, formatos, terminología y convenciones de gráficos.
- Template (plantilla)
- Una distribución y un tema predefinidos a partir de los cuales empiezan los reportes nuevos para garantizar la consistencia.
- Stale data (datos desactualizados)
- Datos de un reporte que son más viejos de lo esperado debido a una actualización o un pipeline fallidos o mal sincronizados.
- Data model relationship (relación del modelo de datos)
- Un vínculo entre tablas de un modelo de BI que permite que los filtros y los cálculos fluyan entre ellas.
- Cardinality (cardinalidad)
- El número de valores distintos de una columna, o la naturaleza uno a uno, uno a muchos o muchos a muchos de una relación.
- Pre-aggregation (preagregación)
- Resumir de antemano los datos detallados al nivel que necesitan los visuales, para acelerar las consultas.
Dominio 5: Data governance (16%)
Consejos para el examen
- Decide y rinde cuentas significa propietario. Define y mantiene la calidad significa steward. Implementa controles técnicos como respaldos, permisos y cifrado significa custodio.
- De dónde vinieron los datos y qué los transformó significa linaje. Qué significa una columna significa diccionario de datos. Un inventario de conjuntos de datos en el que se puede buscar significa catálogo de datos.
- Faltante significa completitud; formato incorrecto o valor imposible significa validez; desacuerdo entre sistemas significa consistencia; duplicados significa unicidad; desactualizado significa oportunidad; no coincide con la realidad significa exactitud.
- El perfilado descubre cómo son los datos; las reglas de validación imponen cómo deberían ser; el monitoreo ejecuta las reglas continuamente con alertas. Corrige en el origen cuando puedas.
- El mismo cliente o producto con datos distintos en varios sistemas apunta a la gestión de datos maestros. Una versión oficial que todos usan es la fuente única de verdad.
- Datos de salud vinculados a una persona significa PHI (HIPAA). Números de tarjeta significa PCI DSS. Quitar solo los nombres puede dejar cuasi-identificadores que vuelvan a identificar a las personas.
- Datos personales de la UE significa GDPR; datos de salud de EE. UU. en poder de proveedores y aseguradoras significa HIPAA; datos de tarjetas significa PCI DSS (un estándar, no una ley). Leyes sobre la ubicación de los datos significa soberanía o residencia.
- Reversible con una clave significa seudonimización; irreversible significa anonimización. Valores falsos realistas para pruebas significa enmascaramiento. Ver solo las filas de tu región significa seguridad a nivel de fila.
- Los datos conservados más allá de su periodo de retención, sobre todo las copias sueltas, son una falla de la etapa de eliminación. Recolecta solo lo que necesitas al principio y elimina todas las copias al final.
Términos clave
- Data owner (propietario de los datos)
- El líder de negocio que rinde cuentas y decide la clasificación, el acceso y el uso de un dominio de datos.
- Data steward (administrador de datos)
- El rol del lado del negocio que gestiona día a día las definiciones, la calidad y el uso adecuado de los datos.
- Data custodian (custodio de los datos)
- El rol técnico que almacena, protege y mantiene los datos según las decisiones del propietario.
- Data consumer (consumidor de datos)
- Cualquier persona que usa los datos para su trabajo y debe seguir las políticas sobre su uso.
- Metadata (metadatos)
- Datos que describen otros datos, como su estructura, significado, propietario e historial de procesamiento.
- Data dictionary (diccionario de datos)
- Documentación del nombre, la definición, el tipo, el formato, los valores permitidos y el origen de cada campo.
- Data catalog (catálogo de datos)
- Un inventario de activos de datos y sus metadatos, en el que se puede buscar, que ayuda a los usuarios a encontrar y entender los datos.
- Data lineage (linaje de datos)
- Un registro de dónde provienen los datos y de cada transformación por la que pasaron hasta llegar a su destino.
- Completeness (completitud)
- El grado en que los valores de datos requeridos están presentes.
- Validity (validez)
- El grado en que los valores cumplen las reglas de tipo, formato, rango y valores permitidos.
- Consistency (consistencia)
- El grado en que los datos coinciden entre sistemas y dentro de un conjunto de datos.
- Timeliness (oportunidad)
- El grado en que los datos están actualizados y disponibles cuando se necesitan.
- Data profiling (perfilado de datos)
- Analizar la estructura y el contenido de un conjunto de datos, como los nulos, los valores distintos, los rangos y los patrones, para entender su calidad.
- Validation rule (regla de validación)
- Una verificación de que los datos cumplen una expectativa, como un tipo, un rango, un formato o un valor permitido.
- Referential integrity check (verificación de integridad referencial)
- Una prueba de que cada valor de clave foránea coincide con un registro existente en la tabla relacionada.
- Data quality scorecard (scorecard de calidad de datos)
- Un reporte que sigue las métricas de calidad frente a los umbrales a lo largo del tiempo.
- Master data (datos maestros)
- Datos centrales y compartidos sobre entidades clave del negocio, como clientes, productos y proveedores.
- Master data management, MDM (gestión de datos maestros)
- Los procesos y herramientas que crean y mantienen una versión única, consistente y oficial de los datos maestros.
- Golden record (registro dorado)
- El registro único, confiable y consolidado de una entidad que produce la MDM.
- Single source of truth (fuente única de verdad)
- El principio de que cada elemento de datos tiene una fuente oficial que todos usan.
- PII
- Personally identifiable information (información de identificación personal): datos que pueden identificar a un individuo específico, directamente o en combinación con otros.
- PHI
- Protected health information (información de salud protegida): información de salud identificable individualmente cubierta por HIPAA.
- Quasi-identifier (cuasi-identificador)
- Un atributo, como la fecha de nacimiento o el código postal, que puede identificar a una persona al combinarse con otros.
- Data classification (clasificación de datos)
- Asignar a los datos un nivel de sensibilidad (como público, interno, confidencial o restringido) que determina su manejo.
- GDPR
- El reglamento de la UE que regula el tratamiento de datos personales de personas en la UE, incluidos los derechos de los titulares de los datos.
- HIPAA
- La ley de EE. UU. que protege la información de salud identificable individualmente en poder de las entidades cubiertas y sus socios comerciales.
- Data sovereignty (soberanía de datos)
- El principio de que los datos están sujetos a las leyes del país en el que se encuentran.
- Retention schedule (calendario de retención)
- Una política que enumera cuánto tiempo se conserva cada tipo de registro y cómo se elimina.
- Least privilege (mínimo privilegio)
- Otorgar a los usuarios y sistemas solo el acceso mínimo necesario para hacer su trabajo.
- Data masking (enmascaramiento de datos)
- Ocultar los valores sensibles con sustitutos realistas o valores parciales, manteniendo los datos utilizables.
- Pseudonymization (seudonimización)
- Reemplazar los identificadores por valores artificiales que pueden volver a vincularse usando una clave guardada por separado.
- Anonymization (anonimización)
- Eliminar de forma irreversible de los datos la capacidad de identificar a las personas.
- Encryption at rest (cifrado en reposo)
- Cifrar los datos almacenados para que sean ilegibles sin la clave si se accede al almacenamiento.
- Data life cycle (ciclo de vida de los datos)
- Las etapas por las que pasan los datos: recolección, almacenamiento, uso, intercambio, archivado y destrucción.
- Archiving (archivado)
- Trasladar los datos inactivos que deben conservarse a un almacenamiento de largo plazo, de menor costo y con acceso restringido.
- Secure disposal (eliminación segura)
- Destruir permanentemente los datos al final de su periodo de retención para que no puedan recuperarse.
- Cryptographic erasure (borrado criptográfico)
- Hacer irrecuperables los datos cifrados destruyendo sus claves de cifrado.
Estudia Data+ gratis
Plan semana a semana con lecciones, cuestionarios, simulaciones de examen y práctica, en español.
Abrir el plan de estudioPlan semana a semana con lecciones, cuestionarios, simulaciones de examen y práctica, en español.