La transformación de datos en Microsoft Fabric es el proceso de convertir datos crudos, tal como llegan de los sistemas de origen, en tablas limpias y organizadas para análisis, informes y agentes de IA. Fabric ofrece varios motores para hacerlo: Dataflow Gen2, SQL, notebooks y Spark Job Definitions. La regla práctica es elegir la opción más simple que pueda probarse, versionarse y operarse, porque la herramienta más potente no siempre es la mejor para tu equipo.
Qué significa transformar datos en Microsoft Fabric
Cuando los datos llegan a tu plataforma desde ventas, contabilidad, operaciones o marketing, llegan como están: con duplicados, formatos distintos, nombres inconsistentes y errores conocidos. La transformación es el trabajo que convierte ese material crudo en información confiable que dirección puede usar para decidir.
En Fabric, este trabajo se organiza normalmente con la arquitectura medallion, que separa los datos en tres capas con responsabilidades claras:
- Bronze: preserva el dato como llega. Da trazabilidad, recuperación y auditoría.
- Silver: limpia, une, estandariza, deduplica y corrige problemas conocidos.
- Gold: organiza los datos para consumo analítico, modelos, informes, Excel y agentes.
La transformación es el motor que mueve los datos de una capa a la siguiente. Sin ella, tienes un depósito de archivos; con ella, tienes productos de datos en los que toda la empresa puede confiar.
Para qué sirve: de cifras dispersas a una única verdad
El valor de transformar datos no es técnico, es de negocio. Sirve para que las reuniones de dirección dejen de discutir cuál cifra es la correcta y pasen a decidir con los mismos números.
Concretamente, la transformación permite:
- Unificar fuentes: ventas del ERP, gastos del sistema contable y actividad comercial del CRM terminan en tablas coherentes que hablan el mismo idioma.
- Corregir la realidad de los datos: duplicados, clientes escritos de tres formas distintas, fechas en formatos mezclados.
- Preparar el consumo: la capa Gold entrega tablas listas para el modelo semántico, que define de forma compartida cómo se calculan las métricas del negocio.
- Habilitar la IA: un agente de IA que consulta datos sucios multiplica el desorden en vez de corregirlo. Transformar primero es la condición para que Copilot y los agentes respondan con cifras correctas.
Los motores de transformación disponibles en Fabric
Fabric no tiene un único motor de transformación. La experiencia de Data Engineering completa la arquitectura medallion con varias opciones, y elegir bien entre ellas es una decisión de criterio, no de moda.
| Motor | Mejor encaje | Qué exige para estar bajo control |
|---|---|---|
| Dataflow Gen2 | Preparación tabular con lógica Power Query, equipos que necesitan bajo código | Consultas legibles, destino explícito, actualización monitoreada, esquema de salida estable |
| SQL | Transformaciones relacionales, uniones y agregaciones en Lakehouse o Warehouse | Scripts versionados, pruebas de reconciliación, grano documentado, rendimiento medido |
| Notebook | Python o PySpark para exploración, reglas complejas, APIs o ciencia de datos | Código reproducible, parámetros, salida persistente, registros, separar experimento de producción |
| Spark Job Definition | Procesos Spark de producción, por lotes o streaming, como trabajos programados | Archivo principal, argumentos, lakehouse asociado, agenda, monitoreo, criterio de reejecución |
| Environment | Notebooks y trabajos que comparten librerías y configuración de Spark | Versiones de dependencias, configuración compartida, promoción controlada entre entornos |
Dataflow Gen2 es el punto de entrada natural para perfiles de negocio: si tu equipo ya domina Power Query en Excel o Power BI, esa misma lógica se convierte en transformaciones gestionadas dentro de Fabric. SQL encaja cuando el trabajo es relacional y estructurado. Los notebooks y Spark aparecen cuando la complejidad o el volumen superan lo que Power Query resuelve con comodidad. Cuando la duda es justamente entre Dataflow Gen2 y un notebook, ayuda revisar qué motor de transformación conviene en cada escenario antes de comprometer un enfoque.
Cómo elegir el motor correcto sin sobredimensionar
La transformación se elige por tres factores: la lógica que necesitas expresar, el volumen de datos y la capacidad real de tu equipo. No por lo que está de moda.
La regla práctica es directa: usar la opción más simple que pueda probarse, versionarse y operarse sin esconder lógica crítica. Esto tiene consecuencias prácticas:
- Si Dataflow Gen2 resuelve el caso y tu equipo puede mantenerlo, no necesitas Spark.
- Si la transformación es relacional pura, SQL versionado con pruebas de reconciliación suele ser más gobernable que un notebook.
- Si nadie en el equipo puede leer PySpark, un pipeline en PySpark es una deuda, no un activo.
Criterio antes que herramienta: la pregunta no es cuál motor es más potente, sino cuál puede operar tu equipo el día que algo falle a las 7 de la mañana.
Cuándo un notebook deja de ser un experimento
Un error frecuente es confundir exploración con producción. Un notebook interactivo puede ayudar a descubrir la solución, pero no es un pipeline de producción hasta que tiene parámetros, dependencias declaradas, salida definida, ejecución repetible, observabilidad y un responsable.
Aquí también importa la separación de roles dentro de Fabric: el pipeline coordina y el motor transforma. El pipeline decide cuándo y en qué orden corren las cosas; el motor (Dataflow Gen2, SQL, notebook o Spark Job Definition) hace el trabajo de transformación. Y cuando varios notebooks o trabajos necesitan las mismas librerías y configuración de Spark, los Environments permiten fijar dependencias reproducibles y promoverlas de forma controlada entre entornos.
Esta disciplina es lo que convierte un conjunto de scripts en un sistema que la empresa puede mantener, confiar y auditar. Sostenerla en el tiempo depende de aplicar buenas prácticas para la transformación de datos en Fabric desde el primer día, no como corrección tardía.
Preguntas que conviene hacerse antes de empezar
Antes de elegir motor o escribir la primera transformación, vale la pena responder:
- ¿Qué decisiones de negocio va a alimentar esta transformación?
- ¿Quién va a mantener esta lógica dentro de seis meses?
- ¿Puede probarse que el resultado cuadra contra la fuente (reconciliación)?
- ¿Está versionada la lógica, o vive escondida en un archivo que solo una persona entiende?
- ¿Qué pasa si la ejecución falla: quién se entera y cómo se reejecuta?
Si alguna respuesta es "no sabemos", el problema no es la herramienta, es el diseño. Primero se ordenan las métricas y las decisiones; después las herramientas.
El siguiente paso natural
La transformación de datos en Fabric no es un tema exclusivo de ingenieros. Con Dataflow Gen2 y SQL, un profesional de negocio que domina Excel y Power BI puede construir transformaciones serias, siempre que aplique criterio: capas claras, la opción más simple que funcione y disciplina de producción.
Si quieres ver cómo se aplica este criterio en la práctica, desde el orden de las capas hasta la elección del motor, y evaluar qué camino de formación o consultoría encaja con tu equipo, mira la demo gratuita.
Preguntas relacionadas
¿Qué es la transformación de datos en Microsoft Fabric?
Es el proceso de convertir datos crudos de los sistemas de origen en tablas limpias y organizadas para análisis, informes y agentes de IA. En Fabric se implementa con motores como Dataflow Gen2, SQL, notebooks y Spark Job Definitions, normalmente siguiendo la arquitectura medallion (Bronze, Silver, Gold).
¿Cuál es la diferencia entre Dataflow Gen2 y un notebook en Fabric?
Dataflow Gen2 usa lógica Power Query y es ideal para preparación tabular con bajo código, accesible para perfiles de negocio. Un notebook usa Python o PySpark y encaja cuando la lógica es compleja, hay que consumir APIs o el procesamiento supera lo que Power Query resuelve con comodidad.
¿Necesito saber programar para transformar datos en Fabric?
No necesariamente. Dataflow Gen2 permite construir transformaciones con la misma lógica Power Query que ya se usa en Excel y Power BI, sin escribir código. Programar (SQL o Python) se vuelve necesario cuando la complejidad o el volumen lo justifican.
¿Cómo elijo el motor de transformación correcto en Fabric?
Por lógica, volumen y capacidad del equipo. La regla es usar la opción más simple que pueda probarse, versionarse y operarse sin esconder lógica crítica. Si Dataflow Gen2 resuelve el caso, no necesitas Spark; si el trabajo es relacional puro, SQL versionado suele ser lo más gobernable.
¿Cuándo un notebook se considera listo para producción?
Cuando tiene parámetros, dependencias declaradas, salida definida, ejecución repetible, observabilidad y un responsable asignado. Un notebook interactivo sirve para descubrir la solución, pero sin esa disciplina sigue siendo un experimento, no un pipeline de producción.