En Microsoft Fabric la entrada y el movimiento de datos no se resuelven con una sola herramienta. Primero decides si el dato se referencia, se replica, se copia o se transforma, y luego eliges el mecanismo más simple que cumpla la latencia, la seguridad y la trazabilidad que necesitas. OneLake Shortcut referencia sin copiar, Mirroring replica con baja latencia, Copy Job mueve por copia o CDC, Data Pipeline orquesta flujos con dependencias y Dataflow Gen2 prepara y transforma con bajo código.
¿Por qué Fabric no tiene una única herramienta de ingesta?
Muchos equipos asumen que mover datos hacia Fabric es una sola operación. No lo es. Data Factory dentro de Fabric reúne varios mecanismos distintos, y cada uno responde a una pregunta diferente sobre el dato.
La decisión depende de cuatro variables:
- Dónde vive el dato: si puede quedarse en su origen o necesita estar dentro de OneLake.
- Cuánta latencia admite: si el negocio tolera actualizaciones por lotes o exige baja latencia.
- Si necesita transformación: si el dato entra tal cual o requiere limpieza y reglas de calidad.
- Cuántos pasos coordina el flujo: si es un movimiento simple o un proceso con dependencias y condiciones.
Cuando ordenas estas cuatro preguntas antes de tocar la herramienta, la elección deja de ser una cuestión de costumbre y pasa a ser una decisión de arquitectura. Ese es el criterio que hace que los datos lleguen de forma predecible y trazable, no según quién configuró el flujo. Si quieres profundizar en ese razonamiento inicial, revisa cómo elegir la herramienta correcta para traer tus datos antes de comprometerte con un mecanismo.
¿Referenciar, replicar, copiar o transformar?
Antes de elegir una herramienta conviene nombrar la intención. Estas son las cuatro estrategias base de entrada y movimiento en Fabric.
- Referenciar: el dato permanece en su ubicación y Fabric solo lo apunta, sin crear otra copia. Es el caso de OneLake Shortcut.
- Replicar: una base operacional compatible se copia hacia OneLake con baja latencia y sin diseñar un proceso ETL propio. Es Mirroring.
- Copiar: el dato se mueve mediante copia completa, incremental o CDC, sin coordinar un flujo complejo. Es Copy Job.
- Transformar: el dato tabular se prepara y limpia con una experiencia de bajo código antes de aterrizar. Es Dataflow Gen2.
Cuando el flujo combina varias de estas intenciones, Data Pipeline entra como orquestador y cada actividad conserva un propósito claro.
¿Qué herramienta corresponde a cada caso?
La siguiente tabla resume cuándo usar cada mecanismo y qué debe quedar definido antes de operarlo. Definir estos puntos por adelantado es lo que convierte un flujo en un proceso operable y no en un script frágil.
| Herramienta | Cuándo usarla | Qué debe quedar definido |
|---|---|---|
| OneLake Shortcut | Conviene cuando no hace falta duplicar nada: la información sigue alojada en su sistema de origen y Fabric se limita a apuntarla | Origen, credencial, dependencia externa, seguridad y comportamiento si la fuente deja de estar disponible |
| Mirroring | Sirve para llevar a OneLake una copia casi en vivo de una base transaccional soportada, evitando construir procesos ETL a medida | Fuente soportada, alcance de tablas, latencia aceptada, seguridad y controles de replicación |
| Copy Job | Encaja cuando el objetivo es puramente trasladar registros, ya sea en carga total, incremental o por CDC, sin orquestar varias actividades | Modo de copia, marca de control o CDC, destino, frecuencia, reanudación y columnas de auditoría |
| Data Pipeline | El proceso necesita dependencias, condiciones, varias actividades, notebooks, funciones o alertas entre sistemas | Orden, parámetros, identidad, reintentos, notificaciones, SLA y responsable de cada fallo |
| Dataflow Gen2 | El equipo necesita preparar y transformar datos tabulares con Power Query y bajo código | Consultas reutilizables, destino, esquema de salida, historial de actualizaciones y reglas de calidad |
¿Cómo se toma la decisión sin caer en la costumbre?
La regla de oro es simple: no se elige Pipeline por costumbre ni Mirroring por novedad. Se selecciona el mecanismo más simple que cumpla latencia, seguridad, trazabilidad y operación. Cuando la duda se reduce a las tres opciones de entrada más frecuentes, esta guía sobre cómo elegir entre Shortcut, Mirroring o Copy Job detalla el criterio caso por caso.
Esto significa preguntarse, en orden:
- ¿El dato puede quedarse donde está? Si la respuesta es sí y solo necesitas leerlo, un Shortcut evita duplicar y mantener una copia.
- ¿Necesitas una réplica de baja latencia de una base operacional soportada? Mirroring te la da sin construir ETL.
- ¿Solo tienes que mover datos, quizá de forma incremental o con CDC? Copy Job es suficiente.
- ¿El flujo tiene condiciones, varias actividades y responsables de fallo? Ahí sí entra Data Pipeline como orquestador.
- ¿El dato tabular necesita limpieza y reglas antes de aterrizar? Dataflow Gen2 con Power Query.
Elegir de más introduce complejidad que alguien tendrá que mantener. Elegir de menos deja huecos de seguridad o trazabilidad. El criterio antes que la herramienta es lo que evita ambos extremos.
¿Cómo encaja esto en una arquitectura medallion?
La entrada y el movimiento son la primera capa de una arquitectura de datos ordenada. En un modelo medallion, el dato crudo aterriza en Bronze, se limpia y conforma en Silver, y se modela para consumo en Gold. La herramienta que elijas para ingerir determina cuán limpio y trazable llega el dato a Bronze.
Un Shortcut mantiene el dato referenciado sin duplicarlo, lo que reduce copias que después hay que gobernar. Un Copy Job con columnas de auditoría deja rastro de cuándo y cómo entró cada registro. Un Dataflow Gen2 aplica reglas de calidad antes de que el dato contamine capas posteriores. Cada decisión de ingesta es también una decisión de gobierno.
Cuando esta capa está bien resuelta, el modelo semántico que la corona puede actuar como contrato común de las métricas: dirección y equipo ven los mismos números porque los datos llegaron por caminos definidos y auditables.
¿Cómo llevar este criterio a tu empresa?
La entrada y el movimiento de datos son una decisión de criterio, no de herramienta favorita. Si quieres ver cómo se aterrizan estas decisiones en un sistema de datos real, con flujos definidos, auditables y listos para escalar, mira la demo gratuita y evalúa qué camino tiene más sentido para tu empresa.
Fuentes
- Opciones de ingesta y obtención de datos en Fabric
- Mirroring en Microsoft Fabric
- Qué es Copy Job
- Dataflow Gen2 en Fabric
- Arquitectura medallion en OneLake
Preguntas relacionadas
¿Cuándo conviene usar un OneLake Shortcut en lugar de copiar los datos?
Cuando el dato puede permanecer en su ubicación de origen y Fabric solo necesita referenciarlo. El Shortcut evita crear y mantener otra copia, pero debes definir origen, credencial, seguridad y qué pasa si la fuente deja de estar disponible.
¿Qué diferencia hay entre Mirroring y Copy Job?
Mirroring replica una base operacional compatible hacia OneLake con baja latencia y sin diseñar un ETL propio. Copy Job mueve datos mediante copia completa, incremental o CDC cuando no necesitas coordinar un flujo complejo. Mirroring es réplica continua, Copy Job es movimiento controlado.
¿Cuándo se justifica usar un Data Pipeline?
Cuando el proceso necesita dependencias, condiciones, varias actividades, notebooks, funciones, alertas o pasos entre sistemas. Data Pipeline actúa como orquestador y debe definir orden, parámetros, identidad, reintentos, SLA y responsable de cada fallo.
¿Para qué sirve Dataflow Gen2?
Para preparar y transformar datos tabulares con Power Query en una experiencia de bajo código. Es la opción cuando el equipo necesita consultas reutilizables, un esquema de salida definido y reglas de calidad antes de que el dato aterrice.
¿Cómo elegir el mecanismo correcto sin equivocarse?
No se elige por costumbre ni por novedad. Se selecciona el mecanismo más simple que cumpla latencia, seguridad, trazabilidad y operación. Si el flujo combina varias herramientas, el Pipeline orquesta y cada actividad conserva un propósito claro.