No hay una única herramienta para traer datos a Microsoft Fabric. Primero decide si el dato se referencia, se replica, se copia o se transforma. Luego elige el mecanismo más simple que cumpla latencia, seguridad, trazabilidad y operación: OneLake Shortcut, Mirroring, Copy Job, Data Pipeline o Dataflow Gen2.
Por qué no existe una sola herramienta de ingesta
Data Factory dentro de Microsoft Fabric no es una única herramienta, sino un conjunto de mecanismos con propósitos distintos. La equivocación más común es elegir por costumbre ("siempre uso Pipeline") o por novedad ("probemos Mirroring porque es nuevo"). Ninguna de esas razones sostiene una arquitectura de datos sana.
La decisión correcta empieza por cuatro preguntas sobre el dato:
- ¿Dónde vive el dato hoy y puede quedarse ahí?
- ¿Cuánta latencia admite el negocio antes de decidir con esa cifra?
- ¿Necesita transformación o basta con moverlo tal cual?
- ¿Cuántos pasos y dependencias debe coordinar el flujo?
Estas respuestas, no la herramienta favorita del equipo, definen el camino. El criterio va primero; la herramienta se elige después.
Las cinco estrategias de entrada y movimiento
Cada mecanismo resuelve un problema concreto. Elegir bien evita procesos frágiles y copias innecesarias que terminan produciendo cifras distintas entre reportes. Si dudas entre las tres opciones de entrada más frecuentes, este análisis de cómo elegir la entrada de datos en Fabric las compara en detalle.
| Herramienta | Cuándo usarla | Qué debe quedar definido |
|---|---|---|
| OneLake Shortcut | Conviene cuando basta con apuntar al dato donde ya reside, evitando generar un duplicado dentro de Fabric | Origen, credencial, dependencia externa, seguridad y comportamiento si la fuente deja de estar disponible |
| Mirroring | Aplica si una base operacional soportada tiene que llegar a OneLake casi al instante, sin construir un ETL a medida | Fuente soportada, alcance de tablas, latencia aceptada, seguridad y controles de replicación |
| Copy Job | Encaja cuando el trabajo se limita a trasladar filas (carga total, incremental o CDC) y no exige orquestar varias etapas | Modo de copia, marca de control o CDC, destino, frecuencia, reanudación y columnas de auditoría |
| Data Pipeline | El proceso necesita dependencias, condiciones, varias actividades, notebooks, funciones, alertas o pasos entre sistemas | Orden, parámetros, identidad, reintentos, notificaciones, SLA y responsable de cada fallo |
| Dataflow Gen2 | El equipo necesita preparar y transformar datos tabulares con Power Query y bajo código | Consultas reutilizables, destino, esquema de salida, historial de actualizaciones y reglas de calidad |
Cuándo referenciar en lugar de copiar
OneLake Shortcut es la opción más liviana dentro de OneLake. Si el dato ya vive en un lugar confiable y Fabric solo necesita apuntarlo, no tiene sentido crear otra copia que después haya que mantener sincronizada. Cada copia adicional es una fuente potencial de discrepancias entre cifras.
Antes de usar un Shortcut define con claridad el origen, la credencial que lo sostiene, la dependencia externa y, sobre todo, qué pasa si la fuente deja de estar disponible. Un shortcut roto puede dejar reportes sin datos sin previo aviso, así que la seguridad y el plan ante caídas son parte del diseño, no un detalle posterior.
Cuándo replicar con baja latencia
Mirroring resuelve un caso puntual: llevar una base operacional compatible hacia OneLake con baja latencia y sin construir un proceso ETL propio. Es ideal cuando el negocio necesita ver cambios casi en tiempo real y no quieres cargar al equipo con el mantenimiento de una tubería personalizada.
Antes de activarlo, confirma que tu fuente esté soportada, define el alcance de tablas que realmente necesitas, la latencia aceptada y los controles de replicación. Mirroring no es "mejor" que las demás opciones por ser reciente; es la respuesta correcta solo cuando el requisito es replicación continua de baja latencia.
Cuándo copiar y cuándo orquestar
Aquí conviene separar dos necesidades que suelen confundirse.
- Copy Job es para cuando lo único que necesitas es mover datos: una copia completa, incremental o por CDC. Define el modo de copia, la marca de control o CDC, el destino, la frecuencia, la reanudación y las columnas de auditoría. Si el trabajo es solo trasladar filas, no lo envuelvas en un proceso más pesado.
- Data Pipeline aparece cuando el flujo necesita coordinación real: dependencias, condiciones, varias actividades, notebooks, funciones, alertas o pasos entre sistemas. Aquí importan el orden, los parámetros, la identidad, los reintentos, las notificaciones, el SLA y quién responde ante cada fallo.
Un error frecuente es armar un Pipeline completo cuando bastaba un Copy Job. Cuando el flujo sí combina varias herramientas, el Pipeline actúa como orquestador y cada actividad conserva un propósito claro, sin convertirse en una caja negra difícil de operar.
Cuándo transformar antes de aterrizar
Dataflow Gen2 es la opción cuando el equipo necesita preparar y transformar datos tabulares con Power Query en una experiencia de bajo código. Sirve para perfiles de negocio que ya viven en Excel y conocen la lógica de las transformaciones, pero no quieren escribir código.
Define consultas reutilizables, el destino, el esquema de salida, el historial de actualizaciones y las reglas de calidad. Esto conecta directamente con la idea de productos de datos y arquitectura medallion: las transformaciones que llevan un dato de Bronze a Silver deben ser explícitas, versionables y auditables, no pasos manuales que solo una persona entiende. Para sostener esa disciplina conviene apoyarse en las buenas prácticas para la entrada y movimiento de datos en Fabric.
La regla de decisión que evita arquitecturas frágiles
La decisión de implementación se resume en una frase: se selecciona el mecanismo más simple que cumpla latencia, seguridad, trazabilidad y operación. No se elige Pipeline por costumbre ni Mirroring por novedad.
Una forma práctica de decidir en orden:
- ¿El dato puede quedarse donde está? Usa Shortcut.
- ¿Necesitas réplica continua de baja latencia de una fuente soportada? Usa Mirroring.
- ¿Solo mueves datos sin lógica compleja? Usa Copy Job.
- ¿Necesitas transformar en bajo código con Power Query? Usa Dataflow Gen2.
- ¿Hay dependencias, condiciones y varios sistemas? Usa Data Pipeline como orquestador.
Elegir bien la entrada de datos es la base de cifras consistentes en toda la organización. Si la ingesta es desordenada, ningún modelo semántico ni ninguna IA encima lo corrige: la IA no arregla un modelo pobre, lo amplifica.
Siguiente paso
Si quieres ver cómo se aplican estos criterios de ingesta a tus propias fuentes, ya sea formando a tu equipo o con acompañamiento de consultoría, el mejor punto de partida es la demo gratuita, donde te mostramos las soluciones y el camino que mejor encaja con tu situación.
Preguntas relacionadas
¿Cuál es la diferencia entre OneLake Shortcut y Mirroring?
OneLake Shortcut referencia el dato en su ubicación original sin crear otra copia, ideal cuando el dato puede quedarse donde está. Mirroring replica una base operacional compatible hacia OneLake con baja latencia y sin diseñar un ETL propio, para cuando necesitas datos casi en tiempo real.
¿Cuándo debo usar Copy Job en lugar de Data Pipeline?
Usa Copy Job cuando solo necesitas mover datos mediante copia completa, incremental o CDC, sin coordinar un flujo complejo. Reserva Data Pipeline para procesos con dependencias, condiciones, varias actividades, notebooks, alertas o pasos entre sistemas.
¿Qué herramienta uso si necesito transformar los datos antes de cargarlos?
Dataflow Gen2 es la opción cuando el equipo necesita preparar y transformar datos tabulares con Power Query en una experiencia de bajo código, definiendo consultas reutilizables, esquema de salida y reglas de calidad.
¿Por qué no conviene usar siempre Data Pipeline?
Porque no se elige Pipeline por costumbre. La regla es seleccionar el mecanismo más simple que cumpla latencia, seguridad, trazabilidad y operación. Armar un Pipeline completo cuando bastaba un Copy Job agrega complejidad innecesaria y procesos difíciles de operar.
¿La IA puede compensar una ingesta de datos mal diseñada?
No. Poner IA encima de una ingesta desordenada solo hace más visibles los errores de origen. Si la entrada de datos crea copias que se desincronizan, ningún modelo semántico ni herramienta de IA posterior corrige el problema de fondo.