preloader
A I G E N T I
  • 12. 6. 2026
  • No Comments

Máme zkušenosti se stavěním datových řešení na platformě Microsoft Fabric. Data zpravidla orchestrujeme v medailonové (medallion) architektuře, která rozděluje datový tok do tří logických vrstev, a to bronzové, stříbrné a zlaté. Tento přístup zajišťuje přehlednost, znovupoužitelnost a postupné zvyšování kvality a důvěryhodnosti dat na cestě od zdroje k reportu.

Datový tok probíhá následovně. Do bronzové vrstvy ingestujeme surová data přesně v podobě, v jaké přicházejí ze zdrojových systémů. Zvládáme jak ingesci velkoobjemových dat, tak příjem dat s nízkou frekvencí či objemem. Stříbrná vrstva obsahuje vyčištěná, validovaná a normalizovaná data po počátečním zpracování. Zlatá vrstva pak představuje finální, byznysově připravená a agregovaná data, nad kterými staví reporting, vizualizace a navazující analytické scénáře včetně strojového učení.

Transformace a přípravu dat mezi jednotlivými vrstvami realizujeme v PySparku. Spark notebooky a pipeline navrhujeme s důrazem na co nejnižší spotřebu kapacit (Capacity Units). Využíváme inkrementální zpracování, vhodný partitioning a optimalizaci Delta tabulek, vyhýbáme se zbytečným shuffle operacím a celkově ladíme výpočty tak, abychom dosáhli vysokého výkonu při minimálním zatížení kapacity Fabricu. Výsledkem je datově i nákladově efektivní řešení.

Důraz klademe také na správu oprávnění napříč vrstvami. Přístupová práva řešíme tak, aby každý uživatel viděl pouze tu vrstvu, kterou skutečně potřebuje. Uživatel, který si vytváří vlastní report, tak typicky získává přístup pouze do zlaté vrstvy s připravenými, kurátorovanými daty a nemá přístup k surovým či mezistupňovým datům v bronzové a stříbrné vrstvě. Tím chráníme citlivá data, předcházíme chybným interpretacím nedokončených dat a držíme jasně oddělené role v rámci celého řešení.

Leave A Comment