
# Propojení vysvětlitelné AI a správy syntetických dat s Formize

Umělá inteligence přechází z experimentálních laboratoří do kritických produkčních prostředí. Dva trendy tuto změnu dominují:

1. **Syntetická data** – generovaná za účelem ochrany soukromí, urychlení tréninku modelu a obohacení nedostatkových datových sad.  
2. **Vysvětlitelná AI (XAI)** – požadovaná regulátory, auditory a koncovými uživateli, kteří chtějí pochopit *proč* model dělá konkrétní predikci.

Ačkoli oba témata mají vyspělou sadu nástrojů, často jsou považována za samostatné silosy. Pipelines pro syntetická data generují data a nástroje XAI vysvětlují chování modelu, ale málokdy existuje jediný zdroj pravdy, který by je spojoval. Tento mezera vytváří riziko souladu, ztěžuje auditovatelnost a podkopává důvěru zainteresovaných stran.

Formize, platforma pro správu s nízkým kódem, již vyniká v **Zero‑Trust správě syntetických dat**, **auditování v reálném čase** a **automatizaci politik**. Rozšířením Formize o XAI primitivy mohou organizace dosáhnout **holistického, auditovatelného a vysvětlitelného životního cyklu syntetických dat**.

Níže představujeme praktický rámec, architektonické komponenty a krok‑za‑krokem implementační průvodce, který využívá workflow engine, policy engine a neměnné auditní stopy Formize k propojení XAI se správou syntetických dat.

## 1. Proč spojit XAI se správou syntetických dat?

| Výzva | Tradiční přístup | Riziko bez propojení |
|-----------|----------------------|---------------------|
| **Regulační soulad** | Samostatné kontrolní seznamy pro soukromí dat a vysvětlitelnost modelu | Nekonzistentní důkazy, možné mezery během auditů |
| **Detekce biasu** | Kontroly biasu na reálných datech, samostatná analýza biasu na výstupech modelu | Skrytý bias zavedený během generování syntetických dat může zůstat neodhalen |
| **Sledovatelnost** | Datová linie zachycena pro surová i syntetická datová sady, vysvětlení modelu uložena jinde | Auditoři nemohou propojit konkrétní vysvětlení se syntetickou datovou verzí, která jej vytvořila |
| **Reakce na incident** | Manuální korelace úniku dat s chováním modelu | Zpožděná náprava, vyšší právní expozice |

Propojením **vysvětlení s přesnou verzí syntetických dat**, která napájela model, lze každou predikci sledovat zpět pomocí **jediného neměnného auditního záznamu**. To splňuje nově vznikající regulace, jako je **EU AI Act**, americký **Executive Order on AI** a sektorové směrnice (např. FDA’s AI/ML Software as a Medical Device).

## 2. Základní koncepty jednotného rámce

1. **Synthetic Data Artifact (SDA)** – verzovaná datová sada generovaná syntetickým enginem (např. GAN, difúzní model). Formize ukládá metadata, parametry generování a štítky politik pro každé SDA.  
2. **Explainability Payload (XP)** – výstup XAI metody (SHAP, LIME, Counterfactuals) připojený k inferenci modelu. XP zahrnuje vektory důležitosti rysů, lokální náhradní modely a skóre důvěry.  
3. **Policy‑Bound Provenance Graph (PBP‑Graph)** – orientovaný acyklický graf (DAG), který propojuje SDA, verze modelů, požadavky na inferenci a XP. Každý okraj je řízen **Zero‑Trust politikou**, která ověřuje přístup, účel a uchovávání.  
4. **Immutable Audit Log (IAL)** – log ukotvený na blockchainu, který zaznamenává každou změnu PBP‑Graph, zajišťuje důkaz o nezměnitelnosti.

Policy Engine Formize vyhodnocuje požadavky na přístup vůči PBP‑Graph v reálném čase, zatímco Workflow Builder orchestruje cyklus generování‑vysvětlení‑ukládání.

## 3. Architektonický plán

Níže je Mermaid diagram, který vizualizuje tok dat a body vynucování politik.

```mermaid
graph TD
    A["Synthetic Data Engine"] -->|Generate| B["Synthetic Data Artifact (SDA)"]
    B -->|Register Metadata| C["Formize Metadata Store"]
    C -->|Trigger| D["Model Training Pipeline"]
    D -->|Produce| E["Trained Model Version"]
    E -->|Serve Inference| F["Inference Request"]
    F -->|Invoke XAI Service| G["Explainability Payload (XP)"]
    G -->|Attach to Inference| H["PBP‑Graph Node"]
    H -->|Policy Check| I["Zero‑Trust Policy Engine"]
    I -->|Log| J["Immutable Audit Log"]
    J -->|Expose| K["Compliance Dashboard"]
```

*All node labels are wrapped in double quotes as required.*

### Klíčové interakce

- **Registrace SDA** – Formize zachytí semena generování, náhodný stav a rozpočty soukromí. Tato metadata se stávají neměnnými po zápisu do IAL.  
- **Propojení modelu a SDA** – Během tréninku pipeline zaznamená přesnou verzi SDA, čímž vytvoří **model‑to‑data okraj** v PBP‑Graph.  
- **Propojení inference a XP** – Každý požadavek na inferenci je obohacen o XP, která odkazuje na verzi modelu a SDA, která přispěla k jeho tréninku.  
- **Vyhodnocení politiky** – Před přístupem k XP Zero‑Trust Policy Engine kontroluje roli žadatele, účel a omezení umístění dat.  
- **Zobrazení auditní stopy** – Dashboard pro soulad vizualizuje kompletní linii od generování syntetických dat po doručení vysvětlení, umožňující auditorům ověřit soulad jedním kliknutím.

## 4. Praktický průvodce implementací

### Krok 1: Povolit verzování syntetických dat ve Formize

```goat
# Pseudo‑code for Formize SDK
formize.registerArtifact(
    type="synthetic-data",
    name="customer‑transactions‑v1",
    metadata={
        "generator":"CTGAN",
        "seed":12345,
        "privacy_budget":0.8,
        "generation_timestamp":"2026-09-10T14:32:00Z"
    }
)
```

*Volání SDK automaticky zapisuje artefakt do neměnného auditního logu.*

### Krok 2: Propojit trénink modelu se SDA

```yaml
workflow:
  name: "Train Model on New SDA"
  trigger: artifact.created
  condition: artifact.type == "synthetic-data"
  actions:
    - run: "python train_model.py --data {{artifact.id}}"
    - register:
        type: "model-version"
        name: "fraud‑detector‑{{timestamp}}"
        metadata:
          sda_id: "{{artifact.id}}"
          hyperparameters: "{{hyperparams}}"
```

Akce `register` ukládá verzi modelu a spojuje ji se SDA pomocí `sda_id`.

### Krok 3: Integrovat XAI službu

Nasadíme XAI mikro‑službu (např. SHAP server), která přijímá ID modelu a vstupní payload, poté vrací XP.

```goat
# Example request to XAI service
POST /explain
{
  "model_id": "fraud-detector-20260910",
  "input": {"amount": 1200, "merchant": "XYZ", "time": "22:15"}
}
```

Formize zachytí odpověď a vytvoří uzel XP.

```goat
formize.registerArtifact(
    type="explainability-payload",
    name="xp-20260911-001",
    metadata={
        "model_id":"fraud-detector-20260910",
        "sda_id":"customer-transactions-v1",
        "shap_values":{"amount":0.42,"merchant":0.31,"time":0.27},
        "timestamp":"2026-09-11T09:15:00Z"
    }
)
```

### Krok 4: Definovat Zero‑Trust politiky

```yaml
policy:
  name: "Politika přístupu k vysvětlitelnosti"
  description: "Pouze auditoři a úředníci pro ochranu dat mohou zobrazit XP."
  rules:
    - effect: allow
      principals: ["role:audit", "role:privacy-officer"]
      actions: ["read"]
      resources: ["explainability-payload"]
      conditions:
        - key: "metadata.sda_id"
          operator: "in"
          value: ["customer-transactions-v1", "customer-transactions-v2"]
```

Formize vyhodnocuje tuto politiku při každém požadavku na XP, čímž zajišťuje účelově vázaný přístup.

### Krok 5: Vytvořit dashboard pro soulad

Využijte vestavěné vizualizační widgety Formize k vykreslení PBP‑Graph. Přidejte filtry pro:

- **Časové rozmezí** (např. posledních 30 dní)  
- **Regulační oblast** ([GDPR](https://gdpr.eu/), [HIPAA](https://www.hhs.gov/hipaa/index.html), [Soulad s EU AI Act](https://digital-strategy.ec.europa.eu/en/policies/regulatory-framework-ai))  
- **Úroveň rizika** (vysoký dopad vysvětlení)

Dashboard může exportovat **PDF auditní balíček**, který obsahuje neměnný hash každého uzlu, čímž splňuje požadované důkazy regulátora.

## 5. Přínosy

| Přínos | Jak rámec dodává |
|---------|-------------------|
| **Regulační připravenost** | Důkaz jedním kliknutím spojující verzi syntetických dat → model → vysvětlení. |
| **Zmírnění biasu** | XP odhalují příspěvky rysů; auditoři mohou sledovat bias zpět k datům, která model trénovala. |
| **Provozní efektivita** | Automatizované kontroly politik odstraňují ruční revize oprávnění. |
| **Důvěra a transparentnost** | Koncoví uživatelé mohou zobrazit vysvětlení, která jsou kryptograficky svázána s daty, která model trénovala. |
| **Škálovatelná auditovatelnost** | Neměnný auditní log škáluje horizontálně; každé nové SDA nebo XP přidá lehký uzel. |

## 6. Reálné příklady použití

### 6.1 Finanční služby – boj proti praní špinavých peněz (AML)

Banka používá Formize k generování syntetických transakčních dat pro trénink AML modelu. Připojením SHAP vysvětlení ke každé označené transakci mohou úředníci pro soulad prokázat, že rozhodnutí modelu jsou založena na legitimních rizikových faktorech, nikoli na chráněných atributech. Auditní log poskytuje regulátorům nezfalšovatelný řetězec od generování syntetických dat po konečné rozhodnutí.

### 6.2 Zdravotnictví – klinická podpora rozhodování

Nemocnice vytváří syntetické záznamy pacientů k doplnění datových sad vzácných onemocnění. XAI vysvětlení (kontrafaktuální) jsou uložena vedle každého doporučení diagnózy. Když klinik zpochybní doporučení, systém zobrazí přesnou syntetickou kohortu, která model ovlivnila, spolu s důležitostí rysů, čímž splňuje auditní požadavky v souladu s **[HIPAA](https://www.hhs.gov/hipaa/index.html)**.

### 6.3 Výroba – prediktivní údržba

Syntetické senzorové proudy jsou generovány k tréninku modelu predikce selhání. Inženýři požadují LIME vysvětlení pro predikce s vysokým rizikem. Policy engine Formize zajišťuje, že pouze certifikovaní manažeři údržby mohou zobrazit vysvětlení, zatímco neměnný log zaznamenává verzi syntetických dat, čímž podporuje soulad s ISO 55001.

## 7. Budoucí vylepšení

1. **Federovaná XAI** – Rozšířit rámec na scénáře federovaného učení, kde každý účastník lokálně přispívá syntetickými daty. Formize může agregovat provenance bez odhalení surových dat.  
2. **AI‑generované návrhy politik** – Použít LLM k navrhování nových Zero‑Trust politik na základě pozorovaných vzorců vysvětlení (např. automaticky zpřísnit přístup, když určitý rys konzistentně vede k výsledkům s vysokým rizikem).  
3. **Dynamické uchovávání** – Implementovat politiku řízeného automatického odstraňování XP po uplynutí regulační doby uchovávání, přičemž se zachovají kryptografické důkazy o smazání.

## 8. Kontrolní seznam pro zahájení

- [ ] Nainstalujte Formize 2.5+ (obsahuje XAI connector SDK).  
- [ ] Zaregistrujte své generátory syntetických dat jako **Artifact Types**.  
- [ ] Vytvořte **Model‑Training Workflow**, který zaznamenává ID SDA.  
- [ ] Nasadíte XAI mikro‑službu (SHAP, LIME, Counterfactual).  
- [ ] Definujte **Zero‑Trust politiky přístupu k vysvětlitelnosti**.  
- [ ] Vytvořte **Dashboard pro soulad** pomocí vizuálních widgetů Formize.  
- [ ] Proveďte pilot na datové sadě s nízkým rizikem a ověřte auditní stopu s interním auditním týmem.

Dodržením tohoto kontrolního seznamu mohou organizace rychle dosáhnout **transparentní, auditovatelné a souladné AI pipeline**, která spojuje správu syntetických dat s vysvětlitelnou AI.

## Viz také

- EU AI Act – Článek 13 o transparentnosti a poskytování informací  
- Dokumentace Formize: Zero‑Trust Policy Engine  
- SHAP: Jednotný přístup k interpretaci predikcí modelu (GitHub)