Gå til indhold
atlas

Forklarlighed

Også kendt som: forklarbar AI, XAI

Hvor godt mennesker kan forstå, hvorfor et AI-system nåede frem til et bestemt resultat.

Kladde - dette opslag er endnu ikke gennemgået.

Formelt

I hvilken grad grundene bag en models resultat kan vises på en måde, et menneske kan følge, for eksempel hvilke oplysninger der vejede tungest, så man kan kontrollere resultatet, klage over det eller rette det.

Forklaret enkelt

Som en læge, der ikke bare siger "tag de her piller", men fortæller, hvad hun så i dine prøver, og hvorfor det førte til valget.

I praksis

En borger, hvis ansøgning om boligstøtte bliver indstillet til afslag af kommunens AI-værktøj, spørger hvorfor; kommunen kan vise, at manglende indkomstoplysninger og ikke alder eller nationalitet afgjorde resultatet.

Hvorfor det betyder noget

Uden den kan ingen opdage skjult uretfærdighed, svare en revisor eller give en berørt person en reel begrundelse, og så bryder tillid og ansvarlighed sammen.

Sådan kommer du i gang

De typiske trin i rækkefølge. Tilpas dem til jeres organisation.

  1. Skriv for hvert AI-system, der påvirker mennesker, ned, hvem der har brug for en forklaring (den berørte person, sagsbehandleren, udvikleren, revisoren), hvad de skal kunne bruge den til, og hvilke regler der gælder, fx GDPR art. 13-15 og 22 og AI-forordningens art. 13 og 86.
  2. Prøv ved afgørelser på tabeldata først en fortolkelig model som et pointkort, et lavt beslutningstræ eller en GAM, og vælg kun en black box-model, hvis den er klart bedre, og I kan forklare den godt nok.
  3. Vælg forklaringsmetoder efter målgruppen, fx global feature importance til udviklere og revisorer, lokale attributioner som SHAP til sagsbehandlere og kontrafaktiske forklaringer ("havde indkomsten været over X, var ansøgningen blevet godkendt") til berørte personer.
  4. Test, at forklaringerne er tro mod modellen, før I stoler på dem, med sanity checks som at randomisere modellens vægte, sammenligne baselines og tjekke korrelerede features, og beskriv deres begrænsninger, som NIST IR 8312 anbefaler.
  5. Byg forklaringen ind i arbejdsgangen, så sagsbehandleren ser de vigtigste grunde ved siden af resultatet, og brevet til borgeren i et klart sprog oplyser AI'ens rolle og de vigtigste elementer i afgørelsen.
  6. Dokumentér de valgte metoder, deres begrænsninger og eksempler på forklaringer i den tekniske dokumentation eller modelkortet, og uddan de medarbejdere, der skal give forklaringerne videre.
  7. Gennemgå forklaringerne ved hver modelopdatering, og tag stikprøver af klager og anker for at se, om folk forstod dem, og justér så formuleringen eller metoden.

Typiske faldgruber

  • At stole på et saliency map eller et SHAP-diagram, fordi det ser plausibelt ud, uden at tjekke, at det faktisk afspejler, hvad modellen gør.
  • At give berørte personer en teknisk liste over features eller et afslag med henvisning til forretningshemmeligheder i stedet for den fremgangsmåde og de principper, der faktisk er brugt, som EU-Domstolen har sagt, at de har krav på at forstå.
  • At fremstille en LLM's chain-of-thought som den egentlige grund til svaret, selv om det er genereret tekst og ikke en tro gengivelse af beregningen.

Gode vejledninger

Teknisk uddybning

Litteraturen skelner mellem fortolkelighed (interpretability) - modeller, hvis struktur et menneske kan inspicere direkte, som sparsomme lineære modeller, lave beslutningstræer, regellister eller generaliserede additive modeller - og post-hoc-forklarlighed, hvor en separat metode tilnærmer, hvorfor en uigennemsigtig model gav et bestemt output. Forklaringer inddeles desuden i globale (hvordan modellen opfører sig overordnet) og lokale (hvorfor netop denne forudsigelse) og i modelspecifikke eller modelagnostiske. Rudin (2019) argumenterede for, at en fortolkelig model ved højrisikobeslutninger på tabeldata ofte er lige så præcis som en black box, så post-hoc-forklaring af en black box er det svagere valg.

De vigtigste post-hoc-familier er feature attribution, eksempelbaserede og kontrafaktiske metoder. LIME (Ribeiro et al., 2016) tilpasser en vægtet lineær surrogatmodel omkring det enkelte tilfælde ud fra forstyrrede eksempler. SHAP (Lundberg og Lee, 2017) tildeler hver feature dens Shapley-værdi fra kooperativ spilteori, den eneste fordeling, der opfylder efficiency, symmetry, dummy og additivity; KernelSHAP estimerer den ved sampling, og TreeSHAP beregner den eksakt for træ-ensembler. Gradientmetoder for neurale netværk omfatter saliency maps, Integrated Gradients (Sundararajan et al., 2017), der integrerer gradienter langs en sti fra en baseline, og Grad-CAM for konvolutionelle netværk. Kontrafaktiske forklaringer (Wachter et al., 2017) angiver den mindste ændring af input, der ville vende udfaldet - "havde den oplyste indkomst været over X, var ansøgningen blevet godkendt" - hvilket ofte er den mest brugbare form for en berørt person.

Fejlkilderne er veldokumenterede. Attributioner afhænger af den valgte baseline eller baggrundsfordeling; korrelerede features deler æren vilkårligt; saliency maps kan se plausible ud og samtidig være ufølsomme over for modellens vægte (Adebayo et al., 2018, "Sanity Checks for Saliency Maps"); og LIME og SHAP kan manipuleres, så en biased model ser ud til at bygge på harmløse features. For LLM'er er en chain-of-thought genereret tekst og ikke nødvendigvis en tro gengivelse af beregningen; mekanistisk interpretability (kredsløb, probing, sparse autoencoders på aktiveringer) sigter mod tro forklaringer, men er stadig et forskningsfelt. NIST IR 8312 opstiller derfor fire principper: forklaring, meningsfuldhed, forklaringens nøjagtighed og videnens grænser.

Juridisk giver GDPR art. 13, stk. 2, litra f, art. 14, stk. 2, litra g, og art. 15, stk. 1, litra h, den registrerede ret til meningsfulde oplysninger om logikken i automatiske afgørelser efter art. 22. EU-Domstolen fastslog i SCHUFA (C-634/21, 2023), at en kreditscore i sig selv kan være en sådan afgørelse, og i Dun & Bradstreet Austria (C-203/22, 2025), at forklaringen skal sætte personen i stand til at forstå den fremgangsmåde og de principper, der faktisk er anvendt, uden at hensynet til forretningshemmeligheder generelt kan afskære den. AI-forordningen tilføjer art. 13 (brugsanvisning, der sætter idriftsættere i stand til at fortolke output), art. 14 (menneskeligt tilsyn) og art. 86, en ret for berørte personer til at få en klar og meningsfuld forklaring på visse afgørelser, der bygger på højrisikosystemer efter bilag III.

Hvad du bør lære først

Alt det, dette bygger på - grundlaget først.

  1. Træningsdata
  2. →Maskinlæring
  3. →Forklarlighed

Relationer

Forudsætter
Maskinlæring
Afbøder
Bias i AI

Kilder og videre læsning

Hvor dataene kommer fra

Dette opslag er skrevet af en AI ud fra kilderne ovenfor og er endnu ikke gennemgået af et menneske. Brug det som udgangspunkt, og tjek alt vigtigt mod kilderne.

Se gennemgangskøenForeslå en rettelse på GitHubDette begreb som JSON

Test dig selv

Indlæser…

Atlas er i beta.