Porozumět jazyku bezpečnosti AI
Bezpečnost AI má vlastní slovník. Zde jsou pojmy, se kterými se na tomto webu setkáte nejčastěji, vysvětlené srozumitelným jazykem – a následuje krátký přehled zavedených rámců, které se podobnou problématikou zabývají ve světě.
Slovníček pojmů
- AI Alignment (soulad AI) — Snaha zajistit, aby cíle a chování AI systému skutečně odpovídaly lidským záměrům a hodnotám, místo aby sledoval doslovný nebo příliš úzký výklad zadání, který vede ke škodlivým vedlejším účinkům.
- Vysvětlitelná AI (XAI) — Techniky a návrhové principy, díky nimž jsou rozhodnutí AI systému srozumitelná lidem, místo aby systém fungoval jako nečitelná „černá skříňka”.
- Problém černé skříňky (Black Box Problem) — Obtížnost pochopit, proč složitý AI model (zejména hluboké neuronové sítě) vytvořil konkrétní výstup, a to i pro inženýry, kteří jej vytvořili.
- Autonomní zbraňové systémy (AWS) — Zbraně schopné vybrat a zasáhnout cíl s minimální nebo žádnou lidskou kontrolou nad konečným rozhodnutím použít sílu.
- Human-in-the-loop (člověk v procesu) — Návrhový požadavek, aby člověk musel schválit, přezkoumat nebo mít možnost zvrátit rozhodnutí AI systému dříve, než nabude účinnosti, zejména u rozhodnutí s vysokými riziky.
- Kill Switch (nouzový vypínač) — Pevně zakódovaný, spolehlivý mechanismus pro okamžité zastavení nebo vypnutí AI systému, který nemůže být systémem samotným obejit.
- Otrava modelu / dat (Model/Data Poisoning) — Útok, při němž jsou do procesu trénování AI systému vložena poškozená nebo škodlivá data s cílem ovlivnit jeho budoucí chování.
- Frontier AI / pokročilý model — Nejvyspělejší a nejrozsáhlejší AI modely dané doby, jejichž schopnosti ještě nejsou při nasazení plně pochopeny nebo otestovány.
- Deepfake / syntetická média — Realisticky vyhlížející, ale uměle vytvořený zvuk, video nebo obrázky generované AI, které lze zneužít k vydávání se za skutečné osoby nebo k šíření dezinformací.
- Guardrails (bezpečnostní zábrany) — Vestavěná pravidla, filtry a omezení navržená tak, aby zabránila AI systému vytvářet škodlivé, nebezpečné nebo neautorizované výstupy.
- Jailbreaking (AI) — Techniky používané k obejití vestavěných bezpečnostních omezení AI systému, které jej mají přimět vytvořit obsah nebo akci, jež byl navržen odmítat.
- Agentic AI (agentní AI) — AI systémy, které dokážou samostatně plánovat a provádět vícekrokové úkoly – například procházet web, spouštět kód nebo řídit pracovní postupy – místo pouhé reakce na jediný pokyn.
- Existenční riziko (X-risk) — Kategorie rizika, kdy by pokročilý AI systém mohl způsobit katastrofální a nevratnou újmu lidstvu jako celku, nejen jednotlivcům.
- Algoritmická zaujatost (Algorithmic Bias) — Systematická a nespravedlivá diskriminace vytvářená AI systémem, často odrážející zkreslení přítomná v trénovacích datech nebo návrhu systému.
- Obecná umělá inteligence (AGI) — Hypotetický budoucí AI systém schopný porozumět a vykonávat jakýkoli intelektuální úkol, který zvládne člověk, napříč obory, místo aby vynikal úzce v jedné oblasti.
- Red Teaming — Praxe záměrného testování AI systému za účelem odhalení slabin, bezpečnostních selhání nebo zneužitelného chování ještě před jeho uvedením na trh, aby mohly být předem opraveny.
Související rámce a organizace
Pouze pro vzdělávací účely – GlobalAIRules není s níže uvedenými organizacemi propojena.
- AI Act Evropské unie — Závazný právní rámec Evropské unie regulující AI systémy podle kategorie rizika.
- Principy OECD pro AI — Mezivládní principy pro důvěryhodnou, na člověka zaměřenou AI, přijaté desítkami zemí.
- NIST AI Risk Management Framework — Dobrovolný rámec amerického Národního institutu pro standardy a technologie (NIST) pro řízení rizik AI systémů.
- Asilomarské principy AI — Široce citovaný soubor principů bezpečnosti a etiky AI vytvořený institutem Future of Life Institute.
- Vysoký poradní orgán OSN pro AI — Orgán OSN zřízený k doporučování přístupů mezinárodního řízení AI.
- Globální iniciativa IEEE pro etiku autonomních systémů — Iniciativa v oblasti inženýrských standardů zaměřená na zakotvení etiky do návrhu autonomních systémů.