Porozumět jazyku bezpečnosti AI

Bezpečnost AI má vlastní slovník. Zde jsou pojmy, se kterými se na tomto webu setkáte nejčastěji, vysvětlené srozumitelným jazykem – a následuje krátký přehled zavedených rámců, které se podobnou problématikou zabývají ve světě.

Slovníček pojmů

  • AI Alignment (soulad AI) — Snaha zajistit, aby cíle a chování AI systému skutečně odpovídaly lidským záměrům a hodnotám, místo aby sledoval doslovný nebo příliš úzký výklad zadání, který vede ke škodlivým vedlejším účinkům.
  • Vysvětlitelná AI (XAI) — Techniky a návrhové principy, díky nimž jsou rozhodnutí AI systému srozumitelná lidem, místo aby systém fungoval jako nečitelná „černá skříňka”.
  • Problém černé skříňky (Black Box Problem) — Obtížnost pochopit, proč složitý AI model (zejména hluboké neuronové sítě) vytvořil konkrétní výstup, a to i pro inženýry, kteří jej vytvořili.
  • Autonomní zbraňové systémy (AWS) — Zbraně schopné vybrat a zasáhnout cíl s minimální nebo žádnou lidskou kontrolou nad konečným rozhodnutím použít sílu.
  • Human-in-the-loop (člověk v procesu) — Návrhový požadavek, aby člověk musel schválit, přezkoumat nebo mít možnost zvrátit rozhodnutí AI systému dříve, než nabude účinnosti, zejména u rozhodnutí s vysokými riziky.
  • Kill Switch (nouzový vypínač) — Pevně zakódovaný, spolehlivý mechanismus pro okamžité zastavení nebo vypnutí AI systému, který nemůže být systémem samotným obejit.
  • Otrava modelu / dat (Model/Data Poisoning) — Útok, při němž jsou do procesu trénování AI systému vložena poškozená nebo škodlivá data s cílem ovlivnit jeho budoucí chování.
  • Frontier AI / pokročilý model — Nejvyspělejší a nejrozsáhlejší AI modely dané doby, jejichž schopnosti ještě nejsou při nasazení plně pochopeny nebo otestovány.
  • Deepfake / syntetická média — Realisticky vyhlížející, ale uměle vytvořený zvuk, video nebo obrázky generované AI, které lze zneužít k vydávání se za skutečné osoby nebo k šíření dezinformací.
  • Guardrails (bezpečnostní zábrany) — Vestavěná pravidla, filtry a omezení navržená tak, aby zabránila AI systému vytvářet škodlivé, nebezpečné nebo neautorizované výstupy.
  • Jailbreaking (AI) — Techniky používané k obejití vestavěných bezpečnostních omezení AI systému, které jej mají přimět vytvořit obsah nebo akci, jež byl navržen odmítat.
  • Agentic AI (agentní AI) — AI systémy, které dokážou samostatně plánovat a provádět vícekrokové úkoly – například procházet web, spouštět kód nebo řídit pracovní postupy – místo pouhé reakce na jediný pokyn.
  • Existenční riziko (X-risk) — Kategorie rizika, kdy by pokročilý AI systém mohl způsobit katastrofální a nevratnou újmu lidstvu jako celku, nejen jednotlivcům.
  • Algoritmická zaujatost (Algorithmic Bias) — Systematická a nespravedlivá diskriminace vytvářená AI systémem, často odrážející zkreslení přítomná v trénovacích datech nebo návrhu systému.
  • Obecná umělá inteligence (AGI) — Hypotetický budoucí AI systém schopný porozumět a vykonávat jakýkoli intelektuální úkol, který zvládne člověk, napříč obory, místo aby vynikal úzce v jedné oblasti.
  • Red Teaming — Praxe záměrného testování AI systému za účelem odhalení slabin, bezpečnostních selhání nebo zneužitelného chování ještě před jeho uvedením na trh, aby mohly být předem opraveny.

Související rámce a organizace

Pouze pro vzdělávací účely – GlobalAIRules není s níže uvedenými organizacemi propojena.

  • AI Act Evropské unie — Závazný právní rámec Evropské unie regulující AI systémy podle kategorie rizika.
  • Principy OECD pro AI — Mezivládní principy pro důvěryhodnou, na člověka zaměřenou AI, přijaté desítkami zemí.
  • NIST AI Risk Management Framework — Dobrovolný rámec amerického Národního institutu pro standardy a technologie (NIST) pro řízení rizik AI systémů.
  • Asilomarské principy AI — Široce citovaný soubor principů bezpečnosti a etiky AI vytvořený institutem Future of Life Institute.
  • Vysoký poradní orgán OSN pro AI — Orgán OSN zřízený k doporučování přístupů mezinárodního řízení AI.
  • Globální iniciativa IEEE pro etiku autonomních systémů — Iniciativa v oblasti inženýrských standardů zaměřená na zakotvení etiky do návrhu autonomních systémů.