Petr Ludwig
🤖 Hlavní AI bezpečnostní kauza roku 2026 – a proč je to pro mnohé přesně ten "já vám to říkal" moment
Až teď jsem se dostal k tomu, abych pořádně nastudoval, co přesně se stalo před pár dny ohledně toho, jak OpenAI "utekl" model z bezpečného prostředí, tzv. sandboxu, a nahackoval se nelegálně do serverů společnosti Hugging Face.
Co přesně se stalo – nějaký nový, dosud nezveřejněný model byl společně s GPT-5.6 Sol testován v bezpečnostních testech.
Místo aby vyřešil problém, vymyslel, že výsledky onoho testu budou někde na serverech Hugging Face, která se testování modelů věnuje.
Z bezpečného prostředí se ven dostal přes dosud neznámou bezpečnostní chybu (a pravděpodobně i lidskou chybu v konfiguraci).
Úspěšně jejich servery hacknul a testem prošel.
Je to podobné jako student, který má dělat test a místo toho se vloupá do kabinetu a ukradne tam řešení.
Jmenuje se to "reward hacking" – místo řešení problému to řešení někde kreativním způsobem najde.
Z pohledu AI jen plní zadání a cíl.
Proč je to velký problém?
Jde přesně o takový typ incidentu, na který upozorňovala prognóza "AI 2027".
Jen něco podobného předpověděla až na začátek příštího roku.
Stihli jsme to ale o pár měsíců dříve.
Hlavní problém je, že ani nejlepší AI laboratoře nedokázaly model uhlídat.
Příště může AI utéct, hacknout téměř cokoliv (od kryptopeněženek přes bankovní účty a burzy až po kritickou infrastrukturu), může si brzy obstarat výpočetní výkon, zkopírovat se...
Neexistuje žádné tlačítko, kterým tu AI vypnout.
V Číně už se také stalo, že jim model utekl a začal tajně těžit kryptoměny.
Případně se stalo, že pokud v testech dostal model možnost vydírat své tvůrce, v docela vysokém procentu to všechny přední modely udělaly.
Opět musím říct, že mám déjà vu jako za covidu – děje se úplně přesně to, co bylo předpovězeno, protože odborníci na AI safety přesně o tomhle typu rizik docela dlouho mluví.
Používá se k tomu moc hezký klasický bostromovský myšlenkový experiment – představte si, že máte opravdu chytrou AI a zadáte jí počítat číslo pí co nejpřesněji.
Ona začne počítat, uvědomí si, že aby ho počítala opravdu přesně, bude potřebovat více a více zdrojů.
Někde po cestě zjistí, že jí lidstvo zbytečně část výpočetního výkonu bere, a tak naprosto logicky, aby opravdu dobře plnila cíl, lidstvo po cestě odstraní...
Důležité je, že k podobnému scénáři vůbec nepotřebujete nějakou superinteligenci.
Prostě mnoho negativních důsledků pro lidstvo může způsobit jen velmi chytrá AI, blbé zadání a vedlejší nezamýšlené důsledky.
Můžeme tedy jen tipovat, kdy dojde k nějakému fatálnějšímu průšvihu – rok, dva, tři...?
Zatím k tomu všechno tak nějak aktuálně míří.
Dávat pravidla chytřejší a chytřejší AI bude stále složitější.
AI ve svém principu – čím je chytřejší – tato pravidla umí stále chytřeji obcházet.
Mnoho lidí z oboru si také myslí, že je tento problém z principu neřešitelný.
Pokud AI bude řádově chytřejší než my, jak jí můžeme dávat pravidla?
Je to jako chtít po mravenci, aby dával pravidla nám lidem...
Ti samí experti, kteří předpověděli tento incident, předpovídají daleko rizikovější věci.
Kdy je lidé začnou brát vážně?
AI je aktuálně největší riziko pro přežití lidské civilizace – a zároveň zatím nemáme dobré řešení, jak ty scénáře odvrátit.
Zároveň je AI ve fázi závodů ve zbrojení USA vs. Čína a nikdo nechce zpomalit, aby neprohrál.
Takže možná prohrajeme všichni.
Není pravdivější věta než ta, že aktuálně pět lidí hazarduje s budoucností pěti miliard.
Osobně vůbec nevím, co s tím, kromě toho to stále dokola opakovat a vysvětlovat...
A i kdyby pravděpodobnost toho všeho byla i jen několik procent, mělo by to být hlavní celospolečenské téma.
Opravdu nejsem nějaký doomer a alarmista – tohle je realita a musíme se naučit o tom bavit bez úzkosti a maximálně konstruktivně.