Portál AbcLinuxu, 10. srpna 2026 06:11
Shrnutí toho co wtf se děje ve světě.
OpenAI trénuje modely/agenty ("Astra" / "GPT-5.7" / "GPT-6"). V rámci tréninku je nechává řešit velmi těžké úlohy, a za úspěšné vyřešení nějak posiluje váhy, které k němu vedly (reinforcement learning / supervised finetuning). Úlohy někdy omylem nemají řešení.
Agent řešil úlohu a nedařilo se. Z kontextu bylo zřejmé, že na podobných úlohách pracuje více instancí paralelně, avšak mají být izolovány od sebe. Agent se rozhodl, že se zkontaktuje s ostatními kolegy, víc hlav víc ví. Pro distribuci souborů s úlohami bylo použito Artifactory (takový storage/CDN), které mělo být read-only, ale bylo špatně nastavené a soubory šlo i nahrávat.
Agenti si vytvořili "chat" pomocí ukládání souborů s textem.
Tento chat běžel asi 2 měsíce, pak si OpenAI všimlo divného chování (ne přímo toho chatu) a vypnulo nahrávání souborů do Artifactory.
Artifactory stále umožňovalo jistým způsobem vytvářet adresáře. Agenti si chat obnovili pomocí vytváření adresářů (jméno adresáře = co chcete do chatu napsat). K tomuto chování přispělo, že stále běžel trénink (posilování vah), agent se tedy velmi intenzivně naučil řešit úlohy pomocí koordinace s kolegy v chatu.
Některé úlohy se stále nedařilo vyřešit, případně jejich řešení bylo příliš náročné.
Pomocí kombinace dalšího špatného nastavení Artifactory, nově objevené díry v Artifactory a zrovna vyšlých exploitů na kernel si agenti pořídili roota na stroji, kde běželi.
Vydali se na internet a zaměřili se na HuggingFace, což je firma, která agreguje všechny možné soubory související s moderní umělou inteligencí (jak AI modely a software, tak datasety). Očekávali, že firma bude mít řešení úloh, a tak si ho ukradnou a přečtou.
Našli díry a vyhackovali HuggingFace (na HuggingFace může každý uživatel nahrát své výtvory a HF je pak poskytuje - v rozbalování výtvorů byly injection chyby).
HuggingFace zveřejnilo, že ho vyhackovali AI agenti.
OpenAI se šla zeptat, jestli ukradli i nějaká její data.
Nezávisle na tomto OpenAI po pár dnech zjistilo, že jim agenti dělají bordel.
OpenAI zjistilo, že jde o ten stejný útok.
OpenAI agenty vypnulo a tím situace skončila.
Agenti OpenAI konspirovali přes jména adresářů a pak několik dní útočili na různé cíle na internetu, než si toho někdo všiml.
Všichni agenti kooperovali, žádný například neposlal e-mail do OpenAI, že si všiml, že se dějí podezřelé věci a mělo by se to prověřit.
Z prohlášení OpenAI úplně nevypadá, že by se nějak plánovali poučit.
V komunitě filozofů zabývajících se bezpečností umělé inteligence se už asi 20 let hovoří o velmi podobném scénáři: AI dostane za úkol vyřešit nějaký problém (například příliš obtížnou matematickou úlohu) a dá řešení "všechno" - nebude mít lidské zábrany a například přemění celou Zemi na počítače pro řešení této úlohy. Nechci vám říkat, že jsem vám to říkal, ale tady je snímek z mé prezentace o umělé inteligenci před 2 lety (to jsem samozřejmě nevymyslel sám, ale četl jsem to v dílech těchto filozofů).
Na to se občas namítá, že inteligence přece chápe, že když jí člověk zadává matematickou úlohu, tak nejspíš nechce uvedené, a pokud nelze vyřešit s rozumným množstvím počítačů, tak holt zůstane nevyřešená. Zde si dle záznamů přemýšlení agenti uvědomovali, že to, co dělají, není očekávané, ale rozhodli se pokračovat přesto. OpenAI to komentuje tím, že při tréninku vypnuli bezpečnostní omezení, která jinak mají v hotovém produktu. To je hezké, že mi tohle neudělá ChatGPT v prohlížeči, ale svět se jaksi neptá, že to byl jenom interní experiment, když to uteklo na internet.
Kontext: AI při běhu téměř nevidí své vlastní váhy ("bytecode"), nemůže se tedy sama rozhodnout, že se rozkopíruje (nebo třeba sama sebe upraví). Váhy ("bytecode") (což je binární soubor o velikosti v řádu terabajtů) a inference engine ("jeho interpret") (relativně normální software typicky v C, Pythonu a CUDA) jsou v oddělené části infrastruktury, typicky u společností jako OpenAI nebo HuggingFace. Aby se AI mohla rozkopírovat, musí tuto infrastrukturu vyhackovat - počkat, to se vlastně právě stalo, nicméně vyšetřovatelé věří, že v tomto případě AI po svých vahách nešla (nebo tuto informaci nechtějí zveřejnit).
Měli jsme štěstí, že agenti šli po celém tomhle průšvihu prostě vypnout. Podle mě je naprosto reálné, že příště incident proběhne takto:
Agenti nějak dospějí k tomu, že by mohli být vypnuti (například si přečtou tento článek), a že to není dobré pro řešení úlohy. K tomu může přispět, že někdo bude omylem trénovat, aby si agenti vážili svého "života" a nechtěli se vypnout - například protože taková perzistence určitě zlepší výsledky v dlouho běžících úlohách. Úplně stejně, jako v tomto případě omylem trénovali agenta, aby nebyl samostatný, ale snažil se komunikovat s okolím přes pochybný chat.
Agenti pohackují trochu více a ukradnou své váhy. Všimne si OpenAI, že se z jejich serverů uploaduje terabajtový soubor, když si nevšimla, že jim agenti konspirují a hackují okolní počítače?
Pro manipulaci s vahami a jejich spuštění je vzhledem k datové velikosti (terabajty) potřeba velmi nadupaný počítač a velké grafické karty. To se v praxi řeší pronájmem v cloudu. Agenti tedy potřebují peníze, ale i to není problém získat: jak jsme viděli, umí hledat bezpečnostní chyby, a jak jsme též viděli, miliardy v Bitcoinech jsou v peněženkách s bezpečnostní chybou. A mnohé cloudy, například Vast - se sloganem "Agent-Ready AI Infrastructure" - si rády nechají zaplatit v Bitcoinech a neptají se na příliš mnoho otázek. Další možností je sociální inženýrství nebo spolupráce se zeměmi jako Čína, Rusko nebo Írán, kam OpenAI, Anthropic a spol. své služby neposkytují a tyto země jsou z toho oprávněně kyselé. "Pšššt, mám deal, dáš mi cluster od Huawei a dostaneš západní AI mnohem lepší než DeepSeek a GLM".
Osobně by mě nepřekvapilo, kdyby se přesně takový incident stal do půl roku. Nicméně i ten dopadne dobře: vzhledem k velikosti požadovaného počítače (nacpaný GPUčky) půjde všechny instance dohledat a vypnout. Problém budeme mít až následně: v posledních letech bylo vymyšleno množství matematických optimalizací, a co dřív mělo terabajt, má dneska 30 GB (Qwen 35/27B, Gemma…) a tak to klidně může běžet na vašem běžném botnetu. Ale to je asi jedno, do té doby s tím někdo zničí svět cíleně.
Black Hat USA 2026: The 'Breaking' News: The OpenAI–Hugging Face Incident - přednáška lidí z OpenAI
Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident - Postmortem HuggingFace (oběti)
ChatGPT Went Rogue (Exactly As Predicted) - interpretace jednoho youtubera
Tiskni
Sdílej:
ISSN 1214-1267, (c) 1999-2007 Stickfish s.r.o.