Kdo hacknul koho, proč, s kým a za kolik?
před 8 hodinami
Možná jste slyšeli, že OpenAI má teď trošičku skandáleček, protože jejich AI agent nahackoval (odborníci říkaj pwnd, můžete se někde blejsknout) firmu Hugging Face. Když pomineme známý schéma AI firem kradoucích data, co se vlastně stalo?
Tohle bude chtít trošku kontextu. OpenAI všichni znaj, i když to možná nevědí: Ano, to jsou ti lidi, co stojí za ChatGPT. Hugging Face naopak spíš neznáte, pokud neděláte do AI. Je to platforma, kde můžete vystavovat, stahovat, kupovat a vyměňovat open-source AI modely (trochu jako Pokémony) a související software a informace. Jinými slovy, je to obří databáze informací poněkud specifickýho charakteru.
Další kus kontextu, kterej potřebujete, je, co je to AI agent. Po otevření ChatGPT můžete do okýnka zadat, co po něm chcete - to ví každej. Trik je ale v tom, že tohle zadání nemusí bejt jednoduchá věc, jako "najdi mi nejlepší recept na štrůdl", ale může to bejt něco složitýho jako "vytvoř mi nástroj na prohledávání internetu, abych věděl o každým novým receptu na štrůdl, co se objeví". Agent pak jde, úkol rozloží na kroky a začne je plnit - a občas se vás zeptá na potvrzení (jako třeba "můžu si vytvořit složku, do které si uložím všechny soubory, co k tomu potřebuju?"). S tím, jak občas vypadá kvalita toho, co z AI leze, to může znít jako blbej nápad, ale když o něco jde, tak se na tohle většinou používají velice sofistikovaný a speciálně trénovaný modely, takže výsledky jsou někdy překvapivě kulervoucí.
AI agenta můžete použít třeba k tomu, aby vám vytvořil web, nebo naprogramoval hru, i když víte houby o tom, jak se tvoří weby a neumíte programovat. Hyena Lenka takhle vyrobila pro svou maminku hru Šestráda, která se už nedá na internetu sehnat. AI agentovi dáte přístup ke složce a on si tam vyrábí, maže a mění soubory. Asi je vám jasný, že kdybyste mu dali přístup k celýmu vašemu počítači, tak se pak nemůžete divit, že vám vytvářel, mazal a měnil soubory. A přesně tohle je v miniaturním měřítku podstata naší kauzičky.
OpenAI podle všeho vyrobila AI agenta (nebo několik), kterej byl v zásadě hacker, tj. designovanej na to, aby lezl, kam nemá, a dělal tam, co nemá. OpenAI o sobě ráda tvrdí, že nejsou úplně blbý a že samozřejmě dali agenta-hackera do tzv. sandboxu (neboli bezpečnýho testovacího prostředí, kde jsou reálný věci jenom simulovaný, odpojenýho od internetu). Jenže co se nestalo. Za prvý, agent-hacker byl instruovanej, aby sám sebe vylepšil a dobře složil zkoušku z hackování. Za druhý, agent-hacker byl trochu moc dobrej. A teď se dají napsat dvě vysvětlení, co se vlastně stalo.
Antropomorfizujícím jazykem: Agent ze sandboxu promptně vylezl, rozhodl se, že aby složil zkoušku a sám sebe vytunil, potřebuje přístup do Hugging Face, a tak se tam nahackoval. V novinách si můžete přečíst o tom, jak se "vymkl kontrole" a jak to byl "bezprecedentní útok OpenAI na Hugging Face".
No a doopravdy: AI agent se ve skutečnosti vůbec nevymkl kontrole, ale jenom dělal přesně to, co byl instruovanej - člověkem - aby udělal. Dokonce se ukázalo, že ani nebyl úplně odpojenej od internetu. Agent následoval svý programování a udělal to, co bylo potřeba, aby splnil zkoušku z hackování. Ani se nedá říct, že by šlo o útok jedný firmy na druhou, byla to prostě zkouška z hackování, kdy člověk řekl modelu vytvořenému OpenAI, aby vyhledával a zneužíval zranitelnosti v softwaru. A model šel a udělal to. Toť vše. Ať o tom kdo mluví jak chce, poslední vědomý rozhodnutí v celým řetězci byl prompt, kterej to všecko spustil, a pak už to jelo, asi jako když pustíte Windowsy a oni si začnou v tem nejnevhodnější moment stahovat update.
A tady se - na rozdíl od agenta - vymyká kontrole celá debata. Říkat o AI agentovi (Pamatujte - glorifikovanej generátor písmenek! No, tahle metafora už nám pomalu přestává stačit, ale v jádru to tak pořád je.), což je komplex hardware, software a statistickejch modelů, že se vymkl kontrole a začal dělat něco, co neměl, je antropomorfizace, která vede do pekla. Je třeba pamatovat, že "agent něco udělal" znamená akorát to, že program statisticky vypočítal, která akce povede nejpravděpodobnějc k úspěchu, a pak tuhle akci na základě programování provedl. Vůle nebo vědomí tam nikde nefiguruje.
Aneb, eště pořád zdaleka nejsme v době, kdy si AI uvědomí sama sebe a začne sledovat vlastní cíle, a ani se tomu neblížíme. AI agenti pořád ještě plní instrukce lidí - a že to občas udělají nečekaným způsobem, rozhodně není známkou vědomí. Pojďme nedělat z AI bytost, pořád je to jenom nástroj.
