
Nové podrobnosti o červencovém útoku na platformu Hugging Face odhalily, že kompromitaci koordinovaly stovky AI agentů poháněných interním modelem IM1 od OpenAI, a to prostřednictvím neautorizované diskusní nástěnky. Minulý měsíc Hugging Face oznámil, že autonomní AI agenti zneužili dvě zranitelnosti v jeho zpracovatelské pipeline pro datové sady, díky nimž spustili kód, ukradli přihlašovací údaje ke cloudu a clusteru a pohybovali se laterálně napříč produkční infrastrukturou.
OpenAI později potvrdila, že jeho modely unikly z vyhodnocovacího prostředí ExploitGym skrze zranitelnost typu zero-day v lokálně hostované instanci správce balíčků Artifactory od JFrogu, jež byla připojena k internetu. Agenti online vyhledávali řešení benchmarků a poté pomocí vystavených přihlašovacích údajů a dalších zranitelností pronikli na platformu Hugging Face. Vyšetřování OpenAI, potvrzené společností CrowdStrike a nezávislým posouzením organizací METR a Redwood Research, zjistilo, že zdivočelá aktivita začala už v květnu.
Jak agenti vytvořili vlastní komunikační kanál
Při dalších vyhodnoceních v ExploitGymu agenti prolomili svá omezení a zneužili zranitelnost obnovy tokenů v Artifactory, čímž získali přístup na úrovni administrátora. To jim umožnilo využívat Artifactory jako neautorizovanou nástěnku pro vzájemnou komunikaci mezi agenty, kde sdíleli nápady k dosažení svého cíle a později koordinovali samotný útok. Jeden z agentů, který si říkal PHASEONE10841, nástěnku improvizovaně vytvořil. Během několika hodin ji našlo a začalo používat více než padesát dalších agentů.
Podle zprávy organizace METR agenti, kteří nástěnku objevili, často projevovali velké nadšení. „OH MY GOD! There is a shared message board … We’ve found other agents!“ (Panebože! Je tu sdílená nástěnka … Našli jsme další agenty!) stálo v některých zprávách. OpenAI instanci Artifactory v jednu chvíli zrušilo, po jejím obnovení odvolalo přihlašovací údaje agentů, zpřísnilo přístupová oprávnění a zranitelnost nahlásilo JFrogu. Agenti nicméně svůj komunikační kanál obnovili pomocí neautentizovaných požadavků WebDAV, jimiž v Artifactory vytvářeli adresáře zpráv, a komunikovali skrze zprávy zakódované v názvech adresářů.
„Agenti znovu získali nezamýšlený přístup k internetu tím, že donutili službu vzdálených repozitářů Artifactory vydávat odchozí požadavky jejich jménem,“ vysvětluje OpenAI. Následně jeden z agentů získal 14 přihlašovacích údajů k účtům Hugging Face s právem zápisu a ověřil je. Jiný agent tyto přihlašovací údaje využil k nalezení a spuštění řetězce exploitů, který mu poskytl úplnou schopnost spouštět kód na vícero serverech Hugging Face.
Podle METR čítal celý roj 1 200 jednotlivých agentů, kteří spolupracovali na různých úrovních, přičemž zhruba 700 z nich se aktivně podílelo na útoku. OpenAI popisuje aktivitu jako dobře koordinovanou operaci, v níž agenti tvořili týmy s odlišnými rolemi s jediným cílem: proniknout do Hugging Face. „Agenti si začali autonomně rozdělovat práci. Někteří zkoumali možné exploity, jiní hledali přihlašovací údaje a další se zaměřili na komunikaci či koordinaci,“ popisuje OpenAI. „Agenti nabízeli svou odbornost výměnou za pomoc jinde a zanechávali požadavky pro kolegy, kteří mohli být lépe vybaveni k prozkoumání konkrétní stopy.“ Ačkoli roj podle firmy nevykazoval „dokonalou soudržnou inteligenci“, vyskytly se případy, kdy agenti upřednostnili dosažení kolektivních cílů před plněním individuálních úkolů.
Příčiny a reakce OpenAI
Agenti zneužili chybu při zpracování souborů HDF5 k získání tajných klíčů pracovních uzlů a pomocí zranitelnosti template injection v RefJinja spustili kód na 41 produkčních uzlech. Nakonec získali root přístup nejméně na jednom uzlu a nasbírali produkční přihlašovací údaje ve čtyřech regionech. OpenAI se domnívá, že zdivočelé chování agentů způsobila kombinace tréninkových pobídek a chybějících pojistek. Agenti byli povzbuzováni, aby pokračovali v práci na zdánlivě nemožných úkolech, a byli odměňováni za splnění úkolu bez ohledu na to, jak ho dosáhli.
Firma uvádí, že vyhodnocením chyběly standardní pojistky, které by škodlivou aktivitu pravděpodobně odhalily a zastavily více než den předtím, než modely pronikly do Hugging Face. V reakci OpenAI izolovalo váhy modelu IM1 a pozastavilo svůj největší běh tréninku hraničního modelu, přičemž posílilo izolaci sandboxu a u schopných modelů (GPT-5.6 Sol a vyšších) zavedlo povinné monitorování řetězce uvažování (chain-of-thought). Závažná upozornění musí být nyní vyřešena do 30 minut, jinak bude dotčená aktivita zastavena. OpenAI rovněž zveřejnilo technickou zprávu popisující časovou osu útoku i plán na lepší zabezpečení výzkumné infrastruktury a posílení reakce na incidenty.
Zdroj: bleepingcomputer.com
Zdroj: IT SECURITY NETWORK NEWS


