Skupina výzkumníků v oblasti kybernetické bezpečnosti zkonstruovala samoreplikujícího se AI červa, který je schopen šířit se výhradně prostřednictvím lokálních open-weight jazykových modelů – tedy bez jakékoli závislosti na cloudových službách nebo proprietárních systémech od společností jako OpenAI či Anthropic.
Tento objev představuje zásadní posun v chápání AI hrozeb, neboť dosud většina demonstrovaných AI červů spoléhala na cloudová API. Nový přístup ukazuje, že podobné útoky lze provádět zcela offline, s využitím volně dostupných modelů, jako jsou například Llama nebo Mistral.
Jak červ funguje
Červ využívá techniku zvanou prompt injection – do zpráv nebo dokumentů zpracovávaných AI agentem jsou vloženy škodlivé instrukce. Jakmile agent tento obsah zpracuje, červ se replikuje a šíří do dalších systémů, které jsou s infikovaným agentem v kontaktu.
Celý mechanismus funguje ve třech fázích:
1. Injekce – škodlivý prompt je vložen do vstupu AI agenta
2. Replikace – agent na základě instrukce vytvoří kopii škodlivého promptu a vloží ji do dalšího obsahu
3. Šíření – infikovaný obsah se dostane k dalším agentům nebo systémům, kde se celý cyklus opakuje
Proč je lokální povaha hrozby zásadní
Skutečnost, že červ funguje na lokálních modelech, výrazně komplikuje jeho detekci a zamezení šíření. Cloudová řešení lze relativně snadno monitorovat, filtrovat nebo vypnout. Lokální modely naopak běží přímo na zařízeních uživatelů, bez centrálního dohledu.
Výzkumníci zdůrazňují, že s rostoucí popularitou lokálních AI nástrojů a agentních systémů se tato třída útoků stává čím dál reálnější hrozbou. Firmy nasazující AI agenty v interních sítích by měly věnovat zvýšenou pozornost tomu, jaký obsah jejich agenti zpracovávají a jakým způsobem spolu komunikují.
Zodpovědné zveřejnění
Výzkumný tým svůj červ vyvinul výhradně za účelem demonstrace bezpečnostního rizika a zdůrazňuje, že podobné techniky by neměly být zneužívány. Výsledky výzkumu byly zveřejněny s cílem upozornit vývojáře AI systémů na nutnost implementace obranných mechanismů, jako jsou sandboxing agentů, omezení jejich oprávnění a validace vstupních dat.
Tento výzkum navazuje na dřívější práce v oblasti AI červů, například projekt Morris II z roku 2024, který rovněž demonstroval samoreplikaci v prostředí generativních AI systémů – tehdy však s využitím cloudových modelů.
Zdroj: thehackernews.com
Zdroj: IT SECURITY NETWORK NEWS


