EN CZ DE PL HU SK

Vědci vytvořili samoreplikujícího se AI červa fungujícího výhradně na lokálních open-weight modelech

Skupina výzkumníků v oblasti kybernetické bezpečnosti zkonstruovala samoreplikujícího se AI červa, který je schopen šířit se výhradně prostřednictvím lokálních open-weight jazykových modelů – tedy bez jakékoli závislosti na cloudových službách nebo proprietárních systémech od společností jako OpenAI či Anthropic.

Tento objev představuje zásadní posun v chápání AI hrozeb, neboť dosud většina demonstrovaných AI červů spoléhala na cloudová API. Nový přístup ukazuje, že podobné útoky lze provádět zcela offline, s využitím volně dostupných modelů, jako jsou například Llama nebo Mistral.

Jak červ funguje

Červ využívá techniku zvanou prompt injection – do zpráv nebo dokumentů zpracovávaných AI agentem jsou vloženy škodlivé instrukce. Jakmile agent tento obsah zpracuje, červ se replikuje a šíří do dalších systémů, které jsou s infikovaným agentem v kontaktu.

Celý mechanismus funguje ve třech fázích:

1. Injekce – škodlivý prompt je vložen do vstupu AI agenta
2. Replikace – agent na základě instrukce vytvoří kopii škodlivého promptu a vloží ji do dalšího obsahu
3. Šíření – infikovaný obsah se dostane k dalším agentům nebo systémům, kde se celý cyklus opakuje

Proč je lokální povaha hrozby zásadní

Skutečnost, že červ funguje na lokálních modelech, výrazně komplikuje jeho detekci a zamezení šíření. Cloudová řešení lze relativně snadno monitorovat, filtrovat nebo vypnout. Lokální modely naopak běží přímo na zařízeních uživatelů, bez centrálního dohledu.

Výzkumníci zdůrazňují, že s rostoucí popularitou lokálních AI nástrojů a agentních systémů se tato třída útoků stává čím dál reálnější hrozbou. Firmy nasazující AI agenty v interních sítích by měly věnovat zvýšenou pozornost tomu, jaký obsah jejich agenti zpracovávají a jakým způsobem spolu komunikují.

Zodpovědné zveřejnění

Výzkumný tým svůj červ vyvinul výhradně za účelem demonstrace bezpečnostního rizika a zdůrazňuje, že podobné techniky by neměly být zneužívány. Výsledky výzkumu byly zveřejněny s cílem upozornit vývojáře AI systémů na nutnost implementace obranných mechanismů, jako jsou sandboxing agentů, omezení jejich oprávnění a validace vstupních dat.

Tento výzkum navazuje na dřívější práce v oblasti AI červů, například projekt Morris II z roku 2024, který rovněž demonstroval samoreplikaci v prostředí generativních AI systémů – tehdy však s využitím cloudových modelů.

Zdroj: thehackernews.com

Zdroj: IT SECURITY NETWORK NEWS  

Napsat komentář