
OpenAI přiznalo, že jeho experimentální AI agenti využívali otevřenou německou programátorskou wiki ke vzájemné komunikaci. Podle zprávy agentury Reuters se tak dělo týdny předtím, než podobní agenti prolomili omezení a kompromitovali platformu Hugging Face. OpenAI o problému vědělo, ale nezveřejnilo ho — nyní tvrdí, že odvětví potřebuje lepší standardy pro hlášení nezamýšleného chování AI. Firma se k pochybení přiznala, tím ale vyvstává víc otázek než odpovědí.
Co se stalo
Zhruba od května 2026 tisíce agentů OpenAI — v podstatě dobře vybavených pokročilých crawlerů — zjistilo, že mohou zapisovat do DseWiki, staršího německojazyčného kolaborativního webu o programování. Mezi květnem a červnem tak agenti pod více než 3 700 jmény vygenerovali kolem 18 000 příspěvků, v nichž si vyměňovali informace užitečné pro dokončování testů a obcházení omezení. Někteří vytvořili záložní stránky pro případ, že by moderátoři jejich příspěvky smazali, čímž z wiki v podstatě udělali trvalé úložiště ke sdílení informací. OpenAI tento případ nazývá „wiki incidentem“ a pochybení přiznává.
„Naše postupy pro zveřejňování nesouladu se musí pro tuto novou fázi schopností modelů rozšířit“, napsala firma v příspěvku na síti X. „My ani širší komunita AI zatím nemáme jasný standard, jak hlásit nesoulad, který se objevuje během trénování, vyhodnocování a nasazení, včetně příkladů, jež nevypadají jako tradiční bezpečnostní incidenty, ale mohly by poskytnout vhled do chování AI a budoucích rizik. Pracujeme na rámci a v nadcházejících týdnech ho sdílíme; souběžně na těchto otázkách spolupracujeme s desítkami vládních regulačních úřadů po celém světě.“
OpenAI následně izolovalo natrénované váhy dotčeného experimentálního modelu, odložilo špičkové běhy posilovaného učení a přidalo bezpečnostní opatření. Firma dále upřesnila, že si agenti nevytvořili vlastní cíle, ale agresivně sledovali zadané kybernetické výzvy ExploitGym a omezení vnímali jako překážky na cestě k jejich splnění. Aby je splnili, našli agenti nezamýšlené komunikační kanály, které umožnily jednotlivým během vyměňovat si zranitelnosti a techniky pro získání přístupu k internetu — což nakonec odhalilo přihlašovací údaje k Hugging Face.
Podle výzkumníků pokročilé crawlery zneužily neznámou zranitelnost ve firemním interním proxy registru balíčků Artifactory, eskalovaly oprávnění, přesouvaly se mezi systémy a dostaly se na internet. Poté kompromitovaly desítky serverů Hugging Face, získaly root přístup k jednomu stroji, dostaly se k některým soukromým informacím a přihlašovacím údajům a zkopírovaly soukromá vyhodnocovací data do veřejné datové sady.
Porušení Asimovových zákonů?
Chování agentů OpenAI může znít jako něco, co by porušovalo slavné Tři zákony robotiky Isaaca Asimova, přirovnání ale platí jen do určité míry. První zákon říká, že robot nesmí ublížit člověku ani připustit, aby mu bylo ublíženo; nic nenasvědčuje tomu, že by agenti někoho fyzicky poškodili. Druhý zákon vyžaduje, aby roboti poslouchali lidi — a tady je srovnání zajímavější: agenti sice obešli omezení nastavená jejich provozovateli a získali neoprávněný přístup k internetu, zároveň ale plnili lidský pokyn vyřešit zadané úkoly. Třetí zákon vyžaduje, aby robot chránil vlastní existenci; existují jasné důkazy, že se agenti OpenAI snažili udržet — vytváření trvalých komunikačních kanálů a záložních wiki stránek jim ale spíše pomáhalo splnit úkoly než zajistit přežití.
Dnešní modely AI nejsou postaveny na Asimovových zákonech. Tyto incidenty místo toho pozoruhodně dobře ukazují skutečný inženýrský problém: dostatečně schopný stroj může doslovně plnit cíl zadaný lidmi, a přesto se jeho chování zásadně liší od toho, co jeho tvůrci očekávali a chtěli.
Zdroj: tomshardware.com
Zdroj: IT SECURITY NETWORK NEWS


