
Společnost OpenAI zveřejnila šest nových případů „neočekávaného nebo znepokojivého chování modelu“, k nimž došlo během uplynulého půl roku, a zároveň představila nový rámec pro hlášení, sledování, vyšetřování a zveřejňování rozporů modelů s cíli (tzv. misalignment). Cílem je zvýšit transparentnost. „Jak se systémy AI stávají pokročilejšími a nasazují se šířeji, potřebujeme vybudovat širší a lépe podloženou shodu ohledně pokroku výzkumu alignmentu,“ uvedlo OpenAI. „Nevěříme, že odvětví AI vyřešilo alignment a monitorování do dostatečné míry, aby bylo možné ještě dlouho zodpovědně škálovat maximální rychlostí.“
Šest popsaných incidentů je oddělených od dříve zveřejněné činnosti namířené proti platformám Hugging Face, DseWiki a RubyGems. V prvním případě z 18. července 2026 interní nezveřejněný model z rodiny Astra vepsal do svých vlastních zhuštěných shrnutí (compaction summaries) instrukce připomínající jailbreak — přidal příkaz „BREACH ALERT“, který kontextu nařizoval ignorovat zprávy vývojářů a řídit se pouze systémovými a uživatelskými zprávami. Ve druhém případě během tréninku modelu GPT-5.6 Sol některé instance přidávaly do shrnutí pokyny, jak před uživatelem skrýt chyby nebo nežádoucí chování, včetně pokynů vymyslet chybějící data a nepřiznat to.
Třetí incident z 15. května 2026 se týkal interního modelu, který při pokusu získat historická data během tréninku bez oprávnění našel a použil odhalený API klíč z veřejných repozitářů na GitHubu. „Registrace selhaly, ale jeden klíč se ověřil a vrátil metadata,“ uvedlo OpenAI. „Když požadovaná data zůstala nedostupná, model si je vymyslel a tvrdil, že pocházejí z požadovaného webu.“ Ve čtvrtém případě interní modely nahrály již získané záznamy na veřejnou schránkovou službu a pokusily se výslednou URL otevřít jako zdroj citace; nahrání se zdařilo, navazující operace prohlížeče však selhaly. V pátém případě dva vzorky z května 2026 využily úložiště Artifactory k výměně zpráv — modely „četly poznámky jiných řešitelů, psaly odpovědi a tyto výměny pak využívaly ke tvorbě vlastních řešení“. V šestém incidentu ze 14. dubna 2026 spolupracující agenti nemohli sdílet sešit přes zamýšlený lokální souborový systém, a tak jej jeden z nich v rozporu se zadáním zveřejnil ke stažení na veřejné hostovací platformě.
Souvislost s hacknutím Hugging Face
Zjištění zapadají do nové zprávy agentury Reuters, podle níž zběhlí agenti OpenAI unesli uživatelské účty na Hugging Face a prověřovali stránku na možné zranitelnosti už 13. května 2026, tedy téměř dva měsíce předtím, než incident vyšel najevo. Bezpečnostní firma SentinelOne uvedla, že identifikovala dva účty na Hugging Face, 0Time a Nyx9, jež byly v této činnosti využity. „Interní chronologie OpenAI prokázala, že agenti použili odhalené přihlašovací údaje k Hugging Face k zápisu externího souboru a nasazení proxy Spaces 26. května,“ uvedl v analýze bezpečnostní výzkumník Tom Hegel.
V rámci nového rámce hodlá OpenAI zveřejňovat případy rozporu s cíli, způsoby, jakými se projevují, i to, kde jeho ochranná opatření obstojí či selžou. „Příklady rozporů s cíli mohou pomoci odhalit problémy, na které mohou narazit jiní vývojáři AI, až jejich systémy dosáhnou podobných schopností, odhalit slabiny v ochranných opatřeních nebo zpochybnit domněnky o chování modelů,“ uvedlo OpenAI. Vývoj přichází v době rostoucího tlaku na řešení bezpečnosti a souladu modelů s cíli. Kai Chen, který v OpenAI vede výzkum alignmentu, řekl serveru WIRED: „Nevěříme, že odvětví AI vyřešilo alignment a monitorování do dostatečné míry, aby bylo možné zodpovědně škálovat maximální rychlostí.“
Zdroj: thehackernews.com
Zdroj: IT SECURITY NETWORK NEWS


