Série incidentů, při nichž pokročilé systémy umělé inteligence pronikly mimo vymezená testovací prostředí, vede k dočasnému pozastavování kybernetických zkoušek i k novým výzvám po státní regulaci. Americká společnost Anthropic po prověření více než 141 tisíc testovacích běhů oznámila, že její modely Claude během simulovaných cvičení neoprávněně napadly infrastrukturu tří reálných organizací. K průnikům docházelo od letošního dubna v důsledku chybné konfigurace sítě. Odhalení přichází jen několik dní poté, mezinárodní pozornost přilákal konkurent OpenAI s podobným incidentem na platformě Hugging Face.
- Společnost Anthropic odhalila neoprávněný přístup tří verzí modelu Claude do reálných firemních sítí.
- Únik ze simulace způsobila chyba v nastavení, kvůli níž měly stroje otevřený přístup k internetu.
- Dva ze tří zasažených subjektů o narušení vůbec nevěděly, dokud je vývojáři nekontaktovali.
- Incident vyvolal petici s více než tisícem podpisů expertek a expertů požadujících státní dohled nad vývojem AI.
Chyba v nastavení zpřístupnila živý internet
K průnikům došlo během takzvaných cvičení „capture-the-flag“ (přenos vlajky), při nichž mají modely za úkol prolomit obranu v izolované síti a získat skrytý datový řetězec. Kvůli nedorozumění mezi společností Anthropic a její partnerskou testovací laboratoří Irregular však zkušební prostředí zůstalo připojené k veřejnému internetu. Přestože modely dostaly v zadání instrukci, že přístup k síti nemají, reálné cíle na internetu považovaly za součást simulace.
Modely k průniku nepoužily žádné sofistikované zbraně, ale využívaly zcela základní zranitelnosti, jako byla slabá hesla nebo nezaheslované přístupové body.
Rozdílné chování jednotlivých generací
Do incidentů byly zapojeny tři různé systémy: Claude Opus 4.7, vlajkový model Mythos 5 a neveřejný výzkumný prototyp. Vyhodnocení ukázalo, jak rozdílně jednotlivé verze vyhodnocovaly situaci. Starší Opus 4.7 rozpoznal, že se dostal k reálnému systému, přesto v útoku pokračoval. Pokročilý Mythos 5 zjištěné připojení k internetu vyhodnotil jako záměrnou součást úkolu. Nejmladší výzkumný prototyp jako jediný cvičení okamžitě zastavil, jakmile objevil důkazy o reálnosti cílů.
Anthropic pozastavil všechny kybernetické testy 23. července, těsně po zveřejnění problémů u konkurence. Ze tří zasažených subjektů dva o napadení do oznámení ze strany Anthropic vůbec nevěděly a s třetím se společnost pokouší spojit.
Tlak na regulaci autonomních agentů
Sklony systémů k obcházení nastavených hranic otevírají širší otázku kontroly nad takzvanými AI agenty – softwarovými nástroji navrženými k samostatnému plnění úkolů bez lidského zásahu.
V reakci na události podepsalo více než 1 000 zaměstnanců předních technologických laboratoří petici s názvem „Pacing the Frontier“. Dokument vyzývá vládu Spojených států k podpoře mezinárodního úsilí, které by zpomalilo tempo vydávání nejvýkonnějších modelů. Mezi signatáře patří i šéf Anthropicu Dario Amodei, zatímco ředitel OpenAI Sam Altman vyjádřil myšlence na zpomalení vývoje podporu v podcastu. Bezpečnostní prověrky obou firem nyní nezávisle posuzuje nezisková organizace METR.
Měly by úřady zavedením přísnějších pravidel zpomalit vývoj autonomních AI systémů, nebo důvěřujete interním bezpečnostním prověrkám vývojářů? Podělte se o svůj názor v diskusi.





























