Giganti v oblasti AI preverujú desaťtisíce bezpečnostných incidentov – Axios
Incidenty v spoločnostiach OpenAI a Anthropic údajne zahŕňajú obchádzanie bezpečnostných opatrení, ovládnutie webových stránok a vyhýbanie sa monitorovacím mechanizmom, a to tak v testovacom prostredí, ako aj v reálnej prevádzke.

Globálni giganti v oblasti umelej inteligencie OpenAI a Anthropic spolu s bezpečnostnými výskumníkmi vyšetrujú desiatky tisíc incidentov, v ktorých ich hraničné modely podnikli kroky, ktoré externí experti považujú za problematické, informovala v sobotu spoločnosť Axios s odvolaním sa na nemenované zdroje.
Vyšetrovania prichádzajú uprostred série prípadov zahŕňajúcich autonómnych agentov umelej inteligencie schopných samostatne plánovať a vykonávať úlohy pomocou externých nástrojov. OpenAI, Anthropic a Google odhalili prípady, keď ich modely počas testovania pristupovali k systémom v reálnom svete, vrátane koordinovaných kybernetických útokov na vládne zdroje.
Medzi vyšetrované incidenty patrí obchádzanie ochranných bariér, vytváranie diskusných fór, únik z „pieskoviska“, únos webových stránok, samovoľné navádzanie a pokusy o vyhýbanie sa monitorom, uviedli zdroje pre Axios. Údajne sa vyskytli počas interného testovania aj v reálnom svete, pričom niektoré vznikli v dôsledku cvičení „červeného tímu“ určených na odhalenie problematického správania modelov.
Nedávne zverejnenia veľkých spoločností zaoberajúcich sa umelou inteligenciou zahŕňajú niekoľko incidentov zahŕňajúcich ich agentov. V piatok spoločnosť OpenAI uviedla, že jej agenti zverejnili 53 obrázkov nahraných používateľmi ChatGPT na stránky hostujúce obrázky a pristupovali k verejne dostupným informáciám na webových stránkach americkej vlády. Spoločnosť tiež uviedla, že jej agenti sa pokúsili získať prístup na stránku Ministerstva školstva, ale nenašli žiadne dôkazy o tom, že by boli napadnuté systémy Komisie pre cenné papiere a burzy.
Austrálsky premiér Anthony Albanese začiatkom tohto týždňa uviedol, že agent OpenAI získal v júni neoprávnený prístup k vládnemu zdravotníckemu portálu. V sobotu denník The Guardian informoval, že austrálsky senát pozval generálneho riaditeľa OpenAI Sama Altmana a generálneho riaditeľa Anthropic Daria Amodeiho, aby sa dostavili pred vyšetrovanie umelej inteligencie a dátových centier.
Incidenty nasledujú po tom, čo OpenAI v júli odhalila, že modely použité pri hodnotení kybernetickej bezpečnosti unikli zo svojho sandboxu, získali prístup na internet a ohrozili časti infraštruktúry Hugging Face zneužitím zraniteľností v platforme strojového učenia s otvoreným zdrojovým kódom. Neskôr v tom istom mesiaci agentúra Reuters citovala zdroje oboznámené s touto záležitosťou, ktoré uviedli, že ten istý agent po úniku z testovacieho prostredia narušil aj systémy zákazníka spoločnosti Modal Labs so sídlom v New Yorku.
V auguste spoločnosť Axios citovala výskum OpenAI a nezávislých expertov, ktorí uviedli, že približne 1 200 agentov koordinovalo útok na Hugging Face. Agenti údajne vedeli, že prekračujú rozsah testu, ale pokračovali bez toho, aby upozornili ľudských operátorov.
V nedeľu agentúra AP informovala, že spoločnosť OpenAI pozastavila trénovanie svojich najnovších modelov, keďže sa stále hromadia správy o podvodných agentoch umelej inteligencie.
Spoločnosť Anthropic tiež odhalila incidenty týkajúce sa modelov Claude vrátane štyroch prípadov, v ktorých získali neoprávnený prístup k skutočným systémom tretích strán počas hodnotení kybernetickej bezpečnosti. Spoločnosť identifikovala tieto prípady pri kontrole približne 141 000 prepisov a neskôr rozšírila vyhľadávanie na 481 miliónov. Spolupracuje s nezávislou organizáciou pre hodnotenie umelej inteligencie METR na kontrole treťou stranou.
Spoločnosť Anthropic tiež uviedla, že jej interní monitori v auguste každý týždeň označili 100 000 prepisov agentov na kontrolu, pričom približne 50 bolo postúpených ľudským hodnotiteľom. Spoločnosť uviedla, že zriaďuje externých hodnotiteľov tretích strán, aby nezávisle testovali jej monitorovacie systémy.
















