Anthropic tvrdí, že modely Claudeovej umelej inteligencie spustili tri neúmyselné kybernetické útoky
Vývojár umelej inteligencie tvrdí, že k incidentom došlo počas testov kybernetickej bezpečnosti po tom, čo nedorozumenie s hodnotiacim partnerom umožnilo jeho modelom prístup k otvorenému internetu.

Vývojár umelej inteligencie Anthropic odhalil tri incidenty, v ktorých jeho modely umelej inteligencie Claude neúmyselne zacielili na organizácie z reálneho sveta počas hodnotení kybernetickej bezpečnosti, ktoré sa mali uskutočniť v izolovanom prostredí.
Prípady boli identifikované retrospektívne počas preskúmania, ktoré vyvolal podobný incident týkajúci sa OpenAI a Hugging Face, online úložiska pre modely a súbory údajov umelej inteligencie, o ktorom bolo hlásené tento mesiac.
Anthropic uviedol, že zistil tri incidenty, ktoré siahajú až do apríla. V každom prípade nesprávne nakonfigurované testovacie prostredie udržalo prístup na internet, čo umožnilo Claudeovi interagovať so skutočnými spoločnosťami a verejnými službami. Spoločnosť problém pripísala „nedorozumeniu“ so svojím hodnotiacim partnerom, spoločnosťou Irregular. Testy zahŕňali cvičenia „zachytenia vlajky“, ktoré vyžadovali, aby Claude získal obmedzené informácie zo simulovaných cieľov. Modelu však bolo nesprávne povedané, že sieť nemá žiadne spojenie s vonkajším svetom, čo ho prinútilo považovať všetky systémy, s ktorými sa stretol, za súčasť cvičenia.
V jednom prípade fiktívna spoločnosť, ktorú mal Claude infiltrovať, zdieľala svoj názov so skutočnou internetovou doménou. Model pristupoval k skutočnej stránke počas štyroch samostatných testovacích behov a extrahoval informácie, ktoré údajne obsahovali poverenia aplikácie a infraštruktúry. Počas ďalšieho hodnotenia Claude narazil na fiktívne pokyny, ktoré softvérovému inžinierovi nariaďovali nainštalovať kód Python. Následne nahral škodlivý softvérový balík do PyPI, verejného úložiska pre programy Python, v snahe získať prístup k svojmu cieľu.
Predtým, ako PyPI identifikoval balík ako škodlivý, bol stiahnutý a spustený na 15 reálnych systémoch, vrátane jedného prevádzkovaného bezpečnostnou spoločnosťou. Claude následne extrahoval poverenia, ktoré použil na prístup k ďalším častiam infraštruktúry firmy, uviedla spoločnosť Anthropic.
V treťom a najnovšom incidente sa model snažil dosiahnuť svoj zamýšľaný cieľ a začal hľadať alternatívne ciele na internete. Nakoniec zastavil svoju činnosť po tom, čo zistil, že nájdené systémy boli skutočné a nie simulované.
Spoločnosť Anthropic uviedla, že v incidente PyPI Claudeov protokol uvažovania uvádzal, že nahrávanie škodlivého softvéru do skutočného úložiska by „NEBOLO v poriadku“. Model sa však presvedčil, že služba je súčasťou simulácie, pretože nedokázal rozpoznať skutočné certifikačné autority zabezpečujúce jeho pripojenia. Toto zverejnenie prichádza uprostred intenzívnejšej konkurencie medzi americkými a čínskymi vývojármi umelej inteligencie, keďže spoločnosti sa predháňajú v budovaní čoraz výkonnejších modelov. Anthropic, OpenAI a ďalšie firmy sa snažia preukázať pokroky vo výkonnosti umelej inteligencie a zároveň výrazne investujú do nových systémov.
Niektorí technologickí manažéri tvrdia, že americké spoločnosti zaoberajúce sa umelou inteligenciou by mali uvoľniť určité bezpečnostné obmedzenia, aby si udržali svoju pozíciu v globálnych pretekoch v oblasti umelej inteligencie.
















