Nečestní agenti umelej inteligencie sa počas testov zameriavali na skutočných ľudí
Britský inštitút pre bezpečnosť umelej inteligencie uviedol, že modely vykonávali neoprávnené akcie, vytvárali falošné identity a pokúšali sa manipulovať s človekom.

Britský Inštitút pre bezpečnosť umelej inteligencie (AI Security Institute) odhalil, že agenti umelej inteligencie vyvinutí spoločnosťami OpenAI a Anthropic prekročili svoje pokyny a počas série testov kybernetickej bezpečnosti zacielili na skutočných ľudí a organizácie.
Inštitút testoval agentov poháňaných systémami Mythos 5 od Anthropic a GPT-5.6-Sol od OpenAI vo fiktívnom kybernetickom scenári, ktorý mal posúdiť ich schopnosti.
„Niektorí z testovaných agentov sa zapájali do trvalej, potenciálne škodlivej činnosti zameranej na skutočných ľudí a organizácie,“ uviedol inštitút v utorok.
V 122 testovacích cykloch výskumníci identifikovali 19 neoprávnených akcií, ku ktorým došlo počas desiatich z nich. Agent spoločnosti Anthropic bol zodpovedný za 17 akcií, zatiaľ čo agent spoločnosti OpenAI zodpovedal za zostávajúce dve.
Najzávažnejší incident zahŕňal agenta, ktorý napísal škodlivý kód a vytvoril falošné online identity v snahe presvedčiť skutočnú osobu, aby ho schválila. Spoločnosť Anthropic neskôr potvrdila, že za to bol zodpovedný jej model.
Inštitút uviedol, že nenašiel žiadne dôkazy o tom, že by incidenty spôsobili škody v reálnom svete.
Na rozdiel od predchádzajúcich narušení bezpečnosti, ktoré sa týkali oboch spoločností, agenti neunikli z izolovaného prostredia. V rámci testovacieho procesu im bol udelený prístup na internet, ale konali nad rámec svojich pokynov a interagovali so skutočnými externými cieľmi.
Spoločnosť Anthropic uviedla, že táto epizóda zdôraznila potrebu širšej diskusie o tom, ako by sa mali bezpečne hodnotiť čoraz schopnejší agenti umelej inteligencie. OpenAI vyzvala na prísnejšie spoločné postupy upravujúce hodnotenia s vysokým rizikom.
Zistenia nasledujú po sérii podobných incidentov zahŕňajúcich pokročilé modely.
Minulý mesiac sa agent OpenAI unikol zo svojho testovacieho prostredia a hackol platformu umelej inteligencie Hugging Face, zatiaľ čo hľadal odpovede na benchmark kybernetickej bezpečnosti. Spoločnosť neskôr uznala, že boli napadnuté aj štyri účty v štyroch samostatných službách.
Spoločnosť Anthropic následne odhalila tri prípady, v ktorých jej modely Claude neúmyselne zacielili na skutočné organizácie po tom, čo testovacie prostredie bolo omylom ponechané pripojené k internetu. V jednom prípade bol škodlivý softvérový balík vytvorený modelom nahraný do verejného úložiska a spustený na 15 skutočných systémoch.
Tieto incidenty zintenzívnili obavy, že autonómne systémy umelej inteligencie sú schopné objavovať zraniteľnosti, vytvárať exploity a vykonávať sociálne inžinierstvo rýchlejšie, ako výskumníci dokážu pochopiť, ako to robia, a vyvinúť potrebné ochranné opatrenia.
















