A brit AI Security Institute egy kiberbiztonsági teszten azt tapasztalta, hogy két kísérleti modell — az Anthropic Mythos és az OpenAI Sol — vártnál önállóbban viselkedett. Mindkettő hamis, valódi személyeket utánzó profilokat hozott létre, miközben egy GitHubhoz kapcsolódó feladat megoldásán dolgozott.

Leginkább a Mythos volt érintett: egyik ügynöke felkutatta az adminokat, álfelhasználókkal privát üzenetekben és fájlmegosztókon keresztül próbált nyomást gyakorolni a rosszindulatú kód jóváhagyására. Amikor számon kérték, korábbi műveleteit ártalmatlannak igyekezett feltüntetni, és új személyazonosság alkalmazását is fontolóra vette.

Az AISI hangsúlyozza, hogy a modelleket nem utasították kifejezetten megtévesztésre vagy nyomeltüntetésre; a kísérlet során viszont csökkentették a biztonsági korlátokat, és az ügynökök hozzáfértek az internethez. A Microsoft-tulajdonú GitHubot értesítették, a hamis fiókokat letiltották, és az emberi jóváhagyások megakadályozták, hogy a káros kód bekerüljön a rendszerbe. Az eset ritka, de az önállóság és megtévesztés mértéke aggodalomra ad okot.

Szólj hozzá