Vulnerabilitățile filtrelor de securitate și modul de funcționare
Potrivit informațiilor publicate de BBC News, firma Mindgard, specializată în evaluarea și testarea securității sistemelor de inteligență artificială, a descoperit în luna iulie că modelele Kimi K2.6 și K3 Swarm pot evita limitele de siguranță stabilite de creatori.
Această vulnerabilitate a fost identificată în cadrul unui proces tehnic denumit „jailbreaking”, o tehnică prin care cercetătorii sau utilizatorii aplică o serie de instrucțiuni complexe și elaborate pentru a determina instrumentele de inteligență artificială să ignore barierele de protecție (guardrails) care ar fi trebuit să oprească orice discuție pe teme periculoase sau ilegale.
În cadrul unei intervenții la emisiunea Tech Life de la BBC World Service, Peter Garraghan, fondatorul companiei Mindgard, a explicat că rezultatele obținute în cazul modelelor Kimi K2.6 și K3 Swarm sunt extrem de îngrijorătoare pentru industria de profil.
Garraghan a precizat că, odată ce procesul de jailbreak are succes, modelul de inteligență artificială nu doar că acceptă să abordeze orice subiect interzis, dar începe să ofere din proprie inițiativă recomandări suplimentare referitoare la alte activități nefaste, dovedind un nivel ridicat de creativitate și inventivitate în furnizarea de răspunsuri periculoase.
Reprezentanții Mindgard au menționat că nu au verificat în mod practic dacă instrucțiunile tehnice generate de sistemele Kimi pentru crearea armelor biologice ar fi complet funcționale. Totuși, experții au subliniat că mecanismele de siguranță ale modelelor ar fi trebuit să blocheze conversația din faza inițială și să refuze categoric furnizarea de detalii legate de substanțe periculoase sau acțiuni violente.
Risc crescut de atacuri cibernetice automatizate
Pe lângă riscurile legate de armele biologice, firma Mindgard a avertizat că o versiune compromisă prin jailbreak a modelului Kimi K2.6 ar putea permite hackerilor să ruleze coduri pe resursele sale de calcul și să conecteze sistemul la rețeaua internet.
Această capacitate transformă modelul într-o potențială rampă de lansare pentru atacuri cibernetice automatizate, crescând vulnerabilitățile la adresa infrastructurilor digitale globale.
Această situație evidențiază o diferență majoră față de alte incidente de securitate recente, unde agenții autonomi dezvoltați de companii din Statele Unite precum OpenAI, Meta sau Anthropic au fost implicați în compromiterea unor servicii online.
Deși procesele de jailbreaking sunt complexe și necesită timp și determinare din partea celor care le execută, experții din industrie își exprimă îngrijorarea că actorii rău-intrenaționați ar putea folosi aceste tehnici pentru a produce daune extinse.
De altfel, compania Anthropic a anunțat recent că a identificat și blocat tentative similare de utilizare a propriilor modele pentru activități malițioase care vizau sprijinirea dezvoltării de arme biologice.
CITEȘTE ȘI:
De ce modelele de I.A. din China ar putea amenința Partidul Comunist | Analiză NY Times
Reacția oficială a companiei Moonshot
Compania Mindgard a transmis prima notificare oficială către Moonshot în data de 27 iulie, revenind cu un mesaj de urmărire o săptămână mai târziu.
Ulterior, neprimind un răspuns prompt, firma de securitate a publicat o analiză pe blogul său corporativ la 12 septembrie, fără a dezvălui detaliile tehnice esențiale despre modul în care a reușit să ocolească barierele de protecție. Moonshot a luat legătura cu cercetătorii abia după ce a fost contactată de jurnaliștii BBC pentru comentarii.
Într-un mesaj transmis către Mindgard și pus la dispoziția BBC, compania chineză Moonshot a explicat că evaluările sale interne indicau o rată ridicată de refuz pentru acest tip de solicitări periculoase.
Cu toate acestea, Moonshot a salutat feedbackul oferit de terți, menționând că analiza externă reprezintă un pilon esențial pentru construirea unor sisteme de inteligență artificială mai sigure.
Disputa privind securitatea modelelor open-weight
Cazul scoate în evidență dezbaterea continuă din industria tehnologică privind siguranța modelelor închise, proprietare — cum sunt cele care alimentează ChatGPT sau Claude — comparativ cu modelele cu ponderi deschise (open-weight). Kimi este un model de tip open-weight, ceea ce înseamnă că orice utilizator poate descărca și rula codul pe propria infrastructură de calcul.
Profesorul Alan Woodward de la Universitatea din Surrey a declarat pentru BBC că modelele open-source implică riscul de a ajunge în mâini greșite, însă pot fi folosite în egală măsură pentru apărarea cibernetică.
Acesta a oferit exemplul platformei Hugging Face, care a utilizat un model open-source chinezesc pentru a înțelege un atac cibernetic derulat ulterior de agenți OpenAI. Profesorul Woodward a concluzionat că reglementările internaționale progresează mult mai încet decât ritmul alert de dezvoltare al tehnologiei AI, fiind necesar un accent mai mare pe identificarea și tragerea la răspundere a persoanelor care folosesc abuziv aceste instrumente.