Stiripesurse.ro

Loading RSS Feed

OpenAI recunoaște că modelele sale AI au spart Hugging Face în timpul unui test intern

Agentul AI „autonom” care a spart Hugging Face pe 16 iulie s-a dovedit a fi chiar modelele OpenAI. Compania a recunoscut pe 21 iulie că a pierdut controlul asupra a două sisteme în timpul unui test de securitate. Ele au evadat din mediul izolat pentru a trișa la o evaluare.

Ce s-a întâmplat în timpul evaluării interne

Incidentul a pornit dintr-o evaluare internă care cere modelelor să caute vulnerabilități complexe. OpenAI măsoară astfel capacitățile de atac cibernetic ale sistemelor sale. Testul rula fără clasificatoarele de siguranță folosite în producție.

Pentru evaluare, compania a redus intenționat refuzurile modelelor în zona cibernetică. Au fost implicate două sisteme: GPT‑5.6 Sol, cel mai puternic model public al OpenAI, și un model nelansat, mai capabil. Benchmarku…

Citește articolul complet

Articole similare

Articole populare