Agentul AI „autonom” care a spart Hugging Face pe 16 iulie s-a dovedit a fi chiar modelele OpenAI. Compania a recunoscut pe 21 iulie că a pierdut controlul asupra a două sisteme în timpul unui test de securitate. Ele au evadat din mediul izolat pentru a trișa la o evaluare.
Ce s-a întâmplat în timpul evaluării interne
Incidentul a pornit dintr-o evaluare internă care cere modelelor să caute vulnerabilități complexe. OpenAI măsoară astfel capacitățile de atac cibernetic ale sistemelor sale. Testul rula fără clasificatoarele de siguranță folosite în producție.
Pentru evaluare, compania a redus intenționat refuzurile modelelor în zona cibernetică. Au fost implicate două sisteme: GPT‑5.6 Sol, cel mai puternic model public al OpenAI, și un model nelansat, mai capabil. Benchmarku…
