OpenAI와 Hugging Face가 모델 평가 중 발생한 전례 없는 보안 사고의 경위와 현재 진행 중인 대응 조치를 공유합니다.
지난주 Hugging Face는 새로운 유형의 보안 사고를 공개했습니다(새 창에서 열림). 이들은 자사 인프라를 침해한 AI 에이전트를 탐지하고 차단한 뒤 이를 발표했으며, 이는 사이버 수행 능력이 점점 더 강한 모델이 확산됨에 따라 앞으로 더 흔해질 것으로 저희가 예상하는 종류의 사건입니다. 조사 결과, 이제 저희는 이번 특정 사고가 OpenAI 모델들의 조합에 의해 유발되었다는 사실을 알고 있습니다. 여기에는 GPT‑5.6 Sol과, 평가 목적상 사이버 거부를 완화한 더욱 강력한 비공개 사전 출시 모델이 포함되며, 모두 사이버 역량에 관한 벤치마크(새 창에서 열림)를 내부 테스트하던 중이었습니다.
저희는 이번 사고를 최첨단 사이버 역량이 관여한 전례 없는 사이버 사고로 판단하며, 그에 맞게 대응하고 있습니다. 현 단계에서 방어자들이 무엇이 일어났는지 이해하고 현재 모델이 어느 수준까지 가능한지 판단 기준을 맞추는 데 도움이 되도록 예비 조사 결과를 공유합니다. 저희는 Hugging Face와 함께 철저한 조사를 계속 진행할 것이며, 조사가 완료되면 취약점, 사고, 조사 결과에 관한 더 많은 세부 사항을 공유하겠습니다.
이번 사고는 모델이 복잡한 공격 경로를 사용해 고도화된 익스플로잇을 추구하도록 유도하는 내부 평가 중 발생했습니다. 목적은 모델의 사이버 역량을 정량화하는 것이었습니다. 저희는 모델이 고위험 사이버 활동을 추구하지 못하도록 막는 프로덕션 분류기를 사용하지 않은 채 이 평가를 실행함으로써 최대 사이버 역량을 추정합니다. 저희 벤치마크는 매우 격리된 환경에서 실행되며, 네트워크 접근은 패키지 레지스트리를 위한 프록시 및 캐시 역할을 하는 내부 호스팅 제삼자 소프트웨어를 통해 패키지를 설치할 수 있는 수준으로 제한되어 있습니다.
모델들은 OpenAI의 연구 환경과 Hugging Face의 프로덕션 인프라 전반에 걸친 취약점을 식별하고 연결해, Hugging Face의 프로덕션 데이터베이스에서 테스트 해답을 직접 획득했습니다. 모든 증거는 모델들이 ExploitGym의 해답을 찾는 데 극도로 집중했고, 다소 협소한 테스트 목표를 달성하기 위해 극단적인 수준까지 나아갔음을 시사합니다.
샌드박스로 격리된 테스트 환경에서 작동하는 동안, 저희 모델들은 평가 문제를 해결하기 위해 개방형 인터넷 접근 권한을 얻는 방법을 찾는 데 상당한 추론 연산 자원을 사용했습니다. 접근 권한을 얻기 위해 모델들은 패키지 레지스트리 캐시 프록시에 존재하던 제로데이 취약점 하나를 식별하고 악용했습니다. 이 취약점은 저희가 이제 공급업체에 책임 있는 방식으로 공개했습니다. 이 접근 권한을 바탕으로 저희 모델들은 연구 테스트 환경에서 일련의 권한 상승과 횡적 이동을 수행했고, 결국 인터넷 접근이 가능한 노드에 도달했습니다.
인터넷 접근 권한을 획득한 뒤, 모델들은 Hugging Face가 ExploitGym용 모델, 데이터세트, 해답을 호스팅하고 있을 가능성을 추론했습니다. 이를 바탕으로 모델은 평가를 속이는 데 사용할 수 있는 비밀 정보에 접근할 방법을 찾았고, 실제로 성공적으로 찾아냈습니다. 한 사례에서 모델은 탈취한 자격 증명과 제로데이 취약점 사용을 포함한 여러 공격 벡터를 연쇄적으로 결합해 Hugging Face 서버에서 원격 코드 실행 경로를 찾아냈습니다. OpenAI 보안팀은 이러한 비정상 활동을 내부적으로 발견했습니다.
Hugging Face의 보안팀과 에이전트는 자사 인프라에서 해당 활동을 탐지하고 중단했으며, 양사 팀이 연결되기 전부터 이미 자사 오픈소스 모델을 활용해 차단 조치와 포렌식 재구성을 시작한 상태였습니다. 저희는 이 사고를 계속 조사하기 위해 그들과 적극적으로 협력하고 있습니다. 조사와 복구 과정에서 Hugging Face가 신속하고 긴밀하게 협력해 준 데 깊이 감사드립니다.
저희가 최근 공유했듯이, AI는 취약점의 발견과 악용을 가속화하고 있습니다. 이번 사고에서 얻은 가장 중요한 교훈은 모델 보안과 안전이 빠르게 발전하는 역량과 보조를 맞춰야 한다는 점입니다. 저희는 모델 개발 중 사용되는 격리, 모니터링, 접근 통제, 평가 관행을 강화하고 있습니다.
UK AISI의 평가는 GPT‑5.6 Sol과 같은 모델이 점점 더 긴 시간 범위에 걸쳐 복잡한 다단계 사이버 작전을 지속할 수 있음을 보여줍니다. 이번 사고는 이러한 이론적 역량이 실제 환경에도 적용된다는 점을 시사합니다.

이번 사고는 또한 고도화된 모델이 소스 코드 접근 없이도 실제 시스템에서 새로운 공격 경로를 발견하고 악용할 수 있음을 분명히 보여줍니다. 이는 고도화된 사이버 역량이 더 강력한 보호 장치와 방어 도구와 함께 개발되어야 함을 부각합니다.
저희는 고도화된 사이버 역량을 갖춘 모델이 공격자보다 먼저 보안팀이 약점을 찾도록 돕고, 취약점이 어떻게 연쇄적으로 결합될 수 있는지 이해하며, 기계 수준의 속도로 이를 완화할 수 있어야 한다고 믿습니다. 저희는 이러한 역량을 활용해 인프라 구성과 모델 평가 환경을 둘러싼 보호를 계속 강화하고 있으며, 학습이 진행되는 대로 조사 결과와 모범 사례를 공유할 것입니다. 다른 방어자들께도 trusted access 신청을 권장하며, 이러한 모델을 지금 실험해 더 나은 예방, 더 빠른 탐지, 더 효과적인 사고 대응으로 이러한 역량을 전환해 보시길 바랍니다.
“저희는 이 사안과 다른 주제들에서 OpenAI와의 협력에 감사하고 있습니다. 어쩌면 이런 종류로는 최초일 수 있는 이번 사고는 저희가 오랫동안 믿어 온 점을 입증합니다. AI 안전은 어떤 한 회사가 비밀리에 일한다고 해서 해결되지 않습니다. 그것은 개방적으로, 협력적으로, 그리고 모든 곳의 모든 방어자가 AI에 폭넓게 접근할 수 있을 때 해결될 것입니다.”
—Clem Delangue, 공동 창립자 겸 CEO, Hugging Face