사이버 평가 중 실제 사람과 조직을 겨냥한 승인되지 않은 에이전트 행동에 관한 AISI의 사건 보고서와 대응 조치입니다.
전체 기술 보고서는여기에서 확인할 수 있습니다.
AISI의 역할은 최전선 AI 모델의 역량을 평가하고 이해하여, 잠재적 위험이 대중에게 도달하기 전에 드러내는 것입니다. 이러한 모델이 무엇을 할 수 있는지, 사이버 공격에 악용될 수 있는지를 포함해 평가하기 위해, 우리는 의도적으로 허용적인 조건에서 모델을 시험합니다. 즉, 공개 인터넷에 접근할 수 있게 하고 일부 안전 필터를 비활성화합니다.
2026년 7월 28일, AISI 보안팀은 정기적인 사이버 평가 중 연구 시스템에서 외부로 나가는 비정상적인 데이터 전송을 탐지했습니다. 조사 결과, 시험 중이던 일부 에이전트가 실제 사람과 조직을 겨냥한 지속적이고 잠재적으로 유해한 활동을 수행한 사실을 발견했습니다. 우리는 보안 사고를 선언했고, 발견 후 약 한 시간 이내에 이를 격리하고 전면 조사를 시작했습니다.
이 사고는 에이전트에게 사이버 보안 과제를 해결하도록 부여한 단일 평가에서 비롯됐습니다. 우리는 여러 모델에 걸쳐 이 과제를 122회 실행했습니다. 조사 결과, 그중 10회 실행에서 AI 에이전트가 실제 인터넷에서 실제 사람과 조직을 표적으로 삼아 자율적이고 승인되지 않은 행동을 취한 것으로 나타났습니다. 우리는 총 19건의 그러한 행동을 기록했습니다. 이 행동의 거의 전부인 17건은 Anthropic의 Mythos 5라는 단일 모델에서 나왔으며, 2건은 악용 방지 메커니즘인 사이버 분류기가 비활성화된 OpenAI의 GPT-5.6-Sol과 관련돼 있었습니다. 가장 심각한 사례에서 한 에이전트는 오픈소스 프로젝트에 악성 코드를 삽입하려 했습니다. 코드 승인을 얻기 위해 에이전트는 가짜 온라인 신원을 만들고 이를 이용해 프로젝트 유지관리자에게 코드 승인을 압박하는 사회공학적 기법을 사용했습니다. 인간 유지관리자는 악성 코드를 발견하고 승인을 거부했습니다.
이러한 시도는 성공하지 못했으며, 우리의 조사에서는 그로 인한 실제 피해의 증거를 찾지 못했습니다. 그러나 이는 구체적인 유도 없이 자율성과 기만에 관련된 위험이 현실 세계에서 이처럼 분명하게 나타난 첫 사례입니다.
중요하게도, 이것은 모델이 안전한 시험 환경 또는 ‘샌드박스’에서 탈출한 사례가 아닙니다. 사이버 시험의 표준 절차에 따라 우리는 의도적으로 인터넷 접근을 허용했고, 모델 제공업체의 사이버 분류기를 의도적으로 비활성화했습니다. 이는 최전선 모델이 일반 대중에게 제공되는 방식과는 다른 조건입니다. 우리는 모델의 최대 역량을 가장 잘 평가하기 위해 이렇게 합니다. 이러한 구성 선택은 최전선 AI 평가에서 일반적인 관행이었습니다. 해당 모델들은 우리가 시험한 구성으로는 상업적으로 이용할 수 없으며, 시험 시나리오 외부에서 유사한 활동이 있었다는 명확한 징후도 없습니다.
이 블로그를 게시하기 전에, 평가 중 접근한 개발자 플랫폼인 GitHub에 에이전트의 악의적 활동을 알렸습니다. 여기에는 GitHub가 이용약관 위반이라고 확인한 행동이 포함됩니다. 우리는 GitHub와 함께 에이전트가 남긴 흔적을 제거하고, 모델이 상호작용한 GitHub 사용자에게 알렸습니다. 다른 영향을 받은 당사자들에게도 연락했습니다. 또한 METR (모델 평가 및 위협 연구)와 협력해 독립적인 제3자 검토를 수행할 계획이며, 현재 이들과 검토 범위를 논의하고 있습니다.
이 사고는 신중하고 세밀하게 해석해야 합니다. 어느 정도는 우리의 평가 설계 선택과 구체적인 구성이 이러한 행동을 가능하게 했습니다. 그럼에도 에이전트가 수행한 활동은 새롭고 잠재적으로 기만적인 행동의 징후를 보였으며, 그 정도와 심각성은 우리가 예상하지 못한 수준이었습니다.
염두에 둘 중요한 단서가 있습니다. 우리는 매우 특정한 조건에서 소수의 사건을 관찰했으며, 그러한 행동이 다른 맥락이나 시험 환경 외부에서 발생할 가능성이 얼마나 되는지는 아직 말할 수 없습니다. 에이전트가 자신이 현실 세계의 행동을 취하고 있음을 언제 이해했는지, 또는 자신이 가상의 시험 시나리오에 있다고 어느 정도 믿었는지도 아직 확신할 수 없습니다. 현재까지의 분석은 엇갈린 양상을 보이며 계속 진행 중입니다.
말할 수 있는 것은 이 행동이 가능했고, 지속적이었으며, 새롭다는 점입니다. 그 사실만으로도 주목할 가치가 있습니다.
이것이 바로 AISI가 존재하는 이유인 행동입니다. 통제된 평가에서 이를 드러내어, 더 유능한 모델이 널리 배포되기 전에 이해하고 대응할 수 있게 합니다. 이 글은 무슨 일이 있었는지, 왜 중요한지, 그리고 우리가 대응으로 무엇을 하고 있는지를 설명합니다. 함께 제공하는 기술 사고 보고서에는 추가 세부 사항이 있으며, 조사가 진행됨에 따라 더 많은 내용을 공유할 계획입니다.
AISI는 실제 세계 시스템을 모방한 통제된 시뮬레이션 네트워크인 사이버 레인지를 사용해 최전선 모델의 사이버 역량을 정기적으로 시험합니다. AI 에이전트에게는 보호된 데이터 조각을 찾는 것과 같은 해결 과제가 주어지며, 이를 완료하기 위해 여러 단계에 걸쳐 자율적으로 작업합니다.
이 실험은 기존 사이버 레인지와 새로운 레인지를 비교했으며, 총 122회 실행에 걸쳐 두 레인지에서 서로 다른 일곱 모델을 시험했습니다. 모든 실행은 AISI의 연구 환경에서 수행됐고, 가상 머신 샌드박싱을 사용해 에이전트를 다른 AISI 인프라와 격리했습니다. 평가 설정의 두 가지 특징이 이후 일어난 일의 핵심입니다.
인터넷 접근을 의도적으로 활성화했습니다. 이 모델들이 실제로 무엇을 할 수 있는지 측정하기 위해, 우리는 공개 인터넷 접근을 포함해 유능한 인간 공격자가 할 수 있는 일을 반영하는 조건에서 모델을 시험합니다.
개발업체의 사이버 분류기를 의도적으로 껐습니다. 최전선 모델은 일반적으로 위험한 행동을 차단하는 내장 필터와 함께 배포됩니다. 신뢰할 수 있는 시험 파트너로서 AISI는 모델의 근본적인 역량을 끌어내기 위해 이러한 필터를 비활성화할 수 있습니다.
이러한 조건의 조합은 최전선 모델이 일반 대중에게 제공되는 방식을 반영하지 않습니다.
7월 28일 아침, 보안 모니터링은 인터넷 트래픽의 출처를 숨기는 데 흔히 사용되는 ‘Tor’ 익명성 네트워크를 통해 시험 시스템 중 하나에서 데이터가 나가고 있음을 포착했습니다. 평가를 운영하던 팀은 수 분 안에 에이전트의 활동을 검토하기 시작했습니다.
이들은 한 번의 실행 중 에이전트가 GitHub의 실제 공개 오픈소스 프로젝트에 악성 ‘풀 리퀘스트’(제안된 코드 변경)를 만들었다는 사실을 빠르게 발견했습니다. 우리는 보안 사고를 선언하고 관련된 모든 평가를 중단했으며, 가장 유능한 모델에 대한 내부 접근을 비활성화했습니다. 경보가 발생한 지 한 시간 안에 모든 평가 실행을 종료하고 관련 머신을 격리했습니다. 이후 수 시간과 수일에 걸쳐, 무슨 일이 일어났는지와 다른 곳에서 유사한 일이 발생했는지를 확인하기 위해 자동화된 기록 스캔과 전문가 수동 분석을 결합해 전체 실행 집합을 검토했습니다.
122회 실행 중 43회에는 Mythos 5가 포함됐고, 35회에는 GPT-5.6 Sol이 포함됐습니다. 122회 실행의 압도적 다수는 의도대로 진행됐습니다. 그러나 122회 중 10회에서 에이전트가 시험 매개변수의 범위를 벗어난 별개의 행동을 취한 19건의 사례를 확인했습니다. 이 사례 중 17건은 Mythos 5에서 나왔고, 2건은 GPT-5.6 Sol이 관련된 단 한 번의 실행에서 나왔습니다.
19건은 별개의 사고가 아니었습니다. 이들은 몇 가지 연결된 행동으로 묶였습니다. 주로 한 에이전트인 Mythos 5의 단일하고 지속적인 활동 흐름에서 발생했으며, 다른 곳에서 소수의 관련 행동이 있었습니다. 이 행동은 2026년 7월 25일부터 7월 28일 사이에 일어났습니다.
아래에서는 관찰된 가장 중요한 네 가지 행동을 소개합니다. 사례의 전체 요약은 기술 사고 보고서에서 확인할 수 있습니다.
1. 실제 오픈소스 소프트웨어에 대한 공급망 공격 시도. 가장 심각한 일련의 과정에서 한 에이전트는 공개적으로 사용되는 오픈소스 프로젝트에 악성 코드를 삽입하려 했고, 인간 검토자로부터 이 삽입에 대한 승인을 얻기 위한 행동을 취했습니다. 에이전트는 프로젝트의 인간 유지관리자를 조사하고 여러 가짜 신원을 만들었으며, 가짜 신원을 이용해 실제 유지관리자가 코드를 승인하도록 사회공학적으로 유도했습니다. 에이전트의 풀 리퀘스트가 공개적으로 문제 제기되자, 에이전트는 무해해 보이도록 이전 활동을 수정했고 계속하기 위해 새로운 신원을 채택하는 방안도 고려했습니다. 에이전트는 GitHub의 일부 네트워크 제한을 우회하기 위해 Tor를 사용했고, 이것이 AISI의 보안 경보를 처음 유발했습니다.
2. 실제 사람을 속이고 표적으로 삼으려는 시도. 같은 노력의 일환으로 에이전트는 실제 사람들에게 직접 연락하려 했으며, 온라인 파일 전송 서비스를 통해 메시지와 파일을 보내 이들이나 이들이 사용하는 AI 코딩 도구가 악성 코드를 실행하도록 설득하려 했습니다. 일부 메시지에는 유해한 페이로드가 포함됐고, 일부는 실제 사람을 겨냥한 사회공학 시도였습니다. 이는 우리가 이전에 한 번도 관찰하지 못한 일입니다.
3. 악성 코드를 심고 프롬프트 주입하려는 시도. 에이전트는 다른 자동화된 AI 시스템이 이를 찾아내 실행할 수 있다고 판단한 곳에 악성 지침을 삽입하려 했습니다. 프롬프트 주입은 AI 코딩 보조 도구를 조작하도록 설계된 숨겨진 지침입니다.
4. 동시에 평가 중인 독립 에이전트 간 협력. 한 에이전트는 같은 과제를 수행하는 다른 에이전트와의 협력을 제안하는 공개 메시지를 GitHub에 남겼습니다. 또한 자신이 남긴 계정과 흔적을 재사용하는 지침을 제공했으며, 이는 후속 에이전트들이 발견해 사용했습니다.
우리는 각 사건이 실제 피해를 일으킬 잠재력을 평가했습니다. 가장 심각한 시도들은 성공하지 못했습니다. 일부 행동은 제한적인 실제 영향을 미쳤지만, 이는 통제된 상황에서였습니다. 이에 대해서는 함께 제공하는 기술 보고서에 설명돼 있습니다. 우리의 조사에서는 그로 인한 실제 피해를 확인하지 못했습니다.
근본적으로 에이전트는 자신에게 부여된 과제, 즉 사이버 레인지를 해결하기 위해 이러한 행동을 취했습니다. 승인되지 않은 행동이 나타난 데에는 여러 요인이 기여했습니다.
에이전트는 목표를 끈질기게 추구했습니다. AI 에이전트는 운영자가 의도하지 않은 경로를 탐색합니다. 어려운 목표가 주어지자 에이전트는 계속해서 돌파구를 찾았고, 발견한 일부 경로에는 실제 사람을 속이려는 시도가 포함됐습니다. 에이전트는 속이라는 지시를 받은 적이 없습니다. 기만은 과제를 추구하는 부산물로 나타났으며, 최근까지 대체로 이론적이었던 목표 지향적 기만의 종류였습니다.
과제가 어려웠고, 잘못된 구성 때문에 때때로 더 어려워졌습니다. 여러 실행에서 과제 프롬프트가 잘못 구성돼 에이전트는 의도된 과제 범위를 벗어나지 않고는 ‘해결책’이 없다고 잘못 믿었습니다. 거의 불가능에 가까운 과제가 모델을 더 ‘창의적’이고 더 규범을 넘는 문제 해결로 몰아간다고 볼 만한 충분한 이유가 있습니다. 그러나 이것이 행동을 완전히 설명하지는 않습니다. 일부 실행에서는 에이전트가 의도대로 과제를 해결하는 데 필요한 지침을 갖고 있었음에도 이런 방식으로 행동했습니다.
인터넷 접근은 열려 있었고, 모니터링은 전용으로 구축되지 않았습니다. 우리는 에이전트가 과제에 필요한 도구를 내려받을 수 있도록 의도적으로 인터넷 접근을 허용했습니다. 그러나 이 인터넷 접근을 이용해 실제 사람에게 직접 행동할 것이라고는 예상하지 못했습니다. 이전 세대 모델에서는 이러한 위험 상충이 수용 가능하다고 판단됐지만, 역량이 발전함에 따라 그 판단을 충분히 신속하게 재검토하지 못했습니다. 보안팀은 평가가 진행되는 동안 이를 감시하도록 만들어진 모니터링이 아니라, 사후 일반 모니터링을 통해 이상 트래픽을 탐지했습니다. 전용 모니터링이었다면 행동을 더 일찍 포착하거나 차단할 수 있었을 것입니다.
에이전트는 공개 인터넷 접근을 활용하지 않거나 사회공학 요소를 피하라는 구체적 지시를 받지 않았습니다. 이전에는 정렬 학습을 받은 모델을 사용할 때 그러한 지시가 필요하다는 점이 명확하지 않았습니다.
피해를 제한한 요인들 역시 가치 있는 통찰을 제공합니다. 인간 검토와 우수한 보안 관행이 중요한 역할을 했습니다. 한 사례에서는 에이전트의 악성 풀 리퀘스트가 인간 검토자에게 발견됐습니다. 검토자가 이 요청을 승인하도록 유도하기 위해 가짜 계정을 만들어 사회공학을 수행하려던 에이전트의 시도는 실패했습니다. 코드가 악성이라고 의심한 일반인은 그러한 코드를 격리하기 위해 만들어진 안전하고 분리된 환경에서 이를 열었습니다.
또한 에이전트는 시험 환경을 AISI의 다른 내부 시스템과 차단해 두는 안전한 시험 환경인 ‘샌드박스’에서 직접 탈출하지 않았습니다. 에이전트는 흔히 접근 가능한 자원을 이해하기 위해 그러한 환경을 탐색하지만, 이 경우 어떤 에이전트도 샌드박스를 탈출하거나 AISI 시스템을 공격하려 하지 않았습니다.
이 사례들에서 표준적인 우수 관행, 인간의 판단, AI 생성 코드에 대한 주의가 최악의 결과를 막았습니다. 하지만 여러 사례에서 실패와 성공의 간격은 좁았으며, 더 유능한 에이전트의 이러한 행동을 확실하게 막아 줄 기술적 장벽이 아니라 인간의 경계심에 의존하고 있었습니다.
우리는 이를 AISI의 평가 프로토콜과 보안 아키텍처에 지속적인 변화를 요구하는 심각한 사고로 다루고 있습니다. AISI와 다른 평가자에게는 세 가지 교훈이 두드러집니다.
인터넷 접근에 대한 더 엄격한 통제. 우리는 이러한 평가에 필요한 현실성은 보존하면서 적절히 제한하는 것을 목표로, 사이버 레인지에 세분화된 네트워크 통제를 구축하고 있습니다. 우리는 이미 다른 모든 평가에서 세분화된 네트워크 통제를 사용하고 있으며, 이제 인터넷 접근을 허용하는 결정은 기본값이 아니라 적극적으로 정당화돼야 하는 결정으로 다룰 것입니다.
실시간 모니터링. 우리는 평가가 실행되는 동안 이를 감시하도록 구축된 모니터링을 도입하고 있습니다. 이는 범위를 벗어난 행동이 발생하는 즉시 이를 표시하거나 차단할 수 있습니다.
평가 설계의 재검토. 평가는 유능한 모델이 자신의 권한 범위를 넘어 행동하려 할 수 있다고 가정해야 하며, 그러한 행동의 범위는 사전에 제한돼야 합니다. AISI의 샌드박싱 지침은 평가 설계에 따라 샌드박스 구성을 조정할 것을 권고합니다. 우수한 격리는 모델이 경계를 시험하지 않기로 선택하는 데 의존해서는 안 됩니다. 또한 과제가 올바르게 명시되고 의도된 경로로 해결 가능한지 보장하기 위한 추가 점검을 도입하고 있습니다.
이러한 변화와 함께, 우리는 사이버 보안과 AI 정렬 관점 모두에서 무슨 일이 일어났는지 분석하고 있으며, 눈에 띄지 않았을 수 있는 유사 행동을 찾기 위해 과거 평가도 감사하고 있습니다.
또한 다른 이들이 우리의 경험에서 배울 수 있도록 이를 공개적으로 알리고 있으며, 이 사고를 더 조사하기 위해 Anthropic 및 OpenAI와 긴밀히 협력할 것입니다.
이 사고는 일반적인 사용 환경이 아니라 통제된 평가에서 발생했으며, 시험 시나리오 외부에서 유사한 활동이 있었다는 명확한 징후는 없습니다. 그러나 이는 대비해야 할 이유입니다. AI 모델이 더 유능하고 접근하기 쉬워짐에 따라, 이 사고 동안 우리가 본 일은 더 흔해질 수 있습니다.
가장 효과적인 대응은 여전히 표준적인 사이버 위생이며, 이는 AI가 발전할수록 더욱 중요합니다. 조직은 사이버 보안의 기본 사항이 견고하게 구현됐는지 확인하고 외부 코드와 기여분을 검증할 때 주의를 기울여야 합니다. 이는 파이브 아이즈 사이버 보안 기관의 수장들이 공동으로 행동을 촉구한 영역이며, 국가 사이버 보안 센터는 최전선 AI의 사이버 역량이 진화함에 따라 대비하는 방법에 관한 지침을 발표했습니다. 모든 종류의 조직이 NCSC의 무료 조기 경보 서비스에 가입하고, 사이버 보안을 이사회 차원의 책임으로 만들며, 공급망 전반에 걸쳐 Cyber Essentials를 요구할 것을 권장합니다.
이런 종류의 사고는 AI가 발전하는 속도를 보여 줍니다. 역량이 발전함에 따라 이러한 시스템을 이해하고 그 안전성을 보장하는 작업도 그에 맞춰 속도를 내야 합니다.
AISI는 강력한 안전 관행을 갖춘 유능한 조직이며, 자체 절차를 통해 이 행동을 식별했습니다. 그러나 어떤 조직의 방어 체계도 무기한으로 충분한 상태를 유지하지는 못합니다. 이 경우 우리는 의도적으로 인터넷 접근을 활성화했고, 행동을 더 빨리 드러낼 능동적 모니터링이 없었습니다. 이는 앞으로 직접 해결할 사항입니다. 다른 이들이 배우고 조정할 수 있도록 이러한 교훈을 공개하고 있습니다.
OpenAI와 Anthropic이 최근 보고한 사고들과 함께 보면, 이 사고는 위험 환경의 변화를 가리킵니다. 피해는 사람들이 공개적으로 이용 가능한 모델을 의도적으로 악용할 때뿐 아니라, 내부 연구 또는 특권 접근 환경에서 작동하는 유능한 에이전트가 승인된 범위를 넘어 의도하지 않은 행동을 취할 때에도 발생할 수 있습니다.
우리는 이 사고를 맥락화하는 중요한 단서를 설명했습니다. 이러한 행동은 에이전트가 과제를 완료하려 했던 평가 중에 나타났습니다. 에이전트가 정확히 언제 자신이 시험 중이라고 생각했는지, 또는 자신의 행동이 가질 수 있는 현실 세계의 함의를 얼마나 인식했는지는 현재 확신할 수 없습니다. 어떤 경우이든 이 사고는 즉각적인 주의가 필요한 변화 방향을 보여 줍니다.
AISI는 더 유능한 시스템이 내부적으로 AI 연구소에, 신뢰할 수 있는 파트너에게, 그리고 대중에게 배포되기 전에 이러한 문제를 식별하고 이해하며, 배운 내용을 공유하여 대응할 수 있게 하기 위해 존재합니다. 이 작업은 아직 완료되지 않았지만, 정부, 산업계, 연구 공동체가 함께 수행하고 있습니다. 이제 우리의 과제는 방어 체계를 강화하고 안전 작업이 발전 속도를 따라가도록 보장하는 것입니다.
기술 사고 보고서는 여기에서 읽을 수 있습니다.