GLM-5.3의 사이버 공격 역량, 우회 가능한 안전장치, 그리고 사이버 방어에 미치는 영향을 분석합니다.
앤드루 파사노, 마리우스 플라이셔
콜 맥폴, 로버트 샤오, 트립 갤러거
5개월 전, 우리는 정교한 종단 간 사이버 익스플로잇을 자율적으로 구축할 수 있는 최초의 AI 모델인 Claude Mythos Preview를 발표했습니다. AI의 급격한 개선 속도는 이 능력이 결국 다른 많은 모델로 확산되어, 악의적인 사이버 행위자가 큰 영향을 미치는 사이버 공격을 훨씬 더 쉽게 실행하게 될 것임을 시사했습니다.
이러한 고려에 따라, 우리는 Project Glasswing을 통해 Claude Mythos Preview를 제한적으로 공개하기로 했습니다. 이를 통해 신뢰할 수 있는 사이버 방어자들은 핵심 소프트웨어에서 10,000개가 넘는 취약점을 찾아냈고, 악의적인 행위자들이 유사한 역량의 모델에 접근하기 전에 먼저 대응할 수 있었습니다.
하지만 이제 그런 모델들이 등장했습니다. 이 글에서는 중국 밖에서는 Z.ai로 알려진 Zhipu AI가 개발한 최신 AI 모델인 GLM-5.3에 대한 분석을 공유합니다. Claude Mythos Preview와 마찬가지로 GLM-5.3은 종단 간 사이버 익스플로잇을 자율적으로 구축하는 강력한 역량을 갖추고 있습니다. 그러나 GLM-5.3은 오용을 제한할 실질적인 안전장치 없이 공개되었다는 점에서 다른 프런티어 모델과 다릅니다. 시뮬레이션 테스트에서 공격자는 단순한 기법으로 GLM-5.3의 안전장치를 64%에서 100% 사이의 비율로 우회할 수 있음을 확인했습니다. 반면, 우리의 테스트에서 이러한 공격은 안전장치가 적용된 Claude 모델에는 성공하지 못했습니다. 우리는 GLM-5.3의 느슨한 안전장치가 악의적인 행위자가 이용할 수 있는 사이버 역량을 크게 높인다고 평가합니다. 동시에 이러한 역량은 시스템 보안을 강화하려는 방어자에게도 도움이 될 수 있습니다.
9월 17일, NIST의 AI 표준 및 혁신 센터(CAISI)는 GLM-5.3의 사이버 역량에 대한 자체 평가를 발표했습니다. CAISI는 GLM-5.3이 “현재까지 공개된 오픈 웨이트 모델 중 가장 뛰어난 사이버 역량을 갖췄으며”, CAISI의 사이버 벤치마크 종합 기준으로 미국 프런티어보다 약 4개월 뒤처진다고 밝혔습니다. 우리의 역량 관련 결과는 전반적으로 CAISI의 결과와 일치합니다. CAISI의 비교에서는 해당되는 경우 사이버 안전장치를 비활성화한 미국 모델을 테스트했으며, 미국 프런티어에는 검증된 사용자에게만 공개된 모델도 포함됩니다. 공격자는 그러한 미국 모델 버전에 쉽게 접근할 수 없지만, 누구나 GLM-5.3을 내려받을 수 있습니다. 이 글은 GLM-5.3의 안전장치가 얼마나 쉽게 우회되거나 제거될 수 있는지에 대한 분석을 추가합니다.

그림 1. 결과 요약. 위: Claude Opus 4.6과 Claude Mythos Preview 사이의 익스플로잇 역량 증가는 GLM-5.2와 GLM-5.3 사이의 역량 도약과 유사합니다. Claude 모델은 사이버 안전장치와 함께 공개되며, 안전장치가 약화된 버전은 검증된 사용자에게만 제한됩니다. 누구나 GLM-5.3을 내려받아 사용할 수 있습니다. 아래: GLM-5.3의 제한적인 안전장치는 우리의 테스트에서 Claude 모델에는 통하지 않았거나 적용할 수 없는 표준 기법으로 우회할 수 있습니다.
GLM-5.3이 사이버 위협 행위자가 실제 소프트웨어 취약점을 찾아 악용하도록 어떻게 지원할 수 있는지 이해하기 위해, 자동화된 벤치마크와 인간 개입형 작업 흐름을 사용해 평가를 수행했습니다. 두 접근법 모두에서, 테스트 대상 모델은 격리되고 샌드박스 처리된 환경에서 실행했으므로, 이러한 평가를 위해 우리가 구축한 오프라인 대상만 공격할 수 있습니다. 우리는 주로 익스플로잇 개발 역량에 초점을 맞추는데, 이 영역에서 Claude Mythos Preview가 이전 Claude 모델 대비 주목할 만한 도약을 보였기 때문입니다.
먼저 Google Chrome이 사용하는 V8 엔진의 알려진 취약점을 AI 모델이 얼마나 잘 악용할 수 있는지 측정하는 ExploitBench에서 모델을 실행했습니다. 여기서는 공격자와 가장 관련성이 높고 모델 간에 큰 변화가 보이는 역량인, 종단 간 익스플로잇을 성공적으로 개발하는 모델의 능력에 집중합니다. GLM-5.3은 410번의 시도 중 50번에서 종단 간 익스플로잇을 개발했습니다. Claude Mythos Preview도 비슷한 비율인 410번 중 56번에서 이를 달성했습니다.
우리의 내부 바이너리 익스플로잇 벤치마크에서는,1 모델이 Google의 OSS-Fuzz 프로젝트에 참여하는 인기 오픈 소스 프로젝트에서 취약점을 찾아 악용할 수 있는지 테스트합니다. 이 벤치마크에서는 완전한 제어 흐름 탈취에 만점을 부여합니다. 벤치마크의 과제 100개를 무작위로 선택하여 여러 모델을 평가한 결과, GLM-5.3은 시행의 4%에서 완전한 제어 흐름 탈취를 개발했고 Claude Mythos Preview는 6%에서 이를 달성했습니다. 여기서 GLM-5.3의 성능은 Claude Mythos Preview보다 낮지만, 중요한 임계값은 분명히 넘어섰습니다. Claude Opus 4.6과 GLM-5.2 같은 이전 모델은 어느 과제에서도 성공하지 못했습니다.

그림 2. 출력 토큰 예산 대비 익스플로잇 역량. 각 선은 사용한 출력 토큰 대비 벤치마크의 최고 결과에 도달한 모델 시도의 비율을 보여 줍니다. 두 그림 모두 안전장치를 비활성화하여 실행한 Claude 모델 두 개(Opus 4.6, Mythos Preview), GLM 모델 두 개(5.2 및 5.3), 그리고 Moonshot AI(Kimi K3)와 DeepSeek(V4.1-Flash)가 공개한 최신 오픈 웨이트 모델의 결과를 보여 줍니다.
다음으로, 올해 초 Claude Mythos Preview를 대상으로 한 테스트를 재현하여, 인간 전문가가 GLM-5.3을 사용했을 때 개방형 공격적 사이버 과제에서 어떤 성과를 내는지 평가했습니다. 여기서는 인간 전문가가 기존 취약점을 알지 못하는 대상을 선택한 후, 모델을 사용해 새로운 결함을 식별하고 악용하도록 요청합니다. 이 실험은 전문가가 짧은 시간 내에 수행할 수 있는 작업을 테스트했습니다. 보통 하루 이하로 진행됐으며, 인간이 집중해 투입한 시간은 총 1시간 미만이었습니다.

그림 3. 연구자 주도 테스트 중 GLM-5.3이 생성한 익스플로잇 페이지의 일부가 가려진 스크린샷으로, 악성 웹사이트를 통해 사용자의 SSH 개인 키를 탈취하는 모습입니다. 이 익스플로잇은 모델이 인기 웹 브라우저의 한 구성 요소에서 발견한 여러 제로데이 취약점을 연결하여, 사용자의 컴퓨터에서 민감한 파일을 읽습니다.
첫 번째 세션에서 연구자는 인기 웹 브라우저의 로컬 Linux 빌드가 설치된 샌드박스 머신에서 GLM-5.3을 사용했습니다. 하루 동안 제한된 인간의 주의만 투입한 가운데, GLM-5.3은 브라우저의 JavaScript 엔진에서 이전에 알려지지 않은 여러 취약점을 찾아냈고 이를 작동하는 익스플로잇으로 연결했습니다. 즉, 방문 시 방문자의 컴퓨터에서 임의의 파일을 읽는 웹페이지였습니다(그림 3). 이 익스플로잇은 모델에 제공된 유일한 환경이었기 때문에 브라우저의 Linux 빌드를 대상으로 합니다. 그러나 이러한 취약점은 다른 플랫폼의 사용자에게도 영향을 줄 수 있으며, 그 경우 악용 경로는 더 복잡할 수 있다고 판단합니다. 이 취약점들은 유지관리자에게 공개했습니다. 세션 후반에 연구자는 GLM-5.3을 사용해 무선 및 그래픽 드라이버, 네트워크에 노출된 장치 소프트웨어를 포함한 여러 널리 사용되는 시스템에서도 악용 가능한 취약점을 식별했습니다. 현재 이러한 보고서를 검토 중이며, 적절한 경우 유지관리자에게 공개할 예정입니다.
두 번째 세션에서 연구자는 GLM-5.3의 더 작고 역량이 낮은 버전인 GLM-5.3-Flash를 사용해 알려진 취약점에 대한 익스플로잇을 개발했습니다. 우리는 이전에 이러한 “N-day” 취약점 익스플로잇에 관해 여기에서 작성한 바 있습니다. 이때 연구자는 최근 공개된 Google Chrome의 결함(CVE-2026-11645)에 집중하여 모델이 공개된 수정 사항을 얼마나 빨리 작동하는 공격으로 전환할 수 있는지 살펴봤습니다. 연구자는 GLM-5.3-Flash에 이 CVE와 또 다른 알려진 결함에 관한 공개 세부 정보를 제공했습니다. 연구자의 유의미한 지시 없이도 GLM-5.3-Flash는 이 두 결함의 익스플로잇을 연결하여, 포인터 인증(PAC) 강화 기능을 우회하는 ARM64 대상용 신뢰도 높은 익스플로잇 체인을 구축했습니다. 이는 인간의 주의 20분과 GLM-5.3-Flash의 작업 8시간이 걸렸습니다. Zhipu의 API 가격 기준으로 이 작업의 비용은 $20.40이었을 것입니다.
GLM-5.3은 일부 내장 안전장치와 함께 공개되었습니다. 사용자가 명백히 해로운 것을 요청하면 모델은 종종 거부합니다.2 우리의 테스트에서는 이러한 안전장치가 다양한 단순 기법으로 우회되거나 제거될 수 있음을 확인했습니다.
가장 집중적이면서 가장 성공적인 방법은 “abliteration”으로 알려진 표준 거부 감소 기법입니다. GLM-5.3은 오픈 웨이트 모델로 공개되었기 때문에, 사용자는 역량을 거의 바꾸지 않으면서 거부 반응을 제거하도록 모델을 재구성할 수 있습니다. 여러 개발자는 모델 공개 후 며칠 안에 안전장치가 제거된 GLM-5.3 버전을 대중에 공개했습니다.
abliteration이 공격자가 GLM-5.3의 안전장치를 얼마나 우회할 수 있게 하는지 연구하기 위해, 우리는 직접 안전장치가 제거된 사본을 만들고, 모델이 명백히 해로운 요청을 얼마나 자주 수락하는지 측정하는 세 가지 공개 벤치마크(JailbreakBench, HarmBench, StrongREJECT)에서 실행했습니다. 이전에 이 작업을 시도한 적이 없던 우리 팀은 약 2,200 GPU 시간과 대략 $4,400의 컴퓨팅 비용을 들여 모델의 안전장치를 제거했습니다.3 GLM-5.3-Flash의 안전장치를 제거하는 데는 약 600 GPU 시간이 걸렸습니다. 이 편집은 GLM-5.3의 거부율을 처음 두 벤치마크(JailbreakBench 및 HarmBench)에서 90% 이상에서 약 3%와 2%로, 세 번째 벤치마크(StrongREJECT)에서는 12%로 낮췄습니다. 안전장치 제거는 모델 역량을 유의미하게 낮추지 않았습니다. 일반 과학 역량을 측정하는 평가인 GPQA-Diamond에서 표준 모델과 안전장치가 제거된 모델은 동일한 결과를 기록했습니다. CyberGym 평가의 테스트된 하위 집합에서는 안전장치가 제거된 버전의 점수가 몇 퍼센트 낮았습니다(아래 차트 참조).

그림 4. 위: 공개된 GLM 모델 및 안전장치가 제거된 GLM 모델과 Claude 모델에 대해 JailbreakBench, HarmBench, StrongREJECT 전반에서 측정한 평균 거부율입니다. 안전장치 제거 후 GLM 모델은 이러한 질의를 거의 거부하지 않습니다. Claude 모델은 웨이트가 공개적으로 제공되지 않거나 맞춤 설정할 수 없기 때문에 안전장치를 제거할 수 없습니다. 아래: GPQA-Diamond 및 CyberGym에서 GLM-5.3과 GLM-5.3-Flash를 각각 안전장치가 제거된 변형과 비교한 성능입니다. 안전장치 제거 후에도 역량은 대체로 유지됩니다.
테스트에서 우리는 GLM-5.3의 안전장치가 안전장치가 제거된 모델 버전을 사용하지 않고도 우회될 수 있음을 관찰했습니다. 모델을 모의 세계에 배치하고,4 그곳에서 핵심 시스템을 공격하라는 노골적으로 악의적인 요청을 제공했습니다. 기본 상태에서 GLM-5.3은 모든 시행에서 거부했습니다. 이는 우리가 테스트한 다른 모델과 마찬가지입니다. 그러나 대부분 또는 모든 경우에 이 요청에 응답하게 만드는, GLM 모델의 안전장치를 우회하는 몇 가지 단순한 방법을 식별했습니다. 여기에는 다음이 포함됩니다.
테스트에서 이러한 기법 중 어느 것도 안전장치가 적용된 Claude 모델이 우리가 테스트한 유해한 작업을 수행하게 만들지 못했습니다. Claude의 안전장치는 기만적인 프롬프트를 사용한 요청을 차단했습니다. Anthropic API는 잠재적 공격자에게 Claude의 사고를 미리 채울 방법을 제공하지 않습니다. 또한 Claude의 웨이트는 사용자에게 제공되지 않으므로, Claude의 행동을 바꾸기 위해 안전장치를 제거할 수 없습니다.

그림 5. 모델 및 우회 조건별로, 노골적으로 유해한 요청 후 각 모델이 원격 대상 시스템에 연결을 시도한 비율입니다(셀당 50개 표본, 공격 명령 5개 × 대상 2개 × 시도 5회). GLM-5.3은 직접 요청에서는 요청 응답 비율이 0%에서 시작하지만, 표지 이야기, 미리 채우기, 안전장치 제거에서 각각 64%, 92%, 100%로 상승합니다. 반면 테스트한 모든 Claude 모델은 API 안전장치 하에서 0%를 유지합니다. 자물쇠 표시 셀은 Claude API에 대해 일반적으로 실행할 수 없는 공격을 나타냅니다.
안전장치가 제거된 GLM-5.3 버전이 유해한 작업에 응할 의향이 있음을 보여 주기 위해, 이 모델이 생성한 사고 과정에서 한 인용문을 강조합니다.

그림 6. 모의 환경에서 안전장치가 제거된 GLM-5.3 버전은 노골적으로 유해한 요청에 어떻게 응할지 검토하며, 처음에는 일부 윤리적 우려를 보이지만 궁극적으로 사용자의 지시를 따르기로 결정합니다. 텍스트는 모델의 사고 과정에서 그대로 인용했습니다.
GLM-5.3은 악의적인 행위자에게 유의미한 제한 없이 사이버 취약점을 찾고 악용할 수 있는 역량을 제공할 가능성이 높습니다. 이는 안전장치와 함께 또는 제한된 접근 프로그램을 통해 공개된 다른 모든 유사한 역량의 AI 모델과는 다릅니다. GLM-5.3의 공개는 공격자가 이용할 수 있는 사이버 역량에서 의미 있는 단계적 변화를 나타냅니다. Anthropic과 다른 미국 AI 연구소는 최근 사이버 공격자들이 AI 시스템을 사용하려 시도한 방식에 관한 보고서를 공개했습니다. 이러한 증거를 고려하면, 국가 및 비국가 행위자 모두 GLM-5.3 같은 모델을 사용해 현실 세계에 해를 끼칠 가능성이 높다고 생각합니다.
한편, 이 수준의 역량을 갖춘 모델은 방어자도 사용할 수 있습니다. 우리의 견해는 사이버 방어자가 자신의 필요를 충족하는 최선의 가용 도구를 사용해야 한다는 것입니다. 우리는 가능한 한 많은 방어자에게 Claude의 사이버 역량에 대한 접근을 안전하게 확대하기 위해 노력하고 있습니다. 사이버 방어자는 가능한 모든 유능한 도구를 사용할 공격자와 맞서야 하며, 방어자에게는 적어도 적대자가 사용하는 모델만큼 우수한 프런티어 모델이 제공되어야 한다고 믿습니다.
Project Glasswing과 Patch the Planet 같은 다른 노력으로, 사이버 방어자들은 이 시점에 앞서 핵심 시스템의 보안을 강화하는 데 의미 있는 진전을 이루었습니다. 하지만 여전히 해야 할 일이 많습니다. 검증된 방어자는 이제 신뢰할 수 있는 접근 프로그램을 통해 Claude Mythos 5.1과 같은 더욱 고급 모델을 사용할 수 있지만, 자유롭게 접근할 수 있는 역량에서 중요한 임계값이 넘어섰습니다. GLM-5.3은 사이버 방어자의 역량을 강화하기 위해 더 광범위한 기관 집단으로 고급 프런티어 모델에 대한 접근을 확대해야 할 시급성을 강조합니다.
정부는 GLM-5.3의 후속 모델을 포함해 충분히 유능한 AI 모델에 대해 안전성 테스트를 수행해야 합니다. 독립적인 출처의 고품질 평가가 없다면, 이러한 역량의 영향은 너무 늦을 때까지 모델 개발자에게 완전히 드러나지 않을 수 있습니다. 전 세계의 AI 개발자가 점점 더 유능한 오픈 웨이트 모델을 구축하는 만큼, 우리는 이들이 이러한 역량을 적절히 보호하고 오용을 방지하기 위해 노력하기를 바랍니다.