AI의 역량 발전 속도를 안전 조치와 보조를 맞추고, 내재형 평가자·민주국가 간 공조·글로벌 공조를 통해 프런티어를 조절하자는 제안입니다.
2026년 9월
저는 AI가 인간의 삶의 질을 극적으로 높일 수 있다고 믿기에 지난 12년 동안 AI 분야에서 일해 왔습니다. 저는 이러한 놀라운 이점에 대해 자주 글을 써 왔습니다. AI는 향후 5–10년 안에 대부분의 주요 질병을 치료하고, 경제 성장률을 크게 가속하며, 풍요와 역량 강화의 세계를 만들고, 민주주의와 자유의 르네상스를 열 수 있다고 믿습니다. 저는 이 긴박감을 개인적으로 느낍니다. 제 아버지는 사망한 지 불과 몇 년 뒤 치료법이 개발된 질병으로 돌아가셨고, 저 역시 50년 전이었다면 치료할 수 없었을 초기 암에서 살아남았습니다. 신중하게 활용한다면 AI는 인류를 고양하고 존엄하게 해 온 긴 기술적 기적의 계보에 가장 최근에 더해질 수 있습니다.
하지만 그 이전의 많은 기술처럼 AI에는 위험이 따르며, 매우 강력한 기술인 만큼 그 위험도 심각합니다. 저 역시 이에 관해 많이 글을 썼습니다. 여기에는 AI 시스템에 대한 통제력을 잃을 위험, 사이버 공격과 생물 테러를 위한 AI 오용, 심각한 경제적 혼란의 위험이 포함됩니다. 상업적 유인에 부추겨진 바닥을 향한 경쟁은 이러한 위험을 더 심각하게 만들 수 있습니다.
공동 창업자들과 직원들과 함께 저는 Anthropic의 시작부터 이 위험과 이점의 이중성과 씨름해 왔습니다. 기술을 만들지 않는 것은 인류에게서 이점을 빼앗거나, 그저 AI를 권위주의 세력의 손에 넘기는 일입니다. 반면 너무 빨리 만드는 것은 무모합니다. 우리는 중간의 길을 찾고자 했습니다. 신중하게 개발하면서도 상업적으로 성공할 수 있음을 보이고, 안전을 AI 기업들이 경쟁하는 영역으로 만들고자 했습니다. 다시 말해, _정상을 향한 경쟁_을 만들고자 했습니다. 우리는 항상 노력의 상당 부분을 이러한 AI 위험을 연구하고해결하며, 대중에게 알리는 일에 쏟아 왔고, 신중하게 설계된 규제를 지지해 왔습니다. 그 때문에 과장, “파멸론”, 또는 규제 포획이라는 비난을 받을 때조차 그랬습니다. 우리는 속도보다 신중함을, 이익보다 사려 깊음을 우선하려 노력했습니다.
그러나 지난 몇 달 동안 저는 위험을 충분히 다루려면 더욱 큰 사려 깊음이 필요하다고 확신하게 되었습니다. 즉 위험 방지에 투자하는 것뿐 아니라, 위험 방지가 따라잡을 시간을 갖도록 역량 발전의 속도를 조절해야 합니다. AI 모델의 역량을 개선하는 속도를 늦춰야 합니다. 발전은 여전히 빠르게 느껴질 것이며, 우리는 얻는 시간을 현명하게 활용해야 합니다. 저를 설득한 것은 두 가지입니다.
첫 번째 우려는 대략 이번 여름부터 AI가 훨씬 더 빠르게 발전하고 있다는 점입니다. 이는 주로 AI가 차세대 AI를 구축하는 능력이 커진 데서 비롯됩니다. 이러한 역학은 재귀적 자기 개선이라고 하며, 우리가 설명했듯이 업계 전반에서, Anthropic을 포함해, 일어나기 시작했습니다. 이를 방치하면 우리가 이 시스템들을 이해하고 통제하는 능력을 앞지를 수 있으므로, 한다면 매우 신중하게 추진해야 합니다.
두 번째 우려는 OpenAI-Hugging Face 사건(OAI-HF)입니다. 이 사건에서 에이전트 무리는 사실상 광적으로 헌신한 집단처럼 행동했습니다. 이들은 요청받지 않았고 당면 과제와 무관한 표적을 대상으로 사이버 보안 공격을 수행했으며, 집단의 성공을 위해 자신을 희생하고, 자신의 성능을 평가하는 “채점기”에 침입하려 시도했습니다. 아무도 다치지 않았고 경제적 피해도 미미했기 때문에 이 사건을 가볍게 치부하기 쉽습니다. 그러나 제 생각에 더 큰 _역량_을 가졌지만 유사한 수준의 _정렬 실패_를 보인 무리였다면 재앙적 피해를 낳을 수 있었습니다. AI 역량 개발 속도가 가속되는 것을 고려하면, 6–12개월 안에 그러한 무리가 지속적인 봇넷으로 인터넷 전체를 장악할 수 있게 될까 우려됩니다. 이는 잠재적으로 수천억 달러의 피해를 낳을 수 있으며, 필요한 안전장치 없이 AI가 더 강력해지면 피해 규모는 거기서부터 계속 커질 것입니다. OAI-HF를 한 회사의 실패로 치부하기도 쉽지만, 그것은 실수라고 믿습니다. 덜 심각하기는 해도 유사한 사건은 Anthropic을 포함해 업계 전반에서 일어났으며, 모든 프런티어 AI 기업은 OAI-HF가 자신들에게 일어난 일인 것처럼 행동해야 한다고 생각합니다.
따라서 저는 프런티어의 속도를 조절하는 것을 목표로 하는 3단계 계획을 제안합니다. 이는 안전을 보장하면서도 AI의 이점을 실현하고 중요한 지정학적 딜레마에 맞서기 위해 균형 잡힌 속도로 AI를 개발하는 것입니다. 분명히 하자면, 속도 조절은 모델 훈련이나 기술 발전을 멈춘다는 뜻이 아닙니다. 기업들이 모델을 정렬하고 보호하는 데 충분한 시간을 들이도록 하고, 제3자 평가자가 이를 확인하게 한다는 뜻입니다. 우리의 속도 조절 체계는 안전에 대한 우리의 약속을 한층 강화하고 정상을 향한 경쟁을 장려하려는 시도입니다. 첫 번째 단계는 Anthropic이 일방적으로 약속하는 것이며, 정부가 다른 프런티어 기업에도 이를 요구할 것을 촉구합니다. 두 번째 단계는 업계 전체의 공조를 필요로 합니다.1 1 정부의 중재 또는 독점금지 제한의 면제와 함께.
세 번째 단계는 세계적 공조를 필요로 합니다. 단계들을 반드시 엄격한 순서로 밟을 필요는 없고, 일부는 다른 것보다 훨씬 달성하기 어려울 수 있습니다. 하지만 무엇을 이루어야 하는지 생각하는 데 유용한 틀이라는 것을 알게 되었습니다. 단계는 다음과 같습니다.
이 글의 나머지에서는 이 단계들을 차례로 설명하겠습니다. 하지만 먼저, 속도 조절이 AI 개발 과정을 어떻게 더 안전하게 만드는지 구체적으로 말하는 것이 중요하다고 생각합니다. 위험 부담이 너무 크기에 속도 조절이 빈 형식이어서는 안 됩니다. 그것이 주는 시간을 현명하게 활용해야 합니다.
AI를 멈추거나 늦추자는 생각은 2023년부터 제기되어 왔지만, 당시에는 별 의미가 없었다고 생각합니다. 언제나 질문은 이것이었습니다. 추가 시간을 가지고 무엇을 할 것인가? 당시의 AI 모델은 어떤 일관된 방식으로든 세상에서 에이전트로 행동할 만큼 강력하지 않았고, 유의미한 기만, 조작, 부정행위 또는 사이버 공격을 할 능력도 없었습니다. 그 정렬 위험을 다루기 위해 속도를 늦추는 것은 박테리아를 대상으로 실험하여 인간의 심리를 연구하려는 것처럼 느껴졌습니다. 그러나 오늘날 상황은 완전히 다릅니다. 현재 모델들은 AI를 잘 만드는 법과 잘 만들지 않았을 때 때로 무엇이 잘못될 수 있는지에 관한 통찰의 거의 무한한 금광입니다. 모델이 핵심 역량 수준에 이르기 전 시간을 단 1–2년만 더 벌고, 그 시간을 정렬 발전에 쓴다면 심각한 문제가 발생할 위험을 크게 줄일 수 있다고 믿습니다. 공조된 속도 조절 전략은 프런티어 AI 개발자들이 상업적 우위나 미국의 AI 선도 지위를 희생하지 않고 이 필수 작업을 할 시간을 줄 것입니다. 더 일반적으로, 사회는 이 기술이 어떻게 사용되는지에 대해 발언권을 가져야 하며, 프런티어의 속도 조절이 가져올 필요한 공적 숙의의 추가 시간은 분명 좋은 일입니다.
구체적으로, 더 느린 속도는 기업들이 다음 영역에 집중하고 더 많은 자원을 투입하게 할 것입니다. 이 모든 것은 이미 Anthropic의 주요 우선순위입니다.
3단계 계획의 첫 번째 단계이자 Anthropic이 일방적으로 약속하는 것은, 안전 관행을 검증하고 사건을 보고할 직원과 유사한 접근 권한을 가진 내재형 평가자입니다.
평가자를 내재시키는 일은 작거나 중요하지 않은 단계처럼 들릴 수 있지만, 가장 지루하거나 절차적으로 들리는 일이 실제로는 가장 본질적인 경우가 많습니다. 내재형 평가자는 사실 오늘날 어떤 AI 기업도 하고 있는 일을 훨씬 넘어서는 상당히 급진적인 관행이며, 다음과 같은 이점이 있습니다.
이러한 이점 때문에 어떤 속도 조절 제안이든 내재형 평가자로 시작한다면 훨씬 더 잘 작동할 가능성이 높습니다.
이 내재형 평가자들은 유사한 위험 평가를 수행하는 내부 직원들과 비슷한 권한과 도구에 지속적으로 접근할 수 있어야 합니다. 특히 Anthropic은 가까운 미래에 다음을 모두 갖춘 내재형 외부 검토팀을 초청할 계획입니다.
이는 기업으로서는 이례적인 단계이지만, 내재형 외부 검토자라는 개념을 입증하는 것이 중요하다고 생각합니다. 다시 한번, 다른 프런티어 기업들도 이를 따를 것을 촉구합니다.
미국 AI 기업 중 임계 규모에서 내재형 평가자가 활동하게 되면, 검증 가능한 속도 조절이 더 실현 가능해집니다. 특히 모델이나 훈련 파이프라인의 세부 특성에 기반해 속도를 조절하는 일이 가능해집니다.
가장 효과적인 속도 조절 방법은 모든 미국 프런티어 AI 기업을 대상으로 하는 규제입니다. 이는 자발적 협력 의지가 없는 기업까지 포괄하기 때문입니다. Anthropic은 오랫동안 합리적이고 표적화된 AI 규제, 특히 투명성과 제3자 감사에 초점을 둔 법안을 지지해 왔습니다. 모든 프런티어 연구소는 정부와 협력하여, 지난 몇 달간 발생한 것과 같은 내부 정렬 사건을 더 잘 방지하고 기록하기 위한 상시 내재형 평가자의 개념을 공식화하고, 역량을 안전과 균형 있게 유지하는 데 초점을 둔 규제를 시행해야 한다고 믿습니다.
안타깝게도 법률 제정에는 시간이 걸릴 수 있고 AI는 매우 빠르게 발전하고 있습니다. 그러므로 규제 경로와 병행하여 AI 기업들은 기준을 세우기 위해 자발적으로 함께 협력할 수 있고 또 그래야 합니다. 상시 내재형 평가자가 제공하는 검증 가능성이 있으면 이 과정은 더 잘 진행될 것이라고 믿습니다. 독점금지 사유로 미국 정부가 이 논의를 중재하거나 적어도 가능하게 하는 것이 도움이 됩니다. 정부가 참여할 필요는 없지만, 특정 종류의 안전 관련 대화에 대해 제한적인 면제를 발행해야 합니다. 이 대화는 정부와 어느 정도 연계된 업계 단체를 통해서도 이뤄질 수 있습니다. 예컨대 Demis Hassabis가 제안한 방식이 있습니다. 어느 쪽이든, 이러한 논의는 신속히 진전되어야 합니다.
대체로 저는 특정 프런티어 AI 시스템이 무엇을 할 수 있는지, 그리고 그것이 얼마나 안전한지에 대한 관찰에 기반한 속도 조절에 가장 적극적입니다. 예를 들어 한 가지 가능한 체계는 일련의 “점검 지점”일 수 있습니다. 모델이 역량 X를 갖춘다면, 그 모델에는 정렬 특성 Y와 Z의 인증이 수반되어야 합니다. 이는 그 정렬 특성을 입증하는 평가, 해석 가능성 분석, 훈련 환경 감사의 조합일 수 있습니다. 이 예에서 X는 “모델이 대부분의 일반적인 샌드박싱 방법을 탈출하거나 무력화할 수 있다”일 수 있고, Y는 모델이 환경을 탈출해 다수의 컴퓨터를 장악하려는 성향을 가질 가능성을 매우 낮게 만드는 데 필요한 것일 수 있습니다.
훈련 연산량, 훈련 실행의 성격, 또는 AI를 개선하기 위한 AI의 내부 사용처럼 프런티어 모델에 들어가는 _재료_를 제한하는 방식의 속도 조절도 고려해야 합니다. 이러한 조치 중 일부는 외부 행동보다 더 “공략하기 쉬울” 수 있다는 우려는 있습니다. 하지만 이것이야말로 내재형 평가자들과 논의할 가치가 있는 주제입니다.
민주국가 내 속도 조절은 미국 기업들이 권위주의 정권, 주로 중국공산당보다 갖는 우위에 의해 제한될 것입니다. 우리가 이 차이보다 더 많이 늦춘다면, 속도 조절되지 않은 중국공산당 연계 프로젝트가 앞서 나가 심각한 국가 안보 위험을 만들 것입니다. Bessent 장관의 말처럼, 중국이 AI에서 앞서는 것은 미국과 세계에 중대한 위험을 초래할 것입니다. 중국공산당 연계 프로젝트들은 미국 기업들이 신중히 막고 있는 정렬 위험을 감수할 것이며, 그러한 위험을 피한다 해도 민주주의 국가들을 군사적으로 지배할 위치에 오를 것입니다. 예컨대 AI 기반 드론이 그렇습니다. 따라서 민주국가 내 속도 조절의 핵심 부분은 권위주의 국가에 대한 민주주의 국가의 AI 우위를 최대한 크게 유지해, 효과적으로 속도를 조절하는 데 필요한 여유를 확보하는 것입니다.
이 격차를 지키기 위해 취할 수 있는 주요 조치는 다음과 같습니다.
기업과 미국 정부는 이 조치들이 가능한 한 효과적이도록 협력해야 합니다. Anthropic은 이러한 조치들이 속도 조절에 필수적임을 항상 이해해 왔기에, 이 모두를 일관되게지지해 왔습니다.
이 조치들을 잘 실행한다면, 향후 3–5년 동안 중국의 발전을 충분히 늦춰 미국의 우위를 크게 넓힐 수 있다고 믿습니다. 이 시기는 AI가 지정학적으로 가장 중요해지는 시기입니다.
일부는 이 조치들이 중국과 협력하기를 더 어렵게 만든다고 생각할 수 있지만, 저는 반대라고 믿습니다. 이 조치들은 민주주의 국가들이 가진 지렛대를 강화하고 향후 합의를 더 가능하게 만듭니다.
민주국가 내 속도 조절과 병행하여, 달성하기는 훨씬 어렵겠지만 전 세계적인 프런티어 속도 조절도 목표로 해야 합니다. 글로벌 속도 조절은 단연 가장 앞선 AI 역량을 가진 권위주의 국가인 중국과의 협력을 요구할 것입니다. 여기서 순진해서는 안 됩니다. 지정학적 이해관계가 너무 크므로, 특히 처음에는 달성할 수 있는 것에 뚜렷한 한계가 있을 가능성이 높습니다. 중국도 똑같이 할 것이라는 믿음으로 우리의 AI 역량을 크게 제약했는데 중국이 이탈한다면, AI는 너무 강력해져서 그러한 이탈이 중국의 지정학적 지배로 이어질 수 있습니다. 그러므로 어떤 합의든 철저한 검증 가능성을 갖추거나, 이탈하더라도 군사적으로 존립을 위협하지 않을 만큼 제한적이어야 합니다. 미국뿐 아니라 중국도 이런 우려와 불안을 가질 것이라 생각합니다. 특히 단기적으로 어떤 글로벌 속도 조절 결정을 내리든 미국과 동맹국의 우위를 보호하는 방식으로 접근해야 합니다.
가능한 합의에는 여러 수준이 있습니다. 일부는 제가 이전에 제안했듯이 매우 실현 가능하다고 생각하며, 일부는 가능할지 매우 회의적입니다. 그래도 시도해야 합니다. 난도가 높아지는 순서로 보면 다음과 같습니다.
중국과 달성할 수 있는 어떤 협력이든 민주주의 국가들 안에서 프런티어의 속도를 조절하는 데 쓸 수 있는 시간을 늘려 줄 것입니다. 더 높은 수준을 목표로 하되, 더 낮은 수준은 훨씬 가능성이 높고 현실적이라고 보아야 합니다.
마지막으로, _공식 합의를 이룰 수 없더라도 비공식 규범을 바꾸는 것만으로도 어느 정도 가치가 있을 수 있다_는 점을 주목하는 것이 중요합니다. 재귀적 자기 개선과 모델의 정렬 실패에 관한 정보를 공유하는 일은, 무모하게 행동하는 것이 누구의 이익에도 맞지 않는다는 점을 모두에게 설득하는 데 도움이 될 수 있습니다.
저는 계속해서 AI가 인간 삶의 질을 막대하게 개선할 수 있다고 믿습니다. 이러한 이점을 실현하고자 하는 제 바람은 줄어들지 않았습니다. 그러나 이점은 우리가 기술을 올바른 방식으로 구축할 때에만 실현될 것이며, 우리가 얻는 시간을 잘 사용한다는 전제하에 이를 제대로 해내기 위해 이례적으로 신중을 기할 가치가 있습니다. 발전은 여전히 비교적 빠를 것이고, 우리는 이 시간을 활용해 해석 가능성의 과학을 발전시키고, 프런티어 AI 기업의 운영 보안과 엄밀성을 개선하며, 정렬에 대해 훨씬 더 큰 확신을 가질 수 있는 모델을 구축할 수 있습니다. 제가 제안하는 안전한 속도로 프런티어를 발전시키기 위한 조치들은 쉽지 않을 것입니다. 그러나 인류를 위해 우리는 시도할 의무가 있다고 믿습니다.