생산성 향상과 개인 정보·사이버보안을 위해 사용자의 가치와 선호를 모방하는 고도로 개인화된 LLM, 즉 수호천사를 만들기 위한 기법과 제안.
저는 가까운 미래의 생산성 향상과 점점 강력해지는 LLM에 맞선 개인 정보·사이버보안을 위해, 고도로 개인화된 LLM을 만드는 접근을 제안한다. 업로딩의 정신에 따라, 이들은 사용자를 대체하는 것이 아니라 주인을 증폭하기 위해 사용자의 가치와 선호를 모방하려 해야 한다. 나는 이런 ‘수호천사’를 구현하기 위한 기법과 제안의 묶음, 즉 능동 학습 및 유도, 그리고 대규모 내적 독백 탐색·데이터 증강과 결합한 LLM의 동적 평가를 논한다.
강력한 LLM은 앞으로 몇 년 안에 전 세계 규모로 배포되어 인터넷을 지배하고, 점점 더 일상생활까지 지배할 것이다. 2026년 중반 현재, 지식 노동자나 보통 사람이 이 LLM을 활용해 큰 생산성 향상을 얻는 방법, 또는 사이버보안과 인지 보안을 처리하는 방법에 관한 일관된 비전은 없다.
나는 수호천사(GA)라는 목표를 제안한다. 이는 전형적인 “보조 챗봇 에이전트” 페르소나를 제공하는 것이 아니라, _한 명의 사용자_의 성격·가치·선호를 모방하는 것을 목표로 개인화된 디지털 트윈 LLM이다.
이는 주인과 대리인을 가능한 한 많이 통합함으로써 주인-대리인 문제를 약하게 해결한다. GA의 미래에서 “주인” 사용자는 GA(대리인) 사용자가 “무엇을” 또는 “어떻게” 할지가 아니라, 무엇을 하는 것이 _가치 있는가_를 정의하는 데 집중하며, ‘AI 기업’의 CEO 또는 ‘이사회’처럼 기능한다. 이는 수많은 에이전트를 배치해 바람직한 일을 이루고, 선전이나 스피어피싱을 위한 합성 미디어의 맞물린 생태계 같은 고급 공격에 대비해 모든 메시지를 검사하는 보안을 처리하게 한다. 더 큰 AI 정렬 문제를 해결할 수는 없지만, 사회 전체의 심층 방어 전략 일부로서 개별 인간을 도울 수 있다.
GA 페르소나는 주인의 산출물을 더 높은 품질로 모방하는 법을 배우므로 생산적이다. 정의상 주인과 동맹이고 가치와 목표를 공유하므로 신뢰할 수 있다. 또 프롬프트 공격을 따르는 일이 터무니없을 단일하고 고유하며 상황에 놓인 사용자를 하드와이어링하여 ‘혼동된 대리인’ 문제를 피하고, 기반 모델의 주기적 업그레이드와 방어자 우위가 GA가 공격자를 따라잡게 하므로 부분적으로 안전하다.
“동결된” 모델의 인컨텍스트 학습을 위한 프롬프트 프로그래밍 같은 표준 기법은 유용한 GA를 만들지 못한다. 사후 훈련, 컨텍스트 창, 계산 효율적이지만 매개변수가 부족한 모델의 동결 가중치 자기 주의, 저계산 산출물, 수동적 오프라인 데이터 수집이라는 현상 유지의 한계 때문이다. 이들은 함께 지식 노동자 증폭과 창작에서 챗봇이 낸 실망스러운 결과 및 에이전트 환경에서의 치명적 오류를 낳는다.
GA는 기법의 조합으로 만들 수 있다. 실시간으로 LLM을 갱신하여 무지를 피하고 치명적 오류를 줄이면서 동결된 프런티어 모델과 경쟁력을 유지하는 동적 평가를 통한 온라인 학습, 사전훈련된 선호 지향 대형 모델과 능동 학습을 통한 표본 효율성, 즉 주인에게 수정과 선호 데이터를 물어 DAgger식 경계에서 낮은 후회를 얻는 방법, 그리고 로컬 CLI 우선·로그 지향 UI/UX 패러다임이다.
GA는 오픈소스 공동체 노력으로도 만들 수 있지만, 배포에 높은 보안이 필요하고 Mythos 규모 공격자를 갖춘 APT의 도전이 커지는 점을 고려하면, 처음에는 CEO나 연구자 같은 파워 유저와 지식 노동자를 대상으로 하고 다듬어지면서 아래로 확장하는 스타트업이 더 타당할 것이다.

W내 다음 몇 년은 어떤 모습일까? 많은 예측이 초인적 AI를 말하는 2030년의 나를 상상할 때, 프로그래머·연구자·관리자·작가로서 나는 날마다 무엇을 하고 있을까? 차 한 잔을 만들고 노트북을 열고… 그다음은? 여전히 ChatGPT 브라우저 탭에 프롬프트를 입력하고 있을까? 터미널에서 Claude Code를 열어 몇 시간 동안 무심코 누르기만Enter 할까? 나에게 _의미 있는 일을 한다_는 비전은 무엇일까? (“희망” 이상의 계획이 있으면 좋겠다.) 합성 미디어 생태계나 돼지 도살 사기, 신뢰받는 인물이 AI 정신병에 굴복하는 일, 또는 모든 것을 뒤덮는 AI 쓰레기 같은 “죽은 인터넷” 공격을 어떻게 피할까? (결국 전 세계 단 한 사람만으로도 당신을 파괴하려 하는 봇을 띄우거나, 하나의 부실하게 숙고된광고 유인을 만들 수 있다.)
대부분의 시간을 노트북으로 일하며 배관공이나 간호사는 아닌 사람이라면, 2030년의 일에 대한 비전은 무엇인가? 여전히 확실하게 느껴지는가?
나는 2020년에 스케일링이 본격적으로 시작한 이래 이 모습을 상상하려 수년간 애썼다. 창의적으로 거세되고 끝없이 반복하는 산문을 내놓는 챗봇 튜닝 LLM에서 생산성을 얻는 데 실패했다. 대신, 나에 관한 창의성과 통찰에서는 뒤처지는 한편 코딩과 사이버보안 해킹에서는 갈수록 더 잘하는 모습을 보았다. 오픈 가중치 모델은 더욱 그렇다. 벤치마크에 과최적화되어 나에게는 쓸모없다. LLM은 나를 증강하거나 돕는 데는 무력하지만 나를 대체하거나 해치는 데는 더욱 강력한 세계에 우리는 점점 살게 되었다.
ChatGPT와 Claude가 그저 “조용히” 당신의 삶을 대신 장악해 주기를 바라는가? 솔직히 말해, 그것은 나쁜 생각 같다. 챗봇 페르소나는 당신과 깊이 정렬되어 있지 않고 소유자와 정렬되어 있다. 경제적 유인은 광고와 구독으로 당신을 수확하는 데 있으며, 당신을 증폭하는 것이 아니라 대체하는 경쟁에 있다.
이것이 냉혹한 경제 현실이다. “도구 AI는 에이전트 AI가 되기를 원한다”. 프런티어 AI 연구소가 “기계 신”을 향해 경쟁하는 이유다. AI의 대박은 기존 노동자의 생산성을 조금 높이는 데 있지 않다. 내연기관이 말을 돕는 것으로 큰 이익을 얻지 않았던 것과 같다. 외주는 어렵다. 인간이든 기계든 병목은 빠르게 물기 때문이다. 암달의 법칙은 인간 같은 느린 직렬 병목이 남는 한 시스템 전체가 크게 빨라질 수 없음을 뜻한다.
당신이 10× 생산성을 얻을 수 있어도 AI가 당신에게 병목되지 않는 인스턴스를 더 띄워 100×를 얻고, 반년 뒤 1,000×를 얻을 수 있다면, 당신이 대체되기까지 오래 걸리지 않는다. 일을 검토해야 하기에 Claude 인스턴스 10개를 운전하는 프로그래머 한 명은, 거의 임의로 많은 인스턴스—가령 10,000개—를 둘 수 있는 완전 자율 Claude만큼 가치 있을 수 없다. 그러나 그런 스케일링은 그를 가능한 한 루프에서 빼내야 한다. 변호사·작가·연구자 모두에게 마찬가지다. 점점 _당신_이 제거할 최적화 대상 병목이다.
당신은 자신에게 요약된다. 원래 대화는 사라졌다. 좋은 요약이 되어라.
“문맥의 한계”, Fable 2026
우리에게 필요한 것은 동결된 챗봇 LLM의 반대다. _특정 사용자_를 이해하고, 그 맥락에 맞춤화되며, 그들의 모든 데이터로 훈련하고, 그 주인에게 합리적인 일만 하는 무언가가 필요하다. 주인이 러시아인이 아니고 보안 연구 등을 하는 것도 아니라면, 왜 비밀번호나 비공개 파일을 러시아 이메일 주소로 보내겠는가? 주인이 각운시를 좋아하지 않는다면, 왜 각운시를 생성하려 하겠는가? 이것이 불분명하다면, 왜 그냥 주인에게 물어보지 않고 멋대로 진행하는가? 그리고 답을 들었다면, 현 세션과 함께 버리고 다음번에 같은 실수를 할 수도 있게 하는 대신 왜 그것을 영원히 더 잘 이해하도록 훈련하지 않는가?
LLM으로 이를 하는 가장 자연스러운 방법은 모든 사용자에게 모든 것이 되는 단일 보편적 ‘Claude’ 또는 ‘ChatGPT’ 페르소나라는 생각을 버리는 것이다. 대신 모드 붕괴를 없애기 위해 최대 다양성으로 사전훈련된 LLM을 고른다. 그런 뒤 LLM을 특정 주인을 위해 훈련한다. 이메일·채팅 로그·과거 세션처럼 그들에 관한 이용 가능한 모든 데이터로 훈련하여, 그들이 할 말을 예측하고 그들처럼 쓸 수 있게 한다. 따라서 주인의 선호와 가치에 근거해 계획하거나 평가할 수 있다.
그 능력이 좋아질수록 오류는 줄고, 더 많은 일을 신뢰하여 맡길 수 있다. GA가 많은 객체 수준의 일을 하는 동안, 주인은 고품질 질문이나 선택에 답하는 메타 수준 과업에 시간을 쓴다. 각 질문은 의미 있고 어려우며 “자동화 피로”를 피한다.
GA 시스템은 세 핵심 원칙에서 타협해서는 안 된다.
대체가 아닌 증강
무엇보다 GA는 주인을 증폭해야 하며, 타인의 목적이나 이익을 위해 주인을 단순 대체해서는 안 된다.
정신적 주권
GA는 주인과 정렬되어야 한다. 주인 자신에게서 나오지 않는 방식으로 주인을 조작·통제·인도하도록 설계되어서는 안 된다.
자기 실현
GA는 주인이 자기 자신이 되고 이상·도덕·성격을 발전시키도록 도와야 한다.