로컬 AI 모델이 성능, 비용, 효율성 측면에서 AI 데이터센터 모델을 이기기 어려운 이유와 그럼에도 로컬 모델이 유용한 틈새를 살펴봅니다.
새로운 오픈 웨이트 AI 모델이 출시될 때마다 사람들은 로컬 모델이 미래라고 말합니다. 모두가 노트북이나 휴대전화에서 AI 모델을 실행할 수 있게 될 텐데, 왜 수십억 달러를 들여 데이터센터를 구축하겠느냐는 것입니다. 저는 이 생각이 실패할 운명이라고 봅니다. 오픈 웨이트 모델이 아무리 강해져도, 추론의 대부분은 언제나 AI 데이터센터에서 일어날 것입니다.
로컬 모델은 결코 그만큼 강력해지지 않을 것입니다. 이 점은 자명해야 한다고 생각합니다. 현재의 모든 최전선 모델(폐쇄형과 오픈 웨이트 모두)은 데이터센터의 완전한 GPU 클러스터 외에는 실행할 수 없을 만큼 큽니다. 물론 더 작은 모델도 시간이 지날수록 더 지능적으로 변하고 있습니다. 1년 뒤에는 노트북에서 GPT-5.6-Sol과 비슷한 수준의 무언가를 실행할 수 있을지도 모릅니다. 하지만 그때가 되면 GPT-5.6-Sol은 유용하게 쓰기에는 너무 약하다고 생각할 것입니다.
많은 사람이 이 마지막 요점을 부정하지만, 사실입니다. 거의 모든 사람의 드러난 선호는 자기 가격대에서 이용할 수 있는 가장 강력한 모델을 쓰는 것입니다. AI 발전이 GPT-4에서 멈췄다면, 그 주위에 매우 강력한 도구를 만들 수 있었을 것이라고 생각합니다. 하지만 오늘날 누가 GPT-4를 쓰겠습니까? LLM이 더 유능해지면서 이에 대한 우리의 기대도 커졌습니다. 이제 우리는 에이전트 시스템이 점점 더 많은 문제를 독립적으로 해결할 수 있기를 기대합니다. 그런 시스템이 혼란스러워하거나 멈춰 버리면 몹시 답답합니다. 선택지가 주어지면 사람들은 자신을 덜 답답하게 하는 모델을 고를 것이고, 그것은 언제나 더 크고 더 강력한 모델일 것입니다.
그에 더해, 데이터센터 모델은 언제나 더 저렴할 것입니다. 사람들이 왜 계속 로컬 모델이 싸다고 말하는지 이해하지 못하겠습니다. 제게는 사람들이 Uber 운전이 “공짜 돈”이라고 말할 때 저지르는 것과 같은 실수로 보입니다. 연료비와 차량의 마모 비용을 무시하는 것이죠. 저가형 홈 랩1의 설치 비용만으로도 AI 제공업체 중 하나의 유료 구독을 몇 년간 살 수 있습니다. 전력 비용은 얼마나 많은 추론을 실행하느냐에 따라 한 달에 대략 $50-$300이 들 것입니다. 다시 말해 유료 구독 몇 개를 더 이용하는 가격입니다.
데이터센터 모델이 더 싼 이유는 무엇일까요? 데이터센터 추론이 보조금을 받고 있어서가 아닙니다. 실제로 추론은 상당히 저렴합니다. 동일한 모델을 로컬과 데이터센터에서 실행한다면, 데이터센터 모델이 본질적으로 더 효율적일 것입니다.
주된 이유는 배칭입니다. GPU는 한 번의 수학 연산을 하는 것과 정확히 같은 속도로 수십만 번의 수학 연산을 할 수 있습니다. 하지만 단일 사용자의 추론에서는 각각의 새 토큰이 이전 토큰의 결과에 의존하므로 배칭할 수 없습니다2. 배칭할 수 있는 것은 수백 명 사용자의 추론을 함께 처리하는 일입니다. 이는 한 번에 한 사용자만을 위한 추론을 하는 것과 사실상 같은 시간, 전력, 열을 소모합니다.
집에서 직접 추론을 실행할 때는 배칭할 것이 없습니다. 기껏해야 병렬 AI 에이전트 몇 개를 돌릴 뿐이므로 활용률은 끔찍합니다. 돈을 내고 있지만 쓸 수 없는 잠재적 추론 용량이 많이 있습니다. 그냥 낭비되는 것입니다. 이를 피할 유일한 방법은 친구들과 함께 로컬 추론 엔드포인트를 그들에게 공개하는 것입니다. 그러면 사실상 형편없는 자체 데이터센터를 운영하는 셈입니다.
또 다른 이유는 데이터센터가 더 크고 효율적인 GPU를 사용할 수 있기 때문입니다. 로컬 모델을 실행하는 데 쓰게 될 소비자용 GPU는 RTX 4090 같은 게이밍 GPU입니다. 배치형 AI 추론을 위해 설계된 데이터센터용 B200은 동일한 전력으로 약 3배의 플롭스와 거의 4배의 메모리 대역폭을 냅니다3. 따라서 배칭과 GPU 효율성을 합치면, 모델을 로컬에서 실행하기 위해 대략 ~30배의 자원을 쓰는 셈입니다.
덧붙여, 이것이 대형 데이터센터만큼 자원 집약적이지 않기 때문에 로컬 모델이 좋다고 말하는 사람들을 제가 의심스럽게 보는 이유입니다. LLM을 효율적으로 실행하고 싶다면, 가능한 한 많은 사용을 AI 데이터센터로 밀어 넣으려 해야 합니다! 최대한 호의적으로 해석하면, 그들이 말하는 바는 우리 모두가 더 작은 모델을 실행해야 한다는 것입니다. 하지만 그 경우에도 자체 모델을 호스팅하는 대신, 예를 들어 GPT-5.6 Luna API를 통해 작은 모델을 쓰는 것이 이상적입니다.
로컬 모델이 이기는 가능한 세계가 있을까요? 아마도 그렇습니다. 일어날 수 있는 한 가지는 정부가 AI의 위험성에 대한 우려 때문에, 또는 단순히 대중의 압력에 굴복해서 AI 데이터센터의 사용을 전면 금지하는 일입니다. 그런 세계에서 로컬 모델은 유일한 선택지가 될 것입니다.
또는 AI 발전이 어떻게든 매우 큰 모델에서는 멈추는 반면 작은 모델에서는 계속될 수도 있습니다. 이것이 어떻게 일어날 수 있을지는 상상하기 어렵습니다. 위에서 말한 정부 개입의 경우를 제외하면 말입니다. 하지만 300억 매개변수 모델이 최전선 모델이 될 수 있는 세계라면, 로컬 모델도 경쟁력이 있을 수 있습니다.
아니면 모델이 너무나도 좋아져서 300억 모델이 정말로 모든 일을 할 만큼 똑똑해지고, 누구도 리만 가설을 풀려는 경우가 아니면 Opus나 Sol 같은 모델을 딱히 필요로 하지 않게 될 수도 있습니다. 저는 이것을 그다지 믿지 않습니다. 오늘날 모델은 최전선 수학 연구를 할 수 있지만, 여전히 대규모 코드베이스를 저만큼 잘 리팩터링할 정도로 똑똑하지는 않습니다. 그러니 제가 그저 이용 가능한 가장 똑똑한 모델을 쓰고 싶지 않은 세계를 상상하기는 어렵습니다.
로컬 모델에는 언제나 틈새가 있을 것이라고 생각합니다. 저는 Thinking Machines의 “Interaction Models” 뒤에 있는 놀랄 만큼 단순한 아이디어를 떠올립니다. 이는 너무나 명백해서 OpenAI도 합니다. 음성 채팅처럼 지연 시간에 민감한 애플리케이션에서는 작고 빠른 모델이 대화를 처리하고, 어려운 사고는 크고 느린 모델에 위임합니다. 5년 뒤 대부분의 AI 사용은 휴대전화나 노트북의 로컬 모델을 통해 매개될 수도 있다고 해도 놀랍지 않을 것입니다. 물론 이 세계에서도 거의 모든 작업은 여전히 AI 데이터센터를 통해 수행될 것입니다.
일부 사용자는 로컬 모델이 더 약하고 더 비싸더라도 선호할 것입니다. 예를 들어 로컬에서 모델을 조종할 수 있는 것은 그런 사용자에게 결정적인 기능일 수 있습니다. 다른 사람들은 단순히 자기 인프라를 완전히 통제하는 것을 가치 있게 여기거나, 인터넷 연결이 불안정할 수 있습니다4. 당신이 그런 사람이라면, 특히 연구나 코딩에 모델을 쓰기보다는 모델과 대화만 한다면, 로컬 모델은 좋은 선택입니다. 하지만 이것은 언제나 틈새 집단일 것이라고 생각합니다. 대다수 사용자는 계속 데이터센터를 통해 추론할 것입니다.
수정: 이 글은 Hacker News와 Lobste.rs 모두에서 댓글을 받았습니다. 댓글 작성자들은 AI 산업 전체의 붕괴가 모든 것을 뒤집을 수 있다고 제안합니다. 그럴 법하지만, 저는 거품 붕괴가 AI 제품에 그 정도로 파국적일 것이라는 데 동의하지 않습니다. 다른 이들은 사람들이 강한 모델을 선택할 것이라는 제 가정에 이의를 제기하며, 로컬 추론에 관한 자신들의경험을공유합니다. 로컬 모델을 쓰는 것은 완전히 괜찮다고 생각하지만, 해커 포럼에서는 로컬 모델 사용자가 과도하게 많이 보일 가능성이 큽니다. 마지막으로, 몇몇사람들은제가 “이긴다”라는 단어를 쓴 것을 좋아하지 않았습니다. 모르겠습니다. 제게는 꽤 관용적인 표현으로 보입니다. 여기서 “이긴다”란 모두가 로컬에서 실행하기 때문에 사람들이 클라우드 추론에 대체로 돈을 내지 않게 된다는 뜻입니다.
↩ 2. 구체적으로 병목은 모델 웨이트를 GPU로 옮기는 것이며, 이는 한 사용자의 토큰을 처리하든 백 명 사용자의 토큰을 처리하든 수행해야 하고 같은 시간이 걸립니다.
↩ 3. 저는 LLM의 도움으로 이를 추정했지만, NVIDIA의 수치를 직접 확인할 수 있습니다.
↩ 4. 그러면서도 안정적인 전력 공급과 가정용 추론 클러스터를 갖출 충분한 돈은 있는 경우입니다.
이 글이 마음에 들었다면, 새 글에 관한 이메일 업데이트를 구독하거나 Hacker News에 공유하는 것을 고려해 주세요.
다음은 이 글과 태그를 공유하는 관련 글의 미리보기입니다.
고급 AI 아첨
누구나 AI 아첨이란 모델이 당신이 얼마나 똑똑한지 말해 주는 것임을 압니다. 와, 당신은 완전히 맞습니다. 그건 단순히 새로운 아이디어가 아니라, 진정으로 획기적입니다. 당신은 아주 특별한 사용자입니다. 알아보기 쉽지 않나요?
AI 아첨에 관한 논의는 지난해 “#keep4o”운동이 OpenAI의 가장 아첨적인 모델(GPT-4o)의 제거에 항의하고, 많은사람들이 공공연히 AI 정신병에 빠져들던 때 정점에 달했습니다.