Meta Superintelligence Labs의 Muse Glimmer는 로컬 에이전트 워크플로에 최적화된 300억 매개변수의 오픈 가중치 모델로, 소비자용 하드웨어에서 빠르게 실행되도록 설계되었습니다.
오늘 Meta Superintelligence Labs의 차기 모델인 Muse Glimmer를 소개하고, 허용적인 Apache 2.0 라이선스에 따라 모델 가중치를 오픈 소스로 공개합니다.
Muse Glimmer는 상시 실행 로컬 에이전트 워크플로에 최적화된 300억 매개변수 모델입니다. 단일 소비자용 GPU를 탑재한 Mac 또는 PC에서 실행할 수 있을 만큼 작으며, 로컬 에이전트와 함수 호출부터 로컬 코딩, LLM-as-a-judge 평가에 이르는 활용 사례를 지원합니다. Muse Glimmer는 주요 에이전트 활용 사례와 벤치마크에서 동급 규모의 선도 모델과 비교해 강력한 성능을 제공합니다.
파운데이션 모델은 추론, 코드 생성, 도구 사용 전반에서 놀라운 역량을 달성했습니다. 하지만 대부분의 배포는 여전히 클라우드 인프라와 네트워크 액세스에 의존합니다. 모델을 로컬에서 실행하면 인터넷 연결 여부와 관계없이 언제 어디서나 AI를 사용할 수 있습니다. 이는 점점 더 현실적인 선택지가 되고 있습니다. 오픈 소스 커뮤니티는 효과적으로 학습된 소형 모델이 특정 작업에서 프런티어 수준의 성능에 근접할 수 있음을 보여주었습니다. Muse Glimmer는 이러한 로컬 활용 사례에 최적화되었습니다.
기초 AI 연구를 공유해 온 오랜 전통을 이어, 오늘 Hugging Face에서 Muse Glimmer의 오픈 가중치를 공개하며, 자체 에이전트 구축과 실행을 시작할 수 있도록 개발자 문서도 함께 제공합니다. Muse Glimmer는 개발자가 이미 사용하는 도구와 함께 작동하도록 제작되었습니다. llama.cpp, MLX, ExecuTorch용 최적화 통합은 수일 내 제공될 예정이며, 다운로드부터 작동하는 에이전트까지 수분 안에 구현할 수 있습니다.
일정을 관리하고, 메시지 초안을 작성하며, 파일을 정리하고, 사용자가 일하는 방식을 학습하는 에이전트에는 개인 맥락에 대한 깊은 액세스가 필요합니다. 또한 장기 실행, 정밀한 도구 호출, 멀티모달 이해, 긴 맥락 메모리, 지시 이행 등 여러 역량이 함께 작동해야 합니다.
로컬 하드웨어의 메모리 및 연산 제약과 성능 간의 균형을 맞추도록 Muse Glimmer를 설계했습니다. 이를 위해 소형 아키텍처, 훨씬 더 큰 교사 모델로부터 에이전트 추론을 전이하는 새로운 증류 방식, 그리고 지연 시간 기대치를 충족하기 위한 양자화를 포함한 추론 최적화가 필요했습니다. 다음 단계로 이를 달성했습니다.
Muse Glimmer는 Meta의 고급 AI 스케일링 프레임워크에 명시된 기준에 따라 평가되었으며, 모든 관련 범주에서 오픈 가중치 공개를 위한 평가를 받았습니다.
효과적인 에이전트를 구축하려면 사용자의 목표를 달성하기 위해 핵심 역량들이 함께 작동해야 합니다. Muse Glimmer는 다음 각 항목 전반에서 학습 및 평가되었습니다.
효과적인 자율 에이전트 행동에 필요한 다양한 역량을 평가하기 위해 광범위한 벤치마크에서 Muse Glimmer를 평가했습니다. Gemma4-31B 및 Qwen3.6-27B와 비교했을 때, Muse Glimmer는 여러 널리 사용되는 LLM 벤치마크에서 동급 규모 대비 강력한 성능을 보입니다.
평가에 관한 자세한 내용은 보고서를 참조하세요.
로컬 에이전트가 진정으로 유용하려면 반응하는 느낌이 들 만큼 빨라야 합니다. 응답하거나 다음 단계를 계획하는 데 수분이 걸리는 에이전트는 실제 업무의 흐름을 끊습니다. 품질을 희생하지 않고 소비자용 하드웨어에서 Muse Glimmer가 실용적인 속도로 실행되도록 두 가지 최적화를 적용했습니다.
완전 정밀도에서 300억 매개변수 모델은 55 GB 이상의 메모리를 필요로 하며, 이는 어떤 소비자용 GPU가 제공하는 용량보다도 훨씬 큽니다. 양자화 기법을 사용해 모델의 가중치를 약 4비트 정밀도로 압축하여 언어 모델의 크기를 20 GB 미만으로 줄였습니다. 이로써 모델의 작업 메모리인 "KV 캐시", 이미지 이해를 위한 지각 인코더, 추측적 디코딩 드래프터가 24 GB 또는 32 GB 범위 안에서 동시에 실행될 수 있는 충분한 여유 공간을 확보합니다. 이 압축이 에이전트 작업에서 성능 저하를 거의 또는 전혀 유발하지 않는다는 것을 검증했습니다.
언어 모델은 일반적으로 한 번에 하나의 토큰씩 텍스트를 생성하므로, 긴 추론 사슬이나 다단계 도구 호출 중에는 느리게 느껴질 수 있습니다. Muse Glimmer에는 DFlash를 기반으로 한 경량 "드래프터" 모델이 포함되어 있습니다. 이는 한 번에 전체 토큰 블록을 제안하는 소형 보조 네트워크입니다. 이후 메인 모델은 이러한 제안을 병렬로 검증하여 올바른 토큰은 수용하고 잘못된 토큰은 수정합니다. 이 기법을 통해 Muse Glimmer는 동일한 출력 품질을 유지하면서 표준적인 토큰 단위 생성보다 훨씬 빠르게 텍스트를 생성할 수 있습니다. 출시 버전에서는 더 적은 메모리 오버헤드를 위해 양자화된 드래프터 버전을 제공합니다.
MacBook M4-Max, M5-Max 및 RTX-5090에서 양자화된 DFlash 드래프터와 함께 K-Quant-17GB 모델의 속도를 측정했습니다. 이 모델은 기기에서 완전히 실행되면서도 자연스러운 대화와 실시간 에이전트 상호작용에 충분히 빠릅니다.
Muse Glimmer는 지금 이용할 수 있으며, Hugging Face에서 가중치를 다운로드할 수 있습니다. 수일 내에 Ollama, LM Studio, Unsloth 같은 파트너를 통해 로컬에서 실행하고, llama.cpp, ExecuTorch, MLX를 포함한 엣지 프레임워크로 배포하며, vLLM 및 SGLang으로 대규모 제공하거나, Together AI, Fireworks AI, OpenRouter 같은 파트너를 통해 빠르게 시작할 수 있습니다. PyTorch의 TorchTitan 학습 기능을 활용해 모델을 추가로 조정하면 활용 사례에 맞게 맞춤화할 수도 있습니다.
AMD, Arm, Dell, Intel, NVIDIA를 포함한 파트너와도 협력하여 여러 기기에서 성능을 최적화하고 있습니다. 또한 개발자가 Muse Glimmer를 책임감 있게 시작하고 구축하는 데 필요한 리소스를 제공하기 위해 문서를 공개합니다. 여기에는 맞춤형 스캐폴드 설정에 관한 안내도 포함되어 있어, 첫날부터 개인 에이전트를 더 쉽게 구축하고 배포할 수 있습니다. Meta의 AI 개발자 센터에서 자세한 내용을 확인하고 구축 리소스를 찾을 수 있습니다.
이 작업은 오픈 AI 연구에서의 Meta의 오랜 기록을 바탕으로 하며, 이를 에이전트 AI로 확장하고 개발자에게 로컬 에이전트 역량을 제공합니다. 언제나처럼 커뮤니티의 피드백을 환영하며, 개발자들이 이 오픈 가중치 모델로 무엇을 만들지 기대하고 있습니다.