대규모 언어 모델 에이전트를 위한 강화 학습의 최근 프레임워크, 인프라, 안정화 기법 및 실용적 설계 원칙을 살펴봅니다.
([3, 4, 6]에서 발췌)
최근 대규모 언어 모델(LLM)에 관한 연구는 추론과 강화 학습(RL)에 크게 집중되어 왔습니다. 이 분야의 초기 연구 상당수는 LLM이 프롬프트에 단일 응답을 생성하는 정적인 과제를 다뤘습니다. 그러나 AI 시스템이 점점 더 에이전트화됨에 따라 이러한 단일 턴 과제의 대표성은 낮아졌습니다. 이제 이들 시스템은 긴 시간 지평에 걸쳐 추론하고, 도구를 호출하며, 사용자와 상호작용하고, 피드백에 즉시 적응할 것으로 기대됩니다. 자율적 기능으로의 이러한 전환은 RL 훈련을 더 복잡하게 만듭니다. 다중 턴 궤적, 확장 가능한 롤아웃 인프라, 모듈형 환경, 다중 턴 과제에서 안정적인 학습을 위한 기법이 필요하기 때문입니다. 이 개요에서는 LLM 에이전트를 위한 RL 훈련의 최근 연구를 살펴보고, 기능적이면서 높은 성능의 에이전틱 RL 시스템을 구축하기 위한 실용적 설계 원칙을 파악하겠습니다.
이 개요의 대부분은 RL로 에이전트를 훈련하는 데 유용한 최근 기법과 프레임워크를 다룹니다. 하지만 이 연구를 이해하려면 먼저 에이전트와 RL 모두에 대한 기초적 이해를 쌓아야 합니다. 에이전트는 단순한 LLM 이상이지만, 그 정의를 지나치게 복잡하게 할 필요는 없습니다. 가장 단순한 수준에서 에이전트란 복잡한 문제를 해결하기 위해 도구와 자체 추론 능력을 모두 사용하는, 에이전틱 루프에서 동작하는 LLM입니다. 이 절에서는 에이전트의 핵심 구성 요소를 상세히 설명하고 에이전틱 RL을 이해하기 위한 구조화된 틀을 제시합니다.
에이전틱 루프
위 그림은 에이전트 시스템의 상위 수준 도식입니다. 보듯이 에이전트는 다음과 같은 여러 구성 요소를 가집니다.
초기 지시사항과 명세가 주어지면, 이 구성 요소들은 에이전틱 루프에서 실행됩니다. LLM 백본은 출력을 생성하고, 도구 호출을 실행하며, 환경의 피드백을 수집한 뒤 이를 반복합니다. 매 단계마다 루프를 계속해야 하는지 또는 문제가 해결되었는지를 판별하기 위해 종료 조건을 확인합니다. 이 구성 요소들은 LLM의 오케스트레이션과 통합 세부 사항을 제어하는 에이전트 하니스를 이룹니다. 이제 각 구성 요소를 자세히 다루겠습니다.
에이전트 시스템의 LLM 백본은 에이전틱 맥락에서 작동하도록 훈련된 표준 LLM입니다. 구체적으로 LLM은 제공된 하니스 안에서 잘 작동할 수 있어야 하며, 이를 위해서는 뛰어난 지시 이행, 도구 호출, 추론 능력이 필요합니다. 어떤 LLM이든 에이전트 백본으로 쓸 수 있지만, 흔히 추론 모델을 사용하면 이점이 있습니다. 아래를 참조하세요.
추론 모델은 최종 출력 전에 사고 흔적을 생성합니다
다단계 과제를 풀기 위해 에이전트는 어려운 문제를 더 작고 단순한 부분으로 분해하고, 최종 해법에 이르기 위해 각 부분을—필요하다면 도구의 도움을 받아—해결할 수 있어야 합니다. 또한 모델은 문제를 푸는 동안 스스로 성찰하고 자기 실수에서 복구할 수 있어야 합니다. 이와 같이 긴 시간 지평의 문제를 다루려면 높은 수준의 추론 능력과 신뢰성이 요구됩니다.
“에이전트는 한꺼번에 너무 많은 일을 하려는 경향이 있었고, 본질적으로 앱을 한 번에 완성하려 했습니다… [이를 해결하기 위해] 우리는 에이전트가 단계별, 기능별로 작업하도록 설정했습니다… [그 후] 각 에이전트가 목표를 향해 점진적으로 진전하면서도 세션 종료 시 환경을 깔끔한 상태로 남기도록 프롬프트했습니다.” - [9]에서 발췌
지시사항은 문제 해결에 필요한 정보와, 문제에 올바르게 접근하도록 돕는 맥락을 에이전트에 제공합니다. 관련 도메인 정보—대개 기존 지침이나 정책 문서에서 가져온 정보—를 에이전트에 제공해야 합니다. 또한 문제를 더 작은 단계로 나누기, 완료한 하위 과제의 할 일 목록 유지하기, 해법에서 특정 스타일 따르기, 심지어 문제 해결 과정의 각 단계를 재확인하기처럼 과제나 문제 해결 전략에 관한 지침을 제공할 수 있습니다. 에이전트 지시사항은 단순성과 구체성의 균형을 이루어야 합니다. 에이전트 행동을 신뢰성 있게 안내할 만큼 상세해야 하지만, 취약하고 유지보수하기 어려울 정도로 상세해서는 안 됩니다.
도구와 환경. 외부 환경과 상호작용하려면 LLM은 API, CLI, 또는 MCP 서버 같은 도구를 사용할 수 있어야 합니다. 예를 들어 에이전트가 지역 식당의 테이블을 예약하게 하려면, 모델에 OpenTable API 호출을 작성하는 방법만 가르치면 됩니다. 특수 도구 호출 토큰 집합을 만들고 LLM에 이 토큰 사용법을 가르침으로써, 도구 호출을 LLM의 토큰 스트림에 직접 표현할 수 있습니다. 아래를 참조하세요.
예를 들어 Qwen3 모델은 XML 스타일 구분자로 도구 호출을 처리합니다.
<tools>와 </tools>는 도구 정의를 감싸는 데 사용됩니다.<tool_call>과 </tool_call>은 호출할 도구와 관련 매개변수를 포함한 특정 도구 호출을 감싸는 데 사용됩니다.<tool_response>와 </tool_response>는 호출된 도구의 결과 또는 응답을 감싸는 데 사용됩니다.에이전트 지시사항에서는 <tools> 태그 사이에 모든 도구의 명세를 제공하여, LLM이 어떤 도구를 사용할 수 있고 어떻게 호출할 수 있는지 이해하게 합니다. LLM이 출력을 생성하는 동안 도구 호출에 알맞은 인수를 포함한 <tool_call> 시퀀스를 출력해 도구를 호출할 수 있습니다. </tool_call> 토큰은 생성 과정을 멈춰 도구 호출이 파싱되고 실행되도록 합니다. 도구 호출의 결과는 <tool_response> 태그에 감싼 환경의 관측 또는 피드백입니다.
도구를 이용한 환경 상호작용
도구는 에이전트의 환경 접근을 매개합니다. 환경은 상태를 가지며, 도구 호출은 환경 상태 변화를 유발할 수 있습니다. 환경 동역학은 대개 도구 호출 로직에 인코딩됩니다. 도구 정의를 통해 임의의 환경 규칙을 만들 수 있으며, 에이전트에 환경 상태 또는 환경에서 반환되는 피드백에 대한 제어권을 제공합니다. 위를 참조하세요.
에이전틱 루프의 각 단계에서 에이전트는 두 핵심 연산을 수행합니다.
도구가 에이전트의 환경 인터페이스라는 점에서, 이 루프의 한 단계는 흔히 환경 상호작용 단계라고 불립니다. 각 단계 후에는 응용 분야에 따라 달라지는 사전 정의된 종료 조건을 확인하여 에이전틱 루프를 끝낼지 결정합니다. 예를 들어 최대 상호작용 단계 수를 정의하거나, 문제가 해결되었는지 판별하는 일련의 테스트를 실행하거나, LLM이 해법이 완료되었음을 나타내는 출력을 제공하게 할 수 있습니다.
([10]에서 발췌)
추가 세부 사항. 에이전트 시스템의 주요 구성 요소를 다뤘지만, 에이전트 하니스는 빠르게 발전하는 연구 분야이며—매일 새로운 아이디어와 구성 요소가 도입됩니다. 중요하지만 위 논의에서 제외된 추가 하니스 구성 요소에는 다음이 포함됩니다.
RL 훈련의 구성 요소
최근 연구는 에이전트 궤적을 사전훈련 또는 중간훈련 과정에 통합하기 시작했습니다. 하지만 에이전트 훈련 문헌의 대부분은 사후훈련, 특히 강화 학습(RL)1에 집중합니다. RL 훈련 중에는 위에 보인 두 핵심 연산을 번갈아 수행합니다.
정책 업데이트의 세부 사항은 사용되는 RL 최적화기에 따라 다릅니다. 일반적인 선택지로 GRPO, PPO, REINFORCE가 있습니다. GRPO가 가장 흔히 사용되지만, 최근 연구는 훈련 안정성을 개선하고 긴 시간 지평 과제(예: 코딩 에이전트)를 더 잘 다루기 위해 PPO를 사용하기 시작했습니다. 예를 들어 GLM-5.2 [12]는 이 이유로 GRPO 대신 PPO를 사용했습니다. 아래를 참조하세요.
“긴 시간 지평 과제는 훨씬 더 긴 실행 흔적을 생성하며, 초장기 궤적이 압축으로 여러 하위 흔적으로 분할되면 동일한 프롬프트의 서로 다른 롤아웃은 길이가 크게 다른 훈련 가능 흔적을 서로 다른 수만큼 산출합니다. 따라서 우리는 그룹 단위 최적화에서 개별 롤아웃으로부터 학습하는 크리틱 기반 PPO 공식화로 옮겨가며, 그룹 상대 비교 대신 크리틱에 의존해 토큰 수준 이점을 추정합니다.” - [12]에서 발췌
에이전틱 롤아웃. RL 최적화기는 달라질 수 있지만, 정책 업데이트의 핵심 입력은 대개 같습니다. 즉, _토큰 수준 로그 확률과 보상_입니다. 또한 RL 훈련의 역학은 에이전트와 표준 LLM에서 유사합니다. 주된 차이는 롤아웃 단계에 있습니다.
에이전틱 롤아웃은 표준 LLM의 롤아웃보다 복잡합니다. 이 롤아웃은 긴 시간 지평에서 작동할 뿐 아니라, 에이전틱 롤아웃의 각 단계도 도구 호출을 통해 환경과 상호작용합니다. 그 결과 _에이전틱 롤아웃의 샘플링은 어려운 인프라 문제_입니다. 많은 상호작용 턴 또는 환경 속도 저하로 인해 일부 롤아웃은 다른 것보다 완료 시간이 길어질 수 있습니다. 따라서 대부분의 에이전트는 아래처럼 공동 배치형이 아닌 분리형 아키텍처의 비동기 RL로 훈련됩니다. 이 주제의 자세한 내용은 RL 훈련 인프라를 다룬 이 개요에서 확인할 수 있습니다.
([11]에서 발췌)
MDP 공식화. 전통적 RL과 에이전틱 RL의 차이를 엄밀하게 포착하기 위해, 단일 턴 LLM과 에이전트 모두에 대한 RL의 마르코프 결정 과정(MDP) 공식화를 유도하겠습니다. 간단히 말해 MDP는 상태, 행동, 전이 동역학, 보상의 시퀀스를 포함하는 의사결정을 위한 확률적 틀입니다—이는 정확히 RL 훈련의 구조입니다.
전통적인 단일 턴 RL 설정은 비교적 단순하게 공식화됩니다. LLM은 다음 토큰 예측으로 롤아웃을 생성하며, 각 출력 토큰을 자기회귀적으로 샘플링합니다. 위를 참조하세요. 이 설정에서 MDP의 구성 요소는 다음처럼 정의됩니다.
생성 중에는 LLM의 다음 토큰 분포에서 토큰을 선택해 행동을 수행합니다—각 토큰 자체가 하나의 행동입니다. 토큰이 선택되면 현재 상태에 추가되고, LLM은 이를 이용해 다음 토큰을 예측합니다. 이 과정은 LLM이 중지 토큰(예: <|end_of_text|> 또는 <eos>)을 예측할 때까지 반복되며, 이 토큰은 생성을 종료하고 완전한 궤적을 산출합니다.
단일 턴 MDP 공식화
위에는 단일 턴 RL의 MDP 공식화가 묘사되어 있습니다. 이 공식화는 하나의 롤아웃을 생성하는 단계를 설명합니다. RL 중에는 정책 업데이트를 계산하기 전에 롤아웃 배치를 생성합니다.
다중 턴(에이전틱) RL 설정은 토큰 수준 MDP 공식화를 에이전트가 외부 환경에 작용하고—그로부터 피드백을 받을 수 있는—상호작용 설정으로 확장합니다. 에이전트는 하나의 텍스트 시퀀스를 생성하는 대신 여러 턴에 걸쳐 행동을 생성합니다. 각 에이전트 행동에는 일반 텍스트뿐 아니라 도구 호출에 해당하는 형식화된 시퀀스도 포함될 수 있습니다. 도구 호출이 생성되면 환경에서 대응하는 관측을 생성합니다. 이 관측은 생성 출력 토큰과 유사하게 누적 상태에 추가됩니다.
에이전틱 RL과 단일 턴 RL의 또 다른 핵심 차이는 상태가 더 이상 LLM의 토큰 맥락만이 아니라는 점입니다. 이제 상태에는 다음 두 가지가 모두 포함됩니다.
따라서 MDP 상태는 LLM이 볼 수 있는 맥락과 환경 상태를 포함하는 결합 상태입니다. 에이전트가 토큰을 생성할 때 전이 함수는 단일 턴 MDP 공식화처럼 이 토큰을 상태에 결정론적으로 추가합니다. 하지만 전이 함수는 환경 상태 업데이트와 환경에서 반환되는 관측도 처리합니다. 따라서 도구 또는 환경의 행동에 따라 전이 함수는—단일 턴 설정과 달리—비결정적일 수 있습니다.
다중 턴 MDP 공식화
위에는 다중 턴 에이전틱 RL의 MDP 공식화가 묘사되어 있습니다. 요약하면, 이 다중 턴 MDP의 구성 요소는 다음과 같이 정의됩니다.
단일 턴 공식화와 마찬가지로, 각 RL 훈련 반복에서 궤적 배치를 생성합니다. 각 궤적은 여러 번의 에이전트 행동 및 환경 상호작용을 포함할 수 있고, 이 궤적들은 정책 업데이트 계산에 사용됩니다. 최근 RL 연구는 결과 기반 보상을 많이 활용하지만, 에이전틱 RL은 더 긴 궤적에 걸쳐 세분화된 감독을 제공하기 위해 결과 보상과 중간 과정 보상을 모두 자주 사용합니다.
환경 실행과 확장. 각 에이전틱 롤아웃에는 에이전트가 상호작용할 격리된 환경 인스턴스가 필요합니다. 환경은 에이전트가 도구(예: 셸, 브라우저, API 등)를 통해 접근하고 수정하는 자체 상태(예: 파일 시스템, 코드베이스, 데이터베이스 등)를 포함할 수 있습니다. 에이전트의 행동은 상태를 수정할 수 있으므로 격리가 중요합니다—에이전트는 파일을 편집하거나 데이터베이스 항목을 변경할 수 있습니다. RL 훈련에서는 대개 과제당 여러 롤아웃을 생성합니다(예: GRPO의 그룹). 격리가 없으면 이 롤아웃들이 같은 환경의 공유 상태를 수정할 수 있으며, 한 롤아웃의 오류가 다른 롤아웃을 방해할 수 있습니다. 롤아웃마다 별도의 격리 환경 인스턴스를 만들면 이런 문제를 피할 수 있습니다—에이전트는 항상 전용 환경을 갖습니다.
코딩 에이전트를 위한 환경과 도구([13]에서 발췌)
이 격리는 흔히 Docker 컨테이너 또는 유사한 샌드박싱 메커니즘으로 처리됩니다—궤적 간 간섭을 막기 위해 각 롤아웃은 깨끗한 환경 인스턴스를 받습니다. 환경 확장은 시스템 과제입니다. RL 훈련은 업데이트당 각각 격리된 환경을 가진 수천 개의 동시 롤아웃을 요구할 수 있습니다. 환경 시작, 실행 또는 종료의 모든 지연은 롤아웃 생성과 RL 훈련 과정의 병목이 됩니다.
“우리가 마주한 과제는 SWE-Bench 환경의 확장이었습니다… 각 RL 반복은 512개의 Docker 컨테이너를 병렬로 생성했고… Docker의 API 서버에 과부하를 주어 결국 Docker 데몬을 충돌시켰습니다… 그 병목을 제거하기 위해 우리는 Kubernetes 지원을 R2E-Gym 에 통합하여, 오케스트레이터가 노드 풀 전반에 컨테이너를 스케줄하도록 했습니다.” - [13]에서 발췌
단순한 구현은 각 롤아웃 워커 노드에서 로컬 Docker 데몬으로 컨테이너를 실행할 수 있지만, 많은 워커가 동시에 컨테이너를 생성하고 파괴하면 병목이 될 수 있습니다. 더 큰 규모의 시스템은 흔히 클러스터 오케스트레이션 계층(예: Kubernetes)을 사용하여 자원 풀 전반에 환경 인스턴스를 스케줄하고, 환경 수명 주기를 관리하며, 단일 장애 지점을 피합니다. RL 환경의 실용적 예시와 대규모 관리 방법은 아래 Prime Intellect의 글을 참조하세요.
이제 에이전트와 RL로 훈련하는 방법에 대한 기본 이해를 갖추었으므로, 실용적 관점에서 에이전틱 RL을 연구한 최근 논문들을 살펴보겠습니다. 이 논문들은 다음과 같은 에이전트 훈련의 모든 측면을 다룹니다.
이 연구로부터 더 유능한 에이전트를 훈련하는 데 반복적으로 사용되는 공통 패턴과 실용적 기법을 파악하겠습니다. 앞으로 보겠지만, 훈련 과정의 많은 부분은 모듈화할 수 있으므로 새로운 환경, 보상 설계, 롤아웃 전략, RL 최적화기를 더 쉽게 실험할 수 있습니다.
([2]에서 발췌)
LLM은 정밀한 수치 계산이나 복잡한 방정식 풀이에 어려움을 겪는 경향이 있지만, 이런 과제는 외부 도구에 쉽게 위임할 수 있습니다. 예를 들어 LLM에 외부 코드 인터프리터를 사용하여 코드를 생성하고 실행하는 방법을 가르치면 정교한 수학적·기호적 추론 능력을 갖출 수 있습니다. 이 개념은 흔히 도구 통합 추론(TIR)이라고 불리며, 이 방식으로 추론하도록 가르친 LLM 에이전트는 매우 강력한 것으로 나타났습니다[2]. 위 그림처럼 TIR은 문제 해결 과정에서 텍스트 기반 추론과 코드 기반 추론을 교차 배치합니다.
“이러한 진전에도 기존 도구 통합 추론 접근법은 중대한 한계에 직면합니다. 대부분의 연구는 더 강력한 모델의 궤적을 증류하여 SFT를 수행하므로, 모델을 미리 정해진 도구 사용 패턴에 제한하고 최적 전략 탐색을 제약합니다.” - [1]에서 발췌
에이전트는 흔히 지도 학습으로 도구 통합 추론을 수행하도록 가르쳐집니다(예: 강력한 교사 LLM이 생성한 궤적으로 훈련). [1]의 저자들은 제안한 도구 통합 강화 학습(ToRL) 접근법을 사용해 RL로 도구 통합 추론 에이전트를 훈련함으로써 이 접근법을 확장합니다. 이 훈련 프레임워크는—표준 결과 보상 기반 RL 설정을 사용한다는 점에서—비교적 단순하지만, [1]의 분석은 도구 통합 추론 에이전트를 위한 안정적이고 효과적인 RL 훈련을 달성하는 실용적 통찰을 제공합니다.
ToRL 프레임워크는 RL-Zero 설정을 사용합니다. 즉 아직 사후훈련을 거치지 않은 사전훈련 기본 모델에서 직접 RL 훈련을 시작합니다. 도구 통합 추론을 가능하게 하려면 RL 훈련 환경에 코드 인터프리터를 도구로 추가하고, 모델은 보상 기반 탐색을 통해 도구 활용을 배웁니다. 중요한 점은 LLM에 자연어와 코드 기반 추론을 융합해 질문에 답하도록 장려하는 프롬프트가 주어진다는 것입니다. 아래를 참조하세요. 이 프롬프트는 TIR 스타일의 해법을 장려하여 모델의 탐색 공간을 좁히는 유용한 시드가 됩니다. 이후 모델이 보상을 최대화하도록 업데이트되면서 이 행동은 RL 훈련에서 정제됩니다.
([1]에서 발췌)
모델이 텍스트를 생성하면서 python``<code here> 표지로 감싼 코드 블록을 교차 배치합니다. 코드 블록이 생성된 뒤 모델은 ````output` 태그를 생성합니다. 이 태그가 생성되면 다음을 수행합니다.
이 교차 배치 코드 구조의 예시는 아래 그림에 나와 있습니다.
([1]에서 발췌)
모델은 문제 해결 과정에 여러 코드 블록을 교차 배치할 수 있습니다. 하지만 각 코드 블록의 실행은 추론 과정을 중단시키는 비용이 들며, 따라서 RL 훈련 중 롤아웃 생성을 늦출 수 있습니다. 에이전트가 과도하게 코드 블록을 사용하여 훈련 효율이 저하되는 일을 막기 위해 모델에 문제당 최대 C번의 도구 호출을 부과합니다. [1]의 대부분 실험은 C``=``1로 설정합니다. C``=``2로 설정하면 중간 정도의 성능 향상이 나타나지만, 효율성에 큰 비용이 듭니다.
“코드 실행이 실패하면 의도적으로 오류 메시지를 LLM에 반환합니다… 이러한 오류 진단은 이후 반복에서 문법적·의미적으로 올바른 코드를 생성하는 모델의 역량을 높입니다.” - [1]에서 발췌
코드 실행 중 발생하는 모든 오류는 관측으로 LLM에 반환됩니다. 하지만 [1]의 저자들은 장황한 역추적으로 LLM 맥락이 과부하되지 않도록 오류 메시지에서 마지막 줄만 포함하도록 자릅니다. 코드 출력은 RL 손실 함수에서도 마스킹되며, 생성되지 않은 텍스트는 외부 맥락으로 취급되고 모델은 이 결과를 예측하도록 훈련되지 않습니다. 모든 코드는 주 훈련 과정과 분리된 샌드박스 환경3에서 실행됩니다. 샌드박스 환경을 만드는 것은 실행 지연을 추가하지만, 코드 문제(예: 세그멘테이션 오류)가 실제 RL 훈련 과정을 손상시키지 않도록 격리가 필요합니다.
[1]에서 도구 통합 추론 에이전트 훈련에 사용한 보상 메커니즘은 비교적 단순합니다. 보상 함수는 다음을 부여합니다.
+1).-1).-0.5).[1]에서 에이전트가 실행 불가능한 코드를 생성했을 때 처벌하는 것은 성능에 이롭지 않음을 알 수 있습니다. 아래를 참조하세요. 프롬프트에 대한 모델 출력을 정답과 비교해 계산한 순수 결과 보상을 사용하면 추가 오류 패널티를 사용한 경우와 같거나 더 좋은 결과를 냅니다. [1]의 저자들은 이 패널티가 모델이 코드를 생성할 때 지나치게 보수적으로 되도록 유도해 전체 성능 하락을 초래할 수 있다고 가정합니다.
코드 오류 패널티 유무에 따른 결과([1]에서 발췌)
실용적 발견. [1]의 실험은 공개 벤치마크(예: MATH 및 Numina-MATH)에서 선별한 약 29K개의 수학 경시대회 문제 집합에 대해 GRPO로 수행됩니다. 검증이 어려운 문제(예: 증명형 문제)는 데이터에서 제거하고, 최종 훈련 예제 집합은 LIMR 기법을 이용해 선택합니다. 아래를 참조하세요. 상위 수준에서 LIMR은 훈련 에포크 전반에 각 훈련 샘플의 보상을 추적하고, 학습 궤적과의 정렬에 기반해 문제에 점수를 매깁니다. 모델의 학습 과정과 부합하는 예제는 높은 점수를 받아 선택됩니다. 어려운 데이터나 무작위 데이터를 선택하는 대신, LIMR은 모델이 적절한 시점에 학습할 수 있는 문제를 우선시합니다.
ToRL 훈련은 수학적 추론 능력을 크게 개선하는 것으로 나타났습니다. 예를 들어 Qwen2.5-Math-7B 모델에서는 SFT 훈련 기준선 대비 정확도가 절대값으로 14.7% 향상되었습니다. 아래를 참조하세요.
([1]에서 발췌)
ToRL의 성능 이점 외에, [1]에서는 에이전트 행동에서 다음과 같은 흥미로운 추세가 관찰됩니다.
이 발견은 의미 있는 도구 활용 전략이 RL을 통해 학습될 수 있음을 보여줍니다. 저자들은 ToRL로 훈련된 모델에서 관찰되는 정교한 에이전트 행동의 구체적 사례도 제공합니다. 예를 들어 에이전트는 오류 메시지의 정보를 이용해 자체 코드를 성찰하고 수정하거나, 코드와 자연어를 혼합해 생성된 해법을 검증하는 것으로 나타났습니다.
([3]에서 발췌)
LLM이 대화형 에이전트에서 추론하고 행동하는 자율 시스템으로 진화함에 따라, 이 에이전트를 훈련하는 인프라도 함께 진화해야 합니다. [3]에서 저자들은 복잡한 다수의 대화 턴에 걸친 상호작용을 요구하는 의사결정 과제를 더 잘 다루기 위해 RL로 LLM 에이전트를 훈련하는 오픈소스 프레임워크를 제안합니다. 위를 참조하세요. [3]에서 제안된 프레임워크는—에이전틱 RL 훈련 연구 대부분과 유사하게—LLM 에이전트를 결과 보상으로 훈련하지만, 에이전트 실험을 단순화하는 모듈형 확장 가능 설계를 따릅니다. 특히 에이전트는 [3]에서 순수하게 결과 기반 RL로 훈련되며, 대개 기존 지시 모델 체크포인트(예: Qwen2.5-3B-Instruct)에서 시작합니다.
AgentGym-RL 프레임워크는 이전 AgentGym 프레임워크를 일반화해 확장한 것으로, 더 높은 효율성과 다양한 현실적 과제 훈련을 위한 더 모듈형 지원을 제공합니다. 프레임워크에는 세 핵심 구성 요소가 있습니다.
[3]의 환경은 다양한 도메인(예: 웹 탐색, 체화 과제, 과학 실험)에 걸쳐 있지만 표준 설계를 따릅니다. 즉 환경은 공유 API 집합을 구현하는 독립 서비스입니다. 아래를 참조하세요.
([3]에서 발췌)
이 표준화된 구조는 RL 훈련 중 다수의 환경을 독립적으로 병렬 실행할 수 있게 합니다. 구체적으로 [3]의 각 환경은 통합 HTTP 인터페이스를 노출하는 독립 서비스로 작동하여, 매우 다른 환경들도 RL 훈련 과정에 매끄럽게 “플러그인”될 수 있습니다.
에이전트 업데이트. 훈련 업데이트를 수행할 때 사용자 질의 배치와 각 질의에 대한 초기 환경 상태 집합이 있습니다. 환경은 병렬 초기화되고, 과제 간 간섭을 피하기 위해 각 에이전트는 자체 환경 인스턴스와 상호작용합니다. 보통 이 에이전트들은 각 분리 환경에서 실행되는 현재 정책의 복제본입니다. 에이전틱 루프 안에서 각 에이전트는 환경과 여러 순차 상호작용 턴을 거치며, 매 턴에 다음 연산이 수행됩니다.
response``=``actor.generate(prompt): 현재 상태와 상호작용 이력이 주어졌을 때 에이전트에서 응답을 샘플링합니다.state,``reward``=``env.step(response): 이 응답을 환경 클라이언트로 보내 환경을 업데이트하고, 환경 관측을 제공하며, 보상을 산출합니다.add_assistant_message(response): 에이전트에서 새로 샘플링한 응답을 포함하도록 궤적을 업데이트합니다.add_user_message(state): 에이전트의 최신 행동 이후 환경의 새 상태를 포함하도록 궤적을 업데이트합니다.마지막으로 프레임워크는 각 상호작용 턴에 생성된 모든 점수 또는 보상을 기록합니다. 에이전틱 루프는 에이전트가 과제를 해결하거나 고정된 상호작용 턴 예산에 도달하면 종료됩니다. 완성된 각 롤아웃은 에이전트의 행동, 관측, 보상을 모두 포함하는 전체 궤적을 만듭니다. 프레임워크는 환경 전반에서 여러 에이전트를 동시에 실행해 궤적 배치를 수집하고, 이를 훈련 파이프라인에 전달해 에이전트 행동을 업데이트합니다. 이 과정은 훈련 내내 반복됩니다.
엔지니어링 최적화. [3]에서 사용하는 에이전트-환경 상호작용의 통합 인터페이스 외에도, AgentGym-RL에는 장기 실행 과제를 이용한 RL 실험을 더 효율적으로 만드는 여러 환경별 엔지니어링 최적화가 포함됩니다. 예를 들어 verl 라이브러리는 단일 턴 사용 사례를 넘어 다중 턴 에이전틱 RL을 더 잘 지원하도록 확장됩니다. AgentGym-RL에 사용되는 RolloutHandler는 모든 궤적 세부 사항, 즉 각 롤아웃의 전체 상호작용 이력과 보상을 추적하며, 궤적 전반에서 에이전트와 환경 생성 토큰을 구별하는 데 도움이 되는 어텐션 및 손실 마스크를 구성합니다.
“프레임워크는 병렬성과 상호작용 지속 시간 모두에서 확장할 수 있어야 합니다. 이를 달성하기 위해 일련의 최적화를 구현했습니다… WebArena의 기본 프로세스당 단일 브라우저 설계를 하위 프로세스 기반 아키텍처로 교체하여 단일 서버가 여러 Chromium 인스턴스를 동시에 관리하게 했습니다… SciWorld 환경에서는 다수 인스턴스의 견고한 병렬 생성 및 재설정을 지원하도록 환경 초기화와 재설정 루틴을 재설계했습니다… WebArena의 전체 재설정 인터페이스를 통해 더 긴 훈련 지평을 지원하며, 이는 매 에피소드 후 각 웹 서버를 초기 상태로 복원하고 시간이 지나며 발생하는 상태 불일치를 완화합니다.” - [3]에서 발췌
환경은 많은 동시 롤아웃을 수집하도록 병렬 초기화를 지원하고 독립적으로 작동하도록 구성됩니다. 예를 들어 WebArena 환경은 처음에 프로세스당 단일 브라우저 설계를 사용했지만, [3]에서는 단일 서버가 여러 동시 브라우저 인스턴스를 관리하게 하는 하위 프로세스 기반 아키텍처로 교체했습니다. SciWorld 환경도 각 롤아웃의 시작과 끝에서 여러 환경 인스턴스를 실행하고 재설정하는 작업을 단순화하도록 수정됩니다. [3]에서는 에이전틱 RL을 위한 환경을 더 효율적으로 관리하고 확장하기 위해 이와 같은 여러 수정이 이루어집니다.
ScalingInter-RL. [3]에서 긴 시간 지평 과제를 수행하도록 LLM 에이전트를 훈련하는 일은 어렵다는 것을 확인합니다. 훈련 초기 단계에서 에이전트는 의미 있는 긴 상호작용을 만들기 어려워하고, 흔히 중복된 추론 패턴으로 붕괴하거나 불필요한 행동을 취합니다. 에이전트를 훈련하는 환경 집합을 제약하면 이 문제를 해결할 수 있습니다—더 짧은 지평의 과제만 고려하면 훈련이 안정적일 수 있습니다. 그러나 이런 접근법은 에이전트가 다양하고 자명하지 않은 추론 패턴을 학습하지 못하게 합니다.
([3]에서 발췌)
해법으로 [3]의 저자들은 에이전트 훈련 과정 전반에 걸쳐 과제 지평을 단조롭게 늘리는 ScalingInter-RL이라는 교육과정 학습 전략을 제안합니다. 위를 참조하세요. 먼저 단순한 과제의 숙련도를 개발하여 에이전트에 기초 기술을 확립하는 초기 탐색 단계에서 시작합니다. 시간이 흐르며 에이전트가 수행할 수 있는 상호작용 양을 점진적으로 늘려 긴 지평 계획을 서서히 도입합니다. 이 접근법은 에이전트가 더 긴 지평의 의사결정을 시도하기 전에 기본 기술을 확립하게 함으로써 훈련 과정을 안정화합니다.
“지평이 증가함에 따라 에이전트는 더 긴 의사결정 경로를 탐색하도록 유도되며, 계획, 성찰, 전략적 되돌아가기 같은 고차 인지 행동의 출현을 촉진합니다… 이 단계적 확장은 상호작용 깊이를 에이전트 정책 역량의 진화에 맞추어 효율적인 초기 단계 활용과 긴 지평 일반화 사이를 연결하게 합니다.” - [3]에서 발췌
구체적으로 이 교육과정은 RL 훈련 과정을 N개 단계로 나누어 달성합니다. 총 T번의 훈련 업데이트를 수행한다고 가정하면, 각 단계는 ∆``= T``/``N단계를 포함하고 단조 증가하는 상호작용 예산 h_1``<``h_2``<``…``<``h_N을 부여받습니다. 이 상호작용 예산은 ∆ 반복마다 증가하며, 상호작용은 에이전트가 환경과 수행하는 상호작용 턴 수로 정의됩니다. 구체적으로 [3]에서는 에이전트를 N``=``3단계, ∆``=``80 훈련 반복으로 훈련하며, 상호작용 턴 예산은 8, 12, 15입니다.
ScalingInter-RL은 표준 RL 훈련 목적을 사용합니다. 즉 에이전트가 받는 기대 누적 보상을 최대화하고자 합니다. 그러나 이 목적은 환경 상호작용 턴 수에 대해 점진적으로 증가하는 제약 아래 최적화됩니다. 이 제약을 구현하기 위해 프레임워크는 최대 상호작용 턴 수에 도달하면 상호작용을 종료하고 에이전트에게 최종 답변을 제공하도록 프롬프트합니다.
([3]에서 발췌)
RL로 에이전트 훈련하기. [3]에서 RL 훈련은 최대 7B 매개변수의 더 작은 오픈소스 모델조차 다양한 환경에서 크고 폐쇄적인 모델에 필적하게 수행하도록 만든다는 점을 확인합니다. 다시 말해 RL 훈련은 더 작은 모델에 에이전틱 지능을 주입하는 데 효과적입니다. 예를 들어 [3]의 최고 모델은 웹 검색 및 심층 연구 과제에서 각각 26%와 38.25%의 성공률을 달성하여 GPT-4o와, 심지어 매개변수 수가 10배인 오픈소스 LLM(예: Llama-3.1-70B)의 성능도 뛰어넘습니다.
“훈련 초기 단계에서 과도한 탐색은 반드시 좋은 선택이 아닙니다. 견고한 토대를 구축하기 전에 에이전트는 비생산적이고 비효율적인 탐색을 수행할 수 있어 훈련 불안정성의 위험을 낳습니다. 반대로 더 짧은 라운드는 초기 탐색을 제한하지만 더 안정적인 학습 신호를 제공하여 더 신뢰할 수 있는 장기 성능으로 이어집니다.” - [3]에서 발췌
도메인 전반의 성능을 더 세밀하게 평가하면, RL은 명확한 환경 규칙을 지닌 구조화된 과제에서 가장 유익하며—복잡도가 높은 개방형 환경은 그만큼 큰 이점을 얻지 못합니다. 예를 들어 RL 훈련은 텍스트 기반 게임 환경인 TextCraft, 과학 실험을 위한 텍스트 기반 시뮬레이터인 SciWorld 같은 도메인에서 가장 큰 성능 이점을 제공합니다. 이 두 과제는 명확한 규칙 기반 동역학을 따르는 단순한 모의 환경을 갖습니다. RL 훈련은 모든 도메인에서 여전히 유익하지만, 더 현실적이고 잡음이 많은 웹 기반 환경을 토대로 한 WebArena에서는 성능 이점이 덜 뚜렷합니다.
ScalingInter-RL 방법은 고정 지평 접근법과 비교해 훈련을 더 일관되게 안정화하는 것으로도 나타납니다. 아래처럼 큰 상호작용 예산, 즉 10턴은 처음에는 성능을 개선하는 경향이 있지만 RL 훈련 과정이 빠르게 붕괴합니다. 대조적으로 초기 훈련 단계에서 상호작용 예산을 제한하면 명확하고 안정적인 학습 신호가 제공됩니다. 시간이 지나며 상호작용 예산을 점진적으로 늘리면, 모델이 단순한 과제에서 숙달한 추론 패턴을 재활용해 더 어려운 문제를 풀 수 있습니다. 그 결과 RL 최적화 과정의 안정성과 효율성을 유지하면서도 에이전트 역량을 의미 있게 개선할 수 있습니다.
([3]에서 발췌)
흥미롭게도 [3]에서는 RL 훈련 에이전트가 자연스럽게 강력한 테스트 시점 확장 능력을 갖는 것으로 나타납니다. 다음을 늘릴 때 뚜렷한 성능 이점을 확인합니다.
실제로 RL로 훈련한 에이전트는 이 영역에서 기준선 모델보다 뛰어난 것으로 나타났으며, 이는 RL 훈련 에이전트가 더 강한 테스트 시점 확장 행동을 보인다는 뜻입니다. [3]에서는 다양한 RL 최적화기도 시험합니다. RL 최적화기의 선택은 성능에 의미 있는 영향을 줄 수 있습니다. 예를 들어 GRPO로 훈련한 3B 매개변수 모델이 실제로 REINFORCE로 훈련한 더 큰 7B 모델을 능가합니다.
([4]에서 발췌)
에이전트로 행동할 때 LLM은 정적인 추론이나 질의응답 이상을 수행해야 합니다. 에이전트는 긴 시간 지평에 걸쳐 자율적으로 의사결정하고 행동하며, 환경 상태 변화에 빠르게 적응할 것으로 기대됩니다—에이전트는 어려운 문제를 풀기 위해 신뢰성 있게 통과해야 하는 동적이고 상호작용적인 세계에 존재합니다. 에이전트가 풀어야 하는 과제의 동적 특성 때문에 RL 훈련 접근법에는 특별한 고려가 필요합니다.
“에이전트는 순차적으로 의사결정하고, 턴 간 메모리를 유지하며, 확률적 환경 피드백에 적응하므로, 더 정적인 과제와 구별되는 고유한 어려움을 제시합니다. 이는 RL 적용 시 특정 난점으로 이어집니다. 특히 다중 턴 상호작용 시나리오에서 에이전트 훈련은 불안정성, 복잡한 보상 신호 설계, 제한된 일반화에 직면할 수 있습니다.” - [4]에서 발췌
단일 턴 RL에서 롤아웃은 평평한 토큰 시퀀스로 표현할 수 있지만, 에이전틱 RL은 더 복잡합니다. 모델은 맥락을 관측하고, 행동을 취하고, 피드백을 받는 여러 턴을 거칩니다. RL 훈련 프레임워크는 종료 시점까지 다중 턴 궤적 전반에서 에이전트가 얻은 관측, 행동, 피드백, 보상의 인과 구조를 보존해야 합니다. 또한 다음과 같이 일반적으로 서로 다른 시간 세분성을 갖는 여러 관련 구성 요소를 효율적으로 오케스트레이션해야 합니다.
Agent-R1은 이 구성 요소를 표준화된 방식으로 통합하는 프레임워크를 제공합니다. 특히 설계의 상당 부분은 다중 턴 RL에 가장 적합한 방식으로 롤아웃 및 훈련 단계를 올바르게 통합하는 데 집중합니다. 프레임워크는 다양한 환경 설정을 지원하고, 종단 보상과 과정 보상 모두를 갖는 임의의 RL 최적화 알고리즘과 통합될 수 있습니다.
([4]에서 발췌)
단계 수준 궤적. Agent-R1의 핵심 설계 선택은 각 토큰이 아니라 _각 에이전트-환경 상호작용 단계_를 에이전트 궤적의 주 단위로 취급하는 것입니다. 이는 RL 훈련 중 생성되는 각 궤적이 구조화된 단계 수준 흔적의 시리즈로 표현된다는 뜻입니다. 각 단계에 대해 다음을 저장합니다.
이 구조는 명시적 단계 경계를 유지하여 프레임워크가 종단 보상뿐 아니라 에이전트 궤적의 특정 단계에 국소화된 과정 보상도 포착하게 합니다. 구체적으로 각 단계에 보상을 저장하고, 궤적의 마지막 단계를 식별하는 종료 신호도 저장합니다—양의 종료 신호를 지닌 단계의 보상이 결과 보상입니다.
궤적은 보통 i) 평평한 토큰 시퀀스 또는 ii) 메시지 흔적, 즉 역할과 내용이 연관된 채팅 스타일 메시지 목록으로 표현됩니다. 하지만 이 두 표현은 에이전틱 RL에 사용될 때 한계가 있습니다.
“[에이전틱 RL에서] 하나의 계속 늘어나는 토큰 시퀀스로 궤적을 보는 일반적인 관점은 점점 부적절해집니다. 맥락 진화를 경직되게 하고 롤아웃과 훈련 간 표현 불일치를 만들기 때문입니다.” - [4]에서 발췌
메시지 형식을 사용할 경우 궤적을 메시지 목록으로 저장한 뒤, 정책 업데이트 수행 시 이를 텍스트 프롬프트로 나중에 재구성합니다(예: 프롬프트 템플릿 사용). 이 접근법은 롤아웃은 토큰 공간에서 발생하지만, 이 토큰들이 텍스트 메시지로 파싱된 뒤 다시 토큰화되기 때문에 [4]에서 재토큰화 드리프트라고 부르는 불일치를 초래할 수 있습니다. 토큰화는 되돌릴 수 없으므로 이 파이프라인은 생성된 궤적과 실제 훈련에 사용되는 데이터 간 불일치를 유발할 수 있습니다. 아래를 참조하세요.
([4]에서 발췌)
Agent-R1의 롤아웃은 원래 행동 토큰과 명시적인 상호작용 경계를 보존하는 구조화된 단계 수준 레코드로 저장됩니다. 위를 참조하세요. 이 형식은 각 단계의 생성 토큰을 명시적으로 저장하고 훈련 중 이 토큰을 직접 사용하여 재토큰화 드리프트의 위험을 크게 줄입니다.
반면 궤적을 평평한 시퀀스로 표현하는 방식은 단순하고 정확한 토큰을 보존하지만, 단계 경계를 암묵적으로 남기며 맥락 관리를 위한 추가 전용 전략을 가정합니다. 단계 수준 궤적 표현은 아래처럼 유연한 맥락 관리 전략을 가능하게 합니다. 이러한 단계 수준 흔적에서 맥락을 어떻게 구성할지 선택할 수 있습니다.
([4]에서 발췌)
에이전트 구현은 새 정보를 에이전트 맥락에 직접 추가하는 단순한 추가 전용 전략을 여전히 채택할 수 있습니다. 하지만 이 접근법은 장황한 도구 출력이나 무관한 추론 단계가 있는 시나리오에서 문제가 됩니다—너무 많은 정보로 에이전트 맥락을 과부하하면 맥락 부패가 발생할 수 있습니다.
이 문제를 피하기 위해 Agent-R1은 임의의 메모리 관리 전략을 RL 훈련에 통합할 수 있는 환경별 맥락 규칙을 정의합니다. 에이전트가 볼 수 있는 맥락은 원시 단계 수준 흔적을 이 규칙에 통과시켜 구성됩니다. 이 규칙 안에서 궤적의 어떤 단계든 보존, 요약, 제거, 변환하도록 선택할 수 있습니다. 이렇게 Agent-R1은 각 롤아웃의 전체 구조화 궤적을 저장하지만, 모델이 항상 이 전체 궤적을 보지는 않습니다. 대신 환경별 맥락 규칙이 에이전트의 다음 관측이 되는, 변환될 수 있는 맥락을 결정합니다.
환경 구조4. [4]에서 도입한 RL 프레임워크의 목표는 기존 단일 턴 RL 프레임워크를 다중 턴 및 상호작용 과제를 지원하도록 확장하는 것입니다. 이 두 패러다임의 가장 중요한 차이는 롤아웃 단계에 있습니다. 단일 턴 롤아웃은 정책이 한 번 응답을 생성해야 하지만, 다중 턴 롤아웃은 각 단계에서 발생할 수 있는 도구 호출을 포함한 여러 환경 상호작용 턴을 가집니다. 이 단계들은 에이전트가 생성하는 도구 호출에 따라 LLM 에이전트의 출력 생성과 환경 상호작용을 모두 포함합니다. Agent-R1에서 환경과의 모든 외부 상호작용은 두 기본 인터페이스로 표준화됩니다.
Tool은 LLM 에이전트가 환경과 상호작용하기 위해 취할 수 있는 원자적 행동을 설명하는 통합 인터페이스 역할을 합니다. 에이전트가 환경에서 취할 수 있는 모든 행동은 명확하게 정의되고 에이전트가 호출할 수 있는 구체적인 도구 집합으로 캡슐화됩니다. [4]에서 사용된 특정 도구 형식은 OpenAI 함수 호출 스키마를 기반으로 합니다. 각 도구에는 두 모듈이 있습니다.
에이전트가 각 도구와 효과적으로 상호작용하려면 메타데이터 명세가 명확하고 포괄적이어야 하며, 에이전트가 각 도구의 목적을 이해하고 필요할 때 올바르게 호출할 수 있어야 합니다. LLM 에이전트가 도구를 호출하면, 도구는 요청받은 연산을 수행하고 원시 결과를 반환합니다.
ToolEnv는 에이전트와 환경 간 상호작용을 오케스트레이션합니다. ToolEnv의 연산은 에이전트-환경 상호작용을 주도하는 step() 함수로 표준화됩니다. 이 함수는 에이전트의 원시 출력을 수집하고, 도구 호출을 식별·실행하며, 환경 상태를 업데이트하고, 현재 보상이 있으면 계산한 후, 관측을 에이전트에 반환합니다. 단계 역학은 도메인에 따라 다르지만, 모든 과제에서 특정 보조 메서드를 구현해야 합니다.
ToolEnv는 상태 전이를 관리하고, 에이전트를 위한 상태 정보를 패키징하며, 보상 신호를 계산하고, 다중 턴 궤적 또는 롤아웃 생성의 전체 과정을 오케스트레이션합니다. ToolEnv는 에이전트 출력을 다음 상태에 통합하는 생성적 전이뿐 아니라 외부 환경이나 상태를 수정할 수 있는 도구 호출로 촉발된 모든 전이를 처리할 수 있습니다.
“단계 메서드가 환경 동역학을 주도하는 중추적 역할을 중심으로 하고 도구 호출과 궤적 수명 주기 관리를 위한 명확한 메커니즘이 뒷받침하는 이 설계는, Agent-R1 프레임워크가 복잡한 상호작용 시나리오를 효과적으로 시뮬레이션하게 합니다. 이는 결정론적 텍스트 생성과, 에이전트 학습에 핵심적인 도구 사용으로 도입되는 비결정적이고 환경을 바꾸는 상태 변화를 신중하게 구분합니다.” - [4]에서 발췌
Agent-R1 프레임워크의 다중 턴 롤아웃 과정은 아래에 묘사되어 있습니다. 보듯이 각 롤아웃은 에이전트가 루프에서 실행됨에 따라 여러 단계에 걸쳐 두 핵심 인터페이스를 결합합니다. 각 단계에서 출력이 생성되면 ToolEnv는 도구 호출을 파싱하고 이에 대응하는 Tool 인터페이스를 통해 실행합니다. 각 단계 후 관련 맥락(예: 도구 출력 또는 생성 토큰)은 ToolEnv가 처리하여 다음 생성 단계 전에 에이전트 맥락에 추가합니다. 중간 단계에서 보상을 계산할 수 있고, 종료 조건에 도달하면 최종 보상을 계산하여 롤아웃을 끝냅니다. 각 롤아웃에는 에이전트의 상태, 행동, 보상에 관한 단계 수준 이력이 포함됩니다.
([4]에서 발췌)
에이전트와 환경 간 동적 상호작용을 다루는 모듈형 구조를 정의했으므로, 에이전트 행동을 최적화할 학습 전략을 개발할 수 있습니다. 에이전틱 RL의 고유한 특성에도 불구하고 Agent-R1은 특정 RL 알고리즘을 규정하지 않습니다. 대신 프레임워크는 다중 턴 궤적이 어떻게 표현되고 최적화 계층으로 전달되는지를 표준화하여, 다양한 RL 최적화기(예: PPO, GRPO, REINFORCE)가 동일한 상호작용 데이터에 작동하도록 합니다. 어떤 최적화기를 사용하든 두 구현 세부 사항은 특히 중요합니다.
[4]에서 LLM이 생성한 토큰을 식별하는 데 사용하는 마스크는 Action Mask라고 합니다. 이 이진 마스크는 에이전트 생성 토큰에는 1이고 그렇지 않은 경우 0입니다. 토큰 수준 손실에 이 마스크를 곱하므로, 에이전트 생성 토큰만 정책 경사에 기여하며 생성되지 않은 콘텐츠와 프롬프트는 외부 맥락으로 처리됩니다. Agent-R1은 궤적을 구조화된 상호작용 단계로 저장하기 때문에 각 행동을 대응하는 피드백과 보상에 연결할 수 있고, 그 행동의 개별 토큰도 식별할 수 있습니다.
([4]에서 발췌)
이 구조는 유연한 공로 할당도 지원합니다. 더 구체적으로 각 토큰에 별도 보상을 계산하거나, 특정 상호작용 단계의 모든 토큰에 같은 보상을 브로드캐스트할 수 있습니다. 중간 과정 보상은 획득된 단계에 직접 연결할 수 있고, 결과 보상은 전체 궤적에 걸쳐 공로를 제공할 수 있습니다. Agent-R1은 다중 턴 궤적의 표현과 RL 최적화기 선택을 분리하여, 서로 다른 최적화 전략을 위한 공통 형식을 제공합니다.
실증적 검증. Agent-R1 프레임워크는 Qwen3-4B 모델을 GSM8K, HotpotQA, ALFWorld, WebShop의 네 가지 서로 다른 환경에서 훈련하는 데 사용됩니다. RL 훈련은 모든 환경에서 성능을 명확히 개선하지만, 결과는 훈련 설정에 따라 달라집니다. 예를 들어 GRPO는 대부분 과제에서 최고 결과를 내지만, PPO는 WebShop 환경에서 최고 성능을 보입니다. 아래를 참조하세요. RL 알고리즘 간 성능 차이는 극적이지 않고—REINFORCE 변형도 좋은 성능을 냅니다. 그러나 성능 차이는 존재합니다.
([4]에서 발췌)
흥미롭게도 맥락 관리 전략의 선택도 에이전트 성능에 큰 영향을 미치는 것으로 나타납니다. [4]에서는 다음과 같은 몇 가지 전략을 시험합니다.
GSM8K 환경에서 시험하면 슬라이딩 윈도 전략이 최고 성능을 달성합니다. 아래를 참조하세요. 이 결과는 시험하는 환경에 특화되었을 가능성이 크지만, 모든 맥락을 유지하는 것이 항상 최적은 아님을 보여줍니다. 맥락 창을 더 효율적으로 활용하는 맥락 관리 전략을 채택하면 에이전트 성능을 개선할 수 있습니다—경우에 따라 적을수록 더 좋습니다.
([4]에서 발췌)
([5]에서 발췌)
LLM을 위한 RL 훈련의 초기 연구 다수는 한 도메인 또는 과제에 흔히 집중하는 단일 턴 설정을 고려했습니다. 이 접근법은 대화 및 추론 도메인에서는 잘 작동하지만, 자율 LLM 에이전트를 훈련하려면 다중 턴 다중 과제 설정을 다루도록 RL 훈련 전략을 확장해야 합니다. [5]에서 저자들은 범용 LLM 에이전트의 RL 훈련 과정을 확장하기 위한 AgentRL이라는 오픈소스 프레임워크를 제안합니다. 앞으로 보겠지만 AgentRL 프레임워크는 RL 훈련을 효율적으로 만들고 광범위한 과제 도메인으로 쉽게 확장할 수 있도록 인프라 및 알고리즘 개선을 결합합니다.
“단일 턴에서 다중 턴으로의 전환은 에이전틱 RL의 문제를 규정합니다. 여기서 LLM은 다중 턴 추론을 수행하고, 도구 또는 환경과 상호작용하며, 확장된 궤적에 걸쳐 행동을 적응시키는 자율 에이전트로 작동합니다.” - [5]에서 발췌
에이전틱 RL의 복잡성. 에이전틱 RL의 다중 턴 설정은 표준 단일 턴 RL 훈련 설정과 비교할 때 핵심적인 구별 요소입니다. 다중 턴 에이전트 환경에서 롤아웃 생성은 복잡합니다.
에이전트 궤적은 길이와 완료 시간에서 크게 달라지므로, 단일 턴 설정에서 흔히 사용되는 훈련과 생성을 교차 배치하는 동기식 RL 훈련 접근법은 작동하지 않습니다. 단일 훈련 배치 안에서도 완료하는 데 크게 다른 시간이 걸리는 여러 롤아웃을 샘플링해야 할 수 있습니다. 동기식 설정에서는 긴 궤적이 끝나는 동안 더 짧은 궤적을 처리하는 GPU가 유휴 상태가 되어 하드웨어 활용이 낮고 불균형해집니다.
에이전트가 상호작용 환경에서 작동한다는 사실은 이런 가변 롤아웃 시간을 악화시킵니다. 각 궤적을 샘플링할 때 에이전트는 자주 상호작용하는 격리 환경에서 실행되어야 합니다. 환경 상호작용의 속도 저하는 롤아웃 길이와 완료 시간의 변동성에 기여하여 효율을 떨어뜨립니다. 이를 피하려면 에이전틱 RL 프레임워크는 많은 환경을 동시에 배포하고 관리할 수 있어야 합니다.
([5]에서 발췌)
해결할 문제에 따라 에이전트는 고유한 인터페이스와 계산 요구를 지닌 다양한 환경에서 실행해야 할 수 있습니다. 새 과제를 RL 훈련 과정에 원활하게 통합하려면, 다양한 에이전트 환경의 설계와 실행을 통합할 수 있는 표준 인터페이스를 설계할 수 있습니다. 또한 훈련 과정에 포함된 수많은 환경과 도메인 전반에서 RL 훈련 과정이 효율적이고 안정적으로 유지되도록 알고리즘 개선이 이루어져야 합니다.
AgentRL 프레임워크에는 위에서 설명한 에이전틱 RL의 각 과제를 해결하기 위해 도입한 세 핵심 구성 요소가 있습니다.
([5]에서 발췌)
앞서 논의했듯이 동기식 설정은 롤아웃 길이 또는 시간의 변동성이 만드는 대량의 유휴 시간 때문에 에이전틱 RL에 적합하지 않습니다. 길고 상호작용적인 궤적을 더 잘 다루기 위해 [5]의 저자들은 롤아웃 생성과 모델 훈련을 분리하는 완전 비동기 훈련 파이프라인을 채택합니다. 각각 전용 자원 풀5을 갖는 훈련 및 추론용 별도 엔진이 만들어집니다. 두 엔진은 동시에 실행됩니다.
이 설정에서 배치 크기는 훈련 업데이트마다 달라지지만, [5]의 저자들은 배치 크기 변동을 허용 가능한 범위로 유지하기 위해 각 배치의 롤아웃 최소·최대 수를 설정합니다. 이 접근법으로 업데이트에 필요한 데이터가 충분히 확보되는 즉시 훈련을 계속하여 하드웨어 활용을 개선할 수 있습니다. 또한 롤아웃 생성 시간의 변동성은 추론 엔진이 지속적으로 작업을 실행한다는 사실로 처리됩니다. 주어진 업데이트 시점에 완료되지 않은 롤아웃은 계속 실행되며, 기존 작업이 끝나는 즉시 새 롤아웃 작업을 스케줄합니다.
“롤아웃 엔진의 오프폴리시 편향을 피하기 위해 데이터 큐의 최대 크기를 설정하고 모든 궤적이 매 단계 훈련 엔진으로 이동하도록 강제합니다. 이를 통해 모든 궤적은 최신 정책으로 가능한 한 최신 상태를 유지하며, 이후 실험은 이것이 허용 가능함을 시사합니다.” - [5]에서 발췌
온폴리시 유지. 이러한 비동기 파이프라인에서는 훈련 업데이트에 오래되거나 오프폴리시 데이터가 포함될 위험이 있습니다. 훈련 접근법이 완전히 온폴리시이려면 롤아웃 생성 모델과 업데이트하는 모델이 동일해야 하지만, 비동기 설정에서는 항상 그렇지 않습니다—궤적이 훈련에 사용될 때까지 모델은 이미 한 번 이상 정책 업데이트를 거쳤을 수 있습니다. 데이터의 오래됨을 다음과 같이 제한하여 훈련 과정이 지나치게 오프폴리시가 되는 것을 막을 수 있습니다.
AgentRL은 에이전트 환경을 위한 통합 환경 배포 인프라도 설계합니다. 다중 과제 에이전틱 RL에서는 한 번에 많은 이종 환경을 실행하고, 새 환경을 포함하도록 훈련을 쉽게 확장할 수 있어야 합니다. 환경의 변동성을 다루기 위해 에이전트가 어떤 환경과도 상호작용하는 데 사용할 수 있는 통합 함수 호출 기반 API 인터페이스를 만듭니다. 이 인터페이스는 환경별 사용자 정의 행동 형식을 에이전트가 호출할 수 있는 표준화된 함수 호출로 대체합니다. 아래를 참조하세요.
([5]에서 발췌)
[5]의 각 환경 워커는 다른 환경과 분리된 격리 실행 단위로 컨테이너화됩니다. 컨테이너화는 다수의 동시 환경 실행 중 발생하는 오류를 격리하고, 다양한 하드웨어 전반의 환경 배포를 단순화하여 활용도와 효율성을 개선합니다. 위에 보인 것처럼 AgentRL의 환경은 훈련 파이프라인과 롤아웃 워커를 오케스트레이션하는 중앙 컨트롤러가 관리합니다. 이 컨트롤러는 수천 개의 동시 환경 인스턴스를 관리하며, 롤아웃 엔진이 통합 인터페이스를 통해 이 환경과 상호작용하게 합니다.
“추가 통합 비용 없이 같은 인프라에서 이종 환경을 호스팅, 스케줄, 모니터링하기 위해 우리는 워커와 컨트롤러 수준에서 일관된 인터페이스를 노출합니다. 환경 측면에서 모든 과제에 걸쳐 워커 API를 통합하여, 각 과제가 동일한 수명 주기 연산 집합으로 인스턴스화되고 관리될 수 있게 합니다. 훈련 측면에서 컨트롤러는 RL 엔진에 단일 게이트웨이 API를 제공하여 과제 이질성을 추상화하고 다중 과제 실행을 단일 과제 사례의 투명한 확장으로 노출합니다.” - [5]에서 발췌
마지막으로 [5]에는 에이전틱 RL에서 흔히 경험하는 두 핵심 난점을 다루기 위해 채택한 몇 가지 알고리즘 변경이 있습니다.
탐색을 장려하기 위해 하나의 궤적에서 여러 LLM을 사용해 행동을 생성하는 교차 정책 샘플링 기법이 제안됩니다. 아래를 참조하세요. 궤적의 행동은 보통 단일 모델에서 샘플링하지만, 이 접근법은 매 단계 행동을 생성할 때 모델 풀에서 무작위로 선택하여, 어떤 단일 모델도 탐색하지 못할 궤적을 만들어 탐색을 돕습니다.
롤아웃 엔진에서 여러 모델을 관리하는 일은 복잡합니다. 대신 저자들은 훈련 과정 이전 단계의 여러 초기 모델 버전을 포함하는 모델 풀을 만듭니다. 구체적으로 이 모델 풀은 RL 훈련 과정 전반에 걸쳐 서로 다른 빈도로 모델 매개변수를 업데이트하여 의도적으로 오래된 상태로 유지되는 전용 롤아웃 엔진 그룹으로 구성됩니다.
([5]에서 발췌)
특히 [5]의 저자들은 궤적 내 행동을 서로 다른 모델에서 샘플링하는 교차 정책 샘플링과, 각 궤적은 단일 모델로 생성하되 업데이트에서 여러 모델의 궤적을 결합하는 혼합 전략을 모두 시험합니다. 교차 정책 샘플링은 정책이 각 궤적 안에서 혼합되므로 혼합과 다릅니다. 이 접근법은 연속된 행동이 서로 다른 정책에서 나오게 하며, 어떤 단일 정책이 생성한 궤적과 다른 궤적을 만듭니다. 흥미롭게도 [5]에서 제안한 교차 정책 샘플링 접근법은 실증적으로 더 단순한 혼합 전략을 능가합니다.
다중 과제 훈련의 안정성을 개선하기 위해 수정된 과제 수준 이점 정규화 접근법도 도입됩니다. AgentRL은 먼저 기저 RL 알고리즘을 사용하여 이점을 계산합니다. 훈련에 사용된 GRPO 설정에서는 결과 보상이 같은 입력에 대해 샘플링된 다른 롤아웃에 상대적으로 정규화되어, 각 궤적의 그룹 상대 이점을 만듭니다. 이후 이 궤적 수준 이점은 행동 마스크를 사용해 해당 궤적 안의 모든 에이전트 생성 토큰에 할당되며, 표준 GRPO에서 사용하는 접근법과 일치합니다.
이후 AgentRL은 현재 배치에서 WebShop처럼 각 도메인의 모든 토큰 수준 이점을 그룹화하고, 그 도메인의 평균과 표준편차를 사용해 정규화합니다. 위를 참조하세요. 그 결과 각 도메인의 토큰 수준 이점 분포는 평균이 대략 0이고 분산이 1이 됩니다. 이 추가 정규화 단계는 과제 도메인 전반의 최적화 규모 차이를 줄이고, 어느 하나의 도메인이 정책 업데이트를 지배하지 못하게 합니다. 과제 수준 이점 정규화와 교차 정책 샘플링을 함께 사용하면 다중 과제·다중 턴 RL이 더 안정적이고 효율적이 됩니다. 아래를 참조하세요.
([5]에서 발췌)
성능 영향. [5]의 실험을 위해 ALFWorld, WebShop, SQL 데이터베이스·운영 체제·지식 그래프와 상호작용하도록 만든 세 새 과제를 포함한 다섯 과제를 AgentRL에 통합합니다. 과제는 다중 과제 RL 훈련 중 균등하게 샘플링되며, 이 훈련은 RL-Zero 설정을 사용합니다. 즉 에이전틱 RL 훈련 전에 워밍업 SFT 단계가 없습니다.
([5]에서 발췌)
AgentRL은 GLM-4-9B와 다양한 크기의 Qwen2.5-Instruct 모델을 포함해 여러 기본 모델에서 일관된 에이전틱 과제의 인상적인 결과를 달성합니다. AgentRL은 GPT-5, Claude-Sonnet-4 같은 여러 독점 모델을 능가하는 과제 평균 통과율을 달성합니다. 이런 성능 지표는 더 작은 모델에서 특히 인상적입니다. 예를 들어 Qwen-2.5-3B-Instruct조차 AgentRL로 RL 훈련 후에는 대부분의 독점 모델을 능가합니다. RL 훈련은 모든 과제에서 에이전트 성능에 분명한 이점을 제공합니다. 위 표에서 Qwen-2.5-32B 기본 모델(녹색)과 AgentRL 모델 변형(빨간색)을 비교하면 과제별 성능 변화량을 확인할 수 있습니다6.
([5]에서 발췌)
AgentRL로 달성한 인상적인 결과는 에이전트가 평가에 사용된 도메인에서 직접 훈련되었기 때문이라고 주장할 수 있습니다. 이 지적은 사실이며 평가 결과에 분명히 영향을 미치지만, [5]에서는 AgentRL 모델이 특정 보류 벤치마크에 비교적 잘 일반화하는 것도 확인합니다. 예를 들어 훈련에 포함되지 않은 BFCL-v3 벤치마크에서 AgentRL의 소폭 향상을 확인합니다. 위를 참조하세요. 또한 다중 과제 RL로 훈련한 에이전트는 각 도메인에서 개별적으로 훈련한 에이전트의 성능에 맞추는 경향이 있으며, 이는 AgentRL이 범용 다중 과제 에이전트를 훈련할 수 있음을 보여줍니다.
에이전트는 광범위한 환경 또는 사용자 상호작용을 지닌 현실 과제를 해결하는 데 어려움을 겪을 수 있지만, RL을 통해 그러한 과제 해결 능력을 정제할 수 있습니다. 이 에이전틱 RL 접근법의 주된 병목은 RL 훈련을 위한 정확한 정답을 갖춘 현실 환경을 선별하는 일이 비용이 많이 들고, 결과적으로 확장성이 낮다는 점입니다. 에이전틱 RL을 위한 모의 환경을 합성하여 이 문제를 완화할 수 있지만, 이 주제의 대부분 선행 연구는 난이도와 다양성이 부족한 과제를 생성하는 경향의 반자동 방법에 한정되었습니다. [6]에서 저자들은 RL을 위한 고품질 환경을 합성하는 LLM-루프 내 프레임워크를 제안하고, 에이전틱 도메인에서 성능과 안정성을 개선할 수 있는 RL 훈련 과정의 여러 변경 사항을 설명합니다.
“모의 환경과 복잡한 과제를 자동으로 생성할 수 있는 통합 파이프라인이 에이전트 훈련의 범위를 넓히고 복잡성을 심화하는 데 더 적합하다고 우리는 주장합니다.” - [6]에서 발췌
과제 합성 파이프라인은 현실적이고 어렵고 검증 가능한 RL 환경을 합성적으로 만들 수 있게 한다는 점에서 [6]의 핵심 기여입니다. 아래를 참조하세요. 생성된 과제가 충분히 고품질이면 모의 환경에서 RL 훈련을 수행하는 것은 LLM 에이전트를 개선하는 비용 효율적이고 확장 가능한 접근법입니다. 하지만 이 접근법은 훈련 중 에이전트가 마주치는 모의 과제와 현실에서 풀어야 할 과제 간 격차를 최소화할 수 있을 때만 효과적입니다. 합성 환경이 충분히 현실적이고 어렵도록, 기본 도구 정의에서 시작해 최종 과제를 반복적으로 구축하는 상향식 접근법이 제안됩니다.
([6]에서 발췌)
위에 묘사된 것처럼 과제 합성 파이프라인은 세 상위 수준 단계로 구성됩니다.
환경 생성을 수행하기 위해 먼저 사용 가능한 도구에 제공된 문서만으로 시작합니다. 이 문서에서 LLM에 프롬프트하여 과제의 상태 공간 역할을 할 키-값 쌍 목록 S``=``[(K_1, V_1),``…,``(K_n, V_n)]과 각 도구의 Python 구현을 구성하게 할 수 있습니다. 도구를 Python 함수로 구현하면 표준 딕셔너리 연산으로 환경 상태와 쉽게 상호작용할 수 있고, RL 훈련에 필요한 동시적이고 효율적인 도구 실행을 지원합니다. 이 과정은 S가 키-값 상태이고 F가 사용 가능한 함수 집합인 E``=``(S,``F) 형식의 환경을 산출합니다. 구체적 예는 아래를 참조하세요.
이 시점에서는 각 상태 항목의 키만 생성됩니다—구체적 값은 나중 단계에서 인스턴스화됩니다. 이 초기 환경에서 먼저 과제를 위한 도구 호출 시퀀스를 생성하는 상향식 과제 구성 접근법을 사용합니다. 도구 설명으로 프롬프트된 LLM은 사용 가능한 도구를 방향 그래프로 조직하며, 여기서 방향 간선은 한 도구의 출력이 다른 도구의 입력을 형성한다는 뜻입니다. 가능한 간선의 예는 아래에 나와 있습니다.
get_project_id_by_name(name) → delete_project(project_id)
도구 시퀀스는 무작위 보행을 사용하여 이 방향 도구 그래프에서 샘플링할 수 있습니다. 이후 시퀀스를 연결하고 중복 도구 호출을 제거하도록 LLM에 요청해 결과 시퀀스를 병합하여 복잡도를 높일 수 있습니다.
“우리의 합성 파이프라인은 도구 설명 문서에서 시작하여 환경 상태를 저장하는 데이터베이스의 자동 구성과 Python 도구 구현 생성을 가능하게 합니다. 이후 도구의 의존성 그래프를 구성하고, 이 그래프의 무작위 보행은 다양한 도구 시퀀스를 산출합니다. 이 시퀀스는 병합되고 추론 노드와 간선으로 증강되어 복잡한 방향 비순환 그래프(DAG)를 형성하며, 이는 다시 과제를 생성하는 청사진 역할을 합니다.” - [6]에서 발췌
과제를 해결할 때 에이전트는 단순히 도구 호출만 수행하지 않습니다. 텍스트 생성 능력도 이용해 문제 해결 과정을 추론합니다. LLM에 도구 호출 시퀀스 안에—에이전트가 도구 호출 결과에 대해 중간 추론을 수행해야 하는 지점을 나타내는—추론 노드를 삽입하도록 프롬프트하여 이 행동을 포착할 수 있습니다. 이 도구 및 추론 노드 시퀀스를 이용하면, LLM에 노드 사이의 방향 간선을 예측하도록 프롬프트하여 과제의 해법 궤적을 포착하는 방향 비순환 그래프(DAG)를 형성할 수 있습니다. 이후 LLM에 다음을 수행하도록 프롬프트하여 최종 과제를 인스턴스화할 수 있습니다.
과제 의도는 더 명시적이며, 과제 질문은 사용자가 에이전트에 제시할 덜 명시적인 과제 표현입니다. 예를 들어 _“안녕하세요, 더 이상 Auro 프로젝트가 필요하지 않습니다. 삭제해 주시겠어요? 그리고 Lumina라는 새 프로젝트도 만들어 주세요.”_라는 과제 질문은 _“프로젝트 Auro 삭제, 프로젝트 Lumina 생성”_이라는 의도를 가질 수 있습니다. 최종 상태는 RL 훈련 중 각 과제의 검증 가능한 보상을 계산하는 데 사용됩니다. 에이전트 궤적을 정답 도구 시퀀스와 대조해 검증할 수도 있지만, [6]의 저자들은 여러 도구 시퀀스가 같은 유효 출력을 낼 수 있으므로 결과 검증에 명시적으로 집중합니다.
“사용자가 계속 요청을 발행하고 에이전트가 사용자와 환경 모두와 상호작용하는 현실 시나리오를 더 잘 모의하기 위해, 우리는 RL 단계에서 합성 환경에 모의 사용자 에이전트를 도입합니다.” - [6]에서 발췌
사용자 상호작용 모의. 모의 과제와 환경 집합을 구성한 뒤에는 RL로 이 합성 환경에서 에이전트를 훈련할 수 있습니다. 하지만 문제 해결 과정이 현실적이려면 에이전트는 환경 이상과 상호작용해야 합니다—현실 세계에서 에이전트는 보통 사용자와 환경 모두와 상호작용합니다. 이 이유로 [6]의 저자들은 RL 훈련 과정에 모의 사용자 에이전트를 도입합니다. 모의 사용자 에이전트는 과제 질문을 에이전트에 직접 제공하여 과제를 시작합니다. 이후 에이전트는 반복적으로 과제를 해결하며, 에이전틱 루프의 각 단계에 두 선택지가 있습니다.
이 두 행동은 모두 에이전트에 관측을 반환하며, 각각 도구 호출 결과 또는 사용자 에이전트의 텍스트 응답입니다. 사용자 에이전트가 모든 요구 사항이 충족되었다고 판단하면 롤아웃이 종료됩니다. 이 시점에서 환경 상태를 정답 상태와 비교하여 최종 보상을 계산합니다. 구체적으로 에이전트가 만든 환경 상태가 기준 최종 상태와 정확히 일치하면 최종 보상은 1이고, 그렇지 않으면 0입니다. 특히 AutoForge는 RL 훈련에 결과 기반 보상만 사용합니다.
([6]에서 발췌)
**환경 상대 정책 최적화(ERPO)**는 [6]에서 에이전틱 RL을 위해 제안한 GRPO 변형입니다. 위에서 설명한 모의 사용자 기반 롤아웃 과정에 더하여 다음 세 가지 변경을 추가합니다.
q_i에는 대응하는 샘플링 궤적 집합 M_i가 있습니다. GRPO에서는 각 질문의 궤적 집합에 대해 그룹 단위 이점을 계산합니다. ERPO는 같은 환경을 공유하는 질문들의 모든 유효 궤적에 대해 보상 표준편차를 계산하여 이 접근법을 수정합니다. 아래를 참조하세요.ERPO의 이점 추정([6]에서 발췌)
ERPO가 사용하는 수정된 정규화는 더 넓은 보상 그룹에 대해 표준편차를 계산하므로 이상치에 대한 견고성을 개선합니다. 위에 보인 것처럼 ERPO는 분자에서 GRPO가 사용하는 같은 질문 수준 보상 평균을 유지합니다. 하지만 표준편차 항은 같은 환경의 모든 질문에 대한 모든 유효 궤적에 걸쳐 계산되어 환경 수준 이점 스케일링을 산출합니다. 다시 말해 ERPO는 분자에 GRPO 스타일 평균을 유지하면서 분모에서는 환경 전반의 보상을 풀링합니다.
실증 분석. [6]에서는 Qwen3-235B-A22B-Thinking 모델을 사용하여 총 1,078개 과제를 포함한 10개 환경을 합성합니다. Qwen3-30B-A3B-Thinking을 미세 조정하는 데 사용하면 AutoForge는 τ-Bench 계열과 VitaBench 같은 도메인 내 벤치마크 성능을 개선합니다. RL 훈련 전에 기본 모델이 합성 환경과 상호작용하도록 하여 수집한 유효 궤적을 사용하는 콜드 스타트 SFT 단계를 수행합니다. 이후 그 결과인 SFT 모델을 ERPO로 추가 최적화합니다. AutoForge 에이전트 성능은 더 큰 오픈 기본 모델(예: Qwen3-235B-A22B-Thinking)을 능가하며, 경우에 따라 독점 모델(예: Gemini-2.5-Pro)의 성능에 근접합니다. 아래를 참조하세요.
([6]에서 발췌)
도메인 외 데이터셋에서 평가해도 AutoForge로 훈련한 에이전트는 계속 좋은 성능을 냅니다. 아래를 참조하세요. 특히 이 도메인 외 일반화 시험은 매우 엄격합니다. AceBench-zh는 훈련과 비교해 i) 다른 프롬프트 및 도구 호출 형식, ii) 훈련 중 보지 못한 새 도구 집합, iii) 완전히 다른 언어를 사용합니다—모델은 영어로 훈련되고 중국어로 평가됩니다. 그럼에도 에이전트는 RL 훈련 후 성능 향상을 보입니다.
([6]에서 발췌)
예상대로 에이전트를 SFT만으로 훈련한 경우보다 RL로 훈련할 때 눈에 띄게 더 큰 향상을 확인합니다. AutoForge의 각 구성 요소에 대한 절제 실험도 수행되며 다음 결과를 얻습니다.
([7]에서 발췌)
[7]의 저자들은 다시 검증 가능한 보상을 지닌 규칙 기반 RL을 사용해 어렵고 다단계인 과제를 해결할 수 있는 상호작용 에이전트를 훈련하는 데 집중합니다. 에이전트는 RL 중 자신의 출력과 이에 대응하는 환경 보상에서 학습하므로, [7]에서는 에이전트의 이 학습 과정을 “자기 진화”라고 부릅니다. 이미 배운 것처럼 다중 턴 RL 수행 시 환경 전반의 일반화 부족 또는 전반적 훈련 불안정성 같은 여러 어려움이 발생합니다. [7]에서 저자들은 새 환경을 위한 모듈형 지원을 갖춘 에이전틱 RL 훈련 프레임워크 RAGEN을 제안합니다. 또한 상호작용 에이전트 훈련을 위해 특별히 설계한 궤적 수준 학습 알고리즘인 상태-사고-행동-보상 정책 최적화(StarPO)를 도입합니다.
“각 행동을 독립적으로 다루는 정적 과제를 위한 이전 방법과 달리, StarPO는 관측, 추론 흔적, 행동, 피드백을 포함한 전체 궤적을 롤아웃과 모델 최적화를 위한 일관된 단위로 다룹니다.” - [7]에서 발췌
StarPO는 에이전트의 전체 궤적을 일관된 단위로 최적화하여 단일 턴 RL 기법을 넘어섭니다. 롤아웃을 생성할 때 에이전트는 에이전틱 루프에서 실행됩니다. 각 단계에서 에이전트는 텍스트 추론 흔적과 하나 이상의 환경 실행 가능 행동, 즉 도구 호출을 포함하는 구조화된 출력을 생성합니다. [7]에서는 아래에 보인 것처럼 추론에 기반한 구조화된 출력을 생성하는 추론 기반 에이전트 훈련을 구체적으로 고려합니다.
추론 에이전트의 행동은 사고와 출력을 모두 포함합니다([7]에서 발췌)
각 단계 후 환경은 업데이트되고 에이전트는 선택적인 중간 보상을 받습니다. 예를 들어 [7]의 에이전트는 형식이 잘못된 출력에 음의 보상을 받습니다. 에이전트는 결국 중지 조건이나 허용된 최대 턴 수 도달으로 종단 상태에 이르며, 이 시점에 롤아웃을 종료하고 최종 검증 가능 보상을 계산합니다. 이 과정의 결과는 에이전트가 만든 상태와 행동의 궤적, 그리고 롤아웃 전반에서 얻은 누적 보상입니다.
([7]에서 발췌)
표준 관행에 따라 [7]의 목적은 누적 보상을 최대화하는 것이지만, 이 목적은 전체 다중 턴 궤적에 대해 최적화됩니다. 위를 참조하세요. [6]과 유사하게 StarPO도 궤적에서 중간 추론 흔적을 유지하지만, 저자들은 목적에서 환경 토큰을 마스킹하지 않습니다. 이는 앞서 본 다른 방법과 의미 있게 다른 점입니다. 다만 부록에서는 응답 마스킹을 시험했고 유익한 것으로 나타났습니다. [7]에서 StarPO는 특정 알고리즘이 아니라 상위 수준 최적화 접근법으로 규정됩니다—훈련 과정은 PPO나 GRPO 같은 모든 RL 최적화기로 구현할 수 있습니다.
실험 결과. StarPO는 [7]에서 RAGEN 프레임워크 안에 구현하여 실용적으로 분석됩니다. RAGEN은 임의의 보상 함수를 지닌 다중 턴 확률적 환경에서 구조화된 롤아웃 생성을 위한 모듈형 확장 가능 지원을 제공하는 LLM 에이전트 훈련 시스템입니다. Qwen-2.5 모델 기반 에이전트는 목표 분석을 가능하게 하는 세 제어된 기호 환경과 웹 탐색 능력을 시험하는 현실적 환경 하나—WebShop 벤치마크—를 포함한 다양한 환경에서 훈련됩니다. StarPO 목적에는 엔트로피 보너스가 추가되고, 모든 도메인에 검증 가능한 결과 보상이 채택되며, PPO와 GRPO로 실험을 수행합니다.
([7]에서 발췌)
[7]의 실험에서 저자들은 에이전틱 RL에서 자주 관찰되는 에코 트랩이라는 새로운 불안정성 패턴을 발견합니다. 위를 참조하세요. 이 문제는 에이전트가 RL 훈련 중 자신이 생성한 추론 패턴에 과적합하여 훈련을 불안정화하는 행동 붕괴를 일으킬 때 발생합니다. 아래 그림에 보이는 에코 트랩의 일반적 징후는 다음과 같습니다.
“초기 단계 궤적은 기호적 의미와 기대 보상에 관한 다양한 추론을 보이는 반면, 후기 단계 응답은 반복적이고 결정론적이 됩니다. 이는 RL 훈련이 내재된 추론 지름길을 과도하게 증폭하여, 지역적으로 보상받는 템플릿은 강화하면서 탐색은 억제했을 수 있음을 시사합니다. 우리는 이러한 실패 모드를 에코 트랩이라고 부릅니다… 여기서 모델은 자체 생성 궤적으로 훈련될 때 암기된 추론 경로를 반복적으로 재사용하며, 다양성 붕괴와 장기 성능 저하로 이어집니다.” - [7]에서 발췌
([7]에서 발췌)
[7]에서는 행동 다양성과 탐색을 장려해 에코 트랩을 피하고 안정성을 개선하기 위한 여러 개입을 제안합니다. 이 변경들은 안정화된 StarPO 변형인 StarPO-S를 형성합니다. 먼저 RL 목적에서 KL 발산 정규화 항을 제거하여 탐색을 장려합니다. 엔트로피 붕괴를 방지하기 위해 DAPO의 Clip-Higher 접근법도 사용합니다.
더 나아가 가장 큰 결과 불확실성을 지닌 훈련 과제를 선택하는 오프라인 데이터 필터링 접근법이 제안됩니다—[7]의 저자들은 이 과제가 가장 유익한 훈련 신호를 제공한다고 주장합니다. 구체적으로 모든 훈련 과제의 보상 표준편차를 측정하고, 표준편차 내림차순으로 과제를 선택해 훈련에 사용합니다. 이 선택 과정은 에이전트가 결정론적 행동을 강화하는 대신 고분산 과제에서 학습하게 합니다. 아래에 보이듯 이 변경은 붕괴를 지연하고 에이전트 성능을 높입니다.
([7]에서 발췌)
[7]에서 훈련한 에이전트의 행동을 심층 분석하여 다음과 같은 발견을 얻습니다.
“안정적인 엔트로피가 있어도 모델은 다양해 보이지만 입력과 무관한 고정 템플릿에 의존할 수 있음을 발견합니다. 이를 템플릿 붕괴라고 부릅니다… 이 실패를 진단하기 위해 우리는 추론 품질을 입력 내 다양성(엔트로피)과 입력 간 구별 가능성(상호 정보량)으로 분해하고, 온라인 진단을 위한 상호 정보량 대리 지표 계열을 도입합니다.” - [8]에서 발췌
RAGEN-2. [7]의 분석을 확장하여 저자들은 [8]에서 아래처럼 템플릿 붕괴라고 부르는 또 다른 형태의 RL 불안정성을 식별합니다. RL에서 다양성 지표를 지속적으로 모니터링할 수 있지만, 다양성을 포착하는 가장 일반적인 지표(예: 토큰 수준 엔트로피)는 같은 입력 내 다양성만 측정합니다. 모델은 각 입력 안에서 높은 엔트로피를 유지하면서도 입력과 무관한 출력을 생성할 수 있습니다. 입력 내 다양성을 넘어 에이전트 추론의 깊이를 포착하려면 입력 간 상호 정보량을 계산해야 합니다.
([8]에서 발췌)
[8]에서 저자들은 전체 다양성을 특정 프롬프트에 대한 추론의 변화 정도인 엔트로피와, 프롬프트에 따라 추론이 얼마나 변화하는지인 상호 정보량의 결합으로 분해해야 한다고 주장합니다. 기존 접근법 대부분, 예를 들어 RL을 위한 엔트로피 보너스는 엔트로피만 겨냥하므로 템플릿 붕괴로 이어집니다. [8]에서는 상호 정보량을 위한 몇 가지 서로 다른 대리 지표를 제안하며, 이것들은 엔트로피보다 최종 성능과 더 강하게 상관되는 것으로 나타납니다. 아래를 참조하세요.
([8]에서 발췌)
흥미롭게도 [8]에서 훈련 중 다양성 지표를 개선하는 데 사용한 접근법은 [7]에서 제안한 능동 학습 접근법과 다소 유사합니다. 저자들은 RL 업데이트에서 신호 대 잡음비(SNR)를 분석하여, 업데이트 내 신호가 각 과제의 보상 분산과 관련됨을 보입니다. 따라서 최대 신호를 지닌 과제는 다음만으로 선택할 수 있습니다.
p``=``0.9에 따릅니다.[8]에서 RL에 사용한 이 동적 SNR 필터링 접근법은 아래에 묘사되어 있습니다. 정책 경사에서 저신호 프롬프트의 기여를 제거하면 템플릿 붕괴를 피할 수 있고, 이에 따라 에이전틱 RL 훈련 과정 전체의 성능, 일반화 가능성, 효율성, 안정성을 개선할 수 있습니다.
([8]에서 발췌)
우리는 RL로 에이전트를 훈련하는 매우 다양한 논문을 살펴보았습니다. 이 논문들은 환경, 최적화기, 실험 설정에서 다르지만, 여러 공통 아이디어와 패턴이 반복해서 나타납니다. 이 추세를 연구하면 모듈형이고, 확장 가능하며, 안정적이고, 에이전트 행동을 개선할 능력이 있는 에이전틱 RL 시스템 구축을 위한 실용적 설계 원칙을 도출할 수 있습니다.
모듈형 인터페이스. 지금까지 본 프레임워크 대부분은 도구와 환경을 위한 모듈형 추상화 위에 구축됩니다.
모듈형 설계를 사용하면 새 과제를 쉽게 추가하고, 환경을 교체하거나, 서로 다른 최적화기를 시험할 수 있습니다. 이런 방식으로 에이전틱 RL 인프라는 수동 정의 과제를 넘어 임의의 훈련 환경을 포착하도록 확장할 수 있습니다.
궤적 구조. 에이전틱 RL에서는 지시사항, 생성 토큰, 도구 호출, 관측, 보상, 환경 상태를 포함하는 다중 턴 궤적을 다뤄야 합니다. 이처럼 복잡한 궤적의 표현은 단일 턴 RL 설정보다 복잡합니다. 이 때문에 에이전틱 RL 프레임워크는 롤아웃을 평평한 토큰 시퀀스로 표현하는 것을 넘어섭니다. 예를 들어 Agent-R1 [4]은 단계 경계를 보존하고 재토큰화 드리프트를 피하기 위해 정확한 토큰을 저장하는 구조화된 단계 수준 궤적을 저장합니다. 궤적 형식은 맥락 구성 방식과 보상 할당 방식을 결정하기 때문에 중요합니다.
행동 마스크. 대부분의 에이전틱 RL 논문은 에이전트가 생성한 토큰만 정책 경사에 기여하도록 RL 목적을 수정합니다. 이러한 행동 마스킹은 지금까지 본 논문들에서 가장 일관되게 공유되는 구현 세부 사항 중 하나이며, 에이전트 성능을 개선하는 것으로 나타났습니다. 하지만 최근 연구에서는 에이전트가 생성하지 않은 토큰을 목적에서 완전히 제외하는 것이 최적이 아닐 수 있음을 발견했습니다. 즉, 다음을 통해 성능을 더 개선할 수 있습니다.
직관적으로 이 접근법은 RL을 통해 행동하는 법을 배우는 동시에, 제공된 환경 피드백에서 SFT로 세계 모델을 배우는 것으로 볼 수 있습니다. 자세한 내용은 Echo, PaW 같은 이 주제의 최근 논문을 참조하세요.
과정 보상. LLM을 위한 RL 훈련의 최근 연구 대부분은 결과 보상에 크게 의존하며, 이는 에이전틱 RL도 마찬가지입니다—특히 과제가 검증 가능한 성공 기준을 가질 때 그렇습니다. 하지만 긴 시간 지평 과제는 더 풍부한 공로 할당 메커니즘에서 흔히 이점을 얻습니다. 그 결과 여러 에이전틱 RL 논문은 훈련에서 중간 과정 보상을 지원합니다[3, 4, 7]. 그러나 과정 보상 포함이 항상 명확한 이점을 내는 것은 아닙니다. 예를 들어 ToRL [1]은 실행 불가능한 코드에 패널티를 추가할 때 성능 저하를 관찰합니다.
이점 정규화. 기본 GRPO에서 이점은 하나의 완성 보상을 같은 프롬프트에 대해 샘플링된 다른 완성에 상대적으로 정규화해 추정합니다. 여러 에이전틱 RL 논문은 더 넓은 그룹, 특히 같은 도메인이나 환경에서 나온 배치 내 모든 궤적에 대해 정규화하는 수정된 이점 추정 기법을 사용합니다. AgentRL [5]은 전체 과제 또는 도메인에 걸쳐 토큰 수준 이점을 정규화하는 과제 수준 이점 정규화를 사용합니다. 유사하게 AutoForge [6]는 환경의 모든 유효 궤적에 걸쳐 GRPO의 이점 스케일링 항을 계산하는 ERPO를 제안합니다. 이 방법들은 약간 다른 방식으로 정규화하지만 같은 원칙에 기반합니다. 즉 다중 과제 훈련이 안정적이고 어떤 단일 과제도 정책 업데이트를 지배하지 않도록 전체 과제 또는 환경 전반에서 이점을 정규화합니다.
확장 가능한 롤아웃. 에이전틱 RL은 알고리즘 문제이자 시스템 문제입니다. 롤아웃은 길이와 완료 시간에서 높은 분산을 가질 수 있으며, 이는 에이전트가 실행되는 환경에 따라 달라집니다. 이 때문에 대부분 에이전틱 RL 프레임워크는 비동기 롤아웃 생성과 훈련·추론 전용 자원을 갖는 분리형 아키텍처를 사용합니다. 또한 환경 실행이 병목이 되지 않도록 환경을 컨테이너화하고 확장 가능한 방식으로 호스팅합니다(예: Kubernetes 사용).
안정성과 탐색. 긴 지평에 걸친 에이전트 훈련은 단일 턴 RL에서 덜 두드러지는 새로운 실패 모드를 도입합니다.
지금까지 살펴본 논문들은 이 문제를 해결하기 위한 다양한 접근법을 제안합니다. 예를 들어 AgentRL [5]은 이런 문제를 해결하기 위해 교차 정책 샘플링, 과제 수준 이점 정규화, 비동기 RL을 위한 오래됨 제어 같은 기법을 탐색합니다. 유사하게 AutoForge [6]는 수정된 이점 정규화를 사용하고, RAGEN [7]과 RAGEN-2 [8]는 더 나은 데이터 필터링으로 불안정성을 다룹니다.
과제 선택과 교육과정. 에이전트가 현재 시점에 다양하고 학습 가능한 과제에 노출되도록 데이터 분포를 신중하게 제어할 때 훈련 과정이 가장 잘 작동합니다. 데이터는 선택, 합성, 필터링하거나, 교육과정을 통해 시간에 따라 스케줄링할 수도 있습니다. ScalingInter-RL [3]은 훈련 내내 상호작용 예산을 늘려 에이전트가 긴 시간 지평 과제를 해결하는 방법을 점진적으로 배우게 하며, RAGEN [7, 8]은 에이전트 안의 결정론적 행동 강화를 피하기 위해 높은 분산 또는 신호를 가진 과제를 우선시합니다. 데이터 수집 병목을 완화하기 위해 AutoForge [6]는 도구 문서에서 에이전틱 RL 훈련을 위한 현실적이고 검증 가능한 환경을 합성합니다.
안녕하세요! 저는 Cameron R. Wolfe이며, 딥러닝 박사이자 Netflix의 수석 연구 과학자입니다. 이곳은 AI 연구의 중요한 주제를 더 잘 이해하도록 돕는 Deep (Learning) Focus 뉴스레터입니다. 뉴스레터는 언제나 무료로 공개됩니다. 뉴스레터가 마음에 드셨다면 구독하거나, 유료 구독을 고려하거나, 공유하거나, X, Medium, LinkedIn에서 팔로우해 주세요!
[1] Li, Xuefeng, Haoyang Zou, and Pengfei Liu. “Torl: 도구 통합 RL의 확장.” arXiv 사전 공개본 arXiv:2503.23383 (2025).
[2] Gou, Zhibin, et al. “Tora: 수학 문제 해결을 위한 도구 통합 추론 에이전트.” 학습 표현 국제 학회. Vol. 2024. 2024.
[3] Xi, Zhiheng, et al. “Agentgym-rl: 다중 턴 강화 학습을 통한 긴 시간 지평 의사결정을 위한 LLM 에이전트 훈련.” arXiv 사전 공개본 arXiv:2509.08755 (2025).
[4] Cheng, Mingyue, et al. “Agent-r1: 종단 간 강화 학습으로 강력한 LLM 에이전트 훈련.” arXiv 사전 공개본 arXiv:2511.14460 (2025).
[5] Zhang, Hanchen, et al. “Agentrl: 다중 턴 다중 과제 프레임워크로 에이전틱 강화 학습 확장.” arXiv 사전 공개본 arXiv:2510.04206 (2025).
[6] Cai, Shihao, et al. “AutoForge: 에이전틱 강화 학습을 위한 자동 환경 합성.” arXiv 사전 공개본 arXiv:2512.22857 (2025).
[7] Wang, Zihan, et al. “Ragen: 다중 턴 강화 학습을 통한 LLM 에이전트의 자기 진화 이해.” arXiv 사전 공개본 arXiv:2504.20073 (2025).
[8] Wang, Zihan, et al. “Ragen-2: 에이전틱 RL의 추론 붕괴.” arXiv 사전 공개본 arXiv:2604.06268 (2026).
[9] Anthropic. “장기 실행 에이전트를 위한 효과적인 하니스” https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents (2025).
[10] Anthropic. “AI 에이전트를 위한 효과적인 맥락 엔지니어링” https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents/ (2025).
[11] Zhong, Yinmin, et al. “Streamrl: 분리형 스트림 생성을 이용한 LLM용 확장 가능하고 이종적이며 탄력적인 RL.” arXiv 사전 공개본 arXiv:2504.15930 (2025).
[12] Zai. “GLM-5.2: 긴 시간 지평 과제를 위해 구축됨” https://z.ai/blog/glm-5.2 (2026).
[13] Luo, Michael et al. “DeepSWE: RL 확장을 통해 완전 오픈소스 최첨단 코딩 에이전트 훈련” https://pretty-radio-b75.notion.site/DeepSWE-Training-a-Fully-Open-sourced-State-of-the-Art-Coding-Agent-by-Scaling-RL-22281902c1468193aabbe9a8c59bbe33 (2025).
에이전틱 RL에는 두 가지 일반적인 훈련 패턴이 있습니다. RL-Zero, 즉 기본 모델에 직접 RL을 수행하는 방식과, SFT 콜드 스타트, 즉 예비 SFT 단계 뒤 RL 훈련을 수행하는 방식입니다.
가장 최근 코드 블록은 명확한 표지로 감싸져 있으므로 모델 출력 시퀀스에서 쉽게 파싱할 수 있다는 점에 유의하세요.
최근 보고서의 개정판이 출판되면서 Agent-R1을 위한 환경 구조와 인터페이스에 관한 논의 대부분이 제거되었음을 밝힙니다. 하지만 이 세부 사항은 여전히 유용하므로 이전 보고서의 내용을 유지합니다.
관찰된 과제별 성능 변화량은 다음과 같습니다. ALFWorld (+62.4%), DB (+43.2%), KG (+14.6%), OS (+31.1%), Webshop (+62.4%).
중요하게도 [6]에서는 이 롤아웃을 그룹에서 단순히 제거하는 방식으로 이를 구현합니다. 따라서 총 롤아웃 수로 목적을 정규화할 때 실제로는 마스킹되지 않은 롤아웃만 고려합니다. 즉 동적 샘플링 접근법입니다.