https://arxiv.org/abs/2602.08234
SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning
Large Language Model (LLM) agents have shown stunning results in complex tasks, yet they often operate in isolation, failing to learn from past experiences. Existing memory-based methods primarily store raw trajectories, which are often redundant and noise
arxiv.org
에이전트가 과거의 긴 행동 궤적을 그대로 기억하는 대신 성공과 실패 경험에서 재사용 가능한 행동 원칙인 스킬을 추출하고, 강화 학습 과정에서 스킬 library를 함꼐 발전시키는 프레임워크임.
기존 방법들은 모든 트레젝토리를 저장한 다음에 유사한 테스크가 들어오면 이를 검색하여 프롬프트에 넣지만 이건 긴 경로, 노이즈와 반복, 참고할 수 있지만 활용하는 능력 자체가 충분히 학습되지 않은 문제가 있다.


환경에서 trajectory 수집
↓
성공·실패 경험을 skill로 증류
↓
General / Task-specific SkillBank 구성
↓
Skill 사용법을 SFT로 학습
↓
Skill-augmented GRPO
↓
검증 실패 분석 → SkillBank 업데이트
↺
성공, 실패 경로를 모두 모으는데 성공은 효과적인 행동 패턴을 제공하지만 실패 경로는 어디서 실패했는지, 어떤 판단과 행동이 잘 못 되었는지, 뭘 해야 했는지, 반복하지 않기 위한 일반 원칙이 무엇인지 말해준다. == boundary condition을 발견하기 위한 자원
수집된 경로를 그대로 저장하지 말고 강한 teacher model인 OpenAI o3를 사용해 간결한 skill로 변환해 그냥 경로를 제공하는 것 대비 10 ~ 20배 수준의 token compression을 제공
계층적 SKILLBANK를 구성
General Skills - 여러 task 유형에 공통으로 적용되는 전략
Task-Specific Skills - 특정 task에만 적용되는 전문적인 절차
task description이 주어지면 General Skill은 항상 포함하고, Task-Specific Skill은 의미적 유사도를 통해 선택(Top-6)
Teacher model이 skill을 명시적으로 활용하는 성공 경로를 생성하여 SFT 진행
GRPO를 통해 policy 최적화 진행
기존 SkillBank가 다루지 못하는 스킬들을 추가하여 진행

성공률이 높은 것을 볼 수 있다.

NQ와 HotpotQA만 학습했음에서도 다른 task에서도 경쟁력 있는 결과를 보여주며 재사용 가능한 검색 절차로 일반화 되었음을 보여줌.
Table3를 통해 Cold-start SFT의 중요성을 보여주며 Skill 대신 raw-trajectory를 제공하면 성능이 급감하는 것도 보여준다.
우측 figure에서는 training이 진행되며 SkillBank가 어떻게 변하는지 보여주는데 general은 거의 그대로지만 대부분 증가는 Task-Specific한 것을 보여준다.

좌측은 skill을 통해 기존 경로를 주는 것 보다 더 작은 메모리를 쓰는 것을 볼 수 있다.
수렴 속도 또한 빠르며 최종 성능도 높다.

흠 스킬을 계속 Teachermodel이 생성하는 것이 마음에 걸리네요 .,...
| 해결하려는 문제 | 기존 memory 기반 agent는 성공·실패 trajectory를 그대로 저장해 이후 task의 prompt에 제공함. 그러나 trajectory는 길고, 반복·탐색·실패 행동이 포함되어 noise와 redundancy가 큼 |
과거 경험을 많이 저장하는 것보다, 경험에서 일반화 가능한 행동 원칙을 추상화하는 것이 중요하다는 문제의식 |
| 핵심 아이디어 | Raw trajectory를 그대로 사용하는 대신 teacher model로 압축된 procedural skill을 생성하고, 이를 계층적 SKILLBANK에 저장함. 이후 skill을 활용하는 policy와 SkillBank를 RL 과정에서 함께 업데이트함 |
핵심은 Experience Abstraction + Skill Utilization Training + Recursive Evolution의 결합 |
| 전체 파이프라인 | ① Base agent rollout → ② 성공·실패 경험 수집 → ③ skill distillation → ④ 계층적 SkillBank 구축 → ⑤ skill 활용용 cold-start SFT → ⑥ skill-augmented GRPO → ⑦ validation 실패로 SkillBank 갱신 | SkillBank를 한 번 만들고 고정하는 것이 아니라, 학습 중 발생하는 새로운 실패를 통해 지속적으로 확장함 |
| 성공 경험 처리 | 성공 trajectory에서 task 완료에 기여한 핵심 의사결정, 올바른 행동 순서, 다른 task에도 전이 가능한 전략을 teacher가 추출 | 성공 사례 전체를 모방하는 것이 아니라, 왜 성공했는지에 해당하는 전략적 패턴을 저장 |
| 실패 경험 처리 | 실패 지점, 잘못된 판단·행동, 올바른 대안, 동일한 실패를 피하기 위한 일반 원칙을 concise failure lesson으로 변환 | 실패 trajectory를 버리지 않고 counterfactual knowledge와 boundary condition으로 활용 |
| Skill 표현 | 각 skill은 skill_id, 짧은 title, 행동 원칙인 principle, 적용 조건인 when_to_apply로 구성 | 단순한 자연어 조언이 아니라, 적용 조건을 포함한 구조화된 procedural knowledge |
| General Skills | 환경 내 여러 task에 공통으로 적용되는 탐색, 상태 추적, prerequisite 확인, goal decomposition, loop escape 등의 전략 | 다양한 task에서 공통 기반이 되는 범용 행동 원칙 |
| Task-Specific Skills | ALFWorld의 Pick, Clean, Heat, Cool, PickTwo나 WebShop의 apparel, footwear, electronics처럼 특정 category에 특화된 행동 절차와 실패 회피 전략 | General skill이 기본 전략을 제공하고, task-specific skill이 구체적인 실행 순서를 보완 |
| Skill Retrieval | General skill은 항상 제공하며, task-specific skill은 task description과 skill embedding 간 semantic similarity로 Top-K 검색함. 실험에서는 (K=6) 사용 | 검색은 관련 skill을 context에 제공할 뿐이며, 실제 적용 여부와 조합은 학습된 policy가 observation을 보고 결정 |
| Cold-Start SFT | Teacher가 skill을 명시적으로 활용하는 성공 trajectory를 생성하고 base model을 SFT함. ALFWorld 7,500개, WebShop 2,400개의 synthetic example 사용 |
단순히 skill을 prompt에 넣는 것만으로는 부족하며, 모델이 skill을 해석하고 action으로 변환하는 법을 먼저 학습해야 함 |
| 강화학습 방식 | Cold-start SFT 모델에서 시작해 GRPO로 policy를 최적화함. 동일 task에서 여러 trajectory를 생성하고 binary task-success reward의 group-relative advantage를 사용 |
기존 GRPO와의 차이는 optimizer 자체보다 skill-augmented context와 skill 활용 능력에 있음 |
| KL Reference Model | GRPO의 reference policy를 base model이 아니라 cold-start SFT 모델로 설정 | RL 중 task 성능을 높이면서도, SFT에서 학습한 skill 활용 능력이 망각되는 것을 방지 |
| Recursive Skill Evolution | 일정 validation interval마다 task category별 성공률을 확인하고, 성능이 낮은 category의 실패 trajectory를 분석해 새로운 skill을 생성하거나 기존 skill을 보완함 | Policy가 발전해 새로운 상태를 탐색하면 새로운 실패가 나타나고, 그 실패가 다시 SkillBank를 발전시키는 policy–skill co-evolution 구조 |
| 학습 설정 | Base model은 Qwen2.5-7B-Instruct, teacher는 OpenAI o3, RL은 GRPO 사용. 8×H100 80GB에서 실험당 약 30시간 소요 |
강한 teacher와 상당한 연산 자원을 사용하는 설정이므로 teacher 품질과 비용 의존성이 존재 |
| 평가 환경 | ALFWorld, WebShop, 그리고 NQ·TriviaQA·PopQA·HotpotQA·2Wiki·MuSiQue·Bamboogle의 7개 search-augmented QA benchmark | Embodied interaction, web navigation, search reasoning이라는 서로 다른 agent task에서 방법의 범용성을 평가 |
| ALFWorld 결과 | SKILLRL 89.9%, GRPO 77.6%, SimpleMem+GRPO 62.5%, base Qwen2.5 14.8% | 동일한 GRPO 대비 +12.3%p로, 성능 향상이 skill augmentation에서 기인함을 보여줌 |
| WebShop 결과 | SKILLRL 성공률 72.7%, GRPO 66.1%, SimpleMem+GRPO 46.9% | 상품 검색, 옵션 설정, 가격·속성 검증 같은 절차적 skill이 실제 web action 성능을 개선 |
| 복잡한 ALFWorld task | GRPO 대비 Heat +15.3%p, Cool +23.0%p, PickTwo +22.8%p | 다단계 planning과 state tracking이 필요한 어려운 task일수록 task-specific skill의 효과가 큼 |
| Search QA 결과 | 전체 평균 47.1%로 EvolveR 43.1%, Search-R1 38.5%를 상회. Bamboogle에서는 73.8% 기록 |
NQ와 HotpotQA만 학습했음에도 OOD dataset에서 높은 성능을 보여, 일부 search skill이 dataset을 넘어 일반화됨 |
| Ablation: 계층 구조 제거 | ALFWorld 89.9→76.8, WebShop 72.7→61.4 | Task-specific skill만으로는 부족하며, 범용 탐색·상태 관리 원칙인 General skill이 필수적 |
| Ablation: Raw trajectory 사용 | SkillBank 대신 raw trajectory를 사용하면 ALFWorld 61.7, WebShop 50.2로 크게 하락 | 논문의 핵심 주장인 abstraction이 memorization보다 효과적이라는 점을 직접 뒷받침 |
| Ablation: Cold-start SFT 제거 | ALFWorld 65.2, WebShop 46.5로 가장 큰 폭의 성능 저하 | 좋은 skill의 존재보다, 모델이 그 skill을 실제로 사용하는 능력을 학습하는 것이 핵심 |
| Ablation: Dynamic evolution 제거 | ALFWorld 84.4, WebShop 70.3 | 초기 SkillBank와 SFT가 성능 대부분을 만들고, dynamic evolution은 새로운 실패를 보완해 추가 성능과 빠른 수렴을 제공 |
| SkillBank 성장 | 초기 55개 skill에서 학습 종료 시 100개로 증가. General 12→20, task-specific 43→80 | 학습 후반에 새로 발견되는 문제는 주로 보편적 원칙보다 특정 task의 세부 failure mode에 집중됨 |
| Context 효율성 | 개별 trajectory를 skill로 변환할 때 약 10–20배 압축. 실제 전체 prompt에서는 raw memory 평균 약 1,450 token 대비 SKILLRL은 1,300 token 미만으로 약 10.3% 감소 |
단순 token 절감보다 중요한 점은 더 짧은 context로 더 높은 task 성능을 달성했다는 것 |
| 수렴 속도 | Dynamic evolution 사용 시 약 60 step 내 80% 이상의 ALFWorld validation success에 도달하며, evolution이 없는 모델보다 빠르고 최종 성능도 높음 | 새롭게 추가된 skill이 sparse-reward 환경에서 exploration을 유도하고 local optimum 탈출을 지원 |
| 주요 기여 | ① 성공·실패 기반 skill distillation ② General–Task-specific 계층적 SkillBank ③ skill 사용을 학습하는 cold-start SFT ④ RL 중 failure-driven recursive evolution | 외부 memory를 단순 참고 자료가 아니라, policy 학습과 함께 변화하는 동적 학습 구성요소로 전환 |
| 한계 | OpenAI o3 teacher 의존, SkillBank의 지속적 증가에 따른 중복·충돌·노후화 가능성, retrieval 정확도와 실제 skill 사용률의 분리 평가 부족, 장기간 open-ended continual setting 미검증 | 향후에는 skill pruning·merging·conflict resolution, retrieval 평가, 약한 local teacher에서도의 재현성 검증이 필요 |
| 최종 결론 | SKILLRL은 과거 경험을 그대로 기억하는 대신, 경험을 재사용 가능한 skill로 추상화하고, 이를 활용하는 정책과 skill library를 실패 기반으로 함께 발전시킴 | 좋은 self-improving agent는 경험을 많이 저장하는 agent가 아니라, 경험에서 원칙을 배우고 이를 실제 행동 정책에 내재화하는 agent라는 것이 논문의 핵심 주장 |
'인공지능 > 논문 리뷰 or 진행' 카테고리의 다른 글
| Reinforcement Learning for Self-Improving Agent with Skill Library (0) | 2026.08.06 |
|---|---|
| Which Heads Matter for Reasoning? RL-Guided KV Cache Compression (0) | 2026.08.04 |
| R-KV: Redundancy-aware KV Cache Compression for Reasoning Models (0) | 2026.08.01 |
| TokenSkip: Controllable Chain-of-Thought Compression in LLMs (0) | 2026.07.29 |
| Do LLMs Encode Functional Importance of Reasoning Tokens ? (0) | 2026.07.29 |