https://neurips.cc/virtual/2025/loc/san-diego/poster/120110뉴립스 2025 포스터네요 중요하면서도 다른 토큰과 중복되지 않는 정보를 선택적으로 KV Cache에 남기는 학습 없는 압축 방법이다. 여기서도 Reasoning model의 토큰 생성 문제를 말합니다. 그러나 SnapKV와 같은 방법들은 Attention을 통해 과거 토큰의 중요도를 따지는데 동일한 문장을 여러번 반복하면 과거 문장들에 높은 attnetion을 줄 수 밖에 없다. 이 Distill model들은 정답을 내기 전에 중간 계산, 자기 검증, 재검토, reflection, 반복 등을 통해 출력이 엄청나게 늘어나게 된다. 그럼 KV cache만으로도 엄청난 저장 공간이 추가되게 된다. 여..