<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
  <channel>
    <title>공대생 도전 일지</title>
    <link>https://yoonschallenge.tistory.com/</link>
    <description>NLP, AI, XAI에 관심있는 공대생의 일기장...?</description>
    <language>ko</language>
    <pubDate>Mon, 17 Aug 2026 05:00:37 +0900</pubDate>
    <generator>TISTORY</generator>
    <ttl>100</ttl>
    <managingEditor>이게될까</managingEditor>
    <image>
      <title>공대생 도전 일지</title>
      <url>https://tistory1.daumcdn.net/tistory/6702617/attach/374521545ee145f59117a332bd6e5d88</url>
      <link>https://yoonschallenge.tistory.com</link>
    </image>
    <item>
      <title>SKILLRL: Evolving Agents via Recursive Skill-AugmentedReinforcement Learning</title>
      <link>https://yoonschallenge.tistory.com/1239</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2602.08234&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2602.08234&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1786018915222&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning&quot; data-og-description=&quot;Large Language Model (LLM) agents have shown stunning results in complex tasks, yet they often operate in isolation, failing to learn from past experiences. Existing memory-based methods primarily store raw trajectories, which are often redundant and noise&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2602.08234&quot; data-og-url=&quot;https://arxiv.org/abs/2602.08234v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/c9qxSB/dJMb8WeO8bk/QuciKkYnNf1D8dtWP7UKs1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/lS0eE/dJMb8QMrxhe/iFQYYtSkr2Zn9rxiItZ7T1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2602.08234&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2602.08234&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/c9qxSB/dJMb8WeO8bk/QuciKkYnNf1D8dtWP7UKs1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/lS0eE/dJMb8QMrxhe/iFQYYtSkr2Zn9rxiItZ7T1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Large Language Model (LLM) agents have shown stunning results in complex tasks, yet they often operate in isolation, failing to learn from past experiences. Existing memory-based methods primarily store raw trajectories, which are often redundant and noise&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;에이전트가 과거의 긴 행동 궤적을 그대로 기억하는 대신 성공과 실패 경험에서 재사용 가능한 행동 원칙인 스킬을 추출하고, 강화 학습 과정에서 스킬 library를 함꼐 발전시키는 프레임워크임.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 방법들은 모든 트레젝토리를 저장한 다음에 유사한 테스크가 들어오면 이를 검색하여 프롬프트에 넣지만 이건 긴 경로, 노이즈와 반복, 참고할 수 있지만 활용하는 능력 자체가 충분히 학습되지 않은 문제가 있다.&amp;nbsp;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;881&quot; data-origin-height=&quot;796&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/DXvI1/dJMcaiRRkIv/AlfwR6ID82dfO7mtBa8CM1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/DXvI1/dJMcaiRRkIv/AlfwR6ID82dfO7mtBa8CM1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/DXvI1/dJMcaiRRkIv/AlfwR6ID82dfO7mtBa8CM1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FDXvI1%2FdJMcaiRRkIv%2FAlfwR6ID82dfO7mtBa8CM1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;881&quot; height=&quot;796&quot; data-origin-width=&quot;881&quot; data-origin-height=&quot;796&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1245&quot; data-origin-height=&quot;558&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bkgNYb/dJMcacYn93o/miSzbwzmSoHCrbZg0G0CS1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bkgNYb/dJMcacYn93o/miSzbwzmSoHCrbZg0G0CS1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bkgNYb/dJMcacYn93o/miSzbwzmSoHCrbZg0G0CS1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbkgNYb%2FdJMcacYn93o%2FmiSzbwzmSoHCrbZg0G0CS1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1245&quot; height=&quot;558&quot; data-origin-width=&quot;1245&quot; data-origin-height=&quot;558&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;pre id=&quot;code_1786020282427&quot; class=&quot;bash&quot; data-ke-language=&quot;bash&quot; data-ke-type=&quot;codeblock&quot;&gt;&lt;code&gt;환경에서 trajectory 수집
        &amp;darr;
성공&amp;middot;실패 경험을 skill로 증류
        &amp;darr;
General / Task-specific SkillBank 구성
        &amp;darr;
Skill 사용법을 SFT로 학습
        &amp;darr;
Skill-augmented GRPO
        &amp;darr;
검증 실패 분석 &amp;rarr; SkillBank 업데이트
        ↺&lt;/code&gt;&lt;/pre&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;성공, 실패 경로를 모두 모으는데 성공은 효과적인 행동 패턴을 제공하지만 실패 경로는 어디서 실패했는지, 어떤 판단과 행동이 잘 못 되었는지, 뭘 해야 했는지, 반복하지 않기 위한 일반 원칙이 무엇인지 말해준다. == boundary condition을 발견하기 위한 자원&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;수집된 경로를 그대로 저장하지 말고 강한 teacher model인 OpenAI o3를 사용해 간결한 skill로 변환해 그냥 경로를 제공하는 것 대비 10 ~ 20배 수준의 token compression을 제공&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;계층적 SKILLBANK를 구성&lt;br /&gt;General Skills - 여러 task 유형에 공통으로 적용되는 전략&amp;nbsp;&lt;br /&gt;Task-Specific Skills - 특정 task에만 적용되는 전문적인 절차&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;task description이 주어지면 General Skill은 항상 포함하고, Task-Specific Skill은 의미적 유사도를&amp;nbsp; 통해 선택(Top-6)&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Teacher model이 skill을 명시적으로 활용하는 성공 경로를 생성하여 SFT 진행&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;GRPO를 통해 policy 최적화 진행&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 SkillBank가 다루지 못하는 스킬들을 추가하여 진행&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1131&quot; data-origin-height=&quot;774&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bvzuv4/dJMcacYn93A/g1zEfnz1gifzreSopkDNAk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bvzuv4/dJMcacYn93A/g1zEfnz1gifzreSopkDNAk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bvzuv4/dJMcacYn93A/g1zEfnz1gifzreSopkDNAk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbvzuv4%2FdJMcacYn93A%2Fg1zEfnz1gifzreSopkDNAk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1131&quot; height=&quot;774&quot; data-origin-width=&quot;1131&quot; data-origin-height=&quot;774&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;성공률이 높은 것을 볼 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;979&quot; data-origin-height=&quot;684&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bKN0Y7/dJMcadbPg3T/7am7zg78MkjJNqrxayhWhk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bKN0Y7/dJMcadbPg3T/7am7zg78MkjJNqrxayhWhk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bKN0Y7/dJMcadbPg3T/7am7zg78MkjJNqrxayhWhk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbKN0Y7%2FdJMcadbPg3T%2F7am7zg78MkjJNqrxayhWhk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;979&quot; height=&quot;684&quot; data-origin-width=&quot;979&quot; data-origin-height=&quot;684&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;NQ와 HotpotQA만 학습했음에서도 다른 task에서도 경쟁력 있는 결과를 보여주며 재사용 가능한 검색 절차로 일반화 되었음을 보여줌.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Table3를 통해 Cold-start SFT의 중요성을 보여주며 Skill 대신 raw-trajectory를 제공하면 성능이 급감하는 것도 보여준다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;우측 figure에서는 training이 진행되며 SkillBank가 어떻게 변하는지 보여주는데 general은 거의 그대로지만 대부분 증가는 Task-Specific한 것을 보여준다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1529&quot; data-origin-height=&quot;463&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bipQxx/dJMcaf8yZkY/8i0LS72D8FlsBEzSuZF2v0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bipQxx/dJMcaf8yZkY/8i0LS72D8FlsBEzSuZF2v0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bipQxx/dJMcaf8yZkY/8i0LS72D8FlsBEzSuZF2v0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbipQxx%2FdJMcaf8yZkY%2F8i0LS72D8FlsBEzSuZF2v0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1529&quot; height=&quot;463&quot; data-origin-width=&quot;1529&quot; data-origin-height=&quot;463&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;좌측은 skill을 통해 기존 경로를 주는 것 보다 더 작은 메모리를 쓰는 것을 볼 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;수렴 속도 또한 빠르며 최종 성능도 높다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1351&quot; data-origin-height=&quot;473&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/rtyHv/dJMcahFlGoe/D4jLG0BGDnMgs6RlWQW8EK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/rtyHv/dJMcahFlGoe/D4jLG0BGDnMgs6RlWQW8EK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/rtyHv/dJMcahFlGoe/D4jLG0BGDnMgs6RlWQW8EK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FrtyHv%2FdJMcahFlGoe%2FD4jLG0BGDnMgs6RlWQW8EK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1351&quot; height=&quot;473&quot; data-origin-width=&quot;1351&quot; data-origin-height=&quot;473&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;흠 스킬을 계속 Teachermodel이 생성하는 것이 마음에 걸리네요 .,...&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 1586px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;해결하려는 문제&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;기존 memory 기반 agent는 성공&amp;middot;실패 trajectory를 그대로 저장해 이후 task의 prompt에 제공함. &lt;br /&gt;그러나 trajectory는 길고, 반복&amp;middot;탐색&amp;middot;실패 행동이 포함되어 noise와 redundancy가 큼&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;과거 경험을 많이 저장하는 것보다, 경험에서 &lt;b&gt;일반화 가능한 행동 원칙을 추상화&lt;/b&gt;하는 것이 중요하다는 문제의식&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;Raw trajectory를 그대로 사용하는 대신 teacher model로 압축된 procedural skill을 생성하고, 이를 계층적 &lt;b&gt;SKILLBANK&lt;/b&gt;에 저장함. &lt;br /&gt;이후 skill을 활용하는 policy와 SkillBank를 RL 과정에서 함께 업데이트함&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;핵심은 &lt;b&gt;Experience Abstraction + Skill Utilization Training + Recursive Evolution&lt;/b&gt;의 결합&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;전체 파이프라인&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;① Base agent rollout &amp;rarr; ② 성공&amp;middot;실패 경험 수집 &amp;rarr; ③ skill distillation &amp;rarr; ④ 계층적 SkillBank 구축 &amp;rarr; ⑤ skill 활용용 cold-start SFT &amp;rarr; ⑥ skill-augmented GRPO &amp;rarr; ⑦ validation 실패로 SkillBank 갱신&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;SkillBank를 한 번 만들고 고정하는 것이 아니라, 학습 중 발생하는 새로운 실패를 통해 지속적으로 확장함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;성공 경험 처리&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;성공 trajectory에서 task 완료에 기여한 핵심 의사결정, 올바른 행동 순서, 다른 task에도 전이 가능한 전략을 teacher가 추출&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;성공 사례 전체를 모방하는 것이 아니라, &lt;b&gt;왜 성공했는지에 해당하는 전략적 패턴&lt;/b&gt;을 저장&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;실패 경험 처리&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;실패 지점, 잘못된 판단&amp;middot;행동, 올바른 대안, 동일한 실패를 피하기 위한 일반 원칙을 concise failure lesson으로 변환&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;실패 trajectory를 버리지 않고 &lt;b&gt;counterfactual knowledge와 boundary condition&lt;/b&gt;으로 활용&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Skill 표현&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;각 skill은 skill_id, 짧은 title, 행동 원칙인 principle, 적용 조건인 when_to_apply로 구성&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;단순한 자연어 조언이 아니라, 적용 조건을 포함한 &lt;b&gt;구조화된 procedural knowledge&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;General Skills&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;환경 내 여러 task에 공통으로 적용되는 탐색, 상태 추적, prerequisite 확인, goal decomposition, loop escape 등의 전략&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;다양한 task에서 공통 기반이 되는 범용 행동 원칙&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Task-Specific Skills&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;ALFWorld의 Pick, Clean, Heat, Cool, PickTwo나 WebShop의 apparel, footwear, electronics처럼 특정 category에 특화된 행동 절차와 실패 회피 전략&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;General skill이 기본 전략을 제공하고, task-specific skill이 구체적인 실행 순서를 보완&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Skill Retrieval&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;General skill은 항상 제공하며, task-specific skill은 task description과 skill embedding 간 semantic similarity로 Top-K 검색함. 실험에서는 (K=6) 사용&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;검색은 관련 skill을 context에 제공할 뿐이며, 실제 적용 여부와 조합은 학습된 policy가 observation을 보고 결정&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Cold-Start SFT&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;Teacher가 skill을 명시적으로 활용하는 성공 trajectory를 생성하고 base model을 SFT함. &lt;br /&gt;ALFWorld 7,500개, WebShop 2,400개의 synthetic example 사용&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;단순히 skill을 prompt에 넣는 것만으로는 부족하며, 모델이 &lt;b&gt;skill을 해석하고 action으로 변환하는 법&lt;/b&gt;을 먼저 학습해야 함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;강화학습 방식&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;Cold-start SFT 모델에서 시작해 GRPO로 policy를 최적화함. &lt;br /&gt;동일 task에서 여러 trajectory를 생성하고 binary task-success reward의 group-relative advantage를 사용&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;기존 GRPO와의 차이는 optimizer 자체보다 &lt;b&gt;skill-augmented context와 skill 활용 능력&lt;/b&gt;에 있음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;KL Reference Model&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;GRPO의 reference policy를 base model이 아니라 cold-start SFT 모델로 설정&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;RL 중 task 성능을 높이면서도, SFT에서 학습한 skill 활용 능력이 망각되는 것을 방지&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Recursive Skill Evolution&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;일정 validation interval마다 task category별 성공률을 확인하고, 성능이 낮은 category의 실패 trajectory를 분석해 새로운 skill을 생성하거나 기존 skill을 보완함&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;Policy가 발전해 새로운 상태를 탐색하면 새로운 실패가 나타나고, 그 실패가 다시 SkillBank를 발전시키는 &lt;b&gt;policy&amp;ndash;skill co-evolution&lt;/b&gt; 구조&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;학습 설정&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Base model은 Qwen2.5-7B-Instruct, teacher는 OpenAI o3, RL은 GRPO 사용. &lt;br /&gt;8&amp;times;H100 80GB에서 실험당 약 30시간 소요&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;강한 teacher와 상당한 연산 자원을 사용하는 설정이므로 teacher 품질과 비용 의존성이 존재&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 58px;&quot;&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;&lt;b&gt;평가 환경&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;ALFWorld, WebShop, 그리고 NQ&amp;middot;TriviaQA&amp;middot;PopQA&amp;middot;HotpotQA&amp;middot;2Wiki&amp;middot;MuSiQue&amp;middot;Bamboogle의 7개 search-augmented QA benchmark&lt;/td&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;Embodied interaction, web navigation, search reasoning이라는 서로 다른 agent task에서 방법의 범용성을 평가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;ALFWorld 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;SKILLRL &lt;b&gt;89.9%&lt;/b&gt;, GRPO 77.6%, SimpleMem+GRPO 62.5%, base Qwen2.5 14.8%&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;동일한 GRPO 대비 &lt;b&gt;+12.3%p&lt;/b&gt;로, 성능 향상이 skill augmentation에서 기인함을 보여줌&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;WebShop 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;SKILLRL 성공률 &lt;b&gt;72.7%&lt;/b&gt;, GRPO 66.1%, SimpleMem+GRPO 46.9%&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;상품 검색, 옵션 설정, 가격&amp;middot;속성 검증 같은 절차적 skill이 실제 web action 성능을 개선&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;복잡한 ALFWorld task&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;GRPO 대비 Heat +15.3%p, Cool +23.0%p, PickTwo +22.8%p&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;다단계 planning과 state tracking이 필요한 어려운 task일수록 task-specific skill의 효과가 큼&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Search QA 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;전체 평균 &lt;b&gt;47.1%&lt;/b&gt;로 EvolveR 43.1%, Search-R1 38.5%를 상회.&lt;br /&gt;Bamboogle에서는 73.8% 기록&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;NQ와 HotpotQA만 학습했음에도 OOD dataset에서 높은 성능을 보여, 일부 search skill이 dataset을 넘어 일반화됨&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 58px;&quot;&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;&lt;b&gt;Ablation: 계층 구조 제거&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;ALFWorld 89.9&amp;rarr;76.8, WebShop 72.7&amp;rarr;61.4&lt;/td&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;Task-specific skill만으로는 부족하며, 범용 탐색&amp;middot;상태 관리 원칙인 General skill이 필수적&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 56px;&quot;&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;&lt;b&gt;Ablation: Raw trajectory 사용&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;SkillBank 대신 raw trajectory를 사용하면 ALFWorld 61.7, WebShop 50.2로 크게 하락&lt;/td&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;논문의 핵심 주장인 &lt;b&gt;abstraction이 memorization보다 효과적&lt;/b&gt;이라는 점을 직접 뒷받침&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 56px;&quot;&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;&lt;b&gt;Ablation: Cold-start SFT 제거&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;ALFWorld 65.2, WebShop 46.5로 가장 큰 폭의 성능 저하&lt;/td&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;좋은 skill의 존재보다, 모델이 그 skill을 실제로 사용하는 능력을 학습하는 것이 핵심&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Ablation: Dynamic evolution 제거&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;ALFWorld 84.4, WebShop 70.3&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;초기 SkillBank와 SFT가 성능 대부분을 만들고, dynamic evolution은 새로운 실패를 보완해 추가 성능과 빠른 수렴을 제공&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;SkillBank 성장&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;초기 55개 skill에서 학습 종료 시 100개로 증가. General 12&amp;rarr;20, task-specific 43&amp;rarr;80&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;학습 후반에 새로 발견되는 문제는 주로 보편적 원칙보다 특정 task의 세부 failure mode에 집중됨&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Context 효율성&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;개별 trajectory를 skill로 변환할 때 약 10&amp;ndash;20배 압축. &lt;br /&gt;실제 전체 prompt에서는 raw memory 평균 약 1,450 token 대비 SKILLRL은 1,300 token 미만으로 약 10.3% 감소&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;단순 token 절감보다 중요한 점은 &lt;b&gt;더 짧은 context로 더 높은 task 성능&lt;/b&gt;을 달성했다는 것&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;수렴 속도&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;Dynamic evolution 사용 시 약 60 step 내 80% 이상의 ALFWorld validation success에 도달하며, evolution이 없는 모델보다 빠르고 최종 성능도 높음&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;새롭게 추가된 skill이 sparse-reward 환경에서 exploration을 유도하고 local optimum 탈출을 지원&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 58px;&quot;&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;&lt;b&gt;주요 기여&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;① 성공&amp;middot;실패 기반 skill distillation ② General&amp;ndash;Task-specific 계층적 SkillBank ③ skill 사용을 학습하는 cold-start SFT ④ RL 중 failure-driven recursive evolution&lt;/td&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;외부 memory를 단순 참고 자료가 아니라, policy 학습과 함께 변화하는 &lt;b&gt;동적 학습 구성요소&lt;/b&gt;로 전환&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;OpenAI o3 teacher 의존, SkillBank의 지속적 증가에 따른 중복&amp;middot;충돌&amp;middot;노후화 가능성, retrieval 정확도와 실제 skill 사용률의 분리 평가 부족, 장기간 open-ended continual setting 미검증&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;향후에는 skill pruning&amp;middot;merging&amp;middot;conflict resolution, retrieval 평가, 약한 local teacher에서도의 재현성 검증이 필요&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;최종 결론&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;SKILLRL은 과거 경험을 그대로 기억하는 대신, 경험을 재사용 가능한 skill로 추상화하고, 이를 활용하는 정책과 skill library를 실패 기반으로 함께 발전시킴&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;좋은 self-improving agent는 경험을 많이 저장하는 agent가 아니라, 경험에서 원칙을 배우고 이를 실제 행동 정책에 내재화하는 agent라는 것이 논문의 핵심 주장&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1239</guid>
      <comments>https://yoonschallenge.tistory.com/1239#entry1239comment</comments>
      <pubDate>Thu, 6 Aug 2026 22:26:20 +0900</pubDate>
    </item>
    <item>
      <title>Reinforcement Learning for Self-Improving Agent with Skill Library</title>
      <link>https://yoonschallenge.tistory.com/1238</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2026.acl-long.69/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2026.acl-long.69/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1786000561061&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Reinforcement Learning for Self-Improving Agent with Skill Library&quot; data-og-description=&quot;Jiongxiao Wang, Qiaojing Yan, Yawei Wang, Yijun Tian, Soumya Smruti Mishra, Zhichao Xu, Megha Gandhi, Panpan Xu, Lin Lee Cheong. Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2026.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2026.acl-long.69/&quot; data-og-url=&quot;https://aclanthology.org/2026.acl-long.69/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/sJNjC/dJMb9gxABAw/DdTisQP61SBu2yUqszuc9K/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2026.acl-long.69/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2026.acl-long.69/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/sJNjC/dJMb9gxABAw/DdTisQP61SBu2yUqszuc9K/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Reinforcement Learning for Self-Improving Agent with Skill Library&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Jiongxiao Wang, Qiaojing Yan, Yawei Wang, Yijun Tian, Soumya Smruti Mishra, Zhichao Xu, Megha Gandhi, Panpan Xu, Lin Lee Cheong. Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2026.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이번 acl 2026 long으로 뽑힌 논문이네요 .&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;RL이 특정 환경에서 높은 성능을 얻을 순 있지만 새로운 작업을 수행하면서 얻은 경험을 다음 작업에 지속적으로 활용하는 능력은 부족함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 스킬 library 연구는 성공한 경로를 저장하여 이후 작업에 재사용하지만 트롬프트 의존적이며, 성공만 최적화하고, 생성자가 장기적인 크리딧을 할당하기 어렵다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 작업 성공하는 것을 넘어 미래 작업에 재사용할 수 있는 좋은 스킬을 생성하고 활용하도록 어떻게 RL할지.&amp;nbsp;&lt;/p&gt;
&lt;pre id=&quot;code_1786017124833&quot; class=&quot;bash&quot; data-ke-language=&quot;bash&quot; data-ke-type=&quot;codeblock&quot;&gt;&lt;code&gt;Expert trajectory 생성
        &amp;darr;
Skill Library Agent 형식으로 SFT
        &amp;darr;
유사한 두 task를 하나의 task chain으로 구성
        &amp;darr;
Task 1 수행 &amp;rarr; skill 생성 및 저장
        &amp;darr;
Task 2 수행 &amp;rarr; Task 1의 skill 재사용
        &amp;darr;
task 성공 + skill 생성/사용을 함께 보상
        &amp;darr;
SAGE 기반 GRPO 업데이트&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1301&quot; data-origin-height=&quot;696&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/02hsL/dJMcacjJDku/OJJruXfhEIwXr8PKkxRISk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/02hsL/dJMcacjJDku/OJJruXfhEIwXr8PKkxRISk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/02hsL/dJMcacjJDku/OJJruXfhEIwXr8PKkxRISk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F02hsL%2FdJMcacjJDku%2FOJJruXfhEIwXr8PKkxRISk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1301&quot; height=&quot;696&quot; data-origin-width=&quot;1301&quot; data-origin-height=&quot;696&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;일반적인 코드 에이전트는 여러 API를 직접 순차 호출 But Skill Library Agent는 여러 API를 조합한 재사용 가능한 함수를 정의한 뒤 실행함.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Agent는 각 task에서 기존 스킬 사용, 스킬 생성, 스킬 업데이터, 스킬 저장을 진행할 수 있음.&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;SAGE: Skill Augmented GRPO for self-Evolution&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1. Sequential Rollout&amp;nbsp;&lt;br /&gt;유사한 두 task를 하나의 체인으로 묶고 순차 실행하여 첫 번째에서 함수(스킬)을 만들고, 그걸 두번째 테스크에서 그대로 활용할 수 있음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2. Skill-integrated Reward&lt;br /&gt;각 Task에서 보상을 받으면 이를 이용해 가중합 보상을 주는데, 단순 보상을 주는 것이 아닌 task1에서 만든 스킬을 task2에서 사용할 때 추가 보상을 줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1335&quot; data-origin-height=&quot;567&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bP74YZ/dJMb99UR3Kd/qC6aFfLnyNOf0P86BVpslk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bP74YZ/dJMb99UR3Kd/qC6aFfLnyNOf0P86BVpslk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bP74YZ/dJMb99UR3Kd/qC6aFfLnyNOf0P86BVpslk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbP74YZ%2FdJMb99UR3Kd%2FqC6aFfLnyNOf0P86BVpslk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1335&quot; height=&quot;567&quot; data-origin-width=&quot;1335&quot; data-origin-height=&quot;567&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Test환경은 Appworld로 에이전트가 API 문서를 읽고 코드를 실행하여 실제적인 디지털 작업을 수행하는 벤치마크다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TSC - 개별 task를 성공적으로 완료한 비율&amp;nbsp;&lt;br /&gt;SGC - Scenatio 내 세 task를 모두 성공한 비율&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;GRPO대비 높은 성공율을 보이며 단일 task성능보다 유사 task 사이의 skill transfer가 개선되었음을 보인다.&amp;nbsp;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;651&quot; data-origin-height=&quot;467&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/FWI7S/dJMcabd0EBG/gj4U1CE4ygKHhbvwYw2WX1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/FWI7S/dJMcabd0EBG/gj4U1CE4ygKHhbvwYw2WX1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/FWI7S/dJMcabd0EBG/gj4U1CE4ygKHhbvwYw2WX1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FFWI7S%2FdJMcabd0EBG%2Fgj4U1CE4ygKHhbvwYw2WX1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;651&quot; height=&quot;467&quot; data-origin-width=&quot;651&quot; data-origin-height=&quot;467&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;BASE 모델은 스킬을 많이 생성하지만 실제 성공률이 낮고, SFT는 생성수는 줄지만 성공률이 개선되며 SAGE는 Skill 성공률과 성공적인 skill 사용률을 모두 크게 향상시킴&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 1926px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 120px;&quot;&gt;
&lt;td style=&quot;height: 120px;&quot;&gt;&lt;b&gt;연구 문제&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 120px;&quot;&gt;기존 RL 기반 LLM 에이전트는 학습 환경에서는 성능이 향상되지만, 배포 후 새로운 작업에서 얻은 경험을 지속적으로 축적하고 재사용하는 능력이 부족하다. &lt;br /&gt;기존 skill library 방법도 대부분 프롬프트에 의존해 skill을 생성&amp;middot;사용하므로, 오픈소스 모델에서는 형식 준수와 skill 품질이 불안정하다.&lt;/td&gt;
&lt;td style=&quot;height: 120px;&quot;&gt;단순히 개별 task 성공률을 높이는 RL만으로는 &lt;b&gt;지속적으로 발전하는 agent&lt;/b&gt;를 만들기 어렵다. &lt;br /&gt;에이전트가 경험을 실행 가능한 지식으로 변환하고, 이후 task에서 재사용하도록 학습해야 한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;핵심 질문&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&amp;ldquo;현재 task를 해결하는 것뿐 아니라, 미래의 유사 task에도 유용한 skill을 생성하고 사용하는 행동을 어떻게 RL로 학습할 것인가?&amp;rdquo;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;이 논문의 초점은 일반적인 task reward가 아니라, &lt;b&gt;skill의 미래 효용에 대한 credit assignment&lt;/b&gt;이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 78px;&quot;&gt;
&lt;td style=&quot;height: 78px;&quot;&gt;&lt;b&gt;제안 방법&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 78px;&quot;&gt;&lt;b&gt;SAGE: Skill Augmented GRPO for self-Evolution&lt;/b&gt;를 제안한다. &lt;br /&gt;기존 GRPO에 &lt;b&gt;Sequential Rollout&lt;/b&gt;과 &lt;b&gt;Skill-integrated Reward&lt;/b&gt;를 결합한다.&lt;/td&gt;
&lt;td style=&quot;height: 78px;&quot;&gt;SAGE의 핵심은 skill library를 단순한 외부 memory로 붙이는 것이 아니라, &lt;b&gt;skill 생성과 재사용 자체를 policy optimization의 대상으로 포함&lt;/b&gt;하는 것이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;Skill의 형태&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;Skill은 자연어 요약이 아니라 여러 API와 프로그램 로직을 묶은 &lt;b&gt;실행 가능한 Python 함수&lt;/b&gt;이다. &lt;br /&gt;예를 들어 로그인, 연락처 검색, 메시지 전송 과정을 하나의 함수로 정의하고 저장한다.&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;실행 가능한 함수는 여러 primitive API 호출을 하나의 고수준 연산으로 압축한다. &lt;br /&gt;따라서 정확도 향상뿐 아니라 interaction step과 생성 token을 줄일 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;Skill Library Agent&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;Agent는 ① 기존 skill 사용, ② 새로운 skill 함수 생성, ③ 실패한 skill 수정, ④ 성공적으로 실행된 skill 저장을 수행한다. &lt;br /&gt;필요한 경우 단일 API를 직접 호출할 수도 있다.&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;기존 방식처럼 task 종료 후 별도로 skill을 추출하지 않고, &lt;b&gt;task를 해결하기 위해 생성한 코드 자체를 skill로 저장&lt;/b&gt;한다. &lt;br /&gt;Task solving과 skill generation의 출력 형식을 통합한 것이 특징이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 100px;&quot;&gt;
&lt;td style=&quot;height: 100px;&quot;&gt;&lt;b&gt;Sequential Rollout&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 100px;&quot;&gt;하나의 task를 독립적으로 rollout하지 않고, 동일 scenario의 유사한 두 task (q_1,q_2)를 순차적으로 수행한다. &lt;br /&gt;첫 task에서 생성한 skill은 library에 저장되어 두 번째 task에서 사용할 수 있다.&lt;/td&gt;
&lt;td style=&quot;height: 100px;&quot;&gt;첫 task의 skill 품질은 생성 시점에는 알기 어렵다. &lt;br /&gt;후속 task에서 실제로 재사용되어 성공했는지를 통해 skill의 유용성을 검증한다. &lt;br /&gt;즉, &lt;b&gt;미래 task의 성공 신호를 이전 skill 생성 행동에 전달&lt;/b&gt;한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 72px;&quot;&gt;
&lt;td style=&quot;height: 72px;&quot;&gt;&lt;b&gt;Skill Generation Reward&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 72px;&quot;&gt;첫 번째 task가 성공하고, 첫 task에서 만든 skill이 두 번째 task에 사용되며, 두 번째 task도 성공한 경우 첫 번째 task에 추가 reward를 준다.&lt;/td&gt;
&lt;td style=&quot;height: 72px;&quot;&gt;단순히 실행 가능한 함수를 많이 만드는 것이 아니라, &lt;b&gt;후속 task의 성공에 실제로 기여하는 재사용 가능한 skill&lt;/b&gt;을 생성하도록 유도한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;Skill Usage Reward&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;두 번째 task가 이전 task에서 생성된 skill을 사용하여 성공한 경우 추가 reward를 준다. &lt;br /&gt;코드를 생성하지 않고 task를 종료하면 (-1) penalty를 부여한다.&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;무조건 skill을 호출하는 행동을 장려하는 것이 아니다. &lt;br /&gt;&lt;b&gt;적절한 skill을 선택하여 성공적으로 적용한 경우에만&lt;/b&gt; 보상한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 140px;&quot;&gt;
&lt;td style=&quot;height: 140px;&quot;&gt;&lt;b&gt;기존 GRPO와 차이&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 140px;&quot;&gt;기존 GRPO는 동일 query에 대해 여러 output을 생성하고 task별 outcome reward로 비교한다. &lt;br /&gt;SAGE에서는 rollout마다 첫 task에서 생성된 skill이 다르기 때문에 두 번째 task가 서로 다른 skill library를 조건으로 수행된다. &lt;br /&gt;KL penalty와 reward 표준편차 정규화는 사용하지 않는다.&lt;/td&gt;
&lt;td style=&quot;height: 140px;&quot;&gt;SAGE는 독립 task 최적화가 아니라 &lt;b&gt;task chain과 변화하는 external memory를 포함한 RL&lt;/b&gt;이다. &lt;br /&gt;다만 rollout별 context가 달라져 기존 GRPO보다 gradient variance가 커질 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 100px;&quot;&gt;
&lt;td style=&quot;height: 100px;&quot;&gt;&lt;b&gt;학습 절차&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 100px;&quot;&gt;① Claude 3.5 Sonnet V2로 성공 trajectory를 rejection sampling하여 1,129개 expert example 생성, &lt;br /&gt;② Qwen2.5-32B-Instruct를 Skill Library Agent 형식으로 full-parameter SFT, &lt;br /&gt;③ SFT 모델에 SAGE 적용.&lt;/td&gt;
&lt;td style=&quot;height: 100px;&quot;&gt;Base model은 prompt만으로 skill 형식을 안정적으로 따르지 못했다. &lt;br /&gt;따라서 SFT는 기본적인 함수 생성&amp;middot;호출 능력을 주입하고, RL은 그 위에서 &lt;b&gt;skill의 품질, 선택, 재사용성&lt;/b&gt;을 최적화한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;왜 SFT가 필요한가&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;Base Model에서 SAGE를 바로 시작하면 Test-Normal 기준 TGC 40.7, SGC 25.6에 그친다. &lt;br /&gt;Self-Distillation은 66.5/53.6, RL Warm-Up은 68.3/55.3, expert SFT 초기화는 72.0/60.7을 달성한다.&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;논문의 최고 성능은 RL만으로 자율적인 skill behavior를 발견한 결과라기보다, &lt;b&gt;강한 expert trajectory로 행동 형식을 초기화한 뒤 RL로 정제한 결과&lt;/b&gt;이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 100px;&quot;&gt;
&lt;td style=&quot;height: 100px;&quot;&gt;&lt;b&gt;평가 환경&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 100px;&quot;&gt;AppWorld를 사용한다. &lt;br /&gt;총 750개 task, 250개 scenario이며, scenario마다 유사한 task 3개가 존재한다. &lt;br /&gt;Agent는 9개 application과 457개 API를 이용해 실제적인 디지털 작업을 수행한다.&lt;/td&gt;
&lt;td style=&quot;height: 100px;&quot;&gt;AppWorld의 scenario 구조는 이전 task의 skill을 후속 유사 task에서 검증하는 Sequential Rollout에 적합하다. &lt;br /&gt;다만 task 간 구조적 유사성이 높아 skill transfer에 유리한 benchmark라는 점도 고려해야 한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;평가 지표&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;TGC&lt;/b&gt;는 개별 task 성공률, &lt;b&gt;SGC&lt;/b&gt;는 scenario 내 세 task를 모두 성공한 비율이다. &lt;br /&gt;추가로 평균 interaction step과 평균 생성 token을 측정한다.&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;SGC는 한 번의 우연한 성공보다 여러 유사 task에서의 일관된 성공을 요구하므로, 논문에서는 &lt;b&gt;skill의 재사용성과 scenario-level self-improvement를 보여주는 핵심 지표&lt;/b&gt;로 사용된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 76px;&quot;&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;&lt;b&gt;주요 결과: Test-Normal&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;GRPO without skill library는 TGC 69.2, SGC 51.8, 16.4 steps, 3,613 tokens이다. &lt;br /&gt;SAGE는 TGC &lt;b&gt;72.0&lt;/b&gt;, SGC &lt;b&gt;60.7&lt;/b&gt;, 12.1 steps, 1,475 tokens을 달성한다.&lt;/td&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;SAGE는 GRPO 대비 SGC를 &lt;b&gt;8.9%p 향상&lt;/b&gt;시키면서 interaction step을 약 &lt;b&gt;26%&lt;/b&gt;, 생성 token을 약 &lt;b&gt;59% 감소&lt;/b&gt;시킨다. &lt;br /&gt;Skill reuse가 정확도와 효율성을 동시에 개선한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;주요 결과: Test-Challenge&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;GRPO는 TGC 40.7, SGC 26.9, 21.9 steps, 5,211 tokens이다. &lt;br /&gt;SAGE는 TGC &lt;b&gt;50.1&lt;/b&gt;, SGC &lt;b&gt;32.4&lt;/b&gt;, 17.3 steps, 1,807 tokens을 기록한다.&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;학습에서 보지 못한 application API가 포함된 환경에서도 성능과 효율성이 개선된다. &lt;br /&gt;다만 완전히 새로운 skill을 발명했다기보다, 학습된 skill 생성&amp;middot;조합 방식을 새로운 API 환경에 적용한 결과로 보는 것이 적절하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;Skill 사용 분석&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;Base Model은 skill usage rate 0.88, skill 사용 시 성공률 0.31이다. &lt;br /&gt;SFT는 각각 0.63, 0.51이며, SAGE는 &lt;b&gt;1.00, 0.72&lt;/b&gt;이다. &lt;br /&gt;실제 사용된 skill 수도 SAGE가 230개로 가장 많다.&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;Base Model은 skill을 많이 생성하지만 품질과 사용 정확도가 낮다. &lt;br /&gt;SAGE는 library의 크기 자체보다 &lt;b&gt;필요한 skill을 생성하고, 실제로 선택하며, 성공적으로 사용하는 능력&lt;/b&gt;을 높인다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Skill 제거 Ablation&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;SAGE를 skill library 없이 평가하면 TGC는 72.0&amp;rarr;71.4로 거의 유지되지만 SGC는 60.7&amp;rarr;54.8로 감소하고, step은 12.1&amp;rarr;16.0, token은 1,475&amp;rarr;1,937로 증가한다.&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;RL을 통해 backbone 자체도 향상되었지만, scenario-level 성능과 효율성 향상의 상당 부분은 &lt;b&gt;평가 시 실제 skill을 축적&amp;middot;재사용하는 과정&lt;/b&gt;에서 발생한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Reward Ablation&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;Skill-integrated Reward는 TGC/SGC 72.0/60.7, outcome-only는 69.8/55.4, chain-based reward는 67.9/56.6이다.&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;Chain 전체 성공만 보상하는 것보다 어떤 skill이 생성되고 사용되었는지를 명시적으로 추적해야 한다. &lt;br /&gt;즉, &lt;b&gt;정교한 행동 수준의 reward attribution이 중요&lt;/b&gt;하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;Retrieval 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;이상적 Same Scenario retrieval은 SGC 60.7이다. &lt;br /&gt;Query N-gram은 60.1, Query Embedding은 59.5, Skill Embedding은 56.0이다.&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;단순 N-gram이 강한 이유는 AppWorld의 동일 scenario task들이 문장 구조를 공유하기 때문이다. &lt;br /&gt;일반 semantic embedding은 tool의 실행 조건과 API 조합을 충분히 반영하지 못한다. &lt;br /&gt;&lt;b&gt;Skill/tool 전용 retriever가 향후 핵심 과제&lt;/b&gt;다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;Task chain 길이 Ablation&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;2-task chain은 TGC/SGC 72.0/60.7, 3-task chain은 70.6/54.8이며 token도 1,475&amp;rarr;2,585로 증가한다.&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;더 긴 chain이 항상 좋은 것은 아니다. &lt;br /&gt;위치별 reward imbalance, rollout마다 달라지는 skill library로 인한 gradient variance, 순차 실행 비용이 증가한다. &lt;br /&gt;현재 SAGE는 &lt;b&gt;장기 lifelong learning보다 짧은 범위의 skill transfer에 적합&lt;/b&gt;하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;주요 기여&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;① Skill library agent를 위한 RL 문제 정식화, &lt;br /&gt;② Sequential Rollout을 통한 미래 효용 기반 credit assignment, &lt;br /&gt;③ skill generation&amp;middot;usage reward 설계, &lt;br /&gt;④ 정확도와 inference 효율성의 동시 개선.&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;가장 중요한 기여는 새로운 memory 구조 자체보다, &lt;b&gt;&amp;ldquo;이 skill이 미래 task에도 도움이 되었는가?&amp;rdquo;를 RL objective에 포함한 학습 방식&lt;/b&gt;이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;AppWorld 단일 benchmark, 주요 평가에서 scenario label 사용, Claude expert data 의존, 중복&amp;middot;충돌&amp;middot;삭제&amp;middot;versioning 등 장기 skill 관리 미해결, 긴 task chain에서 성능 저하.&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;논문이 보여주는 self-improvement는 모델 파라미터가 배포 중 지속적으로 업데이트되는 continual learning이 아니다. &lt;br /&gt;정확히는 &lt;b&gt;고정된 policy가 실행 가능한 skill memory를 온라인으로 축적하고 재사용하는 memory-level adaptation&lt;/b&gt;이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;최종 메시지&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;에이전트가 현재 task만 잘 해결하도록 학습하는 것보다, 미래의 유사 task에 재사용할 수 있는 실행 가능한 skill을 만들고 활용하도록 학습하면 성능과 비용을 동시에 개선할 수 있다.&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;SAGE는 후속 task의 성공을 이전 task의 skill 생성 행동에 연결함으로써, 단순한 task solver를 경험을 축적하는 self-improving agent로 확장하려는 시도이다.&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1238</guid>
      <comments>https://yoonschallenge.tistory.com/1238#entry1238comment</comments>
      <pubDate>Thu, 6 Aug 2026 21:13:41 +0900</pubDate>
    </item>
    <item>
      <title>Which Heads Matter for Reasoning? RL-Guided KV Cache Compression</title>
      <link>https://yoonschallenge.tistory.com/1237</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2510.08525&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2510.08525&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1785740838571&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Which Heads Matter for Reasoning? RL-Guided KV Cache Compression&quot; data-og-description=&quot;Reasoning large language models exhibit complex reasoning behaviors via extended chain-of-thought generation that are highly fragile to information loss during decoding, creating critical challenges for KV cache compression. Existing token-dropping methods&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2510.08525&quot; data-og-url=&quot;https://arxiv.org/abs/2510.08525v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/KHyad/dJMb9iIVs95/VHyfulcIa8BDJoCkBCL6hk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bfUayN/dJMb9jOBwlW/dK1oqF3wzQUDFRezWOZKI1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2510.08525&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2510.08525&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/KHyad/dJMb9iIVs95/VHyfulcIa8BDJoCkBCL6hk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bfUayN/dJMb9jOBwlW/dK1oqF3wzQUDFRezWOZKI1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Which Heads Matter for Reasoning? RL-Guided KV Cache Compression&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Reasoning large language models exhibit complex reasoning behaviors via extended chain-of-thought generation that are highly fragile to information loss during decoding, creating critical challenges for KV cache compression. Existing token-dropping methods&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ICLR은 떨어지고, ICML 2026에 붙은 것 같네요&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Reasoning LLM에서 KV cache는 계산 확인하거나, 중간 결과를 유지, 풀이 탐색 등의 모든 토큰이 저장되어 출력이 길어질 수록 캐시 사용량도 선형적으로 증가함.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;KV캐시는 단순 이전 문장을 기억하는 것이 아니라 현재 까지 추론 상태와 이전에 세운 가정과 중간 결과, 추론을 계속 할지, 종료할지에 대한 흐름, 자기 수정과 이전 단계 참조에 필요한 정보를 모두 담는다고 합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 일반 LLM에서 잘 작동하던 KV 캐시 압축을 reasoning model에 적용하면 추론 과정 자체가 붕괴될 수 있다고 합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1382&quot; data-origin-height=&quot;530&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bfk8Lh/dJMcadCOktk/TxjJBJfHwoRv4QKR07oLck/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bfk8Lh/dJMcadCOktk/TxjJBJfHwoRv4QKR07oLck/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bfk8Lh/dJMcadCOktk/TxjJBJfHwoRv4QKR07oLck/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbfk8Lh%2FdJMcadCOktk%2FTxjJBJfHwoRv4QKR07oLck%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1382&quot; height=&quot;530&quot; data-origin-width=&quot;1382&quot; data-origin-height=&quot;530&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 방법들의 문제를 보여주네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰 드랍하는 방법은 지금은 중요하지 않아도 나중에 다시 필요한 토큰이 존재할 수 있는데 그 것을 없애버리고, Repetitive error가 발생한다고 합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모든 head에서 토큰을 제거하는 대신 일부 중요한 head에선 full KC cache를 할당하고 나머지 해드에는 작은 캐시만 할당하는 방법은 token dropping보다는 전체 sequence정보를 더 잘 보존할 수 있으나, Retrieval head는 긴 입력에서 특정 정보만 다시 찾아오는데 중요한 헤드지 reasoning에는 단순 정보 검색 외의 기능도 필요하기에 reasoning에 중요한 헤드와 일치하지 않게 된다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1351&quot; data-origin-height=&quot;659&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b4dW0U/dJMcaftZgMU/og6Cayqbq8RFTgBTze5NJ1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b4dW0U/dJMcaftZgMU/og6Cayqbq8RFTgBTze5NJ1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b4dW0U/dJMcaftZgMU/og6Cayqbq8RFTgBTze5NJ1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb4dW0U%2FdJMcaftZgMU%2Fog6Cayqbq8RFTgBTze5NJ1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1351&quot; height=&quot;659&quot; data-origin-width=&quot;1351&quot; data-origin-height=&quot;659&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 논문에서는 어떤 attneiton head가 실제 reasoning behavior를 유지하는데 중요한지 확인하려고 합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러기 위해 특정 헤드의 kv cache를 압축했을 때 실제 autoregressive generation의 최종 정답과 추론 행동이 어떻게 달라지는지 확인합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;각 attention head에 gate를 추가하고, full attention와 local attention의 gate 합으로 더하여 진행한다. 1은 과거 전체 KV가 필요한 head고, 0은 최근 토큰만 있어도 동작하는 head다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 하이퍼 파라미터는 고정하고, L * H 개의 gate만 학습하게 된다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;수학 문제에 대해 여러 응답을 생성하고, 최종 정답을 검사해 reward를 계산해 캐쉬 압축으로 일어나는 작은 오류가 이후 어떻게 누적되는지 리워드에 반영함.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이제 GRPO를 통해 최대한 많은 헤드를 0으로 만들게 하고, 정답은 맞출 수 있도록 유지함. 단순히 RL reward와 L1 penalty(헤드 0으로 만드는 긋)만으로는 학습이 쉽게 붕괴함&lt;/p&gt;
&lt;h3 data-end=&quot;5489&quot; data-start=&quot;5474&quot; data-ke-size=&quot;size23&quot;&gt;붕괴가 발생하는 이유&lt;/h3&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-end=&quot;5673&quot; data-start=&quot;5491&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li data-end=&quot;5518&quot; data-start=&quot;5491&quot;&gt;L1 penalty가 gate 값을 감소시킴&lt;/li&gt;
&lt;li data-end=&quot;5550&quot; data-start=&quot;5519&quot;&gt;너무 많은 head가 local cache로 전환됨&lt;/li&gt;
&lt;li data-end=&quot;5571&quot; data-start=&quot;5551&quot;&gt;reasoning 성능이 저하됨&lt;/li&gt;
&lt;li data-end=&quot;5595&quot; data-start=&quot;5572&quot;&gt;정답 reward가 거의 나오지 않음&lt;/li&gt;
&lt;li data-end=&quot;5643&quot; data-start=&quot;5596&quot;&gt;reward 신호는 약해지지만 L1 penalty는 계속 모든 gate에 적용됨&lt;/li&gt;
&lt;li data-end=&quot;5658&quot; data-start=&quot;5644&quot;&gt;gate가 더 작아짐&lt;/li&gt;
&lt;li data-end=&quot;5673&quot; data-start=&quot;5659&quot;&gt;모델이 회복하지 못함&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이를 위해 두 가지 방법을 사용함&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1. 문제를 그대로 사용하기 보단 맞춘 문제만 선별하여 출력 길이에 따라 3000개를 구성하여 출게함.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2. 평균 리워드가 낮아니면 L1 penalty를 자동으로 줄여 모델이 회복할 수 있도록 함.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;추론할 때는 이제 이진화 시켜 gate 값이 높은 상위 head만 full KV 진행하고, 나머지는 오래된 KV를 저장하지 않는 등 진행함.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 178px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 18px;&quot;&gt;
&lt;td style=&quot;height: 18px;&quot;&gt;&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;height: 18px;&quot;&gt;&lt;b&gt;R-KV&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 18px;&quot;&gt;&lt;b&gt;RLKV&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;압축 단위&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;각 head 내부의 토큰&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;attention head&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;중요도 기준&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;attention 및 token redundancy&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;실제 reasoning rollout의 정답 reward&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;모든 head 압축 여부&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;대부분의 head에서 토큰 제거&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;중요한 head는 전혀 압축하지 않음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;보존 대상&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;중요하다고 판단된 토큰&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;reasoning-critical head의 전체 history&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;대표 오류&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;반복 루프, 추론 일관성 붕괴&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;중간 sparsity에서는 상대적으로 안정적&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;학습 필요&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;기본적으로 heuristic 중심&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;모델별 gate RL 학습 필요&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;장점&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;별도 full-cache head를 두지 않아 단순함&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;reasoning 성능을 더 안정적으로 보존&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;단점&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;중요한 reasoning token을 제거할 위험&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;사전 학습 비용과 정적 head selection 필요&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;679&quot; data-origin-height=&quot;594&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ciRj3Y/dJMcahZBXp6/Ng4xhJqvlMwcpeVA6DNUvk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ciRj3Y/dJMcahZBXp6/Ng4xhJqvlMwcpeVA6DNUvk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ciRj3Y/dJMcahZBXp6/Ng4xhJqvlMwcpeVA6DNUvk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FciRj3Y%2FdJMcahZBXp6%2FNg4xhJqvlMwcpeVA6DNUvk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;679&quot; height=&quot;594&quot; data-origin-width=&quot;679&quot; data-origin-height=&quot;594&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLama와 Qwen2.5는 모든 헤드의 중요도가 높게 나타났다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Qwen 3는 중요한 헤드와 압축 가능한 헤드가 섞여 있었다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;670&quot; data-origin-height=&quot;552&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/pcCb7/dJMcahZBXqe/A7kgpgqVMd27cKDYkCGk70/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/pcCb7/dJMcahZBXqe/A7kgpgqVMd27cKDYkCGk70/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/pcCb7/dJMcahZBXqe/A7kgpgqVMd27cKDYkCGk70/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FpcCb7%2FdJMcahZBXqe%2FA7kgpgqVMd27cKDYkCGk70%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;670&quot; height=&quot;552&quot; data-origin-width=&quot;670&quot; data-origin-height=&quot;552&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;RL 학습이 붕괴하는 모습을 보여주며 그냥 진행하면 gate평균 값이 낮아질수록 모델이 망가지지만, 파란색은 gate도 낮추며 모델 성능도 최대한 유지했다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1380&quot; data-origin-height=&quot;676&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cfc3Un/dJMcaasJYZb/0oN4O25OqFwHk3erezfMDK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cfc3Un/dJMcaasJYZb/0oN4O25OqFwHk3erezfMDK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cfc3Un/dJMcaasJYZb/0oN4O25OqFwHk3erezfMDK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcfc3Un%2FdJMcaasJYZb%2F0oN4O25OqFwHk3erezfMDK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1380&quot; height=&quot;676&quot; data-origin-width=&quot;1380&quot; data-origin-height=&quot;676&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;압축률이 높을수록 성능이 낮아지긴 하지만 이 논문의 방식이 잘 버티는 것을 볼 수 있었다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;683&quot; data-origin-height=&quot;518&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/MPXKM/dJMcagsT9DG/TVVuNIdjqHvVRTVuIhCcU0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/MPXKM/dJMcagsT9DG/TVVuNIdjqHvVRTVuIhCcU0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/MPXKM/dJMcagsT9DG/TVVuNIdjqHvVRTVuIhCcU0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FMPXKM%2FdJMcagsT9DG%2FTVVuNIdjqHvVRTVuIhCcU0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;683&quot; height=&quot;518&quot; data-origin-width=&quot;683&quot; data-origin-height=&quot;518&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;대부분 모델에서 20 ~ 40%가 안정적이었지만 일부 테스크에서는 50 ~ 60%까지 성공하는 부분도 있었다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;986&quot; data-origin-height=&quot;574&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/lYXlY/dJMcaaGjeXG/Xp0t3PQNcnuUq9FqJkrzuK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/lYXlY/dJMcaaGjeXG/Xp0t3PQNcnuUq9FqJkrzuK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/lYXlY/dJMcaaGjeXG/Xp0t3PQNcnuUq9FqJkrzuK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FlYXlY%2FdJMcaaGjeXG%2FXp0t3PQNcnuUq9FqJkrzuK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;986&quot; height=&quot;574&quot; data-origin-width=&quot;986&quot; data-origin-height=&quot;574&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Ablation에서는 Adaptibe penalty Weighting, Self-distillation sampling, L1 weight를 실험하여 RL 자체 뿐이 아니라 다른 요인에 크게 의존하는 것을 보여준다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Table3는 속도 향상과 정확도를 부여주며 단일 요청이 아니라 KV메모리 절약을 통해 동시 실행할 수 있는 요청 수가 증가하여 얻은 개선이다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;table4는 Sink와 Local Window 크기의 영향을 보여주며, 적게 썼을 때와 크게 썼을 때의 차이를 보여주며 클 수록 높은 압축률에도 더 좋은 성능을 보여준다.&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;문제 정의&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Reasoning LLM은 긴 Chain-of-Thought를 생성하므로 KV cache 메모리와 추론 비용이 크게 증가한다. &lt;br /&gt;그러나 기존 KV cache 압축을 적용하면 중간 추론 정보가 손실되어 &lt;b&gt;반복 생성, 오답, 지나치게 긴 추론&lt;/b&gt;이 발생한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;기존 Token-dropping의 한계&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;H2O, R-KV처럼 각 head 내부에서 중요도가 낮은 토큰을 제거하면, 현재는 중요하지 않아 보이지만 이후 추론에서 다시 필요한 중간 상태까지 삭제될 수 있다. &lt;br /&gt;이 경우 추론 흐름이 끊기고 동일 문장이나 계산을 반복하는 &lt;b&gt;repetitive error&lt;/b&gt;가 주로 발생한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;기존 Head-reallocation의 한계&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;DuoAttention, KVZip은 일부 head에 full KV cache를 할당하지만, 주로 long-context retrieval에 중요한 &lt;b&gt;retrieval head&lt;/b&gt;를 기준으로 선택한다. &lt;br /&gt;Retrieval head는 정보 검색에는 중요하지만 CoT 일관성, 추론 진행 및 종료를 보존하는 head와 일치하지 않을 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 가설&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;모든 attention head가 전체 과거 토큰의 KV cache를 필요로 하는 것은 아니다. &lt;br /&gt;일부 &lt;b&gt;reasoning-critical head&lt;/b&gt;만 full history를 필요로 하며, 나머지 head는 초기 sink token과 최근 token만 유지해도 된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Reasoning-critical head의 정의&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Full KV cache 대신 local KV cache를 사용했을 때 reasoning 성능이 크게 감소하는 head. &lt;br /&gt;논문은 이 head들이 CoT consistency와 generation termination에 중요한 것으로 해석한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 방법: RLKV&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;각 layer와 KV head에 학습 가능한 gate &lt;span&gt;&lt;span&gt;&amp;alpha;_{l,h}&lt;/span&gt;&lt;/span&gt;를 추가한다. &lt;br /&gt;각 head의 출력은 &lt;span&gt;&lt;span&gt;&amp;alpha;&amp;sdot;Full Attention+(1&amp;minus;&amp;alpha;)&amp;sdot;Local Attention&lt;/span&gt;&lt;/span&gt;으로 계산된다. &lt;br /&gt;&lt;span&gt;&lt;span&gt;&amp;alpha;&lt;/span&gt;&lt;/span&gt;가 높을수록 해당 head가 full KV cache에 의존한다는 의미다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;왜 강화학습을 사용하는가?&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Attention score나 next-token loss 같은 정적 proxy 대신, 압축된 상태에서 모델이 실제로 생성한 autoregressive CoT의 &lt;b&gt;최종 정답 여부&lt;/b&gt;를 직접 관찰하기 위해서다. &lt;br /&gt;이를 통해 초기의 작은 압축 오류가 긴 생성 과정에서 누적되는 영향까지 반영한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;RL 학습 방식&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;LLM 본체는 고정하고 &lt;span&gt;&lt;span&gt;L &amp;times; H&lt;/span&gt;&lt;/span&gt;개의 gate만 GRPO로 학습한다. &lt;br /&gt;정답을 생성한 rollout에는 높은 reward를 주어 필요한 head의 gate를 유지하고, L1 penalty는 불필요한 gate를 0에 가깝게 만들어 full-cache head 수를 줄인다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;학습 목적식의 의미&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;Reasoning reward &lt;/span&gt;&lt;/span&gt;&lt;span&gt;&amp;minus; &lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&amp;beta;&lt;/span&gt;&lt;span&gt;∥&lt;/span&gt;&lt;span&gt;&amp;alpha;&lt;/span&gt;&lt;span&gt;&lt;span&gt;∥_&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;1&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;. &lt;br /&gt;Reward는 추론 능력을 보존하고, L1 regularization은 full KV cache 사용 head를 최소화한다. &lt;br /&gt;두 신호의 경쟁을 통해 reasoning-critical head가 선택된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Self-distillation sampling&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;모델이 full KV cache 상태에서 이미 맞힐 수 있는 DeepScaleR 문제만 선별하고, 출력 길이에 따라 3,000개를 구성한다. &lt;br /&gt;이 연구의 목표는 새로운 추론 능력 학습이 아니라 &lt;b&gt;기존 능력을 압축 후에도 보존할 head를 찾는 것&lt;/b&gt;이기 때문이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Adaptive penalty weighting&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;압축이 과도해져 reward가 떨어지면 L1 penalty를 약화하거나 제거한다. &lt;br /&gt;이는 sparse reward가 사라진 상태에서 dense L1 penalty만 계속 gate를 0으로 밀어 학습이 붕괴하는 것을 방지한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;추론 시 적용 방식&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;학습된 gate를 기준으로 상위 head를 reasoning-critical head로 선택한다. &lt;br /&gt;이 head들은 전체 KV cache를 유지하고, 나머지 head들은 기본 설정에서 &lt;b&gt;첫 16개 sink token과 최근 64개 local token&lt;/b&gt;만 저장한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;R-KV와의 핵심 차이&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;R-KV는 &lt;b&gt;각 head에서 어떤 토큰을 삭제할지&lt;/b&gt; 결정한다. &lt;br /&gt;RLKV는 &lt;b&gt;어떤 head에서는 과거 토큰을 전부 보존해야 하는지&lt;/b&gt; 결정한다. &lt;br /&gt;따라서 중요한 reasoning head 내부의 중간 정보를 임의로 삭제하지 않는다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;평가 모델&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Llama-3.1-8B-R1, Qwen-2.5-7B-R1, Qwen-3-4B-Thinking.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;평가 태스크&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;수학 추론: GSM8K, Math500, AIME24 / 코드: MBPP / 지식 추론: MMLU-Pro의 Chemistry, CS, Law, Physics / 장문 추론: 최대 70K context의 LongReason.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;비교 방법&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Token-dropping: H2O, R-KV / Head-reallocation: DuoAttention, KVZip.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 정확도 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;모델과 태스크에 따라 &lt;b&gt;20&amp;ndash;60% KV cache budget sparsity에서 near-lossless 성능&lt;/b&gt;을 달성했다. &lt;br /&gt;다수 설정에서 기존 방법보다 높은 정확도를 보였으며, 일부 결과는 full KV cache baseline과 같거나 약간 높았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;대표 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Llama-3.1-8B-R1 Math500에서 40% sparsity로 정확도 84.6%를 기록해 full baseline보다 1.6%p 높았다. &lt;br /&gt;Qwen-2.5-7B-R1 GSM8K에서는 40% sparsity에서 90.1%, Qwen-3-4B-Thinking Math500에서는 60% sparsity에서 75.6%로 full 대비 2.0%p 감소에 그쳤다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Long-context 일반화&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Gate는 최대 8K-token rollout으로 학습했지만 70K context의 LongReason에서도 기존 방법보다 우수했다. &lt;br /&gt;이는 특정 토큰 위치보다는 full history가 필요한 head의 특성을 학습했을 가능성을 보여준다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;시스템 효율성&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;SGLang에 full-head용 paged KV pool과 compressed-head용 고정 크기 circular buffer를 구현했다. &lt;br /&gt;절약한 메모리를 더 많은 동시 요청에 사용해 continuous batching 처리량을 높였다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;속도 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Llama-3.1-8B-R1 Math500에서 40% sparsity는 정확도를 유지하면서 &lt;b&gt;1.56&amp;times; end-to-end speedup&lt;/b&gt;, 60% sparsity는 &lt;b&gt;2.06&amp;times; speedup&lt;/b&gt;을 달성했다. &lt;br /&gt;다만 60%에서는 정확도가 79.4%에서 73.8%로 감소했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;속도 결과의 올바른 해석&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;2.06배는 단일 요청 latency가 그대로 절반이 되었다는 뜻이 아니다. &lt;br /&gt;KV cache 절감으로 동시 처리 요청 수를 150개에서 375개로 늘려 얻은 &lt;b&gt;serving-level throughput 개선&lt;/b&gt;이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Head sensitivity 분석&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;RLKV가 높은 점수를 부여한 head부터 압축하면 retrieval head나 random head를 압축할 때보다 정확도가 더 빠르게 감소했다. &lt;br /&gt;이는 선택된 head가 실제 reasoning 성능에 민감하다는 근거다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;오류 유형 분석&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Token-dropping 및 reasoning-critical head 압축은 주로 &lt;b&gt;repetitive/incorrect error&lt;/b&gt;를 유발했다. &lt;br /&gt;Retrieval head 기반 압축은 문장은 유창하지만 결론에 도달하지 못하는 &lt;b&gt;overlength error&lt;/b&gt;가 상대적으로 많았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;논문의 주요 발견&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Reasoning-critical head는 retrieval head와 기능적으로 다르다. &lt;br /&gt;전자는 단순 정보 검색보다 &lt;b&gt;CoT 일관성 유지, 추론 진행, 반복 방지, 생성 종료&lt;/b&gt;와 더 밀접한 것으로 나타났다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 기여&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;① RL을 reasoning head 탐색용 on-policy probe로 사용 &lt;br /&gt;② retrieval head와 reasoning-critical head의 차이를 실험적으로 제시 &lt;br /&gt;③ head-level cache 압축을 실제 SGLang serving speedup으로 연결.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계 1&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Gate와 head 선택이 학습 이후 고정되는 &lt;b&gt;static allocation&lt;/b&gt;이다. &lt;br /&gt;문제 유형이나 query에 따라 중요한 head가 달라질 수 있지만 query-adaptive gating은 다루지 않았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계 2&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;모델마다 reasoning-critical head 분포가 달라 별도의 RL 학습이 필요하다. &lt;br /&gt;모델별 학습 비용은 약 22&amp;ndash;40 GPU-hours이며, 학습된 head mask의 모델 간 전이 가능성은 검증하지 않았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계 3&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;80% 수준의 극단적인 sparsity에서는 대부분 성능이 크게 붕괴한다. &lt;br /&gt;더 높은 압축률을 달성하려면 KV quantization 등 다른 압축 기법과의 결합이 필요하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계 4&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;수학 문제처럼 최종 정답을 자동 검증할 수 있는 reward를 사용했다. &lt;br /&gt;Open-ended generation, agent, 주관적 평가 태스크에서 어떤 reward를 사용할지는 추가 연구가 필요하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;최종 핵심 메시지&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Reasoning LLM의 KV cache를 안전하게 압축하려면 모든 head에서 토큰을 조금씩 삭제하기보다, &lt;b&gt;실제 생성 결과를 통해 전체 history가 반드시 필요한 소수의 head를 찾아 보호해야 한다.&lt;/b&gt; &lt;br /&gt;RLKV는 이를 통해 중간 수준의 cache 절감에서 reasoning 성능과 serving 효율을 함께 확보한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1237</guid>
      <comments>https://yoonschallenge.tistory.com/1237#entry1237comment</comments>
      <pubDate>Tue, 4 Aug 2026 20:46:42 +0900</pubDate>
    </item>
    <item>
      <title>R-KV: Redundancy-aware KV Cache Compression for Reasoning Models</title>
      <link>https://yoonschallenge.tistory.com/1236</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://neurips.cc/virtual/2025/loc/san-diego/poster/120110&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://neurips.cc/virtual/2025/loc/san-diego/poster/120110&lt;/a&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;뉴립스 2025 포스터네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;중요하면서도 다른 토큰과 중복되지 않는 정보를 선택적으로 KV Cache에 남기는 학습 없는 압축 방법이다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서도 Reasoning model의 토큰 생성 문제를 말합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러나 SnapKV와 같은 방법들은 Attention을 통해 과거 토큰의 중요도를 따지는데 동일한 문장을 여러번 반복하면 과거 문장들에 높은 attnetion을 줄 수 밖에 없다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1144&quot; data-origin-height=&quot;618&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bAYQsS/dJMcaiKWNry/uEM2KZ0pLDxPHi7JWgtZk0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bAYQsS/dJMcaiKWNry/uEM2KZ0pLDxPHi7JWgtZk0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bAYQsS/dJMcaiKWNry/uEM2KZ0pLDxPHi7JWgtZk0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbAYQsS%2FdJMcaiKWNry%2FuEM2KZ0pLDxPHi7JWgtZk0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1144&quot; height=&quot;618&quot; data-origin-width=&quot;1144&quot; data-origin-height=&quot;618&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 Distill model들은 정답을 내기 전에 중간 계산, 자기 검증, 재검토, reflection, 반복 등을 통해 출력이 엄청나게 늘어나게 된다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그럼 KV cache만으로도 엄청난 저장 공간이 추가되게 된다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;636&quot; data-origin-height=&quot;688&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/3ZWaU/dJMcafOnhs8/rzIkGjGvxIRHEg2vHSCta1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/3ZWaU/dJMcafOnhs8/rzIkGjGvxIRHEg2vHSCta1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/3ZWaU/dJMcafOnhs8/rzIkGjGvxIRHEg2vHSCta1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F3ZWaU%2FdJMcafOnhs8%2FrzIkGjGvxIRHEg2vHSCta1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;636&quot; height=&quot;688&quot; data-origin-width=&quot;636&quot; data-origin-height=&quot;688&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 중복되는 정보가 계속 남는다는 것을 알 수 있다. =&amp;gt; Attention이 높다는 것이 사실과 새로운 정보를 제공한다는 것은 동일하지 않다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1118&quot; data-origin-height=&quot;549&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/pKnkv/dJMcahyz0la/aWW7epEAs0BPXRs7TydrW0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/pKnkv/dJMcahyz0la/aWW7epEAs0BPXRs7TydrW0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/pKnkv/dJMcahyz0la/aWW7epEAs0BPXRs7TydrW0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FpKnkv%2FdJMcahyz0la%2FaWW7epEAs0BPXRs7TydrW0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1118&quot; height=&quot;549&quot; data-origin-width=&quot;1118&quot; data-origin-height=&quot;549&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;B_Budget : 이전 토큰 중 선택된 KV를 저장하는 고정 cache&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;B_buffer : 새롭게 생성되는 토큰들의 KV를 임시 저장하는 버퍼&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;가장 최근 8토큰은 무조건 유지 =&amp;gt; 나머지 후보 토큰들의 중요도와 중복도를 계산 =&amp;gt; 캐시 버짓에 맞게 상위 토큰만 선택 =&amp;gt; 선택되지 않은 KV는 제거 =&amp;gt; 다시 128토큰 생성&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 버짓 근처에서 유지하게 됨&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰의 중요도는 최근 8토큰이 얼마나 해당 토큰에 attention하는지를 이용해 계산함&amp;nbsp;&lt;br /&gt;- 최근 생성된 토큰이 과저의 특정 토큰을 계속 참조하면 그 과거 토큰은 앞으로도 필요할 가능성 높음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;각 토큰의 키 벡터 사이의 코사인 유사도를 계산하여 특정 토큰의 키 벡터가 다른 많은 토큰과 유사하다면 그 토큰은 이미 캐시에 존재하는 정보와 겹친다고 봄&amp;nbsp;&lt;br /&gt;그래도 최근 유사 토큰은 보호하여 reasoning state를 유지함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;중요도와 중복도를 결합하여 진행함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1085&quot; data-origin-height=&quot;803&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cZvfbe/dJMcaiRNtwo/CL1OInR43tPfqqojGHLO3k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cZvfbe/dJMcaiRNtwo/CL1OInR43tPfqqojGHLO3k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cZvfbe/dJMcaiRNtwo/CL1OInR43tPfqqojGHLO3k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcZvfbe%2FdJMcaiRNtwo%2FCL1OInR43tPfqqojGHLO3k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1085&quot; height=&quot;803&quot; data-origin-width=&quot;1085&quot; data-origin-height=&quot;803&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;생각보다 결과가 엄청 좋습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;특히 라마 8B의 압축률은 심각하네요 ....&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;FullKV보다 성능이 높아지는 이유에서 저자는 노이즈와 같은 상태들을 제거하여 잘못된 추론으로 끌려가는 현상을 줄인다고 설명한다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1096&quot; data-origin-height=&quot;734&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/QrBAL/dJMcadbLEQn/GKiKQtPlZ5ErQUxjVS1hyK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/QrBAL/dJMcadbLEQn/GKiKQtPlZ5ErQUxjVS1hyK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/QrBAL/dJMcadbLEQn/GKiKQtPlZ5ErQUxjVS1hyK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FQrBAL%2FdJMcadbLEQn%2FGKiKQtPlZ5ErQUxjVS1hyK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1096&quot; height=&quot;734&quot; data-origin-width=&quot;1096&quot; data-origin-height=&quot;734&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1111&quot; data-origin-height=&quot;497&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/S45DQ/dJMcaiKWNuY/etNcB3WjdNohAulbMYrQWk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/S45DQ/dJMcaiKWNuY/etNcB3WjdNohAulbMYrQWk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/S45DQ/dJMcaiKWNuY/etNcB3WjdNohAulbMYrQWk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FS45DQ%2FdJMcaiKWNuY%2FetNcB3WjdNohAulbMYrQWk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1111&quot; height=&quot;497&quot; data-origin-width=&quot;1111&quot; data-origin-height=&quot;497&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;메모리 처리량도 비교해보면 R-KV는 버짓을 유지하니 메모리가 선형적으로 증가하지 않고, 배치를 더 키울 수 있게 되며 디코딩타임도 조금 감소하게 되네요.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;흠 성능도 올라가면서 KV 캐시 사용량 10%까지도 줄일 수 있는 이 논문이 상당히 무섭네요.....&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;뭐 다른 벤치마크에서는 30%까지 가야 본문치는 실험도 있긴 하지만..&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 1040px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;해결하려는 문제&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;DeepSeek-R1 계열 reasoning model은 긴 Chain-of-Thought와 반복적인 자기 검증을 생성한다. &lt;br /&gt;이로 인해 생성 길이에 비례해 KV cache가 커지며, GPU 메모리 사용량과 inference 비용이 급증한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;핵심 관찰&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Reasoning 출력은 정답 해설보다 약 &lt;b&gt;8&amp;ndash;14배 길고&lt;/b&gt;, 1-/2-gram 반복 빈도도 약 &lt;b&gt;5&amp;ndash;7배 높다&lt;/b&gt;. &lt;br /&gt;즉, 긴 reasoning trace의 상당 부분은 새로운 정보가 아니라 반복적인 reflection과 재계산이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;기존 방법의 한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;SnapKV와 같은 attention 기반 방법은 attention score가 높은 토큰을 남긴다. &lt;br /&gt;그러나 반복된 문장들은 서로 유사하기 때문에 높은 attention을 받을 수 있다. &lt;br /&gt;그 결과 중요한 문제 조건이나 중간 계산은 제거되고, &amp;ldquo;Wait&amp;rdquo;, &amp;ldquo;따라서 답은 3이다&amp;rdquo;와 같은 반복 구간이 과도하게 보존된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;논문의 핵심 주장&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Attention이 높다는 것과 새로운 정보를 제공한다는 것은 다르다.&lt;/b&gt; &lt;br /&gt;따라서 KV cache에는 단순히 중요한 토큰이 아니라, &lt;b&gt;중요하면서도 다른 토큰과 중복되지 않는 정보&lt;/b&gt;를 남겨야 한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;제안 방법&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;R-KV&lt;/b&gt;는 decoding 중 KV cache를 반복적으로 압축하며, 각 토큰의 ① attention 기반 중요도와 ② Key vector 기반 중복도를 함께 계산하여 보존할 토큰을 선택한다. &lt;br /&gt;별도 학습이나 모델 파라미터 수정은 필요 없다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Decoding-time 압축 방식&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;고정 크기의 기존 cache &lt;span&gt;&lt;span&gt;B_budget&lt;/span&gt;&lt;/span&gt;와 새 토큰 &lt;span&gt;&lt;span&gt;B_buffer&lt;/span&gt;&lt;/span&gt;를 사용한다. 일정 길이의 토큰이 생성될 때마다 기존 cache와 buffer를 합치고, 최근 observation token 일부는 무조건 유지한 뒤 나머지를 점수에 따라 pruning한다. &lt;br /&gt;기본 설정은 buffer 128개, observation token 8개이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;중요도 계산&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;최근 observation token들이 과거 Key token에 부여하는 attention weight를 이용한다. &lt;br /&gt;최근 토큰들이 자주 참조하는 과거 토큰일수록 높은 중요도 (I_i)를 가진다. &lt;br /&gt;GQA에서는 공유 KV head에 속한 여러 query head의 attention을 &lt;b&gt;max pooling&lt;/b&gt;하여 중요한 신호가 평균화되어 사라지는 것을 방지한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;중복도 계산&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;동일 attention head 내 Key vector 간 cosine similarity를 계산한다. &lt;br /&gt;다른 많은 Key와 유사한 토큰은 정보가 반복되어 있다고 보고 높은 중복도 (R_i)를 부여한다. &lt;br /&gt;단, 유사 토큰 중 가장 최근의 &amp;beta;개는 현재 reasoning state를 반영할 수 있으므로 보호한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;최종 선택 기준&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;Z_&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;i &lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;= &lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&amp;lambda;&lt;/span&gt;&lt;span&gt;&lt;span&gt;I_&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;i &lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&amp;minus; &lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;&amp;minus;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&amp;lambda;&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;span&gt;&lt;span&gt;R_&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;i&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;. 중요도가 높을수록 점수가 증가하고, 중복도가 높을수록 감소한다. &lt;br /&gt;실험에서는 &lt;span&gt;&lt;span&gt;&amp;lambda;=0.1&lt;/span&gt;&lt;/span&gt;이 가장 좋았다. 중요도만 사용하거나 중복도만 사용하는 경우 모두 성능이 크게 하락했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;직관적 의미&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;제한된 cache에 같은 결론을 반복한 토큰 여러 개를 저장하는 대신, 문제 조건&amp;middot;중간 계산&amp;middot;수정된 판단&amp;middot;최근 결론처럼 &lt;b&gt;서로 다른 역할을 하는 정보&lt;/b&gt;를 골고루 보존한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;실험 모델 및 데이터&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;DeepSeek-R1-Distill-Llama-8B, DeepSeek-R1-Distill-Qwen-14B를 사용하고, MATH-500과 AIME 2024에서 평가했다. &lt;br /&gt;비교 대상은 모든 KV를 저장하는 FullKV와 attention 기반 SnapKV이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;정확도 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;R1-Llama-8B는 MATH-500에서 약 &lt;b&gt;34%&lt;/b&gt;, AIME 2024에서 약 &lt;b&gt;10%의 KV cache&lt;/b&gt;만으로 FullKV 수준의 성능을 달성했다. &lt;br /&gt;AIME 2024에서는 약 16% budget에서 FullKV 대비 약 &lt;b&gt;105% 성능&lt;/b&gt;을 기록했다. &lt;br /&gt;R1-Qwen-14B도 AIME 2024에서 약 25% budget으로 FullKV에 근접하고, 33% budget에서 FullKV를 넘어섰다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Baseline 대비 효과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;동일 KV budget에서 SnapKV보다 최대 약 &lt;b&gt;40%p 높은 정확도&lt;/b&gt;를 보였다. &lt;br /&gt;특히 reasoning trace가 긴 AIME 2024에서 성능 격차가 크게 나타났다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;FullKV보다 좋아질 수 있는 이유&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;FullKV에는 잘못된 가설, 오래된 계산, 반복적인 자기 의심도 모두 남는다. &lt;br /&gt;R-KV는 이러한 상태를 일부 제거하여 모델이 과거의 잘못된 reasoning에 다시 끌려가는 현상을 줄이는 &lt;b&gt;context denoising 또는 inference-time regularization&lt;/b&gt; 역할을 할 가능성이 있다. &lt;br /&gt;다만 논문에서 이를 직접 인과적으로 검증하지는 않았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;메모리 효과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;고정 cache budget을 사용하므로 FullKV와 달리 생성 길이가 증가해도 KV 메모리가 선형으로 증가하지 않는다. &lt;br /&gt;10% budget 설정에서 약 &lt;b&gt;90% KV cache 메모리 절감&lt;/b&gt;을 달성했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;처리량 효과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;16K 생성에서 10% budget을 사용하면 FullKV보다 약 &lt;b&gt;9배 큰 batch size&lt;/b&gt;, 약 &lt;b&gt;6.6배 높은 throughput&lt;/b&gt;을 지원했다. &lt;br /&gt;고정 budget 1,024에서는 최대 약 &lt;b&gt;13.4배 큰 batch size와 9.2배 throughput&lt;/b&gt;을 기록했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;무엇을 압축하는가&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;생성되는 reasoning token 자체를 줄이는 방법은 아니다. &lt;br /&gt;모델은 여전히 긴 CoT를 생성하지만, 그 과정에서 attention이 참조하는 &lt;b&gt;과거 Key/Value 상태만 선택적으로 제거&lt;/b&gt;한다. &lt;br /&gt;따라서 output token 비용이나 생성 step 수보다는 KV 메모리와 attention 연산량을 줄인다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;주요 기여&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;① reasoning model의 KV 압축 문제를 &lt;b&gt;중복 정보 보존 문제&lt;/b&gt;로 재정의, &lt;br /&gt;② importance와 redundancy를 결합한 decoding-time eviction 제안, &lt;br /&gt;③ training-free&amp;middot;model-agnostic 방식으로 높은 압축률과 reasoning 성능 유지, &lt;br /&gt;④ LLM serving과 RL rollout에서 활용 가능한 효율성 입증&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;수학 reasoning 데이터셋과 두 개의 DeepSeek-R1 distilled 모델에 평가가 제한되어 있다. &lt;br /&gt;중복도 계산은 O(B_{budget}^2) 복잡도를 가진다. 또한 Paged Attention 및 기존 serving framework와의 통합, KV memory 재할당 비용 등 실제 시스템 구현상의 문제가 남아 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;최종 해석&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;이 논문은 &amp;ldquo;과거 토큰을 얼마나 많이 저장할 것인가&amp;rdquo;보다 &lt;b&gt;&amp;ldquo;제한된 cache에 어떤 서로 다른 정보를 남길 것인가&amp;rdquo;가 더 중요하다&lt;/b&gt;고 주장한다. &lt;br /&gt;Reasoning trace의 반복성을 명시적으로 고려하면 전체 KV cache의 일부만으로도 추론 능력을 거의 보존할 수 있다는 것이 핵심이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;div data-ke-type=&quot;moreLess&quot; data-text-more=&quot;더보기&quot; data-text-less=&quot;닫기&quot;&gt;&lt;a class=&quot;btn-toggle-moreless&quot;&gt;더보기&lt;/a&gt;
&lt;div class=&quot;moreless-content&quot;&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;1. 코딩&amp;middot;에이전트에서도 유사한 연구가 있는가?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;있다.&lt;/b&gt; 특히 2025년 말부터 2026년 사이에, R-KV처럼 일반적인 attention score만 사용하지 않고 &lt;b&gt;도메인 특유의 중요도&amp;middot;중복성&lt;/b&gt;을 이용하는 연구들이 등장했다. 다만 R-KV가 &lt;b&gt;생성 중인 reasoning trace의 KV를 decoding 단계에서 압축&lt;/b&gt;한다면, 코딩&amp;middot;에이전트 연구는 주로 코드베이스, 도구 실행 기록, 스크린샷, 대화 이력과 같은 &lt;b&gt;입력 및 trajectory context&lt;/b&gt;를 압축한다는 차이가 있다.&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;CodeComp: Structural KV Cache Compression for Agentic Coding&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Fault localization, patch generation 등 coding agent&lt;/td&gt;
&lt;td&gt;Attention만 사용하면 call site, branch condition, assignment 같은 구조적으로 중요한 코드를 제거할 수 있다고 지적한다. Joern으로 추출한 &lt;b&gt;Code Property Graph 구조 정보&lt;/b&gt;를 KV 선택 prior로 활용한다. Training-free이며 SGLang 기반 coding pipeline에 통합한다.&lt;/td&gt;
&lt;td&gt;&lt;b&gt;코딩 분야에서 가장 직접적인 대응 연구&lt;/b&gt;다. R-KV가 의미적 중복성을 추가한다면, CodeComp는 프로그램 구조적 중요성을 추가한다. 다만 주 대상은 긴 코드 입력 context이지, 생성된 code reasoning trace의 반복성은 아니다. (&lt;a href=&quot;https://arxiv.org/abs/2604.10235&quot;&gt;arXiv&lt;/a&gt;)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;SideQuest: Model-Driven KV Cache Management for Long-Horizon Agentic Reasoning&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Deep research, browsing, tool-calling 등 장기 agent task&lt;/td&gt;
&lt;td&gt;고정 attention heuristic 대신, reasoning model 자체가 현재 context에서 더 이상 필요 없는 구간을 판단해 삭제한다. Memory 관리 작업은 main reasoning과 병렬인 auxiliary thread에서 수행한다.&lt;/td&gt;
&lt;td&gt;R-KV보다 상위 수준의 &lt;b&gt;semantic garbage collection&lt;/b&gt;이다. R-KV는 토큰별 수치 점수를 사용하지만 SideQuest는 agent가 context의 미래 유용성을 직접 추론한다. Peak KV 사용량을 56&amp;ndash;65% 줄이고, SGLang 실험에서 최대 throughput을 약 83.9% 높였다. (&lt;a href=&quot;https://arxiv.org/html/2602.22603v2&quot;&gt;arXiv&lt;/a&gt;)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;GUI-KV&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;GUI agent의 연속 스크린샷과 action history&lt;/td&gt;
&lt;td&gt;현재 screenshot에서 중요한 visual token은 hidden-state norm으로 보강하고, 이전 screenshot과 중복되는 visual KV는 key-subspace projection으로 제거한다.&lt;/td&gt;
&lt;td&gt;R-KV의 &lt;b&gt;importance + redundancy&lt;/b&gt; 구성을 GUI의 공간적 중요도와 시간적 중복성으로 바꾼 형태다. 10&amp;ndash;20% 수준의 cache budget에서도 full-cache에 근접하며, 5개 screenshot 조건에서 decoding FLOPs를 38.9% 줄였다. (&lt;a href=&quot;https://arxiv.org/html/2510.00536v1&quot;&gt;arXiv&lt;/a&gt;)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;ST-Lite&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Long-horizon GUI agent&lt;/td&gt;
&lt;td&gt;UI component의 공간적 saliency와 trajectory 내 반복 screenshot의 semantic redundancy를 함께 계산한다.&lt;/td&gt;
&lt;td&gt;GUI-KV와 마찬가지로 R-KV의 핵심 아이디어를 agent trajectory에 적용한 사례다. 10&amp;ndash;20% KV budget에서 약 2.45배 decoding acceleration을 보고한다. (&lt;a href=&quot;https://arxiv.org/abs/2603.00188&quot;&gt;arXiv&lt;/a&gt;)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;EpiCache&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;장기 대화형 assistant 및 multi-turn QA&lt;/td&gt;
&lt;td&gt;대화 이력을 semantic episode로 clustering하고, 질의와 관련된 episode별 KV를 보존한다. Layer별 eviction 민감도에 따라 budget도 다르게 배분한다.&lt;/td&gt;
&lt;td&gt;개별 토큰 중복성보다 &lt;b&gt;대화 주제 단위의 다양성&amp;middot;관련성&lt;/b&gt;을 보존한다. 4&amp;ndash;6배 압축에서 near-full-KV 정확도를 유지하고 latency를 최대 2.4배 줄였다. (&lt;a href=&quot;https://arxiv.org/html/2509.17396v3&quot;&gt;arXiv&lt;/a&gt;)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Continuum&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;도구 호출을 포함하는 multi-turn agent serving&lt;/td&gt;
&lt;td&gt;Agent가 tool을 실행하는 동안 KV cache를 바로 버리지 않고, 예상 재사용 가치에 따라 TTL 동안 GPU에 유지한다.&lt;/td&gt;
&lt;td&gt;압축 알고리즘이라기보다 &lt;b&gt;cache scheduling/reuse&lt;/b&gt; 연구다. SWE-Bench 등의 agent workload에서 평균 job completion time을 8배 이상 개선했다고 보고한다. (&lt;a href=&quot;https://arxiv.org/abs/2511.02230&quot;&gt;arXiv&lt;/a&gt;)&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;가장 가까운 논문을 고르면&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;코딩:&lt;/b&gt; CodeComp&lt;/li&gt;
&lt;li&gt;&lt;b&gt;일반적인 장기 agent reasoning:&lt;/b&gt; SideQuest&lt;/li&gt;
&lt;li&gt;&lt;b&gt;GUI agent:&lt;/b&gt; GUI-KV 또는 ST-Lite&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;특히 CodeComp와 GUI-KV는 R-KV와 매우 유사한 연구 흐름을 보인다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;[&lt;br /&gt;\text{일반 attention importance}&lt;br /&gt;+&lt;br /&gt;\text{도메인 특화 신호}&lt;br /&gt;]&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;R-KV: attention 중요도 + reasoning token 중복도&lt;/li&gt;
&lt;li&gt;CodeComp: attention 중요도 + code structure&lt;/li&gt;
&lt;li&gt;GUI-KV: attention 중요도 + spatial saliency + temporal redundancy&lt;/li&gt;
&lt;li&gt;EpiCache: attention/관련성 + episode structure&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 최근 연구 흐름은 &lt;b&gt;&amp;ldquo;모든 task에 동일한 KV eviction rule을 적용하는 대신, task-specific structure를 이용해 무엇을 기억할지 결정하자&amp;rdquo;&lt;/b&gt;로 이동하고 있다고 볼 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다만 &lt;b&gt;생성 중인 코딩 CoT나 code token의 반복성을 R-KV처럼 직접 제거하는 연구는 상대적으로 덜 탐색되어 있다.&lt;/b&gt; CodeComp도 주로 코드베이스 입력의 구조적 중요성에 집중한다. 이 지점은 아직 충분한 연구 공간이 있다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h1&gt;2. R-KV에서 시간은 왜 생각보다 적게 줄었는가?&lt;/h1&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;맞다. R-KV는 KV memory를 최대 90% 이상 줄이지만, &lt;b&gt;단일 응답의 생성 시간은 그만큼 줄지 않는다.&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문의 batch size 1 결과는 다음과 같다.&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;8K&lt;/td&gt;
&lt;td&gt;107.30초&lt;/td&gt;
&lt;td&gt;100.60초&lt;/td&gt;
&lt;td&gt;약 &lt;b&gt;6.2%&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;16K&lt;/td&gt;
&lt;td&gt;234.65초&lt;/td&gt;
&lt;td&gt;201.18초&lt;/td&gt;
&lt;td&gt;약 &lt;b&gt;14.3%&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉, 90% memory saving이 90% latency reduction으로 이어지는 것이 아니다. 논문의 큰 수치인 &lt;b&gt;6.6배 또는 9.2배 throughput 향상은 한 요청이 6&amp;ndash;9배 빨라졌다는 의미가 아니라, 절약한 메모리로 훨씬 큰 batch를 동시에 처리할 수 있다는 의미&lt;/b&gt;다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;원인 1. 생성하는 토큰 수는 전혀 줄지 않는다&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;R-KV는 reasoning trace 자체를 압축하지 않는다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;예를 들어 모델이 16,000 tokens을 생성한다면:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;FullKV: 16,000번 autoregressive decoding&lt;/li&gt;
&lt;li&gt;R-KV: 동일하게 16,000번 autoregressive decoding&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;R-KV가 줄이는 것은 각 step에서 참고하는 과거 KV의 양이다. 따라서 다음 연산은 그대로 수행된다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;모든 Transformer layer의 forward&lt;/li&gt;
&lt;li&gt;Q/K/V projection&lt;/li&gt;
&lt;li&gt;MLP/FFN&lt;/li&gt;
&lt;li&gt;normalization&lt;/li&gt;
&lt;li&gt;residual connection&lt;/li&gt;
&lt;li&gt;vocabulary logits 계산&lt;/li&gt;
&lt;li&gt;sampling&lt;/li&gt;
&lt;li&gt;16,000회의 순차적 token generation&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉,&lt;/p&gt;
&lt;h1&gt;[&lt;br /&gt;\text{전체 시간}&lt;/h1&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;\text{Attention 시간}&lt;br /&gt;+&lt;br /&gt;\text{나머지 모델 연산}&lt;br /&gt;+&lt;br /&gt;\text{압축 오버헤드}&lt;br /&gt;]&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;R-KV가 줄이는 것은 이 가운데 주로 &lt;b&gt;Attention 시간&lt;/b&gt;뿐이다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;원인 2. Attention은 전체 decoding 연산의 일부일 뿐이다&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;KV cache가 90% 줄어도 다음 연산량은 거의 변하지 않는다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;MLP/FFN matrix multiplication&lt;/li&gt;
&lt;li&gt;attention projection&lt;/li&gt;
&lt;li&gt;output projection&lt;/li&gt;
&lt;li&gt;LM head&lt;/li&gt;
&lt;li&gt;모델 weight 로딩&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;특히 batch size 1에서는 GPU가 매 token마다 거대한 모델 weight를 메모리에서 읽는 비용이 크다. KV cache를 줄여도 model weight bandwidth와 FFN 비용은 그대로 남는다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Amdahl&amp;rsquo;s law로 생각하면 이해하기 쉽다. 예를 들어 전체 시간 중 KV attention이 20%이고 이를 10배 가속해도,&lt;/p&gt;
&lt;h1&gt;[&lt;br /&gt;\text{Speedup}&lt;/h1&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;\frac{1}{0.8+0.2/10}&lt;br /&gt;\approx 1.22&lt;br /&gt;]&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;전체 시간은 약 18% 정도만 감소한다. 이 수치는 설명을 위한 예시이지만, R-KV의 16K 결과인 약 14% 감소와 같은 방향을 보인다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;원인 3. R-KV 자체에도 압축 계산 비용이 있다&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;R-KV는 128개 토큰을 생성할 때마다 다음 작업을 수행한다.&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;최근 query와 cache 사이 attention 중요도 계산&lt;/li&gt;
&lt;li&gt;Key vector normalization&lt;/li&gt;
&lt;li&gt;모든 Key 쌍의 cosine similarity 계산&lt;/li&gt;
&lt;li&gt;중복도 softmax 계산&lt;/li&gt;
&lt;li&gt;importance와 redundancy 결합&lt;/li&gt;
&lt;li&gt;Top-k token 선택&lt;/li&gt;
&lt;li&gt;선택된 KV를 새로운 cache로 복사&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;특히 redundancy 계산은 budget (B)에 대해&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;[&lt;br /&gt;O(B^2)&lt;br /&gt;]&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;복잡도를 가진다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 attention 대상이 줄면서 얻는 시간 이득 중 일부가 &lt;b&gt;similarity 계산, sorting, indexing, memory copy&lt;/b&gt;에 의해 상쇄된다. 논문도 R-KV가 SnapKV보다 약간의 추가 계산을 갖지만, throughput 차이는 1% 미만이라고 설명한다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;원인 4. GPU kernel이 압축된 KV 구조를 충분히 활용하지 못할 수 있다&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이론적으로 KV가 줄면 attention 연산도 크게 줄어야 한다. 그러나 실제 구현에서는 다음 문제가 생긴다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;KV 위치가 불규칙해져 contiguous memory access가 어려움&lt;/li&gt;
&lt;li&gt;pruning 후 KV tensor 재배치 필요&lt;/li&gt;
&lt;li&gt;cache allocation/deallocation 발생&lt;/li&gt;
&lt;li&gt;PagedAttention block 구조와 충돌&lt;/li&gt;
&lt;li&gt;기존 FlashAttention/vLLM kernel이 동적 eviction을 직접 지원하지 않음&lt;/li&gt;
&lt;li&gt;Python 또는 일반 PyTorch 연산으로 scoring하면 kernel launch overhead 증가&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;R-KV 논문도 PagedAttention 호환성과 serving framework의 native compression interface 부재를 주요 한계로 명시한다. 압축 전 cache를 해제하고 압축 cache를 다시 할당해야 한다면, memory management 비용이 실제 acceleration을 상쇄할 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 때문에 최근 LongFlow 같은 연구는 압축 알고리즘 자체뿐 아니라 &lt;b&gt;FlashAttention, importance scoring, eviction을 하나의 custom kernel로 fuse&lt;/b&gt;하는 방향을 택한다. (&lt;a href=&quot;https://arxiv.org/abs/2603.11504?utm_source=chatgpt.com&quot;&gt;arXiv&lt;/a&gt;)&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;원인 5. R-KV의 주요 목표는 latency보다 throughput이다&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;R-KV의 가장 큰 장점은 한 요청을 빠르게 끝내는 것이 아니라, 같은 GPU에 더 많은 요청을 올리는 것이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;16K 조건을 보면:&lt;/p&gt;
&lt;br /&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 64px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 18px;&quot;&gt;
&lt;td style=&quot;height: 18px;&quot;&gt;FullKV&lt;/td&gt;
&lt;td style=&quot;height: 18px;&quot;&gt;30&lt;/td&gt;
&lt;td style=&quot;height: 18px;&quot;&gt;347 tok/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 18px;&quot;&gt;
&lt;td style=&quot;height: 18px;&quot;&gt;R-KV, 10% budget&lt;/td&gt;
&lt;td style=&quot;height: 18px;&quot;&gt;271&lt;/td&gt;
&lt;td style=&quot;height: 18px;&quot;&gt;2,300 tok/s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 18px;&quot;&gt;
&lt;td style=&quot;height: 18px;&quot;&gt;R-KV, fixed 1,024&lt;/td&gt;
&lt;td style=&quot;height: 18px;&quot;&gt;402&lt;/td&gt;
&lt;td style=&quot;height: 18px;&quot;&gt;3,189 tok/s&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;10% budget: batch 약 &lt;b&gt;9배&lt;/b&gt;, throughput 약 &lt;b&gt;6.6배&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;fixed 1,024: batch 약 &lt;b&gt;13.4배&lt;/b&gt;, throughput 약 &lt;b&gt;9.2배&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 큰 이득은 &lt;b&gt;각 응답이 9배 빨라서가 아니라, 9&amp;ndash;13배 많은 응답을 병렬로 처리하기 때문&lt;/b&gt;이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉, R-KV는 다음 환경에서 특히 유리하다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;RL rollout처럼 수백 개 reasoning sample을 동시에 생성&lt;/li&gt;
&lt;li&gt;Best-of-N 또는 pass@k sampling&lt;/li&gt;
&lt;li&gt;고동시성 LLM serving&lt;/li&gt;
&lt;li&gt;동일 모델에서 여러 agent를 병렬 실행&lt;/li&gt;
&lt;li&gt;GPU memory 때문에 batch size가 제한되는 환경&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;반대로 사용자가 한 명이고 batch size가 1이라면, 체감 latency 개선은 제한적이다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h1&gt;3. 핵심 결론&lt;/h1&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;R-KV의 성능을 정확히 해석하면 다음과 같다.&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;R-KV는 &amp;ldquo;생각을 더 빨리 끝내게 하는 방법&amp;rdquo;이라기보다, &amp;ldquo;긴 생각을 훨씬 적은 메모리로 수행하여 더 많은 생각을 동시에 실행하게 하는 방법&amp;rdquo;이다.&lt;/b&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단일 요청 latency를 크게 줄이려면 KV cache compression만으로는 부족하다. 다음 요소가 함께 필요하다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;[&lt;br /&gt;\text{KV compression}&lt;br /&gt;+&lt;br /&gt;\text{CoT token 감소}&lt;br /&gt;+&lt;br /&gt;\text{optimized sparse/compact attention kernel}&lt;br /&gt;+&lt;br /&gt;\text{large-batch scheduling}&lt;br /&gt;]&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서 코드&amp;middot;에이전트 연구에서 가장 유망한 방향은 &lt;b&gt;R-KV식 domain-aware KV selection과 실제 trajectory/token 길이 감소를 결합하는 것&lt;/b&gt;이다. 예를 들어 coding agent에서는 반복되는 tool output과 실패 로그는 제거하면서, call graph&amp;middot;수정 이력&amp;middot;test failure evidence는 유지하고, 동시에 불필요한 reflection 생성 자체도 억제하는 구조가 더 큰 end-to-end 시간 절감을 만들 수 있다.&lt;/p&gt;
&lt;/div&gt;
&lt;/div&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1236</guid>
      <comments>https://yoonschallenge.tistory.com/1236#entry1236comment</comments>
      <pubDate>Sat, 1 Aug 2026 01:36:10 +0900</pubDate>
    </item>
    <item>
      <title>TokenSkip: Controllable Chain-of-Thought Compression in LLMs</title>
      <link>https://yoonschallenge.tistory.com/1235</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.12067&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2502.12067&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1785329043745&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;TokenSkip: Controllable Chain-of-Thought Compression in LLMs&quot; data-og-description=&quot;Chain-of-Thought (CoT) has been proven effective in enhancing the reasoning capabilities of large language models (LLMs). Recent advancements, such as OpenAI's o1 and DeepSeek-R1, suggest that scaling up the length of CoT sequences during inference could f&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2502.12067&quot; data-og-url=&quot;https://arxiv.org/abs/2502.12067v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bgapGc/dJMb887mTnc/MnEA4ySExyAOFRscQJhATK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bB5Xro/dJMb86PfSWo/xzMGKO4wcxZ4XCMokkXac0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.12067&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2502.12067&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bgapGc/dJMb887mTnc/MnEA4ySExyAOFRscQJhATK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bB5Xro/dJMb86PfSWo/xzMGKO4wcxZ4XCMokkXac0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;TokenSkip: Controllable Chain-of-Thought Compression in LLMs&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Chain-of-Thought (CoT) has been proven effective in enhancing the reasoning capabilities of large language models (LLMs). Recent advancements, such as OpenAI's o1 and DeepSeek-R1, suggest that scaling up the length of CoT sequences during inference could f&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2025 emnlp main에 붙은 논문이네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기선 사후에 CoT를 잘라내는 것이 아닌 중요도가 낮은 토큰을 없앤 데이터로 llm을 fine-tuning하여 압축된 cot를 직접 생성하게 만들려고 합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;동일하게 긴 reasoning trace를 지적합니다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;670&quot; data-origin-height=&quot;592&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Ar0sB/dJMcaiqEVEX/YCtkff0gHPG4p6HvMEHxD1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Ar0sB/dJMcaiqEVEX/YCtkff0gHPG4p6HvMEHxD1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Ar0sB/dJMcaiqEVEX/YCtkff0gHPG4p6HvMEHxD1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FAr0sB%2FdJMcaiqEVEX%2FYCtkff0gHPG4p6HvMEHxD1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;670&quot; height=&quot;592&quot; data-origin-width=&quot;670&quot; data-origin-height=&quot;592&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;본인 trace에서 pruining을 진행하고, 학습하여 효율성을 높인다! 입니다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1193&quot; data-origin-height=&quot;465&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c8o6wN/dJMcahk5JJn/Y78brKBfQGodnHE6KwJevk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c8o6wN/dJMcahk5JJn/Y78brKBfQGodnHE6KwJevk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c8o6wN/dJMcahk5JJn/Y78brKBfQGodnHE6KwJevk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc8o6wN%2FdJMcahk5JJn%2FY78brKBfQGodnHE6KwJevk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1193&quot; height=&quot;465&quot; data-origin-width=&quot;1193&quot; data-origin-height=&quot;465&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1205&quot; data-origin-height=&quot;436&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bWobSS/dJMcagfkfoG/azvVW8PkXIOzqqAmC7Piuk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bWobSS/dJMcagfkfoG/azvVW8PkXIOzqqAmC7Piuk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bWobSS/dJMcagfkfoG/azvVW8PkXIOzqqAmC7Piuk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbWobSS%2FdJMcagfkfoG%2FazvVW8PkXIOzqqAmC7Piuk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1205&quot; height=&quot;436&quot; data-origin-width=&quot;1205&quot; data-origin-height=&quot;436&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;데이터 생성 후 틀린 Trajectory는 제거하고, 정답을 맞춘 데이터만 compressor에 넘어가게 됩니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 LLMLingua-2의 bidirectional token classifier(GPT-4로 학습된 모델)을 통해 &lt;span style=&quot;color: #333333; text-align: start;&quot;&gt;각 토큰에 대해 중요도를 계산하고,&lt;span&gt;&amp;nbsp;지정된 비율에 맞춰 토큰을 제거합니다.&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #333333; text-align: start;&quot;&gt;&lt;span&gt;학습할 땐 비율을 0.5 ~ 1 까지 다 진행하여 원본도 학습해 reasoning 능력이 손상되지 않도록 진행함.&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #333333; text-align: start;&quot;&gt;&lt;span&gt;학습은 LoRA로 진행하고, 입력에는 압축률또한 들어가서 압축률에 맞는 추론을 진행하도록 함.&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;887&quot; data-origin-height=&quot;803&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bam7aU/dJMcag0DqRK/154WvqP3AyWkpVHGCKCAJK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bam7aU/dJMcag0DqRK/154WvqP3AyWkpVHGCKCAJK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bam7aU/dJMcag0DqRK/154WvqP3AyWkpVHGCKCAJK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbam7aU%2FdJMcag0DqRK%2F154WvqP3AyWkpVHGCKCAJK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;887&quot; height=&quot;803&quot; data-origin-width=&quot;887&quot; data-origin-height=&quot;803&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;스킵율이 커질 수록 성능은 약해지지만 토큰도 감소하게 된다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;0.7일 때 약간 성능이 증가하는 모습에서 중요 토큰 사이의 short cut을 잘 학습했다고 저자는 말한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;0.3, 0.4에선 제대로 비율대로 압축하지 못하는 것을 보이기도 한다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1391&quot; data-origin-height=&quot;482&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dadjAG/dJMcaaTIp3s/I8pvp3SnoyjE4xSjvEn7o1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dadjAG/dJMcaaTIp3s/I8pvp3SnoyjE4xSjvEn7o1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dadjAG/dJMcaaTIp3s/I8pvp3SnoyjE4xSjvEn7o1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdadjAG%2FdJMcaaTIp3s%2FI8pvp3SnoyjE4xSjvEn7o1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1391&quot; height=&quot;482&quot; data-origin-width=&quot;1391&quot; data-origin-height=&quot;482&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;누가 토큰을 고르냐도 중요하긴 하네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;더 좋은 모델을 사용했을 때 정답을 유지하면서 토큰 감소량이 큽니다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1213&quot; data-origin-height=&quot;683&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cmDLjZ/dJMcabLXVuJ/KA6GTdUrdzmJOAKDGCOkO0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cmDLjZ/dJMcabLXVuJ/KA6GTdUrdzmJOAKDGCOkO0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cmDLjZ/dJMcabLXVuJ/KA6GTdUrdzmJOAKDGCOkO0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcmDLjZ%2FdJMcabLXVuJ%2FKA6GTdUrdzmJOAKDGCOkO0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1213&quot; height=&quot;683&quot; data-origin-width=&quot;1213&quot; data-origin-height=&quot;683&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기선 실제 CoT 압축 사례를 보여준다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;해결하려는 문제&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;긴 Chain-of-Thought(CoT)는 추론 성능을 높이지만, autoregressive decoding으로 인해 &lt;b&gt;생성 토큰 수, latency, KV-cache 메모리, attention 계산량&lt;/b&gt;이 증가한다. &lt;br /&gt;기존의 간결화 프롬프트는 길이를 정확히 제어하지 못하고, 단순 truncation은 핵심 계산이나 정답까지 잘라 성능을 크게 떨어뜨린다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 연구 질문&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;CoT의 모든 토큰이 최종 정답 도출에 동일하게 중요한가?&lt;/b&gt; &lt;br /&gt;저자들은 숫자&amp;middot;수식&amp;middot;핵심 개념은 상대적으로 중요하지만, 접속사&amp;middot;관사&amp;middot;반복 설명 등은 중요도가 낮아 제거 가능하다고 본다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;중요도가 낮은 CoT 토큰을 제거한 압축 trajectory로 LLM을 fine-tuning하여, 추론 시 모델이 &lt;b&gt;불필요한 토큰을 직접 건너뛰고 중요한 reasoning token 사이의 shortcut을 생성&lt;/b&gt;하도록 학습한다. &lt;br /&gt;이는 reasoning step 자체를 삭제하기보다 &lt;b&gt;각 step 내부의 언어적 중복을 압축&lt;/b&gt;하는 방식이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Token importance 측정&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;기본적으로 &lt;b&gt;LLMLingua-2의 bidirectional token classifier&lt;/b&gt;를 사용한다. &lt;br /&gt;전체 문맥을 양방향으로 보고 각 토큰의 중요 확률을 계산하기 때문에, causal LM perplexity 기반 Selective Context보다 위치 편향과 단방향 문맥 한계를 줄인다. &lt;br /&gt;TokenSkip이 매 trajectory를 GPT-4로 직접 라벨링하는 것은 아니며, GPT-4o는 별도 비교 실험에서 상한선에 가까운 compressor로 사용된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Step 1: CoT 생성 및 필터링&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;대상 LLM이 각 학습 문제에 대해 원본 CoT와 답을 생성한다. &lt;br /&gt;이후 &lt;b&gt;정답이 틀린 trajectory는 제거&lt;/b&gt;하여 올바른 reasoning 결과만 압축 학습에 사용한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Step 2: Token pruning&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;각 CoT 토큰 &lt;span&gt;&lt;span&gt;c_i&lt;/span&gt;&lt;/span&gt;의 중요도 &lt;span&gt;&lt;span&gt;I(c_i)&lt;/span&gt;&lt;/span&gt;를 계산하고, 지정된 비율 &lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&amp;gamma;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;에 따라 threshold를 정한다. &lt;br /&gt;중요도가 threshold 이상인 토큰만 유지하여 압축 CoT &lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;c&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;~&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;를 만든다. &lt;br /&gt;논문에서 &lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&amp;gamma;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;는 compression ratio라고 부르지만 실질적으로는 &lt;b&gt;원본 토큰의 유지 비율&lt;/b&gt;에 가깝다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;압축률 설정&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;학습 시 &lt;span&gt;&lt;span&gt;&amp;gamma;&amp;isin;{0.5, 0.6, 0.7, 0.8, 0.9, 1.0} &lt;/span&gt;&lt;/span&gt;중 하나를 sample마다 무작위로 선택한다.&lt;br /&gt;&lt;span&gt;&lt;span&gt;&amp;gamma;=1.0&lt;/span&gt;&lt;/span&gt;은 원본 CoT, &lt;span&gt;&lt;span&gt;&amp;gamma;=0.5&lt;/span&gt;&lt;/span&gt;는 대략 절반 정도의 토큰을 유지하는 설정이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Step 3: 학습 형식&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;입력은 Question [EOS] &amp;gamma; [EOS], target은 Compressed CoT + Original Answer로 구성한다. &lt;b&gt;CoT만 압축하고 최종 답은 변경하지 않는다.&lt;/b&gt; 원본 CoT가 포함된 &amp;gamma;=1.0 데이터도 함께 학습하여 기존 reasoning 능력 손상을 완화한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;학습 방법과 비용&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;LoRA 기반 SFT를 사용한다. &lt;br /&gt;주요 설정은 LoRA rank 8, alpha 16, 3 epochs, learning rate &lt;span&gt;&lt;span&gt;5&amp;times;10^{&amp;minus;5}&lt;/span&gt;&lt;/span&gt;이다. &lt;br /&gt;Qwen2.5-14B에서는 약 &lt;b&gt;0.2%의 파라미터만 학습&lt;/b&gt;하며, RTX 3090 두 장에서 7B는 약 2시간, 14B는 약 2.5시간이 소요된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;추론 방식&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;추론 시 질문과 원하는 &amp;gamma;만 입력하면 모델이 처음부터 압축된 CoT를 생성한다. &lt;br /&gt;전체 CoT를 먼저 생성한 뒤 후처리하는 방식이 아니므로, inference 단계에서는 LLMLingua-2나 별도 compressor가 필요 없다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;평가 모델&amp;middot;데이터&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;LLaMA-3.1-8B-Instruct, Qwen2.5-3B/7B/14B-Instruct를 사용한다. &lt;br /&gt;주요 벤치마크는 GSM8K와 MATH-500이며, 추가적으로 MMLU-STEM과 CommonsenseQA에서 일반화 성능을 평가한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;비교 방법&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Be concise, Only use numbers or equations, 단어 축약 프롬프트, 고정 비율 길이 제어 프롬프트, 단순 output truncation과 비교한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;대표 결과: Qwen2.5-14B / GSM8K&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;원본은 정확도 &lt;b&gt;93.1%&lt;/b&gt;, 평균 CoT &lt;b&gt;313.11 tokens&lt;/b&gt;이다. &lt;br /&gt;TokenSkip &amp;gamma;=0.6은 &lt;b&gt;180.68 tokens&lt;/b&gt;로 약 40% 이상 줄이면서 정확도 &lt;b&gt;92.7%&lt;/b&gt;, 즉 &lt;b&gt;0.4%p 하락&lt;/b&gt;만 보였다. &lt;br /&gt;&amp;gamma;=0.7에서는 218.62 tokens로 줄이면서 정확도가 오히려 93.4%로 나타났다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;대표 결과: LLaMA-3.1-8B / GSM8K&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;원본은 86.2%, 213.17 tokens, 5.96초이다. &lt;br /&gt;&amp;gamma;=0.7에서는 82.5%, 150.12 tokens, 4.36초로 약 &lt;b&gt;1.4&amp;times; speedup&lt;/b&gt;을 얻었다. &lt;br /&gt;&amp;gamma;=0.5에서는 113.05 tokens와 1.8&amp;times; speedup을 달성하지만 정확도는 78.2%로 하락한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;대표 결과: LLaMA-3.1-8B / MATH-500&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;원본은 48.6%, 502.60 tokens, 16.37초이다. &lt;br /&gt;&amp;gamma;=0.7에서는 46.7%, 349.13 tokens, 11.55초로 &lt;b&gt;토큰 약 30% 감소, 정확도 1.9%p 하락, 약 1.4&amp;times; speedup&lt;/b&gt;을 보였다. &lt;br /&gt;복잡한 수학 문제에서는 GSM8K보다 압축에 따른 성능 저하가 크다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;기존 방법 대비 장점&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;간결화&amp;middot;길이 제어 프롬프트는 목표 비율을 제대로 따르지 못했다. &lt;br /&gt;MATH-500에서 일부 프롬프트의 실제 유지 비율은 0.94&amp;sim;0.97에 머물렀다. &lt;br /&gt;반면 truncation은 목표 길이는 맞추지만 GSM8K의 0.5 설정에서 정확도가 86.2%에서 7.0%로 급락했다. &lt;br /&gt;TokenSkip은 &lt;b&gt;압축률 제어와 정답 성능 보존을 동시에 달성&lt;/b&gt;한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;중요 분석 1: 실제 중요 토큰을 남기는가?&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;원본 CoT에만 나타난 skipped token은 낮은 importance score에 집중되고, 압축 CoT에 유지된 token은 높은 score에 집중되었다. &lt;br /&gt;이는 모델이 단순히 짧게 생성하는 것이 아니라, 학습된 중요도 패턴에 따라 불필요한 토큰을 생략한다는 근거다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;중요 분석 2: 모델 크기 효과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;압축이 강할수록 대형 모델이 더 안정적이었다. &lt;br /&gt;약 50% 유지 시 정확도 하락은 Qwen2.5-3B &amp;minus;9.3%p, 7B &amp;minus;5.4%p, 14B &amp;minus;1.7%p였다. &lt;br /&gt;큰 모델일수록 중요한 reasoning state 사이의 shortcut을 더 잘 학습하는 것으로 해석된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;중요 분석 3: 동일 token budget에서의 효과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;MATH-500에서 TokenSkip에 원본 모델과 동일한 최대 생성 길이를 제공하면 &amp;gamma;=0.7, 0.8, 0.9에서 원본보다 &lt;b&gt;1.3&amp;sim;2.6%p 높은 정확도&lt;/b&gt;를 보였다. &lt;br /&gt;이는 압축 표현이 고정된 token budget을 더 효율적으로 사용할 가능성을 보여준다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;도메인 일반화&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;MMLU-STEM에서는 약 40% 토큰을 줄여도 원본과 비슷하거나 더 높은 정확도를 보였고, CommonsenseQA의 Qwen2.5-14B에서는 약 50% 토큰을 줄인 &amp;gamma;=0.5에서도 정확도 82.1%가 유지되었다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;CoT 복원 실험&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;압축 CoT를 LLaMA-3.1-8B 또는 GPT-4o에 입력하면 자연어 형태의 상세 reasoning으로 복원할 수 있음을 정성적으로 보였다. &lt;br /&gt;다만 복원된 설명이 실제 내부 reasoning과 동일한지, 모든 논리 정보가 보존되는지는 정량적으로 검증하지 않았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 기여&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;① CoT를 reasoning step 단위가 아닌 &lt;b&gt;token 단위로 압축&lt;/b&gt;했다. &lt;br /&gt;② 하나의 모델에서 여러 &amp;gamma;를 지원해 정확도&amp;ndash;효율 trade-off를 조절할 수 있다. &lt;br /&gt;③ inference 시 추가 compressor 없이 압축 CoT를 직접 생성한다. &lt;br /&gt;④ 소규모 데이터와 LoRA만으로 재현 가능한 비교적 저비용 방법을 제시한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 한계&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;실제 실험의 CoT 길이는 주로 수백 토큰이며, 논문 동기에서 언급한 수천&amp;sim;수만 토큰의 long-CoT 모델에서는 검증하지 않았다. &lt;br /&gt;Qwen2.5-32B/72B, QwQ-32B 같은 대형 reasoning 모델도 제외되었다. &lt;br /&gt;또한 LLMLingua-2는 수학 전용 importance model이 아니며, 그 중요도는 실제 causal reasoning importance와 동일하지 않다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 해석&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;TokenSkip은 모델이 &amp;ldquo;덜 생각하게&amp;rdquo; 만드는 방식이라기보다, &lt;b&gt;동일한 논리적 계산을 더 적은 자연어 토큰으로 표현하도록 학습하는 방식&lt;/b&gt;이다. &lt;br /&gt;논문의 핵심 성과는 특히 큰 모델에서 CoT의 언어적 중복을 크게 제거해도 reasoning 성능을 상당 부분 유지할 수 있음을 보인 것이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1235</guid>
      <comments>https://yoonschallenge.tistory.com/1235#entry1235comment</comments>
      <pubDate>Wed, 29 Jul 2026 22:46:36 +0900</pubDate>
    </item>
    <item>
      <title>Do LLMs Encode Functional Importance of Reasoning Tokens ?</title>
      <link>https://yoonschallenge.tistory.com/1234</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2026.acl-long.1419/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2026.acl-long.1419/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1785324232970&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Do LLMs Encode Functional Importance of Reasoning Tokens ?&quot; data-og-description=&quot;Janvijay Singh, Dilek Hakkani-T&amp;uuml;r. Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2026.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2026.acl-long.1419/&quot; data-og-url=&quot;https://aclanthology.org/2026.acl-long.1419/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/UEObH/dJMb9efr1q3/nYhDCwMzlsfIDNiMDOVZxK/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2026.acl-long.1419/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2026.acl-long.1419/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/UEObH/dJMb9efr1q3/nYhDCwMzlsfIDNiMDOVZxK/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Do LLMs Encode Functional Importance of Reasoning Tokens ?&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Janvijay Singh, Dilek Hakkani-T&amp;uuml;r. Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2026.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;acl 2026 main 입니다!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;샌디에고에서 이걸 못 봤네요 ㄷㄷ&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;llm의 긴 추론 과정에서 어떤 토큰이 최종 답변 생성에 실제로 중요한지를 모델 자신의 likelihood 변화로 측정하는 greedy pruning을 제안하며 llm 내부에 추론 토큰의 기능적 중요도를 구분하는 구조가 존재한다는 실험적 근거를 제시합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;일단 이 논문도 CoT의 긴 추론이 리소스, 정답에 필요한 부분 구분 어려움, 기존 압축 방법이 모델 외부 기준에 의존한 점을 문제라고 말한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2006&quot; data-origin-height=&quot;1136&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bdaM0a/dJMcaf8uhBw/9vMScmopIzDKfzEX0sUjfk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bdaM0a/dJMcaf8uhBw/9vMScmopIzDKfzEX0sUjfk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bdaM0a/dJMcaf8uhBw/9vMScmopIzDKfzEX0sUjfk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbdaM0a%2FdJMcaf8uhBw%2F9vMScmopIzDKfzEX0sUjfk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2006&quot; height=&quot;1136&quot; data-origin-width=&quot;2006&quot; data-origin-height=&quot;1136&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;추론 과정에서 토큰 하나를 제거한 뒤 원래 추론과 정답에 얼마나 높은 확률을 부여하는지 확인하여 likelihood가 변하지 않는다면 덜 중요하고, 크게 감소한다면 중요한 토큰으로 보고, Greedy Pruning을 통해 likelihood를 가장 잘 보존하는 토큰 하나를 삭제한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;근데 이거 리소스가 생각보다 좀 많이 들 것 같네요 ....&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Joint Objective는 추론 과정의 likelihood도 보면서 추론 과정의 악영향도 줄입니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Teacher을 통해 reasoning chain을 생성하고, pruning 진행&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Student는 이를 데이터로 사용해 학습함&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2002&quot; data-origin-height=&quot;1020&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/btiXUm/dJMcahZzpgK/qCpOIIYFDXsDmYn26bJjp0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/btiXUm/dJMcahZzpgK/qCpOIIYFDXsDmYn26bJjp0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/btiXUm/dJMcahZzpgK/qCpOIIYFDXsDmYn26bJjp0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbtiXUm%2FdJMcahZzpgK%2FqCpOIIYFDXsDmYn26bJjp0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2002&quot; height=&quot;1020&quot; data-origin-width=&quot;2002&quot; data-origin-height=&quot;1020&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;TokenSkip&lt;/b&gt;: GPT-4 계열 supervision을 통해 학습된 semantic importance 사용&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;H2O&lt;/b&gt;: 미래 토큰으로부터 누적해서 받은 attention이 낮은 토큰 제거&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Surprisal&lt;/b&gt;: 예측하기 쉬운, 즉 surprisal이 낮은 토큰부터 제거&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Uniform&lt;/b&gt;: 무작위로 토큰 제거&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;가장 높은 성능을 보여준다.!&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2004&quot; data-origin-height=&quot;1058&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/YbTbf/dJMcag7q0Ld/1A4tB0X4C2fu71lU7k2D4K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/YbTbf/dJMcag7q0Ld/1A4tB0X4C2fu71lU7k2D4K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/YbTbf/dJMcag7q0Ld/1A4tB0X4C2fu71lU7k2D4K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FYbTbf%2FdJMcag7q0Ld%2F1A4tB0X4C2fu71lU7k2D4K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2004&quot; height=&quot;1058&quot; data-origin-width=&quot;2004&quot; data-origin-height=&quot;1058&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;30%의 압축 상태에서도 수학적 상태는 대부분 보존하며, 성능을 유지함.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;pruner 성능이 나빠지면 sft도 급격하게 약해짐&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 1556px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;핵심 연구 질문&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;LLM은 긴 reasoning chain 안에서 &lt;b&gt;최종 답변 생성에 중요한 토큰과 제거 가능한 토큰을 내부적으로 구분하는가?&lt;/b&gt; &lt;br /&gt;기존 연구가 sampling, heuristic, frontier-model supervision으로 짧은 추론을 생성했다면, 본 논문은 모델 자신의 likelihood와 attention에 토큰 수준의 기능적 중요도 신호가 존재하는지를 진단한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot;&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;&lt;b&gt;문제의식&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;긴 Chain-of-Thought는 정확도를 높일 수 있지만, 출력 토큰 수&amp;middot;추론 지연&amp;middot;메모리&amp;middot;학습 비용을 증가시킨다. &lt;br /&gt;또한 어떤 토큰이 실제 답변 생성에 기여하고, 어떤 토큰이 단순한 언어적 scaffolding인지 구분하기 어렵다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 76px;&quot;&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;&lt;b&gt;핵심 제안: Greedy Pruning&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;완성된 reasoning chain에서 각 토큰을 하나씩 가상으로 삭제한 뒤, &lt;b&gt;삭제 후 모델 likelihood가 가장 높게 유지되는 토큰&lt;/b&gt;을 실제로 제거한다. &lt;br /&gt;이 과정을 목표 keep fraction까지 반복해 길이가 통제된 압축 추론과 전체 pruning rank를 생성한다. &lt;br /&gt;먼저 삭제된 토큰은 상대적으로 제거 가능하고, 마지막까지 남는 토큰은 기능적으로 중요하다고 해석한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 76px;&quot;&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;&lt;b&gt;Greedy Pruning의 특징&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;일반적인 greedy decoding이 likelihood를 높이는 토큰을 순차적으로 &lt;b&gt;추가&lt;/b&gt;한다면, Greedy Pruning은 likelihood를 가장 적게 손상시키는 토큰을 순차적으로 &lt;b&gt;삭제&lt;/b&gt;한다. &lt;br /&gt;토큰을 제거할 때마다 남은 문맥에서 중요도를 다시 계산하므로, 고정된 중요도 점수를 사용하는 방법과 달리 토큰 간 상호작용을 반영한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;ANS Objective&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;L^(&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;A&lt;/span&gt;&lt;span&gt;NS)&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;=&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;lo&lt;span&gt;g&lt;/span&gt;&lt;/span&gt;&lt;span&gt;P&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;A&lt;/span&gt;&lt;span&gt;∣&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;Q&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;&lt;span&gt;R_&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;K&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/span&gt;. &lt;br /&gt;압축된 reasoning을 조건으로 &lt;b&gt;정답의 likelihood만 보존&lt;/b&gt;한다. &lt;br /&gt;정답 확률이 유지된다면 중간 추론 구조가 크게 훼손되어도 허용되므로 비교적 공격적인 pruning이 가능하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 76px;&quot;&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;&lt;b&gt;JOINT Objective&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;L^(&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;J&lt;/span&gt;&lt;span&gt;O&lt;/span&gt;&lt;span&gt;I&lt;/span&gt;&lt;span&gt;NT)&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;=&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;lo&lt;span&gt;g&lt;/span&gt;&lt;/span&gt;&lt;span&gt;P&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;&lt;span&gt;R_&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;K&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;A&lt;/span&gt;&lt;span&gt;∣&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;Q&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/span&gt;. &lt;br /&gt;압축된 reasoning과 answer 전체의 likelihood를 보존한다. &lt;br /&gt;정답뿐 아니라 모델이 선호하는 reasoning trajectory와 구조까지 고려하며, 논문의 기본 설정이다. &lt;br /&gt;실험상 ANS보다 명확한 기능적 구조와 높은 distillation 성능을 보였다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 76px;&quot;&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;&lt;b&gt;전체 프레임워크&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;&lt;b&gt;Teacher&amp;ndash;Pruner&amp;ndash;Student&lt;/b&gt; 구조를 사용한다. &lt;br /&gt;Teacher가 정답 reasoning을 생성하고, Pruner가 Greedy Pruning으로 이를 압축하며, Student는 압축된 reasoning을 SFT supervision으로 학습한다. &lt;br /&gt;기본적으로 Teacher와 Pruner는 동일한 강한 모델을 사용한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 55px;&quot;&gt;
&lt;td style=&quot;height: 55px;&quot;&gt;&lt;b&gt;Teacher / Pruner 모델&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 55px;&quot;&gt;Qwen2.5-7B-Instruct, Llama-3.1-8B-Instruct. &lt;br /&gt;문제당 temperature 0.7로 최대 10개 응답을 생성한 뒤 정답을 맞힌 추론만 남기는 rejection sampling을 적용한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot;&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;&lt;b&gt;Student 모델&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;Llama-2-7B-Chat과 Mistral-7B-Instruct. &lt;br /&gt;압축된 reasoning chain으로 SFT한 뒤 downstream accuracy와 생성 reasoning 길이를 평가한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;평가 데이터셋&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;GSM8K&lt;/b&gt;: 초등 산술 문장제, &lt;br /&gt;&lt;b&gt;MATH/MATH-500&lt;/b&gt;: 올림피아드 수준 수학, &lt;br /&gt;&lt;b&gt;MMLU-Pro&lt;/b&gt;: 다양한 도메인의 고난도 객관식 추론.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 76px;&quot;&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;&lt;b&gt;비교 Baseline&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;&lt;b&gt;TokenSkip&lt;/b&gt;: frontier model supervision으로 학습한 semantic importance 기반 pruning, &lt;br /&gt;&lt;b&gt;H2O&lt;/b&gt;: 미래 토큰으로부터 받은 누적 attention 기반, &lt;br /&gt;&lt;b&gt;Surprisal&lt;/b&gt;: 예측하기 쉬운 low-surprisal token부터 제거, &lt;br /&gt;&lt;b&gt;Uniform&lt;/b&gt;: 무작위 제거. 모든 방법은 같은 teacher reasoning과 동일한 최종 토큰 수를 사용한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 76px;&quot;&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;&lt;b&gt;주요 성능 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;GSM8K, MMLU-Pro, MATH에서 Greedy Pruning으로 압축한 reasoning을 학습한 Student가 &lt;b&gt;동일 keep fraction 기준 모든 pruning baseline보다 일관되게 높은 정확도&lt;/b&gt;를 기록했다. &lt;br /&gt;특히 GPT-4 계열 supervision을 사용하는 TokenSkip보다도 높은 성능을 보여, 모델 자신의 likelihood가 외부 semantic label보다 기능적으로 중요한 토큰을 더 잘 식별할 수 있음을 시사한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;압축률과 Student 출력 길이&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;GSM8K에서 full reasoning으로 학습한 Student는 평균 &lt;b&gt;189 tokens&lt;/b&gt;를 생성했다. &lt;br /&gt;Keep fraction 0.9, 0.8, 0.7로 학습하면 각각 &lt;b&gt;161, 148, 134 tokens&lt;/b&gt;를 생성했다. &lt;br /&gt;즉, 30% pruning된 supervision은 inference 시에도 약 30% 짧은 reasoning을 유도했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;Pruned trace의 품질&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;Keep fraction 0.7, 즉 약 30% 토큰 제거 시 &lt;b&gt;수학적 상태 완전 보존 94.5%&lt;/b&gt;, 구조 붕괴 0.4%, severe semantic corruption 0%, SFT에 완전히 사용 불가능한 사례 0%였다. &lt;br /&gt;손상은 주로 조사&amp;middot;전치사&amp;middot;문장 부호 누락이나 reasoning step 병합 같은 표면적 문제였다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;기능적 토큰 분석 범주&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;GSM8K reasoning token을 &lt;b&gt;SYMBMATH&lt;/b&gt;&amp;mdash;숫자&amp;middot;수식&amp;middot;연산자, &lt;b&gt;VERBALMATH&lt;/b&gt;&amp;mdash;total&amp;middot;half&amp;middot;remaining 등 자연어 수학 관계, &lt;b&gt;ENTNAME&lt;/b&gt;&amp;mdash;사람&amp;middot;물체&amp;middot;단위, &lt;b&gt;METADISC&lt;/b&gt;&amp;mdash;first&amp;middot;calculate&amp;middot;final answer 등 추론 서술, &lt;b&gt;COREF&lt;/b&gt;&amp;mdash;it&amp;middot;she&amp;middot;this 등 지시 표현, &lt;b&gt;GRAMMAR&lt;/b&gt;&amp;mdash;관사&amp;middot;전치사&amp;middot;접속사&amp;middot;문장 부호의 6개 범주로 분류했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 76px;&quot;&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;&lt;b&gt;어떤 토큰이 보존되는가?&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 76px;&quot;&gt;Greedy Pruning은 &lt;b&gt;SYMBMATH 토큰을 가장 강하게 보존&lt;/b&gt;했다. &lt;br /&gt;숫자, 수식, 연산자, 중간 계산값은 공격적인 압축에서도 높은 비율로 남았다. &lt;br /&gt;반면 &lt;b&gt;COREF 토큰은 가장 일찍 제거&lt;/b&gt;되었으며, VERBALMATH와 문법&amp;middot;서술적 scaffolding도 symbolic computation보다 먼저 제거되었다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot;&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;&lt;b&gt;기능적 구조의 의미&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;모델은 reasoning에서 &lt;b&gt;핵심 계산 내용과 이를 자연스럽게 표현하기 위한 언어적 포장&lt;/b&gt;을 일정 수준 구분한다. &lt;br /&gt;단순한 토큰 빈도나 예측 난이도가 아니라, 정답 생성에 필요한 symbolic computation을 선택적으로 보존하는 구조가 나타났다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;ANS와 JOINT의 차이&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;ANS objective에서도 SYMBMATH 보존과 COREF 조기 제거라는 큰 경향은 유지되었지만, 기능 범주 간 구분이 약해지고 여러 retention curve가 uniform pruning에 가까워졌다. &lt;br /&gt;이에 따라 Student 성능도 낮아졌다. 즉, &lt;b&gt;정답 likelihood뿐 아니라 reasoning likelihood까지 보존해야 더 유용한 압축 구조가 형성된다.&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;Pruner 성능의 영향&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;강한 Qwen2.5-7B 대신 약한 Llama2-7B를 Pruner로 사용하면 Student 성능이 크게 하락했다. &lt;br /&gt;약한 Pruner도 수식 보존은 수행했지만, entity&amp;middot;grammar&amp;middot;verbal math 간 균형을 적절히 유지하지 못했다. &lt;br /&gt;따라서 좋은 pruning은 숫자와 수식만 남기는 것이 아니라, 이를 연결하는 최소한의 비상징적 구조도 보존해야 한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;토큰 중요도의 동적 특성&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;초기 full reasoning에서 계산한 ranking을 고정해서 사용하는 &lt;b&gt;Frozen ranking&lt;/b&gt;보다, 각 pruning 단계에서 중요도를 다시 계산하는 &lt;b&gt;Dynamic ranking&lt;/b&gt;이 실제 다음 제거 토큰을 더 잘 예측했다. &lt;br /&gt;이는 토큰 중요도가 고정값이 아니라, 다른 토큰이 제거되면서 계속 재구성되는 &lt;b&gt;context-dependent importance&lt;/b&gt;임을 보여준다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;Attention 분석&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;각 reasoning token이 이후 토큰으로부터 받은 layer&amp;times;head별 평균 attention을 feature로 사용해 2-layer MLP를 학습했다. &lt;br /&gt;GSM8K 200개로 학습하고 1,000개로 평가했을 때, 실제 post-deletion likelihood와 &lt;b&gt;Pearson correlation 0.88&lt;/b&gt;을 기록했다. &lt;br /&gt;이는 attention 내부에 Greedy Pruning rank를 예측할 수 있는 강한 신호가 존재함을 의미한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;핵심 기여&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;① likelihood-preserving deletion을 이용한 token-level diagnostic probe 제안, &lt;br /&gt;② 압축 reasoning distillation에서 기존 방법보다 높은 성능, &lt;br /&gt;③ symbolic computation 우선 보존이라는 해석 가능한 기능적 구조 발견, &lt;br /&gt;④ 토큰 중요도가 pruning 과정에서 동적으로 변화함을 입증, &lt;br /&gt;⑤ attention으로 pruning importance를 예측할 수 있음을 보임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;계산 비용&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;길이 n의 reasoning을 keep fraction &lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&amp;rho;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;까지 pruning할 때 약 &lt;span&gt;&lt;span&gt;O((1&amp;minus;&amp;rho;)n^2)&lt;/span&gt;&lt;/span&gt;개의 candidate evaluation이 필요하며, naive Transformer FLOP 기준 최악의 경우 &lt;span&gt;&lt;span&gt;O((1&amp;minus;&amp;rho;)n^4)&lt;/span&gt;&lt;/span&gt;까지 증가한다. &lt;br /&gt;평균 약 250-token의 GSM8K 8,000개를 30% pruning하는 데 &lt;b&gt;8&amp;times;H100에서 약 20시간&lt;/b&gt;이 소요되었다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;주요 한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;Greedy Pruning은 비용이 커서 inference-time 기법이 아니라 offline 분석&amp;middot;데이터 구축 방법이다. &lt;br /&gt;또한 pruning rank는 deletion에 대한 likelihood sensitivity일 뿐 mechanistic&amp;middot;causal explanation은 아니다. &lt;br /&gt;정답인 reasoning만 분석했고, 7B&amp;ndash;8B 모델과 주로 GSM8K 기반의 기능 분석에 제한되며, 장기 reasoning model이나 잘못된 reasoning에는 검증되지 않았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;논문의 정확한 해석&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;이 논문은 Greedy Pruning 자체로 즉시 serving FLOPs를 줄이는 방법이 아니다. &lt;br /&gt;&lt;b&gt;비싼 offline pruning으로 compact reasoning 데이터를 만들고, 이를 Student에게 distill하여 추론 시 짧은 출력을 생성하게 하는 접근&lt;/b&gt;이다. &lt;br /&gt;Greedy Pruning은 실시간 압축기보다 token-importance oracle 또는 diagnostic probe에 가깝다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 57px;&quot;&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;&lt;b&gt;최종 결론&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 57px;&quot;&gt;LLM의 reasoning에는 모든 토큰이 동일하게 기여하는 것이 아니라, 정답 생성에 필요한 수식&amp;middot;숫자&amp;middot;계산을 우선 보존하고 언어적&amp;middot;지시적 scaffolding을 먼저 제거하는 &lt;b&gt;비자명한 기능적 중요도 구조&lt;/b&gt;가 존재한다. &lt;br /&gt;이 구조는 모델 likelihood로 드러나고 attention에서도 예측 가능하지만, 중요도는 고정되지 않고 남아 있는 문맥에 따라 동적으로 변화한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1234</guid>
      <comments>https://yoonschallenge.tistory.com/1234#entry1234comment</comments>
      <pubDate>Wed, 29 Jul 2026 20:45:15 +0900</pubDate>
    </item>
    <item>
      <title>ConCISE: Confidence-guided Compression in Step-by-step Efficient Reasoning</title>
      <link>https://yoonschallenge.tistory.com/1233</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.emnlp-main.405/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2025.emnlp-main.405/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1785321111567&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;ConCISE: Confidence-guided Compression in Step-by-step Efficient Reasoning&quot; data-og-description=&quot;Ziqing Qiao, Yongheng Deng, Jiali Zeng, Dong Wang, Lai Wei, Guanbo Wang, Fandong Meng, Jie Zhou, Ju Ren, Yaoxue Zhang. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing. 2025.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2025.emnlp-main.405/&quot; data-og-url=&quot;https://aclanthology.org/2025.emnlp-main.405/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bpwtPJ/dJMb84qmFx7/Z1q8JCCCNNHL4qXMjLnfc0/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.emnlp-main.405/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2025.emnlp-main.405/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bpwtPJ/dJMb84qmFx7/Z1q8JCCCNNHL4qXMjLnfc0/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;ConCISE: Confidence-guided Compression in Step-by-step Efficient Reasoning&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Ziqing Qiao, Yongheng Deng, Jiali Zeng, Dong Wang, Lai Wei, Guanbo Wang, Fandong Meng, Jie Zhou, Ju Ren, Yaoxue Zhang. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing. 2025.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2025 emnlp main 논문입니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;언어 모델이 추론 과정에서 답을 구한 상태에서도 계속 검산하거나, 올바른 중간 추론을 불필요하게 의심하며 생성하는 중복 reflection step을 제거하는 방법입니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;928&quot; data-origin-height=&quot;1426&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bMsdXN/dJMcabE3nw2/aj4GluRI1kK9oJVPbnMvL0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bMsdXN/dJMcabE3nw2/aj4GluRI1kK9oJVPbnMvL0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bMsdXN/dJMcabE3nw2/aj4GluRI1kK9oJVPbnMvL0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbMsdXN%2FdJMcabE3nw2%2Faj4GluRI1kK9oJVPbnMvL0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;928&quot; height=&quot;1426&quot; data-origin-width=&quot;928&quot; data-origin-height=&quot;1426&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;추론을 다시 반복하는 현상이 앞선 추론이 틀렸기 때문에 발생하는 것이 아니라 내부 확신이 부족해서 불필요한 재검토가 발생할 수 있다고 저자는 말한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Confidence Deficit - 올바른 추론을 수행했지만, 해당 추론을 신뢰하지 못하여 다시 검토하는 현상&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Termination Delay - 정답을 찾고 검증까지 했지만 추론을 종료하지 않고, 추가 reflection을 계속 생성하는 현상으로 confidence threshold가 지나치게 높아져 confidence가 높아져도 신뢰하지 못하는 상황&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Confidence Injection - reflection(wait, alternatively, check...)을 생성하려는 경우 confidence phrase(Therfore, The reasoning holds, All steps are valid....)를 삽입한 후 다시 추론 이어 진행하도록 변경 =&amp;gt; 앞선 추론이 유효하니까 다시 진행하라&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Early Stopping - Confidence injection 만으로는 정답 뒤에 계속 reflection 하는 것을 막을 수 없기에 So, I'm 뒤에 confident, sure, pretty confident, pretty sure와 같은 표현이 생성할 확률을 통해 일정 임계치를 넘으면 바로 정답을 출력하도록 Final Answer:을 붙여버림 - 정답이 맞고, confident가 임계치 이상인 경우 종료&amp;nbsp;&lt;/p&gt;
&lt;pre id=&quot;code_1785323276115&quot; class=&quot;bash&quot; data-ke-language=&quot;bash&quot; data-ke-type=&quot;codeblock&quot;&gt;&lt;code&gt;Question
  &amp;darr;
Reasoning step 생성
  &amp;darr;
Reflection 발생?
 ├─ Yes &amp;rarr; Confidence phrase 삽입 후 재생성
 └─ No  &amp;rarr; 그대로 유지
  &amp;darr;
Confidence 측정
  &amp;darr;
Confidence &amp;gt; threshold?
 ├─ Yes &amp;rarr; Final Answer 생성 및 정답 검증
 │          ├─ 정답 &amp;rarr; 종료
 │          └─ 오답 &amp;rarr; reasoning 계속
 └─ No  &amp;rarr; reasoning 계속&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2128&quot; data-origin-height=&quot;1080&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/wy4YX/dJMcadCLP9x/RxvtK1nArrkvh9zX4BkE9k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/wy4YX/dJMcadCLP9x/RxvtK1nArrkvh9zX4BkE9k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/wy4YX/dJMcadCLP9x/RxvtK1nArrkvh9zX4BkE9k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fwy4YX%2FdJMcadCLP9x%2FRxvtK1nArrkvh9zX4BkE9k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2128&quot; height=&quot;1080&quot; data-origin-width=&quot;2128&quot; data-origin-height=&quot;1080&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이러한 방식대로 답안을 생성하게하여 step를 줄임&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;학습은 SFT와 SimPO를 통해 진행 됨&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 외부 teacher model의 reasoning을 사용하지 않아 해당 target model이 직접 생성한 reasoning 의 불일치를 줄인다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1042&quot; data-origin-height=&quot;714&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bcjsC2/dJMcaf1KkYx/tWrttoDRU7eUOZ1UKCBWR0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bcjsC2/dJMcaf1KkYx/tWrttoDRU7eUOZ1UKCBWR0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bcjsC2/dJMcaf1KkYx/tWrttoDRU7eUOZ1UKCBWR0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbcjsC2%2FdJMcaf1KkYx%2FtWrttoDRU7eUOZ1UKCBWR0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1042&quot; height=&quot;714&quot; data-origin-width=&quot;1042&quot; data-origin-height=&quot;714&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;좌측의 단어들은 reflection을 막지 못하고, 우측의 문장들은 reflection을 줄이게 된다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;우측 figure에선 정답 낸 뒤 모델의 confidence가 어떻게 변하는지 보여주며 처음에는 낮다가 점점 올라가는 모습을 보여준다. 3턴 이후에는 이미 끝까지 가서 이득이 크지 않다. - Termination Delay&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1884&quot; data-origin-height=&quot;1540&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/HICvl/dJMcaiRLZzj/WVLYMVkykiCBmJ7EC1tFB0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/HICvl/dJMcaiRLZzj/WVLYMVkykiCBmJ7EC1tFB0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/HICvl/dJMcaiRLZzj/WVLYMVkykiCBmJ7EC1tFB0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FHICvl%2FdJMcaiRLZzj%2FWVLYMVkykiCBmJ7EC1tFB0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1884&quot; height=&quot;1540&quot; data-origin-width=&quot;1884&quot; data-origin-height=&quot;1540&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CR = 원본 모델 대비 길이 비율&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;길이는 대폭 줄이면서 정확도는 유지하거나, 소폭 감소하는 것을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1890&quot; data-origin-height=&quot;792&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/btit3X/dJMcaaMYFL1/wlcAtQnEgBSGjEZEGKFqOK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/btit3X/dJMcaaMYFL1/wlcAtQnEgBSGjEZEGKFqOK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/btit3X/dJMcaaMYFL1/wlcAtQnEgBSGjEZEGKFqOK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbtit3X%2FdJMcaaMYFL1%2FwlcAtQnEgBSGjEZEGKFqOK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1890&quot; height=&quot;792&quot; data-origin-width=&quot;1890&quot; data-origin-height=&quot;792&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Step 수와 정확도, 제거되는 Reflection step의 종류, 학습 데이터의 어떤 특성이 압축 행동을 만드는지 보여준다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 101.86%; height: 3417px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;논문 목표&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Large Reasoning Model이 정답에 필요하지 않은 재검토와 반복 검증을 생성해 추론 길이와 비용이 증가하는 문제를 해결한다.&lt;/td&gt;
&lt;td&gt;ConCISE는 모든 CoT를 짧게 만드는 범용 압축법이라기보다, &lt;b&gt;중복 reflection을 선택적으로 줄이는 reasoning compression 방법&lt;/b&gt;이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;기존 방법의 한계&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;① 여러 응답 중 가장 짧은 정답을 선택하는 sampling-based selection은 불필요한 reflection을 충분히 제거하지 못한다. &lt;br /&gt;② 생성 후 step을 삭제하는 post-hoc pruning은 필요한 추론까지 제거해 논리적 일관성과 정확도를 해칠 수 있다.&lt;/td&gt;
&lt;td&gt;기존 방법은 대부분 추론이 끝난 뒤 결과를 선택하거나 삭제한다. &lt;br /&gt;ConCISE는 &lt;b&gt;생성 과정에서 중복 reflection이 나오지 않도록 제어한 학습 데이터&lt;/b&gt;를 만든다는 점이 다르다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 관점&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Reflection은 앞선 추론이 틀렸기 때문만이 아니라, 모델이 현재 추론을 얼마나 확신하는지와도 관련된다고 본다.&lt;/td&gt;
&lt;td&gt;논문의 핵심 가정은 reflection 발생 &amp;asymp; confidence 부족이다. &lt;br /&gt;다만 이 confidence는 hidden state에서 직접 측정한 값이 아니라 언어적&amp;middot;행동적 proxy에 가깝다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;중복 유형 1: Confidence Deficit&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;모델이 올바른 중간 추론을 수행했음에도 이를 충분히 신뢰하지 못해 &amp;ldquo;Wait&amp;rdquo;, &amp;ldquo;Alternatively&amp;rdquo;, &amp;ldquo;Let me check&amp;rdquo; 등의 재검토를 생성하는 현상이다.&lt;/td&gt;
&lt;td&gt;정답 전 발생하는 불필요한 reflection의 원인이다. &lt;br /&gt;이를 제거하지 않으면 답에 도달하기 전부터 reasoning chain이 길어진다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;중복 유형 2: Termination Delay&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;모델이 이미 정답을 구하고 검산까지 했지만 reasoning을 끝내지 않고 다른 방법의 검증과 반복 설명을 계속 생성하는 현상이다.&lt;/td&gt;
&lt;td&gt;정답 후 overthinking에 해당한다. &lt;br /&gt;Confidence Injection만으로는 충분히 해결되지 않으므로 별도의 종료 메커니즘이 필요하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;구성요소 1: Confidence Injection&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;다음 step이 reflection으로 감지되면 이전 context 뒤에 &amp;ldquo;Therefore&amp;rdquo;, &amp;ldquo;The reasoning holds&amp;rdquo;, &amp;ldquo;Let&amp;rsquo;s proceed&amp;rdquo; 등의 confidence phrase를 넣고 해당 step을 다시 생성한다.&lt;/td&gt;
&lt;td&gt;이미 생성된 reflection을 삭제하는 것이 아니라, &lt;b&gt;reflection이 시작되는 지점에서 생성 방향을 continuation으로 바꾼다.&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Confidence phrase 구성&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;모델의 자연스러운 표현, 수작업 설계, 실험적 선별을 통해 20개의 phrase pool을 구축하고 매번 하나를 무작위로 사용한다.&lt;/td&gt;
&lt;td&gt;특정 phrase에 과적합되는 것을 방지하려는 설계다. &lt;br /&gt;가장 효과적인 phrase도 reflection을 완전히 제거하지는 않았으며, 약 20% 수준의 reflection은 남았다. &lt;br /&gt;이는 필요한 검증까지 전부 제거하지는 않는다는 의미다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Reflection 탐지&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Confidence Injection에서는 wait, alternatively, verify, reconsider, check 등의 키워드를 사용하는 rule-based detector를 적용한다.&lt;/td&gt;
&lt;td&gt;탐지기는 전체 reflection 구간이 아니라 reflection의 시작점만 찾는다. &lt;br /&gt;구현은 가볍지만 모델&amp;middot;언어&amp;middot;표현 방식이 바뀌면 일반화가 약할 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;구성요소 2: Early Stopping&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;현재 reasoning context 뒤에 &quot;So, I'm&quot;이라는 probing prompt를 붙이고, confident, sure, pretty confident, pretty sure가 나올 확률을 합해 confidence score를 계산한다.&lt;/td&gt;
&lt;td&gt;이는 calibration된 정답 확률이나 내부 uncertainty가 아니라, &lt;b&gt;모델이 자신감을 언어로 표현할 확률&lt;/b&gt;이다. &lt;br /&gt;따라서 논문의 &amp;ldquo;internal confidence&amp;rdquo;라는 표현은 다소 강한 해석일 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Early Stopping 조건&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Confidence score가 임계값 t_e를 넘으면 Final Answer:를 생성하게 한다. &lt;br /&gt;학습 데이터 구축 시에는 그 답이 ground truth와 일치하는 경우에만 reasoning을 종료한다.&lt;/td&gt;
&lt;td&gt;단순히 모델이 자신 있다고 말한다고 종료하는 것이 아니다. &lt;br /&gt;&lt;b&gt;confidence와 정답 검증을 동시에 사용&lt;/b&gt;해 premature stopping을 방지한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Threshold 설정&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;t_e &amp;isin; {0.4,0.5,0.6,0.7}를 비교한 뒤 t_e=0.5를 선택했다. 0.5&amp;ndash;0.7은 비교적 안정적이었지만, 0.4는 특히 AIME24에서 성능이 크게 하락했다.&lt;/td&gt;
&lt;td&gt;threshold가 너무 낮으면 필요한 검산까지 제거한다. &lt;br /&gt;즉, 더 짧은 reasoning이 항상 더 좋은 것은 아니다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;전체 데이터 구축 과정&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;질문별로 step을 생성하고, reflection이면 Confidence Injection으로 재생성한다. &lt;br /&gt;매 step confidence를 측정하고 임계값을 넘으면 최종 답을 출력하게 하며, ground truth와 일치하면 종료한다. 최종 오답 chain은 폐기한다.&lt;/td&gt;
&lt;td&gt;ConCISE의 주요 산출물은 압축 알고리즘 자체보다 &lt;b&gt;정답성과 논리적 일관성을 유지한 concise reasoning training dataset&lt;/b&gt;이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;학습 방식&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;ConCISE로 생성한 reasoning chain을 이용해 SFT와 SimPO를 수행한다. &lt;br /&gt;각 target model이 자기 reasoning을 생성하고 이를 ConCISE로 정제한다.&lt;/td&gt;
&lt;td&gt;외부 teacher reasoning을 그대로 사용하는 것이 아니라 모델별 reasoning style을 유지한다. &lt;br /&gt;SimPO에서는 짧고 올바른 reasoning을 chosen, 긴 올바른 reasoning을 rejected로 학습한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;학습 데이터&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;MATH 학습 세트에서 약 2,000문제를 선택했으며, 각 모델이 greedy decoding으로 정답을 맞힌 문제를 사용했다. &lt;br /&gt;비교 방법들이 공통으로 정답을 생성한 최종 subset은 약 1,900개이다.&lt;/td&gt;
&lt;td&gt;비교적 적은 데이터로 효과를 보였다는 점은 장점이지만, 학습 데이터가 수학 문제에 집중되어 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;평가 모델&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;DeepSeek-R1-Distill-Qwen-7B&amp;middot;1.5B, Skywork-OR1-7B-Preview, Qwen3-8B를 평가했다.&lt;/td&gt;
&lt;td&gt;서로 다른 크기와 계열의 네 reasoning model에서 검증해 특정 모델에만 국한된 결과는 아니다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;평가 벤치마크&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Math-500, GSM8K, AIME24, GPQA-Diamond를 사용했다.&lt;/td&gt;
&lt;td&gt;GPQA는 수학 학습 데이터와 다른 영역이므로 일부 out-of-domain 일반화를 보여주지만, agent&amp;middot;code&amp;middot;다국어&amp;middot;open-ended task까지 일반화했다고 보기는 어렵다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;평가 지표&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;최종 답 정확도, 평균 생성 토큰 수, 원본 대비 길이 비율인 Compression Ratio를 측정한다. CR이 낮을수록 출력이 짧다.&lt;/td&gt;
&lt;td&gt;논문은 출력 token 감소를 중심으로 평가한다. 실제 FLOPs, latency, throughput, KV-cache, peak memory는 직접 측정하지 않았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;SimPO에서 네 모델 모두 평균적으로 원본의 약 50&amp;ndash;56% 길이로 압축되면서 정확도를 비교적 잘 유지했다. Qwen3-8B는 평균 CR 50%, DeepSeek-1.5B는 53%, DeepSeek-7B는 54%, Skywork-7B는 56%였다.&lt;/td&gt;
&lt;td&gt;&amp;ldquo;약 50% 압축&amp;rdquo;은 토큰이 50% 감소했다는 의미와 거의 대응하지만, 정확도가 완전히 동일한 것은 아니다. 일부 어려운 task에서는 소폭 하락한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;SFT와 SimPO 차이&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;ConCISE-SFT도 압축 효과가 있었지만 모델별 편차가 컸다. 특히 Qwen3-8B의 SFT 평균 CR은 92%로 압축이 약했고, SimPO에서는 50%까지 감소했다.&lt;/td&gt;
&lt;td&gt;ConCISE 데이터만 SFT하는 것보다, &lt;b&gt;짧은 reasoning을 긴 reasoning보다 선호하도록 직접 학습하는 SimPO가 더 안정적&lt;/b&gt;이었다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;OverThink 대비&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;OverThink는 여러 응답 중 가장 짧은 정답을 선택해 정확도는 잘 유지했지만, 정답 전 reflection이 많이 남아 ConCISE보다 압축률이 낮았다.&lt;/td&gt;
&lt;td&gt;&amp;ldquo;가장 짧은 정답 선택&amp;rdquo;만으로는 reflection 구조를 정밀하게 통제할 수 없다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Spirit 대비&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Spirit은 PPL 영향이 작은 step을 사후 삭제한다. 일부 설정에서 강한 압축을 달성했지만 AIME24 같은 어려운 문제에서 성능 하락이 컸다.&lt;/td&gt;
&lt;td&gt;중요도가 낮아 보이는 step을 삭제하는 방식은 필요한 non-reflection reasoning까지 제거할 위험이 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;왜 성능이 유지되는가&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;ConCISE는 각 step의 길이를 크게 줄이는 대신, reasoning step의 수와 reflection step의 수를 줄인다. Non-reflection step 수는 상대적으로 보존한다.&lt;/td&gt;
&lt;td&gt;논문의 가장 중요한 분석 결과는 &lt;b&gt;reflection step 제거는 압축에 유리하고, non-reflection step 제거는 성능 저하로 이어질 수 있다&lt;/b&gt;는 것이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;학습 데이터 분석&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;ConCISE와 OverThink 데이터는 전체 토큰 수, step 수, 평균 step 길이가 유사했지만, ConCISE로 학습한 모델이 더 강한 압축을 보였다.&lt;/td&gt;
&lt;td&gt;표면적인 데이터 길이보다 &lt;b&gt;정답 전&amp;middot;후 reflection이 어떻게 구성되어 있는지&lt;/b&gt;가 더 중요한 supervision signal임을 보여준다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Ablation 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Confidence Injection만 사용하거나 Early Stopping만 사용해도 정확도는 유지됐지만, 전체 ConCISE보다 압축률이 낮았다. 예를 들어 Math-500 CR은 전체 58%, Injection 단독 68%, Early Stopping 단독 69%였다.&lt;/td&gt;
&lt;td&gt;두 구성요소는 대체 관계가 아니라 보완 관계다. Injection은 정답 전 reflection, Early Stopping은 정답 후 reflection을 주로 처리한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Training-free 비교&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;TALE, DEER와 비교했을 때 training-free 방법은 일부 압축을 달성했지만 정확도 하락 또는 모델&amp;middot;데이터별 불안정성이 컸다. ConCISE-Decoding은 기존 training-free 방법보다 대체로 나았고, ConCISE-SimPO가 가장 안정적이었다.&lt;/td&gt;
&lt;td&gt;inference intervention만으로도 가능하지만, &lt;b&gt;ConCISE 데이터로 모델 자체를 학습하는 방식이 compression&amp;ndash;accuracy trade-off에서 더 우수&lt;/b&gt;했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 기여 1&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;LRM의 중복 reflection을 Confidence Deficit과 Termination Delay라는 두 패턴으로 구분했다.&lt;/td&gt;
&lt;td&gt;단순히 &amp;ldquo;CoT가 길다&amp;rdquo;는 현상을 넘어, 정답 전과 정답 후의 중복 원인을 분리해 설명한 개념적 기여다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 기여 2&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Confidence Injection과 Early Stopping을 결합해 생성 과정에서 중복 reflection을 억제하는 데이터 구축 프레임워크를 제안했다.&lt;/td&gt;
&lt;td&gt;post-hoc 삭제보다 reasoning coherence를 보존하기 쉬운 능동적 생성 제어 방식이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 기여 3&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;ConCISE 데이터로 SFT&amp;middot;SimPO한 모델이 여러 LRM과 벤치마크에서 약 절반 수준의 출력 길이와 비교적 높은 정확도를 달성했다.&lt;/td&gt;
&lt;td&gt;데이터의 reflection 구조가 모델의 추론 행동으로 학습될 수 있음을 실험적으로 보여준다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계 1: Confidence의 타당성&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;정답 전 confidence는 reflection keyword로 간접 추정하고, 정답 후 confidence는 특정 verbal expression의 확률로 계산한다.&lt;/td&gt;
&lt;td&gt;실제 내부 confidence나 calibrated uncertainty를 직접 측정한 것은 아니다. phrase injection이 confidence를 높인 것인지 단순히 token trajectory를 바꾼 것인지 분리 검증이 부족하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계 2: 규칙 기반 탐지&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;영어 reflection keyword에 의존한다.&lt;/td&gt;
&lt;td&gt;명시적 키워드 없는 reflection, 모델별 표현 차이, 다국어 reasoning에서는 탐지 성능이 떨어질 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계 3: Ground truth 의존&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;학습 데이터 구축 시 early stopping 후 생성한 답을 ground truth와 비교한다.&lt;/td&gt;
&lt;td&gt;정답이 없는 실제 질의에서는 동일한 검증을 사용할 수 없다. 실제 배포에서는 verifier, reward model, self-consistency 등의 보완이 필요하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계 4: 데이터 구축 비용&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Reflection 발생 시 재생성하고, 매 step probing을 수행하며, 이후 fine-tuning까지 필요하다.&lt;/td&gt;
&lt;td&gt;최종 inference token은 줄지만 데이터 생성과 학습에 추가 비용이 든다. 총 GPU 비용과 break-even point는 보고되지 않았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계 5: 실제 시스템 효율 미측정&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;논문은 token count와 compression ratio를 중심으로 보고한다.&lt;/td&gt;
&lt;td&gt;출력 token 감소가 일반적으로 latency와 KV-cache 감소로 이어질 가능성은 있지만, 이 논문만으로 FLOPs&amp;middot;wall-clock&amp;middot;메모리 절감량을 확정할 수 없다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계 6: 압축 범위&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;주로 reflection step 수를 줄이며, non-reflection step과 step 내부 길이는 충분히 압축하지 못한다.&lt;/td&gt;
&lt;td&gt;ConCISE는 전체 reasoning을 구조적으로 재작성하는 방법보다 &lt;b&gt;중복 자기검증 제거에 특화된 1차 압축법&lt;/b&gt;으로 보는 것이 정확하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;최종 의의&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;짧은 reasoning을 만들기 위해 무조건 문장을 삭제하거나 token budget을 강제하기보다, 정답에 기여하지 않는 reflection behavior를 학습 데이터에서 제거해야 한다고 주장한다.&lt;/td&gt;
&lt;td&gt;이 논문의 핵심 메시지는 &lt;b&gt;reasoning compression의 본질이 길이 자체가 아니라, 핵심 추론과 중복 reflection을 구분하는 것&lt;/b&gt;이라는 점이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1233</guid>
      <comments>https://yoonschallenge.tistory.com/1233#entry1233comment</comments>
      <pubDate>Wed, 29 Jul 2026 20:20:15 +0900</pubDate>
    </item>
    <item>
      <title>CRISP: Compressing Redundancy in Chain-of-Thought via Intrinsic Saliency Pruning</title>
      <link>https://yoonschallenge.tistory.com/1232</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2026.findings-acl.1961/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2026.findings-acl.1961/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1785310821167&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;CRISP: Compressing Redundancy in Chain-of-Thought via Intrinsic Saliency Pruning&quot; data-og-description=&quot;Yangsong Lan, Hongliang Dai, Piji Li. Findings of the Association for Computational Linguistics: ACL 2026. 2026.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2026.findings-acl.1961/&quot; data-og-url=&quot;https://aclanthology.org/2026.findings-acl.1961/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/S6S4o/dJMb9cBVT99/VXsVqxLcE5pU3k97ac7ZIK/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2026.findings-acl.1961/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2026.findings-acl.1961/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/S6S4o/dJMb9cBVT99/VXsVqxLcE5pU3k97ac7ZIK/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;CRISP: Compressing Redundancy in Chain-of-Thought via Intrinsic Saliency Pruning&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Yangsong Lan, Hongliang Dai, Piji Li. Findings of the Association for Computational Linguistics: ACL 2026. 2026.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2026 acl findings 논문입니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;lt;/think&amp;gt; 토큰의 attention으로 중요한 추론과 불필요한 추론을 구분함 =&amp;gt; 필요한 단계만 진행하도록 학습하여 추론시 짧은 CoT생성하도록 만듬.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;외부 Compressor 없이 학습으로 압축을 진행하려고 했던 방법이네요&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1195&quot; data-origin-height=&quot;761&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Wz53X/dJMcaccUY4I/APmkKaNIikkxlJqrxoifVk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Wz53X/dJMcaccUY4I/APmkKaNIikkxlJqrxoifVk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Wz53X/dJMcaccUY4I/APmkKaNIikkxlJqrxoifVk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FWz53X%2FdJMcaccUY4I%2FAPmkKaNIikkxlJqrxoifVk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1195&quot; height=&quot;761&quot; data-origin-width=&quot;1195&quot; data-origin-height=&quot;761&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1427&quot; data-origin-height=&quot;577&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/l6CkM/dJMcaijVqN6/FukCo0J3KDUAtMGXOEcGRk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/l6CkM/dJMcaijVqN6/FukCo0J3KDUAtMGXOEcGRk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/l6CkM/dJMcaijVqN6/FukCo0J3KDUAtMGXOEcGRk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fl6CkM%2FdJMcaijVqN6%2FFukCo0J3KDUAtMGXOEcGRk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1427&quot; height=&quot;577&quot; data-origin-width=&quot;1427&quot; data-origin-height=&quot;577&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;답을 생성할 때 이전 reasoning token들 보다 reasoning 정보를 집약한 &amp;lt;/think&amp;gt; token representation을 강하게 참조하는 모습을 보임&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1115&quot; data-origin-height=&quot;777&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/KdlkJ/dJMcajbYMLz/kPkTAshT0NFS94QWyKmT40/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/KdlkJ/dJMcajbYMLz/kPkTAshT0NFS94QWyKmT40/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/KdlkJ/dJMcajbYMLz/kPkTAshT0NFS94QWyKmT40/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FKdlkJ%2FdJMcajbYMLz%2FkPkTAshT0NFS94QWyKmT40%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1115&quot; height=&quot;777&quot; data-origin-width=&quot;1115&quot; data-origin-height=&quot;777&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;높은 attention을 제거하면 정답 perplexity가 급격하게 증가하고, 낮은 attention을 제거했을 때 perplexity가 천천히 증가한 것에 따라 &amp;lt;/think&amp;gt; 토큰이 중요한 정보를 가지고 있음을 보이고, 낮은 attention은 중복 정보일 가능성이 높다고 말한다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1221&quot; data-origin-height=&quot;795&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/AAMXS/dJMcajwn5f4/8MtpClQGKZo4MQfwRqKLk0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/AAMXS/dJMcajwn5f4/8MtpClQGKZo4MQfwRqKLk0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/AAMXS/dJMcajwn5f4/8MtpClQGKZo4MQfwRqKLk0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FAAMXS%2FdJMcajwn5f4%2F8MtpClQGKZo4MQfwRqKLk0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1221&quot; height=&quot;795&quot; data-origin-width=&quot;1221&quot; data-origin-height=&quot;795&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;원래 CoT 생성하기 =&amp;gt; Attention을 통해 &amp;lt;/think&amp;gt; 토큰이 생각하는 각 reasoning 단계들의 중요도를 종합 =&amp;gt; KEEP, PRUNE, REWRITE, FUSE 와 같은 옵션을 통해 단순 삭제만 하는 것이 아닌 재작성, 합치기 등도 진행한다. 이 부분은 코사인 유사도를 통해 heuristic gating으로 진행. Reward를 통해 최종 연산 선택도 진행함. =&amp;gt; Deepseek v3를 통해 문장 재구성 진행함 =&amp;gt; 학습 =&amp;gt; 평가&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;619&quot; data-origin-height=&quot;740&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/buDdmx/dJMcadQnjiB/LMn0cxit63jHGwI8hH8EU0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/buDdmx/dJMcadQnjiB/LMn0cxit63jHGwI8hH8EU0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/buDdmx/dJMcadQnjiB/LMn0cxit63jHGwI8hH8EU0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbuDdmx%2FdJMcadQnjiB%2FLMn0cxit63jHGwI8hH8EU0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;619&quot; height=&quot;740&quot; data-origin-width=&quot;619&quot; data-origin-height=&quot;740&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기준에 따른 Action 고르기 입니다!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1166&quot; data-origin-height=&quot;846&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/MKcWQ/dJMcaiRLTeo/OwuNYgfGznKhoPQARh4kS1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/MKcWQ/dJMcaiRLTeo/OwuNYgfGznKhoPQARh4kS1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/MKcWQ/dJMcaiRLTeo/OwuNYgfGznKhoPQARh4kS1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FMKcWQ%2FdJMcaiRLTeo%2FOwuNYgfGznKhoPQARh4kS1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1166&quot; height=&quot;846&quot; data-origin-width=&quot;1166&quot; data-origin-height=&quot;846&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰수가 감소하며 정확도를 유지하거나, 조금 떨어지는 모습을 보임.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 140px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;방법&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;기본 원리&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;주요 문제&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;Truncation&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;일정 길이에서 강제 종료&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;핵심 추론이 잘릴 수 있음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;CoD&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;짧게 생각하라고 prompting&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;모델이 길이 제약을 지키지 않거나 정확도 하락&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;TALE&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;token budget을 prompt로 지정&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;세밀한 압축 제어가 어려움&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;TokenSkip&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;LLMLingua2로 CoT token 압축 후 학습&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;target model의 내부 중요도와 불일치 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;A*-Thought&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;외부 scorer 기반 중요 token 탐색&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;논리적 연결과 모델 내재적 판단이 다를 수 있음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;CRISP&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&amp;lt;/think&amp;gt; attention으로 중요 step 탐색 후 재구성&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;데이터 구축 비용과 refiner 의존성&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;논문 목표&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Reasoning LLM이 생성하는 장황한 Chain-of-Thought에서 중복 추론을 제거해 &lt;b&gt;정확도를 유지하면서 생성 토큰과 추론 비용을 줄이는 것&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;단순한 입력 프롬프트 압축이 아니라, 모델이 생성하는 &lt;b&gt;추론 과정 자체를 짧게 학습시키는 방법&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;기존 방법의 문제&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;기존 CoT 압축은 외부 compressor나 별도 scorer가 중요 단계를 판단하므로, target model이 실제로 중요하게 사용하는 자기수정&amp;middot;중간 계산을 잘못 삭제할 수 있음&lt;/td&gt;
&lt;td&gt;외부 모델의 중요도 판단과 target reasoning model의 내부 추론 구조 사이에 &lt;b&gt;saliency misalignment&lt;/b&gt;가 발생&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 발견&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Reasoning 종료 토큰인 &amp;lt;/think&amp;gt;가 이전 추론 정보를 집약하는 &lt;b&gt;information anchor&lt;/b&gt;로 작동함&lt;/td&gt;
&lt;td&gt;깊은 layer에서 최종 답변을 생성할 때 모델은 개별 CoT 토큰보다 &amp;lt;/think&amp;gt; representation에 집중&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;중요도 측정 방법&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&amp;lt;/think&amp;gt; 토큰에서 각 reasoning step의 토큰으로 향하는 attention을 layer와 head 전체에 걸쳐 집계하여 step saliency (S_i)를 계산&lt;/td&gt;
&lt;td&gt;높은 (S_i)는 최종 답변에 중요한 단계, 낮은 (S_i)는 제거하거나 축약할 수 있는 중복 단계로 해석&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 가설 검증&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;높은-attention 단계를 제거하면 최종 답변 perplexity가 급격히 증가하고, 낮은-attention 단계를 제거하면 증가 폭이 작음&lt;/td&gt;
&lt;td&gt;&amp;lt;/think&amp;gt; attention이 단순한 시각적 패턴이 아니라 &lt;b&gt;실제 정답 생성 기여도를 반영하는 신호&lt;/b&gt;임을 보임&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;전체 파이프라인&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;① 원본 장문 CoT 생성 &amp;rarr; ② intrinsic attention으로 중요 단계 계산 &amp;rarr; ③ 구조화된 압축 탐색 &amp;rarr; ④ LLM refinement &amp;rarr; ⑤ 압축 CoT로 target model fine-tuning&lt;/td&gt;
&lt;td&gt;실제 서비스 추론 시마다 search를 수행하는 것이 아니라, &lt;b&gt;offline에서 압축 데이터를 만들고 모델이 짧은 추론 방식을 학습&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;4가지 압축 연산&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;KEEP:&lt;/b&gt; 유지, &lt;b&gt;PRUNE:&lt;/b&gt; 삭제, &lt;b&gt;REWRITE:&lt;/b&gt; 짧게 재작성, &lt;b&gt;FUSE:&lt;/b&gt; 유사한 연속 단계를 통합&lt;/td&gt;
&lt;td&gt;단순 삭제 중심이 아니라 여러 단계를 더 적은 수의 &lt;b&gt;정보 밀도 높은 reasoning unit&lt;/b&gt;으로 재구성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;연산 후보 결정&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;이전 압축 단계와 의미가 유사하면 FUSE, 낮은 saliency는 PRUNE/REWRITE, 중간은 REWRITE, 높은 saliency는 KEEP/REWRITE&lt;/td&gt;
&lt;td&gt;SimCSE 유사도와 intrinsic saliency를 이용해 불필요한 탐색 공간을 먼저 제한&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;연산 선택 기준&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;정답 likelihood 증가량에서 생성 토큰 길이 penalty를 뺀 reward를 최대화하는 연산을 greedy하게 선택&lt;/td&gt;
&lt;td&gt;정답에 대한 기여도-토큰 비용을 직접 최적화하여 정확도와 압축률을 함께 고려&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Refinement 단계&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Search 결과의 단절된 문장과 논리적 공백을 DeepSeek-V3가 원본 CoT를 참고해 자연스럽고 정확하게 복원&lt;/td&gt;
&lt;td&gt;Search만 사용하면 MATH-500 정확도가 1.5B에서 57.6%, 7B에서 70.6%이지만, refinement 후 각각 &lt;b&gt;75.0%, 84.2%&lt;/b&gt;로 크게 회복&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;학습 방식&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&amp;lt;|compressed|&amp;gt; control token을 붙인 입력에는 압축 CoT를, 일반 입력에는 원본 CoT를 학습하는 multi-task fine-tuning&lt;/td&gt;
&lt;td&gt;압축 모드와 일반 reasoning 모드를 하나의 모델에 학습하면서 catastrophic forgetting을 완화&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;모델 및 데이터&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;DeepSeek-R1-Distill-Qwen-1.5B/7B, MATH에서 난이도별 500개씩 총 2,500개로 모델별 압축 데이터 생성&lt;/td&gt;
&lt;td&gt;동일한 압축 정답을 공유하지 않고 각 모델의 attention을 이용해 &lt;b&gt;model-specific supervision&lt;/b&gt;을 구축&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;평가 데이터&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;GSM8K, MATH-500, AMC23&lt;/td&gt;
&lt;td&gt;초등 수학부터 경시 수준까지 난이도가 다른 수학 reasoning에서 평가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;7B 주요 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;평균 정확도 &lt;b&gt;83.6% &amp;rarr; 83.9%&lt;/b&gt;, 평균 토큰 &lt;b&gt;2,971 &amp;rarr; 1,235&lt;/b&gt;, Token Efficiency &lt;b&gt;2.81 &amp;rarr; 6.80&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;토큰을 약 &lt;b&gt;58% 감소&lt;/b&gt;시키면서 평균 정확도는 유지 또는 소폭 향상&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;1.5B 주요 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;평균 정확도 &lt;b&gt;73.3% &amp;rarr; 71.9%&lt;/b&gt;, 평균 토큰 &lt;b&gt;3,483 &amp;rarr; 1,669&lt;/b&gt;, Token Efficiency &lt;b&gt;2.10 &amp;rarr; 4.31&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;토큰을 약 &lt;b&gt;52% 감소&lt;/b&gt;했으며, 작은 모델에서는 정확도가 1.4%p 감소하지만 효율은 약 2배 향상&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;추론 구조 변화&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;reasoning step 수가 평균 &lt;b&gt;62.4% 감소&lt;/b&gt;하고, step당 길이는 &lt;b&gt;22.5% 증가&lt;/b&gt;함&lt;/td&gt;
&lt;td&gt;많은 짧고 반복적인 단계를 소수의 길지만 고밀도인 단계로 통합하는 &lt;b&gt;step-wise consolidation&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Overthinking 완화&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;MATH-500의 7B 정답 사례에서 평균 reasoning step이 &lt;b&gt;69개 &amp;rarr; 15개&lt;/b&gt;로 감소&lt;/td&gt;
&lt;td&gt;동일한 수준의 정확도에 도달하는 데 약 36개 적은 step이 필요해 불필요한 반복 추론을 효과적으로 제거&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;방법의 핵심 차별점&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;외부 evaluator가 아니라 target model 자신의 &amp;lt;/think&amp;gt; attention을 사용해 중요한 논리를 선택&lt;/td&gt;
&lt;td&gt;모델이 실제로 의존하는 reasoning structure에 맞춘 &lt;b&gt;intrinsic saliency-guided CoT distillation&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;중요한 주의점&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;중요도 평가는 intrinsic하지만, REWRITE&amp;middot;FUSE와 최종 refinement에는 외부 LLM이 사용됨&lt;/td&gt;
&lt;td&gt;완전히 external-model-free한 방법이 아니라, &lt;b&gt;saliency estimation만 intrinsic한 프레임워크&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;수학 문제 중심 평가, 반복 search로 인한 높은 offline 데이터 구축 비용, 정답 likelihood나 verifier가 필요함&lt;/td&gt;
&lt;td&gt;Open-ended reasoning, agent planning, 코드&amp;middot;법률&amp;middot;의료 영역으로의 일반화는 추가 검증이 필요&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;최종 결론&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;CRISP는 &amp;lt;/think&amp;gt; attention으로 핵심 추론 경로를 찾고, 이를 압축&amp;middot;복원한 데이터로 모델을 재학습시켜 짧은 CoT를 직접 생성하게 함&lt;/td&gt;
&lt;td&gt;&lt;b&gt;추론 중 토큰을 잘라내는 기법이라기보다, 모델 내부 중요도에 기반한 CoT 압축 데이터 생성 및 reasoning behavior 학습 방법&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1232</guid>
      <comments>https://yoonschallenge.tistory.com/1232#entry1232comment</comments>
      <pubDate>Wed, 29 Jul 2026 17:43:46 +0900</pubDate>
    </item>
    <item>
      <title>LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression</title>
      <link>https://yoonschallenge.tistory.com/1231</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2403.12968&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2403.12968&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1785265370718&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression&quot; data-og-description=&quot;This paper focuses on task-agnostic prompt compression for better generalizability and efficiency. Considering the redundancy in natural language, existing approaches compress prompts by removing tokens or lexical units according to their information entro&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2403.12968&quot; data-og-url=&quot;https://arxiv.org/abs/2403.12968v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/x02wh/dJMb82MQ9Q7/9A1xKSff7QhOahGj2JBz01/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/ccoD8s/dJMb88feJUK/hgVZDU4kwbPaS7K1iQ0wC0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2403.12968&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2403.12968&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/x02wh/dJMb82MQ9Q7/9A1xKSff7QhOahGj2JBz01/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/ccoD8s/dJMb88feJUK/hgVZDU4kwbPaS7K1iQ0wC0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;This paper focuses on task-agnostic prompt compression for better generalizability and efficiency. Considering the redundancy in natural language, existing approaches compress prompts by removing tokens or lexical units according to their information entro&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;acl 2024 findings 네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기선 이전처럼 perplexity로 토큰 중요도를 추정하는 것이 아닌 Teacher를 통해 압축 데이터를 생성하고, Encoder가 이를 학습해 토큰 삭제를 진행하여 Prompt Compression을 수행한다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1314&quot; data-origin-height=&quot;582&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bDkmhQ/dJMcaalOdAf/EYtHFzusdypVJL7nPV8FF0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bDkmhQ/dJMcaalOdAf/EYtHFzusdypVJL7nPV8FF0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bDkmhQ/dJMcaalOdAf/EYtHFzusdypVJL7nPV8FF0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbDkmhQ%2FdJMcaalOdAf%2FEYtHFzusdypVJL7nPV8FF0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1314&quot; height=&quot;582&quot; data-origin-width=&quot;1314&quot; data-origin-height=&quot;582&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLM의 입력은 점점 길어지고, 이는 토큰 비용 증가, 지연 시간, 메모리, 장문 정보 활용 저하 등 단점이 많다. =&amp;gt; Compression이 필요함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;GPT를 통해 Distill data를 생성함 =&amp;gt; 학습 =&amp;gt; 압축진행&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1377&quot; data-origin-height=&quot;592&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/l9CcU/dJMcaidd9XE/DTJkJTZCT8G1ky0B6CruCK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/l9CcU/dJMcaidd9XE/DTJkJTZCT8G1ky0B6CruCK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/l9CcU/dJMcaidd9XE/DTJkJTZCT8G1ky0B6CruCK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fl9CcU%2FdJMcaidd9XE%2FDTJkJTZCT8G1ky0B6CruCK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1377&quot; height=&quot;592&quot; data-origin-width=&quot;1377&quot; data-origin-height=&quot;592&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;평균 압축률 2.57배의 학습 데이터셋이 만들어진다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1222&quot; data-origin-height=&quot;390&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/HqGN5/dJMcajwnHvl/vXBQz81JkQKgfqMC6HMZ40/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/HqGN5/dJMcajwnHvl/vXBQz81JkQKgfqMC6HMZ40/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/HqGN5/dJMcajwnHvl/vXBQz81JkQKgfqMC6HMZ40/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FHqGN5%2FdJMcajwnHvl%2FvXBQz81JkQKgfqMC6HMZ40%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1222&quot; height=&quot;390&quot; data-origin-width=&quot;1222&quot; data-origin-height=&quot;390&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;원문 토큰의 32%만 사용하면서 성능은 최대한 유지시킴&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;762&quot; data-origin-height=&quot;846&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/MPRrq/dJMcaccUCsR/kKbIK550kIiBRNOvKWKHw0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/MPRrq/dJMcaccUCsR/kKbIK550kIiBRNOvKWKHw0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/MPRrq/dJMcaccUCsR/kKbIK550kIiBRNOvKWKHw0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FMPRrq%2FdJMcaccUCsR%2FkKbIK550kIiBRNOvKWKHw0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;762&quot; height=&quot;846&quot; data-origin-width=&quot;762&quot; data-origin-height=&quot;846&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;장문이나, code와 같은 학습 데이터와 다른 환경에서도 높은 성능을 보여줬다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1339&quot; data-origin-height=&quot;408&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/zhJ4S/dJMcabZsmT6/2ApacKGNls4hIhKCKiryKK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/zhJ4S/dJMcabZsmT6/2ApacKGNls4hIhKCKiryKK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/zhJ4S/dJMcabZsmT6/2ApacKGNls4hIhKCKiryKK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FzhJ4S%2FdJMcabZsmT6%2F2ApacKGNls4hIhKCKiryKK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1339&quot; height=&quot;408&quot; data-origin-width=&quot;1339&quot; data-origin-height=&quot;408&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다른 target llm으로도 일반화를 진행했을 때 기존 방법의 성능을 뛰어 넘고, 성능도 증가되었다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결국 여기선 input에 대해서만 압축하고, 출력은 압축하지 않습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 1020px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;연구 목표&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;긴 프롬프트에서 불필요한 토큰을 제거해 &lt;b&gt;LLM의 입력 비용, GPU 메모리 사용량, 추론 지연 시간&lt;/b&gt;을 줄이면서도 downstream task에 필요한 핵심 정보를 유지하는 &lt;b&gt;task-agnostic prompt compression&lt;/b&gt; 방법을 개발한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;기존 방법의 한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;기존 LLMLingua&amp;middot;Selective-Context는 causal LM의 &lt;b&gt;perplexity 또는 information entropy&lt;/b&gt;를 토큰 중요도로 사용한다. &lt;br /&gt;그러나 ① 해당 지표가 prompt compression 목표와 직접 정렬되지 않고, ② 왼쪽 문맥만 사용하는 단방향 모델이므로 뒤쪽 문맥까지 고려한 토큰 중요도를 판단하기 어렵다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Prompt compression을 언어 모델의 entropy 계산 문제가 아니라, 원문의 각 토큰을 &lt;b&gt;preserve 또는 discard로 분류하는 supervised token classification 문제&lt;/b&gt;로 재정의한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;전체 구조&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;GPT-4 데이터 증류 &amp;rarr; 압축문-원문 토큰 정렬 및 라벨링 &amp;rarr; 데이터 품질 필터링 &amp;rarr; 양방향 Encoder 압축기 학습 &amp;rarr; 보존 확률 기반 토큰 선택&lt;/b&gt;의 순서로 구성된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Data Distillation&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;GPT-4-32k가 MeetingBank 회의록을 압축하도록 한다. &lt;br /&gt;일반 요약과 달리 &lt;b&gt;원문 단어 삭제만 허용&lt;/b&gt;하고, 단어 변경&amp;middot;재배열&amp;middot;추가를 금지해 extractive compression 데이터를 생성한다. &lt;br /&gt;고정 압축률을 강제하지 않고, &amp;ldquo;가능한 한 짧게 만들되 최대한 많은 정보를 유지하라&amp;rdquo;고 지시한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;Chunk-wise Compression&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;긴 문서를 한 번에 GPT-4로 압축하면 과도한 정보 손실이 발생하므로, 문서를 &lt;b&gt;최대 512토큰의 문장 단위 chunk&lt;/b&gt;로 나누어 각각 압축한다. &lt;br /&gt;Ablation에서 chunk를 사용하지 않으면 약 21배로 과도하게 압축되고 QA F1이 27.9였지만, chunk-wise 방식은 약 2.6배 압축에서 QA F1 36.7을 기록했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;자동 데이터 라벨링&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;압축문에 남은 단어를 원문에서 찾아 preserve, 제거된 단어를 discard로 지정한다. &lt;br /&gt;GPT-4의 단어 반복&amp;middot;형태 변화&amp;middot;순서 변경 문제를 처리하기 위해 &lt;b&gt;sliding window, bidirectional search, lemmatization, fuzzy matching&lt;/b&gt;을 사용한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;품질 관리&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Variation Rate&lt;/b&gt;로 압축문에 새로 추가되거나 변형된 단어 비율을 측정하여 상위 5%를 제거한다. &lt;br /&gt;&lt;b&gt;Alignment Gap&lt;/b&gt;으로 원문-압축문 자동 정렬 품질을 평가하여 상위 10%의 저품질 사례를 제거한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;학습 데이터&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;MeetingBank 학습 데이터 5,169개 문서, 41,746개 chunk로 데이터셋을 구축했다. &lt;br /&gt;평균 길이는 원문 3,635토큰에서 압축문 1,415토큰으로 감소하여 평균 약 &lt;b&gt;2.57배 압축&lt;/b&gt;되었다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Compressor 모델&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Transformer Encoder가 각 토큰의 &lt;b&gt;전체 양방향 문맥 표현&lt;/b&gt;을 계산하고, 선형 분류기로 보존 확률 p_{preserve}를 예측한다. &lt;br /&gt;LLMLingua-2는 XLM-RoBERTa-large 355M, LLMLingua-2-small은 multilingual BERT 110M을 사용한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;추론 시 압축 방법&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;목표 압축률에 따라 남길 단어 수를 결정하고, p_{preserve}가 높은 상위 토큰을 선택한다. &lt;br /&gt;선택된 토큰은 &lt;b&gt;원래 순서를 유지&lt;/b&gt;해 압축 프롬프트를 구성하므로 새로운 내용을 생성하지 않는다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;MeetingBank 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;LLMLingua-2는 원문 3,003토큰을 970토큰으로 줄여 &lt;b&gt;3.1배 압축&lt;/b&gt;하면서 QA EM 86.92를 기록해 원문 87.75에 근접했다. &lt;br /&gt;기존 Selective-Context와 LLMLingua의 QA EM은 각각 66.28, 67.52였다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;Out-of-domain 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;MeetingBank로만 학습했지만 LongBench, ZeroSCROLLS, GSM8K, BBH에서도 기존 task-agnostic 방법보다 전반적으로 우수했다. &lt;br /&gt;2,000토큰 조건에서 LongBench 평균은 LLMLingua 34.6 대비 &lt;b&gt;LLMLingua-2 39.1&lt;/b&gt;, ZeroSCROLLS는 27.2 대비 &lt;b&gt;33.4&lt;/b&gt;였다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Target LLM 일반화&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;GPT-3.5뿐 아니라 Mistral-7B에서도 기존 방법보다 높은 성능을 보였다. &lt;br /&gt;일부 조건에서는 압축된 입력이 원문보다 높은 성능을 기록했는데, 저자들은 짧고 정보 밀도가 높은 입력이 장문 처리에 취약한 모델을 도울 수 있다고 해석한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;다국어 일반화&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;영어 MeetingBank로만 학습했지만 LongBench 중국어 평가에서 LLMLingua 평균 28.6 대비 &lt;b&gt;LLMLingua-2 38.1&lt;/b&gt;을 기록했다. &lt;br /&gt;이는 multilingual Encoder의 사전학습 능력에 기인한 것으로 설명된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;효율성&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;압축기 자체는 기존 방법보다 약 &lt;b&gt;3&amp;ndash;6배 빠르며&lt;/b&gt;, 전체 LLM 추론은 압축률 2&amp;ndash;5배에서 약 &lt;b&gt;1.6&amp;ndash;2.9배 가속&lt;/b&gt;되었다. &lt;br /&gt;GPU peak memory는 LLMLingua 16.6GB, Selective-Context 26.5GB 대비 LLMLingua-2가 &lt;b&gt;2.1GB&lt;/b&gt;였다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Task-aware 방법과의 관계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;LLMLingua-2는 질문과 무관하게 문서를 한 번 압축해 재사용할 수 있어 효율적이다. &lt;br /&gt;다만 특정 질문과 관련된 문서 정보를 우선 보존하는 LongLLMLingua 같은 &lt;b&gt;question-aware 방법보다는 일부 장문 QA에서 성능이 낮다&lt;/b&gt;. &lt;br /&gt;LongLLMLingua의 문서별 budget allocation과 결합할 수도 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;주요 장점&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;① 압축 목표를 직접 학습해 perplexity 기반 휴리스틱보다 정확하다. &lt;br /&gt;② 양방향 문맥을 활용한다. &lt;br /&gt;③ 작은 Encoder로 빠르고 메모리 효율적이다. &lt;br /&gt;④ 원문 토큰만 선택하므로 abstractive compression의 hallucination 위험을 구조적으로 줄인다. &lt;br /&gt;⑤ 다양한 task와 target LLM에 일반화된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;학습 데이터가 주로 MeetingBank 회의록에 한정되어 있으며, 질문을 고려하지 않아 특정 질의에만 중요한 세부 정보를 제거할 수 있다. &lt;br /&gt;또한 extractive token deletion 결과는 사람이 읽기에 문법적으로 부자연스럽고, 새로운 내용을 생성하지 않는다는 faithfulness는 제공하지만 &lt;b&gt;모든 핵심 정보 보존을 이론적으로 보장하지는 않는다&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;논문의 핵심 의의&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;LLMLingua-2의 본질적 기여는 prompt compression을 &lt;b&gt;&amp;ldquo;causal LM의 entropy로 토큰을 제거하는 문제&amp;rdquo;에서 &amp;ldquo;LLM의 압축 지식을 작은 양방향 Encoder에 증류해 보존 여부를 직접 예측하는 문제&amp;rdquo;로 전환한 것&lt;/b&gt;이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1231</guid>
      <comments>https://yoonschallenge.tistory.com/1231#entry1231comment</comments>
      <pubDate>Wed, 29 Jul 2026 04:22:36 +0900</pubDate>
    </item>
    <item>
      <title>SkipKV: Selective Skipping of KV Generation and Storage for Efficient Inference with Large Reasoning Models</title>
      <link>https://yoonschallenge.tistory.com/1230</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://proceedings.mlsys.org/paper_files/paper/2026/hash/45c1f6a8cbf2da59ebf2c802b4f742cd-Abstract-Conference.html&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://proceedings.mlsys.org/paper_files/paper/2026/hash/45c1f6a8cbf2da59ebf2c802b4f742cd-Abstract-Conference.html&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1785254203204&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;SkipKV: Selective Skipping of KV Generation and Storage for Efficient Inference with Large Reasoning Models&quot; data-og-description=&quot;Requests for name changes in the electronic proceedings will be accepted with no questions asked. However name changes may cause bibliographic tracking issues. Authors are asked to consider this carefully and discuss it with their co-authors prior to reque&quot; data-og-host=&quot;proceedings.mlsys.org&quot; data-og-source-url=&quot;https://proceedings.mlsys.org/paper_files/paper/2026/hash/45c1f6a8cbf2da59ebf2c802b4f742cd-Abstract-Conference.html&quot; data-og-url=&quot;https://proceedings.mlsys.org/paper_files/paper/2026/hash/45c1f6a8cbf2da59ebf2c802b4f742cd-Abstract-Conference.html&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://proceedings.mlsys.org/paper_files/paper/2026/hash/45c1f6a8cbf2da59ebf2c802b4f742cd-Abstract-Conference.html&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://proceedings.mlsys.org/paper_files/paper/2026/hash/45c1f6a8cbf2da59ebf2c802b4f742cd-Abstract-Conference.html&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;SkipKV: Selective Skipping of KV Generation and Storage for Efficient Inference with Large Reasoning Models&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Requests for name changes in the electronic proceedings will be accepted with no questions asked. However name changes may cause bibliographic tracking issues. Authors are asked to consider this carefully and discuss it with their co-authors prior to reque&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;proceedings.mlsys.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;처음보는 컨퍼런스긴 한데 비슷한 방향성을 가진 것 같아서 ...&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;불필요하게 반복되는 문장은 KV cache에서 제거하고, 불필요한 추론 문장이 생성되기 전에는 activation steering으로 억제하여 정확도를 유지하며 KV 메모리와 생성 길이를 동시에 줄이는 추론 최적화 방법을 고안해냄&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;816&quot; data-origin-height=&quot;528&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bquwjv/dJMcabdVECe/kvLDyprjdtYNKvaoJdRtCK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bquwjv/dJMcabdVECe/kvLDyprjdtYNKvaoJdRtCK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bquwjv/dJMcabdVECe/kvLDyprjdtYNKvaoJdRtCK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbquwjv%2FdJMcabdVECe%2FkvLDyprjdtYNKvaoJdRtCK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;816&quot; height=&quot;528&quot; data-origin-width=&quot;816&quot; data-origin-height=&quot;528&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;정확도는 유지하며 토큰 길이와 KV 메모리 감소를 보인다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1468&quot; data-origin-height=&quot;484&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/lQ0C6/dJMcaa0s7iH/0GkFrWZqACsToiZkOuOSo1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/lQ0C6/dJMcaa0s7iH/0GkFrWZqACsToiZkOuOSo1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/lQ0C6/dJMcaa0s7iH/0GkFrWZqACsToiZkOuOSo1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FlQ0C6%2FdJMcaa0s7iH%2F0GkFrWZqACsToiZkOuOSo1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1468&quot; height=&quot;484&quot; data-origin-width=&quot;1468&quot; data-origin-height=&quot;484&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 방법들은 일부 숫자나 단어만 제거하여 추론 흐름을 깨드려 추론 길이도 길어지지만 이 방법론은 추론 길이도 짧게 유지한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;또한 여기선 Multi-batch를 신경쓰며 배치가 커질 때 padding token의 영향을 받게 되는데 계산을 불안정하게 만들어 품질이 떨어지게 됨&amp;nbsp;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;SkipKV&lt;/span&gt;&lt;/span&gt;&lt;span&gt;=&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;Sentence-aware&amp;nbsp;eviction&lt;/span&gt;&lt;/span&gt;&lt;span&gt;+&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;Adaptive&amp;nbsp;steering&lt;/span&gt;&lt;/span&gt;&lt;span&gt;+&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;Batch&amp;nbsp;grouping&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1397&quot; data-origin-height=&quot;782&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/4aumw/dJMcacKP9Si/KZBU9XKg5mvEEhkZcwA7e0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/4aumw/dJMcacKP9Si/KZBU9XKg5mvEEhkZcwA7e0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/4aumw/dJMcacKP9Si/KZBU9XKg5mvEEhkZcwA7e0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F4aumw%2FdJMcacKP9Si%2FKZBU9XKg5mvEEhkZcwA7e0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1397&quot; height=&quot;782&quot; data-origin-width=&quot;1397&quot; data-origin-height=&quot;782&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;거의 같은 내용을 표현하는 두 문자이 있다면 이전 문장의 KV를 우선 제거하고, 더 최근 문장은 유지하는 식으로 진행함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기선 따로 Sentence BERT를 쓰면 비용이 크니까 모델의 마지막 layer hidden state를 직접 사용하여 문장마다 mean pooling한 뒤 Cos 유사도를 통해 구합니다. 거기서 유사도가 높으면 중복으로 두고, 이전 문장을 지우게 됩니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 필요 없는 wait, alternatively 등등 ... 의 hidden state와 reasoning token의 hidden state를 통해 steering도 진행합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 744px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;연구 문제&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Large Reasoning Model은 긴 Chain-of-Thought를 생성하면서 KV cache가 토큰 수에 비례해 증가한다. &lt;br /&gt;이로 인해 GPU 메모리 사용량이 커지고, 처리 가능한 batch size와 decoding throughput이 제한된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;기존 방법의 한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;H2O, R-KV와 같은 기존 KV eviction 방법은 개별 토큰의 attention score나 중복도를 기준으로 제거한다. &lt;br /&gt;이 과정에서 수식, 숫자, 최종 답변의 일부가 파편적으로 삭제되어 추론 흐름이 깨지고, 모델이 이전 내용을 반복적으로 재검증하면서 오히려 더 긴 출력을 생성한다. 또한 multi-batch 환경에서는 padding token이 고정 KV budget을 차지해 정확도가 크게 하락한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;핵심 관찰&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;① 기존 KV eviction은 batch size가 증가할수록 정확도가 감소한다. &lt;br /&gt;② KV cache를 줄였음에도 FullKV보다 생성 토큰 수가 증가할 수 있다. &lt;br /&gt;③ 오답 reasoning에는 정답 reasoning보다 의미적으로 유사한 문장과 Wait, Alternatively, again 같은 non-execution thought가 더 많이 나타난다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;토큰 단위가 아니라 &lt;b&gt;문장&amp;middot;reasoning segment 단위의 의미 중복성&lt;/b&gt;을 우선적으로 고려한다. &lt;br /&gt;이미 생성된 중복 문장은 KV cache에서 제거하고, 불필요한 문장이 생성되려는 경우 activation steering으로 생성을 억제한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;방법 1: Sentence-level KV Storage Skipping&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;생성 문장을 newline 및 punctuation 기준으로 분할하고, 각 문장의 마지막 layer hidden state 평균을 문장 representation으로 사용한다. &lt;br /&gt;문장 간 cosine similarity가 임계값 &amp;tau;보다 높으면 이전 문장을 중복으로 판단해 해당 문장의 KV를 우선 제거한다. &lt;br /&gt;별도의 sentence encoder를 실행하지 않아 추가 연산을 줄인다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;최종 Eviction Score&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;SkipKV는 attention 기반 token importance (I), token redundancy (R), sentence similarity &amp;lambda;_{i,j}를 결합한다. 중&lt;br /&gt;복 문장에 속한 토큰에는 sentence similarity를 추가 감점하여 일반 토큰보다 먼저 제거되도록 한다. 즉, 실제 KV 크기는 token budget으로 맞추되 eviction 우선순위는 문장 의미 중복성이 지배한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Cache Range Monitoring&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;반복적인 eviction 이후에는 원래 generation sequence의 문장 위치와 실제 KV cache 내부 위치가 달라진다. &lt;br /&gt;SkipKV는 generation space와 cache space 사이의 문장 범위를 지속적으로 매핑하여 sentence score가 정확한 KV 영역에 적용되도록 한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;방법 2: Adaptive Steering&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;MATH 학습 데이터 1,000개에서 execution thought와 non-execution thought의 평균 hidden-state 차이를 steering vector로 구성한다. &lt;br /&gt;생성 중 non-execution thought가 누적될수록 steering strength를 &amp;alpha;_t=&amp;alpha;_0+&amp;gamma; N_o로 증가시켜 모델을 실제 계산과 문제 해결 중심의 reasoning 방향으로 유도한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;방법 3: Batch Grouping&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;입력을 prefill length 순으로 정렬한 뒤 길이가 비슷한 sample끼리 batch를 구성한다. &lt;br /&gt;이를 통해 padding token을 줄이고, 설정된 KV budget 중 실제 reasoning token이 사용할 수 있는 valid KV budget을 증가시킨다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;학습 여부&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;모델 파라미터를 업데이트하지 않는 &lt;b&gt;training-free inference method&lt;/b&gt;이다. &lt;br /&gt;다만 adaptive steering에 사용할 steering vector는 사전에 데이터로부터 계산하며, 모델별 steering layer와 strength 설정이 필요하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;평가 모델&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;DeepSeek-R1-Distill-Qwen-7B, DeepSeek-R1-Distill-Qwen-14B, DeepSeek-R1-Distill-Llama-8B&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;평가 데이터셋&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;수학 reasoning: AIME-24, MATH-500, GSM8K / 코드 reasoning: LiveCodeBench&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;비교 방법&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;FullKV, H2O, R-KV, SEAL&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;정확도 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;동일하거나 유사한 KV compression budget에서 기존 방법보다 최대 &lt;b&gt;26.7% 높은 정확도&lt;/b&gt;를 기록했다. &lt;br /&gt;AIME-24의 R1-Qwen-14B에서는 FullKV와 동일한 정확도를 유지하면서 약 &lt;b&gt;6.7배 적은 KV memory&lt;/b&gt;를 사용했다. 일부 조건에서는 FullKV보다 적은 메모리로 더 높은 정확도를 달성했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot;&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;&lt;b&gt;생성 길이 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;기존 token-level eviction은 FullKV보다 더 긴 출력을 생성하는 경우가 많았지만, SkipKV는 FullKV 대비 최대 약 &lt;b&gt;28%&lt;/b&gt;, R-KV 대비 모델에 따라 최대 &lt;b&gt;32&amp;sim;48%&lt;/b&gt; 적은 토큰을 생성했다. 논문 전체 기준으로 SoTA 대비 최대 약 &lt;b&gt;1.6배 짧은 생성 길이&lt;/b&gt;를 달성했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Throughput 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;GSM8K의 single A100-40GB 환경에서 FullKV 대비 최대 &lt;b&gt;9.6배 높은 throughput&lt;/b&gt;을 달성했다. &lt;br /&gt;동일 batch size에서는 더 짧은 생성 길이 덕분에 R-KV보다 최대 &lt;b&gt;1.7배 높은 throughput&lt;/b&gt;을 보였다. &lt;br /&gt;FullKV와 SEAL이 OOM이 발생한 큰 batch에서도 고정 KV budget을 통해 추론이 가능했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Ablation 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Sentence Scoring은 추론 coherence와 정확도를 개선했고, Adaptive Steering은 생성 길이를 크게 줄였으며, Batch Grouping은 multi-batch 정확도를 추가로 향상했다. &lt;br /&gt;세 요소를 모두 적용했을 때 R-KV 대비 정확도 최대 &lt;b&gt;+20%p&lt;/b&gt;, 생성 길이 최대 &lt;b&gt;&amp;minus;30%&lt;/b&gt;를 기록했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 기여&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;① KV eviction의 단위를 token에서 의미적 문장 구조로 확장했다. &lt;br /&gt;② 이미 생성된 KV의 제거와 불필요한 KV의 생성 억제를 동시에 수행한다. &lt;br /&gt;③ padding으로 인한 multi-batch 성능 저하를 분석하고 batch grouping으로 해결한다. &lt;br /&gt;④ vLLM의 paged KV cache 및 continuous batching에서도 효과를 확인했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Batch grouping은 prompt 길이 분포가 지나치게 불규칙한 환경에서 효과가 제한될 수 있다. &lt;br /&gt;문장 분할 delimiter와 non-execution keyword가 수작업으로 정의되어 있어 언어&amp;middot;도메인별 조정이 필요하다. &lt;br /&gt;평가도 주로 DeepSeek-R1 Distill 계열과 수학&amp;middot;코드 reasoning에 집중되어 있어 agent, 장문 추론, 다국어 환경에 대한 추가 검증이 필요하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1230</guid>
      <comments>https://yoonschallenge.tistory.com/1230#entry1230comment</comments>
      <pubDate>Wed, 29 Jul 2026 03:58:35 +0900</pubDate>
    </item>
    <item>
      <title>Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge</title>
      <link>https://yoonschallenge.tistory.com/1229</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.ijcnlp-long.18/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2025.ijcnlp-long.18/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1784737570519&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge&quot; data-og-description=&quot;Lin Shi, Chiyu Ma, Wenhua Liang, Xingjian Diao, Weicheng Ma, Soroush Vosoughi. Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Lin&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2025.ijcnlp-long.18/&quot; data-og-url=&quot;https://aclanthology.org/2025.ijcnlp-long.18/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/1I1IM/dJMb81HaJVQ/7mdSwR38oT7RHfidluK5mk/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.ijcnlp-long.18/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2025.ijcnlp-long.18/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/1I1IM/dJMb81HaJVQ/7mdSwR38oT7RHfidluK5mk/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Lin Shi, Chiyu Ma, Wenhua Liang, Xingjian Diao, Weicheng Ma, Soroush Vosoughi. Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Lin&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;IJCNLP 2025에 붙은 논문입니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;llm 두개 이상의 응답을 평가할 때 실제 응답 품질보다 위치에 따라 판단이 달라지는 것을 체계적으로 분석합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://yoonschallenge.tistory.com/1227&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;2026.07.22 - [인공지능/논문 리뷰 or 진행] - Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1784738152655&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena&quot; data-og-description=&quot;https://arxiv.org/abs/2306.05685 Judging LLM-as-a-Judge with MT-Bench and Chatbot ArenaEvaluating large language model (LLM) based chat assistants is challenging due to their broad capabilities and the inadequacy of existing benchmarks in measuring human p&quot; data-og-host=&quot;yoonschallenge.tistory.com&quot; data-og-source-url=&quot;https://yoonschallenge.tistory.com/1227&quot; data-og-url=&quot;https://yoonschallenge.tistory.com/1227&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/tsekQ/dJMb8RkfnnD/LhEjkjRqdBxXpylPKTWsL0/img.png?width=800&amp;amp;height=800&amp;amp;face=0_0_800_800,https://scrap.kakaocdn.net/dn/bbEVh0/dJMb8SXLaCO/vut1CxJmuCIfmU5rRXoStK/img.png?width=800&amp;amp;height=800&amp;amp;face=0_0_800_800,https://scrap.kakaocdn.net/dn/bPMs1F/dJMb8YXY1wh/3F7Qk18k2UWlF2TpyOflJK/img.png?width=1231&amp;amp;height=686&amp;amp;face=0_0_1231_686&quot;&gt;&lt;a href=&quot;https://yoonschallenge.tistory.com/1227&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://yoonschallenge.tistory.com/1227&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/tsekQ/dJMb8RkfnnD/LhEjkjRqdBxXpylPKTWsL0/img.png?width=800&amp;amp;height=800&amp;amp;face=0_0_800_800,https://scrap.kakaocdn.net/dn/bbEVh0/dJMb8SXLaCO/vut1CxJmuCIfmU5rRXoStK/img.png?width=800&amp;amp;height=800&amp;amp;face=0_0_800_800,https://scrap.kakaocdn.net/dn/bPMs1F/dJMb8YXY1wh/3F7Qk18k2UWlF2TpyOflJK/img.png?width=1231&amp;amp;height=686&amp;amp;face=0_0_1231_686');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;https://arxiv.org/abs/2306.05685 Judging LLM-as-a-Judge with MT-Bench and Chatbot ArenaEvaluating large language model (LLM) based chat assistants is challenging due to their broad capabilities and the inadequacy of existing benchmarks in measuring human p&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;yoonschallenge.tistory.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 논문과 유사하네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1267&quot; data-origin-height=&quot;737&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/33mYr/dJMcajwjcyb/77e0bLeKKXBTDGMRBi7i60/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/33mYr/dJMcajwjcyb/77e0bLeKKXBTDGMRBi7i60/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/33mYr/dJMcajwjcyb/77e0bLeKKXBTDGMRBi7i60/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F33mYr%2FdJMcajwjcyb%2F77e0bLeKKXBTDGMRBi7i60%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1267&quot; height=&quot;737&quot; data-origin-width=&quot;1267&quot; data-origin-height=&quot;737&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Repetition stability - 반복 안정성 : Judge 판단의 안정성 확인&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Position Consistency - 위치 일관성 : 위치 선호도를 확인할 수 있게 함.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Preference Fairness - 선호 공정성 : 위치 일관적인 판단도 공정한 판단으로 반영함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;632&quot; data-origin-height=&quot;520&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bxBIpQ/dJMcajppcmL/yjn4dArSsgw7k9pbi3X7ZK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bxBIpQ/dJMcajppcmL/yjn4dArSsgw7k9pbi3X7ZK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bxBIpQ/dJMcajppcmL/yjn4dArSsgw7k9pbi3X7ZK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbxBIpQ%2FdJMcajppcmL%2Fyjn4dArSsgw7k9pbi3X7ZK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;632&quot; height=&quot;520&quot; data-origin-width=&quot;632&quot; data-origin-height=&quot;520&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;수준&lt;/td&gt;
&lt;td&gt;분석 요인&lt;/td&gt;
&lt;td&gt;설명&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Judge-Level&lt;/td&gt;
&lt;td&gt;모델 계열&lt;/td&gt;
&lt;td&gt;GPT, Claude, Gemini, Llama 등 Judge의 계열적 특성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Candidate-Level&lt;/td&gt;
&lt;td&gt;Answer Quality Gap&lt;/td&gt;
&lt;td&gt;후보 응답 간 품질 차이&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Candidate/Task-Level&lt;/td&gt;
&lt;td&gt;출력 길이&lt;/td&gt;
&lt;td&gt;후보 응답의 평균 길이&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Task-Level&lt;/td&gt;
&lt;td&gt;입력 길이&lt;/td&gt;
&lt;td&gt;질문 자체의 길이&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;전체 Prompt&lt;/td&gt;
&lt;td&gt;Prompt 길이&lt;/td&gt;
&lt;td&gt;지시문, 질문, 후보 응답을 포함한 전체 길이&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1273&quot; data-origin-height=&quot;696&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bGnM1D/dJMcacjzKif/E8H5U6STSt3M2CmPeEk7rK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bGnM1D/dJMcacjzKif/E8H5U6STSt3M2CmPeEk7rK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bGnM1D/dJMcacjzKif/E8H5U6STSt3M2CmPeEk7rK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbGnM1D%2FdJMcacjzKif%2FE8H5U6STSt3M2CmPeEk7rK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1273&quot; height=&quot;696&quot; data-origin-width=&quot;1273&quot; data-origin-height=&quot;696&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Claude, GPT는 높은 일관성을 가지고 거의 공정한 모델임.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;task에 따라 편향 방향이 변하기도 함.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;품질 차이가 작을수록 편향이 심해지는건 동일함.&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 788px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;연구 목적&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;LLM-as-a-Judge가 후보 응답의 실제 품질이 아니라 &lt;b&gt;프롬프트에서 제시된 위치&lt;/b&gt;에 따라 판단을 바꾸는 &lt;b&gt;Position Bias&lt;/b&gt;를 Pairwise 및 List-wise 비교 환경에서 체계적으로 분석한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;핵심 문제&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;기존 연구는 주로 응답 순서를 바꿨을 때 결과가 일치하는지만 측정했기 때문에, 판단 변화가 &lt;b&gt;무작위 생성 때문인지&lt;/b&gt;, 특정 위치에 대한 &lt;b&gt;체계적 선호 때문인지&lt;/b&gt;, 후보 수가 증가해도 동일한 현상이 나타나는지 충분히 설명하지 못했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Position Bias 정의&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;원래 순서 [A, B]와 교체 순서 [B, A]를 평가했을 때 동일한 후보가 아니라 항상 첫 번째 또는 두 번째 위치의 응답을 선택하는 현상이다. &lt;br /&gt;첫 번째 위치 선호는 &lt;b&gt;Primacy Preference&lt;/b&gt;, 뒤쪽 위치 선호는 &lt;b&gt;Recency Preference&lt;/b&gt;로 정의한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 56px;&quot;&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;&lt;b&gt;제안 지표 1: Repetition Stability (RS)&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;동일한 평가 프롬프트를 반복 제시했을 때 같은 판단을 내리는 정도이다. &lt;br /&gt;높은 RS는 관찰된 위치 편향이 단순한 sampling 변동이 아니라 &lt;b&gt;안정적으로 반복되는 판단 패턴&lt;/b&gt;임을 의미한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 56px;&quot;&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;&lt;b&gt;제안 지표 2: Position Consistency (PC)&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;후보 응답의 순서를 바꾸어도 동일한 후보를 승자로 선택하는 비율이다. &lt;br /&gt;높을수록 위치에 영향을 덜 받으며, 낮을수록 위치 편향이 강하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 56px;&quot;&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;&lt;b&gt;제안 지표 3: Preference Fairness (PF)&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;위치 불일치가 발생했을 때 특정 위치를 어느 정도 선호하는지를 -1~1로 측정한다. &lt;br /&gt;-1은 완전한 Primacy Preference, 0은 위치 공정성, 1은 완전한 Recency Preference를 의미한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;실험 구성&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;GPT, Claude, Gemini, Llama 계열의 &lt;b&gt;15개 LLM Judge&lt;/b&gt;를 평가했다. &lt;br /&gt;MTBench와 DevBench의 &lt;b&gt;22개 Task&lt;/b&gt;, 약 &lt;b&gt;40개 응답 생성 모델&lt;/b&gt;, 10만 건 이상의 평가 인스턴스를 사용했다. &lt;br /&gt;Pairwise가 주 실험이며, 일부 모델을 대상으로 3개 후보의 List-wise 평가도 수행했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;핵심 결과 1&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;성능이 높은 Judge들은 대부분 RS &amp;gt; 0.85였으며 GPT-4, Claude-3.5-Sonnet, Llama-3.3-70B 등은 약 0.95 이상의 RS를 기록했다. &lt;br /&gt;따라서 위치 편향은 단순한 무작위 출력이 아니라 &lt;b&gt;체계적이고 재현 가능한 현상&lt;/b&gt;이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;핵심 결과 2&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;위치 편향은 &lt;b&gt;Judge와 Task에 따라 크게 달라진다.&lt;/b&gt; &lt;br /&gt;동일한 모델도 MTBench와 DevBench에서 선호 방향이 달라질 수 있으며, Coding에서는 안정적이지만 Writing이나 Humanities에서는 불안정할 수 있다. &lt;br /&gt;따라서 Judge의 신뢰성은 모델 단위가 아니라 &lt;b&gt;Judge&amp;ndash;Task 조합별로 평가&lt;/b&gt;해야 한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;핵심 결과 3&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;후보 응답 간 품질 차이(Answer Quality Gap)&lt;/b&gt;가 가장 중요한 영향 요인이다. &lt;br /&gt;두 응답의 품질이 비슷할수록 판단이 어려워져 PC가 낮아지고 위치 편향이 증가한다. &lt;br /&gt;반대로 한 응답이 명확히 우수하면 Judge는 위치와 무관하게 더 일관된 판단을 내린다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;핵심 결과 4&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;질문 길이, 후보 응답 길이, 전체 Prompt 길이와 위치 편향의 관계는 매우 약했다. &lt;br /&gt;출력 길이가 PF에 통계적으로 유의한 경우는 있었지만, Judge&amp;middot;Task&amp;middot;품질 차이에 비해 영향력이 미미했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Pairwise vs. List-wise&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;후보 수가 증가하면 전반적으로 PC가 감소했다. &lt;br /&gt;Claude-3.5-Sonnet과 GPT-4o 같은 강한 Judge는 비교적 안정성을 유지했지만, GPT-3.5-Turbo는 Pairwise PC 0.70에서 List-wise PC 0.34로 크게 하락했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Judge 간 합의 분석&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;평균 PC와 PF가 비슷한 Judge도 개별 사례에서는 서로 다른 판단을 내렸다. &lt;br /&gt;다수 Judge가 합의하는 사례는 평가가 쉬운 반면, 품질 차이가 작고 disagreement가 큰 사례는 어렵고 위치 편향에 취약했다. &lt;br /&gt;MTBench에서 과반수 Judge가 합의하지 못한 극단적 난이도 사례는 2% 미만이었다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;주요 기여&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;위치 편향을 &lt;b&gt;반복 안정성&amp;ndash;위치 일관성&amp;ndash;선호 공정성&lt;/b&gt;의 세 관점에서 평가하는 통합 프레임워크를 제시하고, 이를 Pairwise에서 List-wise로 확장했다. &lt;br /&gt;또한 Judge-Level, Candidate-Level, Task-Level 요인을 구분해 편향의 주요 원인을 실증적으로 분석했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;두 Benchmark와 제한된 Judge만 평가했고, List-wise는 세 후보와 네 Judge에 한정된다. &lt;br /&gt;폐쇄형 모델의 구조적 요인을 직접 분석하지 못했으며, 연구의 초점은 편향의 측정과 이해로서 &lt;b&gt;새로운 편향 완화 기법은 제안하지 않는다.&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;최종 결론 및 실무적 의미&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;LLM Judge의 단일 순서&amp;middot;단일 실행 결과를 그대로 신뢰해서는 안 된다. &lt;br /&gt;특히 품질이 유사한 답안을 평가할 때는 &lt;b&gt;응답 순서 교환, 반복 평가, 동점 허용, 복수 Judge의 합의 또는 인간 검토&lt;/b&gt;를 함께 사용하는 것이 필요하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1229</guid>
      <comments>https://yoonschallenge.tistory.com/1229#entry1229comment</comments>
      <pubDate>Thu, 23 Jul 2026 01:58:43 +0900</pubDate>
    </item>
    <item>
      <title>Towards standardizing Korean Grammatical Error Correction:Datasets and Annotation</title>
      <link>https://yoonschallenge.tistory.com/1228</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2210.14389&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2210.14389&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1784704518273&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Towards standardizing Korean Grammatical Error Correction: Datasets and Annotation&quot; data-og-description=&quot;Research on Korean grammatical error correction (GEC) is limited, compared to other major languages such as English. We attribute this problematic circumstance to the lack of a carefully designed evaluation benchmark for Korean GEC. In this work, we collec&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2210.14389&quot; data-og-url=&quot;https://arxiv.org/abs/2210.14389v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/3182Y/dJMb9jgKroW/2RLmYr3mCbiJVIlR7FA16k/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/zQhpO/dJMb9eT2v86/dYiTbsKLK6tOkMoGOG0DXk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2210.14389&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2210.14389&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/3182Y/dJMb9jgKroW/2RLmYr3mCbiJVIlR7FA16k/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/zQhpO/dJMb9eT2v86/dYiTbsKLK6tOkMoGOG0DXk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Towards standardizing Korean Grammatical Error Correction: Datasets and Annotation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Research on Korean grammatical error correction (GEC) is limited, compared to other major languages such as English. We attribute this problematic circumstance to the lack of a carefully designed evaluation benchmark for Korean GEC. In this work, we collec&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;acl 2023에 붙은 논문입니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;한국어 문법 수정(Korean Grammatical Error Correction, GEC) 연구에 부족했던 데이터와 평가 자원을 구축하려고 합니다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1255&quot; data-origin-height=&quot;578&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/rqtOd/dJMcaijQlZl/u6OhF63XkG5YOygRU7pBpK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/rqtOd/dJMcaijQlZl/u6OhF63XkG5YOygRU7pBpK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/rqtOd/dJMcaijQlZl/u6OhF63XkG5YOygRU7pBpK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FrqtOd%2FdJMcaijQlZl%2Fu6OhF63XkG5YOygRU7pBpK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1255&quot; height=&quot;578&quot; data-origin-width=&quot;1255&quot; data-origin-height=&quot;578&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;외국인 학습자, 한국어 원어민, 온라인 언어 학습자의 오류를 각각 포함하는 데이터 셋을 구축&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;유형은 이렇게 됩니다.&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 290px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;INS&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;단어 삽입&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;DEL&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;단어 삭제&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;WS&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;띄어쓰기 수정&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;WO&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;단어 순서 변경&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;SPELL&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;철자 오류&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;PUNCT&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;문장부호 오류&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;SHORT&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;형태소 구조를 유지하는 축약&amp;middot;표면형 수정&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;VERB&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;동사 오류&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;ADJ&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;형용사 오류&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;NOUN&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;명사 오류&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;PART&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;조사 오류&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;END&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;어미 오류&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;MOD&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;관형사&amp;middot;부사 등 수식어 오류&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;CONJ&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;용언과 어미가 함께 변하는 활용 오류&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1247&quot; data-origin-height=&quot;326&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bCM8yo/dJMcabycPS3/Ft5BEKJau6PLmP6ZFPKwE0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bCM8yo/dJMcabycPS3/Ft5BEKJau6PLmP6ZFPKwE0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bCM8yo/dJMcabycPS3/Ft5BEKJau6PLmP6ZFPKwE0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbCM8yo%2FdJMcabycPS3%2FFt5BEKJau6PLmP6ZFPKwE0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1247&quot; height=&quot;326&quot; data-origin-width=&quot;1247&quot; data-origin-height=&quot;326&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;오류 문장과 교정 문장을 입력 받아 수정 구간을 정렬하고 한국어 특화 14개 오류 유형을 자동 부여하는 KAGAS를 제안 함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Kor-Lang8은 언어 학습 플랫폼 Lang-8과 원어민 교정 데이터를 정제하여 구축하였음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;노이즈 제거, 길이, 비율 등을 통해 정제 -&amp;gt; GLEU가 개선 -&amp;gt; GEC 품질이 중요&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1362&quot; data-origin-height=&quot;327&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Tuawn/dJMcafAE5Vw/EfedKjhMosi0kfLvQjAK6K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Tuawn/dJMcafAE5Vw/EfedKjhMosi0kfLvQjAK6K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Tuawn/dJMcafAE5Vw/EfedKjhMosi0kfLvQjAK6K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FTuawn%2FdJMcafAE5Vw%2FEfedKjhMosi0kfLvQjAK6K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1362&quot; height=&quot;327&quot; data-origin-width=&quot;1362&quot; data-origin-height=&quot;327&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1334&quot; data-origin-height=&quot;447&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/D8P0X/dJMcadQikya/Y68stHTMLn8kaYNflJ8SGk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/D8P0X/dJMcadQikya/Y68stHTMLn8kaYNflJ8SGk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/D8P0X/dJMcadQikya/Y68stHTMLn8kaYNflJ8SGk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FD8P0X%2FdJMcadQikya%2FY68stHTMLn8kaYNflJ8SGk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1334&quot; height=&quot;447&quot; data-origin-width=&quot;1334&quot; data-origin-height=&quot;447&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 860px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;논문 목적&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;한국어 문법 오류 수정(Korean GEC) 연구의 핵심 문제인 &lt;b&gt;공개 학습 데이터 부족&lt;/b&gt;, &lt;b&gt;데이터셋별 상이한 오류 주석 체계&lt;/b&gt;, &lt;b&gt;한국어 전용 자동 평가 도구 부재&lt;/b&gt;를 해결하고, 재현 가능한 표준 연구 기반을 구축한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;핵심 기여&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;① 서로 다른 사용자 집단의 오류를 포함하는 한국어 GEC 데이터셋 3종 구축, &lt;br /&gt;② 한국어 특화 자동 오류 주석 시스템 &lt;b&gt;KAGAS&lt;/b&gt; 제안, &lt;br /&gt;③ 구축한 데이터로 학습한 &lt;b&gt;KoBART 기반 베이스라인&lt;/b&gt;과 오류 유형별 분석 제공&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Kor-Learner&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;한국어 외국인 학습자의 글을 한국어 튜터가 교정한 데이터. &lt;br /&gt;국립국어원 학습자 말뭉치의 형태소 단위 XML 주석을 맞춤법 규칙에 따라 단어 단위 병렬 문장으로 복원하였다. &lt;br /&gt;&lt;b&gt;28,426문장 쌍, 59,419개 수정&lt;/b&gt;을 포함하며 조사, 어미, 활용, 명사 오류 등이 상대적으로 빈번하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Kor-Native&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;올바른 문장을 TTS로 원어민에게 들려주고 받아쓰게 한 뒤, 받아쓴 문장을 오류 문장으로 사용하는 역방향 수집 방식이다. &lt;br /&gt;&lt;b&gt;17,559문장 쌍, 29,975개 수정&lt;/b&gt;을 포함하며, 전체 오류의 약 &lt;b&gt;52.13%가 띄어쓰기 오류&lt;/b&gt;이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Kor-Lang8&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;언어 학습 플랫폼 Lang-8의 한국어 문장&amp;ndash;교정 쌍을 언어, 길이, 반복 문자, 문장 유사도, 자모 단위 Levenshtein distance 등으로 정제한 데이터이다. &lt;br /&gt;&lt;b&gt;109,559문장 쌍, 262,833개 수정&lt;/b&gt;으로 규모가 가장 크고 비격식 학습자 오류가 다양하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Kor-Lang8 정제 효과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;원본 한국어 Lang8 데이터보다 데이터 수는 감소했지만, 검증 손실은 &lt;b&gt;1.53&amp;rarr;0.83&lt;/b&gt;, Self-GLEU는 &lt;b&gt;15.01&amp;rarr;19.38&lt;/b&gt;, KoBART GLEU는 &lt;b&gt;19.69&amp;rarr;28.57&lt;/b&gt;로 향상되어 정제 과정이 실질적인 데이터 품질 개선으로 이어졌다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 100px;&quot;&gt;
&lt;td style=&quot;height: 100px;&quot;&gt;&lt;b&gt;KAGAS 역할&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 100px;&quot;&gt;오류 문장과 교정 문장을 입력받아 &lt;br /&gt;① 수정 위치를 정렬하고, &lt;br /&gt;② 수정 구간을 추출하며, &lt;br /&gt;③ 각 수정에 오류 유형을 자동 부여하고, &lt;br /&gt;④ GEC 평가에 사용되는 &lt;b&gt;M2 형식&lt;/b&gt;으로 출력한다. &lt;br /&gt;문장을 직접 교정하는 모델이 아니라 &lt;b&gt;주석&amp;middot;평가&amp;middot;분석 도구&lt;/b&gt;이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;한국어 특화 설계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;영어용 ERRANT와 달리 한국어의 &lt;b&gt;교착어 구조, 조사, 어미, 활용, 띄어쓰기, 자유로운 어순&lt;/b&gt;을 고려한다. &lt;br /&gt;단어 수준 수정 구간을 다시 형태소 수준으로 분석하고, Kkma 품사 태거와 한국어 표제어&amp;middot;철자 사전을 활용한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;14개 오류 유형&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;INS, DEL, WS, WO, SPELL, PUNCT, SHORT, VERB, ADJ, NOUN, PART, END, MOD, CONJ&lt;/b&gt;로 구성된다. &lt;br /&gt;분류가 어려운 경우는 UNK로 처리하며, 복수 유형이 가능한 경우 사전 정의된 우선순위에 따라 하나의 대표 유형을 선택한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;KAGAS 평가 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;오류 분류 coverage는 &lt;b&gt;Kor-Learner 81.56%, Kor-Native 90.92%, Kor-Lang8 82.52%&lt;/b&gt;, 전문가 수용률은 각각 &lt;b&gt;87.34%, 93.93%, 87.06%&lt;/b&gt;였다. &lt;br /&gt;INS&amp;middot;DEL&amp;middot;WS는 100% 수용률을 보였지만, POS 분석에 민감한 CONJ는 43.59%로 낮았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;실험 설정&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;한국어 사전학습 encoder&amp;ndash;decoder 모델인 &lt;b&gt;KoBART&lt;/b&gt;를 각 데이터셋 및 세 데이터셋의 통합본인 Kor-Union으로 파인튜닝했다. &lt;br /&gt;비교 대상은 규칙&amp;middot;통계 기반 한국어 교정 시스템 &lt;b&gt;Hanspell&lt;/b&gt;이며, 평가는 &lt;b&gt;GLEU와 M2 Precision/Recall/F0.5&lt;/b&gt;로 수행했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;주요 성능 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;KoBART는 Hanspell보다 Kor-Learner에서 GLEU &lt;b&gt;30.36&amp;rarr;45.06&lt;/b&gt;, Kor-Native에서 &lt;b&gt;57.08&amp;rarr;67.24&lt;/b&gt;, Kor-Lang8에서 &lt;b&gt;22.94&amp;rarr;28.48&lt;/b&gt;, Kor-Union에서 &lt;b&gt;28.82&amp;rarr;33.70&lt;/b&gt;으로 향상되었다. &lt;br /&gt;Kor-Union 기준 M2 F0.5도 &lt;b&gt;25.85&amp;rarr;31.70&lt;/b&gt;으로 개선되었다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;오류 유형별 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Hanspell은 &lt;b&gt;띄어쓰기와 철자 오류&lt;/b&gt;에 편향된 성능을 보였다. &lt;br /&gt;반면 KoBART는 명사, 동사, 형용사, 조사, 어미, 활용 등 다양한 유형에서 보다 균형 잡힌 성능을 보였다. &lt;br /&gt;단, WS의 F0.5는 Hanspell이 &lt;b&gt;61.72&lt;/b&gt;, KoBART가 &lt;b&gt;45.48&lt;/b&gt;로 Hanspell이 더 높았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;데이터 통합 효과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Kor-Union으로 먼저 학습한 뒤 개별 데이터셋에 추가 파인튜닝하면 F0.5가 Kor-Learner &lt;b&gt;37.58&amp;rarr;41.00&lt;/b&gt;, Kor-Native &lt;b&gt;70.45&amp;rarr;73.63&lt;/b&gt;, Kor-Lang8 &lt;b&gt;25.93&amp;rarr;26.78&lt;/b&gt;로 향상되어 세 데이터셋의 상호 보완성을 확인했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;핵심 해석&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;모델 성능은 학습 데이터의 오류 분포와 밀접하다. &lt;br /&gt;띄어쓰기 교정은 Kor-Native, 전문가 교정 기반 학습자 오류는 Kor-Learner, 비격식 외국인 학습자 오류는 Kor-Lang8이 적합하다. &lt;br /&gt;따라서 세 데이터셋은 단순 통합 대상이 아니라 &lt;b&gt;서로 다른 목적의 보완적 자원&lt;/b&gt;이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;논문의 의의&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;새로운 GEC 모델 구조보다 &lt;b&gt;데이터셋&amp;ndash;자동 주석&amp;ndash;표준 평가&amp;ndash;베이스라인 모델&lt;/b&gt;을 함께 제공해 한국어 GEC 연구를 재현 가능하고 비교 가능한 형태로 표준화했다는 점이 핵심이다. &lt;br /&gt;특히 단일 점수뿐 아니라 조사&amp;middot;어미&amp;middot;활용 등 오류 유형별 진단을 가능하게 했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;KAGAS coverage가 약 80～90%에 머물고, Kkma 품사 분석기와 사전 기반 철자 검사기에 의존한다. &lt;br /&gt;하나의 수정에 단일 오류 유형만 부여해 복합 오류 정보가 손실되며, TTS 받아쓰기 기반 Kor-Native가 실제 자유 작문 오류를 완전히 대표한다고 보기는 어렵다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1228</guid>
      <comments>https://yoonschallenge.tistory.com/1228#entry1228comment</comments>
      <pubDate>Wed, 22 Jul 2026 18:21:01 +0900</pubDate>
    </item>
    <item>
      <title>Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena</title>
      <link>https://yoonschallenge.tistory.com/1227</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2306.05685&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2306.05685&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1784651195299&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena&quot; data-og-description=&quot;Evaluating large language model (LLM) based chat assistants is challenging due to their broad capabilities and the inadequacy of existing benchmarks in measuring human preferences. To address this, we explore using strong LLMs as judges to evaluate these m&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2306.05685&quot; data-og-url=&quot;https://arxiv.org/abs/2306.05685v4&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/BKD3F/dJMb88Gh9TJ/r148Zfk8qTScXFHq9X0De0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cX31kT/dJMb8Rkfe0l/38f9AFrbI2uUjGTwivyYlk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2306.05685&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2306.05685&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/BKD3F/dJMb88Gh9TJ/r148Zfk8qTScXFHq9X0De0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cX31kT/dJMb8Rkfe0l/38f9AFrbI2uUjGTwivyYlk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Evaluating large language model (LLM) based chat assistants is challenging due to their broad capabilities and the inadequacy of existing benchmarks in measuring human preferences. To address this, we explore using strong LLMs as judges to evaluate these m&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLM을 평가자로 사용하면 개방형, 멀티턴 대화에서 인간 선호도를 비교적 정확하게 근사할 수 있다!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;468&quot; data-start=&quot;443&quot;&gt;사용자의 복잡한 지시를 얼마나 잘 따르는가&lt;/li&gt;
&lt;li data-end=&quot;496&quot; data-start=&quot;469&quot;&gt;개방형 질문에 얼마나 유용한 답변을 제공하는가&lt;/li&gt;
&lt;li data-end=&quot;514&quot; data-start=&quot;497&quot;&gt;이전 대화 맥락을 유지하는가&lt;/li&gt;
&lt;li data-end=&quot;543&quot; data-start=&quot;515&quot;&gt;답변이 정확하면서도 관련성 있고 이해하기 쉬운가&lt;/li&gt;
&lt;li data-end=&quot;569&quot; data-start=&quot;544&quot;&gt;사용자가 실제로 어느 답변을 더 선호하는가&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이와 같은 능력을 측정할 수 있음&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;932&quot; data-origin-height=&quot;807&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/SHCul/dJMcaa0nNgx/bKr0YZ22jWf0aDLrFrA9Bk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/SHCul/dJMcaa0nNgx/bKr0YZ22jWf0aDLrFrA9Bk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/SHCul/dJMcaa0nNgx/bKr0YZ22jWf0aDLrFrA9Bk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FSHCul%2FdJMcaa0nNgx%2FbKr0YZ22jWf0aDLrFrA9Bk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;932&quot; height=&quot;807&quot; data-origin-width=&quot;932&quot; data-origin-height=&quot;807&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1296&quot; data-origin-height=&quot;498&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bVnCJX/dJMcadizz6V/IM1pif1EI4DfB0ouptzfdk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bVnCJX/dJMcadizz6V/IM1pif1EI4DfB0ouptzfdk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bVnCJX/dJMcadizz6V/IM1pif1EI4DfB0ouptzfdk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbVnCJX%2FdJMcadizz6V%2FIM1pif1EI4DfB0ouptzfdk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1296&quot; height=&quot;498&quot; data-origin-width=&quot;1296&quot; data-origin-height=&quot;498&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;MT-Bench : 챗봇의 멀티턴 대화 능력과 지시 수행 능력을 평가하기 위한 벤치마크!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;질문당 2턴의 대화가 이어짐&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1231&quot; data-origin-height=&quot;686&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/w0N8Y/dJMcabdQIwk/QbhnKvVYMQxXOkSnBZJr50/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/w0N8Y/dJMcabdQIwk/QbhnKvVYMQxXOkSnBZJr50/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/w0N8Y/dJMcabdQIwk/QbhnKvVYMQxXOkSnBZJr50/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fw0N8Y%2FdJMcabdQIwk%2FQbhnKvVYMQxXOkSnBZJr50%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1231&quot; height=&quot;686&quot; data-origin-width=&quot;1231&quot; data-origin-height=&quot;686&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;챗봇 아레나는 두 모델과 동시에 대화한 뒤 더 좋은 답변을 선택하는 플랫폼&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Position bias - 순서에 따른 결과 변형 현상!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Verbosity bias - 짧고 정확한 답변보다, 길지만 반복적인 답변을 더 높게 평가&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Self-enhancement bias - 자기 생성 답변이나 자신과 유사한 스타일 답변을 더 선호&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 평가 모델이 문제를 정확하게 풀지 못하면 제대로 평가하지 못하는 경향이 존재.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;정답을 같이 주면 조금 더 잘 판별하기도 함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1308&quot; data-origin-height=&quot;381&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Dpn80/dJMcadvWy9U/wk8rnVKx0XlIE3yddtsXA0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Dpn80/dJMcadvWy9U/wk8rnVKx0XlIE3yddtsXA0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Dpn80/dJMcadvWy9U/wk8rnVKx0XlIE3yddtsXA0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FDpn80%2FdJMcadvWy9U%2Fwk8rnVKx0XlIE3yddtsXA0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1308&quot; height=&quot;381&quot; data-origin-width=&quot;1308&quot; data-origin-height=&quot;381&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;618&quot; data-origin-height=&quot;847&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/lR2bk/dJMcajwigWW/jsKlijebZrGKAoBYFlJeg0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/lR2bk/dJMcajwigWW/jsKlijebZrGKAoBYFlJeg0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/lR2bk/dJMcajwigWW/jsKlijebZrGKAoBYFlJeg0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FlR2bk%2FdJMcajwigWW%2FjsKlijebZrGKAoBYFlJeg0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;618&quot; height=&quot;847&quot; data-origin-width=&quot;618&quot; data-origin-height=&quot;847&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;연구 문제&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;기존 MMLU, GSM8K 같은 정답 기반 벤치마크는 챗봇의 &lt;b&gt;개방형 응답 품질, 지시 수행 능력, 멀티턴 대화 능력, 인간 선호도&lt;/b&gt;를 충분히 평가하지 못한다. &lt;br /&gt;인간 평가는 정확하지만 비용과 시간이 많이 들기 때문에, 강력한 LLM을 자동 평가자로 사용할 수 있는지 검증한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;GPT-4와 같은 강력한 LLM에게 사용자 질문과 모델 응답을 제공하고, &lt;b&gt;정확성, 관련성, 유용성, 깊이, 창의성, 상세성&lt;/b&gt; 등을 기준으로 응답 품질을 평가하게 하는 &lt;b&gt;LLM-as-a-Judge&lt;/b&gt; 방식을 제안한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;평가 방식&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;① &lt;b&gt;Pairwise comparison&lt;/b&gt;: 두 답변 중 더 좋은 답변 선택&lt;br /&gt;② &lt;b&gt;Single-answer grading&lt;/b&gt;: 하나의 답변에 1~10점 부여&lt;br /&gt;③ &lt;b&gt;Reference-guided grading&lt;/b&gt;: 수학&amp;middot;추론 문제에서 기준 답안과 비교하여 평가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;MT-Bench&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;총 &lt;b&gt;80개의 2턴 질문&lt;/b&gt;으로 구성된 멀티턴 챗봇 벤치마크다. &lt;br /&gt;Writing, Roleplay, Reasoning, Math, Coding, Extraction, STEM, Humanities의 8개 범주를 포함하며, 대화 맥락 유지와 후속 지시 수행 능력을 평가한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Chatbot Arena&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;사용자가 두 익명 모델에 동일한 질문을 하고 더 좋은 답변에 투표하는 크라우드소싱 플랫폼이다. &lt;br /&gt;정해진 질문 없이 실제 사용자의 다양한 질의와 선호도를 수집하며, 논문에서는 약 &lt;b&gt;30K개의 대화 및 투표&lt;/b&gt;를 확보했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;실험 설정&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;MT-Bench에서는 GPT-4, GPT-3.5, Claude, Vicuna-13B, Alpaca-13B, LLaMA-13B를 비교하고, &lt;b&gt;58명의 전문가 평가자로부터 약 3K개의 투표&lt;/b&gt;를 수집했다. &lt;br /&gt;Chatbot Arena에서는 30K 투표 중 3K개를 샘플링해 LLM Judge와 인간 평가를 비교했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;무승부를 제외했을 때 GPT-4와 인간의 평가 일치도는 &lt;b&gt;MT-Bench에서 약 85%&lt;/b&gt;, Chatbot Arena에서 &lt;b&gt;약 87%&lt;/b&gt;였다. &lt;br /&gt;이는 인간 평가자 간 일치도인 약 &lt;b&gt;81~82%&lt;/b&gt;와 유사하거나 더 높은 수준이다. &lt;br /&gt;따라서 GPT-4는 인간 다수의 선호 경향을 상당히 잘 근사한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;모델 간 차이에 따른 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;두 모델의 성능 차이가 클수록 GPT-4와 인간의 평가 일치도가 높아져 거의 100%에 접근했다. &lt;br /&gt;반대로 성능이 유사한 모델끼리 비교할 때는 평가 편향과 불일치가 증가했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Position bias&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;동일한 두 답변의 순서만 바꾸어도 평가 결과가 달라지는 편향이다. &lt;br /&gt;순서 교체 후 판단 일관성은 Claude 23.8%, GPT-3.5 46.2%, GPT-4 65.0%로, GPT-4도 유사한 품질의 답변에서는 위치 편향을 보였다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Verbosity bias&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;새로운 정보 없이 답변을 길고 반복적으로 만들었을 때 더 좋은 답변으로 평가하는 편향이다. &lt;br /&gt;반복 목록 공격 실패율은 Claude와 GPT-3.5가 각각 91.3%, GPT-4가 8.7%로 나타났다. &lt;br /&gt;GPT-4가 상대적으로 강하지만 완전히 안전하지는 않다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Self-enhancement bias&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;평가 모델이 자신이 생성한 답변이나 유사한 스타일의 응답을 선호할 가능성이다.&lt;br /&gt;GPT-4는 인간보다 자신의 답변 승률을 약 10% 높게, Claude는 약 25% 높게 평가했으나, 실험 통제가 어려워 확정적 결론은 내리지 않았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;수학&amp;middot;추론 평가 한계&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;GPT-4가 문제를 독립적으로 풀 때는 정답을 알면서도, 잘못된 모델 답변과 함께 제시되면 그 오류에 영향을 받아 틀린 답변을 정답으로 판단할 수 있었다. &lt;br /&gt;즉, 평가 능력은 Judge 모델 자체의 추론 능력과 입력 문맥에 제한된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;편향 완화 방법&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;① 답변 순서를 바꾸어 두 번 평가하고 결과가 일치할 때만 승리 판정&lt;br /&gt;② A 승리, B 승리, 무승부 예시를 제공하는 few-shot judge&lt;br /&gt;③ 평가 전 문제를 독립적으로 풀게 하는 CoT judge&lt;br /&gt;④ 외부 기준 답안을 제공하는 reference-guided judge&lt;br /&gt;⑤ 멀티턴에서는 각 모델의 전체 대화 기록을 함께 제시&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;완화 효과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Few-shot을 사용하면 GPT-4의 순서 교체 일관성이 &lt;b&gt;65.0%&amp;rarr;77.5%&lt;/b&gt;로 향상됐다.&amp;nbsp;&lt;br /&gt;수학 평가 실패는 기본 프롬프트 14/20, CoT 6/20, reference-guided 3/20으로 감소하여, 단순 CoT보다 &lt;b&gt;독립적인 기준 답안 제공이 가장 효과적&lt;/b&gt;이었다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;기존 벤치마크와의 관계&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;MT-Bench와 Chatbot Arena는 기존 벤치마크를 대체하지 않는다. &lt;br /&gt;MMLU 등은 지식&amp;middot;추론 같은 &lt;b&gt;핵심 능력&lt;/b&gt;을, MT-Bench는 지시 수행&amp;middot;대화 품질&amp;middot;인간 선호를 측정하므로 두 평가를 함께 사용해야 한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;중요한 관찰&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;소량의 고품질 대화 데이터만으로도 모델의 MMLU 성능은 크게 향상되지 않지만, MT-Bench 점수는 빠르게 향상될 수 있다.&lt;br /&gt;이는 instruction tuning이 지식 자체보다 &lt;b&gt;인간이 선호하는 답변 형식과 대화 스타일&lt;/b&gt;을 효과적으로 학습시킨다는 것을 보여준다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;논문의 기여&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;① LLM-as-a-Judge의 인간 평가 일치도를 체계적으로 검증&lt;br /&gt;② MT-Bench와 Chatbot Arena 구축 및 공개&lt;br /&gt;③ 위치&amp;middot;장황함&amp;middot;추론 편향을 분석하고 완화 방법 제안&lt;br /&gt;④ 능력 기반 벤치마크와 선호 기반 평가를 결합한 혼합 평가 체계 제안&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Helpfulness 중심으로 평가해 안전성&amp;middot;정직성&amp;middot;유해성 분석이 부족하다. &lt;br /&gt;여러 평가 요소가 하나의 점수에 혼합되며, GPT-4의 문체와 선호 기준이 평가 결과에 반영될 수 있다. &lt;br /&gt;또한 전문 지식, 수학, 복잡한 추론에서는 Judge 자체가 틀릴 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;최종 결론&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;강력한 LLM Judge는 인간 평가를 완전히 대체하는 절대적 평가자가 아니라, &lt;b&gt;개방형 응답과 인간 선호를 저비용으로 근사하는 확장 가능한 자동 평가 도구&lt;/b&gt;다. &lt;br /&gt;실제 사용 시에는 답변 순서 교체, 기준 답안, 규칙 기반 검증, 복수 Judge, 인간 검토를 결합해야 신뢰도를 확보할 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1227</guid>
      <comments>https://yoonschallenge.tistory.com/1227#entry1227comment</comments>
      <pubDate>Wed, 22 Jul 2026 02:02:10 +0900</pubDate>
    </item>
    <item>
      <title>Large Language Models are not Fair Evaluators</title>
      <link>https://yoonschallenge.tistory.com/1226</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2305.17926&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2305.17926&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1784568034487&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Large Language Models are not Fair Evaluators&quot; data-og-description=&quot;In this paper, we uncover a systematic bias in the evaluation paradigm of adopting large language models~(LLMs), e.g., GPT-4, as a referee to score and compare the quality of responses generated by candidate models. We find that the quality ranking of cand&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2305.17926&quot; data-og-url=&quot;https://arxiv.org/abs/2305.17926v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/b7wO7y/dJMb87N9NJu/Senh5KiAdwdbAGEXjKtE30/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/kOGkV/dJMb89yqBPK/h3iPdKh9xc3hIhKN0EZyCk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2305.17926&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2305.17926&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/b7wO7y/dJMb87N9NJu/Senh5KiAdwdbAGEXjKtE30/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/kOGkV/dJMb89yqBPK/h3iPdKh9xc3hIhKN0EZyCk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Large Language Models are not Fair Evaluators&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;In this paper, we uncover a systematic bias in the evaluation paradigm of adopting large language models~(LLMs), e.g., GPT-4, as a referee to score and compare the quality of responses generated by candidate models. We find that the quality ranking of cand&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLM as Judge를 하다가 편햐애 문제가 생각보다 큰 것 같아서. ...&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;조금 찾아보게 되었습니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;982&quot; data-origin-height=&quot;760&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Fihzb/dJMcaixntGd/gMSoEt3wHuK6p3jZU4uITK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Fihzb/dJMcaixntGd/gMSoEt3wHuK6p3jZU4uITK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Fihzb/dJMcaixntGd/gMSoEt3wHuK6p3jZU4uITK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FFihzb%2FdJMcaixntGd%2FgMSoEt3wHuK6p3jZU4uITK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;982&quot; height=&quot;760&quot; data-origin-width=&quot;982&quot; data-origin-height=&quot;760&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;GPT 같은 llm을 평가자로 활용할 때 두 응답의 내용이 같더라도 순서만 바꿔도 평가 결과가 뒤집히는 위치 편향이 발생한다는 사실을 밝힌 논문입니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1111&quot; data-origin-height=&quot;331&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/uPfhO/dJMcabkKzed/XO6EPosJ7UAK4kcU2W9Nck/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/uPfhO/dJMcabkKzed/XO6EPosJ7UAK4kcU2W9Nck/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/uPfhO/dJMcabkKzed/XO6EPosJ7UAK4kcU2W9Nck/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FuPfhO%2FdJMcabkKzed%2FXO6EPosJ7UAK4kcU2W9Nck%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1111&quot; height=&quot;331&quot; data-origin-width=&quot;1111&quot; data-origin-height=&quot;331&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;위치에 따른 승률 차이가 큰 것을 보여준다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모델 별로 선호하는 응답 위치 또한 다르다...&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;554&quot; data-origin-height=&quot;532&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/KWPzv/dJMcacqp10b/nrujiHgKuNdBbCdfzpdPqK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/KWPzv/dJMcacqp10b/nrujiHgKuNdBbCdfzpdPqK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/KWPzv/dJMcacqp10b/nrujiHgKuNdBbCdfzpdPqK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FKWPzv%2FdJMcacqp10b%2FnrujiHgKuNdBbCdfzpdPqK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;554&quot; height=&quot;532&quot; data-origin-width=&quot;554&quot; data-origin-height=&quot;532&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;응답 품질이 비슷할수록 편향 차이도 커진다고 나왔습니다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1109&quot; data-origin-height=&quot;527&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/eEnMH7/dJMcaiD8c34/GILUCqAVVjQdvF5dzO2Pfk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/eEnMH7/dJMcaiD8c34/GILUCqAVVjQdvF5dzO2Pfk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/eEnMH7/dJMcaiD8c34/GILUCqAVVjQdvF5dzO2Pfk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FeEnMH7%2FdJMcaiD8c34%2FGILUCqAVVjQdvF5dzO2Pfk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1109&quot; height=&quot;527&quot; data-origin-width=&quot;1109&quot; data-origin-height=&quot;527&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;3단계 보정 프레임워크를 통해 위치 편향을 완화하려고 함.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;위치 바꾸기, 설명 근거 후 점수 내게 하기 + HITL 을 통해 낮춤&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;BPDE를 통해 HITL로 넘어가는데 엔트로피를 통해 계산하며 판정이 섞여 있으면 사람이 평가하게 된다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1143&quot; data-origin-height=&quot;822&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/KyDYf/dJMcafUYe5l/muOJFfGY28sZuOl3qXcpaK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/KyDYf/dJMcafUYe5l/muOJFfGY28sZuOl3qXcpaK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/KyDYf/dJMcafUYe5l/muOJFfGY28sZuOl3qXcpaK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FKyDYf%2FdJMcafUYe5l%2FmuOJFfGY28sZuOl3qXcpaK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1143&quot; height=&quot;822&quot; data-origin-width=&quot;1143&quot; data-origin-height=&quot;822&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;코스트를 줄이며 정확도를 올릴 수 있음.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;흠 근데 뭐 이건....&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;편향을 줄이려고 노력하긴 했습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;연구 배경&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;BLEU&amp;middot;ROUGE와 같은 기존 자동 평가지표는 자유형 생성 응답의 유용성, 정확성, 인간 의도 정렬을 충분히 평가하기 어렵다. &lt;br /&gt;이에 GPT-4와 ChatGPT를 평가자로 사용하는 &lt;b&gt;LLM-as-a-Judge&lt;/b&gt; 방식이 확산되었지만, 그 평가 신뢰성은 충분히 검증되지 않았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;해결하려는 문제&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;동일한 두 응답의 &lt;b&gt;제시 순서만 바꾸었을 때 평가 점수와 승자가 달라지는 위치 편향(Positional Bias)&lt;/b&gt; 문제를 분석한다. &lt;br /&gt;이 편향으로 인해 특정 모델의 성능을 실제보다 높거나 낮게 보이도록 평가 결과를 조작할 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 발견 1&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;GPT-4는 대체로 &lt;b&gt;첫 번째 응답&lt;/b&gt;, ChatGPT는 &lt;b&gt;두 번째 응답&lt;/b&gt;을 선호했다. &lt;br /&gt;평가 프롬프트에 &amp;ldquo;응답 순서가 판단에 영향을 주지 않도록 하라&amp;rdquo;는 지시를 포함해도 편향은 사라지지 않았다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 발견 2&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Vicuna-13B와 ChatGPT를 비교할 때, GPT-4 평가에서 Vicuna의 승률은 첫 번째 위치에서 &lt;b&gt;51.3%&lt;/b&gt;, 두 번째 위치에서 &lt;b&gt;23.8%&lt;/b&gt;였으며 충돌률은 &lt;b&gt;46.3%&lt;/b&gt;였다.&lt;br /&gt;ChatGPT 평가에서는 승률이 &lt;b&gt;2.5% &amp;rarr; 82.5%&lt;/b&gt;로 변했고 충돌률은 &lt;b&gt;82.5%&lt;/b&gt;였다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 발견 3&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;두 응답의 품질 차이가 작을수록 위치 편향이 강했다. 특히 점수 차이가 1 이하인 어려운 비교에서는 순서 변경에 따라 결과가 자주 뒤집혔지만, 점수 차이가 3 이상이면 상대적으로 안정적이었다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;평가 불안정성 지표&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Conflict Rate&lt;/b&gt;를 제안했다. &lt;br /&gt;동일한 응답 쌍을 원래 순서와 교환된 순서로 평가했을 때, 두 판정이 서로 다른 사례의 비율을 측정한다. &lt;br /&gt;값이 높을수록 평가자가 응답 위치에 민감하다는 의미다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;제안 방법 1: MEC&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Multiple Evidence Calibration&lt;/b&gt;. &lt;br /&gt;점수를 먼저 생성하고 설명을 나중에 붙이는 기존 방식과 달리, 평가 근거를 먼저 생성한 뒤 점수를 출력한다. &lt;br /&gt;또한 동일 사례를 여러 번 샘플링하여 평가 결과를 평균&amp;middot;앙상블함으로써 단일 평가의 우연성을 줄인다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;제안 방법 2: BPC&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Balanced Position Calibration&lt;/b&gt;. &lt;br /&gt;두 응답을 원래 순서와 교환된 순서로 각각 평가하고, 각 응답이 첫 번째와 두 번째 위치에서 받은 점수를 평균한다. &lt;br /&gt;특정 위치에서 얻는 이점과 불이익을 직접 상쇄하는 핵심 방법이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;제안 방법 3: HITLC&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Human-in-the-Loop Calibration&lt;/b&gt;.&lt;br /&gt;MEC와 BPC에서 생성된 여러 win/tie/lose 판정의 불일치 정도를 &lt;b&gt;BPDE(Balanced Position Diversity Entropy)&lt;/b&gt;로 계산한다. &lt;br /&gt;BPDE가 높은, 즉 LLM 평가가 불안정한 사례만 사람이 직접 평가한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;실험 설정&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Vicuna Benchmark의 &lt;b&gt;80개 질문&lt;/b&gt;, 9개 범주를 사용했다. &lt;br /&gt;ChatGPT와 Vicuna-13B 응답을 GPT-4 및 ChatGPT가 평가했으며, 세 명의 연구자가 유용성&amp;middot;관련성&amp;middot;정확성&amp;middot;상세성을 기준으로 독립 평가한 뒤 다수결 결과를 정답으로 사용했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;GPT-4 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Vanilla 평가 정확도는 &lt;b&gt;52.7%&lt;/b&gt;, MEC는 &lt;b&gt;58.7%&lt;/b&gt;, MEC+BPC는 &lt;b&gt;62.5%&lt;/b&gt;였다. &lt;br /&gt;상위 20%의 불안정 사례를 사람이 평가한 HITLC까지 적용하면 &lt;b&gt;73.8%&lt;/b&gt;, Kappa &lt;b&gt;0.56&lt;/b&gt;으로 상승했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;ChatGPT 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Vanilla 정확도는 &lt;b&gt;44.4%&lt;/b&gt;, MEC는 &lt;b&gt;53.2%&lt;/b&gt;, MEC+BPC는 &lt;b&gt;58.7%&lt;/b&gt;였다. &lt;br /&gt;HITLC를 추가하면 &lt;b&gt;71.3%&lt;/b&gt;, Kappa &lt;b&gt;0.52&lt;/b&gt;를 달성하여 인간 평가자 평균 정확도 &lt;b&gt;71.7%&lt;/b&gt;에 근접했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;비용 효과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;ChatGPT 기반 MEC+BPC+HITLC는 전체 사례 중 20%만 사람이 평가하면서 인간 평가 비용을 &lt;b&gt;$30에서 $18.3으로 약 39% 절감&lt;/b&gt;했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 분석 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;MEC는 반복 횟수 (k=3)에서 성능과 비용의 균형이 가장 좋았다. &lt;br /&gt;단순히 샘플 수를 늘린 MEC (k=6)보다, 동일한 평가 횟수로 순서를 교환한 MEC+BPC가 더 우수해 위치 균형화의 효과를 입증했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;연구 의의&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;LLM Judge의 평가는 절대적으로 공정하거나 객관적인 판정이 아니며, 입력 구성과 응답 위치에 의해 쉽게 왜곡될 수 있음을 실증했다. &lt;br /&gt;동시에 재학습 없이 적용할 수 있는 단순한 위치 교환&amp;middot;반복 평가&amp;middot;선택적 인간 검토 전략을 제시했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;80개 질문과 당시 GPT-4&amp;middot;ChatGPT 버전에 한정된 실험이며, 인간 평가자도 세 명의 저자로 제한된다. &lt;br /&gt;또한 위치 편향은 완화하지만 길이 편향, 자기 선호, 문체 편향, verbosity bias 등 다른 LLM Judge 편향을 직접 해결하지는 않는다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;최종 결론&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;LLM 평가 결과를 신뢰하려면 &lt;b&gt;평가 근거를 먼저 생성하고, 두 응답의 순서를 교환하여 여러 번 평가하며, 결과가 불안정한 사례는 인간에게 검토하도록 해야 한다.&lt;/b&gt; &lt;br /&gt;즉, 단일 순서&amp;middot;단일 호출의 LLM Judge 점수를 모델의 객관적 성능으로 사용해서는 안 된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1226</guid>
      <comments>https://yoonschallenge.tistory.com/1226#entry1226comment</comments>
      <pubDate>Tue, 21 Jul 2026 02:45:35 +0900</pubDate>
    </item>
    <item>
      <title>Towards Compressive and Scalable RecurrentMemory</title>
      <link>https://yoonschallenge.tistory.com/1225</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2602.11212&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2602.11212&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1782729265124&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Towards Compressive and Scalable Recurrent Memory&quot; data-og-description=&quot;Transformers face a quadratic bottleneck in attention when scaling to long contexts. Recent approaches introduce recurrent memory to extend context beyond the current window, yet these often face a fundamental trade-off between theoretical principles and p&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2602.11212&quot; data-og-url=&quot;https://arxiv.org/abs/2602.11212v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/LI58C/dJMb8U84lCM/gh1RASw01YvE4hlPkO6Rp0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/z3t07/dJMb8RkcKDB/st7j6ZkyREjz8cK0qXoNL1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2602.11212&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2602.11212&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/LI58C/dJMb8U84lCM/gh1RASw01YvE4hlPkO6Rp0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/z3t07/dJMb8RkcKDB/st7j6ZkyREjz8cK0qXoNL1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Towards Compressive and Scalable Recurrent Memory&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Transformers face a quadratic bottleneck in attention when scaling to long contexts. Recent approaches introduce recurrent memory to extend context beyond the current window, yet these often face a fundamental trade-off between theoretical principles and p&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ICLR 2026에 제출했지만 리젝했네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서도 동일하게 transformer가 long context에서 attention 비용이 quadratic하게 증가하고, 기존 recurrent memory는 이론적 정당성과 실용적 확장성 사이에 trade-off를 말합니다. 그래서 긴 context를 많이 저장하기 보다는 어떻게 압축해야 정보 손실을 줄일 수 있는가가 핵심 문제라고 말합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 여기선 HiPPO 기반의 수학적 함수 근사로 과거 key/value 정보를 고정 크기 memory state에 압축하고, 필요할 때 polynomial sampling으로 다시 복원해 attention에 넣는 elastic memory를 제안합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 과거의 토큰을 그대로 저장하지 않고, 어텐션 정보를 하나의 곡선처럼 저장했다가 다시 꺼내 쓰는 것입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2224&quot; data-origin-height=&quot;1236&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c5MgQQ/dJMcahrs5rU/nWEKRvuDg3ogmqXnbizGV1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c5MgQQ/dJMcahrs5rU/nWEKRvuDg3ogmqXnbizGV1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c5MgQQ/dJMcahrs5rU/nWEKRvuDg3ogmqXnbizGV1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc5MgQQ%2FdJMcahrs5rU%2FnWEKRvuDg3ogmqXnbizGV1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2224&quot; height=&quot;1236&quot; data-origin-width=&quot;2224&quot; data-origin-height=&quot;1236&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;현재 블록에서 Q, K, V 만들기 -&amp;gt; Memory Retrieval -&amp;gt; Trapezoidal attention -&amp;gt; Memory Update&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2220&quot; data-origin-height=&quot;882&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b2DXK2/dJMcahLIpP4/NKmDSRNMKblTlU9N9ofbq0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b2DXK2/dJMcahLIpP4/NKmDSRNMKblTlU9N9ofbq0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b2DXK2/dJMcahLIpP4/NKmDSRNMKblTlU9N9ofbq0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb2DXK2%2FdJMcahLIpP4%2FNKmDSRNMKblTlU9N9ofbq0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2220&quot; height=&quot;882&quot; data-origin-width=&quot;2220&quot; data-origin-height=&quot;882&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 메모리 모델 구조와 어떻게 다른지 보여주며 파라미터가 존재하지 않고, HiPPO로 메모리를 키울 수 있지만 이건 학습 파라미터가 아닌 memory state dimension임&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2180&quot; data-origin-height=&quot;786&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/roSJp/dJMcaiKzLOu/bn1GFB6thLxXBwYSVrSMQK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/roSJp/dJMcaiKzLOu/bn1GFB6thLxXBwYSVrSMQK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/roSJp/dJMcaiKzLOu/bn1GFB6thLxXBwYSVrSMQK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FroSJp%2FdJMcaiKzLOu%2Fbn1GFB6thLxXBwYSVrSMQK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2180&quot; height=&quot;786&quot; data-origin-width=&quot;2180&quot; data-origin-height=&quot;786&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;PPL이 낮은 것을 통해 성능이 우수하닥 ㅗ말하고 있다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2182&quot; data-origin-height=&quot;538&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/wQI4I/dJMcahSqU60/2BLDpZtsgBbzxd9p2g7ON0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/wQI4I/dJMcahSqU60/2BLDpZtsgBbzxd9p2g7ON0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/wQI4I/dJMcahSqU60/2BLDpZtsgBbzxd9p2g7ON0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FwQI4I%2FdJMcahSqU60%2F2BLDpZtsgBbzxd9p2g7ON0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2182&quot; height=&quot;538&quot; data-origin-width=&quot;2182&quot; data-origin-height=&quot;538&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;메모리 사이즈를 키웠을 때의 변화로 성능이 안정적으로 좋아지는 모습을 보여준다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2166&quot; data-origin-height=&quot;814&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dRJZCS/dJMcag65M1C/hUK0nk2VjjQBKC1WHPe9G0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dRJZCS/dJMcag65M1C/hUK0nk2VjjQBKC1WHPe9G0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dRJZCS/dJMcag65M1C/hUK0nk2VjjQBKC1WHPe9G0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdRJZCS%2FdJMcag65M1C%2FhUK0nk2VjjQBKC1WHPe9G0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2166&quot; height=&quot;814&quot; data-origin-width=&quot;2166&quot; data-origin-height=&quot;814&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모델이 커질수록 성능이 좋아지는 모습이 보이며 uni, exp의 차이도 지속적으로 보여주고 있다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;exp는 최근 context를 좀 더 촘촘하게 복원하고, uni는 과거 전체를 균등하게 복원한다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2198&quot; data-origin-height=&quot;1218&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/easO6s/dJMcaiDSbd1/z57wJ3osjy8JKhklVvykqk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/easO6s/dJMcaiDSbd1/z57wJ3osjy8JKhklVvykqk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/easO6s/dJMcaiDSbd1/z57wJ3osjy8JKhklVvykqk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FeasO6s%2FdJMcaiDSbd1%2Fz57wJ3osjy8JKhklVvykqk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2198&quot; height=&quot;1218&quot; data-origin-width=&quot;2198&quot; data-origin-height=&quot;1218&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;table 5는 학습 끝난뒤에도 검색 방식만 바꿔 성능을 조절할 수 있나 확인해보았고, 각각 장점인 방식으로 바꿀 수 있음을 보여줬다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2210&quot; data-origin-height=&quot;498&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/shLYO/dJMcabkuzH9/sx6LJtZ3RuSAwC2faBKgQK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/shLYO/dJMcabkuzH9/sx6LJtZ3RuSAwC2faBKgQK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/shLYO/dJMcabkuzH9/sx6LJtZ3RuSAwC2faBKgQK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FshLYO%2FdJMcabkuzH9%2Fsx6LJtZ3RuSAwC2faBKgQK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2210&quot; height=&quot;498&quot; data-origin-width=&quot;2210&quot; data-origin-height=&quot;498&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;진짜 long-term memory를 사용하는지 확인하였습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그를 위해 일부로 랜덤 노이즈를 통해 키 벨류를 망가뜨리고, 성능을 측정했다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기선 실제 정보를 압축한다고 보여준다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;논문 문제&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Transformer는 긴 문맥에서 attention 비용이 quadratic하게 증가하고, 기존 recurrent memory는 &lt;b&gt;이론적 정당성&lt;/b&gt;과 &lt;b&gt;실용적 확장성&lt;/b&gt; 사이의 trade-off가 있음.&lt;/td&gt;
&lt;td&gt;긴 context를 단순히 더 많이 저장하는 것이 아니라, &lt;b&gt;어떻게 압축해야 정보 손실을 줄일 수 있는가&lt;/b&gt;가 핵심 문제.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;제안 방법&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Elastic Memory&lt;/b&gt;를 제안. 과거 Key/Value sequence를 continuous signal로 보고, HiPPO 기반 online function approximation으로 고정 크기 memory state에 압축.&lt;/td&gt;
&lt;td&gt;memory를 heuristic summary가 아니라 &lt;b&gt;수학적으로 정의된 최적 polynomial approximation 문제&lt;/b&gt;로 재정의.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;과거 전체 token을 저장하지 않고, 과거 K/V trajectory를 Legendre polynomial basis 위의 coefficient로 표현.&lt;/td&gt;
&lt;td&gt;raw KV cache나 summary token보다 더 principled한 compression. 긴 문맥의 저주파/semantic structure를 보존하는 방향.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Memory Update&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;block 단위로 HiPPO recurrence를 병렬화하여 C_i = P_i C_{i-1} + K^ˉ_i F_i 형태로 memory state를 업데이트. P_i, K^ˉ_i는 precompute/cache.&lt;/td&gt;
&lt;td&gt;token-by-token recurrence의 sequential bottleneck을 제거하면서 HiPPO의 이론적 구조는 유지.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Memory Retrieval&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;압축된 coefficient state에서 reconstruction matrix R_i를 통해 K_{mem}, V_{mem}을 복원. 이후 current block의 K/V 앞에 붙여 attention 수행.&lt;/td&gt;
&lt;td&gt;memory state와 retrieval 방식이 분리되어 있어, inference 시점에 retrieval bias를 바꿀 수 있음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Sampling 전략&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Uniform sampling&lt;/b&gt;은 과거 전체를 균등하게 복원하고, &lt;b&gt;Exponential sampling&lt;/b&gt;은 최근 context를 더 촘촘히 복원.&lt;/td&gt;
&lt;td&gt;Exponential은 일반 PPL에 유리하고, Uniform은 먼 과거 정보가 중요한 LongPPL에 유리. 즉, retrieval policy에 따라 성능 성격이 달라짐.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;실험 설정&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;PG-19, Proof-Pile, FineWeb-Edu의 32k+ long-document language modeling에서 평가. block size는 2,048. Llama 3 기반 architecture를 사용하고, 모든 모델은 scratch에서 40B tokens 학습.&lt;/td&gt;
&lt;td&gt;long-context memory 성능을 보기 위한 비교적 통제된 실험 환경. baseline은 Transformer++, Memorizing Transformer, Infini-Transformer, Melodi.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Elastic Memory는 추가 trainable parameter 없이 강한 성능을 보임. Elastic Memoryexp는 PPL에서 가장 강하고, Elastic Memoryuni는 LongPPL에서 가장 강함. 1x memory의 Elastic Memoryexp가 16x Memorizing Transformer보다 낮은 PPL을 달성.&lt;/td&gt;
&lt;td&gt;단순히 memory를 많이 저장하는 것보다 &lt;b&gt;principled compression&lt;/b&gt;이 더 효율적일 수 있음을 보여줌.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Scaling 결과&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;memory size를 1x&amp;rarr;16x로 키울수록 Elastic Memory의 성능이 안정적으로 개선됨. model size를 100M&amp;rarr;400M으로 키워도 장점 유지.&lt;/td&gt;
&lt;td&gt;memory capacity가 모델 dimension에 묶이지 않고, HiPPO dimension (N)으로 확장 가능하다는 점이 강점.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;추가 분석&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;test-time sampling bias injection 실험에서 retrieval 방식을 바꾸면 PPL/LongPPL trade-off를 조절 가능. local context corruption 실험에서도 Elastic Memory가 더 robust.&lt;/td&gt;
&lt;td&gt;모델이 실제로 long-term memory를 활용하고 있으며, memory representation이 특정 retrieval 방식에 과도하게 고정되지 않았음을 시사.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;장점&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;이론적 기반이 명확하고, 추가 parameter 없이 memory scaling 가능하며, full 32k context를 압축 형태로 접근 가능. Melodi보다 효율적이고 빠름.&lt;/td&gt;
&lt;td&gt;long-context Transformer에서 &lt;b&gt;compression, scalability, efficiency&lt;/b&gt;를 동시에 노린 설계.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;실험 규모가 100M&amp;ndash;400M 중심이고, 평가는 PPL/LongPPL 중심. QA, reasoning, retrieval, agent task 같은 downstream 검증은 부족함. precomputed matrix bank도 구현 부담이 있음.&lt;/td&gt;
&lt;td&gt;7B+ LLM이나 실제 long-context downstream task에서 동일한 이득이 유지되는지는 추가 검증 필요.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;최종 의의&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;이 논문은 long-context memory를 &amp;ldquo;더 많이 저장하는 문제&amp;rdquo;가 아니라 &lt;b&gt;과거 K/V signal을 어떻게 압축하고 복원할 것인가&lt;/b&gt;의 문제로 바꾼다.&lt;/td&gt;
&lt;td&gt;핵심 기여는 &lt;b&gt;cache-based memory &amp;rarr; function-approximation-based memory&lt;/b&gt;로 관점을 전환한 것.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1225</guid>
      <comments>https://yoonschallenge.tistory.com/1225#entry1225comment</comments>
      <pubDate>Mon, 29 Jun 2026 20:51:57 +0900</pubDate>
    </item>
    <item>
      <title>TurboQuant: Online Vector Quantization with Near-optimalDistortion Rate</title>
      <link>https://yoonschallenge.tistory.com/1224</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2504.19874&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2504.19874&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1782382387164&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate&quot; data-og-description=&quot;Vector quantization, a problem rooted in Shannon's source coding theory, aims to quantize high-dimensional Euclidean vectors while minimizing distortion in their geometric structure. We propose TurboQuant to address both mean-squared error (MSE) and inner &quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2504.19874&quot; data-og-url=&quot;https://arxiv.org/abs/2504.19874v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/dfw7ka/dJMb8SpScDq/6asK5HzFZirZiCFJIpFDPk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/L9K9x/dJMb8Qewna3/LjEDXp3RlGg75qMbpmzIJ0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2504.19874&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2504.19874&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/dfw7ka/dJMb8SpScDq/6asK5HzFZirZiCFJIpFDPk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/L9K9x/dJMb8Qewna3/LjEDXp3RlGg75qMbpmzIJ0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Vector quantization, a problem rooted in Shannon's source coding theory, aims to quantize high-dimensional Euclidean vectors while minimizing distortion in their geometric structure. We propose TurboQuant to address both mean-squared error (MSE) and inner&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;양자화는 잘 아는 분야가 아니라 조금 어렵겠지만.... 요즘 화두가 된 논문이니 한번 읽어보려고 합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;사전 지식&amp;nbsp;&lt;/h3&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;1. 벡터 양자화, Vector Quantization&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;실수 벡터 &lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;x&lt;/span&gt;&lt;span&gt;&amp;isin;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;R^&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;d&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;를 낮은 bit의 정수/bit string으로 바꾸고, 다시 근사 벡터 &lt;span&gt;&lt;span&gt;x&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;~&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;로 복원하는 압축 기법&lt;/td&gt;
&lt;td&gt;TurboQuant의 본질은 LLM 전용 기법이 아니라 &lt;b&gt;고차원 벡터를 압축하는 일반적 VQ 알고리즘&lt;/b&gt;임&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;2. Bit-width&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;(b)-bit quantization은 좌표 하나당 평균 b bit를 쓴다는 뜻. 예: 16-bit &amp;rarr; 4-bit &amp;rarr; 2-bit로 갈수록 압축률은 커지지만 정보 손실도 커짐&lt;/td&gt;
&lt;td&gt;논문은 모든 bit-width b에서 distortion이 얼마나 줄어드는지 이론적으로 분석함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;3. Quantization / Dequantization&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Quantization은 Q(x), dequantization은 Q^{-1}(Q(x))=&lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;~&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;. 즉, 원본 벡터를 저장하지 않고 압축 표현만 저장한 뒤 근사 복원&lt;/td&gt;
&lt;td&gt;Algorithm 1과 Algorithm 2가 각각 Quant와 DeQuant 절차로 구성됨&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;4. MSE distortion&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;원본 벡터와 복원 벡터의 거리 손실. &lt;span&gt;&lt;span&gt;E&lt;/span&gt;&lt;span&gt;[&lt;/span&gt;&lt;span&gt;∥&lt;/span&gt;&lt;span&gt;x&lt;/span&gt;&lt;span&gt;&amp;minus;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;x&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;~&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;∥^&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;2_&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;2&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;/span&gt;&lt;/td&gt;
&lt;td&gt;TurboQuantmse는 이 값을 최소화하는 방향으로 설계됨&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;5. Inner product distortion&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;⟨&lt;/span&gt;&lt;span&gt;y&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;x&lt;/span&gt;&lt;span&gt;⟩&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;와 &lt;span&gt;&lt;span&gt;⟨y,x~⟩&lt;/span&gt;&lt;/span&gt;의 차이. 즉, 압축 후에도 query와 vector의 dot product가 얼마나 보존되는지&lt;/td&gt;
&lt;td&gt;attention, embedding search, nearest neighbor search는 대부분 inner product/cosine similarity에 의존하므로 매우 중요함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;6. Bias / Unbiased estimator&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;압축 후 추정값의 평균이 원래 값과 같으면 unbiased. 즉, &lt;span&gt;&lt;span&gt;E&lt;/span&gt;&lt;span&gt;[⟨&lt;/span&gt;&lt;span&gt;y&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;x&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;~&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;⟩]&lt;/span&gt;&lt;span&gt;=&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;⟨&lt;/span&gt;&lt;span&gt;y&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;x&lt;/span&gt;&lt;span&gt;⟩&lt;/span&gt;&lt;/span&gt;&lt;/td&gt;
&lt;td&gt;논문은 MSE에 최적인 quantizer가 inner product에는 bias를 만들 수 있음을 지적하고, residual QJL로 이를 해결함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;7. Random rotation&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;벡터를 무작위 직교행렬 &amp;Pi;로 회전시키는 것. 길이와 inner product는 보존하지만 좌표 분포를 균질하게 만듦&lt;/td&gt;
&lt;td&gt;TurboQuant의 핵심 출발점. worst-case 벡터도 회전 후에는 구면 위 랜덤 벡터처럼 다룰 수 있음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;8. 고차원 구면과 concentration&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;고차원 unit sphere의 랜덤 점은 각 좌표가 매우 작고, 대략 N(0,1/d)처럼 분포함&lt;/td&gt;
&lt;td&gt;논문은 random rotation 후 각 좌표가 Beta distribution을 따르고, 고차원에서는 Gaussian에 가까워진다는 점을 이용함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;9. Scalar quantization&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;벡터 전체를 한 번에 양자화하지 않고, 각 좌표를 독립적으로 양자화하는 방식&lt;/td&gt;
&lt;td&gt;TurboQuant는 random rotation 덕분에 좌표별 scalar quantization만으로도 near-optimal vector quantization을 달성한다고 주장함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;10. Lloyd-Max quantizer / 1D k-means&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;1차원 분포를 여러 구간으로 나누고 각 구간을 centroid로 대표하게 하는 최적 scalar quantization 방법&lt;/td&gt;
&lt;td&gt;TurboQuantmse는 회전된 좌표의 Beta/Gaussian-like 분포에 대해 Lloyd-Max 방식으로 optimal codebook을 만든다&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;11. QJL, Quantized Johnson-Lindenstrauss&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;랜덤 projection 후 sign만 저장하는 1-bit quantization. inner product를 unbiased하게 추정하는 데 사용됨&lt;/td&gt;
&lt;td&gt;TurboQuantprod는 MSE quantization의 residual에 QJL을 적용해 inner product bias를 제거함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;12. Rate-distortion theory&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;주어진 bit budget에서 이론적으로 달성 가능한 최소 distortion을 분석하는 정보이론 분야&lt;/td&gt;
&lt;td&gt;논문의 강점은 TurboQuant가 정보이론적 lower bound에 약 2.7 X이내로 가까운 near-optimal rate를 달성한다고 증명한 점임&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;13. KV cache&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Transformer decoder가 이전 token들의 Key/Value 벡터를 저장해 다음 token 생성에 재사용하는 메모리&lt;/td&gt;
&lt;td&gt;Long-context LLM에서는 KV cache가 매우 커지므로, TurboQuant를 이용해 KV cache를 낮은 bit로 압축하는 것이 주요 응용임&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;14. Product Quantization, PQ&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;vector DB/ANN search에서 많이 쓰이는 codebook 기반 벡터 압축 방법. 보통 k-means로 codebook을 학습함&lt;/td&gt;
&lt;td&gt;논문은 TurboQuant가 PQ보다 preprocessing이 거의 없고, recall도 좋다고 비교함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;15. Nearest Neighbor Search&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;query vector와 가장 비슷한 database vector를 찾는 문제. embedding retrieval, RAG, vector DB의 핵심&lt;/td&gt;
&lt;td&gt;TurboQuant는 압축된 벡터로도 top-k nearest neighbor를 잘 찾는지를 실험함&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 offline/data_dependent 방식은 데이터셋에 맞춰 codebook를 학습해야 하므로 preprocessing 비용이 크고, KVcache 처럼 토큰이 생성될 때마다 백터가 계속 생기는 online setting에는 적합하지 않음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순 Scalar quntization이나 기존 product Quantization 계열은 계산은 가능해도 MSE, inner product distortion에 대한 최적 distortion rate 보장이 약함. 특히 LLM에는 attention이 키, 벨류, 쿼리 간 inner product 구조에 크게 의존하므로 벡터를 압축해도 이 기하 구조를 잘 보존해야 함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1944&quot; data-origin-height=&quot;948&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/H40uA/dJMcadvEnlC/bKtN1lKDWh10Emm2YI7o3k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/H40uA/dJMcadvEnlC/bKtN1lKDWh10Emm2YI7o3k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/H40uA/dJMcadvEnlC/bKtN1lKDWh10Emm2YI7o3k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FH40uA%2FdJMcadvEnlC%2FbKtN1lKDWh10Emm2YI7o3k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1944&quot; height=&quot;948&quot; data-origin-width=&quot;1944&quot; data-origin-height=&quot;948&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;입력 벡터를 random rotation matrix로 회전함&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;회전된 벡터의 각 좌표는 구면 위 랜덤 벡터의 좌표처럼 행동하며, Beta distribution을 따름 =&amp;gt; 고차원에서는 이 분포가 대략 N(0, 1d)에 가까워지므로 각 좌표에 대해 Lloyd-Max 방식의 1D optimal scalar quantizer을 적용&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;De quantization에서는 저장된 codebook index를 centroid로 복원한뒤 랜덤 회전 행렬의 변환행렬을 곱해 원래 좌표로 되돌림&amp;nbsp;&lt;br /&gt;= MSE 기준에서 near-optimal&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1932&quot; data-origin-height=&quot;980&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/6cGcT/dJMcabraTyy/WiYgpnHKEKMWcItgorY5rk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/6cGcT/dJMcabraTyy/WiYgpnHKEKMWcItgorY5rk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/6cGcT/dJMcabraTyy/WiYgpnHKEKMWcItgorY5rk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F6cGcT%2FdJMcabraTyy%2FWiYgpnHKEKMWcItgorY5rk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1932&quot; height=&quot;980&quot; data-origin-width=&quot;1932&quot; data-origin-height=&quot;980&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;위의 MSE-optimal quantizer는 inner product estimation에는 bias를 만든다. =&amp;gt; 2stage 구조를 통해 해결&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1.&amp;nbsp; b-1 bit로 MSE quantization 수행&lt;br /&gt;2. 원본과 복원값 차이인 residual 을 계산&amp;nbsp;&lt;br /&gt;3. 이 residual을 1-bit QJL(Quantized Johnson-Lindenstrauss transform)으로 양자화&lt;br /&gt;4. 최종 복원은 MSE 복원값과 QJL residual 복원값을 더해서 만듬&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2122&quot; data-origin-height=&quot;1342&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bgTgqn/dJMcahdRVRF/bskXdswpzTCsKXEbU9Fbf0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bgTgqn/dJMcahdRVRF/bskXdswpzTCsKXEbU9Fbf0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bgTgqn/dJMcahdRVRF/bskXdswpzTCsKXEbU9Fbf0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbgTgqn%2FdJMcahdRVRF%2FbskXdswpzTCsKXEbU9Fbf0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2122&quot; height=&quot;1342&quot; data-origin-width=&quot;2122&quot; data-origin-height=&quot;1342&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TurboQuant로 양자화한 뒤 원래와 복원 벡터의 차이를 오차 분포로 나타낸 것으로 위쪽은 분포 중심이 거의 0에 있고, 아래는 우측으로 치우친 편향이 보인다. inner product 추정에 bias가 생긴 것이다.&lt;br /&gt;=&amp;gt; 아래는 mse에는 좋지만 inner product에는 bias를 만들 수 있음을 보여줌 == MSE를 잘 줄이는 quantizer가 inner product까지 항상 잘 보존하는 것은 아니다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2130&quot; data-origin-height=&quot;1378&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bSJvu7/dJMcaiqgTFY/BHxpaufdKRAQ1KOnYnndnK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bSJvu7/dJMcaiqgTFY/BHxpaufdKRAQ1KOnYnndnK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bSJvu7/dJMcaiqgTFY/BHxpaufdKRAQ1KOnYnndnK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbSJvu7%2FdJMcaiqgTFY%2FBHxpaufdKRAQ1KOnYnndnK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2130&quot; height=&quot;1378&quot; data-origin-width=&quot;2130&quot; data-origin-height=&quot;1378&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기선 bit-width를 2로 고정하고, 벡터 쌍의 평균 inner product가 커질 때 error 분포를 확인&lt;br /&gt;위는 분포가 0 중심으로 유지되지만, 아래는 inner product가 커질수록 에러 분포가 오른쪽으로 이동 =&amp;gt; 바이어스가 커짐&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt;TurboQuan mse의 inner product bias가 단순한 외즈가 아니라 inner product 크기와 연관된 systematic bias임을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2140&quot; data-origin-height=&quot;1096&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bsDvgL/dJMcab5LGGa/iPsHwjWW5hewGXIHon5iu0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bsDvgL/dJMcab5LGGa/iPsHwjWW5hewGXIHon5iu0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bsDvgL/dJMcab5LGGa/iPsHwjWW5hewGXIHon5iu0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbsDvgL%2FdJMcab5LGGa%2FiPsHwjWW5hewGXIHon5iu0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2140&quot; height=&quot;1096&quot; data-origin-width=&quot;2140&quot; data-origin-height=&quot;1096&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이론적 바운드와 실제 에러의 비교로 논문에서 증명한 바운드 사이에 잘 들어오는지 보여준다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1894&quot; data-origin-height=&quot;1192&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/HLkwq/dJMcabSbF7U/ZP2ZzsayiOF9UiBJx8b73k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/HLkwq/dJMcabSbF7U/ZP2ZzsayiOF9UiBJx8b73k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/HLkwq/dJMcabSbF7U/ZP2ZzsayiOF9UiBJx8b73k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FHLkwq%2FdJMcabSbF7U%2FZP2ZzsayiOF9UiBJx8b73k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1894&quot; height=&quot;1192&quot; data-origin-width=&quot;1894&quot; data-origin-height=&quot;1192&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Needle in a haystack에서 kv cache 압축 성능을 보여주는 그림으로 needle을 모델이 제대로 찾아내는지 평가한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TurboQuant는 KC cache를 4배 이상 압축해도 long-context 능력을 거의 손상시키지 않음을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1814&quot; data-origin-height=&quot;1102&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cS4XSn/dJMb99NAtB7/hQAIuUOCBLCrUFuIWa5YQk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cS4XSn/dJMb99NAtB7/hQAIuUOCBLCrUFuIWa5YQk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cS4XSn/dJMb99NAtB7/hQAIuUOCBLCrUFuIWa5YQk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcS4XSn%2FdJMb99NAtB7%2FhQAIuUOCBLCrUFuIWa5YQk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1814&quot; height=&quot;1102&quot; data-origin-width=&quot;1814&quot; data-origin-height=&quot;1102&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;위는 LongBench에서의 실제 downstream generation 성능을 보여주는 것으로, 성능 하락이 거의 없음을 보여준다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 타 방법론에 비해 양자화 시간이 0에 가까움을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2186&quot; data-origin-height=&quot;832&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/2bd82/dJMcabY2KgY/PGmnWl1I9ItWIOdck07xfk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/2bd82/dJMcabY2KgY/PGmnWl1I9ItWIOdck07xfk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/2bd82/dJMcabY2KgY/PGmnWl1I9ItWIOdck07xfk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F2bd82%2FdJMcabY2KgY%2FPGmnWl1I9ItWIOdck07xfk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2186&quot; height=&quot;832&quot; data-origin-width=&quot;2186&quot; data-origin-height=&quot;832&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TurboQuant는 KV cache뿐 아니라 vector DB나 RAG용 embedding index compression에서도 효과적임.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉, 압축 후에도 inner product 기반 검색 품질이 잘 유지됨&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;해결하려는 문제&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;LLM KV cache, vector DB, nearest neighbor search에서는 고차원 벡터를 낮은 bit로 압축해야 하지만, 기존 방법은 느리거나 distortion 보장이 약함&lt;/td&gt;
&lt;td&gt;단순 압축이 아니라 &lt;b&gt;벡터의 기하 구조&lt;/b&gt;, 특히 거리와 inner product를 보존하는 것이 핵심&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;기존 방법의 한계&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Product Quantization 계열은 codebook 학습이 필요해 offline preprocessing 비용이 큼. 일부 online quantization은 빠르지만 distortion-rate가 비최적임&lt;/td&gt;
&lt;td&gt;KV cache처럼 토큰 생성 중 실시간으로 벡터가 생기는 환경에서는 data-dependent 학습 방식이 부적합&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;입력 벡터를 random rotation하여 좌표 분포를 균질화한 뒤, 각 좌표를 optimal scalar quantizer로 독립 양자화&lt;/td&gt;
&lt;td&gt;복잡한 데이터 기반 codebook 없이도 고차원에서는 좌표별 양자화만으로 near-optimal 성능 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;MSE용 TurboQuant&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;span&gt;x&lt;/span&gt;를 random rotation &lt;span&gt;&amp;Pi;&lt;/span&gt;&lt;span&gt;x&lt;/span&gt;로 변환하면 각 좌표가 Beta distribution을 따르고, 고차원에서는 &lt;span&gt;N&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;1/&lt;/span&gt;&lt;span&gt;d&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;에 가까워짐. 이후 Lloyd-Max quantizer로 좌표별 최적 양자화 수행&lt;/td&gt;
&lt;td&gt;MSE distortion을 최소화하는 online vector quantizer 구성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Inner product용 TurboQuant&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;MSE-optimal quantizer는 inner product estimation에 bias를 만들 수 있음. 이를 해결하기 위해 (b-1) bit MSE quantization 후 residual을 1-bit QJL로 추가 양자화&lt;/td&gt;
&lt;td&gt;최종 inner product estimator가 unbiased가 됨. 즉, &lt;span&gt;&lt;span&gt;E&lt;/span&gt;&lt;span&gt;[⟨&lt;/span&gt;&lt;span&gt;y&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;x^&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;~&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;⟩]&lt;/span&gt;&lt;span&gt;=&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;⟨&lt;/span&gt;&lt;span&gt;y&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;x&lt;/span&gt;&lt;span&gt;⟩&lt;/span&gt;&lt;/span&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;이론적 보장&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;MSE distortion은 &lt;span&gt;&lt;span&gt;&amp;le; (&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;3&lt;/span&gt;&lt;span&gt;&amp;pi;)^{0.5}/2 *&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;4 ^{&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&amp;minus;&lt;/span&gt;&lt;span&gt;b}&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;, inner product distortion은 &lt;span&gt;&lt;span&gt;&amp;le; (&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;3&lt;/span&gt;&lt;span&gt;&amp;pi;)^{0.5} / 2 * &lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;∥&lt;/span&gt;&lt;span&gt;y&lt;/span&gt;&lt;span&gt;&lt;span&gt;∥^{&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;2} / d * &lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;4^{&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&amp;minus;&lt;/span&gt;&lt;span&gt;b}&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/td&gt;
&lt;td&gt;정보이론적 lower bound와 같은 4^{-b} rate를 달성하며, 최적 대비 약 &lt;b&gt;2.7배 이내&lt;/b&gt;의 작은 상수 차이&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Lower bound 기여&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Shannon lower bound와 Yao&amp;rsquo;s minimax principle을 이용해 어떤 randomized quantizer도 4^{-b}보다 좋은 distortion-rate를 일반적으로 달성할 수 없음을 보임&lt;/td&gt;
&lt;td&gt;TurboQuant의 성능이 단순 empirical improvement가 아니라 &lt;b&gt;정보이론적으로 거의 최적&lt;/b&gt;임을 증명&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;실험 1: 이론 검증&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;DBpedia Entities + OpenAI embedding에서 MSE와 inner product error가 이론적 상&amp;middot;하한과 잘 정렬됨&lt;/td&gt;
&lt;td&gt;논문의 수학적 distortion 분석이 실제 embedding 데이터에서도 유효함을 확인&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;실험 2: KV cache 압축&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Needle-In-A-Haystack에서 Llama-3.1-8B-Instruct 기준 TurboQuant는 4&amp;times; 이상 압축해도 full precision과 동일한 score &lt;b&gt;0.997&lt;/b&gt; 달성&lt;/td&gt;
&lt;td&gt;long-context retrieval에서 KV cache를 크게 줄여도 핵심 정보 검색 능력이 유지됨&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;실험 3: LongBench&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Llama-3.1-8B-Instruct에서 full cache 평균 &lt;b&gt;50.06&lt;/b&gt;, TurboQuant 3.5-bit도 &lt;b&gt;50.06&lt;/b&gt;. 2.5-bit는 &lt;b&gt;49.44&lt;/b&gt;로 소폭 하락&lt;/td&gt;
&lt;td&gt;3.5-bit 수준에서는 사실상 quality-neutral KV cache quantization 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;실험 4: Nearest Neighbor Search&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;GloVe, OpenAI embedding 데이터에서 PQ/RabitQ보다 높은 recall을 보이며, quantization time은 거의 0에 가까움&lt;/td&gt;
&lt;td&gt;vector DB indexing에서 학습 기반 PQ보다 빠르고 실용적인 대안 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;가장 중요한 차별점&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;online&lt;/b&gt;, &lt;b&gt;data-oblivious&lt;/b&gt;, &lt;b&gt;accelerator-friendly&lt;/b&gt;, &lt;b&gt;near-optimal distortion-rate&lt;/b&gt;, &lt;b&gt;unbiased inner product estimation&lt;/b&gt;을 동시에 만족&lt;/td&gt;
&lt;td&gt;LLM serving과 vector search 양쪽에 적용 가능한 범용 고차원 벡터 양자화 프레임워크&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계 및 주의점&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;random rotation/QJL projection의 실제 시스템 latency, norm 저장 overhead, 더 다양한 모델&amp;middot;attention 구조에서의 검증은 추가 필요&lt;/td&gt;
&lt;td&gt;이론과 실험은 강하지만, production-level deployment에서는 하드웨어 최적화와 대규모 serving 검증이 중요&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;최종 요약&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;TurboQuant는 random rotation으로 벡터 분포를 균질화하고, scalar quantization과 residual QJL을 결합해 MSE와 inner product를 거의 최적으로 보존하는 온라인 양자화 방법&lt;/td&gt;
&lt;td&gt;이 논문의 핵심 가치는 &lt;b&gt;이론적 최적성에 가까운 distortion 보장과 LLM KV cache/vector search에서의 실용성 결합&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;논문 제목&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;고차원 벡터를 빠르게 압축하면서도 MSE와 inner product 구조를 거의 최적으로 보존하는 온라인 양자화 방법 제안&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1224</guid>
      <comments>https://yoonschallenge.tistory.com/1224#entry1224comment</comments>
      <pubDate>Thu, 25 Jun 2026 20:00:49 +0900</pubDate>
    </item>
    <item>
      <title>Revising and Falsifying Sparse Autoencoder FeatureExplanations</title>
      <link>https://yoonschallenge.tistory.com/1223</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://neurips.cc/virtual/2025/loc/san-diego/poster/118303&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://neurips.cc/virtual/2025/loc/san-diego/poster/118303&lt;/a&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;립스에 붙은 논문입니다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 SAE에서 feature 해석하는 방법은 다음과 같다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1. 특정 sae feature가 강하게 활성화 되는 문장을 모음&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2. LLM에게 이 feature가 무엇을 보고 활성화되는지 설명하라고 함&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;3. 설명된 생성을 다시 simulator llm으로 평가 함&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러나 이런 방법의 문제는 과도한 일반화를 진행하거나, 너무 넓은 범위를 말하기도 한다. top-activating examples만 보면 그럴 듯 하지만, 비슷한 문맥의 반례를 넣으면 쉽게 깨진다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 기존 sae feature explanation은 맞는 예시를 잘 포함하지만, 틀린 예시를 배제하는 precision이 약하다고 말한다.&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Similarity-based close negatives&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;top-activating sentences와 의미적으로 비슷하지만 실제 activation은 없는 문장을 negative로 사용&lt;/td&gt;
&lt;td&gt;overly broad explanation을 더 잘 falsify&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Structured explanation&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;하나의 짧은 문장이 아니라, 여러 개의 {activates_on, strength} rule로 설명&lt;/td&gt;
&lt;td&gt;feature의 polysemanticity를 명시적으로 표현&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Tree-based explainer&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;설명 생성 &amp;rarr; 평가 &amp;rarr; 피드백 &amp;rarr; 수정 과정을 tree search처럼 반복&lt;/td&gt;
&lt;td&gt;one-shot explanation보다 더 정교한 설명 생성&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1229&quot; data-origin-height=&quot;753&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/OUBr5/dJMcac4DkJd/Pkc8d9tVGnuLffIEpZdq5k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/OUBr5/dJMcac4DkJd/Pkc8d9tVGnuLffIEpZdq5k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/OUBr5/dJMcac4DkJd/Pkc8d9tVGnuLffIEpZdq5k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FOUBr5%2FdJMcac4DkJd%2FPkc8d9tVGnuLffIEpZdq5k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1229&quot; height=&quot;753&quot; data-origin-width=&quot;1229&quot; data-origin-height=&quot;753&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;위 방식을 통해 feature가 나타내는 실제 설명을 추려낸다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;821&quot; data-origin-height=&quot;758&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/7VxK9/dJMcagzczWf/ALaSJ1vFIKUGokv9NJKKQK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/7VxK9/dJMcagzczWf/ALaSJ1vFIKUGokv9NJKKQK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/7VxK9/dJMcagzczWf/ALaSJ1vFIKUGokv9NJKKQK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F7VxK9%2FdJMcagzczWf%2FALaSJ1vFIKUGokv9NJKKQK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;821&quot; height=&quot;758&quot; data-origin-width=&quot;821&quot; data-origin-height=&quot;758&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1306&quot; data-origin-height=&quot;621&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/QP3gy/dJMcahrpeoV/PU9PtNho4peRjNVG73hWs1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/QP3gy/dJMcahrpeoV/PU9PtNho4peRjNVG73hWs1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/QP3gy/dJMcahrpeoV/PU9PtNho4peRjNVG73hWs1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FQP3gy%2FdJMcahrpeoV%2FPU9PtNho4peRjNVG73hWs1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1306&quot; height=&quot;621&quot; data-origin-width=&quot;1306&quot; data-origin-height=&quot;621&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 figure는 기존 sae가 얼마나 틀린 설명을 포함하는지, Similar negatives가 왜 필요한지를 말해줍니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;유사한 네거티브를 사용하면 의미적으론 비슷해도, 실제 feature이 활성화 되지 않기 때문에 설명이 조금만 넓어도 false positive가 많이 발생하게 됨&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;997&quot; data-origin-height=&quot;489&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/D3bHt/dJMcahrpepJ/IiuX0Kna2Kp98xYIJ5alKk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/D3bHt/dJMcahrpepJ/IiuX0Kna2Kp98xYIJ5alKk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/D3bHt/dJMcahrpepJ/IiuX0Kna2Kp98xYIJ5alKk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FD3bHt%2FdJMcahrpepJ%2FIiuX0Kna2Kp98xYIJ5alKk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;997&quot; height=&quot;489&quot; data-origin-width=&quot;997&quot; data-origin-height=&quot;489&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;tree-based explainer가 one-shot보다 더 좋은 설명을 만드는 것을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; feature가 여러 의미를 가질 때 하나 문장으로 뭉뚱그리는 것 보다 여러 룰로 나누는 것이 좋을 것.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;tree base 에선 structured 설명의 추가 이득이 적음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1149&quot; data-origin-height=&quot;575&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/YuGxa/dJMcahrpeqI/eZ4gDfYVLW6bG0NBvp74x1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/YuGxa/dJMcahrpeqI/eZ4gDfYVLW6bG0NBvp74x1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/YuGxa/dJMcahrpeqI/eZ4gDfYVLW6bG0NBvp74x1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FYuGxa%2FdJMcahrpeqI%2FeZ4gDfYVLW6bG0NBvp74x1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1149&quot; height=&quot;575&quot; data-origin-width=&quot;1149&quot; data-origin-height=&quot;575&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;큰 모델에서는 중간 레이어가 더 추상적인 feature을 만힝 담음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 508px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;연구 문제&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;기존 SAE feature 자동 설명은 top-activating examples를 요약하는 데 치우쳐, 설명이 &lt;b&gt;너무 broad&lt;/b&gt;하고 &lt;b&gt;polysemanticity&lt;/b&gt;를 제대로 반영하지 못함. 즉, feature가 실제로는 특정 조건에서만 활성화되는데 설명은 더 넓은 개념으로 일반화되는 문제가 있음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;좋은 SAE explanation은 단순히 positive examples를 잘 설명하는 것이 아니라, &lt;b&gt;비슷하지만 실제로는 activation되지 않는 close negative examples에서 틀리지 않아야 한다&lt;/b&gt;는 관점으로 전환함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 56px;&quot;&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;&lt;b&gt;Similarity-based negatives&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;top-activating sentences와 embedding similarity가 높은 문장 중 실제 SAE activation이 없는 문장을 negative로 사용. &lt;br /&gt;이를 통해 overly broad explanation을 더 강하게 falsify함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 56px;&quot;&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;&lt;b&gt;Structured explanation&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;feature 설명을 하나의 문장으로 만들지 않고, activates_on과 strength를 가진 여러 rule의 리스트로 표현함. &lt;br /&gt;이를 통해 하나의 SAE feature 안에 섞인 여러 monosemantic component를 분리해 설명함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 56px;&quot;&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;&lt;b&gt;Tree-based explainer&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;LLM이 explanation을 생성한 뒤 simulator로 평가하고, 가장 틀린 예시를 feedback으로 주어 explanation을 반복적으로 수정함. &lt;br /&gt;즉, explanation generation을 tree search 기반 textual optimization 문제로 다룸.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;실험 설정&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Pile uncopyrighted subset 100,000 sentences를 32-token chunk로 구성. &lt;br /&gt;subject model은 Gemma-2-9B, Llama-3.1-8B, GPT-2 Small. 각 layer의 SAE feature를 대상으로 설명 생성 및 simulation 평가 수행.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;주요 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;similarity-based negatives는 random negatives보다 false positive를 더 많이 드러내며, 기존 explanation 평가가 recall-biased였음을 보여줌. &lt;br /&gt;Tree-based explainer는 one-shot explainer보다 일관되게 높은 성능을 보임. &lt;br /&gt;Structured explanation은 one-shot 설정에서는 성능 향상에 도움이 되지만, tree-based에서는 추가 이득이 작음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;추가 분석&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Gemma-2와 Llama-3.1에서는 중간 layer에서 feature complexity가 높아지고, 깊은 layer로 갈수록 polysemanticity가 증가하는 경향이 관찰됨. &lt;br /&gt;GPT-2 Small은 상대적으로 낮고 안정적인 complexity/polysemanticity를 보임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;tree-based explainer는 feature 하나당 약 1.5분이 걸려 대규모 분석에는 비싸며, top-activating records에 의존하기 때문에 낮은 activation 영역의 polysemanticity를 놓칠 수 있음. &lt;br /&gt;또한 SAE feature explanation이 좋아져도 실제 model mechanism이나 reasoning을 완전히 설명한다고 보기는 어려움.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;한 줄 평가&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;이 논문의 핵심 공헌은 SAE feature 설명을 &lt;b&gt;&amp;ldquo;그럴듯하게 생성&amp;rdquo;하는 문제에서 &amp;ldquo;반증 가능하게 평가하고 수정&amp;rdquo;하는 문제로 전환&lt;/b&gt;했다는 점임.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1223</guid>
      <comments>https://yoonschallenge.tistory.com/1223#entry1223comment</comments>
      <pubDate>Wed, 24 Jun 2026 18:41:03 +0900</pubDate>
    </item>
    <item>
      <title>Do Sparse Autoencoders Identify Reasoning Features in Language Models?</title>
      <link>https://yoonschallenge.tistory.com/1222</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2601.05679&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2601.05679&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1779609513607&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Do Sparse Autoencoders Identify Reasoning Features in Language Models?&quot; data-og-description=&quot;We study how reliably sparse autoencoders (SAEs) support claims about reasoning-related internal features in large language models. We first give a stylized analysis showing that sparsity-regularized decoding can preferentially retain stable low-dimensiona&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2601.05679&quot; data-og-url=&quot;https://arxiv.org/abs/2601.05679v7&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/cmn0Hp/dJMb8ZvHCtl/k6ngE8vvuFKsTpXR9ikvy1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cuMDIn/dJMb8T95MRP/LlIfJHetXiOr0ESpDaDc31/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2601.05679&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2601.05679&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/cmn0Hp/dJMb8ZvHCtl/k6ngE8vvuFKsTpXR9ikvy1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cuMDIn/dJMb8T95MRP/LlIfJHetXiOr0ESpDaDc31/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Do Sparse Autoencoders Identify Reasoning Features in Language Models?&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We study how reliably sparse autoencoders (SAEs) support claims about reasoning-related internal features in large language models. We first give a stylized analysis showing that sparsity-regularized decoding can preferentially retain stable low-dimensiona&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;SAE가 찾아낸 reasoning feature가 실제 추론 계산을 나타내는지 검증했고, 많은 경우 추론 자체가 아니라 CoT 문체, 특정 토큰, 절차적 표현 드오가 같이 낮은 차원의 언어적 단서를 포착한다고 주장&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 논문에서 reasoning feature를 찾기 위해 CoT reasoning text와 non-reasoning text를 준비하고, SAE feature activation을 비교한 뒤 reasoning text에서 더 강하게 켜지는 feature를 reasoning feature로 해석하였음&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;그러나 논문에선 이 접근 법은 실제 추론 뿐만이 아니라 &quot;First, Let's, Therefore, Wait&quot;와 같은 표현을 자주 포함하여 추론 과정을 포착한 것인지, 언어 패턴을 포착한 것인지 구분하기 어려움&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1361&quot; data-origin-height=&quot;816&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bhMWrV/dJMcafNxllm/aykh9HCJk44nbKktuSsNP1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bhMWrV/dJMcafNxllm/aykh9HCJk44nbKktuSsNP1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bhMWrV/dJMcafNxllm/aykh9HCJk44nbKktuSsNP1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbhMWrV%2FdJMcafNxllm%2Faykh9HCJk44nbKktuSsNP1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1361&quot; height=&quot;816&quot; data-origin-width=&quot;1361&quot; data-origin-height=&quot;816&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;SAE는 sparsity objective 이기 때문에 고차원적이고 다양한 reasoning variation보다 반복적으로 나타나는 저차원적 Wait, Let 같은 lexical cue를 더 쉽게 feature를 분리할 수 있음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 아래 3조건을 만족해야 진짜 reasoning feature를 정의할 수 있음&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 60px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;Reasoning specificity&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;reasoning text에서 안정적으로 활성화되고 non-reasoning text에서는 낮게 활성화되어야 함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;Non-spurious correlation&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;단순히 &amp;ldquo;therefore&amp;rdquo;, &amp;ldquo;let us consider&amp;rdquo;, &amp;ldquo;I need to&amp;rdquo; 같은 표면적 cue만으로 활성화되면 안 됨&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;Semantic invariance&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;같은 reasoning을 paraphrase하거나 문체를 바꿔도 activation이 유지되어야 함&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이를 검증하기 위해 아래와 같은 파이프라인을 활용함&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&amp;nbsp;&lt;/td&gt;
&lt;td&gt;목적&lt;/td&gt;
&lt;td&gt;방법&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;1. Contrastive feature selection&lt;/td&gt;
&lt;td&gt;후보 reasoning feature 찾기&lt;/td&gt;
&lt;td&gt;reasoning corpus와 non-reasoning corpus의 SAE activation 차이를 Cohen&amp;rsquo;s d로 측정&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;2. Causal token injection&lt;/td&gt;
&lt;td&gt;token cue만으로 feature가 켜지는지 확인&lt;/td&gt;
&lt;td&gt;non-reasoning text에 top-activating token, bigram, trigram 삽입&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;3. LLM-guided falsification&lt;/td&gt;
&lt;td&gt;더 복잡한 confound 제거&lt;/td&gt;
&lt;td&gt;LLM이 false positive와 false negative counterexample 생성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;4. Steering sanity check&lt;/td&gt;
&lt;td&gt;feature 증폭이 실제 reasoning 성능을 바꾸는지 확인&lt;/td&gt;
&lt;td&gt;feature decoder direction으로 residual stream steering&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1104&quot; data-origin-height=&quot;600&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/H7pC2/dJMcaciSsMo/IENpEi3dFcFxX5PbIJZBo0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/H7pC2/dJMcaciSsMo/IENpEi3dFcFxX5PbIJZBo0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/H7pC2/dJMcaciSsMo/IENpEi3dFcFxX5PbIJZBo0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FH7pC2%2FdJMcaciSsMo%2FIENpEi3dFcFxX5PbIJZBo0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1104&quot; height=&quot;600&quot; data-origin-width=&quot;1104&quot; data-origin-height=&quot;600&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;초반부 레이어는 lexical processing에 치우치고, 후반 레이어는 output token prediction에 치우치기 때문에 중간 레이어를 선택함 .&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1109&quot; data-origin-height=&quot;522&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/vilgs/dJMcad29j0Z/hgpuaQxU9KVS0kQ5nd8GFk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/vilgs/dJMcad29j0Z/hgpuaQxU9KVS0kQ5nd8GFk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/vilgs/dJMcad29j0Z/hgpuaQxU9KVS0kQ5nd8GFk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fvilgs%2FdJMcad29j0Z%2FhgpuaQxU9KVS0kQ5nd8GFk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1109&quot; height=&quot;522&quot; data-origin-width=&quot;1109&quot; data-origin-height=&quot;522&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1117&quot; data-origin-height=&quot;747&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/OHaKD/dJMcajoJbhF/nNaftxGB7FUtKndLISr11K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/OHaKD/dJMcajoJbhF/nNaftxGB7FUtKndLISr11K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/OHaKD/dJMcajoJbhF/nNaftxGB7FUtKndLISr11K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FOHaKD%2FdJMcajoJbhF%2FnNaftxGB7FUtKndLISr11K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1117&quot; height=&quot;747&quot; data-origin-width=&quot;1117&quot; data-origin-height=&quot;747&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 방법으로 나누면 SAE feature들은 reasoning text와 non-reasoning text를 구분하는 것 처럼 보이지만 이것만으로는 feature가 reasoning을 포착한다고 말할 수 없음 = cot문체 때문인지, reasoning 때문인지 알 수 없음&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1365&quot; data-origin-height=&quot;807&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bUwQDV/dJMcajoJbhU/s2XREwrVtcyH4RFfWQ4KVk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bUwQDV/dJMcajoJbhU/s2XREwrVtcyH4RFfWQ4KVk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bUwQDV/dJMcajoJbhU/s2XREwrVtcyH4RFfWQ4KVk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbUwQDV%2FdJMcajoJbhU%2Fs2XREwrVtcyH4RFfWQ4KVk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1365&quot; height=&quot;807&quot; data-origin-width=&quot;1365&quot; data-origin-height=&quot;807&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰 삽입만으로 많은 후보 feature들이 활성화 되는 것을 통해 실제 reaosning을 따라가는 것은 아니다!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1174&quot; data-origin-height=&quot;634&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c2X0cj/dJMcaii8mRF/NeEfpkMhNKyqBz319OZ2PK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c2X0cj/dJMcaii8mRF/NeEfpkMhNKyqBz319OZ2PK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c2X0cj/dJMcaii8mRF/NeEfpkMhNKyqBz319OZ2PK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc2X0cj%2FdJMcaii8mRF%2FNeEfpkMhNKyqBz319OZ2PK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1174&quot; height=&quot;634&quot; data-origin-width=&quot;1174&quot; data-origin-height=&quot;634&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰 삽입으로도 설명되지 않은 feature들은 llm에게 feature가 어떤 패턴을 감지하도록 가설을 생성하게 함 =&amp;gt; 그 가설을 바탕으로 false positibe를 만듦 =&amp;gt; reasoning 여부와 분리되는지 확인&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 살아남음 feature는 0개로 대부분은 cot-style feature로 보여줬고, steering도 reasoning 성능 향상을 보여주지 못 했음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결국 이 논문은 SAE 기반 reasoning interpretabilibty가 잘못되었음을 보여줬고, 좀 더 엄격하게 진행해야 함을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;흠 근데 reasoning model은 안 쓰고, instruction, distill model만 쓰면서 reasoning feature를 찾는 것이 맞을지, 모델 자체 출력도 아니고 data set을 그대로 forward하는데 이게 맞을지가 의문이긴 하네요&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 990px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;핵심 질문&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;SAE가 contrastive activation 방식으로 찾아낸 &amp;ldquo;reasoning feature&amp;rdquo;가 실제로 LLM 내부의 &lt;b&gt;추론 계산 과정&lt;/b&gt;을 나타내는가?&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;문제의식&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;기존 연구들은 CoT reasoning text에서 더 강하게 활성화되는 SAE feature를 reasoning feature로 해석했지만, CoT text는 실제 추론뿐 아니라 &amp;ldquo;First&amp;rdquo;, &amp;ldquo;I need to&amp;rdquo;, &amp;ldquo;Let&amp;rsquo;s&amp;rdquo;, &amp;ldquo;Therefore&amp;rdquo;, &amp;ldquo;Wait&amp;rdquo; 같은 &lt;b&gt;표면적 언어 단서&lt;/b&gt;도 많이 포함함. &lt;br /&gt;따라서 activation 차이만으로는 reasoning feature인지 lexical/style feature인지 구분하기 어려움.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;핵심 주장&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;SAE의 sparsity objective는 복잡하고 다양한 고차원 reasoning variation보다, 반복적으로 등장하는 저차원 lexical cue를 더 쉽게 포착한다. &lt;br /&gt;따라서 contrastive selection으로 뽑힌 feature는 reasoning 자체가 아니라 reasoning과 함께 나타나는 &lt;b&gt;언어적 상관물&lt;/b&gt;일 가능성이 높음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;이론적 근거&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;논문은 reasoning activation을 ① 안정적인 저차원 cue 방향과 ② 고차원 reasoning variation으로 나누어 분석함. &lt;br /&gt;ℓ1 sparse decoding 또는 Top-K sparsity는 많은 좌표에 퍼진 고차원 성분을 억제하고, 하나의 안정적 cue coordinate는 상대적으로 보존하기 쉬움을 보임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 58px;&quot;&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;&amp;ldquo;진짜 reasoning feature&amp;rdquo;의 조건&lt;/td&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;① reasoning text에서 안정적으로 활성화되어야 함, &lt;br /&gt;② non-reasoning text에 reasoning cue만 넣었을 때 활성화되면 안 됨, &lt;br /&gt;③ 같은 reasoning을 paraphrase하거나 문체를 바꿔도 activation이 유지되어야 함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 58px;&quot;&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;방법론 전체 흐름&lt;/td&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;&lt;b&gt;Contrastive feature selection &amp;rarr; Causal token injection &amp;rarr; LLM-guided falsification &amp;rarr; Steering sanity check&lt;/b&gt; 순서로 검증함. &lt;br /&gt;즉, 먼저 기존 방식대로 후보 feature를 찾고, 이후 token cue와 counterexample로 해당 feature 해석을 반증하는 방식.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 54px;&quot;&gt;
&lt;td style=&quot;height: 54px;&quot;&gt;Contrastive feature selection&lt;/td&gt;
&lt;td style=&quot;height: 54px;&quot;&gt;reasoning corpus와 non-reasoning corpus에서 각 SAE feature의 activation 차이를 Cohen&amp;rsquo;s d, ROC-AUC, activation frequency ratio 등으로 측정하고, 각 configuration에서 top 100 feature를 후보 reasoning feature로 선택함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Causal token injection&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;각 후보 feature를 가장 강하게 활성화하는 token, bigram, trigram을 찾은 뒤, non-reasoning text에 삽입함. &lt;br /&gt;만약 이 조작만으로 feature activation이 증가하면 해당 feature는 reasoning이 아니라 token cue에 민감한 것으로 판단함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;LLM-guided falsification&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;token injection으로 설명되지 않는 context-dependent feature에 대해 LLM이 feature hypothesis를 만들고, &lt;br /&gt;① reasoning은 없지만 activation을 유발하는 false positive, &lt;br /&gt;② reasoning 의미는 유지하지만 activation이 사라지는 false negative paraphrase를 생성함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;실험 모델&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Gemma-3-12B-Instruct, Gemma-3-4B-Instruct, DeepSeek-R1-Distill-Llama-8B를 중심으로 분석하고, appendix에서 Llama-3.1-8B, Gemma-2-9B, Gemma-2-2B도 추가 검증함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;데이터셋&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;reasoning corpus로 &lt;b&gt;s1K-1.1&lt;/b&gt;과 &lt;b&gt;General Inquiry Thinking Chain-of-Thought&lt;/b&gt;를 사용하고, non-reasoning corpus로 &lt;b&gt;Pile uncopyrighted subset&lt;/b&gt;을 사용함. &lt;br /&gt;각 corpus에서 1,000개 샘플을 사용하며 입력은 64 tokens로 chunking함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;주요 결과 1&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Contrastive selection만 보면 top feature들은 reasoning text와 non-reasoning text를 잘 구분함. &lt;br /&gt;평균 Cohen&amp;rsquo;s d는 대체로 0.675~1.043 수준으로, 통계적으로는 reasoning-associated feature처럼 보임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;주요 결과 2&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;그러나 token injection 결과, 후보 feature의 &lt;b&gt;45%~90%&lt;/b&gt;가 non-reasoning text에 몇 개의 관련 token만 삽입해도 유의미하게 활성화됨. &lt;br /&gt;이는 많은 후보 feature가 실제 reasoning보다 lexical cue에 민감함을 보여줌.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;주요 결과 3&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;Token injection으로 설명되지 않은 context-dependent feature 248개를 LLM-guided falsification으로 분석했지만, &lt;b&gt;genuine reasoning feature로 분류된 feature는 0개&lt;/b&gt;였음. &lt;br /&gt;대부분은 first-person planning, procedural discourse, formal explanatory style, decomposition vocabulary 등의 confound로 해석됨.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;주요 결과 4&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;Steering 실험에서도 top feature를 증폭했을 때 AIME와 GPQA 성능이 개선되지 않았고, 일부는 오히려 하락함. &lt;br /&gt;논문은 feature steering이 특정 표현을 더 자주 생성하게 할 수는 있어도, 그것이 reasoning mechanism을 조작했다는 증거는 아니라고 해석함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;논문의 결론&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;현재 분석한 설정에서는 SAE가 contrastive activation으로 찾은 reasoning-associated feature 대부분이 실제 reasoning computation보다는 &lt;b&gt;CoT 스타일의 언어적 단서&lt;/b&gt;를 포착한 것으로 보임. &lt;br /&gt;따라서 SAE feature를 고수준 reasoning mechanism으로 해석하려면 contrastive correlation만으로는 부족하고, causal intervention과 falsification 검증이 필수적임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;의의&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;SAE 기반 mechanistic interpretability 연구에서 &amp;ldquo;activation이 높다 = 의미 있는 내부 개념이다&amp;rdquo;라는 해석을 경계하게 만듦. &lt;br /&gt;특히 reasoning, refusal, hallucination, instruction following 같은 고수준 행동을 해석할 때 feature가 실제 mechanism인지 표면적 correlate인지 구분해야 함을 강조함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;한계&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;이 결과는 개별 SAE feature의 monosemantic reasoning interpretation에 대한 검증이며, reasoning이 여러 feature에 분산되어 있거나 nonlinear subspace에 표현될 가능성은 배제하지 않음. &lt;br /&gt;또한 LLM-guided falsification의 품질은 생성 LLM의 능력에 영향을 받을 수 있음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;연구적 takeaway&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;향후 reasoning interpretability는 단일 feature activation 분석을 넘어서, &lt;b&gt;paraphrase-invariant feature, cue-matched counterexample, causal intervention, distributed subspace/circuit 분석&lt;/b&gt;을 함께 수행해야 함. &lt;br /&gt;이 논문은 SAE를 부정하기보다 SAE 해석의 검증 기준을 강화한 연구로 보는 것이 타당함.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1222</guid>
      <comments>https://yoonschallenge.tistory.com/1222#entry1222comment</comments>
      <pubDate>Sun, 24 May 2026 18:28:35 +0900</pubDate>
    </item>
    <item>
      <title>Retrieval from Within: An Intrinsic Capability of Attention-Based Models</title>
      <link>https://yoonschallenge.tistory.com/1221</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2605.05806&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2605.05806&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1779282468372&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Retrieval from Within: An Intrinsic Capability of Attention-Based Models&quot; data-og-description=&quot;Retrieval-augmented generation (RAG) typically treats retrieval and generation as separate systems. We ask whether an attention-based encoder-decoder can instead retrieve directly from its own internal representations. We introduce INTRA (INTrinsic Retriev&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2605.05806&quot; data-og-url=&quot;https://arxiv.org/abs/2605.05806v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/0e2nT/dJMb87N2mcF/6shmLoZJuxyhGKjNnuAVh1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/b3YNvt/dJMb9eTVhfY/VQFzd2jpmyyzvXSxAuQ2A1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2605.05806&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2605.05806&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/0e2nT/dJMb87N2mcF/6shmLoZJuxyhGKjNnuAVh1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/b3YNvt/dJMb9eTVhfY/VQFzd2jpmyyzvXSxAuQ2A1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Retrieval from Within: An Intrinsic Capability of Attention-Based Models&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Retrieval-augmented generation (RAG) typically treats retrieval and generation as separate systems. We ask whether an attention-based encoder-decoder can instead retrieve directly from its own internal representations. We introduce INTRA (INTrinsic Retriev&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 RAG에서는 Retriever 모델을 따로 쓰면서 텍스트를 가져오지만 여기선 en-decoder model의 cross attention 자체를 검색 메커니즘으로 사용하여 검색과 생성을 하나의 latent representation space 안에서 통합할 수 있는 것을 보였습니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 rag에서 검색기는 쿼리와 문서의 유사도 기준으로 청크를 찾지만, 실제 답변 생성에 필요한 증거와 완전히 일치하지 않을 수 있고, 텍스트를 그대로 다시 generator에 넣어야 하므로 리소스 소모가 또 필요하다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1167&quot; data-origin-height=&quot;609&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cmRzRP/dJMcahqY9CP/kTUUDhc7Btth4D32BjeV5K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cmRzRP/dJMcahqY9CP/kTUUDhc7Btth4D32BjeV5K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cmRzRP/dJMcahqY9CP/kTUUDhc7Btth4D32BjeV5K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcmRzRP%2FdJMcahqY9CP%2FkTUUDhc7Btth4D32BjeV5K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1167&quot; height=&quot;609&quot; data-origin-width=&quot;1167&quot; data-origin-height=&quot;609&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;문서 청크를 encoder로 미리 encoding해 두고, decoder의 cross attention query가 encoding 청크를 검색하여 그래도 context로 활용한다.&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&amp;nbsp;&lt;/td&gt;
&lt;td&gt;Standard&amp;nbsp;RAG&lt;/td&gt;
&lt;td&gt;INTRA&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Retriever&lt;/td&gt;
&lt;td&gt;외부 retriever 사용&lt;/td&gt;
&lt;td&gt;decoder cross-attention query 사용&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Retrieval space&lt;/td&gt;
&lt;td&gt;retriever embedding space&lt;/td&gt;
&lt;td&gt;encoder-decoder shared representation space&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Generation input&lt;/td&gt;
&lt;td&gt;retrieved raw text&lt;/td&gt;
&lt;td&gt;retrieved pre-encoded encoder states&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Re-encoding&lt;/td&gt;
&lt;td&gt;필요&lt;/td&gt;
&lt;td&gt;불필요&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;장점&lt;/td&gt;
&lt;td&gt;범용성 높음&lt;/td&gt;
&lt;td&gt;retriever-generator mismatch 감소, pre-encoded context 재사용&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;stage 1&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;각 청크를 encoder에 넣은 뒤 representation으로 변환하여 저장해둠.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;stage 2&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;query와 청크의 key value사이의 dot product matching을 통해 retrueval score를 구함. 이를 위해 입력 질문 뒤에 learnable retrieval token을 추가하여 어떤 evidence가 필요한가를 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;stage 3&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;MaxSim late interaction을 통해 token level attention score를 chunk level retrieval score로 바꿈&amp;nbsp;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;stage 4&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;MaxSim을 통해 초기 후보를 선택한 후 리랭킹, 다시 점수 메기기 등을 통해 점수가 가장 높은 5개를 선택&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;stage 5&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;선택된 청크를 통해 생성을 진행&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실험 설정&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Backbone&lt;/td&gt;
&lt;td&gt;T5Gemma2 4B-4B encoder-decoder&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Benchmarks&lt;/td&gt;
&lt;td&gt;HotPotQA, 2WikiMultihopQA, MuSiQue, Natural Questions&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Corpus pool&lt;/td&gt;
&lt;td&gt;약 100M tokens, 758.5K chunks&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Retrieval metric&lt;/td&gt;
&lt;td&gt;Complete-evidence recall@5/10/20&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;QA metric&lt;/td&gt;
&lt;td&gt;EM, token-level F1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Baselines&lt;/td&gt;
&lt;td&gt;TF-IDF, BM25, MaxSim, Hybrid RAG, BGE-large, &lt;br /&gt;Qwen3-Embedding-0.6B/4B, Qwen3-Embedding-4B + Jina reranker&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Generation&lt;/td&gt;
&lt;td&gt;fixed T5Gemma2 generator 사용&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1311&quot; data-origin-height=&quot;822&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/divScZ/dJMcahqY9CZ/AWyvMkN7sR8CkGqKjbe7ek/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/divScZ/dJMcahqY9CZ/AWyvMkN7sR8CkGqKjbe7ek/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/divScZ/dJMcahqY9CZ/AWyvMkN7sR8CkGqKjbe7ek/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdivScZ%2FdJMcahqY9CZ%2FAWyvMkN7sR8CkGqKjbe7ek%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1311&quot; height=&quot;822&quot; data-origin-width=&quot;1311&quot; data-origin-height=&quot;822&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;NQ에서 유독 약한 모습을 보이지만 다른 곳에서는 가장 높은 성능을 보여준다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;멀티턴 다른 벤치마크와 싱글턴인 NQ 사이에서 여러 evidence를 조합해야 하는 멀티홉 세팅에서 장점이 보인다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1036&quot; data-origin-height=&quot;784&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bDK60l/dJMcahRZXBJ/GW8LCbd4OGtLqyU0K16Svk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bDK60l/dJMcahRZXBJ/GW8LCbd4OGtLqyU0K16Svk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bDK60l/dJMcahRZXBJ/GW8LCbd4OGtLqyU0K16Svk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbDK60l%2FdJMcahRZXBJ%2FGW8LCbd4OGtLqyU0K16Svk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1036&quot; height=&quot;784&quot; data-origin-width=&quot;1036&quot; data-origin-height=&quot;784&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;end to end QA 세팅에서도 싱글 홉인 NQ를 제외하곤 다른 벤치마크에선 높은 성능을 보였다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;검색 성능이 크게 작용했을것이라고 저자는 말한다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1049&quot; data-origin-height=&quot;716&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/mS1kk/dJMcadaXftO/BWVIa34ZT6srkkcYUWks40/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/mS1kk/dJMcadaXftO/BWVIa34ZT6srkkcYUWks40/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/mS1kk/dJMcadaXftO/BWVIa34ZT6srkkcYUWks40/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FmS1kk%2FdJMcadaXftO%2FBWVIa34ZT6srkkcYUWks40%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1049&quot; height=&quot;716&quot; data-origin-width=&quot;1049&quot; data-origin-height=&quot;716&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여러 검색기와 생성기를 조합해 격차를 측정했으나 같은 모델일 수록 격차가 가장 컸다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 INTRA의 장점은 검색된 텍스트를 다시 인코딩하지 않는 것에서 나온다고 말한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1035&quot; data-origin-height=&quot;383&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/GhKtm/dJMcagFCQDn/j1sa5LrI5vquyssvDxqLkk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/GhKtm/dJMcagFCQDn/j1sa5LrI5vquyssvDxqLkk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/GhKtm/dJMcagFCQDn/j1sa5LrI5vquyssvDxqLkk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FGhKtm%2FdJMcagFCQDn%2Fj1sa5LrI5vquyssvDxqLkk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1035&quot; height=&quot;383&quot; data-origin-width=&quot;1035&quot; data-origin-height=&quot;383&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TTFT 테스트에서 INTRA가 가장 빠른 모습을 보여준다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;검색 시간을 제외한게 좀 클 것 같긴 한데....&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 임베딩을 다 저장해야 하는 것에서 저장 용량도 지속적으로 커진다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;논문 핵심 주장&lt;/td&gt;
&lt;td&gt;기존 RAG처럼 &lt;b&gt;retriever와 generator를 분리하지 않아도&lt;/b&gt;, encoder-decoder 모델의 &lt;b&gt;cross-attention 자체가 retrieval mechanism으로 작동할 수 있다&lt;/b&gt;는 것을 보인다. &lt;br /&gt;즉, attention-based model 내부에는 이미 intrinsic retrieval capability가 존재한다는 주장이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;해결하려는 문제&lt;/td&gt;
&lt;td&gt;기존 RAG는 외부 retriever가 문서를 검색하고, generator가 검색된 raw text를 다시 처리한다. &lt;br /&gt;이 과정에서 &lt;b&gt;retriever-generator representation mismatch&lt;/b&gt;가 발생하고, 검색된 evidence를 generation 시점에 다시 encoding/prefilling해야 하므로 비용이 증가한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;제안 방법&lt;/td&gt;
&lt;td&gt;&lt;b&gt;INTRA: INTrinsic Retrieval via Attention&lt;/b&gt;을 제안한다. &lt;br /&gt;Corpus chunk를 encoder로 미리 encoding해 저장하고, decoder의 cross-attention query가 이 encoded chunk들을 직접 score하여 관련 evidence를 선택한다. &lt;br /&gt;이후 선택된 encoded representation을 그대로 generation context로 사용한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;기존 RAG와 차이&lt;/td&gt;
&lt;td&gt;Standard RAG는 &amp;ldquo;외부 retriever &amp;rarr; raw text retrieval &amp;rarr; generator 재처리&amp;rdquo; 구조다. &lt;br /&gt;INTRA는 &amp;ldquo;pre-encoded chunk pool &amp;rarr; decoder attention query 기반 retrieval &amp;rarr; encoded state 재사용&amp;rdquo; 구조다. &lt;br /&gt;따라서 retrieval과 generation이 &lt;b&gt;동일한 representation space&lt;/b&gt;에서 일어난다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;핵심 메커니즘&lt;/td&gt;
&lt;td&gt;질문 입력 뒤에 &lt;b&gt;learnable retrieval tokens&lt;/b&gt;를 추가하고, decoder layer에서 나온 query state를 사용해 corpus chunk와 similarity를 계산한다. 이때 ColBERT-style &lt;b&gt;MaxSim late interaction&lt;/b&gt;을 사용하여 token-level matching을 chunk-level retrieval score로 변환한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Initial context (S_0)&lt;/td&gt;
&lt;td&gt;먼저 encoder representation 기반 MaxSim으로 초기 후보 chunk set (S_0)를 만든다. 하지만 최종 INTRA retrieval은 (S_0)만 reranking하는 것이 아니라, &lt;b&gt;전체 corpus를 다시 score&lt;/b&gt;하여 (S_{\text{INTRA}})를 선택한다. 따라서 초기 후보에 없던 evidence도 복구할 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Generation 방식&lt;/td&gt;
&lt;td&gt;최종 선택된 chunk의 raw text를 넣는 것이 아니라, 해당 chunk의 &lt;b&gt;pre-encoded encoder states&lt;/b&gt;를 decoder cross-attention memory로 넣어 답변을 생성한다. 따라서 검색된 문서를 다시 encoding하지 않아도 된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;중요한 구현 기법&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Reverse-QWK&lt;/b&gt;를 제안한다. 일반 encoder-decoder에서는 layer별 key projection 때문에 같은 encoder state를 모든 layer에서 재사용하기 어렵다. &lt;br /&gt;Reverse-QWK는 key-side projection을 query-side로 옮겨, 하나의 normalized encoder representation pool을 여러 decoder layer/head에서 공유할 수 있게 한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;학습 대상&lt;/td&gt;
&lt;td&gt;Encoder와 decoder backbone은 frozen으로 유지한다. 학습되는 것은 약 &lt;b&gt;164K개의 retrieval token parameters&lt;/b&gt;와 &lt;b&gt;272개의 layer aggregation weights&lt;/b&gt;뿐이다. &lt;br /&gt;즉, 별도 대형 retriever를 새로 학습하지 않고, 매우 작은 retrieval-specific parameter만 조정한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;학습 objective&lt;/td&gt;
&lt;td&gt;Oracle evidence chunk가 있는 경우, retrieval score에 대해 soft cross-entropy loss를 사용한다. &lt;br /&gt;여러 oracle chunk가 있으면 target probability mass를 균등하게 나누어 모든 supporting evidence가 높은 score를 받도록 학습한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;실험 설정&lt;/td&gt;
&lt;td&gt;T5Gemma2 4B-4B encoder-decoder를 사용한다. &lt;br /&gt;평가 benchmark는 &lt;b&gt;HotPotQA, 2WikiMultihopQA, MuSiQue, Natural Questions&lt;/b&gt;이며, 약 &lt;b&gt;100M token / 758.5K chunks&lt;/b&gt; 규모의 shared retrieval pool을 구성한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;비교 baseline&lt;/td&gt;
&lt;td&gt;TF-IDF, BM25, MaxSim, Hybrid RAG, BGE-large, Qwen3-Embedding-0.6B/4B, Qwen3-Embedding-4B + Jina reranker 등 강한 sparse/dense/hybrid retrieval baseline과 비교한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Retrieval 결과&lt;/td&gt;
&lt;td&gt;INTRA는 &lt;b&gt;HotPotQA, 2Wiki, MuSiQue&lt;/b&gt; 같은 multi-hop QA에서 complete-evidence recall@5/10/20 기준 최고 성능을 보인다. &lt;br /&gt;특히 여러 evidence를 조합해야 하는 문제에서 decoder-guided retrieval의 장점이 크다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;QA 결과&lt;/td&gt;
&lt;td&gt;End-to-end QA에서도 INTRA는 multi-hop benchmark에서 가장 높은 EM/F1을 달성한다. &lt;br /&gt;평균 성능도 가장 높으며, 이는 retrieval 성능 향상이 실제 answer generation 품질 향상으로 이어졌음을 보여준다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;NQ 결과 해석&lt;/td&gt;
&lt;td&gt;Natural Questions는 single-hop 성격이 강해 INTRA의 이점이 상대적으로 작다. &lt;br /&gt;실제로 NQ에서는 Qwen3-Embedding-4B + reranker가 더 높은 EM/F1을 보인다. &lt;br /&gt;이는 INTRA가 특히 &lt;b&gt;multi-hop evidence assembly&lt;/b&gt;에 강하다는 점을 시사한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;효율성 장점&lt;/td&gt;
&lt;td&gt;INTRA는 검색된 raw text를 다시 encoding하지 않고 pre-encoded representation을 재사용한다. &lt;br /&gt;따라서 standard RAG 대비 query-time prefilling cost와 time-to-first-token이 줄어든다. &lt;br /&gt;특히 retrieved chunk 수 (k)가 커질수록 RAG와의 latency 차이가 커진다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Ablation 핵심&lt;/td&gt;
&lt;td&gt;(S_0) 제거, cosine-only initialization, retrieval token 수 감소, pooled chunk length 축소 등은 모두 성능 하락을 유발한다. &lt;br /&gt;즉, INTRA의 성능은 &lt;b&gt;초기 context, retrieval tokens, full-corpus scoring, multi-vector representation&lt;/b&gt;이 함께 작동할 때 가장 강하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;한계점&lt;/td&gt;
&lt;td&gt;fixed context pool 중심 실험이며, open-web/web-scale dynamic retrieval을 대체한다고 보기는 어렵다. &lt;br /&gt;또한 encoder-decoder architecture에 의존하므로 현재 주류인 decoder-only LLM에 직접 적용하기 어렵다. &lt;br /&gt;평가도 short-answer text QA에 제한되어 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;연구적 의의&lt;/td&gt;
&lt;td&gt;이 논문은 retrieval을 외부 모듈로만 보던 기존 RAG 관점을 바꾸어, &lt;b&gt;generation model 내부의 attention demand 자체가 retrieval signal이 될 수 있다&lt;/b&gt;는 점을 실험적으로 보인다. &lt;br /&gt;Latent RAG, memory-augmented model, efficient context reuse, multi-hop QA retrieval 연구에 중요한 방향성을 제공한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;최종 평가&lt;/td&gt;
&lt;td&gt;INTRA는 실용적 RAG 시스템을 즉시 대체하기보다는, &lt;b&gt;retrieval과 generation을 하나의 representation space에서 통합할 수 있다는 강한 개념적&amp;middot;실험적 증거&lt;/b&gt;를 제시한 논문이다. &lt;br /&gt;특히 multi-hop QA와 static corpus reuse 환경에서 의미가 크다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1221</guid>
      <comments>https://yoonschallenge.tistory.com/1221#entry1221comment</comments>
      <pubDate>Thu, 21 May 2026 00:20:11 +0900</pubDate>
    </item>
    <item>
      <title>Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?</title>
      <link>https://yoonschallenge.tistory.com/1220</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.11501&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2502.11501&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1779276379746&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?&quot; data-og-description=&quot;Multimodal large language models (MLLMs) have shown remarkable performance for cross-modal understanding and generation, yet still suffer from severe inference costs. Recently, abundant works have been proposed to solve this problem with token pruning, whi&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2502.11501&quot; data-og-url=&quot;https://arxiv.org/abs/2502.11501v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/fpKV1/dJMb8Yp07j3/II87eRjvoyum15hcon2zEK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/K4nlT/dJMb8U8ZmCb/igZCYZIDlkbcR4qA252pXk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.11501&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2502.11501&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/fpKV1/dJMb8Yp07j3/II87eRjvoyum15hcon2zEK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/K4nlT/dJMb8U8ZmCb/igZCYZIDlkbcR4qA252pXk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Multimodal large language models (MLLMs) have shown remarkable performance for cross-modal understanding and generation, yet still suffer from severe inference costs. Recently, abundant works have been proposed to solve this problem with token pruning, whi&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이번엔 멀티모달이라 그렇게 땡기는건 아니지만 그래도 이쪽 분야의 토큰 프루닝도 알면 좋을테니...&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;visual token pruning 연구가 정말 중요한 토큰을 잘 고르고 있는지에 대해 놓치고 있고, 기존 attention 기반 pruning이 random, pooling보다 못할 수 있다는 점을 실험적으로 보여줬습니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;928&quot; data-origin-height=&quot;819&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bLOhMX/dJMcaiDowOi/LRDhpQscFpHkkNon7lLhG0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bLOhMX/dJMcaiDowOi/LRDhpQscFpHkkNon7lLhG0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bLOhMX/dJMcaiDowOi/LRDhpQscFpHkkNon7lLhG0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbLOhMX%2FdJMcaiDowOi%2FLRDhpQscFpHkkNon7lLhG0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;928&quot; height=&quot;819&quot; data-origin-width=&quot;928&quot; data-origin-height=&quot;819&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 pruning 방법들은 bias를 가져 random이나 pooling보다 못 함을 보여준다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1043&quot; data-origin-height=&quot;648&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/HsqBC/dJMcabYBprC/YMOwGKlJn9lGkb3qnQVSo1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/HsqBC/dJMcabYBprC/YMOwGKlJn9lGkb3qnQVSo1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/HsqBC/dJMcabYBprC/YMOwGKlJn9lGkb3qnQVSo1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FHsqBC%2FdJMcabYBprC%2FYMOwGKlJn9lGkb3qnQVSo1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1043&quot; height=&quot;648&quot; data-origin-width=&quot;1043&quot; data-origin-height=&quot;648&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최신 token에 attention이 쏠리는 편향을 보여주고 있음 = position bias&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;870&quot; data-origin-height=&quot;835&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/MPusk/dJMcai4pdkQ/MvzBTtmSsB0upUnzL6YDc0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/MPusk/dJMcai4pdkQ/MvzBTtmSsB0upUnzL6YDc0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/MPusk/dJMcai4pdkQ/MvzBTtmSsB0upUnzL6YDc0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FMPusk%2FdJMcai4pdkQ%2FMvzBTtmSsB0upUnzL6YDc0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;870&quot; height=&quot;835&quot; data-origin-width=&quot;870&quot; data-origin-height=&quot;835&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;지속적으로 기존에 있던 pruning 방법들의 문제를 보여줍니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 토큰 수를 더 줄여도 결국 random의 성능이 가장 높은 것을 보인다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1503&quot; data-origin-height=&quot;405&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/IHSFn/dJMcafGHAnj/OUckn03XKb4La3VvXKKN6K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/IHSFn/dJMcafGHAnj/OUckn03XKb4La3VvXKKN6K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/IHSFn/dJMcafGHAnj/OUckn03XKb4La3VvXKKN6K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FIHSFn%2FdJMcafGHAnj%2FOUckn03XKb4La3VvXKKN6K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1503&quot; height=&quot;405&quot; data-origin-width=&quot;1503&quot; data-origin-height=&quot;405&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;vanilla FastV보면 살아 남은 것이 엄청 뭉쳐있는 것을 볼 수 있네요...&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;RdfCOCO는 위치 정보가 매우 중요한데 여기서도 기존 prunning 방법의 성능 저하가 매우 크다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;917&quot; data-origin-height=&quot;679&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/WSCNU/dJMcaja8EoK/ArzHEZ5HmlK4VPVAdmGC30/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/WSCNU/dJMcaja8EoK/ArzHEZ5HmlK4VPVAdmGC30/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/WSCNU/dJMcaja8EoK/ArzHEZ5HmlK4VPVAdmGC30/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FWSCNU%2FdJMcaja8EoK%2FArzHEZ5HmlK4VPVAdmGC30%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;917&quot; height=&quot;679&quot; data-origin-width=&quot;917&quot; data-origin-height=&quot;679&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;SparseVLM이나 FastV 계열 방법은 text와 visual token 사이의 attention을 활용함 -&amp;gt; 이 것은 task가 언어 정보에 강하게 의존할 때만 유리함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Visual Haystack 벤치마크(text와 visual alignment를 확인)를 봤을 때 SparseVLM은 성능을 유지하는 것을 볼 수 있음&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Task 유형&lt;/td&gt;
&lt;td&gt;적합한&amp;nbsp;pruning&amp;nbsp;방향&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;일반 visual perception / spatial task&lt;/td&gt;
&lt;td&gt;language guidance보다 spatial coverage, redundancy 보존이 중요&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;text-heavy retrieval / object matching task&lt;/td&gt;
&lt;td&gt;text-guided pruning이 효과적&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;OCR / document / phrase-grounded task&lt;/td&gt;
&lt;td&gt;language-conditioned visual selection이 중요할 가능성 큼&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1471&quot; data-origin-height=&quot;365&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b9qhIu/dJMcaja8Epb/3sNVp7KnuUKIaTArKu0bb0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b9qhIu/dJMcaja8Epb/3sNVp7KnuUKIaTArKu0bb0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b9qhIu/dJMcaja8Epb/3sNVp7KnuUKIaTArKu0bb0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb9qhIu%2FdJMcaja8Epb%2F3sNVp7KnuUKIaTArKu0bb0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1471&quot; height=&quot;365&quot; data-origin-width=&quot;1471&quot; data-origin-height=&quot;365&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;visual token에는 두가지 기준이 있음&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Importance : 출력 Y를 예측하는데 중요한 token인가. - SQA, TextVQA 같은 knowledge/reasoning task&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Redundancy / Uniqueness : 다른 토큰과 중복되지 않고 구조 정보를 보존하는가. - MME, POPE 같은 perception task&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;MME, POPE 같은 perception-dominant task에서는 중요도가 낮을 때 redundancy first pruning이 좋음. 반대 케이스에서는 또 다른 프루닝 방식이 좋았음&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;630&quot; data-origin-height=&quot;199&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bDM6ap/dJMcahYMBe1/NbqAks85vMnUCigwPGZdH1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bDM6ap/dJMcahYMBe1/NbqAks85vMnUCigwPGZdH1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bDM6ap/dJMcahYMBe1/NbqAks85vMnUCigwPGZdH1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbDM6ap%2FdJMcahYMBe1%2FNbqAks85vMnUCigwPGZdH1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;630&quot; height=&quot;199&quot; data-origin-width=&quot;630&quot; data-origin-height=&quot;199&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;FLOPs가 실제 속도 향상을 잘 설명하지 못한다고도 저자는 주장합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;정비례하지 않고, 오히려 역전되는 경우도 있음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;문제의식&lt;/td&gt;
&lt;td&gt;MLLM은 이미지/비디오 입력에서 수백~수천 개의 visual token을 사용하기 때문에 inference latency와 KV cache 비용이 큼. &lt;br /&gt;기존 연구들은 token pruning으로 이를 줄이려 했지만, &lt;b&gt;정말 중요한 token을 잘 고르고 있는지&lt;/b&gt;, &lt;b&gt;평가가 올바른지&lt;/b&gt;는 충분히 검증하지 않음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;핵심 주장&lt;/td&gt;
&lt;td&gt;기존 attention-based visual token pruning은 근본적으로 불완전할 수 있음. &lt;br /&gt;특히 FastV, SparseVLM 같은 방법이 &lt;b&gt;Random selection이나 단순 Pooling보다 낮은 성능&lt;/b&gt;을 보이는 경우가 많음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;비교한 방법&lt;/td&gt;
&lt;td&gt;FastV, SparseVLM, MustDrop 같은 기존 pruning 방법과 Random token selection, Pooling 같은 단순 baseline을 비교함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;사용 모델&lt;/td&gt;
&lt;td&gt;LLaVA-1.5-7B/13B, LLaVA-Next-7B, Qwen2-VL-7B/72B 등 대표 MLLM을 사용함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;사용 데이터셋&lt;/td&gt;
&lt;td&gt;GQA, MMBench, MME, POPE, ScienceQA, TextVQA, VizWiz, RefCOCO, Visual Haystack 등 다양한 visual understanding, grounding, retrieval task를 평가함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과 1: 단순 baseline의 강함&lt;/td&gt;
&lt;td&gt;LLaVA-1.5-7B에서 576개 visual token 중 144개만 남기는 경우, Pooling은 평균 &lt;b&gt;96.4%&lt;/b&gt;, Random은 &lt;b&gt;95.0%&lt;/b&gt; 성능을 유지했지만, Vanilla FastV는 &lt;b&gt;89.8%&lt;/b&gt;, SparseVLM은 &lt;b&gt;93.5%&lt;/b&gt;에 그침. &lt;br /&gt;즉, 잘 설계된 pruning보다 단순한 spatially uniform 방식이 더 안정적임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과 2: Position Bias&lt;/td&gt;
&lt;td&gt;FastV처럼 attention score를 기준으로 token을 고르면 visual sequence 뒤쪽 token이 과도하게 선택됨. &lt;br /&gt;이는 실제 중요도라기보다 &lt;b&gt;위치 편향(position bias)&lt;/b&gt; 때문일 수 있음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;해결 실험: Window FastV&lt;/td&gt;
&lt;td&gt;저자들은 local window 안에서 token을 고르는 &lt;b&gt;Window FastV&lt;/b&gt;를 제안함. &lt;br /&gt;이 방식은 token이 이미지 전체에 더 균일하게 남도록 하며, Vanilla FastV보다 성능 저하가 작음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과 3: Spatial task에서 취약&lt;/td&gt;
&lt;td&gt;RefCOCO grounding task에서는 대부분의 pruning 방법이 크게 성능 저하를 보임. &lt;br /&gt;특히 spatial localization이 필요한 task에서는 token pruning이 위험하며, spatial uniformity가 중요함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과 4: Language guidance의 조건부 효과&lt;/td&gt;
&lt;td&gt;text-guided pruning은 항상 좋은 것이 아니라, Visual Haystack처럼 text와 visual object matching이 중요한 task에서 특히 효과적임. &lt;br /&gt;일반 visual perception task에서는 language guidance보다 spatial coverage가 더 중요할 수 있음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과 5: Importance vs. Redundancy&lt;/td&gt;
&lt;td&gt;pruning 기준은 단순히 &amp;ldquo;중요한 token&amp;rdquo;만 보면 안 됨. &lt;br /&gt;Perception task에서는 token 간 중복을 줄이면서 구조를 보존하는 &lt;b&gt;redundancy-first&lt;/b&gt;가 유리하고, SQA/TextVQA 같은 reasoning task에서는 예측에 중요한 token을 남기는 &lt;b&gt;importance-first&lt;/b&gt;가 유리함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과 6: FLOPs 평가의 한계&lt;/td&gt;
&lt;td&gt;token 수나 FLOPs 감소율은 실제 latency를 잘 설명하지 못함. &lt;br /&gt;SparseVLM은 FastV와 유사한 FLOPs를 보이지만 실제 latency는 더 느림. &lt;br /&gt;FlashAttention 호환성, pruning layer 위치, selection overhead가 실제 속도에 큰 영향을 줌.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과 7: Training-aware compression&lt;/td&gt;
&lt;td&gt;Qwen2-VL처럼 학습 단계에서 이미 patch merging/token compression을 수행한 모델은 inference-time pruning을 다르게 평가해야 함. &lt;br /&gt;training-aware compression을 고려하면 Qwen2-VL은 큰 token reduction에서도 vanilla와 거의 유사한 성능을 유지함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;논문의 결론&lt;/td&gt;
&lt;td&gt;MLLM token pruning은 단순히 attention score가 낮은 token을 제거하는 문제가 아님. &lt;br /&gt;&lt;b&gt;spatial uniformity, task-specific language dependency, importance-redundancy trade-off, hardware-aware latency, training-aware compression&lt;/b&gt;을 함께 고려해야 함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;한계&lt;/td&gt;
&lt;td&gt;실험이 LLaVA, LLaVA-Next, Qwen2-VL 중심으로 수행되어 더 다양한 MLLM architecture와 scale에서 검증이 필요함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;연구적 시사점&lt;/td&gt;
&lt;td&gt;앞으로 token pruning 논문은 Random/Pooling 같은 단순 baseline을 반드시 포함해야 하며, FLOPs가 아니라 실제 latency와 hardware compatibility를 보고해야 함. &lt;br /&gt;또한 attention score 기반 pruning보다 spatially uniform하고 task-adaptive한 token reduction이 더 유망함.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1220</guid>
      <comments>https://yoonschallenge.tistory.com/1220#entry1220comment</comments>
      <pubDate>Wed, 20 May 2026 21:33:53 +0900</pubDate>
    </item>
    <item>
      <title>Recursive Multi-Agent Systems</title>
      <link>https://yoonschallenge.tistory.com/1219</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2604.25917&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2604.25917&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1778743738354&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Recursive Multi-Agent Systems&quot; data-og-description=&quot;Recursive or looped language models have recently emerged as a new scaling axis by iteratively refining the same model computation over latent states to deepen reasoning. We extend such scaling principle from a single model to multi-agent systems, and ask:&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2604.25917&quot; data-og-url=&quot;https://arxiv.org/abs/2604.25917v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bNT5ik/dJMb84qdCy8/9jpMZjN5U6dVCHxx1st6eK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cXyxZS/dJMb86O6JdE/TU9yq9IKRL7XEFhkE7Tkz1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2604.25917&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2604.25917&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bNT5ik/dJMb84qdCy8/9jpMZjN5U6dVCHxx1st6eK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cXyxZS/dJMb86O6JdE/TU9yq9IKRL7XEFhkE7Tkz1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Recursive Multi-Agent Systems&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Recursive or looped language models have recently emerged as a new scaling axis by iteratively refining the same model computation over latent states to deepen reasoning. We extend such scaling principle from a single model to multi-agent systems, and ask:&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Agent끼리의 소통을 텍스트 기반 대화가 아닌 latent space 기반으로 진행&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Hidden state를 RecursiveLink라는 작은 projection module로 연결하고, 전체 MAS를 대화 라운드 동안 강화하도록 반복&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1137&quot; data-origin-height=&quot;815&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bXV3Ur/dJMcabRH1Cs/9UtJEPnIUpHkDQasV0MzBk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bXV3Ur/dJMcabRH1Cs/9UtJEPnIUpHkDQasV0MzBk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bXV3Ur/dJMcabRH1Cs/9UtJEPnIUpHkDQasV0MzBk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbXV3Ur%2FdJMcabRH1Cs%2F9UtJEPnIUpHkDQasV0MzBk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1137&quot; height=&quot;815&quot; data-origin-width=&quot;1137&quot; data-origin-height=&quot;815&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;더 긴 라운드를 진행할 수 있게 되면 성능이 높아지는 모습을 보인다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다양한 MAS 구조에서도 좋은 성능을 보여주는 것을 보인다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1419&quot; data-origin-height=&quot;681&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/d7QnRd/dJMcaaegpUB/aW6JZq1l8FX5eZvvHQ78sK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/d7QnRd/dJMcaaegpUB/aW6JZq1l8FX5eZvvHQ78sK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/d7QnRd/dJMcaaegpUB/aW6JZq1l8FX5eZvvHQ78sK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fd7QnRd%2FdJMcaaegpUB%2FaW6JZq1l8FX5eZvvHQ78sK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1419&quot; height=&quot;681&quot; data-origin-width=&quot;1419&quot; data-origin-height=&quot;681&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Inner RecursiveLink는 한 에이전트 내부 latent thought를 생성하며 마지막 layer의 hidden state 를 다시 input embedding space로 변환해 latent autoregressive reasoning을 수행한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Outer RecursiveLink는 서로 다른 에이전트간 latent state 전달로 서로 다른 모델 크기, dimension을 정렬함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;RecursiveLink는 2-layer MLP + GELU + residual connection 구조.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;580&quot; data-origin-height=&quot;530&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ldBj7/dJMcaja5mnq/ROI9uBPhd10kspeOIlvfHk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ldBj7/dJMcaja5mnq/ROI9uBPhd10kspeOIlvfHk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ldBj7/dJMcaja5mnq/ROI9uBPhd10kspeOIlvfHk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FldBj7%2FdJMcaja5mnq%2FROI9uBPhd10kspeOIlvfHk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;580&quot; height=&quot;530&quot; data-origin-width=&quot;580&quot; data-origin-height=&quot;530&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;자기 자신한테 보내는 inner link와 외부에 보내는 outer link&amp;nbsp;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;976&quot; data-origin-height=&quot;836&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/OYxhn/dJMb990J8vN/I510kkKH7YPv53zbDPrtKK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/OYxhn/dJMb990J8vN/I510kkKH7YPv53zbDPrtKK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/OYxhn/dJMb990J8vN/I510kkKH7YPv53zbDPrtKK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FOYxhn%2FdJMb990J8vN%2FI510kkKH7YPv53zbDPrtKK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;976&quot; height=&quot;836&quot; data-origin-width=&quot;976&quot; data-origin-height=&quot;836&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Inner loop training은 각 에이전트가 latent thought를 안정적으로 생성하도록 warm-up하는 단계로, inner RecursiveLink를 cosine regression loss로 학습&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Ourer-loop training은 여러 에이전트의 latent collaboration flow를 최적화는 것으로, Outer RecursiveLink를 final answer CE loss로 학습&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;llm 자체는 학습하지 않고 RecursiveLink만 학습!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;stage 1학습이 좀 더 명확하게 있으면 편하겠네요&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;968&quot; data-origin-height=&quot;641&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cEEQbt/dJMcaiwyVMp/6qytjnI9cDnhA5zM6s8Ah1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cEEQbt/dJMcaiwyVMp/6qytjnI9cDnhA5zM6s8Ah1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cEEQbt/dJMcaiwyVMp/6qytjnI9cDnhA5zM6s8Ah1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcEEQbt%2FdJMcaiwyVMp%2F6qytjnI9cDnhA5zM6s8Ah1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;968&quot; height=&quot;641&quot; data-origin-width=&quot;968&quot; data-origin-height=&quot;641&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 100px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;Collaboration&amp;nbsp;Pattern&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;구성&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;목적&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;Sequential Style&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;Planner &amp;rarr; Critic &amp;rarr; Solver&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;단계적 추론&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;Mixture Style&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;Math / Code / Science Specialist + Summarizer&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;전문 에이전트 조합&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;Distillation Style&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;Expert + Learner&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;큰 모델 지식을 작은 모델에 전달&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;Deliberation Style&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;Reflector + Tool-Caller&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;도구 사용 및 자기반성 기반 추론&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1001&quot; data-origin-height=&quot;802&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/NNhvW/dJMcaf0TrbD/SicwCm4wWIebSwtLs70P8K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/NNhvW/dJMcaf0TrbD/SicwCm4wWIebSwtLs70P8K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/NNhvW/dJMcaf0TrbD/SicwCm4wWIebSwtLs70P8K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FNNhvW%2FdJMcaf0TrbD%2FSicwCm4wWIebSwtLs70P8K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1001&quot; height=&quot;802&quot; data-origin-width=&quot;1001&quot; data-origin-height=&quot;802&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 text를 사용하는 것 보다 높은 정확도, inference speed 향상, 토큰 사용량도 줄게 된다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;라운드가 증가할 수록 이 차이는 더욱 더 늘어난다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;999&quot; data-origin-height=&quot;406&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/lHZPa/dJMcahqVCEY/yt3NtpsDQk8geEAGjtQBik/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/lHZPa/dJMcahqVCEY/yt3NtpsDQk8geEAGjtQBik/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/lHZPa/dJMcahqVCEY/yt3NtpsDQk8geEAGjtQBik/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FlHZPa%2FdJMcahqVCEY%2Fyt3NtpsDQk8geEAGjtQBik%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;999&quot; height=&quot;406&quot; data-origin-width=&quot;999&quot; data-origin-height=&quot;406&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다른 방법론에 비해 정확도도 꾸준히 높은 것을 볼 수 있다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1187&quot; data-origin-height=&quot;711&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bucBPh/dJMcabc6ZTr/oBttN6pWcUmn8YuAJzWKv0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bucBPh/dJMcabc6ZTr/oBttN6pWcUmn8YuAJzWKv0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bucBPh/dJMcabc6ZTr/oBttN6pWcUmn8YuAJzWKv0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbucBPh%2FdJMcabc6ZTr%2FoBttN6pWcUmn8YuAJzWKv0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1187&quot; height=&quot;711&quot; data-origin-width=&quot;1187&quot; data-origin-height=&quot;711&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기선 효율성을 보여줍니다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1243&quot; data-origin-height=&quot;472&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/tPgBm/dJMcajvto8D/5iCkdemmTiawaaLi74dNvK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/tPgBm/dJMcajvto8D/5iCkdemmTiawaaLi74dNvK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/tPgBm/dJMcajvto8D/5iCkdemmTiawaaLi74dNvK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FtPgBm%2FdJMcajvto8D%2F5iCkdemmTiawaaLi74dNvK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1243&quot; height=&quot;472&quot; data-origin-width=&quot;1243&quot; data-origin-height=&quot;472&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Recursion round가 증가할 수록 생성된 임베딩 분포가 정답 임베딩 분포와 가까워지는 것을 볼 수 있었음 =&amp;gt; 단순히 반복하는 것이 아닌 latent representation을 통해 점진적으로 정답 분포에 맞춰 refine함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;RecursiveLink의 구조에 대해서도 다양하게 만들어 봤으나 2-Layer + Res 구조가 가장 높은 성능을 보였음&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 776px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;기존 Multi-Agent System(MAS)의 에이전트 간 협업을 &lt;b&gt;텍스트 기반 대화&lt;/b&gt;가 아니라 &lt;b&gt;latent state 기반 recursive computation&lt;/b&gt;으로 바꾼다. &lt;br /&gt;즉, 여러 에이전트를 하나의 재귀적 계산 그래프처럼 연결해 반복적으로 latent thought를 refinement한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;해결하려는 문제&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;기존 MAS는 중간 결과를 텍스트로 생성하고 다시 읽는 방식이라 &lt;b&gt;token 비용, latency, decoding/re-encoding overhead&lt;/b&gt;가 크다. &lt;br /&gt;또한 각 에이전트를 개별적으로 prompt tuning하거나 학습하기 때문에 &lt;b&gt;시스템 전체 collaboration flow를 end-to-end로 최적화하기 어렵다&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;제안 방법&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;각 에이전트는 latent representation을 생성하고, 이를 다음 에이전트로 전달한다. &lt;br /&gt;마지막 에이전트의 latent output은 다시 첫 번째 에이전트로 돌아가며 recursion loop를 형성한다. &lt;br /&gt;중간 round에서는 텍스트를 생성하지 않고, 최종 round에서만 textual answer를 decoding한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;핵심 모듈&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;2-layer residual projection module로, latent state를 다른 embedding space로 변환한다. &lt;br /&gt;&lt;b&gt;Inner RecursiveLink&lt;/b&gt;는 한 에이전트 내부에서 latent thought를 계속 생성하게 하고, &lt;b&gt;Outer RecursiveLink&lt;/b&gt;는 서로 다른 모델/에이전트 사이의 hidden representation을 연결한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;학습 방식&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Inner-Outer Loop Training&lt;/b&gt;. 1단계에서는 각 에이전트의 Inner RecursiveLink를 warm-up하여 latent thought generation을 안정화한다. 2단계에서는 전체 MAS loop를 unroll한 뒤, final answer의 CE loss를 통해 Outer RecursiveLink를 system-level로 최적화한다. LLM backbone은 freeze하고 RecursiveLink만 학습한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;적용한 MAS 구조&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;네 가지 협업 패턴에 적용했다: &lt;b&gt;Sequential Style&lt;/b&gt;: Planner &amp;rarr; Critic &amp;rarr; Solver, &lt;b&gt;Mixture Style&lt;/b&gt;: Math/Code/Science Specialist + Summarizer, &lt;b&gt;Distillation Style&lt;/b&gt;: Expert + Learner, &lt;b&gt;Deliberation Style&lt;/b&gt;: Reflector + Tool-Caller.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;평가 벤치마크&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;수학, 과학, 의료, 코드, 검색 QA 등 9개 benchmark에서 평가했다. 사용 benchmark는 &lt;b&gt;MATH500, AIME2025, AIME2026, GPQA-Diamond, MedQA, LiveCodeBench-v6, MBPP Plus, HotpotQA, Bamboogle&lt;/b&gt;이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;주요 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;RecursiveMAS는 single-agent, LoRA/Full-SFT, TextGrad, LoopLM, Recursive-TextMAS 등과 비교해 평균 &lt;b&gt;+8.3% accuracy improvement&lt;/b&gt;를 보였다. 또한 &lt;b&gt;1.2&amp;times;&amp;ndash;2.4&amp;times; inference speedup&lt;/b&gt;, &lt;b&gt;34.6%&amp;ndash;75.6% token usage reduction&lt;/b&gt;을 달성했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 56px;&quot;&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;&lt;b&gt;Recursion depth 효과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;recursion round가 증가할수록 RecursiveMAS의 성능과 효율 이점이 커진다. r=3에서는 Recursive-TextMAS 대비 평균 &lt;b&gt;2.4&amp;times; speedup&lt;/b&gt;, &lt;b&gt;75.6% token reduction&lt;/b&gt;을 보인다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Ablation 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;RecursiveLink 구조 비교에서 &lt;b&gt;Res+2-Layer&lt;/b&gt;가 가장 좋았다. 예를 들어 Math500 88.0, GPQA-D 66.2, LiveCodeBench 42.9로 1-layer, residual 없는 2-layer보다 높다. 이는 residual connection이 latent semantics를 보존하면서 distribution shift만 학습하게 한다는 설계를 뒷받침한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;추가 분석&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;recursion round가 증가할수록 generated answer embedding distribution이 ground-truth embedding distribution에 가까워진다. 논문은 이를 통해 RecursiveMAS가 단순 반복이 아니라 latent representation을 정답 방향으로 점진적으로 refine한다고 해석한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;장점&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;중간 텍스트 생성을 줄여 &lt;b&gt;효율적&lt;/b&gt;이고, 여러 heterogeneous agent를 latent level에서 연결할 수 있으며, 전체 MAS를 하나의 differentiable recursive system으로 최적화한다. 특히 agent collaboration 자체를 scaling axis로 제시했다는 점이 핵심 기여다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;hidden state 접근이 필요하므로 GPT/Claude 같은 완전 black-box API 기반 MAS에는 직접 적용하기 어렵다. 또한 latent communication은 중간 reasoning이 텍스트로 드러나지 않아 interpretability/debugging이 약할 수 있다. Role-specific training target 구성에도 강한 모델 기반 재작성 과정이 들어간다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;최종 평가&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;이 논문은 &lt;b&gt;MAS를 더 많은 에이전트나 더 긴 CoT로 확장하는 대신, latent-space recursive collaboration으로 확장하는 방법&lt;/b&gt;을 제안한다. 연구적으로는 &amp;ldquo;multi-agent collaboration을 학습 가능한 latent transition system으로 재정의했다&amp;rdquo;는 점이 가장 중요하다. 실용적으로는 token/latency 절감이 강점이지만, black-box API 환경과 해석 가능성 측면의 제약은 남아 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1219</guid>
      <comments>https://yoonschallenge.tistory.com/1219#entry1219comment</comments>
      <pubDate>Fri, 15 May 2026 22:22:26 +0900</pubDate>
    </item>
    <item>
      <title>LIMO: Less is More for Reasoning</title>
      <link>https://yoonschallenge.tistory.com/1218</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.03387&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2502.03387&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1778685772718&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;LIMO: Less is More for Reasoning&quot; data-og-description=&quot;We challenge the prevailing assumption that complex reasoning in large language models (LLMs) necessitates massive training data. We demonstrate that sophisticated mathematical reasoning can emerge with only a few examples. Specifically, through simple sup&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2502.03387&quot; data-og-url=&quot;https://arxiv.org/abs/2502.03387v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/eeWd0C/dJMb9b3WUgn/acnC2l4R6FCuVvKqFDFQ41/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/ctEcOC/dJMb8ZvGlEV/XkzvoLmiqBTlZd1xd764n0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.03387&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2502.03387&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/eeWd0C/dJMb9b3WUgn/acnC2l4R6FCuVvKqFDFQ41/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/ctEcOC/dJMb8ZvGlEV/XkzvoLmiqBTlZd1xd764n0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;LIMO: Less is More for Reasoning&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We challenge the prevailing assumption that complex reasoning in large language models (LLMs) necessitates massive training data. We demonstrate that sophisticated mathematical reasoning can emerge with only a few examples. Specifically, through simple sup&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;reasoning model로 만들기 위해 필요한 것은 대규모 sft data가 아니라, 이미 pretrained 모델 내부 지식을 잘 이끌어 내는 소수의 고품질 reasoning deminstration으로 유도될 수 있다라는 것을 보여줍니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://yoonschallenge.tistory.com/1217&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;2026.05.14 - [인공지능/논문 리뷰 or 진행] - s1: Simple test-time scaling&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1778686119970&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;s1: Simple test-time scaling&quot; data-og-description=&quot;https://arxiv.org/abs/2501.19393 s1: Simple test-time scalingTest-time scaling is a promising new approach to language modeling that uses extra test-time compute to improve performance. Recently, OpenAI's o1 model showed this capability but did not publicl&quot; data-og-host=&quot;yoonschallenge.tistory.com&quot; data-og-source-url=&quot;https://yoonschallenge.tistory.com/1217&quot; data-og-url=&quot;https://yoonschallenge.tistory.com/1217&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/cbdSA8/dJMb85WYggg/JmiPCuUdDpO4uUOgHD0fW0/img.png?width=800&amp;amp;height=479&amp;amp;face=0_0_800_479,https://scrap.kakaocdn.net/dn/ywV4I/dJMb9fZAccW/A3jQrrxvXn6oJuS0ZKK49k/img.png?width=800&amp;amp;height=479&amp;amp;face=0_0_800_479,https://scrap.kakaocdn.net/dn/bKgaiL/dJMb85WYggf/ZHdhGyconRYjqxdy3xeSNK/img.png?width=1381&amp;amp;height=754&amp;amp;face=0_0_1381_754&quot;&gt;&lt;a href=&quot;https://yoonschallenge.tistory.com/1217&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://yoonschallenge.tistory.com/1217&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/cbdSA8/dJMb85WYggg/JmiPCuUdDpO4uUOgHD0fW0/img.png?width=800&amp;amp;height=479&amp;amp;face=0_0_800_479,https://scrap.kakaocdn.net/dn/ywV4I/dJMb9fZAccW/A3jQrrxvXn6oJuS0ZKK49k/img.png?width=800&amp;amp;height=479&amp;amp;face=0_0_800_479,https://scrap.kakaocdn.net/dn/bKgaiL/dJMb85WYggf/ZHdhGyconRYjqxdy3xeSNK/img.png?width=1381&amp;amp;height=754&amp;amp;face=0_0_1381_754');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;s1: Simple test-time scaling&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;https://arxiv.org/abs/2501.19393 s1: Simple test-time scalingTest-time scaling is a promising new approach to language modeling that uses extra test-time compute to improve performance. Recently, OpenAI's o1 model showed this capability but did not publicl&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;yoonschallenge.tistory.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 논문과 유사한 것이라 대충 보고 넘어가겠습니다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1198&quot; data-origin-height=&quot;620&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Kjneg/dJMcaja3H5i/3HlrnLOoJ7oMbGv6PSrYs1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Kjneg/dJMcaja3H5i/3HlrnLOoJ7oMbGv6PSrYs1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Kjneg/dJMcaja3H5i/3HlrnLOoJ7oMbGv6PSrYs1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FKjneg%2FdJMcaja3H5i%2F3HlrnLOoJ7oMbGv6PSrYs1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1198&quot; height=&quot;620&quot; data-origin-width=&quot;1198&quot; data-origin-height=&quot;620&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;적은 데이터로도 높은 성능 향상을 보일 수 있다!&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1140&quot; data-origin-height=&quot;269&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/v0CcE/dJMcaf7Dwvy/3plGdRb8dfsuLHNY38vxBk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/v0CcE/dJMcaf7Dwvy/3plGdRb8dfsuLHNY38vxBk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/v0CcE/dJMcaf7Dwvy/3plGdRb8dfsuLHNY38vxBk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fv0CcE%2FdJMcaf7Dwvy%2F3plGdRb8dfsuLHNY38vxBk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1140&quot; height=&quot;269&quot; data-origin-width=&quot;1140&quot; data-origin-height=&quot;269&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1140&quot; data-origin-height=&quot;703&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/P9lwA/dJMcaf7DwvD/BSIX8wkIdFVE6g7J7tTS20/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/P9lwA/dJMcaf7DwvD/BSIX8wkIdFVE6g7J7tTS20/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/P9lwA/dJMcaf7DwvD/BSIX8wkIdFVE6g7J7tTS20/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FP9lwA%2FdJMcaf7DwvD%2FBSIX8wkIdFVE6g7J7tTS20%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1140&quot; height=&quot;703&quot; data-origin-width=&quot;1140&quot; data-origin-height=&quot;703&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1139&quot; data-origin-height=&quot;471&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bcnICk/dJMcagFxrkA/Z4snODQkWk3cg4X0K3YcVK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bcnICk/dJMcagFxrkA/Z4snODQkWk3cg4X0K3YcVK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bcnICk/dJMcagFxrkA/Z4snODQkWk3cg4X0K3YcVK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbcnICk%2FdJMcagFxrkA%2FZ4snODQkWk3cg4X0K3YcVK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1139&quot; height=&quot;471&quot; data-origin-width=&quot;1139&quot; data-origin-height=&quot;471&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 916px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;핵심 문제의식&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;기존에는 복잡한 수학 추론 능력을 만들기 위해 수만~수십만 개의 SFT/CoT 데이터가 필요하다고 보았지만, 저자들은 최신 foundation model이 이미 사전학습에서 많은 수학 지식을 내재하고 있으므로 &lt;b&gt;소수의 고품질 예시만으로도 reasoning ability를 끌어낼 수 있는지&lt;/b&gt; 검증하고자 함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;핵심 가설&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;LIMO Hypothesis&lt;/b&gt;: 충분한 도메인 지식이 사전학습으로 모델 내부에 인코딩되어 있다면, 복잡한 추론 능력은 대규모 데이터가 아니라 &lt;b&gt;정교하게 설계된 소수의 reasoning demonstration&lt;/b&gt;만으로도 발현될 수 있음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Post-training의 목적을 새로운 지식 주입이 아니라, 모델이 이미 가진 지식을 &lt;b&gt;long reasoning chain 형태로 전개하도록 유도하는 cognitive template 제공&lt;/b&gt;으로 봄&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;데이터 구성 방식&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;NuminaMath-CoT, DeepScaleR, AIME 과거 문제, MATH, 중국 수학 시험 문제 등에서 대규모 후보 문제를 수집한 뒤, 쉬운 문제를 제거하고 어려운 문제만 선별함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;문제 선별 기준&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Qwen2.5-Math-7B-Instruct가 4번 안에 맞히는 쉬운 문제는 제거하고, DeepSeek-R1-Distill-Qwen-32B가 32번 중 1~3번만 맞히는 문제를 선택함. 이를 통해 너무 쉽지 않고, 깊은 추론을 요구하는 문제를 확보함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Reasoning chain 선별 기준&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;DeepSeek R1, DeepSeek-R1-Distill-Qwen-32B, QwQ-32B로 여러 풀이를 생성한 뒤, &lt;b&gt;충분한 논리 전개, 자기 검증, 탐색적 사고, 적절한 세부 설명 수준&lt;/b&gt;을 기준으로 가장 좋은 풀이를 선택함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;최종 데이터셋&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;LIMO Dataset은 최종적으로 &lt;b&gt;800개 문제-풀이 쌍&lt;/b&gt;으로 구성됨. 핵심은 데이터 양이 아니라, 문제 난이도와 reasoning chain 품질임&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;학습 방법&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Qwen2.5-32B-Instruct를 base model로 사용하고, 별도의 RL이나 복잡한 학습 기법 없이 &lt;b&gt;full-parameter supervised fine-tuning&lt;/b&gt;을 수행함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;학습 세팅&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Sequence length 16,384, learning rate 5e-6, cosine decay, warmup 없음, 15 epochs, batch size 64, DeepSpeed ZeRO-3와 FlashAttention-2 사용&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;주요 성능&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;LIMO는 800개 데이터만으로 &lt;b&gt;AIME24 63.3%, MATH500 95.6%, AMC23 96.3%&lt;/b&gt;를 달성함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;비교 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;같은 Qwen2.5-32B-Instruct를 OpenThoughts-114k나 NuminaMath-100k로 학습한 모델보다 LIMO-800이 더 높은 성능을 보임. 특히 NuminaMath-100k는 평균 32.3%, OpenThoughts-114k는 58.3%인 반면 LIMO는 평균 &lt;b&gt;78.1%&lt;/b&gt;를 기록함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;OOD 일반화&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;OlympiadBench, CHMath, Gaokao, Kaoyan, GradeSchool, Minerva, GPQA 등에서도 강한 성능을 보여, 단순 benchmark memorization이 아니라 어느 정도 일반화된 reasoning behavior를 유도했음을 주장함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 56px;&quot;&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;&lt;b&gt;Ablation 1: Reasoning chain 품질&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 56px;&quot;&gt;같은 문제라도 낮은 품질의 풀이보다 높은 품질의 풀이로 학습한 모델이 AIME24와 MATH500에서 더 좋은 성능을 보임. 즉, 정답 여부뿐 아니라 &lt;b&gt;풀이 과정의 질&lt;/b&gt;이 중요함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Ablation 2: 문제 난이도&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Simple-500, Complex-500, Advanced-500 비교에서 어려운 문제로 학습할수록 AIME24 성능이 상승함. &lt;br /&gt;어려운 문제가 더 깊은 reasoning pattern을 유도한다는 것을 보임&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Ablation 3: Base model 지식&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Qwen1.5-32B-Chat보다 Qwen2.5-32B-Instruct에서 LIMO 효과가 훨씬 크게 나타남. &lt;br /&gt;이는 LIMO가 약한 모델에 지식을 새로 넣는 방식이 아니라, &lt;b&gt;이미 강한 pretraining knowledge를 가진 모델의 능력을 끌어내는 방식&lt;/b&gt;임을 보여줌&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Ablation 4: 모델 크기&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;3B, 7B, 14B, 32B, 72B 비교에서 모델 크기가 커질수록 특히 AIME24 성능이 크게 향상됨. &lt;br /&gt;다만 32B 이후에는 성능 향상이 완만해짐&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Ablation 5: 데이터 수&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;400개만으로도 AIME24가 16.5%에서 57.5%로 크게 상승하며, 800개 이후에는 성능 향상이 점차 완만해짐. &lt;br /&gt;이는 고품질 데이터의 효과가 초반에 매우 크다는 것을 의미함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;핵심 기여&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;① reasoning SFT에서도 &amp;ldquo;quality over quantity&amp;rdquo;가 성립함을 보임 &lt;br /&gt;② LIMO Hypothesis 제안 &lt;br /&gt;③ 800개 데이터만으로 강한 수학 추론 성능 달성 &lt;br /&gt;④ 문제 난이도와 reasoning chain 품질의 중요성을 실험적으로 검증&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;한계점&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;강한 base model과 강한 teacher model에 의존함. 최종 데이터는 800개지만 후보 문제 필터링과 풀이 생성 과정은 비용이 큼. &lt;br /&gt;또한 실험이 주로 수학 reasoning에 집중되어 있어 코드, 법률, 과학, 에이전트 planning 등으로의 일반화는 추가 검증이 필요함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;연구적 의의&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;이 논문은 reasoning post-training을 대규모 데이터 학습 문제가 아니라, &lt;b&gt;pretrained model 내부의 latent reasoning ability를 어떤 예시로 활성화할 것인가의 문제&lt;/b&gt;로 재정의함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;최종 결론&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;LIMO는 &amp;ldquo;많은 데이터가 항상 좋은 reasoning model을 만드는 것은 아니다&amp;rdquo;라는 점을 강하게 보여준다. 충분히 강한 foundation model에서는 &lt;b&gt;어려운 문제 + 고품질 long reasoning trace + 소수 SFT&lt;/b&gt;만으로도 경쟁력 있는 reasoning 성능을 얻을 수 있다&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1218</guid>
      <comments>https://yoonschallenge.tistory.com/1218#entry1218comment</comments>
      <pubDate>Thu, 14 May 2026 00:29:10 +0900</pubDate>
    </item>
    <item>
      <title>s1: Simple test-time scaling</title>
      <link>https://yoonschallenge.tistory.com/1217</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2501.19393&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2501.19393&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1778681737703&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;s1: Simple test-time scaling&quot; data-og-description=&quot;Test-time scaling is a promising new approach to language modeling that uses extra test-time compute to improve performance. Recently, OpenAI's o1 model showed this capability but did not publicly share its methodology, leading to many replication efforts.&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2501.19393&quot; data-og-url=&quot;https://arxiv.org/abs/2501.19393v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/cnPQ7h/dJMb9dHs13D/pAzDN7NbFDMpWTAd9Awn01/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/qUyhm/dJMb83SnPKe/0KuYALESl8CkmGiMzfsrAk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2501.19393&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2501.19393&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/cnPQ7h/dJMb9dHs13D/pAzDN7NbFDMpWTAd9Awn01/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/qUyhm/dJMb83SnPKe/0KuYALESl8CkmGiMzfsrAk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;s1: Simple test-time scaling&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Test-time scaling is a promising new approach to language modeling that uses extra test-time compute to improve performance. Recently, OpenAI's o1 model showed this capability but did not publicly share its methodology, leading to many replication efforts.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 논문은 RL 없이도 1000개의 reasoning trace로 sft하고, 추론 시 모델의 생각 길이를 강제로 조절하는 budget forcing을 적용하여 작은 비용으로도 test-time scaling이 가능한 reasoning model을 만들 수 있음을 보였습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;908&quot; data-origin-height=&quot;544&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bd3Fmr/dJMcaiXziq9/uvdhakkkNAmsMqlFJFGmr0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bd3Fmr/dJMcaiXziq9/uvdhakkkNAmsMqlFJFGmr0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bd3Fmr/dJMcaiXziq9/uvdhakkkNAmsMqlFJFGmr0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbd3Fmr%2FdJMcaiXziq9%2FuvdhakkkNAmsMqlFJFGmr0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;908&quot; height=&quot;544&quot; data-origin-width=&quot;908&quot; data-origin-height=&quot;544&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;token이 늘어날수록 정답률이 오르는 것을 볼 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1411&quot; data-origin-height=&quot;628&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c7AwvE/dJMcaiXzirh/wm1N8jqyM29ZtZb7v1VCv0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c7AwvE/dJMcaiXzirh/wm1N8jqyM29ZtZb7v1VCv0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c7AwvE/dJMcaiXzirh/wm1N8jqyM29ZtZb7v1VCv0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc7AwvE%2FdJMcaiXzirh%2Fwm1N8jqyM29ZtZb7v1VCv0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1411&quot; height=&quot;628&quot; data-origin-width=&quot;1411&quot; data-origin-height=&quot;628&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;16개의 소스에서 퀄리티, 난이도, 분포를 조절하여 1000개의 문제를 골라냄&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그 데이터를 통해 Qwen 2.5 32B instruct model에 sft를 진ㄷ행함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;871&quot; data-origin-height=&quot;807&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/1eRfY/dJMcadBU6gs/ZdO7TdnF9CJVfwBbeJfrOk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/1eRfY/dJMcadBU6gs/ZdO7TdnF9CJVfwBbeJfrOk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/1eRfY/dJMcadBU6gs/ZdO7TdnF9CJVfwBbeJfrOk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F1eRfY%2FdJMcadBU6gs%2FZdO7TdnF9CJVfwBbeJfrOk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;871&quot; height=&quot;807&quot; data-origin-width=&quot;871&quot; data-origin-height=&quot;807&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;thinking을 짧게 만들기 위해서는 일정 버짓을 넘어가면 엔드 띵크 토큰을 넣고, 길게 만들기 위해서는 엔드 토큰이 나올 때 wait를 통해 reasoning trace를 늘림.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1381&quot; data-origin-height=&quot;754&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/H2XLA/dJMcaiww2CL/FFfYoKHiS5rFUzLx8FGKQ0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/H2XLA/dJMcaiww2CL/FFfYoKHiS5rFUzLx8FGKQ0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/H2XLA/dJMcaiww2CL/FFfYoKHiS5rFUzLx8FGKQ0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FH2XLA%2FdJMcaiww2CL%2FFFfYoKHiS5rFUzLx8FGKQ0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1381&quot; height=&quot;754&quot; data-origin-width=&quot;1381&quot; data-origin-height=&quot;754&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;AIME24, MATH500, GPQA Diamond 벤치마크에서 평가하고, 성능이 크게 오름.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;585&quot; data-origin-height=&quot;833&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dUWTjh/dJMcafzQicK/K2n0dCWawsRek6UnFeR6nk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dUWTjh/dJMcafzQicK/K2n0dCWawsRek6UnFeR6nk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dUWTjh/dJMcafzQicK/K2n0dCWawsRek6UnFeR6nk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdUWTjh%2FdJMcafzQicK%2FK2n0dCWawsRek6UnFeR6nk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;585&quot; height=&quot;833&quot; data-origin-width=&quot;585&quot; data-origin-height=&quot;833&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;r1distill보다는 성능이 낮은데 데이터의 차이를 말함.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;592&quot; data-origin-height=&quot;656&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Y3eXI/dJMcagrXAXX/aT8FxCgekOkuKFgZjocJf0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Y3eXI/dJMcagrXAXX/aT8FxCgekOkuKFgZjocJf0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Y3eXI/dJMcagrXAXX/aT8FxCgekOkuKFgZjocJf0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FY3eXI%2FdJMcagrXAXX%2FaT8FxCgekOkuKFgZjocJf0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;592&quot; height=&quot;656&quot; data-origin-width=&quot;592&quot; data-origin-height=&quot;656&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;고품질 데이터의 중요성을 말함.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;585&quot; data-origin-height=&quot;479&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cRxHRp/dJMcadooMJJ/lxITAObzUdVHwcMyZK7ji0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cRxHRp/dJMcadooMJJ/lxITAObzUdVHwcMyZK7ji0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cRxHRp/dJMcadooMJJ/lxITAObzUdVHwcMyZK7ji0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcRxHRp%2FdJMcadooMJJ%2FlxITAObzUdVHwcMyZK7ji0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;585&quot; height=&quot;479&quot; data-origin-width=&quot;585&quot; data-origin-height=&quot;479&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰수 제한을 거는 것은 컨트롤이 어려웠음.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;687&quot; data-origin-height=&quot;868&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b2N0Sp/dJMcabjVH3x/kISp6WkPhCwLUJFIKjE79k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b2N0Sp/dJMcabjVH3x/kISp6WkPhCwLUJFIKjE79k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b2N0Sp/dJMcabjVH3x/kISp6WkPhCwLUJFIKjE79k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb2N0Sp%2FdJMcabjVH3x%2FkISp6WkPhCwLUJFIKjE79k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;687&quot; height=&quot;868&quot; data-origin-width=&quot;687&quot; data-origin-height=&quot;868&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;552&quot; data-origin-height=&quot;869&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cf4Zqy/dJMcah5vpxh/bpVy2O8eM1YvOIKttJXcw1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cf4Zqy/dJMcah5vpxh/bpVy2O8eM1YvOIKttJXcw1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cf4Zqy/dJMcah5vpxh/bpVy2O8eM1YvOIKttJXcw1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcf4Zqy%2FdJMcah5vpxh%2FbpVy2O8eM1YvOIKttJXcw1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;552&quot; height=&quot;869&quot; data-origin-width=&quot;552&quot; data-origin-height=&quot;869&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 938px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;핵심 질문&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;OpenAI o1처럼 &lt;b&gt;test-time compute를 늘릴수록 reasoning 성능이 좋아지는 모델&lt;/b&gt;을 대규모 RL 없이 단순한 방식으로 만들 수 있는가?&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;문제의식&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;기존 o1/R1-style reasoning model은 강력하지만, 방법론이 비공개이거나 대규모 RL&amp;middot;대량 데이터&amp;middot;복잡한 multi-stage training에 의존함. &lt;br /&gt;저자들은 가장 단순한 recipe로 test-time scaling을 재현하려 함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;핵심 아이디어&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;잘 선별한 1,000개 reasoning trace로 SFT&lt;/b&gt;하고, 추론 시 &lt;b&gt;budget forcing&lt;/b&gt;으로 thinking token 길이를 강제로 조절하면 강한 reasoning 성능과 test-time scaling이 가능함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;데이터셋&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;s1K&lt;/b&gt;: 59,029개 후보 문제에서 최종 1,000개만 선별. Gemini Flash Thinking으로 reasoning trace와 solution을 생성함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;데이터 선별 기준&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;&lt;b&gt;Quality, Difficulty, Diversity&lt;/b&gt; 세 기준 사용. &lt;br /&gt;① 포맷 오류&amp;middot;저품질 샘플 제거, &lt;br /&gt;② Qwen2.5-7B/32B가 맞힌 쉬운 문제 제거, &lt;br /&gt;③ Claude로 domain 분류 후 다양한 분야에서 sampling.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;학습 모델&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Qwen2.5-32B-Instruct&lt;/b&gt;를 base model로 사용하여 s1K에 대해 supervised fine-tuning 수행. &lt;br /&gt;결과 모델은 &lt;b&gt;s1-32B&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;학습 방식&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Next-token prediction 기반 SFT. &lt;br /&gt;질문에는 loss를 주지 않고, reasoning trace와 final answer에만 loss 적용.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;학습 비용&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;16 NVIDIA H100 GPU에서 약 &lt;b&gt;26분&lt;/b&gt;. &lt;br /&gt;총 5 epochs, 315 gradient steps.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;핵심 기법: Budget Forcing&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;모델의 thinking 길이를 decoding 단계에서 강제 조절하는 방법. &lt;br /&gt;너무 길면 end-of-thinking delimiter를 삽입해 종료시키고, 더 생각하게 만들고 싶으면 end-of-thinking을 막은 뒤 &quot;Wait&quot;를 삽입함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Budget Forcing의 효과&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;모델이 답을 끝내려 할 때 &quot;Wait&quot;를 넣으면 스스로 검토하거나 오류를 수정하는 경우가 생김. &lt;br /&gt;즉, 단순한 intervention으로 self-correction을 유도함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;평가 벤치마크&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;AIME24&lt;/b&gt;, &lt;b&gt;MATH500&lt;/b&gt;, &lt;b&gt;GPQA Diamond&lt;/b&gt;. 수학 경시, competition math, PhD-level 과학 reasoning 능력을 평가함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;주요 성능&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;s1-32B는 &lt;b&gt;AIME24 56.7&lt;/b&gt;, &lt;b&gt;MATH500 93.0&lt;/b&gt;, &lt;b&gt;GPQA Diamond 59.6&lt;/b&gt;을 달성. &lt;br /&gt;Base model Qwen2.5-32B-Instruct의 AIME24 26.7보다 크게 향상됨.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;비교 결과&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;1K 데이터만 사용했음에도 Sky-T1보다 강하고, 일부 benchmark에서 o1-preview와 경쟁 가능함. &lt;br /&gt;다만 DeepSeek-R1 계열보다는 낮음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Sample efficiency&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;s1-32B는 &lt;b&gt;1,000개 샘플만으로 강한 reasoning 성능&lt;/b&gt;을 얻었다는 점에서 sample-efficient reasoning model임. &lt;br /&gt;r1-distill은 약 800K 샘플을 사용한 반면 s1은 1K만 사용함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Ablation: 데이터&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;random 1K, diverse-only 1K, longest-only 1K보다 s1K가 전반적으로 우수함. &lt;br /&gt;즉, 단순히 많이 또는 길게 고르는 것이 아니라 &lt;b&gt;품질&amp;middot;난이도&amp;middot;다양성의 결합&lt;/b&gt;이 중요함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot;&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;Ablation: 59K 전체 학습&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;59K 전체를 학습해도 s1K 대비 큰 이득이 없음. &lt;br /&gt;이는 reasoning SFT에서 &lt;b&gt;데이터 양보다 선별 품질이 중요&lt;/b&gt;함을 시사함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Ablation: test-time scaling&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Token control, step control, class control, rejection sampling과 비교했을 때 &lt;b&gt;budget forcing이 control, scaling, performance 측면에서 가장 안정적&lt;/b&gt;임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;주요 한계&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Budget forcing을 과도하게 적용하면 반복 루프나 plateau가 발생함. &lt;br /&gt;Context window 한계가 있으며, 데이터가 Gemini distillation에 의존함. &lt;br /&gt;평가도 수학&amp;middot;과학 reasoning 중심이라 일반 task로의 확장성은 추가 검증 필요.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;논문의 의의&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;대규모 RL 없이도 &lt;b&gt;소량의 고품질 reasoning trace + 간단한 추론 제어&lt;/b&gt;만으로 test-time scaling behavior를 만들 수 있음을 보임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;연구적 해석&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;이 논문은 reasoning 능력이 base model 내부에 이미 어느 정도 잠재되어 있고, SFT는 이를 새로 학습한다기보다 &lt;b&gt;reasoning mode를 활성화&lt;/b&gt;하는 역할을 할 수 있음을 시사함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;후속 연구 방향&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;더 좋은 reasoning trace selection, RL 없이 가능한 reasoning activation의 한계, budget forcing보다 안정적인 compute controller, SFT 기반 reasoning과 RL 기반 reasoning의 차이 분석이 중요함.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1217</guid>
      <comments>https://yoonschallenge.tistory.com/1217#entry1217comment</comments>
      <pubDate>Thu, 14 May 2026 00:03:29 +0900</pubDate>
    </item>
    <item>
      <title>Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes</title>
      <link>https://yoonschallenge.tistory.com/1216</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2305.02301&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2305.02301&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1778516329012&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes&quot; data-og-description=&quot;Deploying large language models (LLMs) is challenging because they are memory inefficient and compute-intensive for practical applications. In reaction, researchers train smaller task-specific models by either finetuning with human labels or distilling usi&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2305.02301&quot; data-og-url=&quot;https://arxiv.org/abs/2305.02301v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bc0UDx/dJMb8RRWvVq/kMqiZL082ypHzmg9VTyW11/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/Ug4au/dJMb8Z3vYYY/fJeFNE4NANAbwCkT1s6gN0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2305.02301&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2305.02301&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bc0UDx/dJMb8RRWvVq/kMqiZL082ypHzmg9VTyW11/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/Ug4au/dJMb8Z3vYYY/fJeFNE4NANAbwCkT1s6gN0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Deploying large language models (LLMs) is challenging because they are memory inefficient and compute-intensive for practical applications. In reaction, researchers train smaller task-specific models by either finetuning with human labels or distilling usi&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;옛날 논문이라 이전의 지식들을 이야기 하긴 하지만 지금 사용하는 distill의 초창기겠네요&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;llm을 통해 step을 생성하고, 단순 정답만 학습하는게 아니라 그 step도 학습하여 더 높은 성능을 보여준다! 가 나옵니다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;623&quot; data-origin-height=&quot;598&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bETv0F/dJMcab5elNr/8SaukHNs4KnMMnuKSBlVO1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bETv0F/dJMcab5elNr/8SaukHNs4KnMMnuKSBlVO1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bETv0F/dJMcab5elNr/8SaukHNs4KnMMnuKSBlVO1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbETv0F%2FdJMcab5elNr%2F8SaukHNs4KnMMnuKSBlVO1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;623&quot; height=&quot;598&quot; data-origin-width=&quot;623&quot; data-origin-height=&quot;598&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이게 distilling step-by-step이 llm보다 쌘 것이 의아하긴 하지만 뭐 범용모델이 성능은 그렇게 좋지 않다는 것을 보여주는 것 같습니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1179&quot; data-origin-height=&quot;596&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ABNwZ/dJMcafmhwZj/kbsY3vu2Xs7urv43LpSeW0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ABNwZ/dJMcafmhwZj/kbsY3vu2Xs7urv43LpSeW0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ABNwZ/dJMcafmhwZj/kbsY3vu2Xs7urv43LpSeW0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FABNwZ%2FdJMcafmhwZj%2FkbsY3vu2Xs7urv43LpSeW0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1179&quot; height=&quot;596&quot; data-origin-width=&quot;1179&quot; data-origin-height=&quot;596&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CoT를 통해 추론 과정을 뽑고 작은 모델에 이걸 학습시킨다!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;근데 단순 Rationale + label 을 출력하도록 학습하는 것이 아닌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Rationale, label을 출력하도록 따로 따로 로스를 더해 학습함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;766&quot; data-origin-height=&quot;559&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dj6kA3/dJMcaiiYAeh/AHkGEoftKKOHkZ4xGycRl0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dj6kA3/dJMcaiiYAeh/AHkGEoftKKOHkZ4xGycRl0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dj6kA3/dJMcaiiYAeh/AHkGEoftKKOHkZ4xGycRl0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fdj6kA3%2FdJMcaiiYAeh%2FAHkGEoftKKOHkZ4xGycRl0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;766&quot; height=&quot;559&quot; data-origin-width=&quot;766&quot; data-origin-height=&quot;559&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Teacher는 540B PaLM이고, Student는 T5-Base 220M, T5-Large 770M, T5-XXL 11B가 사용되었습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;997&quot; data-origin-height=&quot;771&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bODkmA/dJMcajvpCYc/lKIXmwGSX4H5LNfWtwRUN0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bODkmA/dJMcajvpCYc/lKIXmwGSX4H5LNfWtwRUN0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bODkmA/dJMcajvpCYc/lKIXmwGSX4H5LNfWtwRUN0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbODkmA%2FdJMcajvpCYc%2FlKIXmwGSX4H5LNfWtwRUN0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;997&quot; height=&quot;771&quot; data-origin-width=&quot;997&quot; data-origin-height=&quot;771&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;더 적은 데이터로 standard fine-tuning을 능가하는 모습을 보여줬다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순 성능만을 올리는 것이 아니라 데이터 요구량 자체를 줄였습니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;라벨이 없는 경우에도 PaLM이 생성한 라벨과 출력물을 통해 학습할 수 있었다.- 여기서도 적은 데이터로 높은 성능을 가질 수 있었음&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;891&quot; data-origin-height=&quot;767&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/liATp/dJMcagk9Nsv/8akxpUqIuquhVLkJKekecK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/liATp/dJMcagk9Nsv/8akxpUqIuquhVLkJKekecK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/liATp/dJMcagk9Nsv/8akxpUqIuquhVLkJKekecK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FliATp%2FdJMcagk9Nsv%2F8akxpUqIuquhVLkJKekecK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;891&quot; height=&quot;767&quot; data-origin-width=&quot;891&quot; data-origin-height=&quot;767&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;작은 모델이 큰 모델의 CoT를 뛰어 넘는 것을 볼 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;881&quot; data-origin-height=&quot;709&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dlcrQa/dJMcagrVOLe/9oJPepN3B1yR60ZAykFCzK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dlcrQa/dJMcagrVOLe/9oJPepN3B1yR60ZAykFCzK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dlcrQa/dJMcagrVOLe/9oJPepN3B1yR60ZAykFCzK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdlcrQa%2FdJMcagrVOLe%2F9oJPepN3B1yR60ZAykFCzK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;881&quot; height=&quot;709&quot; data-origin-width=&quot;881&quot; data-origin-height=&quot;709&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모델 사이즈가.... 흠&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;지금은 모델 성능이 워낙 좋아서 이 때랑 비교가 안 될 것 같기도 하고요&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;883&quot; data-origin-height=&quot;273&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bAp38I/dJMcadPsebW/VFqQIUxeDOGyNhMi3LYolK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bAp38I/dJMcadPsebW/VFqQIUxeDOGyNhMi3LYolK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bAp38I/dJMcadPsebW/VFqQIUxeDOGyNhMi3LYolK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbAp38I%2FdJMcadPsebW%2FVFqQIUxeDOGyNhMi3LYolK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;883&quot; height=&quot;273&quot; data-origin-width=&quot;883&quot; data-origin-height=&quot;273&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 문제&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;대형 LLM은 few-shot / CoT 성능이 뛰어나지만, 모델 크기&amp;middot;GPU 메모리&amp;middot;추론 비용 때문에 실제 배포가 어렵다. 반면 작은 task-specific model은 배포는 쉽지만, 기존 fine-tuning이나 distillation 방식은 많은 학습 데이터가 필요하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;LLM을 단순히 pseudo-label 생성기로 쓰지 않고, &lt;b&gt;정답에 도달하는 rationale / reasoning step을 생성하는 teacher&lt;/b&gt;로 활용한다. 작은 모델은 label뿐 아니라 rationale도 함께 학습한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;제안 방법&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Distilling Step-by-Step&lt;/b&gt;: ① Few-shot CoT prompting으로 LLM에서 label과 rationale을 추출한다. &lt;br /&gt;② 작은 T5 모델을 multi-task learning으로 학습한다. 하나의 task는 label prediction, 다른 task는 rationale generation이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;학습 목적 함수&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;최종 loss는 L = L_label + &amp;lambda;L_rationale이다. 즉, 작은 모델이 정답을 맞히는 능력과 reasoning 과정을 생성하는 능력을 동시에 학습하도록 한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;중요한 설계 포인트&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Rationale을 &lt;b&gt;입력으로 넣지 않고 출력 supervision으로 사용&lt;/b&gt;한다. 따라서 추론 시에는 LLM이 필요 없고, 작은 모델이 label만 예측하면 된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;비교 대상&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Standard fine-tuning, standard task distillation, Few-shot CoT, PINTO tuning&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Teacher model&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;주로 &lt;b&gt;540B PaLM&lt;/b&gt;을 사용하고, ablation에서는 &lt;b&gt;20B GPT-NeoX&lt;/b&gt;도 사용한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Student model&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;T5-Base 220M, T5-Large 770M, T5-XXL 11B&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;사용 데이터셋&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;e-SNLI, ANLI, CommonsenseQA(CQA), SVAMP. &lt;br /&gt;각각 자연어 추론, adversarial NLI, 상식 질의응답, 수학 word problem을 평가한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 결과 1: 데이터 효율성&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;220M T5 기준, Distilling Step-by-Step은 standard fine-tuning보다 훨씬 적은 labeled data로 더 높은 성능을 낸다. &lt;br /&gt;e-SNLI에서는 전체 데이터의 12.5%만 사용해도 full-data fine-tuning을 능가한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 결과 2: Unlabeled distillation&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;라벨이 없는 경우에도 LLM이 생성한 pseudo-label과 rationale을 사용하면 standard task distillation보다 적은 unlabeled data로 더 좋은 성능을 달성한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 결과 3: 작은 모델로 LLM 능가&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Distilling Step-by-Step으로 학습한 작은 T5 모델이 540B PaLM Few-shot CoT를 여러 데이터셋에서 능가한다. &lt;br /&gt;예를 들어 e-SNLI에서는 220M T5가, ANLI와 SVAMP에서는 770M T5가 PaLM을 능가한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 결과 4: 최소 자원 분석&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;ANLI에서 770M T5가 80% 데이터만으로 540B PaLM Few-shot CoT를 능가한다. &lt;br /&gt;반면 standard fine-tuning은 100% 데이터를 사용해도 PaLM 성능을 맞추기 어렵다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Ablation 1: Teacher 크기&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;20B GPT-NeoX에서 추출한 rationale도 성능 향상을 제공하지만, 540B PaLM에서 추출한 rationale이 더 높은 성능을 낸다. 즉, teacher의 rationale quality가 중요하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Ablation 2: Multi-task의 중요성&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Rationale과 label을 하나의 sequence로 붙여 예측하는 single-task 방식은 일부 데이터셋에서 fine-tuning보다 나쁘다. &lt;br /&gt;반면 label prediction과 rationale generation을 분리한 multi-task 방식이 가장 안정적이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;논문의 핵심 기여&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;LLM의 지식을 단순 label이 아니라 &lt;b&gt;reasoning rationale 형태로 작은 모델에 압축&lt;/b&gt;했다. &lt;br /&gt;이를 통해 데이터 효율성과 배포 효율성을 동시에 개선했다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계점&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Few-shot CoT prompt 예시가 필요하고, teacher LLM의 rationale 품질에 성능이 의존한다. &lt;br /&gt;또한 복잡한 reasoning/planning task에서는 LLM rationale 자체가 부정확할 수 있으며, teacher의 bias가 student로 전이될 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;최종 결론&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;이 논문은 &lt;b&gt;&amp;ldquo;LLM의 답만 증류하지 말고, 답을 도출하는 reasoning 과정까지 증류하면 작은 모델도 적은 데이터로 대형 LLM을 능가할 수 있다&amp;rdquo;&lt;/b&gt;는 것을 실험적으로 보인 연구다. &lt;br /&gt;특히 test-time에는 작은 모델만 사용하면 되므로 실용적인 LLM compression / task-specific deployment 방법으로 의미가 크다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1216</guid>
      <comments>https://yoonschallenge.tistory.com/1216#entry1216comment</comments>
      <pubDate>Tue, 12 May 2026 02:04:54 +0900</pubDate>
    </item>
    <item>
      <title>Associative Recurrent Memory Transformer</title>
      <link>https://yoonschallenge.tistory.com/1215</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2407.04841&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2407.04841&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1778513340670&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Associative Recurrent Memory Transformer&quot; data-og-description=&quot;This paper addresses the challenge of creating a neural architecture for very long sequences that requires constant time for processing new information at each time step. Our approach, Associative Recurrent Memory Transformer (ARMT), is based on transforme&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2407.04841&quot; data-og-url=&quot;https://arxiv.org/abs/2407.04841v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/s30jN/dJMb84qdgrB/Iv6bcj9lql9H4TYSG499Z0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/daQiH3/dJMb88F9Anz/M3aZqW9lv9tikjANnrok20/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2407.04841&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2407.04841&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/s30jN/dJMb84qdgrB/Iv6bcj9lql9H4TYSG499Z0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/daQiH3/dJMb88F9Anz/M3aZqW9lv9tikjANnrok20/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Associative Recurrent Memory Transformer&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;This paper addresses the challenge of creating a neural architecture for very long sequences that requires constant time for processing new information at each time step. Our approach, Associative Recurrent Memory Transformer (ARMT), is based on transforme&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ICML 2024 Next Generation of Sequence Modeling Architectures Workshop 제출 논문인데 숏이네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;짧습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;긴 입력 전체를 attention으로 보지 말고 입력을 segment 단위로 처리하며 각 layer 마다 associative key-value memory를 축적하는 구조를 제안해 16k 토큰 만으로 50M 토큰까지 QA를 수행할 수 있음을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;접근&lt;/td&gt;
&lt;td&gt;장점&lt;/td&gt;
&lt;td&gt;한계&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Long-context Transformer 확장&lt;/td&gt;
&lt;td&gt;기존 Transformer 성능 유지&lt;/td&gt;
&lt;td&gt;attention cost, context window 한계&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RMT 계열 recurrent memory&lt;/td&gt;
&lt;td&gt;segment 단위 처리 가능&lt;/td&gt;
&lt;td&gt;memory token 수가 작아 저장 용량 제한&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Mamba/RWKV/SSM&lt;/td&gt;
&lt;td&gt;긴 시퀀스 효율적 처리&lt;/td&gt;
&lt;td&gt;key-value recall, copying, 사후 질문형 memory task에 약할 수 있음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RAG&lt;/td&gt;
&lt;td&gt;외부 검색으로 긴 문맥 우회&lt;/td&gt;
&lt;td&gt;여러 근거를 조합해야 하는 reasoning task에서 실패 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1213&quot; data-origin-height=&quot;582&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bOjlGg/dJMcab5elcs/VVIkUyMulESqk9pdj686t0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bOjlGg/dJMcab5elcs/VVIkUyMulESqk9pdj686t0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bOjlGg/dJMcab5elcs/VVIkUyMulESqk9pdj686t0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbOjlGg%2FdJMcab5elcs%2FVVIkUyMulESqk9pdj686t0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1213&quot; height=&quot;582&quot; data-origin-width=&quot;1213&quot; data-origin-height=&quot;582&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 RMT는 Segmen마다 memory token로 넘김&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ARMTsms 각 layer에서 memory token을 단순 전달하는 것이 아닌 이를 key-value association martix에 저장함&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;현재 segment 토큰들이 위 matrix에 query를 날려 과거 segment에서 축적된 정보를 가져와 입력에 활용&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;840&quot; data-origin-height=&quot;213&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/nFThO/dJMcafT7kcs/3MpTFllrsYF0vphZKkWxuK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/nFThO/dJMcafT7kcs/3MpTFllrsYF0vphZKkWxuK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/nFThO/dJMcafT7kcs/3MpTFllrsYF0vphZKkWxuK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FnFThO%2FdJMcafT7kcs%2F3MpTFllrsYF0vphZKkWxuK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;840&quot; height=&quot;213&quot; data-origin-width=&quot;840&quot; data-origin-height=&quot;213&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;각 memory token을 key-value pair로 바꾼 뒤 기존 memory matrix에 같은 key에 저장된 old value를 지우고, 새로운 value를 다시 쓰는 과정&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1211&quot; data-origin-height=&quot;641&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bkhvR8/dJMcabc3MAC/ZuUcnWRDTnZ8zE3HHXD4PK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bkhvR8/dJMcabc3MAC/ZuUcnWRDTnZ8zE3HHXD4PK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bkhvR8/dJMcabc3MAC/ZuUcnWRDTnZ8zE3HHXD4PK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbkhvR8%2FdJMcabc3MAC%2FZuUcnWRDTnZ8zE3HHXD4PK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1211&quot; height=&quot;641&quot; data-origin-width=&quot;1211&quot; data-origin-height=&quot;641&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ARMT가 RMT보다 훨씬 많은 key-value pair를 저장할 수 있었음&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1111&quot; data-origin-height=&quot;856&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/w8ODX/dJMcafmhwkh/aPoKeNx1wdnpKESinHxM21/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/w8ODX/dJMcafmhwkh/aPoKeNx1wdnpKESinHxM21/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/w8ODX/dJMcafmhwkh/aPoKeNx1wdnpKESinHxM21/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fw8ODX%2FdJMcafmhwkh%2FaPoKeNx1wdnpKESinHxM21%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1111&quot; height=&quot;856&quot; data-origin-width=&quot;1111&quot; data-origin-height=&quot;856&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;RMT와 Mamba는 학습 길이를 넘어가면 점진적으로 성능이 하락함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ARMT 는 긴 문맥을 버티는게 아닌 key-value 형태로 저장, 갱신, 검색에 강하다.&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 916px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 80px;&quot;&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;문제의식&lt;/td&gt;
&lt;td style=&quot;height: 80px;&quot;&gt;Transformer는 긴 입력을 처리할 때 self-attention 비용이 커지고, RMT류 recurrent memory는 segment-level 처리는 가능하지만 memory token 수가 제한되어 &lt;b&gt;장기 정보 저장 용량&lt;/b&gt;에 한계가 있음. &lt;br /&gt;Mamba/RWKV 같은 recurrent sequence model도 효율적이지만 key-value recall, 복사, 과거 정보 검색형 task에서 약점이 있을 수 있음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;핵심 목표&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;새로운 segment를 처리할 때 시간&amp;middot;공간 복잡도를 일정하게 유지하면서&lt;/b&gt;, 수백만~수천만 토큰 규모의 long-context에서 필요한 정보를 저장하고 회수할 수 있는 구조를 만드는 것.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;제안 방법&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;ARMT&lt;/b&gt;는 RMT에 &lt;b&gt;layer-wise associative memory&lt;/b&gt;를 추가한 구조.&amp;nbsp;&lt;br /&gt;현재 segment는 Transformer self-attention으로 처리하고, 과거 segment의 정보는 각 layer의 associative memory matrix에 key-value 형태로 저장함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;기존 RMT와 차이&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;RMT는 memory token을 다음 segment로 그대로 넘기는 방식에 가깝지만, ARMT는 memory token을 (k_i, v_i)로 변환해 associative matrix A_s^l에 저장함. &lt;br /&gt;즉, memory token을 단순 전달하지 않고 &lt;b&gt;검색 가능한 key-value memory&lt;/b&gt;로 구조화함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 58px;&quot;&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;Associative Block 역할&lt;/td&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;각 memory token m_i에서 key k_i, value v_i, 저장 강도 &lt;span&gt;&amp;beta;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;_i를 만들고, 이전 memory에서 같은 key의 old value \bar{v}_i를 읽은 뒤, v_i-\bar{v}_i를 통해 기존 값을 새 값으로 갱신함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;중요한 수식 직관&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;\bar{v}_i는 이전 memory에 저장된 old value이고, v_i-\bar{v}_i는 old value를 지우고 new value로 바꾸기 위한 delta임. &lt;span&gt;&amp;beta;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;_i는 저장 강도, &lt;span&gt;&lt;span&gt;&amp;gamma;&lt;/span&gt;&lt;/span&gt;_i는 normalization vector z_s^l가 같은 key를 과도하게 중복 누적하지 않도록 막는 correction term임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;핵심 기술적 포인트&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;ARMT는 단순히 정보를 누적하는 것이 아니라 &lt;b&gt;같은 key가 다시 등장하면 최신 value로 rewrite&lt;/b&gt;할 수 있음. &lt;br /&gt;이 때문에 긴 sequence에서 entity 상태, 위치, 속성처럼 시간에 따라 바뀌는 정보를 추적하는 데 유리함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;실험 1: Associative Retrieval&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;Remember task&lt;/b&gt;와 &lt;b&gt;Rewrite task&lt;/b&gt;를 사용. &lt;br /&gt;Remember는 unique key-value pair를 기억하는 능력을 평가하고, Rewrite는 같은 key가 여러 번 등장할 때 최신 value를 기억하는 능력을 평가함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;Associative Retrieval 결과&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;ARMT는 RMT보다 훨씬 많은 key-value pair를 저장했고, PRMT ablation이 큰 개선을 보이지 않아 성능 향상의 핵심이 단순 layer-wise memory가 아니라 &lt;b&gt;associative memory matrix&lt;/b&gt;임을 보임. &lt;br /&gt;Rewrite task에서는 50 pair로 학습했지만 500 update에서도 정확한 recall을 유지해 약 10배 길이 일반화를 보임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;실험 2: BABILong&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;BABILong은 긴 context 안의 fact와 distractor sentence 중 필요한 정보를 찾아 QA를 수행하는 benchmark. QA1은 single supporting fact, QA2~QA5는 여러 supporting facts 또는 relation reasoning을 요구함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;BABILong 주요 결과&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;GPT-2 137M 기반에 ARMT를 적용한 145M 모델이 &lt;b&gt;16K tokens로 학습&lt;/b&gt;했음에도 QA1에서 &lt;b&gt;50M tokens까지 평가&lt;/b&gt;됨. &lt;br /&gt;best model 기준 50M tokens에서 79.9% accuracy를 기록했고, QA2~QA5에서도 10M tokens까지 강한 성능을 보임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;비교 모델 대비 성능&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;ARMT는 RMT, Mamba, GPT-4 few-shot, GPT-4+RAG 대비 BABILong의 장문 QA에서 대체로 우수한 성능을 보임. &lt;br /&gt;특히 500K~10M token 구간에서 다섯 개 QA task 전반에 걸쳐 가장 안정적인 성능을 보인 구조로 제시됨.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 98px;&quot;&gt;
&lt;td style=&quot;height: 98px;&quot;&gt;주요 기여&lt;/td&gt;
&lt;td style=&quot;height: 98px;&quot;&gt;1) RMT에 associative memory를 결합한 ARMT 제안, &lt;br /&gt;2) key-value memory capacity 향상, &lt;br /&gt;3) memory rewrite operation에 강한 구조 제시, &lt;br /&gt;4) 16K 학습 후 최대 50M token까지 extrapolation, &lt;br /&gt;5) BABILong에서 long-context QA 성능 기록 제시.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;한계점&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;Segment를 순차 처리해야 하므로 병렬화가 제한적임. 300K 이하 short/medium context에서는 Mamba/RWKV보다 느릴 수 있음. &lt;br /&gt;또한 Wikitext-103 language modeling 실험에서는 ARMT가 RMT와 유사한 수준에 머물러, 일반 LM 성능 개선 구조로는 아직 충분히 검증되지 않음. 실험도 137M~145M 규모라 대형 LLM scaling 검증이 필요함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;연구적 의미&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;이 논문은 long-context 문제를 단순히 context window 확장으로 해결하려는 것이 아니라, &lt;b&gt;task-relevant 정보를 recurrent associative memory에 저장하고 필요할 때 회수하는 방향&lt;/b&gt;을 제안함. &lt;br /&gt;즉, &amp;ldquo;긴 attention&amp;rdquo;보다 &amp;ldquo;구조화된 장기 memory&amp;rdquo;가 중요하다는 관점을 보여줌.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;최종 평가&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;ARMT는 일반 언어모델링 대체재라기보다, &lt;b&gt;초장문 context에서 sparse fact를 저장&amp;middot;갱신&amp;middot;회수하는 memory-augmented Transformer 구조&lt;/b&gt;로 보는 것이 타당함. &lt;br /&gt;장기 기억, entity tracking, long-context QA, multi-segment evidence retrieval 연구에 중요한 참고점이 있음.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1215</guid>
      <comments>https://yoonschallenge.tistory.com/1215#entry1215comment</comments>
      <pubDate>Tue, 12 May 2026 01:10:29 +0900</pubDate>
    </item>
    <item>
      <title>Adapting Language Models to Compress Contexts</title>
      <link>https://yoonschallenge.tistory.com/1214</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2305.14788&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2305.14788&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1778336718736&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Adapting Language Models to Compress Contexts&quot; data-og-description=&quot;Transformer-based language models (LMs) are powerful and widely-applicable tools, but their usefulness is constrained by a finite context window and the expensive computational cost of processing long text documents. We propose to adapt pre-trained LMs int&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2305.14788&quot; data-og-url=&quot;https://arxiv.org/abs/2305.14788v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/ewfuKc/dJMb83kxloO/dpXMmnhjo2DeFa7pbSrUaK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/RICq4/dJMb87N0WZK/4ebR86FxsgKkqwuFniXCn0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2305.14788&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2305.14788&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/ewfuKc/dJMb83kxloO/dpXMmnhjo2DeFa7pbSrUaK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/RICq4/dJMb87N0WZK/4ebR86FxsgKkqwuFniXCn0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Adapting Language Models to Compress Contexts&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Transformer-based language models (LMs) are powerful and widely-applicable tools, but their usefulness is constrained by a finite context window and the expensive computational cost of processing long text documents. We propose to adapt pre-trained LMs int&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 논문도 llm의 제한된 context window, long context 리소스가 많이 드는 것을 말한다. 그리고 같은 문서나 페세지를 여러 번 쓸 때 전체 텍스트를 다시 attention 하는 것도 비효율로 본다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 긴 텍스트를 짧은 softprompt 형태의 summary vector로 압축하는 방식으로 해결하려고 함.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;881&quot; data-origin-height=&quot;721&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/FBF6C/dJMcafzNdGa/bnaPKahrhodqHRlSJayJZ1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/FBF6C/dJMcafzNdGa/bnaPKahrhodqHRlSJayJZ1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/FBF6C/dJMcafzNdGa/bnaPKahrhodqHRlSJayJZ1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FFBF6C%2FdJMcafzNdGa%2FbnaPKahrhodqHRlSJayJZ1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;881&quot; height=&quot;721&quot; data-origin-width=&quot;881&quot; data-origin-height=&quot;721&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;긴 문서를 여러 segment로 나누고, 각 segment를 처리한 뒤 summary token 위치의 hidden state를 summary vector 로 활용해 이 것을 soft prompt 처럼 사용함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 것을 다 이어 붙여서 활용하네요&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 90px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&amp;nbsp;&lt;/td&gt;
&lt;td&gt;Recurrent Memory Transformer&lt;/td&gt;
&lt;td&gt;AutoCompressor&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;메모리 전달&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;직전 segment summary만 전달&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;모든 이전 segment의 summary를 누적&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;정보 경로&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;(S_{i-1} &amp;rarr; S_i) 중심&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;(S_1, ..., S_{i-1} &amp;rarr;S_i) 직접 접근&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;긴 문맥 유지&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;장거리 정보 손실 가능&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;summary accumulation으로 장거리 정보 유지 강화&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;학습 segment&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;고정 segment 위주&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;randomized segmenting 사용&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;677&quot; data-origin-height=&quot;685&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/0FLT9/dJMcaaZwGV1/O7W2mtkP3LKnZX7stkODk1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/0FLT9/dJMcaaZwGV1/O7W2mtkP3LKnZX7stkODk1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/0FLT9/dJMcaaZwGV1/O7W2mtkP3LKnZX7stkODk1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F0FLT9%2FdJMcaaZwGV1%2FO7W2mtkP3LKnZX7stkODk1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;677&quot; height=&quot;685&quot; data-origin-width=&quot;677&quot; data-origin-height=&quot;685&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;잘 보이진 않는데 Auto compressor가 ppl도 낮은 장점을 가지고 있네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1387&quot; data-origin-height=&quot;434&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/crPePg/dJMcabqDcOP/2Nf2KO42eXHYuPdJjclpe0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/crPePg/dJMcabqDcOP/2Nf2KO42eXHYuPdJjclpe0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/crPePg/dJMcabqDcOP/2Nf2KO42eXHYuPdJjclpe0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcrPePg%2FdJMcabqDcOP%2F2Nf2KO42eXHYuPdJjclpe0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1387&quot; height=&quot;434&quot; data-origin-width=&quot;1387&quot; data-origin-height=&quot;434&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;671&quot; data-origin-height=&quot;614&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/0HL7b/dJMcabqDcOX/0mVYI9oGT2k6I0k6uCbjyk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/0HL7b/dJMcabqDcOX/0mVYI9oGT2k6I0k6uCbjyk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/0HL7b/dJMcabqDcOX/0mVYI9oGT2k6I0k6uCbjyk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F0HL7b%2FdJMcabqDcOX%2F0mVYI9oGT2k6I0k6uCbjyk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;671&quot; height=&quot;614&quot; data-origin-width=&quot;671&quot; data-origin-height=&quot;614&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1364&quot; data-origin-height=&quot;495&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cwqzDJ/dJMcadu7IBP/9OVGm4v7Fe5j49reHANOz0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cwqzDJ/dJMcadu7IBP/9OVGm4v7Fe5j49reHANOz0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cwqzDJ/dJMcadu7IBP/9OVGm4v7Fe5j49reHANOz0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcwqzDJ%2FdJMcadu7IBP%2F9OVGm4v7Fe5j49reHANOz0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1364&quot; height=&quot;495&quot; data-origin-width=&quot;1364&quot; data-origin-height=&quot;495&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;570&quot; data-origin-height=&quot;834&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bdrOEe/dJMcaiXwoms/asFUoOXkaxfRH5dlFatQS0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bdrOEe/dJMcaiXwoms/asFUoOXkaxfRH5dlFatQS0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bdrOEe/dJMcaiXwoms/asFUoOXkaxfRH5dlFatQS0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbdrOEe%2FdJMcaiXwoms%2FasFUoOXkaxfRH5dlFatQS0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;570&quot; height=&quot;834&quot; data-origin-width=&quot;570&quot; data-origin-height=&quot;834&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 668px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;핵심 문제&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Transformer LM은 context window가 제한되어 있고, 긴 문서를 full attention으로 처리하면 계산/메모리 비용이 큼. 따라서 긴 문맥을 더 짧고 재사용 가능한 형태로 압축할 필요가 있음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;핵심 아이디어&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;사전학습 LM을 &lt;b&gt;AutoCompressor&lt;/b&gt;로 fine-tuning하여 긴 문맥을 &lt;b&gt;summary vectors&lt;/b&gt;라는 짧은 continuous soft prompt로 압축함. 이 summary vectors는 이후 segment나 downstream task에서 문맥 대체재처럼 사용됨.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;방법론&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;긴 문서를 여러 segment로 나눈 뒤, 각 segment 뒤에 &amp;lt;Sum&amp;gt; token을 붙임. 모델은 &amp;lt;Sum&amp;gt; 위치의 hidden state를 summary vector로 만들고, 다음 segment 입력 앞에 이 vector들을 soft prompt처럼 붙여 다음 토큰을 예측함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;기존 RMT와 차이&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;기존 RMT는 주로 직전 segment의 memory만 넘기는 구조인 반면, AutoCompressor는 &lt;b&gt;summary accumulation&lt;/b&gt;을 통해 이전 모든 segment의 summary vectors를 누적하여 다음 segment에 제공함. 이로써 장거리 정보 보존이 더 좋아짐.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;학습 objective&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;별도 human summary나 supervised label 없이 &lt;b&gt;language modeling loss&lt;/b&gt;만 사용함. 즉, 이전 segment summary가 다음 segment 토큰 예측에 도움이 되도록 학습됨.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;추가 학습 기법&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;Randomized segmenting&lt;/b&gt;으로 다양한 길이의 문맥 압축에 강건하게 만들고, &lt;b&gt;stop-gradient&lt;/b&gt;를 사용해 2 compression step 이후 gradient를 끊어 GPU 메모리 사용량을 줄임. Llama-2 실험에서는 LoRA를 활용함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;실험 모델&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;OPT-1.3B, OPT-2.7B, Llama-2-7B 기반 AutoCompressor를 학습함. OPT는 최대 30,720-token sequence까지, Llama-2는 6,144-token sequence까지 실험함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Long-context LM 결과&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;AutoCompressor는 6,144 tokens를 150 summary vectors로 압축해 perplexity를 개선했고, RMT보다 일관되게 좋은 성능을 보임. 30K-token 실험에서도 28K context를 활용해 perplexity를 낮춤.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Llama-2 결과&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Llama-2-7B AutoCompressor는 4,096-token context를 100 summary vectors로 압축했을 때 Extended Full Attention의 512-token plain text context와 유사한 perplexity를 달성함. 다만 full attention보다 완전한 정보 보존은 부족함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 58px;&quot;&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;In-context Learning 결과&lt;/td&gt;
&lt;td style=&quot;height: 58px;&quot;&gt;Demonstration을 summary vectors로 압축해 ICL에 사용했을 때, 11개 task 중 8개에서 150-token plain-text ICL보다 높은 성능을 보임. 일부 task에서는 750-token plain-text demonstration보다도 좋은 결과를 보임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Retrieval 활용&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;대규모 corpus의 passage를 미리 summary vectors로 압축해 저장한 뒤 retrieval-augmented LM과 passage re-ranking에 사용함. Fused summary vectors는 효율성과 성능의 trade-off에서 좋은 결과를 보임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;주요 공헌&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;① 사전학습 LM을 context compressor로 변환하는 방법 제안 ② summary accumulation으로 장거리 정보 유지 개선 ③ LM loss만으로 unsupervised compression 학습 ④ ICL, RAG, re-ranking에서 summary vectors의 활용 가능성 입증&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;핵심 한계&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Summary vectors가 full attention이 접근하는 원문 정보를 완전히 보존하지 못함. 모델 규모도 OPT-2.7B, Llama-2-7B 수준에 제한됨. summary vector 수를 늘려도 항상 성능이 좋아지지 않음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;연구적 의미&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;이 논문은 long-context 문제를 단순히 attention 구조 확장으로 해결하지 않고, &lt;b&gt;문맥을 continuous memory로 압축해 재사용하는 방향&lt;/b&gt;을 제시함. Long-CoT compression, memory-augmented LM, efficient RAG, privacy-preserving representation 연구와 연결 가능성이 큼.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;한 줄 평가&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;AutoCompressor는 긴 문맥을 latent soft prompt로 압축하여 context window 확장과 inference 비용 절감을 동시에 노린 실용적 long-context adaptation 방법이다.&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1214</guid>
      <comments>https://yoonschallenge.tistory.com/1214#entry1214comment</comments>
      <pubDate>Sun, 10 May 2026 01:27:08 +0900</pubDate>
    </item>
    <item>
      <title>LCIRC: A Recurrent Compression Approach for Efficient Long-form Context and Query Dependent Modeling in LLMs</title>
      <link>https://yoonschallenge.tistory.com/1213</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.06139&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2502.06139&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1778145412394&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;LCIRC: A Recurrent Compression Approach for Efficient Long-form Context and Query Dependent Modeling in LLMs&quot; data-og-description=&quot;While large language models (LLMs) excel in generating coherent and contextually rich outputs, their capacity to efficiently handle long-form contexts is limited by fixed-length position embeddings. Additionally, the computational cost of processing long s&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2502.06139&quot; data-og-url=&quot;https://arxiv.org/abs/2502.06139v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/btPd4T/dJMb887cWVn/tkjvtabUItooccvt811WN1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/b0CQGW/dJMb84qcLTy/8AQOZsCi4oNkq7CjA193CK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.06139&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2502.06139&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/btPd4T/dJMb887cWVn/tkjvtabUItooccvt811WN1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/b0CQGW/dJMb84qcLTy/8AQOZsCi4oNkq7CjA193CK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;LCIRC: A Recurrent Compression Approach for Efficient Long-form Context and Query Dependent Modeling in LLMs&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;While large language models (LLMs) excel in generating coherent and contextually rich outputs, their capacity to efficiently handle long-form contexts is limited by fixed-length position embeddings. Additionally, the computational cost of processing long s&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 transformer는 고정된 context window, quadratic attention cost(attention은 입력 길이가 길 수록 계산량이 제곱으로 늘어남)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순 RoPE를 확장하거나, full attention window를 늘리는 방식은 계산 비용이 크고, sparse attention, prompt compression은 정보 손실 및 길이 확장 한계가 있음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 긴 context를 전부 attention하지 말고 필요한 정보만 compact representation으로 압축해 llm에 주입하자!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1300&quot; data-origin-height=&quot;734&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/FKmJq/dJMcahRQvLc/3PZA1eXj5RhvckDNLcWilK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/FKmJq/dJMcahRQvLc/3PZA1eXj5RhvckDNLcWilK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/FKmJq/dJMcahRQvLc/3PZA1eXj5RhvckDNLcWilK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FFKmJq%2FdJMcahRQvLc%2F3PZA1eXj5RhvckDNLcWilK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1300&quot; height=&quot;734&quot; data-origin-width=&quot;1300&quot; data-origin-height=&quot;734&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1. Recurrent Context Compression&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;긴 Context를 Segment 단위로 나누고 Perceiver 기반 Compressor로 순차 압축&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉 입력 길이가 n이고 llm의 입력 가능한 길이가 m이라면 n-m만큼 잘리게 되니 긴 context를 나누고, perceiver module를 통해 반복적으로 압축&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;672&quot; data-origin-height=&quot;738&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cpgJLh/dJMcaiDd4o3/w35J2waCj6XBWLvpUndsLK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cpgJLh/dJMcaiDd4o3/w35J2waCj6XBWLvpUndsLK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cpgJLh/dJMcaiDd4o3/w35J2waCj6XBWLvpUndsLK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcpgJLh%2FdJMcaiDd4o3%2Fw35J2waCj6XBWLvpUndsLK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;672&quot; height=&quot;738&quot; data-origin-width=&quot;672&quot; data-origin-height=&quot;738&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2. Compressed Context Injection&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;압축된 Representation을 기존 llm layer에 gated cross attention으로 주입&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;llm은 학습하지 않고, compressor와 추가 module만 학습.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;QD-LCIRC는 쿼리 임베딩을 통해 긴 문서 전체를 무작정 압축하는 것이 아니라 질문에 따라 중요한 정보가 압축 representation에 더 들어가도록 유도함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1326&quot; data-origin-height=&quot;828&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dfZNxJ/dJMcabc0OVb/s5QH0iotIH8cgHdGX1opKK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dfZNxJ/dJMcabc0OVb/s5QH0iotIH8cgHdGX1opKK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dfZNxJ/dJMcabc0OVb/s5QH0iotIH8cgHdGX1opKK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdfZNxJ%2FdJMcabc0OVb%2Fs5QH0iotIH8cgHdGX1opKK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1326&quot; height=&quot;828&quot; data-origin-width=&quot;1326&quot; data-origin-height=&quot;828&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;일반 BPTT는 모든 recurrent timestep에 gradient를 보내야 하므로 긴 context에는 비현실적&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Truncated BPTT는 마지막 타입스텝만 학습하므로 과거 segment에 대한 모델링이 약해질 수 있음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Selective BPTT는 일부 타임스탭을 랜덤하게 학습해 긴 context에서도 효율적으로 장기 의존 정보를 학습하게 됨&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;591&quot; data-origin-height=&quot;872&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/qrpUv/dJMcaa6iiqe/pdKH5Xzad7Gve0LKSruYW0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/qrpUv/dJMcaa6iiqe/pdKH5Xzad7Gve0LKSruYW0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/qrpUv/dJMcaa6iiqe/pdKH5Xzad7Gve0LKSruYW0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FqrpUv%2FdJMcaa6iiqe%2FpdKH5Xzad7Gve0LKSruYW0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;591&quot; height=&quot;872&quot; data-origin-width=&quot;591&quot; data-origin-height=&quot;872&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다른 방법론에서는 길이가 길어질 수록 perplexity가 악화되는 반면 LCIRC는 안정된 성능을 유지함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TFLOPs 기준으로 계산량 감소가 선명하게 보여짐&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1028&quot; data-origin-height=&quot;798&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cNLWgV/dJMcafsX66H/NmgllHmPBIWcou7Vj9I1ek/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cNLWgV/dJMcafsX66H/NmgllHmPBIWcou7Vj9I1ek/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cNLWgV/dJMcafsX66H/NmgllHmPBIWcou7Vj9I1ek/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcNLWgV%2FdJMcafsX66H%2FNmgllHmPBIWcou7Vj9I1ek%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1028&quot; height=&quot;798&quot; data-origin-width=&quot;1028&quot; data-origin-height=&quot;798&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;성능도 유지!!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;RAG 프로세스에서 압축하는 거라 QA밖에 못하기는 하겠는데 reasoning에서 진행하면 어떻게 될까 궁금하긴 하네요&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 문제&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;기존 LLM은 고정된 context window와 quadratic attention cost 때문에 64K, 128K 이상의 긴 문서를 직접 처리하기 어렵다. 긴 입력을 단순 truncation하면 앞부분의 중요한 정보가 사라지고, full attention 확장은 계산 비용이 과도하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;긴 context를 LLM에 그대로 넣지 않고, segment 단위로 나누어 &lt;b&gt;recurrent compression&lt;/b&gt;한 뒤, 압축된 representation을 기존 LLM에 &lt;b&gt;gated cross-attention&lt;/b&gt;으로 주입한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;제안 방법: LCIRC&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;긴 문서의 잘리는 부분을 여러 segment로 나누고, Perceiver 기반 compressor가 이전 압축 상태 h^(i-1)와 현재 segment s_i를 이용해 누적 압축 representation h^(i)를 생성한다. 이후 [h^(1), ..., h^(S)]를 LLM layer에 cross-attention으로 주입한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;제안 방법: QD-LCIRC&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;QA처럼 query가 있는 상황에서는 모든 정보를 동일하게 압축하지 않고, query embedding을 compression 과정에 넣어 &lt;b&gt;질문과 관련 있는 정보&lt;/b&gt;가 더 잘 보존되도록 한다. 즉, query-aware memory compression 구조이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;학습 방식&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Llama2-7B backbone은 frozen하고, Perceiver compressor와 gated cross-attention 등 추가 모듈만 학습한다. LCIRC는 FineWeb-Edu로 long-form language modeling을 학습하고, QD-LCIRC는 FineWeb-LQA로 query-dependent modeling을 fine-tuning한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;효율화 전략&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;일반 BPTT는 긴 recurrent sequence에서 비용이 크므로, 논문은 일부 timestep만 선택해 gradient를 전달하는 &lt;b&gt;Selective State BPTT&lt;/b&gt;를 사용한다. 이는 truncated BPTT보다 장기 query-dependent modeling에 유리하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;비교 대상&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;Llama2-7B, RoPE 확장 기반 ExtendedFA, recurrent prompt compression 계열 AutoCompressor와 비교한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 실험 데이터셋&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;FineWeb-Edu, FineWeb-LQA, InfiniteBench, LongBench, L-Eval을 사용한다. InfiniteBench는 100K token 이상의 ultra-long context 평가에 사용된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 결과: Perplexity&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;FineWeb-Edu에서 LCIRC와 QD-LCIRC는 64K, 128K context에서도 안정적인 perplexity를 유지한다. QD-LCIRC는 128K에서 5.298을 기록해 AutoCompressor보다 안정적이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 결과: 계산량&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;128K context 기준 ExtendedFA는 10,739 TFLOPs가 필요한 반면, LCIRC는 120 TFLOPs, QD-LCIRC는 122 TFLOPs만 사용한다. 즉, full attention 확장 대비 약 99% 계산량 감소를 보인다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;주요 결과: QA 성능&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;QD-LCIRC는 InfiniteBench 평균 22.33, LongBench 평균 21.45, L-Eval 평균 26.17로 비교 모델 중 가장 높은 평균 성능을 달성한다. 특히 query-dependent compression이 long-form QA 성능 향상에 크게 기여한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;핵심 기여&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;① LLM 전체 재학습 없이 long-context 확장 가능, ② recurrent compression으로 긴 문서 처리 비용 절감, ③ query-dependent compression으로 질문 관련 정보 보존, ④ long-context benchmark에서 성능 향상 입증.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;한계점&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;QA 중심으로만 query-dependent modeling을 검증했기 때문에 retrieval, dialogue, agent memory 등으로의 일반화는 추가 검증이 필요하다. 또한 학습 비용이 여전히 크고, 실험이 영어 데이터 중심이며, 최신 native long-context LLM과의 비교가 부족하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;최종 결론&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;이 논문의 핵심은 &lt;b&gt;long-context modeling을 단순히 context window를 늘리는 문제가 아니라, 긴 정보 중 무엇을 압축하고 어떻게 LLM에 주입할 것인가의 문제로 재정의했다는 점&lt;/b&gt;이다. LCIRC는 long-context LLM, agent memory, RAG compression, query-aware context modeling 연구로 확장 가능성이 크다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1213</guid>
      <comments>https://yoonschallenge.tistory.com/1213#entry1213comment</comments>
      <pubDate>Thu, 7 May 2026 18:49:54 +0900</pubDate>
    </item>
    <item>
      <title>R1-Compress: Long Chain-of-Thought Compressionvia Chunk Compression and Search</title>
      <link>https://yoonschallenge.tistory.com/1212</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2505.16838&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2505.16838&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1777137715906&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search&quot; data-og-description=&quot;Chain-of-Thought (CoT) reasoning enhances large language models (LLMs) by enabling step-by-step problem-solving, yet its extension to Long-CoT introduces substantial computational overhead due to increased token length. Existing compression approaches -- i&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2505.16838&quot; data-og-url=&quot;https://arxiv.org/abs/2505.16838v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/FQxMV/dJMb887bxQK/odNCKdjOPPH8SF7RujkAf0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2505.16838&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2505.16838&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/FQxMV/dJMb887bxQK/odNCKdjOPPH8SF7RujkAf0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Chain-of-Thought (CoT) reasoning enhances large language models (LLMs) by enabling step-by-step problem-solving, yet its extension to Long-CoT introduces substantial computational overhead due to increased token length. Existing compression approaches -- i&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;압축하면서 생성하거나 그런 논문을 보고 싶었는데 여기선 압축된 CoT를 만들고 이를 학습해서 효과적인 reasoning을 하는 모델을 만들겠다 뭐 그런 거네요&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;문제의식&lt;/td&gt;
&lt;td&gt;Long-CoT는 수학&amp;middot;과학 추론 성능을 높이지만 출력 토큰이 길어져 inference latency와 KV cache 비용이 증가함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;기존 방법의 한계&lt;/td&gt;
&lt;td&gt;Instance-level 압축은 전체 CoT를 한 번에 줄이므로 reflection 같은 지역 추론 신호가 사라짐. Token-level 압축은 중요하지 않은 토큰을 제거하지만 문장이 부자연스럽고 incoherent해짐&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;제안 방법&lt;/td&gt;
&lt;td&gt;Long-CoT를 여러 chunk로 나누고, 각 chunk를 LLM으로 압축한 뒤, 여러 후보 중 앞선 chunk와 가장 자연스럽게 이어지는 후보를 search model로 선택&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;핵심 아이디어&lt;/td&gt;
&lt;td&gt;&lt;b&gt;local reasoning preservation + global coherence selection&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;사용 데이터&lt;/td&gt;
&lt;td&gt;OpenR1-Math-220k에서 5,000개 샘플 추출, 필터링 후 2,513개로 SFT&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;평가 모델&lt;/td&gt;
&lt;td&gt;Qwen2.5-14B-Instruct, Qwen2.5-32B-Instruct&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;평가 벤치마크&lt;/td&gt;
&lt;td&gt;MATH500, AIME24, GPQA-Diamond&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과&lt;/td&gt;
&lt;td&gt;Qwen2.5-32B 기준 MATH500에서 Long-CoT 93.0% &amp;rarr; R1-Compress 92.4%로 정확도 0.6%p만 감소, 평균 토큰은 3147 &amp;rarr; 2661로 감소&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;한계&lt;/td&gt;
&lt;td&gt;LLM 기반 압축이므로 chunk 후보 품질이 항상 보장되지 않고, 여전히 일부 문맥 불일치 가능성이 있음&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 논문은 딱히라...&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;대충 표만 정리해놓고 가겠습니다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1324&quot; data-origin-height=&quot;539&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/wZiEQ/dJMcaaZmGQ4/Rynfuba2U8JgTC8LPun4u0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/wZiEQ/dJMcaaZmGQ4/Rynfuba2U8JgTC8LPun4u0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/wZiEQ/dJMcaaZmGQ4/Rynfuba2U8JgTC8LPun4u0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FwZiEQ%2FdJMcaaZmGQ4%2FRynfuba2U8JgTC8LPun4u0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1324&quot; height=&quot;539&quot; data-origin-width=&quot;1324&quot; data-origin-height=&quot;539&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1339&quot; data-origin-height=&quot;693&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b4PVSz/dJMcacpmzwB/tP7mBbYtjVd6sS9r4kK5kk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b4PVSz/dJMcacpmzwB/tP7mBbYtjVd6sS9r4kK5kk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b4PVSz/dJMcacpmzwB/tP7mBbYtjVd6sS9r4kK5kk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb4PVSz%2FdJMcacpmzwB%2FtP7mBbYtjVd6sS9r4kK5kk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1339&quot; height=&quot;693&quot; data-origin-width=&quot;1339&quot; data-origin-height=&quot;693&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1283&quot; data-origin-height=&quot;558&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/wfQoJ/dJMcafl5QnS/5iK833ECmR8YlFK8T3EyaK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/wfQoJ/dJMcafl5QnS/5iK833ECmR8YlFK8T3EyaK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/wfQoJ/dJMcafl5QnS/5iK833ECmR8YlFK8T3EyaK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FwfQoJ%2FdJMcafl5QnS%2F5iK833ECmR8YlFK8T3EyaK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1283&quot; height=&quot;558&quot; data-origin-width=&quot;1283&quot; data-origin-height=&quot;558&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;675&quot; data-origin-height=&quot;802&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/nNaA5/dJMcajoo0sr/82IdT0kXAWAJ6rIfIPHzfk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/nNaA5/dJMcajoo0sr/82IdT0kXAWAJ6rIfIPHzfk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/nNaA5/dJMcajoo0sr/82IdT0kXAWAJ6rIfIPHzfk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FnNaA5%2FdJMcajoo0sr%2F82IdT0kXAWAJ6rIfIPHzfk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;675&quot; height=&quot;802&quot; data-origin-width=&quot;675&quot; data-origin-height=&quot;802&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 1026px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;핵심 문제&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Long-CoT는 수학&amp;middot;과학 추론 성능을 높이지만, 출력 토큰이 길어져 &lt;b&gt;inference latency, KV cache memory, serving cost&lt;/b&gt;가 크게 증가함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot;&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;기존 방법 1: Instance-level compression&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;C3oT, CoT-Valve처럼 전체 CoT를 한 번에 압축하는 방식&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;Instance-level 한계&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;전체 reasoning을 짧게 줄이면서 &lt;b&gt;reflection, checking, self-correction&lt;/b&gt; 같은 지역적 추론 신호가 사라짐. 논문 실험에서 C3oT는 평균 reflection이 &lt;b&gt;18.68 &amp;rarr; 0.15&lt;/b&gt;로 급감하고 MATH500 성능도 &lt;b&gt;88.0% &amp;rarr; 65.8%&lt;/b&gt;로 하락함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot;&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;기존 방법 2: Token-level compression&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot;&gt;TokenSkip처럼 중요하지 않은 토큰을 제거하는 방식&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Token-level 한계&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;지역 정보는 일부 보존하지만 문장이 깨지고, LLM의 자연스러운 출력 분포와 맞지 않는 &lt;b&gt;incoherent CoT&lt;/b&gt;가 생성됨. TokenSkip의 token-level loss는 &lt;b&gt;0.87&lt;/b&gt;로 Long-CoT &lt;b&gt;0.41&lt;/b&gt;보다 높음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;핵심 아이디어&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Long-CoT를 전체 단위나 토큰 단위가 아니라 &lt;b&gt;chunk 단위&lt;/b&gt;로 압축하면, local reasoning 정보를 보존하면서도 문장 coherence를 유지할 수 있음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;제안 방법&lt;/td&gt;
&lt;td style=&quot;height: 60px;&quot;&gt;&lt;b&gt;R1-Compress&lt;/b&gt;: ① Long-CoT를 reasoning chunk로 분할 &amp;rarr; ② 각 chunk를 LLM으로 여러 후보로 압축 &amp;rarr; ③ inter-chunk search로 짧고 자연스럽게 이어지는 후보 선택 &amp;rarr; ④ 선택된 chunk들을 이어붙여 compressed CoT 생성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Chunk segmentation&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;최소 길이 조건과 double newline boundary를 사용해 Long-CoT를 문단 또는 논리적 reasoning unit 단위로 분할&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Inner-chunk compression&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;각 chunk에 대해 &lt;b&gt;LLaMA3.1-70B-Instruct&lt;/b&gt;가 여러 압축 후보를 생성. Prompt는 reasoning step, reflection, checking, mistake step을 생략하지 말라고 지시함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Inter-chunk search&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;각 chunk 후보 중 긴 후보를 먼저 제거한 뒤, 이전에 선택된 chunk들과 문제를 조건으로 search model이 가장 높은 likelihood를 주는 후보를 선택&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;Search model&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;DeepSeek-R1-Distill-Qwen-14B&lt;/b&gt; 사용&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;학습 방식&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;압축된 CoT 데이터셋으로 Qwen2.5-Instruct 모델을 &lt;b&gt;full-parameter SFT&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;학습 데이터&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;OpenR1-Math-220k에서 5,000개 샘플 추출 후, chunk 수&amp;middot;정답 일치성&amp;middot;압축 비율 등을 필터링해 &lt;b&gt;2,513개&lt;/b&gt; 학습 샘플 사용&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;평가 모델&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;Qwen2.5-14B-Instruct&lt;/b&gt;, &lt;b&gt;Qwen2.5-32B-Instruct&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;평가 벤치마크&lt;/td&gt;
&lt;td style=&quot;height: 20px;&quot;&gt;&lt;b&gt;MATH500&lt;/b&gt;, &lt;b&gt;AIME24&lt;/b&gt;, &lt;b&gt;GPQA-Diamond&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;주요 결과: Qwen2.5-14B&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;MATH500에서 Long-CoT는 &lt;b&gt;88.0%, 3781 tokens&lt;/b&gt;, R1-Compress는 &lt;b&gt;84.8%, 3369 tokens&lt;/b&gt;. 정확도는 일부 감소하지만 CoT-Valve, TokenSkip보다 좋은 accuracy-token trade-off를 보임&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;주요 결과: Qwen2.5-32B&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;MATH500에서 Long-CoT는 &lt;b&gt;93.0%, 3147 tokens&lt;/b&gt;, R1-Compress는 &lt;b&gt;92.4%, 2661 tokens&lt;/b&gt;. 정확도는 &lt;b&gt;0.6%p&lt;/b&gt;만 감소하고 평균 출력 토큰은 크게 감소&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;GPQA-Diamond 결과&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Qwen2.5-32B 기준 Long-CoT는 &lt;b&gt;61.11%, 8054 tokens&lt;/b&gt;, R1-Compress는 &lt;b&gt;59.09%, 6963 tokens&lt;/b&gt;. OOD 과학 QA에서도 성능 손실을 제한하면서 토큰을 줄임&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Reflection 보존 결과&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Qwen2.5-14B 기준 평균 reflection 수는 Long-CoT &lt;b&gt;18.68&lt;/b&gt;, CoT-Valve &lt;b&gt;8.36&lt;/b&gt;, R1-Compress &lt;b&gt;14.59&lt;/b&gt;. R1-Compress는 Long-CoT reflection의 약 &lt;b&gt;78%&lt;/b&gt;를 보존&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Coherence 결과&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Token-level loss는 TokenSkip &lt;b&gt;0.87&lt;/b&gt;, R1-Compress random &lt;b&gt;0.63&lt;/b&gt;, R1-Compress &lt;b&gt;0.59&lt;/b&gt;. Inter-chunk search가 chunk 간 coherence 개선에 기여함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Ablation: chunk size&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;chunk size 1000보다 500이 더 좋은 성능을 보임. 작은 chunk가 local information을 더 잘 보존하고 압축 난이도를 낮춤&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Ablation: search model&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;search 없이 random 선택하면 MATH500 &lt;b&gt;81.2%&lt;/b&gt;, Qwen search는 &lt;b&gt;83.0%&lt;/b&gt;, DeepSeek-Distill search는 &lt;b&gt;84.8%&lt;/b&gt;. Search mechanism이 성능 개선에 중요함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;논문의 핵심 주장&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Long-CoT 압축에서 중요한 것은 단순히 길이를 줄이는 것이 아니라, &lt;b&gt;reflection과 verification 같은 reasoning behavior는 보존하고 redundant expression만 제거하는 것&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;장점&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;기존 instance-level/token-level 압축의 한계를 명확히 분석하고, chunk-level compression + search로 local information과 coherence를 동시에 고려함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;한계&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;LLM 기반 압축이라 후보 품질이 항상 보장되지 않음. 압축 데이터셋 생성 비용이 큼. AIME24처럼 어려운 문제에서는 Long-CoT 대비 성능 저하가 큼. Reflection keyword count가 실제 reflection quality를 완전히 대변하지는 않음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;최종 의의&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;R1-Compress는 &lt;b&gt;Long-CoT SFT 데이터를 짧고 일관된 reasoning trace로 변환해, 성능 손실을 작게 유지하면서 추론 비용을 줄이는 방법&lt;/b&gt;으로 볼 수 있음&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1212</guid>
      <comments>https://yoonschallenge.tistory.com/1212#entry1212comment</comments>
      <pubDate>Sun, 26 Apr 2026 02:46:55 +0900</pubDate>
    </item>
    <item>
      <title>OSCAR: Online Soft Compression And Reranking</title>
      <link>https://yoonschallenge.tistory.com/1211</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2504.07109&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2504.07109&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1777127718702&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;OSCAR: Online Soft Compression And Reranking&quot; data-og-description=&quot;Retrieval-Augmented Generation (RAG) enhances Large Language Models (LLMs) by integrating external knowledge, leading to improved accuracy and relevance. However, scaling RAG pipelines remains computationally expensive as retrieval sizes grow. To address t&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2504.07109&quot; data-og-url=&quot;https://arxiv.org/abs/2504.07109v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/G7qEn/dJMb88e3oJg/EreyLFmrjG23bWS9s7BRck/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cySx1z/dJMb85WV4Sb/XV5CUBVeuuKlYClpeyggTk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2504.07109&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2504.07109&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/G7qEn/dJMb88e3oJg/EreyLFmrjG23bWS9s7BRck/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cySx1z/dJMb85WV4Sb/XV5CUBVeuuKlYClpeyggTk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;OSCAR: Online Soft Compression And Reranking&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Retrieval-Augmented Generation (RAG) enhances Large Language Models (LLMs) by integrating external knowledge, leading to improved accuracy and relevance. However, scaling RAG pipelines remains computationally expensive as retrieval sizes grow. To address t&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이번에도 네이버 랩스 유럽에서 나온 token compression 관련 논문입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://yoonschallenge.tistory.com/1106&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;2025.08.19 - [인공지능/논문 리뷰 or 진행] - PISCO: Pretty Simple Compression for Retrieval-Augmented Generation&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1777128625816&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;PISCO: Pretty Simple Compression for Retrieval-Augmented Generation&quot; data-og-description=&quot;2025.02.26 - [인공지능/논문 리뷰 or 진행] - Embedding + Generation Model 사전 논문 조사1 Gecko, COCOM Embedding + Generation Model 사전 논문 조사1 Gecko, COCOM2025.02.25 - [인공지능/논문 리뷰 or 진행] - GRIT 생성과 Embedd&quot; data-og-host=&quot;yoonschallenge.tistory.com&quot; data-og-source-url=&quot;https://yoonschallenge.tistory.com/1106&quot; data-og-url=&quot;https://yoonschallenge.tistory.com/1106&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/b87Ieq/dJMb89ygjSM/VDZpcoRsE9evicKw8ShbT0/img.png?width=499&amp;amp;height=556&amp;amp;face=0_0_499_556,https://scrap.kakaocdn.net/dn/bvXW2o/dJMb9efgGrI/7Hb3CwTnGIkT0anMLlFvj0/img.png?width=499&amp;amp;height=556&amp;amp;face=0_0_499_556,https://scrap.kakaocdn.net/dn/bDyn9s/dJMb9hC3Z0a/rVzwRst4hlN6FRPO9GTtAk/img.png?width=2736&amp;amp;height=1566&amp;amp;face=0_0_2736_1566&quot;&gt;&lt;a href=&quot;https://yoonschallenge.tistory.com/1106&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://yoonschallenge.tistory.com/1106&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/b87Ieq/dJMb89ygjSM/VDZpcoRsE9evicKw8ShbT0/img.png?width=499&amp;amp;height=556&amp;amp;face=0_0_499_556,https://scrap.kakaocdn.net/dn/bvXW2o/dJMb9efgGrI/7Hb3CwTnGIkT0anMLlFvj0/img.png?width=499&amp;amp;height=556&amp;amp;face=0_0_499_556,https://scrap.kakaocdn.net/dn/bDyn9s/dJMb9hC3Z0a/rVzwRst4hlN6FRPO9GTtAk/img.png?width=2736&amp;amp;height=1566&amp;amp;face=0_0_2736_1566');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;PISCO: Pretty Simple Compression for Retrieval-Augmented Generation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;2025.02.26 - [인공지능/논문 리뷰 or 진행] - Embedding + Generation Model 사전 논문 조사1 Gecko, COCOM Embedding + Generation Model 사전 논문 조사1 Gecko, COCOM2025.02.25 - [인공지능/논문 리뷰 or 진행] - GRIT 생성과 Embedd&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;yoonschallenge.tistory.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이전에는 Pisco라는 논문으로도 압축을 진행했었습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://huggingface.co/collections/naver/oscar&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://huggingface.co/collections/naver/oscar&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1777128414459&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;OSCAR - a naver Collection&quot; data-og-description=&quot;Online soft compression models for RAG. We release the models with llama-1B as compressor.&quot; data-og-host=&quot;huggingface.co&quot; data-og-source-url=&quot;https://huggingface.co/collections/naver/oscar&quot; data-og-url=&quot;https://huggingface.co/collections/naver/oscar&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/mWrMM/dJMb9iIJLhG/h4QE9vY1iuklrureIofaA0/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648&quot;&gt;&lt;a href=&quot;https://huggingface.co/collections/naver/oscar&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://huggingface.co/collections/naver/oscar&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/mWrMM/dJMb9iIJLhG/h4QE9vY1iuklrureIofaA0/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;OSCAR - a naver Collection&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Online soft compression models for RAG. We release the models with llama-1B as compressor.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;huggingface.co&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모델 공개도 되어 있습니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서도 텍스트를 단순 요약하는 것이 아닌 몇 개의 연속 백터 embedding token으로 압축하는 방법을 사용하여 LLM이 문서로 인해 폭증하는 리소스 소모를 줄이려고 합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순 텍스트를 줄이는 방법은 쿼리에 맞춰 문서를 줄이거나, 해석 가능하다는 장점이 있지만, 압축률이 낮으며 텍스트 형태를 유지가 필요하여 과감한 압축이 어려우며 효율 개선도 제한된다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;연속 벡터로 압축하는 방법은 높은 압축률이 가능하고, 토큰 생성에 리소스가 감소하며 임베딩에 정보 밀도를 높게 압축할 수 있는 장점이 있음&lt;br /&gt;그러나 문서 embedding을 사전에 계산해서 저장한다 =&amp;gt; 저장 공간이 많이 들고, 쿼리에 상관 없게 문서가 압축된다. Compressor가 필요하고, online 적용이 어렵다는 단점이 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; OSCAR는 이 둘 장점을 결합하여 진행함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;837&quot; data-origin-height=&quot;649&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/GSPvd/dJMcaiXmuC5/myGxekIetinGRHlkSzy231/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/GSPvd/dJMcaiXmuC5/myGxekIetinGRHlkSzy231/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/GSPvd/dJMcaiXmuC5/myGxekIetinGRHlkSzy231/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FGSPvd%2FdJMcaiXmuC5%2FmyGxekIetinGRHlkSzy231%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;837&quot; height=&quot;649&quot; data-origin-width=&quot;837&quot; data-origin-height=&quot;649&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;OSCAR는 T-FLOPs는 낮으면서 높은 정확도를 보이는 것을 볼 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Pisco가 생각보다 추론 T-FLOPs가 높은 것이 의외네요&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1509&quot; data-origin-height=&quot;766&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/9ZPuN/dJMcabDZbXj/XODOaWSju0v90fqNpyYuK0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/9ZPuN/dJMcabDZbXj/XODOaWSju0v90fqNpyYuK0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/9ZPuN/dJMcabDZbXj/XODOaWSju0v90fqNpyYuK0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F9ZPuN%2FdJMcabDZbXj%2FXODOaWSju0v90fqNpyYuK0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1509&quot; height=&quot;766&quot; data-origin-width=&quot;1509&quot; data-origin-height=&quot;766&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Online방법으로 쿼리와 문서를 함께 넣는 방식으로 압축을 진행하여 같은 문서라도 쿼리가 달라지면 압축 임베딩도 달라지게 됩니다. =&amp;gt; 근데 이건 Compressor를 작은 모델로 해야 한다는 점이 있겠네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 여기선 decoder의 앞단을 compressor로 쓰거나, 작은 1B모델을 compressor(이 때는 차원을 맞추기 위해 Projection layer로 dense 2개와 ReLU가 들어갔음)로 쓰네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 Docs(128) + Query(n) + Memory token(8)을 넣어서 Memory Token(8)위치의 임베딩을 넘깁니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 임베딩을 다시 디코더에 쿼리와 함께 넣어서 출력을 잘 하도록 학습한 것이 OSCAR네요.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;학습은 Teacher forcing 으로 아마 원문 복원을 하려고 했을 것 같습니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;근데 이건 음 논문으로 나오진 못할 것 같기도 하고.... 아카이브니까 나오지 컨퍼런스에는 힘들 것 같네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기선 기본으로 128 -&amp;gt; 8로 16배 압축하여 진행합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 리랭커의 역할도 같이 할 수 있습니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Docs(128) + Query(n) + Memory token(8) + RR 으로 Relevance Score를 예측하게 됩니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 Compressor가 Reranking까지 할 수 있도록 하여 Reranker 비용이 감소하게 됩니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;학습때는 top-5 document를 사용하고, 평가시에는 top-10 document를 사용하여 일반화가 되는지를 확인했음&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;806&quot; data-origin-height=&quot;763&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Y90XO/dJMcabcSIny/5fdgECEC712odDGO0b5vl0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Y90XO/dJMcabcSIny/5fdgECEC712odDGO0b5vl0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Y90XO/dJMcabcSIny/5fdgECEC712odDGO0b5vl0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FY90XO%2FdJMcabcSIny%2F5fdgECEC712odDGO0b5vl0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;806&quot; height=&quot;763&quot; data-origin-width=&quot;806&quot; data-origin-height=&quot;763&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Figure가 조금 깨지긴 했지만...&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Oscar의 승률이 대부분의 상황에서 높은 것을 알 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1375&quot; data-origin-height=&quot;782&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bYAdOJ/dJMcacJGzrL/7xmtraIcxh2ps8pUwxCgu0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bYAdOJ/dJMcacJGzrL/7xmtraIcxh2ps8pUwxCgu0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bYAdOJ/dJMcacJGzrL/7xmtraIcxh2ps8pUwxCgu0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbYAdOJ%2FdJMcacJGzrL%2F7xmtraIcxh2ps8pUwxCgu0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1375&quot; height=&quot;782&quot; data-origin-width=&quot;1375&quot; data-origin-height=&quot;782&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결국 No compression 대비 얼마나 정확도가 덜 떨어지는지, 연산량은 얼마나 감소하는지를 파악해야 합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 OSCAR는 성능감소 거의 없이 연산량도 확 줄인 것을 볼 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러나 PISCO가 너무 잘 하는데.....&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;compression이 offline상황이라는 것으로 직접 비교를 진행하지 않았습니다.&amp;nbsp;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1332&quot; data-origin-height=&quot;856&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bsSWmu/dJMcaduXRWX/ajCd4gCnav15irsScps4A1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bsSWmu/dJMcaduXRWX/ajCd4gCnav15irsScps4A1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bsSWmu/dJMcaduXRWX/ajCd4gCnav15irsScps4A1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbsSWmu%2FdJMcaduXRWX%2FajCd4gCnav15irsScps4A1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1332&quot; height=&quot;856&quot; data-origin-width=&quot;1332&quot; data-origin-height=&quot;856&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;665&quot; data-origin-height=&quot;546&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bPY5Jv/dJMcad2OA8d/66jJTpl3aYVEVLwSnfhtHK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bPY5Jv/dJMcad2OA8d/66jJTpl3aYVEVLwSnfhtHK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bPY5Jv/dJMcad2OA8d/66jJTpl3aYVEVLwSnfhtHK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbPY5Jv%2FdJMcad2OA8d%2F66jJTpl3aYVEVLwSnfhtHK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;665&quot; height=&quot;546&quot; data-origin-width=&quot;665&quot; data-origin-height=&quot;546&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이건 뚜렷하게 나타나진 않지만 No compression과 성능차이가 크지 않은 것을 볼 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;근데 Compression의 역할을 보여주려면 더 잘해야 하는 거 아닌가 싶기도 하고....&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1338&quot; data-origin-height=&quot;618&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cqTDsr/dJMcad2OA8j/ILHJlWWAC21FvkkF0xgd20/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cqTDsr/dJMcad2OA8j/ILHJlWWAC21FvkkF0xgd20/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cqTDsr/dJMcad2OA8j/ILHJlWWAC21FvkkF0xgd20/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcqTDsr%2FdJMcad2OA8j%2FILHJlWWAC21FvkkF0xgd20%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1338&quot; height=&quot;618&quot; data-origin-width=&quot;1338&quot; data-origin-height=&quot;618&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;각종 요소들이 빠지면 성능이 떨어지는 것을 볼 수 있습니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;128에서 성능이 나쁘지 않은 것도 볼 수 있습니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;질문을 보고 문서를 압축하는 것이 중요하고, 압축률이 커질수록 Query-Document의 중요성이 커짐&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다른 인코더로도 가능한 모습을 보여줍니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;llama 1B가 잘 한건 사이즈 덕이 아닌가 싶긴 합니다&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;828&quot; data-origin-height=&quot;389&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/kQvgw/dJMcahYuHX0/AQ7FeUgpyhJVCjmBXGO2c1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/kQvgw/dJMcahYuHX0/AQ7FeUgpyhJVCjmBXGO2c1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/kQvgw/dJMcahYuHX0/AQ7FeUgpyhJVCjmBXGO2c1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FkQvgw%2FdJMcahYuHX0%2FAQ7FeUgpyhJVCjmBXGO2c1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;828&quot; height=&quot;389&quot; data-origin-width=&quot;828&quot; data-origin-height=&quot;389&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;리랭킹 성능도 봤는데 준수한 성능을 보여주는 것을 볼 수 있었습니다. (teacher model은 55.4)&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;핵심 문제&lt;/td&gt;
&lt;td&gt;RAG에서 검색 문서를 그대로 LLM에 넣으면 context 길이가 커져 &lt;b&gt;inference 비용, latency, memory 사용량&lt;/b&gt;이 크게 증가함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;기존 방법의 한계&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Hard compression&lt;/b&gt;은 query-aware지만 압축률이 낮고, &lt;b&gt;soft compression&lt;/b&gt;은 압축률은 높지만 대부분 offline&amp;middot;query-independent라 동적 RAG에 부적합함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;제안 방법&lt;/td&gt;
&lt;td&gt;검색 문서 dᵢ를 질문 q와 함께 compressor LLM에 넣어, 문서를 몇 개의 연속 embedding token으로 압축하는 &lt;b&gt;online query-dependent soft compression&lt;/b&gt; 제안&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;핵심 구조&lt;/td&gt;
&lt;td&gt;Query + Document + [MEM] tokens &amp;rarr; Compressor &amp;rarr; compressed embeddings &amp;rarr; Generator LLM &amp;rarr; Answer&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;[MEM] token 역할&lt;/td&gt;
&lt;td&gt;BERT의 [CLS]처럼 문서와 질문의 관련 정보를 특정 hidden state에 저장하도록 학습되는 memory token&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;압축 방식&lt;/td&gt;
&lt;td&gt;128-token 문서를 보통 8개 embedding으로 압축하여 &lt;b&gt;16&amp;times; compression&lt;/b&gt; 수행. 추가로 &lt;b&gt;128&amp;times; compression&lt;/b&gt;도 실험&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Query-dependent 핵심성&lt;/td&gt;
&lt;td&gt;같은 문서라도 질문에 따라 필요한 정보가 다르므로 C(dᵢ)가 아니라 C(q, dᵢ)로 압축함. Ablation에서 query-independent 방식은 성능이 크게 하락&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Compressor 설계 1&lt;/td&gt;
&lt;td&gt;&lt;b&gt;OSCAR-N-Layers&lt;/b&gt;: generator LLM의 앞쪽 N개 layer만 사용. hidden space 정렬이 쉬워 별도 pretraining 없이 학습 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Compressor 설계 2&lt;/td&gt;
&lt;td&gt;&lt;b&gt;OSCAR-llama&lt;/b&gt;: Llama-3.2-1B를 작은 compressor로 사용하고, dense layer를 통해 generator embedding space에 맞춤. 효율이 가장 좋지만 pretraining 필요&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;학습 목표&lt;/td&gt;
&lt;td&gt;No-compression RAG pipeline의 teacher answer를 따라 하도록 &lt;b&gt;sequence-level distillation&lt;/b&gt; 수행&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Loss 개념&lt;/td&gt;
&lt;td&gt;compressed embedding을 입력받은 generator가 teacher answer token을 잘 예측하도록 compressor와 generator를 함께 학습&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Generator 학습&lt;/td&gt;
&lt;td&gt;generator는 LoRA로 fine-tuning, compressor는 full fine-tuning. Generator를 freeze하면 성능이 하락&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Reranking 확장&lt;/td&gt;
&lt;td&gt;compressor에 [RR] token을 추가해 document relevance score도 예측. 즉, &lt;b&gt;compression과 reranking을 하나의 forward pass로 통합&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;학습 데이터&lt;/td&gt;
&lt;td&gt;약 &lt;b&gt;893K queries&lt;/b&gt;, Wikipedia-KILT 문서 chunk, SPLADE-v3 retrieval, DeBERTa-v3 reranker, Mistral-7B teacher 사용&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;평가 데이터셋&lt;/td&gt;
&lt;td&gt;Natural Questions, TriviaQA, HotpotQA, ASQA, PopQA, BioASQ-12B&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;평가 지표&lt;/td&gt;
&lt;td&gt;Accuracy, LLM Evaluation, GPT-4o pairwise comparison&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과: Mistral-7B&lt;/td&gt;
&lt;td&gt;No-compression 평균 accuracy 0.68, OSCAR-llama도 0.68 유지. 계산량은 20.33 &amp;rarr; 6.15 T-FLOPs로 감소, &lt;b&gt;3.3&amp;times; speed-up&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과: Qwen-7B&lt;/td&gt;
&lt;td&gt;No-compression 평균 accuracy 0.65, OSCAR-llama 0.67. 계산량은 18.94 &amp;rarr; 5.83 T-FLOPs, &lt;b&gt;3.2&amp;times; speed-up&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과: Mistral-24B&lt;/td&gt;
&lt;td&gt;No-compression 평균 accuracy 0.68, OSCAR-llama 0.69. 계산량은 64.29 &amp;rarr; 13.37 T-FLOPs, &lt;b&gt;4.8&amp;times; speed-up&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Ablation 핵심&lt;/td&gt;
&lt;td&gt;Query-dependent compression, compressor pretraining, generator fine-tuning이 모두 중요함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;강점&lt;/td&gt;
&lt;td&gt;RAG 성능을 거의 유지하면서 inference 비용을 크게 줄임. 특히 큰 LLM일수록 효율 이점이 큼&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;한계&lt;/td&gt;
&lt;td&gt;generator별로 별도 학습이 필요하고, closed-source API LLM에는 직접 적용하기 어려움. compressed embedding의 해석 가능성과 privacy 분석도 부족함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;최종 결론&lt;/td&gt;
&lt;td&gt;OSCAR는 &lt;b&gt;RAG 검색 문서를 질문 조건부 embedding으로 online 압축&lt;/b&gt;하여, hard compression보다 높은 압축률과 soft compression보다 실용적인 online 적용성을 동시에 달성한 RAG 효율화 방법&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;학습 데이터 셋 - 893 k&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;pretrained - COCOM 계열 연구&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1211</guid>
      <comments>https://yoonschallenge.tistory.com/1211#entry1211comment</comments>
      <pubDate>Sun, 26 Apr 2026 01:25:08 +0900</pubDate>
    </item>
    <item>
      <title>ACL 2026 main : towards privacy-preserving large language model: text-free inference through alignment and adaptation</title>
      <link>https://yoonschallenge.tistory.com/1170</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;원래는 모델, 코드까지 다 공개할 생각이었으나....&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;안되니... 여기에 미리 작성되어있던 코드는 다 지우고 발표 자료나, 논문 올려놓겠습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2604.06831&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2604.06831&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1776272488406&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Towards Privacy-Preserving Large Language Model: Text-free Inference Through Alignment and Adaptation&quot; data-og-description=&quot;Current LLM-based services typically require users to submit raw text regardless of its sensitivity. While intuitive, such practice introduces substantial privacy risks, as unauthorized access may expose personal, medical, or legal information. Although pr&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2604.06831&quot; data-og-url=&quot;https://arxiv.org/abs/2604.06831v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bXxo4b/dJMb8SpJupS/clLoreD3QsJ144Ljd7T87k/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/4BlaM/dJMb8XkgS0p/CJLCLhM32OdraNFXEiENPk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2604.06831&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2604.06831&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bXxo4b/dJMb8SpJupS/clLoreD3QsJ144Ljd7T87k/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/4BlaM/dJMb8XkgS0p/CJLCLhM32OdraNFXEiENPk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Towards Privacy-Preserving Large Language Model: Text-free Inference Through Alignment and Adaptation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Current LLM-based services typically require users to submit raw text regardless of its sensitivity. While intuitive, such practice introduces substantial privacy risks, as unauthorized access may expose personal, medical, or legal information. Although pr&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;996&quot; data-origin-height=&quot;513&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/F7t9U/dJMcaiiFYLq/utHimLneQTqUXIoYWaf3KK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/F7t9U/dJMcaiiFYLq/utHimLneQTqUXIoYWaf3KK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/F7t9U/dJMcaiiFYLq/utHimLneQTqUXIoYWaf3KK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FF7t9U%2FdJMcaiiFYLq%2FutHimLneQTqUXIoYWaf3KK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;996&quot; height=&quot;513&quot; data-origin-width=&quot;996&quot; data-origin-height=&quot;513&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;793&quot; data-origin-height=&quot;563&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/IxGdp/dJMcahc0d0B/9uoMDsvpqam8A2Hv7rpcak/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/IxGdp/dJMcahc0d0B/9uoMDsvpqam8A2Hv7rpcak/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/IxGdp/dJMcahc0d0B/9uoMDsvpqam8A2Hv7rpcak/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FIxGdp%2FdJMcahc0d0B%2F9uoMDsvpqam8A2Hv7rpcak%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;793&quot; height=&quot;563&quot; data-origin-width=&quot;793&quot; data-origin-height=&quot;563&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;div data-ke-type=&quot;moreLess&quot; data-text-more=&quot;더보기&quot; data-text-less=&quot;닫기&quot;&gt;&lt;a class=&quot;btn-toggle-moreless&quot;&gt;더보기&lt;/a&gt;
&lt;div class=&quot;moreless-content&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;초기 PPFT 발표자료 였습니다.&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1849&quot; data-origin-height=&quot;937&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/CmNX6/dJMcaaX7aXM/1vvNyvkoUHvtVueW0ddlsK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/CmNX6/dJMcaaX7aXM/1vvNyvkoUHvtVueW0ddlsK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/CmNX6/dJMcaaX7aXM/1vvNyvkoUHvtVueW0ddlsK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FCmNX6%2FdJMcaaX7aXM%2F1vvNyvkoUHvtVueW0ddlsK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1849&quot; height=&quot;937&quot; data-origin-width=&quot;1849&quot; data-origin-height=&quot;937&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;First, I would like to briefly explain the motivation behind my experiment.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;In most current&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;LLM services&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, user prompts are transmitted to external servers,&lt;br /&gt;and in many cases, the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;raw text is directly stored&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;during this process.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;While this may not be a critical issue in general applications,&lt;br /&gt;inc&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;domains such as law and healthcare&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;the exposure of original text can directly result in&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;severe privacy violations(바이얼레이션즈)&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;For example, if medical records or legal consultation(칸설테이션) data are stored as raw text on external servers,&lt;br /&gt;this poses a serious risk to personal data protection.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Based on this problem, I formulated the following research question:&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;ldquo;Is it possible for an LLM to generate reliable answers without ever accessing the raw text?&amp;rdquo;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;This question led to the core idea of my experiment&amp;mdash;&lt;br /&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;building a privacy-preserving interface where only embeddings are transmitted, instead of raw text.&lt;/span&gt;&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1837&quot; data-origin-height=&quot;879&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/1C3M6/dJMcacO9QlR/kfybtqGuJGX4Fzwci7ctb0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/1C3M6/dJMcacO9QlR/kfybtqGuJGX4Fzwci7ctb0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/1C3M6/dJMcacO9QlR/kfybtqGuJGX4Fzwci7ctb0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F1C3M6%2FdJMcacO9QlR%2FkfybtqGuJGX4Fzwci7ctb0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1837&quot; height=&quot;879&quot; data-origin-width=&quot;1837&quot; data-origin-height=&quot;879&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Now, I will briefly introduce the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;related work&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, which can be categorized into&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;three main directions&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;First, there are approaches for&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;privacy-preserving LLM inference&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;A representative method is&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Homomorphic(호우머모어픽) Encryption(엔크립션)&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;br /&gt;This allows computation on encrypted data and provides strong privacy guarantees.&lt;br /&gt;However, it suffers from&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;extremely high computational cost and severe latency&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;making it impractical for real-world deployment.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Another approach is&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Text Masking&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;which removes sensitive information before sending the prompt.&lt;br /&gt;While this improves privacy, it often leads to&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;significant performance degradation(데그러데이션) due to loss of contextual information&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;The second direction is&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;prompt compression and continuous embedding-based methods&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Early studies mainly focused on&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Discrete Compression&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;which removes less important tokens from the input.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Later,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Continuous Soft Prompt methods&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, such as&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Prefix-Tuning and P-Tuning&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, were proposed.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;However, these methods primarily aim at&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;efficiency rather than privacy&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;and the compressed vectors still contain&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;rich semantic information&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;br /&gt;As a result, they remain&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;highly vulnerable to inversion attacks such as Vec2Text&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;✅ ③ Embedding Inversion Attacks &amp;amp; Defenses&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;The third direction is&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;embedding inversion attacks and their defenses&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Recent studies have demonstrated that&lt;br /&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;text embeddings preserve semantic information almost equivalent(이퀴벌런트) to raw text&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;To mitigate this,&lt;br /&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Local Differential Privacy-based embedding sanitization(새너터제이션) methods&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;have been introduced.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;However, in practice,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;injecting noise often causes severe utility loss&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;leading to a&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;collapse(컬랩스) in model performance&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Due to these limitations of existing approaches,&lt;br /&gt;my work focuses on the following key question:&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;ldquo;How can we preserve privacy at the embedding level while maintaining strong LLM performance?&amp;rdquo;&lt;/span&gt;&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1944&quot; data-origin-height=&quot;963&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/TJAur/dJMcaacJKfD/8ltqZL770Wz4kz6YoZ46AK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/TJAur/dJMcaacJKfD/8ltqZL770Wz4kz6YoZ46AK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/TJAur/dJMcaacJKfD/8ltqZL770Wz4kz6YoZ46AK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FTJAur%2FdJMcaacJKfD%2F8ltqZL770Wz4kz6YoZ46AK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1944&quot; height=&quot;963&quot; data-origin-width=&quot;1944&quot; data-origin-height=&quot;963&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Now, I will explain the overall&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;method of our approach&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, which consists of three main steps.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;✅ Step 1. Prompt &amp;rarr; Encoder &amp;rarr; K-slot Latent Vectors&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;First, the user&amp;rsquo;s text prompt is&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;never transmitted to the server&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;br /&gt;Instead, it is&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;encoded into K latent vectors on the client side&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;This means that the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;server never sees the raw text&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;and only receives vector representations.&lt;br /&gt;This provides the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;first layer of privacy protection&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;✅ Step 2. Add Privacy Noise&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;However, privacy is&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;not fully guaranteed by encoding alone&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Recent studies have shown that it is often possible to&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;recover or infer the original text from embeddings&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;which is known as&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;embedding inversion&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;To prevent this, we&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;add L2-Laplace noise to the K-slot latent vectors&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;The purpose of this noise is simple:&lt;br /&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;to make it extremely difficult for the server to trace back or reconstruct the original input text from the vectors.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;This step forms the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;second and critical privacy defense layer at the vector level&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;✅ Step 3. LLM Decoder Generates the Answer&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Finally, the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;server receives only the noisy latent vectors&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;br /&gt;and generates the output using the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;LLM decoder&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;In other words,&lt;br /&gt;the server performs inference&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;without ever accessing the original text or clean embeddings&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Despite this restriction(리스트릭션), the LLM is still able to generate&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;semantically meaningful answers&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&amp;nbsp;&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1835&quot; data-origin-height=&quot;973&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/uf0zv/dJMb995YNhD/AYSX3YbaEB9FtDd3kiykG0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/uf0zv/dJMb995YNhD/AYSX3YbaEB9FtDd3kiykG0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/uf0zv/dJMb995YNhD/AYSX3YbaEB9FtDd3kiykG0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fuf0zv%2FdJMb995YNhD%2FAYSX3YbaEB9FtDd3kiykG0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1835&quot; height=&quot;973&quot; data-origin-width=&quot;1835&quot; data-origin-height=&quot;973&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Now, let me explain the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;two-stage training strategy&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;of our method.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;In&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Stage 1&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, we perform&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;joint training of the encoder and the LLM&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;br /&gt;using&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;general-purpose datasets&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;The goal of this stage is to&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;stabilize the semantic alignment between the encoder and the LLM&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;br /&gt;based on&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;clean latent vectors without noise&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;In other words, this stage allows the model to learn&lt;br /&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;how a given latent representation should be decoded into meaningful text&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;In&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Stage 2&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, we&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;completely freeze the encoder&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;br /&gt;This means that the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;client-side encoder is fixed and no longer updated&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Then, the LLM is&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;fine-tuned using domain-specific data&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;but&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;only with noisy latent vectors as input&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;This ensures that:&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;The training condition exactly matches the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;real deployment setting with privacy noise&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, and&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;The server&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;never accesses raw text at any point during domain adaptation&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1835&quot; data-origin-height=&quot;879&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/mURRv/dJMcaiBNlx1/GRdkBBRv30ulbJIVfs97Ik/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/mURRv/dJMcaiBNlx1/GRdkBBRv30ulbJIVfs97Ik/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/mURRv/dJMcaiBNlx1/GRdkBBRv30ulbJIVfs97Ik/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FmURRv%2FdJMcaiBNlx1%2FGRdkBBRv30ulbJIVfs97Ik%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1835&quot; height=&quot;879&quot; data-origin-width=&quot;1835&quot; data-origin-height=&quot;879&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Now, I will explain the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;goals and evaluation setup of my experiment&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;The first goal of this experiment is to answer the following question:&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;ldquo;How well can an LLM generate answers using only embeddings, without access to raw text?&amp;rdquo;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;In other words, we aim to verify whether the LLM can still understand the meaning of the input&lt;br /&gt;and generate reliable responses when&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;text is completely removed from the server side&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;The second goal is:&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;ldquo;Can the model maintain its performance even when privacy noise is added?&amp;rdquo;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;As explained earlier, noise is&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;essential for preventing tracing and inversion&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;but it may also&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;degrade model performance&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;br /&gt;Therefore, the second goal is to evaluate whether a&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;practical balance between privacy and utility&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;can be achieved.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;The third goal focuses on security:&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;ldquo;How effectively can the method defend against embedding inversion attacks?&amp;rdquo;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;These three questions define the core objectives of our experimental evaluation.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;✅ Evaluation Tasks&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;To evaluate these goals, we conducted experiments on&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;three different QA tasks&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;:&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Medical Question Answering&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Legal Question Answering&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, and&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Open-domain Question Answering&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;By evaluating both&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;high-stakes domains such as medicine and law&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;as well as&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;general open-domain QA&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;we were able to comprehensively assess&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;the robustness and practicality of our privacy-preserving method across diverse domains&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1835&quot; data-origin-height=&quot;879&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bcF228/dJMcabvW4hI/Iaco613XS7MYvOzHZ0aPxK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bcF228/dJMcabvW4hI/Iaco613XS7MYvOzHZ0aPxK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bcF228/dJMcabvW4hI/Iaco613XS7MYvOzHZ0aPxK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbcF228%2FdJMcabvW4hI%2FIaco613XS7MYvOzHZ0aPxK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1835&quot; height=&quot;879&quot; data-origin-width=&quot;1835&quot; data-origin-height=&quot;879&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Now, I will briefly go over the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;model configuration&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;For the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;encoder&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, we use&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Modern BERT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;which provides stable and strong semantic representations.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;For the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;decoder&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, we evaluate both&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;LLaMA-1B and LLaMA-8B&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;to analyze the effect of model scale.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;The&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;pooling size is set to 4&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;which balances information preservation and computational efficiency.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;For&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;privacy noise&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, we apply&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Laplace noise&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;with&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;epsilon values ranging from 5 to 75&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;br /&gt;allowing us to analyze the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;privacy&amp;ndash;utility trade-off&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;944&quot; data-origin-height=&quot;392&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/FUKlb/dJMcagcX3yP/ygqx5MjAgYCBXokh0gKGV1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/FUKlb/dJMcagcX3yP/ygqx5MjAgYCBXokh0gKGV1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/FUKlb/dJMcagcX3yP/ygqx5MjAgYCBXokh0gKGV1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FFUKlb%2FdJMcagcX3yP%2Fygqx5MjAgYCBXokh0gKGV1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;944&quot; height=&quot;392&quot; data-origin-width=&quot;944&quot; data-origin-height=&quot;392&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;Now, I will briefly explain the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;overall trends of the results&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;rather than each individual number.&lt;br /&gt;First, when we use the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;basic LLaMA models&lt;/b&gt;,&lt;br /&gt;the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;8B model consistently outperforms the 1B model across all tasks&lt;/b&gt;,&lt;br /&gt;which reflects the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;natural performance gain from larger model capacity&lt;/b&gt;.&lt;br /&gt;Next, when&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;pooling is applied&lt;/b&gt;,&lt;br /&gt;we observe a&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;significant performance improvement even for the 1B model&lt;/b&gt;.&lt;br /&gt;This improvement is especially noticeable in the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;commonsense QA task&lt;/b&gt;.&lt;br /&gt;Now, looking at the results with&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;privacy noise added&lt;/b&gt;,&lt;br /&gt;when the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;noise is very large (noise 76)&lt;/b&gt;,&lt;br /&gt;the performance&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;almost completely collapses&lt;/b&gt;, regardless of model size.&lt;br /&gt;However, when the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;noise level is moderate (noise 5)&lt;/b&gt;,&lt;br /&gt;we can see that the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;performance is still well preserved in both Medical QA and Legal QA&lt;/b&gt;.&lt;br /&gt;In particular, the&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;8B model maintains relatively strong performance even under noise&lt;/b&gt;.&lt;/p&gt;
&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;Next,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;Hayoon Ji&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;will present our work on&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;training-free robustness methods&lt;/b&gt;.&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b9AGAf/dJMcacorh7Y/09XWkGw69NZsVRIq5bv0x1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b9AGAf/dJMcacorh7Y/09XWkGw69NZsVRIq5bv0x1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b9AGAf/dJMcacorh7Y/09XWkGw69NZsVRIq5bv0x1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb9AGAf%2FdJMcacorh7Y%2F09XWkGw69NZsVRIq5bv0x1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2000&quot; height=&quot;1125&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;현재 우리가 사용하는 대부분의&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;LLM&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;기반 서비스는 클라우드 기반의&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;MLaaS&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;형태로 배포되어 있습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;하지만 이 편리함 뒤에는 아주 치명적인 프라이버시 취약점이 숨어 있습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&amp;ldquo;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;자료의&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;1&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;페이지와&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;2&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;페이지에서 지적하듯이&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;현재의 시스템은 사용자가 입력하는 프롬프트를&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;평문&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;(Plaintext)&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;형태 그대로 서버에 전송하도록 요구합니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;사용자가 질문을 던지는 순간&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;그 텍스트는 가공되지 않은 상태로 네트워크를 타고 클라우드로 흘러가게 됩니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이 방식은 직관이지만 보안상 매우 위험합니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;만약 전송&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;과정에적서&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;적대적인 도청이 발생하거나&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;서비스 제공자의 클라우드 인프라가 침해당할 경우&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;사용자의 민감한 개인 정보나 의료&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;middot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;법률 정보가 그대로 노출될 수 있기 때문입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;특히 이러한 정보는 일회성 유출로 끝나지 않고&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;시스템 로그에 남거나 모델의 후속 학습에 사용되면서 장기적인 보안 위협이 됩니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&amp;ldquo;&lt;/span&gt;&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c8BnNf/dJMb99SMOSl/4kUwPyiybWpbVxknLYZK7K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c8BnNf/dJMb99SMOSl/4kUwPyiybWpbVxknLYZK7K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c8BnNf/dJMb99SMOSl/4kUwPyiybWpbVxknLYZK7K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc8BnNf%2FdJMb99SMOSl%2F4kUwPyiybWpbVxknLYZK7K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2000&quot; height=&quot;1125&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;앞서 살펴본 위험을 해결하기 위해 그동안 다양한 방어 기법들이 연구되어 왔습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;하지만 이 기법들은 실제 서비스 환경에서 적용하기에는 몇 가지 근본적인 한계가 있습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;첫째&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;민감한 단어를 삭제하는&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;프롬프트 정제 방식&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이 방식은 언뜻 안전해 보이지만&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;문장 전체의 맥락 속에 숨겨진 암묵적인 정보 유출을 막지 못합니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;무엇보다 서버가 여전히&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;텍스트&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;를 직접 받는 인터페이스를 유지한다는 점이 가장 큰 취약점입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;둘째&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;텍스트 대신&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;임베딩에&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;노이즈를 섞어 보내는&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;표현 교란 방식&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;최근 연구에 따르면&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;단순한 노이즈 처리만으로는 정교한&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;역추론&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;공격을 막을 수 없으며&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;의미적으로 원문이 복원될 위험이 큽니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;또한 노이즈를 늘리면 모델의 성능이 급격히 떨어지는 문제가 발생합니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;마지막으로&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;암호학적 방식&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;은 이론적으로는 완벽할지 모르나&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;대규모 트랜스포머 모델을 실시간으로 처리하기에는 계산 비용과&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;통신량이&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;너무 커서 실제 서비스에 적용하기가 매우 어렵습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;(&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;마무리&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;)&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;결국&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;기존 방법들은 프라이버시를 지키면 성능이나 효율이 떨어지는&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;상충 관계&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;를 해결하지 못했습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;저희는 이러한 공백을 메우기 위해&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;PPFT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;라는 새로운 대안을 제안하게 되었습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ptLHV/dJMcagK97rb/erGxxY8fAIUxxXxKU9Jf0K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ptLHV/dJMcagK97rb/erGxxY8fAIUxxXxKU9Jf0K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ptLHV/dJMcagK97rb/erGxxY8fAIUxxXxKU9Jf0K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FptLHV%2FdJMcagK97rb%2FerGxxY8fAIUxxXxKU9Jf0K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2000&quot; height=&quot;1125&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;그림 상단의&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'OTHERS'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;라인을 보시면&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;기존의 일반적인&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;LLM&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;서비스 구조가 나옵니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;사용자가 자신의 건강 상태와 같은 민감한 질문을 던지면&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이 내용은 텍스트 형태 그대로 서버로 넘어갑니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이때 중간에 공격자가 침입한다면&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;말풍선에 보이는 것처럼 사용자가 어떤 병을 앓고 있는지 아주 손쉽게 알아낼 수 있습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이것이 바로 현재&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;LLM&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;서비스의 가장 큰 프라이버시 구멍입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;반면 하단의&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'OURS'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;라인을 봐주시기 바랍니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;저희는 텍스트를 서버로 보내는 단계 자체를 없앴습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;대신 클라이언트 기기 내부에서&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;인코더 모델&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;을 통해 텍스트를 숫자의 나열인&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;임베딩으로&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;변환합니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;여기에 한 단계 더 나아가&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;라플라스&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;노이즈&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;(Laplace Noise)&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;를 주입하여 데이터를 한 번 더 꼬아버립니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이제 서버로 전송되는 데이터는 의미를 알 수 없는 숫자 뭉치일 뿐입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;해커가 서버를 해킹하여 이 데이터를 얻더라도&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;원래 어떤 내용이었는지 전혀 복원할 수 없습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;하지만 서버에 있는 저희의&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;정렬된&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;LLM'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;은 이&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;난독화된&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;숫자들을 해석할 수 있도록 미리 학습되어 있기 때문에&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;프라이버시는 완벽히 지키면서도 사용자에게 정확한 진단 결과를 제공할 수 있습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&amp;ldquo;&lt;/span&gt;&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bxpph1/dJMcafS0K9f/g9ngM6zDEipXlZkDKlFrCK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bxpph1/dJMcafS0K9f/g9ngM6zDEipXlZkDKlFrCK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bxpph1/dJMcafS0K9f/g9ngM6zDEipXlZkDKlFrCK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbxpph1%2FdJMcafS0K9f%2Fg9ngM6zDEipXlZkDKlFrCK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2000&quot; height=&quot;1125&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이제&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;PPFT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;가 구체적으로 어떻게 텍스트 없이 학습&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;(Text-Free Training)&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;을 진행하고&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;도메인 지식을 습득하는지 그 내부 메커니즘을 말씀드리겠습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;저희의 방법론은 크게 두 단계로 구성됩니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;첫 번째 단계는 **&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'Alignment Tuning'**&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;독립적으로 학습된 인코더와 서버의&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;디코더가&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;서로의 신호를 이해할 수 있도록 잠재 공간을 정렬하는 과정입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이때는 일반적인 상식이나&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;지시문&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;데이터셋을 사용합니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;그림 상단을 보시면 인코더가 단어를 숫자로 바꾸고&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이를 뭉치는&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;$k$-Pooling&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;과정을 거칩니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이를 통해&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;통신량도&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;줄이고&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;시퀀스 차원이 줄어들기에 의미적으로 복구하기 상당히 어려워집니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&amp;nbsp;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;디코더는&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;이제 단어라는 텍스트 대신&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이 숫자의 뭉치를 보고도 원래 어떤 지시였는지 이해하고 정확한 답변을 생성하도록 훈련됩니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;두 번째 단계는 **&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'Domain Adaptation'**&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이제 정렬된 모델에게 의료나 법률 같은 전문 지식을 가르칠 차례입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;그림 하단을 보시면&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;클라이언트는 노이즈가 섞여서 원래 내용을 알 수 없는&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;암호화된 벡터&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;만 전송합니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;서버는 이 노이즈 섞인&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;입력값만&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;보고도 정답을 맞히도록 학습됩니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이 과정에서 클라이언트의 인코더는 고정시킨 채 서버의&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;디코더만&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;파인튜닝하기&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;때문에&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;프롬프트 텍스트는 서버에 단 한 글자도 노출되지 않습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;결과적으로&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, 1&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;단계에서&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;임베딩으로&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;소통하는 법&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;을 배우고&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, 2&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;단계에서&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;전문 지식을 처리하는 법&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;을 배움으로써&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;텍스트가 디바이스를 벗어나지 않고도 강력한 성능을 내는 안전한 시스템이 완성되는 것입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/4RkoL/dJMcadOlSJB/ZL0S5R0fFCLiAObGAny08k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/4RkoL/dJMcadOlSJB/ZL0S5R0fFCLiAObGAny08k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/4RkoL/dJMcadOlSJB/ZL0S5R0fFCLiAObGAny08k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F4RkoL%2FdJMcadOlSJB%2FZL0S5R0fFCLiAObGAny08k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2000&quot; height=&quot;1125&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;앞서&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;설명드린&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;PPFT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;의 프라이버시 보호 능력이 실제 모델 성능에는 어떤 영향을 주었는지&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;실험 결과를 통해 말씀드리겠습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;저희는 의료&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;법률&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;그리고 일반 상식까지 총&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;5&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;가지의 핵심 데이터셋을 통해 성능을 검증했습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&amp;ldquo;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;(&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;먼저 우측 상단은 민감 정보가 집중된 전문 도메인 결과입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Pri-DDX&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;와&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;NLICE&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는 복잡한 의학적 진단 능력을&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Pri-SLJA&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는 까다로운 법률적 추론 능력을 평가합니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;결과를 보시면&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, Llama-3.1-8B&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;모델 기준&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;PPFT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는 모든 데이터셋에서 기존의&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;패러프레이징이나&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;표현 교란 방식보다 압도적으로 우수한 성능을 보여줍니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;특히 법률 도메인&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;(Pri-SLJA)&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;에서는 노이즈가 전혀 없는 상태의 약&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;95%&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;수준까지 성능을 회복하며&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;프라이버시를 지키면서도 전문적인 작업 수행에 전혀 지질이 없음을 확인했습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&amp;ldquo;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;＂&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;오른쪽 하단은 일반 도메인에서의 성능입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;CSQA&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는 모델의 상식 추론을&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;SQuAD&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는 지문 독해 능력을 측정합니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;기존의 프라이버시 기법들이 텍스트를 왜곡하면서 일반적인 추론 능력이 급격히 망가지는 것과 달리&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, PPFT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는 인코더와&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;디코더의&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;안정적인 정렬&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;(Stage 1)&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;덕분에 일반 도메인에서도 강력한 성능을 유지합니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;특히&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;SQuAD&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터셋에서는 타 기법들이 거의 답변을 하지 못하는 상황에서도&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;PPFT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는 상한선에 근접한 높은 정확도를 기록했습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&amp;ldquo;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;종합하면&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, PPFT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는 텍스트를 서버에 노출하지 않는 엄격한 제약 하에서도 의료와 법률 같은 전문 분야는 물론&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;모델 본연의 일반적인 지능까지 모두 보존할 수 있는 효과적인 프라이버시 보존&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;파인튜닝&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;솔루션입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/wFcYx/dJMcai3c8hz/bjPrLFllUIp1WtR66exaXK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/wFcYx/dJMcai3c8hz/bjPrLFllUIp1WtR66exaXK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/wFcYx/dJMcai3c8hz/bjPrLFllUIp1WtR66exaXK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FwFcYx%2FdJMcai3c8hz%2FbjPrLFllUIp1WtR66exaXK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2000&quot; height=&quot;1125&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;(&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;도입&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;)&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;PPFT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;가 성능만 좋은 것이 아니라&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;실제로 얼마나 안전한지도 정밀하게 검증했습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;저희는 공격자가 전송된 임베딩을 가로채서 원래 문장을 복원하려고 시도하는&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;역추론&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;공격&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;환경을 가정하여 테스트를 진행했습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&amp;ldquo;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;(&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;지표 설명&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;: ROUGE-L)&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;여기서 보안성을 측정하는 핵심 지표는&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;ROUGE-L&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이는 공격자가 복원해낸 문장이 원래 프롬프트와 얼마나 유사한지를 나타내는 점수입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;따라서 이 점수가&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;낮으면 낮을수록&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;저희의 방패가 강력하다는 뜻입니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;(Figure 3 &amp;amp; 4&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;설명&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;)&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;먼저&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;우측 상단&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;그래프를 보시겠습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;기존 방식들은 프라이버시 보호 강도가 약해질수록&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;정보가 급격히 유출되는 반면&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;빨간색 선인&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;PPFT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는 아주 낮은 점수를 일관되게 유지&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;하고 있습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;또한&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;Figure 4&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;에서 보시는 것처럼&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;저희가 선택한&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;라플라스&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;노이즈&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;방식이&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;가우시안&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;노이즈보다&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;임베딩의&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;의미를 훨씬 더 효과적으로 숨겨준다는 사실도 수치로 확인했습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;(Table 3&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;및 정성적 분석 설명&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;)&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;특히&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;우측 하단&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;의 속성별 분석 결과가 매우 흥미롭습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;의료 데이터에서 가장 민감한 정보인&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;연령과 과거 병력&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;의 경우&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;재현율이&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;0.01&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;수준으로 사실상 복원이 불가능했습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;함께 첨부된 예시를 보시면&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;공격 모델이&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;27&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;세 남성의 췌장암 관련 질문을&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;28&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;세 여성의 천식 관련 내용으로 완전히 잘못 짚고 있는 것을 볼 수 있습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이는&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;PPFT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;가 표면적인 텍스트 구조는 유지할지 몰라도&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;핵심적인 민감 정보는 완벽하게 난독화&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;하고 있음을 증명합니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&amp;ldquo;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;PPFT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는 강력한 수치적 증거와 정성적 사례 모두에서 실제 서비스에 적용 가능한 수준의 프라이버시 보호 능력을 갖추었음을 입증했습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/beDhUC/dJMcaiCajrs/FT9oymK9PKotAI3facENC0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/beDhUC/dJMcaiCajrs/FT9oymK9PKotAI3facENC0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/beDhUC/dJMcaiCajrs/FT9oymK9PKotAI3facENC0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbeDhUC%2FdJMcaiCajrs%2FFT9oymK9PKotAI3facENC0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2000&quot; height=&quot;1125&quot; data-origin-width=&quot;2000&quot; data-origin-height=&quot;1125&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p style=&quot;text-align: left;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #000000;&quot;&gt;(&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;도입&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;)&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;이제 발표를 마무리하며 본 연구의 결론을 정리해 보겠습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;저희가 제안한&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;PPFT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;LLM&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;서비스의 고질적인 문제였던 프라이버시 유출 위험에 대한 실질적인 해답을 제시했습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&quot;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&quot;PPFT&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;추론뿐만&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;아니라&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;데이터 학습&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;(&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;파인튜닝&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;)&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;단계에서도 텍스트를 단 한 글자도 서버에 보내지 않는다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는 점에 있습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;정보 압축과&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;노이즈 주입 기술을 결합하여&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;,&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;공격자가 데이터를 가로채더라도 원문을 복원할 수 없는 강력한 방패를 구축했습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;그럼에도 불구하고 성능 면에서는 노이즈가 없는 이상적인 환경의&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;95%&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;수준&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;까지 도달하며&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;, '&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;보안을 강화하면 성능이 떨어진다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;'&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;는 기존의 상충 관계를 성공적으로 극복했습니다&lt;/span&gt;&lt;span style=&quot;color: #000000;&quot;&gt;.&lt;br /&gt;&lt;br /&gt;&lt;br /&gt;&lt;/span&gt;&lt;/p&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bX6PpR/dJMcabKFmgu/PzKS6hB6es6W3XCV2AAzD0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bX6PpR/dJMcabKFmgu/PzKS6hB6es6W3XCV2AAzD0/img.png&quot; data-alt=&quot;'&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bX6PpR/dJMcabKFmgu/PzKS6hB6es6W3XCV2AAzD0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbX6PpR%2FdJMcabKFmgu%2FPzKS6hB6es6W3XCV2AAzD0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;960&quot; height=&quot;540&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;/&gt;&lt;/span&gt;&lt;figcaption&gt;'&lt;/figcaption&gt;
&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;964&quot; data-origin-height=&quot;540&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/2H4hT/dJMcaiwbLWs/KOMQuj11SEkqKQWId7lW90/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/2H4hT/dJMcaiwbLWs/KOMQuj11SEkqKQWId7lW90/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/2H4hT/dJMcaiwbLWs/KOMQuj11SEkqKQWId7lW90/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F2H4hT%2FdJMcaiwbLWs%2FKOMQuj11SEkqKQWId7lW90%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;964&quot; height=&quot;540&quot; data-origin-width=&quot;964&quot; data-origin-height=&quot;540&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bXm4FY/dJMcahc0d0v/2yMPbgoOHXk4f4dF5CIXok/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bXm4FY/dJMcahc0d0v/2yMPbgoOHXk4f4dF5CIXok/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bXm4FY/dJMcahc0d0v/2yMPbgoOHXk4f4dF5CIXok/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbXm4FY%2FdJMcahc0d0v%2F2yMPbgoOHXk4f4dF5CIXok%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;960&quot; height=&quot;540&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;964&quot; data-origin-height=&quot;540&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/vJC7d/dJMcafTN7pe/hCwr6xrR4goKkGIkirzUK0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/vJC7d/dJMcafTN7pe/hCwr6xrR4goKkGIkirzUK0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/vJC7d/dJMcafTN7pe/hCwr6xrR4goKkGIkirzUK0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FvJC7d%2FdJMcafTN7pe%2FhCwr6xrR4goKkGIkirzUK0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;964&quot; height=&quot;540&quot; data-origin-width=&quot;964&quot; data-origin-height=&quot;540&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bDsy9U/dJMcaibWo48/MqVZzFJCK6e4Mr7M3LTmuK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bDsy9U/dJMcaibWo48/MqVZzFJCK6e4Mr7M3LTmuK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bDsy9U/dJMcaibWo48/MqVZzFJCK6e4Mr7M3LTmuK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbDsy9U%2FdJMcaibWo48%2FMqVZzFJCK6e4Mr7M3LTmuK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;960&quot; height=&quot;540&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/DjYES/dJMcadhm7pw/wpZbKnb41Y1U1egKSjKozk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/DjYES/dJMcadhm7pw/wpZbKnb41Y1U1egKSjKozk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/DjYES/dJMcadhm7pw/wpZbKnb41Y1U1egKSjKozk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FDjYES%2FdJMcadhm7pw%2FwpZbKnb41Y1U1egKSjKozk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;960&quot; height=&quot;540&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;964&quot; data-origin-height=&quot;540&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/SZ5EE/dJMcabcLpmT/O02arkSD4g87jIA6p2fa3K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/SZ5EE/dJMcabcLpmT/O02arkSD4g87jIA6p2fa3K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/SZ5EE/dJMcabcLpmT/O02arkSD4g87jIA6p2fa3K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FSZ5EE%2FdJMcabcLpmT%2FO02arkSD4g87jIA6p2fa3K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;964&quot; height=&quot;540&quot; data-origin-width=&quot;964&quot; data-origin-height=&quot;540&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/chYbkD/dJMcaaSvAyt/aYJUlyxROeOLorhUkQK8G1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/chYbkD/dJMcaaSvAyt/aYJUlyxROeOLorhUkQK8G1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/chYbkD/dJMcaaSvAyt/aYJUlyxROeOLorhUkQK8G1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FchYbkD%2FdJMcaaSvAyt%2FaYJUlyxROeOLorhUkQK8G1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;960&quot; height=&quot;540&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/nnMzd/dJMcaiwbLYf/tLy9YpRrDdpMXnny62fNs1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/nnMzd/dJMcaiwbLYf/tLy9YpRrDdpMXnny62fNs1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/nnMzd/dJMcaiwbLYf/tLy9YpRrDdpMXnny62fNs1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FnnMzd%2FdJMcaiwbLYf%2FtLy9YpRrDdpMXnny62fNs1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;960&quot; height=&quot;540&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/k8Obt/dJMcaiXe7kc/1qYACMWCVlxTzokDkr4NZ0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/k8Obt/dJMcaiXe7kc/1qYACMWCVlxTzokDkr4NZ0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/k8Obt/dJMcaiXe7kc/1qYACMWCVlxTzokDkr4NZ0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fk8Obt%2FdJMcaiXe7kc%2F1qYACMWCVlxTzokDkr4NZ0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;960&quot; height=&quot;540&quot; data-origin-width=&quot;960&quot; data-origin-height=&quot;540&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/자연어 처리</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1170</guid>
      <comments>https://yoonschallenge.tistory.com/1170#entry1170comment</comments>
      <pubDate>Thu, 16 Apr 2026 02:04:25 +0900</pubDate>
    </item>
    <item>
      <title>Sequential Efficient LLM 논문 -3</title>
      <link>https://yoonschallenge.tistory.com/1210</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.acl-long.536/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2024.acl-long.536/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1772521947259&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Dodo: Dynamic Contextual Compression for Decoder-only LMs&quot; data-og-description=&quot;Guanghui Qin, Corby Rosset, Ethan Chau, Nikhil Rao, Benjamin Van Durme. Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2024.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2024.acl-long.536/&quot; data-og-url=&quot;https://aclanthology.org/2024.acl-long.536/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/1MScg/dJMb82MAFrn/q4mL41sWF6n4jmKhnni6y1/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.acl-long.536/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2024.acl-long.536/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/1MScg/dJMb82MAFrn/q4mL41sWF6n4jmKhnni6y1/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Dodo: Dynamic Contextual Compression for Decoder-only LMs&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Guanghui Qin, Corby Rosset, Ethan Chau, Nikhil Rao, Benjamin Van Durme. Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2024.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;acl 2024 long에 붙은 논문입니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 방법들(sparse attention, 커널 등)은 nlp에서 일관적인 효과가 나지 않거나, 대형 llm에 적용이 어려웠음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모든 토큰을 동일 길이의 hidden state로 유지하지 말자!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1900&quot; data-origin-height=&quot;1256&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/w23Lq/dJMcabwxr9R/WNDMkLRgoEQlY45htkMME1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/w23Lq/dJMcabwxr9R/WNDMkLRgoEQlY45htkMME1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/w23Lq/dJMcabwxr9R/WNDMkLRgoEQlY45htkMME1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fw23Lq%2FdJMcabwxr9R%2FWNDMkLRgoEQlY45htkMME1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1900&quot; height=&quot;1256&quot; data-origin-width=&quot;1900&quot; data-origin-height=&quot;1256&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;각 레이어에서 중요한 일부 토큰 hidden state만 선택해 더 짧은 시퀀스로 문맥 표현하면 self-attention의 키 벨류 길이가 줄어 디코딩 비용을 크게 절감할 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://yoonschallenge.tistory.com/1209&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot;&gt;2026.03.03 - [인공지능/논문 리뷰 or 진행] - Sequential Efficient LLM 논문 -2&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1772522353892&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Sequential Efficient LLM 논문 -2&quot; data-og-description=&quot;https://arxiv.org/abs/2310.01732 Nugget: Neural Agglomerative Embeddings of TextEmbedding text sequences is a widespread requirement in modern language understanding. Existing approaches focus largely on constant-size representations. This is problematic, &quot; data-og-host=&quot;yoonschallenge.tistory.com&quot; data-og-source-url=&quot;https://yoonschallenge.tistory.com/1209&quot; data-og-url=&quot;https://yoonschallenge.tistory.com/1209&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bANH9a/dJMb89ya8Zx/Zj1HdBbwX55S4zbZVLZMn1/img.png?width=800&amp;amp;height=487&amp;amp;face=0_0_800_487,https://scrap.kakaocdn.net/dn/bVhQV2/dJMb8UHMKOP/COLONb1I7KJhheLLLWhg7k/img.png?width=800&amp;amp;height=487&amp;amp;face=0_0_800_487,https://scrap.kakaocdn.net/dn/lwrSa/dJMb8TB7bxi/K5VlK4BKOEYZWD3xFmL7Ok/img.png?width=2152&amp;amp;height=1214&amp;amp;face=0_0_2152_1214&quot;&gt;&lt;a href=&quot;https://yoonschallenge.tistory.com/1209&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://yoonschallenge.tistory.com/1209&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bANH9a/dJMb89ya8Zx/Zj1HdBbwX55S4zbZVLZMn1/img.png?width=800&amp;amp;height=487&amp;amp;face=0_0_800_487,https://scrap.kakaocdn.net/dn/bVhQV2/dJMb8UHMKOP/COLONb1I7KJhheLLLWhg7k/img.png?width=800&amp;amp;height=487&amp;amp;face=0_0_800_487,https://scrap.kakaocdn.net/dn/lwrSa/dJMb8TB7bxi/K5VlK4BKOEYZWD3xFmL7Ok/img.png?width=2152&amp;amp;height=1214&amp;amp;face=0_0_2152_1214');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Sequential Efficient LLM 논문 -2&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;https://arxiv.org/abs/2310.01732 Nugget: Neural Agglomerative Embeddings of TextEmbedding text sequences is a widespread requirement in modern language understanding. Existing approaches focus largely on constant-size representations. This is problematic,&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;yoonschallenge.tistory.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 사용한 nuggets를 또 사용하네요&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2232&quot; data-origin-height=&quot;932&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/mYNDF/dJMcag5HZxd/JW3PveRyMRosU8METaBCyK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/mYNDF/dJMcag5HZxd/JW3PveRyMRosU8METaBCyK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/mYNDF/dJMcag5HZxd/JW3PveRyMRosU8METaBCyK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FmYNDF%2FdJMcag5HZxd%2FJW3PveRyMRosU8METaBCyK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2232&quot; height=&quot;932&quot; data-origin-width=&quot;2232&quot; data-origin-height=&quot;932&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서도 t개의 토큰을 k개의 토큰으로 동적으로 표현함 (But 실험에서는 압축비로 제어)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;각 토큰에 대해 scorer가 점수를 매기고, 선택된 토큰의 hidden state만 nuggets으로 남김&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서도 top-k의 미분 불가가 문제였는데 STE를 적용해 end to end로 학습함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1892&quot; data-origin-height=&quot;1326&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/G1J71/dJMcabQQhJG/Lvjwi2uo3TkrfCMiimKFI1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/G1J71/dJMcabQQhJG/Lvjwi2uo3TkrfCMiimKFI1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/G1J71/dJMcabQQhJG/Lvjwi2uo3TkrfCMiimKFI1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FG1J71%2FdJMcabQQhJG%2FLvjwi2uo3TkrfCMiimKFI1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1892&quot; height=&quot;1326&quot; data-origin-width=&quot;1892&quot; data-origin-height=&quot;1326&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;질의 응답과 생성 테스트를 진행함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;입력을 다시 복원하는 실험에서 20배를 압축해도 98%를 복구하는 모습을 보여줬고, 다른 압축 방법에 비해 긴 입력에 유리하다고 알림&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Full text보다 좋은 perplexity를 보이기도 함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1754&quot; data-origin-height=&quot;1500&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/IgjBv/dJMcagEEwD2/cxLXUjmLik8zZS9zLeqCkK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/IgjBv/dJMcagEEwD2/cxLXUjmLik8zZS9zLeqCkK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/IgjBv/dJMcagEEwD2/cxLXUjmLik8zZS9zLeqCkK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FIgjBv%2FdJMcagEEwD2%2FcxLXUjmLik8zZS9zLeqCkK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1754&quot; height=&quot;1500&quot; data-origin-width=&quot;1754&quot; data-origin-height=&quot;1500&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;논문 한 줄 요약&lt;/td&gt;
&lt;td&gt;디코더-only LLM에서 &lt;b&gt;컨텍스트를 동적으로 압축한 hidden-state 집합(nuggets)&lt;/b&gt; 만 유지해 self-attention 비용을 줄이면서도 성능을 유지하는 &lt;b&gt;Dynamic Contextual Compression(DODO)&lt;/b&gt; 를 제안&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;해결하려는 문제&lt;/td&gt;
&lt;td&gt;긴 컨텍스트에서 self-attention이 &lt;b&gt;O(n&amp;sup2;)&lt;/b&gt; 로 증가해 &lt;b&gt;추론 시간/메모리&lt;/b&gt;가 급증. &lt;br /&gt;기존 희소/근사 attention은 LLM에서 효과&amp;middot;적용성이 제한적이라는 문제의식&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;핵심 아이디어&lt;/td&gt;
&lt;td&gt;입력 토큰 전체를 그대로 유지하지 않고, 각 레이어에서 &lt;b&gt;중요 토큰의 hidden state만 선택&lt;/b&gt;하여 길이 k(&amp;le;n)의 &lt;b&gt;nuggets&lt;/b&gt;로 컨텍스트를 표현 &amp;rarr; K/V 길이 감소로 연산 절감&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;표현&lt;/td&gt;
&lt;td&gt;표준: 토큰 n개 &amp;rarr; hidden state n개. &lt;br /&gt;DODO: 토큰 n개 &amp;rarr; &lt;b&gt;nuggets k개&lt;/b&gt;(동적)로 압축된 컨텍스트 표현&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;선택 메커니즘&lt;/td&gt;
&lt;td&gt;Scorer(점수 함수)가 토큰별 중요도를 산출하고 &lt;b&gt;Top-k 또는 threshold&lt;/b&gt;로 토큰 인덱스를 선택 &lt;br /&gt;&amp;rarr; 선택된 토큰 hidden state만 nuggets로 유지(레이어 간 선택 인덱스 일관성 유지)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;학습 핵심&lt;/td&gt;
&lt;td&gt;토큰 선택은 이산적이라 미분 불가 &amp;rarr; &lt;b&gt;Straight-Through Estimator(STE)&lt;/b&gt; 로 end-to-end 학습. &lt;br /&gt;attention logit에 (s &amp;minus; stopgrad(s)) 형태로 gradient를 흘려 &lt;b&gt;&amp;ldquo;미래에서 참조될 토큰&amp;rdquo;&lt;/b&gt; 을 선택하도록 유도&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;사용 모드 1: Autoregressive LM&lt;/td&gt;
&lt;td&gt;생성 시 미래를 볼 수 없으므로 &lt;b&gt;causal(온라인) threshold 선택(&amp;Lambda;)&lt;/b&gt; 을 사용. &lt;br /&gt;정보 손실 완화 위해 &lt;b&gt;최근 &amp;tau; 토큰은 미압축(원본 유지), 먼 과거만 nuggets로 압축(mixed resolution)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;사용 모드 2: Context Compressor&lt;/td&gt;
&lt;td&gt;문서가 먼저 주어지는 설정(QA/요약 등)에서는 입력 전체를 보고 &lt;b&gt;정확히 k=&amp;lceil;n/r&amp;rceil;개 Top-k 선택&lt;/b&gt; &lt;br /&gt;&amp;rarr; nuggets를 압축 컨텍스트로 만들고 디코더가 이를 조건화해 생성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 실험 1: Autoencoding&lt;/td&gt;
&lt;td&gt;nuggets로 입력을 압축 후 복원 시 &lt;b&gt;고압축에서도 거의 무손실&lt;/b&gt; 수준의 복원 성능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 실험 2: 제한 메모리 LM&lt;/td&gt;
&lt;td&gt;동일한 &amp;ldquo;저장 가능한 hidden state 수(64/128/256)&amp;rdquo; 제약에서 기존 방법(Compressive 등) 대비 &lt;b&gt;perplexity 개선&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 실험 3: Downstream(QA/요약)&lt;/td&gt;
&lt;td&gt;SQuAD zero-shot 등에서 압축비가 낮을수록 FULL에 근접. &lt;br /&gt;CNN/DailyMail 요약에서는 &lt;b&gt;10&amp;times; 압축에서도 Rouge가 경쟁적&lt;/b&gt;(일부 설정에서 FULL fine-tune과 비슷/상회)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;분석/해석&lt;/td&gt;
&lt;td&gt;선택된 토큰이 문장부호&amp;middot;접속사 등 &lt;b&gt;구/절 경계&lt;/b&gt;에 자주 위치(&amp;ldquo;문맥을 구조적으로 대표하는 토큰&amp;rdquo;을 잡는 경향). 근사 선택이 &amp;ldquo;거의 최적&amp;rdquo;에 가깝다는 중첩/갭 분석도 제시&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;기여(Contributions)&lt;/td&gt;
&lt;td&gt;(1) 디코더-only에서 &lt;b&gt;동적 길이 컨텍스트 압축 표현(nuggets)&lt;/b&gt;, &lt;br /&gt;(2) &lt;b&gt;STE 기반 hard selection 학습&lt;/b&gt; 정식화, (3) &lt;b&gt;생성/압축기 2-모드&lt;/b&gt;로 실용 적용, &lt;br /&gt;(4) 다양한 설정에서 &lt;b&gt;효율-성능 trade-off&lt;/b&gt; 실증&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;한계/리스크(해석)&lt;/td&gt;
&lt;td&gt;hard selection은 구현&amp;middot;학습 안정성(하이퍼파라미터 &amp;Lambda;, &amp;tau;, 압축비 r) 의존 가능. &lt;br /&gt;압축이 과도하면 long-range 정보 손실 위험(그래서 mixed resolution을 둠)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;결론 메시지&lt;/td&gt;
&lt;td&gt;디코더-only LLM도 긴 문맥을 &lt;b&gt;소수의 상태 벡터로 충분히 캡슐화&lt;/b&gt;할 수 있으며, 이를 통해 &lt;b&gt;추론 비용을 줄이면서 성능을 유지/개선&lt;/b&gt;할 수 있다&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2510.26622&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2510.26622&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1772525332439&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model&quot; data-og-description=&quot;Recent large language model (LLM) research has undergone an architectural shift from encoder-decoder modeling to nowadays the dominant decoder-only modeling. This rapid transition, however, comes without a rigorous comparative analysis especially \textit{f&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2510.26622&quot; data-og-url=&quot;https://arxiv.org/abs/2510.26622v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/QiBzn/dJMb9kT0zbx/kSvtSz5fasdUBYaKqaFJvK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/RKYMl/dJMb8XR3dWn/sLjPeDTuibAFY1Z6lbLav0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2510.26622&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2510.26622&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/QiBzn/dJMb9kT0zbx/kSvtSz5fasdUBYaKqaFJvK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/RKYMl/dJMb8XR3dWn/sLjPeDTuibAFY1Z6lbLav0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Recent large language model (LLM) research has undergone an architectural shift from encoder-decoder modeling to nowadays the dominant decoder-only modeling. This rapid transition, however, comes without a rigorous comparative analysis especially \textit{f&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이건 en-decoder랑 decoder only랑 정리해놓은 논문이네요&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1986&quot; data-origin-height=&quot;1056&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bkqxKv/dJMcaaEqRn5/R2bimrnMCvG8dkXcuSMCQ0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bkqxKv/dJMcaaEqRn5/R2bimrnMCvG8dkXcuSMCQ0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bkqxKv/dJMcaaEqRn5/R2bimrnMCvG8dkXcuSMCQ0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbkqxKv%2FdJMcaaEqRn5%2FR2bimrnMCvG8dkXcuSMCQ0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1986&quot; height=&quot;1056&quot; data-origin-width=&quot;1986&quot; data-origin-height=&quot;1056&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 20.3488%;&quot;&gt;문제의식&lt;/td&gt;
&lt;td style=&quot;width: 79.5349%;&quot;&gt;최근 LLM이 &lt;b&gt;encoder-decoder &amp;rarr; decoder-only&lt;/b&gt;로 이동했지만, &lt;b&gt;스케일링 관점(파라미터/컴퓨트 효율)&lt;/b&gt;에서 encoder-decoder가 과소평가되었을 수 있어 이를 재검증&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 20.3488%;&quot;&gt;비교 대상&lt;/td&gt;
&lt;td style=&quot;width: 79.5349%;&quot;&gt;&lt;b&gt;RedLLM(encoder-decoder)&lt;/b&gt; vs &lt;b&gt;DecLLM(decoder-only)&lt;/b&gt; 를 동일 스케일(&amp;asymp;150M~8B)에서 비교&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 20.3488%;&quot;&gt;RedLLM 설계&lt;/td&gt;
&lt;td style=&quot;width: 79.5349%;&quot;&gt;RoPE를 &lt;b&gt;encoder/decoder self-attn 및 cross-attn 전체&lt;/b&gt;에 적용, &lt;b&gt;continuous position&lt;/b&gt;, &lt;b&gt;embedding all-tied&lt;/b&gt;, 안정화 위해 &lt;b&gt;attn output에도 추가 norm&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 20.3488%;&quot;&gt;학습 목표&lt;/td&gt;
&lt;td style=&quot;width: 79.5349%;&quot;&gt;DecLLM은 &lt;b&gt;Causal LM&lt;/b&gt;, RedLLM은 &lt;b&gt;Prefix LM&lt;/b&gt; 사용&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 20.3488%;&quot;&gt;데이터/학습 설정&lt;/td&gt;
&lt;td style=&quot;width: 79.5349%;&quot;&gt;&lt;b&gt;RedPajama V1&lt;/b&gt;로 400K steps(&amp;asymp;&lt;b&gt;1.6T tokens&lt;/b&gt;) 프리트레인, 이후 &lt;b&gt;FLAN&lt;/b&gt;으로 인스트럭션 튜닝(입/출력 max 2048/512)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 20.3488%;&quot;&gt;평가&lt;/td&gt;
&lt;td style=&quot;width: 79.5349%;&quot;&gt;PPL 스케일링(in-domain RedPajama / out-of-domain Paloma) + 13개 다운스트림 태스크 &lt;b&gt;zero/few-shot&lt;/b&gt;, 프리트레인(PT)과 튜닝 후(FT) 모두 비교&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 20.3488%;&quot;&gt;주요 결과 1&lt;/td&gt;
&lt;td style=&quot;width: 79.5349%;&quot;&gt;&lt;b&gt;DecLLM이 더 파라미터 효율적&lt;/b&gt;(동일 파라미터에서 RedLLM 대비 일관되게 우수)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 20.3488%;&quot;&gt;주요 결과 2&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;width: 79.5349%;&quot;&gt;RedLLM은 &amp;ldquo;비슷한 조건&amp;rdquo;에서 학습에 &lt;b&gt;&amp;asymp;2배 FLOPs&lt;/b&gt;가 필요해 계산 비효율이 있으나, &lt;b&gt;컴퓨트 기준으로 비교하면 품질 격차가 거의 사라져 스케일링 곡선이 겹침&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 20.3488%;&quot;&gt;주요 결과 3&lt;/td&gt;
&lt;td style=&quot;width: 79.5349%;&quot;&gt;PPL-컴퓨트 관점의 &lt;b&gt;compute-optimal frontier는 대체로 DecLLM이 지배&lt;/b&gt;(특히 큰 컴퓨트에서)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 20.3488%;&quot;&gt;주요 결과 4&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;width: 79.5349%;&quot;&gt;프리트레인 동안 &lt;b&gt;RedLLM이 compute-optimal 학습에서 뒤처지고&lt;/b&gt;, zero/few-shot에서도 DecLLM 대비 열세 경향&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 20.3488%;&quot;&gt;주요 결과 5&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;width: 79.5349%;&quot;&gt;&amp;ldquo;&lt;b&gt;+BiAttn&lt;/b&gt;&amp;rdquo;은 DecLLM에서 &lt;b&gt;입력에 bidirectional attention&lt;/b&gt;을 허용한 변형이며, 튜닝/태스크 성능 분석에서 중요한 비교축으로 사용&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 20.3488%;&quot;&gt;논문이 말하고자 하는 결론&lt;/td&gt;
&lt;td style=&quot;width: 79.5349%;&quot;&gt;encoder-decoder는 &amp;ldquo;구식&amp;rdquo;이 아니라, &lt;b&gt;스케일링 기준을 명확히 잡으면(파라미터 vs 컴퓨트)&lt;/b&gt; DecLLM/RedLLM 각각 강점이 드러나며, 아키텍처 선택은 &lt;b&gt;효율-품질 트레이드오프&lt;/b&gt;로 재해석해야 함&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2503.10337&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2503.10337&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1772525914964&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;KV-Distill: Nearly Lossless Learnable Context Compression for LLMs&quot; data-og-description=&quot;Sequence-to-sequence tasks often benefit from long contexts, but the quadratic complexity of self-attention in standard Transformers renders this non-trivial. During generation, temporary representations -stored in the so-called KV cache-account for a larg&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2503.10337&quot; data-og-url=&quot;https://arxiv.org/abs/2503.10337v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bNun1Q/dJMb8WMnatc/3RbLHJux0Eg5Q4nswQMd90/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/8Oxs7/dJMb8VNsWYM/XW3wecoVUYMrI79DTqkUH0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2503.10337&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2503.10337&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bNun1Q/dJMb8WMnatc/3RbLHJux0Eg5Q4nswQMd90/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/8Oxs7/dJMb8VNsWYM/XW3wecoVUYMrI79DTqkUH0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;KV-Distill: Nearly Lossless Learnable Context Compression for LLMs&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Sequence-to-sequence tasks often benefit from long contexts, but the quadratic complexity of self-attention in standard Transformers renders this non-trivial. During generation, temporary representations -stored in the so-called KV cache-account for a larg&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 논문도 엄청 연관된 논문은 아니라서...&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결국 여기서도 gpu메모리 문제를 말하면서 캐시를 압축하려고 합니다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1661&quot; data-origin-height=&quot;718&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/czvWtO/dJMcagYU2PO/PfJ3P5hERmhsbRUKIWDiZk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/czvWtO/dJMcagYU2PO/PfJ3P5hERmhsbRUKIWDiZk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/czvWtO/dJMcagYU2PO/PfJ3P5hERmhsbRUKIWDiZk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FczvWtO%2FdJMcagYU2PO%2FPfJ3P5hERmhsbRUKIWDiZk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1661&quot; height=&quot;718&quot; data-origin-width=&quot;1661&quot; data-origin-height=&quot;718&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;원본 모델을 두고, 압축된 캐쉬가 생성 분포가 같아지도록 디스틸함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1495&quot; data-origin-height=&quot;945&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/mmmVm/dJMcahKj96g/BEAkLqELuqbRQvirN8H4L1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/mmmVm/dJMcahKj96g/BEAkLqELuqbRQvirN8H4L1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/mmmVm/dJMcahKj96g/BEAkLqELuqbRQvirN8H4L1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FmmmVm%2FdJMcahKj96g%2FBEAkLqELuqbRQvirN8H4L1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1495&quot; height=&quot;945&quot; data-origin-width=&quot;1495&quot; data-origin-height=&quot;945&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1577&quot; data-origin-height=&quot;547&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/d4LzhX/dJMcagLpGxf/GBCKkay83JGykkOC6Nfx7K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/d4LzhX/dJMcagLpGxf/GBCKkay83JGykkOC6Nfx7K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/d4LzhX/dJMcagLpGxf/GBCKkay83JGykkOC6Nfx7K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fd4LzhX%2FdJMcagLpGxf%2FGBCKkay83JGykkOC6Nfx7K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1577&quot; height=&quot;547&quot; data-origin-width=&quot;1577&quot; data-origin-height=&quot;547&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;주제&lt;/td&gt;
&lt;td&gt;&lt;b&gt;KV-DISTILL: Nearly Lossless Learnable Context Compression for LLMs&lt;/b&gt; &lt;br /&gt;&amp;mdash; LLM의 &lt;b&gt;KV cache를 학습적으로 압축&lt;/b&gt;해 긴 컨텍스트 추론의 메모리 병목을 줄이는 방법&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;해결하려는 문제&lt;/td&gt;
&lt;td&gt;긴 컨텍스트에서 &lt;b&gt;KV cache 메모리가 토큰 길이에 선형 증가&lt;/b&gt; &lt;br /&gt;&amp;rarr; 추론 시 GPU 메모리 병목. 기존 효율화는 성능 저하/설정 제약이 크며, 긴 컨텍스트를 모델이 충분히 활용 못하는 현상도 존재&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;목표/설정&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Question-independent context compression&lt;/b&gt;: 질문을 모르는 상태에서 문서를 미리 압축해 두고, 이후 여러 질문에 재사용해도 성능을 유지&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;핵심 아이디어&lt;/td&gt;
&lt;td&gt;원본 KV 조건의 next-token 분포(교사)와 압축 KV 조건 분포(학생)가 같아지도록 &lt;b&gt;distillation&lt;/b&gt; 수행&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;압축 구성요소 1: 토큰 선택&lt;/td&gt;
&lt;td&gt;컨텍스트 토큰 hidden state &amp;rarr; &lt;b&gt;scorer(FFN)&lt;/b&gt;로 중요도 점수 산출 &lt;br /&gt;&amp;rarr; &lt;b&gt;top-k&lt;/b&gt; 토큰 선택(모든 레이어에 동일 선택 적용). &lt;br /&gt;top-k 비미분 문제는 학습 시 attention 감쇠로 scorer에 신호 전달&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;압축 구성요소 2: 조건부 LoRA&lt;/td&gt;
&lt;td&gt;단순 삭제가 아니라 선택 토큰이 정보까지 &amp;ldquo;흡수&amp;rdquo;하도록 &lt;b&gt;conditional computation&lt;/b&gt; 적용. &lt;br /&gt;구현은 선택 토큰에 대해 transformer의 &lt;b&gt;W_Q, W_O에 LoRA 라우팅&lt;/b&gt;(선택 토큰 인지)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;학습 목표(손실)&lt;/td&gt;
&lt;td&gt;원본 분포 (p) vs 압축 분포 (&lt;span&gt;q_&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&amp;theta;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;)에 대해 &lt;b&gt;forward KL + reverse KL 혼합&lt;/b&gt;으로 next-token 분포 정렬: &lt;span&gt;&lt;span&gt;&amp;lambda;&lt;/span&gt;&lt;span&gt;&lt;span&gt;D_{&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;K&lt;/span&gt;&lt;span&gt;L}&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;​&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;p&lt;/span&gt;&lt;span&gt;∥&lt;/span&gt;&lt;span&gt;q&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;span&gt;+&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;&amp;minus;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&amp;lambda;&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;span&gt;&lt;span&gt;D_{&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;K&lt;/span&gt;&lt;span&gt;L}&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;​&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;q&lt;/span&gt;&lt;span&gt;∥&lt;/span&gt;&lt;span&gt;p&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/span&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;학습 데이터/절차&lt;/td&gt;
&lt;td&gt;Self-Instruct, P3, LongAlpaca, Super-Natural Instructions 등으로 (Context, Instruction, Answer) 구성. &lt;br /&gt;①교사 logits 생성 &amp;rarr; ②컨텍스트만 압축해 학생 logits 생성 &amp;rarr; ③KL 혼합 손실로 정렬&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;추론(사용) 방식&lt;/td&gt;
&lt;td&gt;고정 컨텍스트는 &lt;b&gt;1회 압축해 저장&lt;/b&gt; 후 재사용, 이후 자동회귀 디코딩은 &lt;b&gt;추가 오버헤드 없이&lt;/b&gt; 압축 KV cache로 진행&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과 요약&lt;/td&gt;
&lt;td&gt;Needle-in-a-Haystack에서 &lt;b&gt;대폭 높은 정확도&lt;/b&gt;(예: KV 90% 제거 후에도 매우 강함). &lt;br /&gt;SQuAD에서 20&amp;ndash;25% KV 유지 시 base에 근접하며, H2I/ICAE/DODO 대비 우수. &lt;br /&gt;QuALITY/요약에서도 &lt;b&gt;10x~100x 이상&lt;/b&gt; 압축에서 성능 유지 가능성을 제시&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;기여(한 줄)&lt;/td&gt;
&lt;td&gt;&amp;ldquo;텍스트를 줄이는&amp;rdquo; 대신, LLM이 실제로 쓰는 &lt;b&gt;KV cache 자체를 distill&lt;/b&gt;하여 &lt;b&gt;질문-독립적이고 거의 무손실에 가까운 컨텍스트 압축&lt;/b&gt;을 달성&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1210</guid>
      <comments>https://yoonschallenge.tistory.com/1210#entry1210comment</comments>
      <pubDate>Tue, 3 Mar 2026 17:27:11 +0900</pubDate>
    </item>
    <item>
      <title>Sequential Efficient LLM 논문 -2</title>
      <link>https://yoonschallenge.tistory.com/1209</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2310.01732&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2310.01732&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1772515267943&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Nugget: Neural Agglomerative Embeddings of Text&quot; data-og-description=&quot;Embedding text sequences is a widespread requirement in modern language understanding. Existing approaches focus largely on constant-size representations. This is problematic, as the amount of information contained in text often varies with the length of t&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2310.01732&quot; data-og-url=&quot;https://arxiv.org/abs/2310.01732v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bCGsj0/dJMb89ya750/D31fn2FLKKqTRxwsY7HN7k/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bTBaLf/dJMb86nU604/JqmEdJ6C49eOSAAm2aT2K0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2310.01732&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2310.01732&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bCGsj0/dJMb89ya750/D31fn2FLKKqTRxwsY7HN7k/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bTBaLf/dJMb86nU604/JqmEdJ6C49eOSAAm2aT2K0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Nugget: Neural Agglomerative Embeddings of Text&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Embedding text sequences is a widespread requirement in modern language understanding. Existing approaches focus largely on constant-size representations. This is problematic, as the amount of information contained in text often varies with the length of t&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;고정 길이 임베딩은 문장 길이와 정보량이 달라도 동일한 크기로 압축해야 해서 긴 텍스트에서 정보 손실 커질 수 있음!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰을 전부 저장하는 ColBERT류는 정보는 풍부하지만 메모리나 인덱싱 비용이 매우 큼&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2042&quot; data-origin-height=&quot;1244&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/CJkpX/dJMcag5HUyb/FI0APczLYEkHG3FhugPBok/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/CJkpX/dJMcag5HUyb/FI0APczLYEkHG3FhugPBok/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/CJkpX/dJMcag5HUyb/FI0APczLYEkHG3FhugPBok/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FCJkpX%2FdJMcag5HUyb%2FFI0APczLYEkHG3FhugPBok%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2042&quot; height=&quot;1244&quot; data-origin-width=&quot;2042&quot; data-origin-height=&quot;1244&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 의미적으로 유용한 적정 granularity를 찾아야 함. 텍스트 길이에 따라 동적으로 늘어야 함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1138&quot; data-origin-height=&quot;1244&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Tf9XX/dJMcadHRflO/vbMZ7XB5tbVVqqiTMgGSo0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Tf9XX/dJMcadHRflO/vbMZ7XB5tbVVqqiTMgGSo0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Tf9XX/dJMcadHRflO/vbMZ7XB5tbVVqqiTMgGSo0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FTf9XX%2FdJMcadHRflO%2FvbMZ7XB5tbVVqqiTMgGSo0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1138&quot; height=&quot;1244&quot; data-origin-width=&quot;1138&quot; data-origin-height=&quot;1244&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;중요도 점수를 통해 top-k 토큰만 선택해 nugget을 구성하고, 여기서 k는 압축비로 정해져 문서가 길어지면 nuggets수도 늘어남&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 top-k는 미분 불가하여 selector가 학습 신호를 받지 못하는 문제가 있음 =&amp;gt; 여기서 residual을 통해 gradient가 흐르도록 만듬&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1138&quot; data-origin-height=&quot;1018&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/BUcAe/dJMcafZZ16k/L4QXJk9mPJKInT7kLH5ALk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/BUcAe/dJMcafZZ16k/L4QXJk9mPJKInT7kLH5ALk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/BUcAe/dJMcafZZ16k/L4QXJk9mPJKInT7kLH5ALk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FBUcAe%2FdJMcafZZ16k%2FL4QXJk9mPJKInT7kLH5ALk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1138&quot; height=&quot;1018&quot; data-origin-width=&quot;1138&quot; data-origin-height=&quot;1018&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1952&quot; data-origin-height=&quot;1508&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ca1yjp/dJMcafyYcsM/VMuCBB98D7IpaeGIVDGNwK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ca1yjp/dJMcafyYcsM/VMuCBB98D7IpaeGIVDGNwK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ca1yjp/dJMcafyYcsM/VMuCBB98D7IpaeGIVDGNwK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fca1yjp%2FdJMcafyYcsM%2FVMuCBB98D7IpaeGIVDGNwK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1952&quot; height=&quot;1508&quot; data-origin-width=&quot;1952&quot; data-origin-height=&quot;1508&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Nugget이 자주 선택하는 토큰은 구두점, 접속사, 선치사, eos 등 절/구 셩계 성격의 delimiter로 나타남 =&amp;gt; 앞 구간을 요약하는 summary token처럼 작동한다고 해석&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;성능 복구에 큰 문제가 없고, ColBART대비 훨씬 적은 벡터로 비슷한 성능을 낼 수 있음&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 716px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;한 줄 핵심&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;텍스트 정보량은 길이/구조에 따라 달라지므로, &lt;b&gt;고정 크기(1벡터)&lt;/b&gt; 와 &lt;b&gt;토큰 전부 저장(다수 벡터)&lt;/b&gt; 사이의 절충으로, 입력 길이에 비례해 &lt;b&gt;동적으로 선택된 일부 토큰만을 다중 벡터(nuggets)로 표현&lt;/b&gt;하는 방법(NUGGET)을 제안.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;문제의식&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;(1) 1개/상수개 벡터 표현은 긴 텍스트에서 정보 손실 위험, &lt;br /&gt;(2) 토큰 수준 저장은 비용 과다 &amp;rarr; &amp;ldquo;의미적으로 유용한 granularity&amp;rdquo;가 필요.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;제안 방법 개요&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;입력 토큰 임베딩 (X)에서 &lt;b&gt;토큰별 점수 (s)&lt;/b&gt; 를 계산하고, &lt;b&gt;Top-k 토큰만 선택&lt;/b&gt;해 nuggets (Z)를 구성하는 &lt;b&gt;가변 길이 multi-vector embedding&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 20px;&quot;&gt;
&lt;td style=&quot;height: 20px; width: 18.9535%;&quot;&gt;k(벡터 개수) 설정&lt;/td&gt;
&lt;td style=&quot;height: 20px; width: 80.9302%;&quot;&gt;고정 k가 아니라 &lt;b&gt;압축비 &lt;b&gt; &lt;span&gt;&lt;span&gt;rr&lt;/span&gt;&lt;/span&gt;&lt;/b&gt;로 &lt;span&gt;&lt;span&gt;k=&amp;lceil;n&amp;sdot;r&amp;rceil;&lt;/span&gt;&lt;/span&gt;&amp;nbsp;&amp;rarr;&lt;/b&gt;&amp;nbsp;입력이 길수록 nugget 수가 증가(가변 표현).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;핵심 난점 &amp;amp; 해결&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;TopK 선택은 비미분이라 selector가 학습 신호를 못 받음 &amp;rarr; 디코더 cross-attention logit에 &lt;b&gt;(s)를 residual로 더해&lt;/b&gt; gradient가 selector로 흐르게 함(식(5)).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 60px;&quot;&gt;
&lt;td style=&quot;height: 60px; width: 18.9535%;&quot;&gt;Informed Nugget Encoding&lt;/td&gt;
&lt;td style=&quot;height: 60px; width: 80.9302%;&quot;&gt;nugget 선택이 encoder 표현에도 반영되도록, encoder &lt;b&gt;l번째 레이어&lt;/b&gt;에서 (s)를 미리 계산하고 nugget/비-nugget에 &lt;b&gt;type embedding&lt;/b&gt;을 더해 다음 레이어로 전달(식(7)(8)); &lt;br /&gt;학습 안정화를 위해 &lt;b&gt;하위 l개 레이어 freeze&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;학습 목표&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;데이터셋에 따라 &lt;b&gt;Auto-Encoding(AE)&lt;/b&gt; 혹은 &lt;b&gt;Machine Translation(MT)&lt;/b&gt; 로 end-to-end 학습(문서 수준으로 문장 연결).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;내재 평가&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;압축비 (r)에 따른 BLEU로 &amp;ldquo;semantic completeness&amp;rdquo; 평가: &lt;br /&gt;&lt;b&gt;r=0.1에서 성능 포화&lt;/b&gt;, AE의 경우 &lt;b&gt;r&amp;ge;0.1이면 BLEU&amp;gt;0.99(거의 verbatim, almost lossless)&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;nugget이 선택하는 토큰&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;균등 선택이 아니라 &lt;b&gt;구두점/접속사/전치사 등 delimiter&lt;/b&gt;를 선호하며, 이를 &lt;b&gt;segment summary token&lt;/b&gt;처럼 해석.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;nugget이 담는 정보&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;특정 nugget만 노출해 decoding 시 확률 증가(&amp;ldquo;probability gain&amp;rdquo;)을 측정 &lt;br /&gt;&amp;rarr; 각 nugget이 주로 &lt;b&gt;자기 이전 연속 구간&lt;/b&gt; 복원에 도움 &lt;br /&gt;&amp;rarr; delimiter 기반 &lt;b&gt;divide-and-conquer 분절 인코딩&lt;/b&gt; 가설을 제시.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;외재 평가 1: 문서 유사도&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;&lt;b&gt;문서-수준 paraphrase identification(ParaBank 기반)&lt;/b&gt;: &lt;br /&gt;1개 정답 + BM25로 19개 hard negative(총 20개) 중 정답 선택.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;외재 평가 2: passage reranking&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;WikiText-103에서 lead section을 query로, 같은 문서의 다른 section을 positive로 두고 BM25로 19개 negative를 구성해 20개 중 랭킹.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 36px;&quot;&gt;
&lt;td style=&quot;height: 36px; width: 18.9535%;&quot;&gt;유사도 성능&lt;/td&gt;
&lt;td style=&quot;height: 36px; width: 80.9302%;&quot;&gt;Table 2(MRR&amp;times;100): &lt;br /&gt;NUGGET(MT, r=0.25) &lt;b&gt;PI 97.38 / RR 56.51&lt;/b&gt;, ColBART &lt;b&gt;PI 94.83 / RR 52.44&lt;/b&gt;, TSDAE(AE) &lt;b&gt;PI 95.59 / RR 50.48&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;비용-성능 주장&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;PI(RR)에서 NUGGET이 ColBART급 성능을 내면서도, ColBART는 텍스트 인코딩에 &lt;b&gt;훨씬 많은 벡터(PI 20x, RR 6.7x)&lt;/b&gt; 를 사용한다고 서술.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;장문 컨텍스트 LM 확장&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;과거 토큰을 nugget으로 압축하고, 최근 s토큰은 self-attn, 과거 nuggets는 cross-attn으로 읽는 형태로 LM을 구성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;LM 성능&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;Table 3(PPL): &lt;br /&gt;예) r=0.05, h=8에서 &lt;b&gt;28.14&lt;/b&gt; vs full-attn baseline(h=0) &lt;b&gt;31.46&lt;/b&gt;. &lt;br /&gt;또한 &amp;ldquo;NUGGET-assisted 모델이 full-attn baseline보다 낮은 PPL&amp;rdquo;이라고 결론.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;Ablation&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;피드백 제거/selector 대체 등 분석: 기본 설정(l=3, r=0.1)이 강하며, l=0(임베딩층)로 selector를 두면 PI/RR 급락&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px; width: 18.9535%;&quot;&gt;결론/의의&lt;/td&gt;
&lt;td style=&quot;height: 40px; width: 80.9302%;&quot;&gt;(i) &lt;b&gt;동적 multi-vector 표현&lt;/b&gt;을 통해 고정 벡터 vs 토큰 전부 저장의 간극을 메움, &lt;br /&gt;(ii) delimiter 기반 자연 분절, &lt;br /&gt;(iii) 문서 유사도/장문 LM에서 유효, &lt;br /&gt;(iv) 향후 contrastive learning 등 추가 학습을 제안.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2404.11912&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2404.11912&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1772517537108&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding&quot; data-og-description=&quot;With large language models (LLMs) widely deployed in long content generation recently, there has emerged an increasing demand for efficient long-sequence inference support. However, key-value (KV) cache, which is stored to avoid re-computation, has emerged&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2404.11912&quot; data-og-url=&quot;https://arxiv.org/abs/2404.11912v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/ddXwe4/dJMb9frC2Ic/klISomWRKmRlJn6vlT0z2K/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/kWASd/dJMb8VNsV2Y/M65EwTHolbiqoHv4uq99B1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2404.11912&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2404.11912&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/ddXwe4/dJMb9frC2Ic/klISomWRKmRlJn6vlT0z2K/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/kWASd/dJMb8VNsV2Y/M65EwTHolbiqoHv4uq99B1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;With large language models (LLMs) widely deployed in long content generation recently, there has emerged an increasing demand for efficient long-sequence inference support. However, key-value (KV) cache, which is stored to avoid re-computation, has emerged&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;colm 2024에 붙은 논문이네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 llm추론에서 kv cache 병목을 말하네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;시퀀스 길이마다 선형 증가하고, gpu 메모리에 올리기 등 다양하게 리소스를 소모&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 출력 분포를 정확히 보존하며 긴 입력에서 토큰당 지연 시간을 줄이자!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2152&quot; data-origin-height=&quot;1214&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/BykYM/dJMcacoGUSG/Wlh3qbqxVKb1LhAmOq6xFk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/BykYM/dJMcacoGUSG/Wlh3qbqxVKb1LhAmOq6xFk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/BykYM/dJMcacoGUSG/Wlh3qbqxVKb1LhAmOq6xFk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FBykYM%2FdJMcacoGUSG%2FWlh3qbqxVKb1LhAmOq6xFk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2152&quot; height=&quot;1214&quot; data-origin-width=&quot;2152&quot; data-origin-height=&quot;1214&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;hierarhical speculative decoding 시스템을 통해 model weight, kv cache 이 두 병목을 해결하려고 함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Draft model - llama 68M + streaming LLM cache&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Retrieval chach - full kv에서 중요한 청크만 뽑아 만든 partial KV cache&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Target model - long context llm, full kv cache&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;뭐 이렇게 나눠서 캐시를 구성하고, 검색기로 kv가 높은 청크를 가져와서 넣어주고 하는데.... 일단 여긴 너무 제가 하는 거랑은 다른 느낌이라 이정도만....&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 400px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;논문/핵심 주장&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;&lt;b&gt;TRIFORCE&lt;/b&gt;는 &lt;b&gt;계층적(hierarchical) speculative decoding&lt;/b&gt;으로, &lt;b&gt;출력 분포를 보존(lossless)&lt;/b&gt; 하면서 &lt;b&gt;롱컨텍스트 생성 속도&lt;/b&gt;를 크게 올리는 시스템을 제안한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;해결하려는 문제&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;롱컨텍스트 추론에서는 토큰마다 &lt;b&gt;모델 weight + 거대 KV cache&lt;/b&gt;를 반복 로드해야 해서 지연이 커진다. &lt;br /&gt;기존 KV eviction/압축은 KV를 되돌릴 수 없어 &lt;b&gt;정확도 저하&lt;/b&gt;가 발생한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;핵심 관찰&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;(1) &lt;b&gt;Dual bottleneck&lt;/b&gt;: KV cache가 weight 못지않은 병목 &lt;br /&gt;(2) &lt;b&gt;Attention sparsity&lt;/b&gt;: 일부 KV만으로도 attention score 대부분을 회복 가능 &lt;br /&gt;(3) &lt;b&gt;Contextual locality&lt;/b&gt;: 연속 토큰들이 비슷한 long-context를 참조해 retrieval cache를 재사용 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;방법&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Target 큰 모델 (M_p)+&lt;b&gt;full KV&lt;/b&gt; (C_p), &lt;b&gt;retrieval cache&lt;/b&gt; (C_r)(full KV에서 top chunk만 뽑은 partial KV), Draft 작은 모델 (M_q)+StreamingLLM cache (C_q)를 사용.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;방법&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;① (M_q)가 빠르게 draft 생성 &amp;rarr; &lt;br /&gt;② (M_p)+(C_r)로 1차 검증/수정(=KV 병목 완화) &amp;rarr; &lt;br /&gt;③ (M_p)+(C_p)로 최종 검증(=lossless 보장). acceptance가 떨어지면 (C_r) 재구성.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;Retrieval cache 구성&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;full KV를 chunk로 나누고, 현재 query와 각 chunk의 평균 key 간 attention으로 점수화해 &lt;b&gt;상위 chunk를 budget(예: 4K) 내로 선택&lt;/b&gt;하여 (C_r)를 만든다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;주요 결과&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;A100에서 122K 프롬프트 + 256 생성 조건에 &lt;b&gt;최대 2.31&amp;times;&lt;/b&gt; 가속(acceptance ~0.92).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;주요 결과&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;2&amp;times;RTX4090에서 128K 컨텍스트: Llama2-7B &lt;b&gt;7.78&amp;times;&lt;/b&gt;, Llama2-13B &lt;b&gt;7.94&amp;times;&lt;/b&gt; 토큰 지연 개선. 1&amp;times;4090에서도 ZeRO-Inference 대비 &lt;b&gt;4.86&amp;times;&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;확장/추가 실험&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;더 긴 입력(256K/512K)에서도 큰 speedup을 보고(예: 11.81&amp;times;, 12.10&amp;times;).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 40px;&quot;&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;의의&lt;/td&gt;
&lt;td style=&quot;height: 40px;&quot;&gt;롱컨텍스트 서빙의 두 병목(Weight/KV)을 &lt;b&gt;계층적 speculation&lt;/b&gt;으로 분해해 해결하며, &lt;b&gt;정확도 손실 없이(lossless)&lt;/b&gt; 실용적인 대규모 가속을 달성한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2405.17951&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2405.17951&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1772518825756&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Efficient Time Series Processing for Transformers and State-Space Models through Token Merging&quot; data-og-description=&quot;Despite recent advances in subquadratic attention mechanisms or state-space models, processing long token sequences still imposes significant computational requirements. Token merging has emerged as a solution to increase computational efficiency in comput&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2405.17951&quot; data-og-url=&quot;https://arxiv.org/abs/2405.17951v4&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/dpZZse/dJMb9kT0yd0/AYohOY2VlaJ0ECKyGcCzu0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/kcqDC/dJMb81fQcni/CJgkw8BjfrY6akh2qkBmVK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2405.17951&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2405.17951&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/dpZZse/dJMb9kT0yd0/AYohOY2VlaJ0ECKyGcCzu0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/kcqDC/dJMb81fQcni/CJgkw8BjfrY6akh2qkBmVK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Efficient Time Series Processing for Transformers and State-Space Models through Token Merging&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Despite recent advances in subquadratic attention mechanisms or state-space models, processing long token sequences still imposes significant computational requirements. Token merging has emerged as a solution to increase computational efficiency in comput&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;4번의 시도 끝에 icml 2025에 붙었네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서도 동일하게 시계열 데이터는 토큰 길이가 길어질수록 리소스가 제곱으로 커지는 것을 말합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;비전에서는 token merging이 효율 개선에 효과적이었음 - 시계열 도메인, SSM, Decoder로의 확장이 제대로 이루어지지 않음!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1650&quot; data-origin-height=&quot;1120&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Lyvr7/dJMcadVopBr/2oAfRNCKCYBFJIIkZiRbF1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Lyvr7/dJMcadVopBr/2oAfRNCKCYBFJIIkZiRbF1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Lyvr7/dJMcadVopBr/2oAfRNCKCYBFJIIkZiRbF1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FLyvr7%2FdJMcadVopBr%2F2oAfRNCKCYBFJIIkZiRbF1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1650&quot; height=&quot;1120&quot; data-origin-width=&quot;1650&quot; data-origin-height=&quot;1120&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Token Merging을 시계열에 맞게 재설계해야 함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;매 레이어에서 토큰을 두 집합으로 나눈뒤 코사인 유사도 행렬을 통해 가장 유사한 쌍들을 골라 평균으로 병합. = 이 것도 계산이 제곱이라 긴 시계열 입력엔 비효율적 !&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 유사도 계산을 전체가 아닌 로컬(이웃) 범위에서만 수행하도록 제안! (k가 커지면 범위가 넓어져 제곱에 가까워지고, k가 작아질 수록 로컬로 작아져 선형에 가까워짐)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;디코딩 때 차원을 맞춰줘야 하기 때문에 마지막에 unmerge 단계를 둔다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1804&quot; data-origin-height=&quot;1224&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cWAn9A/dJMcacPLHpg/FPGmnq78FYJoEdECPcBA90/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cWAn9A/dJMcacPLHpg/FPGmnq78FYJoEdECPcBA90/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cWAn9A/dJMcacPLHpg/FPGmnq78FYJoEdECPcBA90/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcWAn9A%2FdJMcacPLHpg%2FFPGmnq78FYJoEdECPcBA90%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1804&quot; height=&quot;1224&quot; data-origin-width=&quot;1804&quot; data-origin-height=&quot;1224&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;pre-trained transformer를 추가학습 없이 가속할 수 있었음&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1982&quot; data-origin-height=&quot;1224&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ckIJR3/dJMcaaj7eha/hVmbOPhKM4UKi7YohbftPK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ckIJR3/dJMcaaj7eha/hVmbOPhKM4UKi7YohbftPK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ckIJR3/dJMcaaj7eha/hVmbOPhKM4UKi7YohbftPK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FckIJR3%2FdJMcaaj7eha%2FhVmbOPhKM4UKi7YohbftPK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1982&quot; height=&quot;1224&quot; data-origin-width=&quot;1982&quot; data-origin-height=&quot;1224&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;문제의식&lt;/td&gt;
&lt;td&gt;긴 시계열 입력에서 &lt;b&gt;Transformer는 self-attention 때문에 O(t&amp;sup2;)&lt;/b&gt;로 비용이 급증하고, &lt;b&gt;SSM도 매우 긴 시퀀스에서는 여전히 부담&lt;/b&gt;이 큼. &lt;br /&gt;비전에서의 token merging은 잘 알려졌지만, &lt;b&gt;시계열/SSM/decoder(인과적 생성)&lt;/b&gt;로의 일반화가 부족함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;핵심 주장&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Token Merging을 시계열 특성(시간적 국소성)과 인과성&lt;/b&gt;에 맞게 재설계하면, &lt;b&gt;추가 학습 없이도(또는 최소로) 속도를 크게 올리면서 성능 저하를 작게&lt;/b&gt; 만들 수 있고, 경우에 따라 성능 향상도 가능.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;기본 병합&lt;/td&gt;
&lt;td&gt;토큰을 두 집합(A,B)으로 나누고, A&amp;ndash;B 간 &lt;b&gt;코사인 유사도&lt;/b&gt;로 유사한 쌍을 골라 &lt;b&gt;평균(Convex/average)으로 병합&lt;/b&gt;해 토큰 수를 줄임.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;기존(Global) 한계&lt;/td&gt;
&lt;td&gt;전역 유사도 행렬 계산이 필요해 &lt;b&gt;O(t&amp;sup2;)&lt;/b&gt; 오버헤드가 발생 &amp;rarr; 긴 시계열에 비효율.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Local Token Merging&amp;nbsp;&lt;/td&gt;
&lt;td&gt;유사도 비교를 &lt;b&gt;시간적으로 가까운 토큰 쌍(‖i&amp;minus;j‖&amp;lt;k)&lt;/b&gt;으로 제한해 계산을 줄임. &lt;br /&gt;k로 &lt;b&gt;효율&amp;ndash;정확도 트레이드오프를 연속적으로 제어&lt;/b&gt;(k가 작을수록 더 선형에 가까움).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Causal Token Merging (Decoder 적용)&lt;/td&gt;
&lt;td&gt;일반 merging은 미래 정보 혼합으로 &lt;b&gt;비인과성&lt;/b&gt; 문제가 있어 decoder에 어렵지만, &lt;b&gt;k=1(인접 토큰만 병합)&lt;/b&gt;을 쓰면 인과성을 유지하며 적용 가능하다고 주장. &lt;br /&gt;출력 정합을 위해 마지막에 &lt;b&gt;unmerge(복원)&lt;/b&gt; 단계(병합 토큰을 인접 동일 토큰으로 복제) 추가.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Dynamic Token Merging (적응형 병합)&lt;/td&gt;
&lt;td&gt;레이어/배치마다 병합 가능성이 다르므로 &lt;b&gt;유사도 임계값 기반으로 병합 개수(r)를 동적으로 결정&lt;/b&gt;(특히 작은 배치/온디바이스 환경에서 유리하다고 제안).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;적용 위치(구현 관점)&lt;/td&gt;
&lt;td&gt;Transformer에서는 대체로 &lt;b&gt;self-attention 이후(MLP 전)&lt;/b&gt;에 merging을 넣는 구성이 유리하다고 보고.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;실험 범위(모델/데이터)&lt;/td&gt;
&lt;td&gt;시계열 forecasting(ETT/Weather/Electricity/Traffic 등)에서 여러 time-series transformer로 평가, 시계열 foundation model &lt;b&gt;Chronos&lt;/b&gt;에서 zero-shot 평가, SSM 계열(&lt;b&gt;HyenaDNA, Mamba&lt;/b&gt;)에서도 비교/검증.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과 1: Pretrained TS Transformer 가속&lt;/td&gt;
&lt;td&gt;다양한 아키텍처/데이터셋에서 &lt;b&gt;throughput을 크게 올리면서 MSE 변화는 작게&lt;/b&gt; 유지(깊은 모델일수록 이득이 커지는 경향 관찰).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과 2: 학습 시 병합으로 안정화&lt;/td&gt;
&lt;td&gt;inference 때만 merging을 넣을 때 성능이 흔들리는 경우에, &lt;b&gt;training에도 merging을 적용하면 정확도 손실 없이 가속&lt;/b&gt;(학습도 최대 2.27&amp;times; 가속 보고).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과 3: Chronos에서 큰 가속(+성능 향상 사례)&lt;/td&gt;
&lt;td&gt;Chronos에서 local merging이 Pareto-optimal 지점을 만들고, 일부 데이터셋에서 &lt;b&gt;정확도와 속도를 동시에 개선&lt;/b&gt;. 최대 &lt;b&gt;54.76&amp;times; 속도 향상&lt;/b&gt;, 최대 &lt;b&gt;9% MSE 개선&lt;/b&gt; 보고.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과 4: SSM에도 유효(특히 local)&lt;/td&gt;
&lt;td&gt;16k 길이에서 local(k=1)이 global 대비 &lt;b&gt;더 좋은 정확도&amp;ndash;속도 트레이드오프&lt;/b&gt;를 보였다고 주장. global은 유사도 계산 오버헤드가 커질 수 있음을 수치로 강조.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;왜 성능이 좋아질 수 있나&lt;/td&gt;
&lt;td&gt;token merging을 &lt;b&gt;선택적 스무딩(적응적 저역통과 필터)&lt;/b&gt;로 해석: &lt;br /&gt;노이즈 감소로 예측이 좋아질 수 있으며, 실제로 low-pass filtering과 유사한 경향 및 스펙트럼 지표(예: spectral entropy/THD)와의 상관을 보고.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;결론/의의&lt;/td&gt;
&lt;td&gt;&lt;b&gt;시계열 Transformer + SSM + decoder&lt;/b&gt;까지 포괄적으로 token merging을 확장해, 긴 시퀀스에서 &lt;b&gt;효율을 실질적으로 끌어올리는 범용 모듈&lt;/b&gt;로 제시.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1209</guid>
      <comments>https://yoonschallenge.tistory.com/1209#entry1209comment</comments>
      <pubDate>Tue, 3 Mar 2026 16:09:58 +0900</pubDate>
    </item>
    <item>
      <title>Sequential Efficient LLM 논문 -1</title>
      <link>https://yoonschallenge.tistory.com/1208</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2006.03236&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2006.03236&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1772458286699&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Funnel-Transformer: Filtering out Sequential Redundancy for Efficient Language Processing&quot; data-og-description=&quot;With the success of language pretraining, it is highly desirable to develop more efficient architectures of good scalability that can exploit the abundant unlabeled data at a lower cost. To improve the efficiency, we examine the much-overlooked redundancy &quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2006.03236&quot; data-og-url=&quot;https://arxiv.org/abs/2006.03236v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/garcs/dJMb83kqrKB/B9IXGikTolmvycUbAhKKSK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/jqPOd/dJMb9dHlzmU/iFXJaJidWegCvKmD7L4KRk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2006.03236&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2006.03236&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/garcs/dJMb83kqrKB/B9IXGikTolmvycUbAhKKSK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/jqPOd/dJMb9dHlzmU/iFXJaJidWegCvKmD7L4KRk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Funnel-Transformer: Filtering out Sequential Redundancy for Efficient Language Processing&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;With the success of language pretraining, it is highly desirable to develop more efficient architectures of good scalability that can exploit the abundant unlabeled data at a lower cost. To improve the efficiency, we examine the much-overlooked redundancy&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Transformer가 모든 layer에서 토큰 길이를 끝까지 유도하는 것은 리소스 소모가 과하고, 시퀀스 전체를 하나의 벡터로 요약해 사용하는 다운스트림 테스크에서는 그 표현이 상당히 중복될 수 있다고 말한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;BERT 학습 이후 성능을 올리려면 더 크고 길게 학습이 필요하지만 메모리 비용이 폭증하기에 기존 증류, 프로닝, 양자화나 블록 재설계도 있지만 Transformer의 비용원인인 full-length 토큰 시퀀스를 유지하는 설계 자체가 낭비라고 봄&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;946&quot; data-origin-height=&quot;597&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/TR0uV/dJMcagki3I7/f4c2WVn9CjzhTmqCbSjMdk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/TR0uV/dJMcagki3I7/f4c2WVn9CjzhTmqCbSjMdk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/TR0uV/dJMcagki3I7/f4c2WVn9CjzhTmqCbSjMdk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FTR0uV%2FdJMcagki3I7%2Ff4c2WVn9CjzhTmqCbSjMdk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;946&quot; height=&quot;597&quot; data-origin-width=&quot;946&quot; data-origin-height=&quot;597&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기선 Encoder로 압축, Decoder로 복원을 진행하여 Transformer의 구조 자체는 동일하지만 Encoder Block 사이 사이에 Stride 2, Window 2의 간단한 mean pooling을 활용하여 토큰 길이를 줄인다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Decoder는 줄어든 길이를 한꺼번에 늘려서 이전에 압축 전에 있던 hidden state를 연결하여 사용&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1894&quot; data-origin-height=&quot;1402&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cSoXKZ/dJMcaaLaLs9/VAdnbSuKbrEIEz3KeYdk01/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cSoXKZ/dJMcaaLaLs9/VAdnbSuKbrEIEz3KeYdk01/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cSoXKZ/dJMcaaLaLs9/VAdnbSuKbrEIEz3KeYdk01/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcSoXKZ%2FdJMcaaLaLs9%2FVAdnbSuKbrEIEz3KeYdk01%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1894&quot; height=&quot;1402&quot; data-origin-width=&quot;1894&quot; data-origin-height=&quot;1402&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;더 적은 FLOPs를 달성했지만 성능을 올린 것을 볼 수 있었음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Squad처럼 토큰 스팬 예측이 중요한 경우에는 표준 트렌스포머가 더 유리한 현상을 보여줌 - 압축이 디테일을 손상함&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;논문 한 줄 요약&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;Transformer가 레이어 전반에서 &lt;b&gt;full-length 토큰 시퀀스&lt;/b&gt;를 유지하며 발생하는 &lt;b&gt;순차적 중복(redundancy)&lt;/b&gt; 을 줄이기 위해, &lt;b&gt;깊어질수록 시퀀스 길이를 점진적으로 압축(풀링)&lt;/b&gt; 하는 encoder를 설계하고, 절약된 FLOPs를 &lt;b&gt;더 깊고/넓은 모델로 재투자&lt;/b&gt;하여 같은(혹은 더 적은) 비용으로 성능을 높인다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;해결하려는 문제&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;사전학습 확대로 성능은 오르지만 &lt;b&gt;FLOPs&amp;middot;메모리 비용&lt;/b&gt;이 너무 크고 , 특히 분류/랭킹처럼 &lt;b&gt;시퀀스-레벨 단일 벡터([CLS])&lt;/b&gt; 만 쓰는 태스크에서 토큰-level 표현을 끝까지 유지하는 것은 &lt;b&gt;불필요한 중복&lt;/b&gt;일 수 있음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;핵심 기여&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;(1) &lt;b&gt;Funnel-Transformer(F-TFM)&lt;/b&gt;: encoder가 블록을 거치며 &lt;b&gt;시퀀스 길이를 단계적으로 감소&lt;/b&gt; &lt;br /&gt;(2) 압축으로 절약한 연산을 깊이/폭에 &lt;b&gt;재투자&lt;/b&gt;하여 capacity 향상 &lt;br /&gt;(3) 토큰-레벨 예측(사전학습/시퀀스 라벨링)을 위해 &lt;b&gt;decoder로 토큰 표현 복원&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;방법론 &amp;ndash; Encoder 구조&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;여러 &lt;b&gt;블록(block)&lt;/b&gt; 의 Transformer layer로 구성. &lt;br /&gt;블록 내에서는 길이 유지, 블록 경계에서 &lt;b&gt;Pooling(h)&lt;/b&gt; 으로 길이 축소.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;방법론 &amp;ndash; 핵심 설계: pool-query-only attention&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;풀링된 시퀀스 (h')는 &lt;b&gt;Query(및 residual)&lt;/b&gt; 로만 사용하고, 풀링 전 시퀀스 (h)는 &lt;b&gt;Key/Value&lt;/b&gt; 로 사용:&lt;span&gt;&lt;span&gt;h&lt;/span&gt;&lt;span&gt;&amp;larr;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;LN&lt;/span&gt;&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;&lt;span&gt;h&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&amp;prime;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;+&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;Attn&lt;/span&gt;&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;Q&lt;/span&gt;&lt;span&gt;=&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;h&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&amp;prime;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;K&lt;/span&gt;&lt;span&gt;V&lt;/span&gt;&lt;span&gt;=&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;h&lt;/span&gt;&lt;span&gt;))&lt;/span&gt;&lt;/span&gt;. &lt;br /&gt;이로써 압축이 &amp;ldquo;단순 풀링&amp;rdquo;이 아니라 attention 가중합을 포함한 &lt;b&gt;표현력 있는 선형 압축&lt;/b&gt;이 됨.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;방법론 &amp;ndash; 풀링/CLS 처리&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;실험에선 &lt;b&gt;stride=2, window=2 mean pooling&lt;/b&gt;만으로도 잘 동작(길이를 절반으로). &lt;br /&gt;또한 [CLS]는 풀링으로 구조가 깨질 수 있어 &lt;b&gt;[CLS]를 분리해 유지&lt;/b&gt;하고 나머지에만 풀링 적용.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;방법론 &amp;ndash; Decoder&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;encoder 최종 출력(길이 (T/2^{M-1}))을 &lt;b&gt;한 번에 크게 up-sample&lt;/b&gt;(반복 복제)하여 길이 T로 복원 &lt;br /&gt;&amp;rarr; 토큰 디테일 보강을 위해 1블록의 full-length 표현 (h^1) 과 결합(스킵/잔차) 후, decoder에 &lt;b&gt;추가 Transformer layer(논문은 2층)&lt;/b&gt; 를 쌓아 토큰-레벨 예측에 사용.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;학습/활용 시나리오&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;사전학습/토큰-레벨 태스크는 &lt;b&gt;encoder+decoder&lt;/b&gt;, 분류처럼 시퀀스-레벨은 &lt;b&gt;decoder를 버리고 encoder만 finetune&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;복잡도/효율&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;표준 Transformer layer 비용: (O(T^2D + TD^2)). &lt;br /&gt;길이를 절반으로 줄이면 &lt;b&gt;super-linear(&amp;gt;1/2) 수준으로 비용 감소&lt;/b&gt;가 가능.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;대표 설계 예시(깊이-길이 trade-off)&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;BERTBase(L12H768) 대비, 예: &lt;b&gt;B6-6-6H768(총 18층)&lt;/b&gt; 은 분류 finetune 기준 FLOPs가 &amp;ldquo;full-length 10.5층&amp;rdquo; 수준으로 줄면서 성능이 더 좋았다고 설명.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;실험 결과 &amp;ndash; 시퀀스-레벨&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;GLUE 등에서 &lt;b&gt;동일/더 적은 FLOPs로&lt;/b&gt; 대응 baseline보다 다수 태스크에서 우수. &lt;br /&gt;RACE(긴 문장+추론)에서도 &lt;b&gt;유의미한 이득&lt;/b&gt;: 긴 문단 압축이 기회가 될 수 있음을 강조.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;실험 결과 &amp;ndash; 토큰-레벨&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;SQuAD에서는 base 그룹에선 강하지만, large 그룹에선 &lt;b&gt;full-length 유지 표준 Transformer가 더 유리&lt;/b&gt;한 경우가 있어, 압축이 토큰 디테일에 불리할 수 있음을 인정.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;Ablation 핵심 결론&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;풀링 종류는 mean/max는 대체로 괜찮지만 &lt;b&gt;Top-Att 기반 선택은 크게 악화&lt;/b&gt;.&lt;b&gt;pool-query-only&lt;/b&gt;, &lt;b&gt;[CLS] 분리 유지&lt;/b&gt;, &lt;b&gt;relative attention&lt;/b&gt; 등이 성능에 중요하다고 보고.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 17.2093%;&quot;&gt;결론/의미&lt;/td&gt;
&lt;td style=&quot;width: 82.6744%;&quot;&gt;&amp;ldquo;시퀀스의 &lt;b&gt;순차 해상도(resolution)&lt;/b&gt; 를 레이어 깊이에 따라 낮추는&amp;rdquo; 구조를 통해 Transformer 효율을 개선하고, 절약 FLOPs를 capacity로 재투자해 특히 &lt;b&gt;시퀀스-레벨 태스크에서 비용 대비 성능을 개선&lt;/b&gt;하는 방향을 제시.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2110.13711&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2110.13711&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1772468429993&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Hierarchical Transformers Are More Efficient Language Models&quot; data-og-description=&quot;Transformer models yield impressive results on many NLP and sequence modeling tasks. Remarkably, Transformers can handle long sequences which allows them to produce long coherent outputs: full paragraphs produced by GPT-3 or well-structured images produced&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2110.13711&quot; data-og-url=&quot;https://arxiv.org/abs/2110.13711v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/pp8nu/dJMb9iIEDym/HIAJR5pAIRwCzn3Sgk6kD0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/AjuW9/dJMb9lL841T/2fVE1IPtGUIYeB06OdPJI0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2110.13711&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2110.13711&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/pp8nu/dJMb9iIEDym/HIAJR5pAIRwCzn3Sgk6kD0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/AjuW9/dJMb9lL841T/2fVE1IPtGUIYeB06OdPJI0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Hierarchical Transformers Are More Efficient Language Models&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Transformer models yield impressive results on many NLP and sequence modeling tasks. Remarkably, Transformers can handle long sequences which allows them to produce long coherent outputs: full paragraphs produced by GPT-3 or well-structured images produced&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;naacl 2022 findings에 뽑혔네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서도 시퀸스 길이에 대해 연산 메모리 비용이 제곱으로 계속 커지는 것을 지적한다. =&amp;gt; 대형, 장문 입력에서 병목&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;906&quot; data-origin-height=&quot;854&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Annx3/dJMb99S1vA5/rF6zQCdhONiiu7iqqXxfC1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Annx3/dJMb99S1vA5/rF6zQCdhONiiu7iqqXxfC1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Annx3/dJMb99S1vA5/rF6zQCdhONiiu7iqqXxfC1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FAnnx3%2FdJMb99S1vA5%2FrF6zQCdhONiiu7iqqXxfC1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;906&quot; height=&quot;854&quot; data-origin-width=&quot;906&quot; data-origin-height=&quot;854&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1864&quot; data-origin-height=&quot;852&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/N1fyQ/dJMcadHQXn0/tkdqXwnwOVyQg0g0qkNQoK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/N1fyQ/dJMcadHQXn0/tkdqXwnwOVyQg0g0qkNQoK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/N1fyQ/dJMcadHQXn0/tkdqXwnwOVyQg0g0qkNQoK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FN1fyQ%2FdJMcadHQXn0%2FtkdqXwnwOVyQg0g0qkNQoK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1864&quot; height=&quot;852&quot; data-origin-width=&quot;1864&quot; data-origin-height=&quot;852&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;U-Net형 계층적 Autoregressive Transformer형태로 기존 Transformer레이어를 반복하다가 down sampling하는 구간이 있고, 다시 up sampling하면서 줄어든 차원에 이전의 내용을 넣어주며 정보 손실을 줄여줌&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;778&quot; data-origin-height=&quot;1292&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/wHzzs/dJMcaioUSKK/2bc6oSmDMfTUOzurAcIslk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/wHzzs/dJMcaioUSKK/2bc6oSmDMfTUOzurAcIslk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/wHzzs/dJMcaioUSKK/2bc6oSmDMfTUOzurAcIslk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FwHzzs%2FdJMcaioUSKK%2F2bc6oSmDMfTUOzurAcIslk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;778&quot; height=&quot;1292&quot; data-origin-width=&quot;778&quot; data-origin-height=&quot;1292&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 12.5581%;&quot;&gt;문제의식&lt;/td&gt;
&lt;td style=&quot;width: 87.3256%;&quot;&gt;표준 Transformer는 시퀀스 길이 (L)에 대해 계산/메모리 비용이 커져(특히 attention) 장문 처리 효율이 낮음. &lt;br /&gt;효율적 attention만으로는 &amp;ldquo;모든 레이어가 원래 길이 시퀀스를 계속 처리&amp;rdquo;하는 병목이 남음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 12.5581%;&quot;&gt;핵심 주장&lt;/td&gt;
&lt;td style=&quot;width: 87.3256%;&quot;&gt;&lt;b&gt;명시적 계층(hierarchy)&lt;/b&gt; 을 도입해 레이어 진행 중 &lt;b&gt;시퀀스 길이를 줄였다가(다운샘플) 다시 복원(업샘플)&lt;/b&gt; 하면, 같은 비용에서 더 좋은 성능(또는 같은 성능에서 더 적은 비용)을 달성할 수 있음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 12.5581%;&quot;&gt;제안 모델&lt;/td&gt;
&lt;td style=&quot;width: 87.3256%;&quot;&gt;&lt;b&gt;Hourglass&lt;/b&gt;(U-Net/Hourglass 형태): &lt;br /&gt;(1) 토큰-레벨 pre-vanilla 블록 &amp;rarr; (2) shortening &amp;rarr; &lt;br /&gt;(3) 짧아진 시퀀스에서 블록(재귀적 hourglass 가능) &amp;rarr; (4) upsampling(+스킵/잔차 결합) &amp;rarr; &lt;br /&gt;(5) 토큰-레벨 post-vanilla 블록.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 12.5581%;&quot;&gt;Causality&lt;/td&gt;
&lt;td style=&quot;width: 87.3256%;&quot;&gt;Autoregressive에서 다운샘플 시 &lt;b&gt;미래 정보 누출&lt;/b&gt; 위험이 있으므로, shortening 직전에 &lt;b&gt;(k-1) shift-right&lt;/b&gt; 로 누출을 방지(최소 안전 shift).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 12.5581%;&quot;&gt;표현력 유지&lt;/td&gt;
&lt;td style=&quot;width: 87.3256%;&quot;&gt;너무 이르게(또는 너무 많이) 축소하면 토큰 간 직접 상호작용이 약해져 &lt;b&gt;표현력 저하&lt;/b&gt;가 발생하므로, 축소 전/후에 &lt;b&gt;토큰-레벨 vanilla layers&lt;/b&gt; 를 유지하는 설계가 중요.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 12.5581%;&quot;&gt;Shortening&lt;/td&gt;
&lt;td style=&quot;width: 87.3256%;&quot;&gt;길이 &lt;span&gt;&lt;span&gt;(l,d)&amp;rarr;(l/k,d)&lt;/span&gt;&lt;/span&gt;. 방식: AvgPool / Linear pooling(reshape&amp;rarr;linear) / Attention pooling(Funnel-style).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 12.5581%;&quot;&gt;Upsampling&lt;/td&gt;
&lt;td style=&quot;width: 87.3256%;&quot;&gt;방식: Repeat / Linear / &lt;b&gt;Attention upsampling&lt;/b&gt;(토큰이 축소 표현에서 content-based로 읽어옴). &lt;br /&gt;전반적으로 attention upsampling이 강력하다고 보고.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 12.5581%;&quot;&gt;추가 정규화&lt;/td&gt;
&lt;td style=&quot;width: 87.3256%;&quot;&gt;&lt;b&gt;Shorten factor dropout&lt;/b&gt;: 훈련 중 shorten factor (k)를 {2,3} 등에서 랜덤 샘플링하여 일반화/성능을 개선.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 12.5581%;&quot;&gt;주요 결과&lt;/td&gt;
&lt;td style=&quot;width: 87.3256%;&quot;&gt;enwik8에서 효율-성능 Pareto 개선을 보이며, 예시 구성으로 &lt;b&gt;0.98 BPC&lt;/b&gt; 달성을 보고.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 12.5581%;&quot;&gt;주요 결과&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;width: 87.3256%;&quot;&gt;autoregressive 이미지 생성에서도 효과적이며, ImageNet32에서 &lt;b&gt;SOTA(3.741 bpd)&lt;/b&gt; 를 주장.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 12.5581%;&quot;&gt;의의&lt;/td&gt;
&lt;td style=&quot;width: 87.3256%;&quot;&gt;attention 변형(희소/근사/LSH 등)과 &lt;b&gt;직교적으로 결합 가능한 구조적 효율화 프레임워크&lt;/b&gt;(&amp;ldquo;레이어 내부 시퀀스 길이 자체를 줄이는&amp;rdquo; 접근).&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2211.09761&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2211.09761&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1772471731993&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Efficient Transformers with Dynamic Token Pooling&quot; data-og-description=&quot;Transformers achieve unrivalled performance in modelling language, but remain inefficient in terms of memory and time complexity. A possible remedy is to reduce the sequence length in the intermediate layers by pooling fixed-length segments of tokens. Neve&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2211.09761&quot; data-og-url=&quot;https://arxiv.org/abs/2211.09761v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/pGJyc/dJMb8RRPqwA/jHj5Rn1MPIuNfDE913I5c0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/WUqTY/dJMb8SpFtre/qmjjm5FUKZcH4ZNLHlJIJ1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2211.09761&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2211.09761&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/pGJyc/dJMb8RRPqwA/jHj5Rn1MPIuNfDE913I5c0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/WUqTY/dJMb8SpFtre/qmjjm5FUKZcH4ZNLHlJIJ1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Efficient Transformers with Dynamic Token Pooling&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Transformers achieve unrivalled performance in modelling language, but remain inefficient in terms of memory and time complexity. A possible remedy is to reduce the sequence length in the intermediate layers by pooling fixed-length segments of tokens. Neve&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이건 2023 acl long에 붙었네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서도 말하는 문제는 동일합니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 고정 pooling은 언어의 의미 단위(형태소, 단어, 구)가 가변 길이라는 점과 충돌해 성능 손실이 난다고 말한다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1904&quot; data-origin-height=&quot;946&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bzjG9C/dJMcahDvz2c/BJ2yuH9SUAp3D2bzkTQwMK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bzjG9C/dJMcahDvz2c/BJ2yuH9SUAp3D2bzkTQwMK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bzjG9C/dJMcahDvz2c/BJ2yuH9SUAp3D2bzkTQwMK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbzjG9C%2FdJMcahDvz2c%2FBJ2yuH9SUAp3D2bzkTQwMK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1904&quot; height=&quot;946&quot; data-origin-width=&quot;1904&quot; data-origin-height=&quot;946&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;중간 레이어에서 토큰을 가변 길이 세그먼트로 동적으로 묶어 효율을 얻되, 그 세그먼트 경계를 모델이 예측하도록 하여 효율과 성능 모두를 개선하게 됩니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1904&quot; data-origin-height=&quot;796&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/wvq46/dJMcaaxEnxr/VjCayXq2o7YoLjvgRaO6FK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/wvq46/dJMcaaxEnxr/VjCayXq2o7YoLjvgRaO6FK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/wvq46/dJMcaaxEnxr/VjCayXq2o7YoLjvgRaO6FK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fwvq46%2FdJMcaaxEnxr%2FVjCayXq2o7YoLjvgRaO6FK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1904&quot; height=&quot;796&quot; data-origin-width=&quot;1904&quot; data-origin-height=&quot;796&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;BPC는 낮을 수록 좋고, SF는 높을 수록 좋음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;문제의식&lt;/td&gt;
&lt;td&gt;Transformer는 시퀀스 길이 (l)에 대해 계산/메모리 비용이 커서 비효율적이며, 중간 레이어에서 &lt;b&gt;고정 길이 토큰 묶음(pooling)&lt;/b&gt; 으로 길이를 줄이는 기존 방식은 &lt;b&gt;단어/구 등 의미 단위가 가변 길이&lt;/b&gt;라는 언어 특성과 불일치해 성능 손실이 생긴다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;핵심 주장&lt;/td&gt;
&lt;td&gt;중간 레이어에서 &lt;b&gt;세그먼트 경계를 동적으로 예측&lt;/b&gt;해 &lt;b&gt;가변 길이 세그먼트 pooling&lt;/b&gt;을 수행하면, 동일/유사한 계산 예산에서 &lt;b&gt;더 빠르고 더 정확&lt;/b&gt;한 Transformer를 만들 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;제안 모델&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Dynamic-Pooling Transformer&lt;/b&gt;: &lt;br /&gt;(1) 경계 예측으로 세그먼트 생성 &amp;rarr; (2) 세그먼트 단위로 pooling하여 중간 시퀀스 단축 &amp;rarr; &lt;br /&gt;(3) 짧아진 시퀀스에서 연산 &amp;rarr; &lt;br /&gt;(4) AR 생성 가능하도록 원 길이로 업샘플링(Hourglass 계열의 &amp;ldquo;줄였다가 복원&amp;rdquo; 골격 위에 동적 경계를 결합).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;경계(boundary) 획득 방법&lt;/td&gt;
&lt;td&gt;4가지 비교: &lt;br /&gt;&lt;b&gt;(i) 확률적 재매개변수화 기반 end-to-end 학습(Gumbel-Sigmoid)&lt;/b&gt;, &lt;br /&gt;&lt;b&gt;(ii) subword tokenizer(Unigram) 분절을 supervision으로 사용&lt;/b&gt;, &lt;br /&gt;&lt;b&gt;(iii) conditional entropy spike 기반 supervision&lt;/b&gt;, &lt;b&gt;(iv) 언어학적 규칙(whitespace 등)&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;평가 세팅&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Character-level language modeling&lt;/b&gt;을 여러 데이터셋/언어에서 수행.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;평가 지표&lt;/td&gt;
&lt;td&gt;&lt;b&gt;BPC(bits per character; &amp;darr;)&lt;/b&gt;: 예측 품질(음의 로그확률)&amp;nbsp;&lt;br /&gt;&lt;b&gt;SF(shortening factor; &amp;uarr;)&lt;/b&gt;: 중간 레이어에서 평균적으로 얼마나 길이를 줄였는지(효율).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과(정확도/효율 트레이드오프)&lt;/td&gt;
&lt;td&gt;영어 벤치마크(text8, wiki40b, CC-100)에서 &lt;b&gt;whitespace 기반&lt;/b&gt;과 &lt;b&gt;Unigram 기반&lt;/b&gt; 동적 분절이 &lt;b&gt;가장 낮은 BPC&lt;/b&gt;를 기록하며, vanilla 및 고정 pooling 대비 &lt;b&gt;통계적으로 유의미하게 우수&lt;/b&gt;하고, 동시에 &lt;b&gt;가장 큰 SF(더 많이 단축)&lt;/b&gt; 를 달성한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;수치 예시(Table 1)&lt;/td&gt;
&lt;td&gt;text8에서 &lt;b&gt;Vanilla: BPC 1.143 (SF 1.0x)&lt;/b&gt; 대비, &lt;br /&gt;&lt;b&gt;Unigram: 1.134⋆ (SF 5.0x)&lt;/b&gt;, &lt;br /&gt;&lt;b&gt;Whitespaces: 1.133⋆ (SF 5.7x)&lt;/b&gt; 로 성능(BPC)과 효율(SF)을 함께 개선.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;효율 측정(시간/메모리)&lt;/td&gt;
&lt;td&gt;구현 측정에서 &lt;b&gt;SF=2&lt;/b&gt;면 메모리/학습시간이 &lt;b&gt;40%+ 감소&lt;/b&gt;, &lt;br /&gt;&lt;b&gt;SF=4&lt;/b&gt;에서도 동적 pooling이 더 좋은 BPC를 유지하며 자원 사용이 &lt;b&gt;50&amp;ndash;60% 감소&lt;/b&gt;하고 학습이 &lt;b&gt;2.5&amp;times; 빠름&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;결론/의미&lt;/td&gt;
&lt;td&gt;&amp;ldquo;고정 길이&amp;rdquo; 대신 &amp;ldquo;가변 의미 단위에 정렬된 동적 세그먼트 pooling&amp;rdquo;이라는 inductive bias를 주면, Transformer를 &lt;b&gt;더 잘 스케일&lt;/b&gt;시키면서 &lt;b&gt;예측 품질도 개선&lt;/b&gt;할 수 있다는 실증을 제시한다(효율&amp;ndash;성능 Pareto front 개선).&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1208</guid>
      <comments>https://yoonschallenge.tistory.com/1208#entry1208comment</comments>
      <pubDate>Tue, 3 Mar 2026 02:29:45 +0900</pubDate>
    </item>
    <item>
      <title>Latent Reasoning, Soft Thinking 논문 정리 3</title>
      <link>https://yoonschallenge.tistory.com/1207</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2511.06411&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2511.06411&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1771564381548&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization&quot; data-og-description=&quot;The soft-thinking paradigm for Large Language Model (LLM) reasoning can outperform the conventional discrete-token Chain-of-Thought (CoT) reasoning in some scenarios, underscoring its research and application value. However, while the discrete-token CoT re&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2511.06411&quot; data-og-url=&quot;https://arxiv.org/abs/2511.06411v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/zUohb/dJMb9frB5fR/78eqtKBjepEzAMAHq7TXZk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/ykPp9/dJMb9jgtOxH/JnyYutwMAFe1VSGDxW5g00/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2511.06411&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2511.06411&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/zUohb/dJMb9frB5fR/78eqtKBjepEzAMAHq7TXZk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/ykPp9/dJMb9jgtOxH/JnyYutwMAFe1VSGDxW5g00/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;The soft-thinking paradigm for Large Language Model (LLM) reasoning can outperform the conventional discrete-token Chain-of-Thought (CoT) reasoning in some scenarios, underscoring its research and application value. However, while the discrete-token CoT re&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;딱 제가 하려고 했던 아이디어 인데.....&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;일단 나와있으니 논문을 한번 읽어보겠습니다&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;363&quot; data-origin-height=&quot;780&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/oNaOi/dJMcahDonJy/g9JuvI3JzIWk64C2mGtzfk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/oNaOi/dJMcahDonJy/g9JuvI3JzIWk64C2mGtzfk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/oNaOi/dJMcahDonJy/g9JuvI3JzIWk64C2mGtzfk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FoNaOi%2FdJMcahDonJy%2Fg9JuvI3JzIWk64C2mGtzfk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;363&quot; height=&quot;780&quot; data-origin-width=&quot;363&quot; data-origin-height=&quot;780&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Soft-Thinking은 토큰을 추상적 개념으로 전달할 수 있어 fine-tuning 없이 discrete CoT 보다 잘 될 수 있음&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;BUT RLVR(검증 가능한 보상 기반 RL like GRPO)가 성능 향상을 주도하며 이는 샘플링된 이산 토큰 경로의 확률에 크레딧을 정확히 할당하면서 학습함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1133&quot; data-origin-height=&quot;275&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/BXRih/dJMb996sc9e/1m5477KzSYSp63yNecuyJ1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/BXRih/dJMb996sc9e/1m5477KzSYSp63yNecuyJ1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/BXRih/dJMb996sc9e/1m5477KzSYSp63yNecuyJ1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FBXRih%2FdJMb996sc9e%2F1m5477KzSYSp63yNecuyJ1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1133&quot; height=&quot;275&quot; data-origin-width=&quot;1133&quot; data-origin-height=&quot;275&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;GRPO 수식&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Soft thinking에 RLVR을 붙이려면 기존 vanilla soft-thinking은 determinstic(결정적)이라 다양한 추론 경로를 탐색하기 어렵고, 정확히 어던 선택이 좋았는지 logits/probabilities에 정합적으로 귀속시키기 어려움&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt;soft token이 아니라 ligit probabilities 레벨에서 확률성 노이즈를 주입하고, 그를 매개로 RLVR 크레딧을 할당해야 함&amp;nbsp;&lt;br /&gt;==&amp;gt; Gumbel-Softmax + Gumbel reparameterization&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1457&quot; data-origin-height=&quot;781&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cepsAx/dJMcagLhQZm/KQ5M1rGepAgUj1pKZjaFf0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cepsAx/dJMcagLhQZm/KQ5M1rGepAgUj1pKZjaFf0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cepsAx/dJMcagLhQZm/KQ5M1rGepAgUj1pKZjaFf0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcepsAx%2FdJMcagLhQZm%2FKQ5M1rGepAgUj1pKZjaFf0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1457&quot; height=&quot;781&quot; data-origin-width=&quot;1457&quot; data-origin-height=&quot;781&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Rollout 생성 - logits에 gumbel noise 합치고, temperature로 softmax한 뒤 soft token 생성&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;gumbel 노이즈를 버리지 말고 이를 통해 off-police 확률비 구성&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1077&quot; data-origin-height=&quot;695&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bhw1Oe/dJMcabwpKl0/Y2qdVQ7udz6cnbGhZB9Gqk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bhw1Oe/dJMcabwpKl0/Y2qdVQ7udz6cnbGhZB9Gqk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bhw1Oe/dJMcabwpKl0/Y2qdVQ7udz6cnbGhZB9Gqk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbhw1Oe%2FdJMcabwpKl0%2FY2qdVQ7udz6cnbGhZB9Gqk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1077&quot; height=&quot;695&quot; data-origin-width=&quot;1077&quot; data-origin-height=&quot;695&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;점수 차이가 그렇게 크진 않네요...?&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1063&quot; data-origin-height=&quot;636&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bX2d0e/dJMcafMn7SD/JBTU9QZKj5qEJZ3ekk5JQ0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bX2d0e/dJMcafMn7SD/JBTU9QZKj5qEJZ3ekk5JQ0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bX2d0e/dJMcafMn7SD/JBTU9QZKj5qEJZ3ekk5JQ0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbX2d0e%2FdJMcafMn7SD%2FJBTU9QZKj5qEJZ3ekk5JQ0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1063&quot; height=&quot;636&quot; data-origin-width=&quot;1063&quot; data-origin-height=&quot;636&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;distill 모델로 진행해도 @K 성능이 꾸준히 잘 오르네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;미약한 격차긴 한데....&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1078&quot; data-origin-height=&quot;712&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/TyNPo/dJMcaaK3lqq/ohai8fR3KuITA1KwWIxWK0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/TyNPo/dJMcaaK3lqq/ohai8fR3KuITA1KwWIxWK0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/TyNPo/dJMcaaK3lqq/ohai8fR3KuITA1KwWIxWK0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FTyNPo%2FdJMcaaK3lqq%2Fohai8fR3KuITA1KwWIxWK0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1078&quot; height=&quot;712&quot; data-origin-width=&quot;1078&quot; data-origin-height=&quot;712&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;가우시안으로 바꾸거나 Dirichlet으로 바꾸면 성능 떨어짐&amp;nbsp;&lt;br /&gt;=&amp;gt; Soft-thinking 탐색은 확률 simplex 에서 일어나야 함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 567px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 63px;&quot;&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;핵심 아이디어&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;&lt;b&gt;noise를 soft token(임베딩)에 넣지 말고, 토큰 확률분포(logits/probabilities) 레벨에 넣어라.&lt;/b&gt; &lt;br /&gt;즉, &lt;b&gt;Gumbel-Softmax&lt;/b&gt;로 확률 simplex 위에서 탐색 가능한 soft token을 생성하고, 그 확률적 원인(perturbed logits)을 기준으로 RLVR 업데이트를 정식화.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 147px;&quot;&gt;
&lt;td style=&quot;height: 147px;&quot;&gt;제안 방법&lt;/td&gt;
&lt;td style=&quot;height: 147px;&quot;&gt;(1) 각 추론 step에서 &lt;b&gt;soft token = 토큰 임베딩의 확률 가중합&lt;/b&gt;으로 입력을 구성(Eq.3). &lt;br /&gt;(2) &lt;b&gt;Gumbel noise + temperature(&amp;tau;g)&lt;/b&gt;로 logits을 교란해 &lt;b&gt;Gumbel-Softmax 샘플&lt;/b&gt;을 만들고, 그로부터 soft token을 생성(Eq.4). &lt;br /&gt;(3) rollout 시 &lt;b&gt;perturbed logits(g&amp;prime;) / mixture(y&amp;prime;)&lt;/b&gt;를 저장. &lt;br /&gt;(4) soft token density를 직접 정의하는 대신, &lt;b&gt;&amp;ldquo;같은 g&amp;prime;가 나오게 하는 Gumbel noise&amp;rdquo;의 density&lt;/b&gt;로 old/current policy의 &lt;b&gt;importance ratio&lt;/b&gt;를 계산(Eq.8, Eq.11&amp;ndash;12). (5) &lt;br /&gt;이를 GRPO의 그룹 샘플링/클리핑/KL 페널티 구조에 결합.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 84px;&quot;&gt;
&lt;td style=&quot;height: 84px;&quot;&gt;왜 되는가&lt;/td&gt;
&lt;td style=&quot;height: 84px;&quot;&gt;(i) 탐색이 &lt;b&gt;확률 simplex 내부&lt;/b&gt;에서 일어나므로 항상 &amp;ldquo;유효한 mixture&amp;rdquo;로 해석 가능(embedding convex hull 유지). &lt;br /&gt;(ii) action을 &lt;b&gt;noise(or g&amp;prime;)&lt;/b&gt;로 두어 likelihood/ratio가 명확해져 &lt;b&gt;크레딧 할당이 안정화&lt;/b&gt;. &lt;br /&gt;(iii) discrete GRPO가 토큰 1개에만 크레딧이 집중되기 쉬운 반면, soft token은 mixture라 한 step에서 &lt;b&gt;여러 토큰 확률에 분산된 업데이트&lt;/b&gt;가 가능해 &lt;b&gt;Pass@K(다중 샘플 성능)&lt;/b&gt;에 유리하다는 분석을 제시.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot;&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;실험 설정&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;모델: DeepSeek-R1-Distill-Qwen(1.5B/7B), LLaMA-3.2-3B-Instruct 등. &lt;br /&gt;학습: DeepScaler. &lt;br /&gt;평가: AIME/AMC/MATH-500/GSM8K(인도메인) + GPQA/HumanEval/MBPP(OOD), Mean@32/Pass@K.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot;&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;핵심 결과&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;인도메인에서 &lt;b&gt;Pass@1은 근소 개선&lt;/b&gt;(평균 +0.13%p 수준)이나, &lt;b&gt;Pass@16/32에서 더 큰 개선&lt;/b&gt;(평균 +1.80%p / +2.19%p)로 &amp;ldquo;샘플 효율/다중 후보 성능&amp;rdquo;을 강화. &lt;br /&gt;OOD에서도 No-FT 및 표준 GRPO 대비 우세 경향 보고. Majority voting 결합 시 Major@K에서도 이득.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot;&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;Ablation/분석 포인트&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;&lt;b&gt;Gumbel 형태가 중요&lt;/b&gt;:&lt;br /&gt;Dirichlet/Gaussian으로 바꾸면 성능/안정성 저하. &lt;br /&gt;&amp;tau;g, top-p 설정이 너무 공격적이면 KL 증가와 함께 학습 붕괴(collapse) 관찰. &lt;br /&gt;엔트로피 붕괴 완화/Pass@K 개선 관점의 해석 제시.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;한계/주의점&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;&amp;tau;g, top-p 등 탐색 하이퍼파라미터에 민감하며, soft-thinking 구간 길이/샘플링 전략에 따라 KL 및 안정성이 흔들릴 수 있음(붕괴 사례 보고). &lt;br /&gt;계산/구현 복잡도(rollout 저장 및 ratio 계산)도 discrete GRPO보다 증가.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;결론&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;&lt;b&gt;Soft-thinking을 RLVR로 &amp;ldquo;제대로&amp;rdquo; 강화하려면, 임베딩 노이즈가 아니라 logits-space에서의 Gumbel reparameterization이 핵심&lt;/b&gt;이며, 그 결과 discrete-token GRPO를 &lt;b&gt;특히 Pass@K에서&lt;/b&gt; 유의미하게 상회할 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.17416&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2502.17416&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1771827802489&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Reasoning with Latent Thoughts: On the Power of Looped Transformers&quot; data-og-description=&quot;Large language models have shown remarkable reasoning abilities and scaling laws suggest that large parameter count, especially along the depth axis, is the primary driver. In this work, we make a stronger claim -- many reasoning problems require a large d&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2502.17416&quot; data-og-url=&quot;https://arxiv.org/abs/2502.17416v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/hjMzg/dJMb8YXIkMk/JtzeVlGW0rnpg0hpUyQKJ1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/dFuLaR/dJMb88eXvDh/1YW4p5lkMAn4CJnvYKxwF0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.17416&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2502.17416&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/hjMzg/dJMb8YXIkMk/JtzeVlGW0rnpg0hpUyQKJ1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/dFuLaR/dJMb88eXvDh/1YW4p5lkMAn4CJnvYKxwF0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Reasoning with Latent Thoughts: On the Power of Looped Transformers&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Large language models have shown remarkable reasoning abilities and scaling laws suggest that large parameter count, especially along the depth axis, is the primary driver. In this work, we make a stronger claim -- many reasoning problems require a large d&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ICLR 2025 poster네요&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1682&quot; data-origin-height=&quot;713&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/mVTrx/dJMcai3nqk5/CbbGAt37eCJKFkm1z3oo4k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/mVTrx/dJMcai3nqk5/CbbGAt37eCJKFkm1z3oo4k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/mVTrx/dJMcai3nqk5/CbbGAt37eCJKFkm1z3oo4k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FmVTrx%2FdJMcai3nqk5%2FCbbGAt37eCJKFkm1z3oo4k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1682&quot; height=&quot;713&quot; data-origin-width=&quot;1682&quot; data-origin-height=&quot;713&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;음 다른 논문이긴 하네요&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기선 파라미터를 늘리면서 깊이를 늘리는 것이 아닌 깊이만 늘려서 reasoning 한 논문입니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Looped Transformer라면서 가중치를 공유하여 k layer를 L번 반복하여 진행합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1250&quot; data-origin-height=&quot;678&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/kCsae/dJMcabwsyZL/NVD9Ouh3qYWkvHJ7Nv9exK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/kCsae/dJMcabwsyZL/NVD9Ouh3qYWkvHJ7Nv9exK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/kCsae/dJMcabwsyZL/NVD9Ouh3qYWkvHJ7Nv9exK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FkCsae%2FdJMcabwsyZL%2FNVD9Ouh3qYWkvHJ7Nv9exK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1250&quot; height=&quot;678&quot; data-origin-width=&quot;1250&quot; data-origin-height=&quot;678&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1 layer 12번 반복과 같은 극단적 설정도 깊이만 확보하면 성능을 근사화할 수 있음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;p-hop induction으로 재귀적으로 p번 거슬러 올라가 찾기가 필요한 문제에서 loop가 깊이를 공급해 iso-flop에 급접한 성능을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1233&quot; data-origin-height=&quot;580&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bkhqa0/dJMcabDfGf2/erheNWCplxRrRkFS212dIk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bkhqa0/dJMcabDfGf2/erheNWCplxRrRkFS212dIk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bkhqa0/dJMcabDfGf2/erheNWCplxRrRkFS212dIk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbkhqa0%2FdJMcabDfGf2%2FerheNWCplxRrRkFS212dIk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1233&quot; height=&quot;580&quot; data-origin-width=&quot;1233&quot; data-origin-height=&quot;580&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;추론 문제는 depth는 필요하지만 parameter는 꼭 필요하지 않음&amp;nbsp;&lt;br /&gt;= 수학과 같은 알고리즘적, 반복적 성격의 추론 문제는 깊이가 충분하면 잘 풀림&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;DAG 형태의 산술 추론에서도 유사한 성능을 보여준다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;929&quot; data-origin-height=&quot;740&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/nqHhg/dJMcagEzwnU/4Eo5fVKncyXWvMyentKXXK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/nqHhg/dJMcagEzwnU/4Eo5fVKncyXWvMyentKXXK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/nqHhg/dJMcagEzwnU/4Eo5fVKncyXWvMyentKXXK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FnqHhg%2FdJMcagEzwnU%2F4Eo5fVKncyXWvMyentKXXK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;929&quot; height=&quot;740&quot; data-origin-width=&quot;929&quot; data-origin-height=&quot;740&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Loop는 LLM에 유리한 유도편향을 줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;pretrain 모델의 perplexity는 파라미터 수에 크게 좌우되어 loop가 불리할 수 있으나 downstream 추론 과제에서는 loop 모델이 iso-flop 모델에 근접하거나 더 좋다는 현상을 보임&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1028&quot; data-origin-height=&quot;513&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bE55eo/dJMcaaYCLmY/vxqFBS2kPMpuqDPuwxPGn1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bE55eo/dJMcaaYCLmY/vxqFBS2kPMpuqDPuwxPGn1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bE55eo/dJMcaaYCLmY/vxqFBS2kPMpuqDPuwxPGn1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbE55eo%2FdJMcaaYCLmY%2FvxqFBS2kPMpuqDPuwxPGn1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1028&quot; height=&quot;513&quot; data-origin-width=&quot;1028&quot; data-origin-height=&quot;513&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Loop는 CoT를 latent thinking 으로 시뮬레이션 할 수 있어 각 루프에서 여러 개의 latent thought를 병렬로 갱신할 수 있음!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;772&quot; data-origin-height=&quot;276&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bC2bdm/dJMcab4iKc6/dP55tQvMc5Yyz9dqi8rht0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bC2bdm/dJMcab4iKc6/dP55tQvMc5Yyz9dqi8rht0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bC2bdm/dJMcab4iKc6/dP55tQvMc5Yyz9dqi8rht0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbC2bdm%2FdJMcab4iKc6%2FdP55tQvMc5Yyz9dqi8rht0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;772&quot; height=&quot;276&quot; data-origin-width=&quot;772&quot; data-origin-height=&quot;276&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Looping-inspired regularization으로 추론 편향을 이식할 수 있음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;블록 간 가중치가 완전히 공유되는 것 대신 비슷해지도록 정규화를 걸어 loop의 장점을 가져오면서 perplexity는 유지되는 지점을 제안함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;논문 한줄 요약&lt;/td&gt;
&lt;td&gt;&lt;b&gt;가중치 공유(Looping)로 &amp;ldquo;효과적 깊이(effective depth)&amp;rdquo;를 늘리면, 파라미터를 크게 늘리지 않고도 추론 성능을 크게 끌어올릴 수 있으며, LM에서도 루프는 추론에 유리한 유도편향을 만든다.&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;문제의식&lt;/td&gt;
&lt;td&gt;(1) 추론 성능이 종종 &lt;b&gt;파라미터 규모&lt;/b&gt;에 귀속되어 설명됨. &lt;br /&gt;(2) 하지만 많은 추론은 본질적으로 &lt;b&gt;반복 계산(algorithmic iteration)&lt;/b&gt;이며, 핵심 병목은 &lt;b&gt;깊이/스텝 수&lt;/b&gt;일 수 있음.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;핵심 아이디어&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Looped Transformer (k &amp;otimes; L)&lt;/b&gt;: k-layer 블록을 &lt;b&gt;L번 반복&lt;/b&gt; 적용(가중치 공유)하여 &lt;b&gt;파라미터 증가 없이 깊이만 확대&lt;/b&gt;. &lt;br /&gt;비교축: &lt;b&gt;iso-param&lt;/b&gt;(k &amp;otimes; 1), &lt;b&gt;iso-FLOP&lt;/b&gt;(kL &amp;otimes; 1).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 주장&lt;/td&gt;
&lt;td&gt;&lt;b&gt;C1&lt;/b&gt;: 다수 추론 문제는 parameter보다 depth가 본질. &lt;br /&gt;&lt;b&gt;C2&lt;/b&gt;: LM에서도 loop는 추론에 유리한 inductive bias. &lt;br /&gt;&lt;b&gt;C3&lt;/b&gt;: loop는 CoT를 &lt;b&gt;latent thought 반복 갱신&lt;/b&gt;으로 해석/시뮬레이션 가능. &lt;br /&gt;&lt;b&gt;C4&lt;/b&gt;: 완전 공유 대신 &lt;b&gt;looping-inspired regularization&lt;/b&gt;으로 PPL 손실 없이 추론 편향 이식 가능.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;방법 상세&lt;/td&gt;
&lt;td&gt;1) &lt;b&gt;블록 반복 구조&lt;/b&gt;로 effective depth 확보. &lt;br /&gt;2) (선택) 완전 공유가 부담이면, 레이어 간 &lt;b&gt;가중치 유사도(cosine similarity) 정규화&lt;/b&gt;로 &amp;ldquo;부분적 loop 성질&amp;rdquo;을 주입.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;실험 1: 합성/알고리즘 추론&lt;/td&gt;
&lt;td&gt;&lt;b&gt;n-ary addition, p-hop induction, i-GSM&lt;/b&gt; 등에서 (k &amp;otimes; L)이 &lt;b&gt;iso-FLOP(깊이 동일, 파라미터 큼)&lt;/b&gt;에 근접/동등 성능 &amp;rarr; &amp;ldquo;반복 스텝&amp;rdquo;의 중요성 실증.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;실험 2: 1B급 LM&lt;/td&gt;
&lt;td&gt;프리트레인 PPL/암기형은 파라미터 영향으로 loop가 불리할 수 있으나, &lt;b&gt;추론형(오픈북 QA/수학/Reasoning primitives)&lt;/b&gt;에선 (k &amp;otimes; L)이 &lt;b&gt;iso-FLOP과 격차를 크게 줄이거나 일부에서 우수&lt;/b&gt;. &lt;br /&gt;또한 성능이 effective depth에 대해 &lt;b&gt;로그형 스케일링&lt;/b&gt; 경향 관찰.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;이론(정당화)&lt;/td&gt;
&lt;td&gt;반복 알고리즘 관점에서, loop가 &lt;br /&gt;(i) 덧셈/조합 연산을 &lt;b&gt;O(log n)&lt;/b&gt; 루프로 가능하게 함, &lt;br /&gt;(ii) 제한된 &amp;ldquo;서로 다른 레이어 수&amp;rdquo;를 가진 네트워크를 loop로 &lt;b&gt;시뮬레이션&lt;/b&gt; 가능, &lt;br /&gt;(iii) &lt;b&gt;T-step CoT&lt;/b&gt;를 &lt;b&gt;T번 루프&lt;/b&gt;로 모사 가능함을 정리(주요 정리/따름정리).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;기여(Contributions)&lt;/td&gt;
&lt;td&gt;1) &lt;b&gt;Looping=깊이 확장&lt;/b&gt;으로 &amp;ldquo;추론은 depth가 핵심&amp;rdquo;을 강하게 실증. &lt;br /&gt;2) LM에서 &lt;b&gt;PPL과 추론 성능의 분리&lt;/b&gt;를 보여주는 근거 제공. &lt;br /&gt;]\3) CoT를 &lt;b&gt;latent 반복 업데이트&lt;/b&gt;로 연결하는 이론/직관. &lt;br /&gt;4) &lt;b&gt;정규화 기반&lt;/b&gt;으로 loop 편향을 일반 모델에도 이식 가능함 제안.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;한계/주의점&lt;/td&gt;
&lt;td&gt;1) &lt;b&gt;암기/언어모델링(PPL)&lt;/b&gt;은 여전히 파라미터 영향이 커서 loop만으로는 한계. &lt;br /&gt;2) loop 횟수 증가에 따른 &lt;b&gt;학습/추론 안정성, 최적화 난이도, 지연(latency)&lt;/b&gt; 이슈 가능. &lt;br /&gt;3) 어떤 과제가 &amp;ldquo;depth 지배적&amp;rdquo;인지의 &lt;b&gt;과제 특성 분류&lt;/b&gt;가 추가로 필요.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;실무적 시사점&lt;/td&gt;
&lt;td&gt;1) 동일 예산에서 &lt;b&gt;파라미터 증대 대신 반복 스텝(깊이) 확보&lt;/b&gt;가 더 효율적인 추론 과제가 존재. &lt;br /&gt;2) &amp;ldquo;생각(Reasoning)&amp;rdquo;을 토큰으로 외부에 드러내는 CoT 대신, &lt;b&gt;잠재 반복(latent loops)&lt;/b&gt;로 내부 추론을 강화하는 설계가 가능. &lt;br /&gt;3) 완전 공유가 부담이면 &lt;b&gt;유사도 정규화&lt;/b&gt;로 편향만 부분 주입하는 설계 옵션.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1207</guid>
      <comments>https://yoonschallenge.tistory.com/1207#entry1207comment</comments>
      <pubDate>Sat, 21 Feb 2026 18:15:13 +0900</pubDate>
    </item>
    <item>
      <title>Multi-turn, Long-context Benchmark 논문 5</title>
      <link>https://yoonschallenge.tistory.com/1196</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://openreview.net/forum?id=rkIw2GqYEt&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://openreview.net/forum?id=rkIw2GqYEt&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768668735655&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Probing to Refine: Reinforcement Distillation of LLM Reasoners via...&quot; data-og-description=&quot;Distilling robust reasoning capabilities from large language models (LLMs) into smaller, computationally efficient student models remains an unresolved challenge. Despite recent advances, distilled...&quot; data-og-host=&quot;openreview.net&quot; data-og-source-url=&quot;https://openreview.net/forum?id=rkIw2GqYEt&quot; data-og-url=&quot;https://openreview.net/forum?id=rkIw2GqYEt&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://openreview.net/forum?id=rkIw2GqYEt&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://openreview.net/forum?id=rkIw2GqYEt&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Probing to Refine: Reinforcement Distillation of LLM Reasoners via...&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Distilling robust reasoning capabilities from large language models (LLMs) into smaller, computationally efficient student models remains an unresolved challenge. Despite recent advances, distilled...&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;openreview.net&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.emnlp-main.811/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2024.emnlp-main.811/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768668740076&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;LLM Task Interference: An Initial Study on the Impact of Task-Switch in Conversational History&quot; data-og-description=&quot;Akash Gupta, Ivaxi Sheth, Vyas Raina, Mark Gales, Mario Fritz. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing. 2024.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2024.emnlp-main.811/&quot; data-og-url=&quot;https://aclanthology.org/2024.emnlp-main.811/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bssFVO/dJMb8862CMK/CUBooe9Y4yAjYkHvEQ3FCK/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.emnlp-main.811/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2024.emnlp-main.811/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bssFVO/dJMb8862CMK/CUBooe9Y4yAjYkHvEQ3FCK/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;LLM Task Interference: An Initial Study on the Impact of Task-Switch in Conversational History&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Akash Gupta, Ivaxi Sheth, Vyas Raina, Mark Gales, Mario Fritz. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing. 2024.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1196</guid>
      <comments>https://yoonschallenge.tistory.com/1196#entry1196comment</comments>
      <pubDate>Fri, 20 Feb 2026 02:53:29 +0900</pubDate>
    </item>
    <item>
      <title>Latent Reasoning, Soft Thinking 논문 정리 2</title>
      <link>https://yoonschallenge.tistory.com/1206</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.emnlp-main.36/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2025.emnlp-main.36/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1771509543325&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation&quot; data-og-description=&quot;Zhenyi Shen, Hanqi Yan, Linhai Zhang, Zhanghao Hu, Yali Du, Yulan He. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing. 2025.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2025.emnlp-main.36/&quot; data-og-url=&quot;https://aclanthology.org/2025.emnlp-main.36/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/c92Srb/dJMb8YpRZzN/asIWZKEjAN1LG3MHMxuzc1/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.emnlp-main.36/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2025.emnlp-main.36/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/c92Srb/dJMb8YpRZzN/asIWZKEjAN1LG3MHMxuzc1/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Zhenyi Shen, Hanqi Yan, Linhai Zhang, Zhanghao Hu, Yali Du, Yulan He. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing. 2025.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;emnlp 2025 main에 붙었네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;589&quot; data-origin-height=&quot;730&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/UNYR7/dJMcafMnvv4/7zH5c7eLNtZ3ELJvKdAUB0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/UNYR7/dJMcafMnvv4/7zH5c7eLNtZ3ELJvKdAUB0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/UNYR7/dJMcafMnvv4/7zH5c7eLNtZ3ELJvKdAUB0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FUNYR7%2FdJMcafMnvv4%2F7zH5c7eLNtZ3ELJvKdAUB0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;589&quot; height=&quot;730&quot; data-origin-width=&quot;589&quot; data-origin-height=&quot;730&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 CoT는 토큰 사용량이 너무 많았고, Coconut는 단계적 치환을 통해 latent로 바꾸는데 stage간 망각 가능성을 제시함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;추론 능력을 연속 공간으로 압축해도 학습 신호를 주면 explicit CoT 성능에 도달할 수 있음!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1501&quot; data-origin-height=&quot;720&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bd0HCB/dJMcabpF4Mk/7hnqFe79BtUXfFJZxtdFC1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bd0HCB/dJMcabpF4Mk/7hnqFe79BtUXfFJZxtdFC1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bd0HCB/dJMcabpF4Mk/7hnqFe79BtUXfFJZxtdFC1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbd0HCB%2FdJMcabpF4Mk%2F7hnqFe79BtUXfFJZxtdFC1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1501&quot; height=&quot;720&quot; data-origin-width=&quot;1501&quot; data-origin-height=&quot;720&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Teacher는 Explicit CoT를 진행하며 CoT 토큰과 정답 토큰을 학습하고, Student는 Implicit CoT를 진행하여 언어 토큰 생성 없이 hidden state를 생성하고, eot를 통해 답을 말하게 됨&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이게 되는건 CoT가 답 생성 직전 토큰인 ':'의 hidden state을 특정 방향으로 shift 시킨다고 보고 여기에 CoT 정보가 담겼다고 봄&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 이 ':' 를 맞추도록 KD 학습&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기도 n개가 고정되긴 하네요...&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1150&quot; data-origin-height=&quot;750&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b1yNdI/dJMcaivvpMq/kpRP1sd6bDp4KYFb1WkHA0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b1yNdI/dJMcaivvpMq/kpRP1sd6bDp4KYFb1WkHA0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b1yNdI/dJMcaivvpMq/kpRP1sd6bDp4KYFb1WkHA0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb1yNdI%2FdJMcaivvpMq%2FkpRP1sd6bDp4KYFb1WkHA0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1150&quot; height=&quot;750&quot; data-origin-width=&quot;1150&quot; data-origin-height=&quot;750&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CoT Path는 gpt 4o mini로 했다고 하네요&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;왜 CoT SFT 보다 높은가 싶기는 한데....&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;KD를 제거한 실험에서 성능 급락을 통해 KD가 필수임을 보여줌&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;teacher와 student를 분리한 것도 성능 하락함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;850&quot; data-origin-height=&quot;769&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/6CF38/dJMcai96qpo/s3t6VQ1VlCLaoEJ2SymREK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/6CF38/dJMcai96qpo/s3t6VQ1VlCLaoEJ2SymREK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/6CF38/dJMcai96qpo/s3t6VQ1VlCLaoEJ2SymREK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F6CF38%2FdJMcai96qpo%2Fs3t6VQ1VlCLaoEJ2SymREK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;850&quot; height=&quot;769&quot; data-origin-width=&quot;850&quot; data-origin-height=&quot;769&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;lm head를 통해 중간 결과를 확인했을 때 연산하는 과정 토큰이 섞여있음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 594px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;한 줄 결론&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;&lt;b&gt;자연어 CoT(Explicit)를 연속(latent) 공간의 짧은 thought로 &amp;ldquo;압축&amp;rdquo;&lt;/b&gt;하되, &lt;b&gt;self-distillation(teacher&amp;harr;student hidden state 정렬)&lt;/b&gt;로 추론 능력을 전이해 &lt;b&gt;implicit CoT가 explicit CoT 성능에 도달&lt;/b&gt;하게 만든다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;문제의식&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;CoT는 성능을 올리지만 &lt;b&gt;토큰 비용이 크고(비효율), 언어적 모사로 과적합 가능&lt;/b&gt;. &lt;br /&gt;기존 implicit CoT는 언어를 우회하려 했으나 &lt;b&gt;CoT-SFT 대비 성능 격차&lt;/b&gt;가 큼&lt;br /&gt;(특히 curriculum 기반 Coconut은 stage 간 forgetting 가능).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;핵심 아이디어&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;&lt;b&gt;동일 LLM&lt;/b&gt;에서 (1) &lt;b&gt;Teacher: explicit CoT 생성&lt;/b&gt;(CE) + (2) &lt;b&gt;Student: continuous thought 후 답 생성&lt;/b&gt;(CE)을 &lt;b&gt;공동 학습&lt;/b&gt;하고, &lt;br /&gt;&lt;b&gt;답 직전 특정 토큰(기본 &amp;lsquo;:&amp;rsquo;)의 hidden activation을 층별로 L1 정렬&lt;/b&gt;하여 reasoning을 latent로 distill.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot;&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;모델/학습 설계&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;목적함수 &lt;b&gt;L = &amp;alpha;&amp;middot;L_student + &amp;beta;&amp;middot;L_KD + &amp;gamma;&amp;middot;L_teacher&lt;/b&gt;. &lt;br /&gt;Student는 &amp;lt;bot&amp;gt;에서 시작해 &lt;b&gt;n개의 continuous thought를 hidden-state propagation&lt;/b&gt;으로 만들고 &amp;lt;eot&amp;gt;로 답 생성 모드로 전환. &lt;br /&gt;continuous thought에는 &lt;b&gt;2-layer MLP+LN projection&lt;/b&gt;을 적용. &lt;br /&gt;Distillation은 &lt;b&gt;stop-grad teacher&lt;/b&gt;로 one-way 전이.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 59px;&quot;&gt;
&lt;td style=&quot;height: 59px;&quot;&gt;Distillation 근거&lt;/td&gt;
&lt;td style=&quot;height: 59px;&quot;&gt;CoT가 &amp;ldquo;답 직전 토큰(예: &amp;lsquo;The answer is:&amp;rsquo;의 &amp;lsquo;:&amp;rsquo;)&amp;rdquo; hidden을 &lt;b&gt;shift&lt;/b&gt;시키며, 그 shift에 reasoning 정보가 담긴다는 관점(&amp;ldquo;CoT shift&amp;rdquo; 정당화). &lt;br /&gt;그래서 &lt;b&gt;해당 토큰 hidden만 정렬&lt;/b&gt;해도 효과적이라고 주장.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;데이터/비교&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;학습: &lt;b&gt;GSM8k-Aug / GSM8k-Aug-NL / CommonsenseQA-CoT(자체 생성)&lt;/b&gt;. &lt;br /&gt;비교: No-CoT-SFT, CoT-SFT, iCoT, Coconut, CODI.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot;&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;메인 성과(성능)&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;&lt;b&gt;GPT-2 스케일에서 GSM8k에서 CoT-SFT 성능에 &amp;ldquo;매칭(99%)&amp;rdquo;&lt;/b&gt;했다고 보고. &lt;br /&gt;Coconut 등 기존 implicit CoT 대비 큰 폭 향상(본문 요약).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot;&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;메인 성과(효율)&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;&lt;b&gt;6개 continuous thought(+bot/eot=총 8 토큰)&lt;/b&gt;로 reasoning 길이를 고정해, GSM8k-Aug에서 &lt;b&gt;~3.1&amp;times; 압축/~2.7&amp;times; 속도&lt;/b&gt;, GSM8k-Aug-NL에서 &lt;b&gt;~8.2&amp;times; 압축/~5.9&amp;times; 속도&lt;/b&gt;를 보고(A100, bs=1).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;견고성(OOD)&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;GSM8k-Aug로 학습 후 SVAMP/GSM-Hard/MultiArith에서 &lt;b&gt;implicit CoT 중 최고&lt;/b&gt;, GPT-2에서는 &lt;b&gt;CoT-SFT도 일부 상회&lt;/b&gt;. &lt;br /&gt;해석: token-level CoT 모사가 없어 &lt;b&gt;과적합 감소&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;Ablation 핵심&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;&lt;b&gt;L1(KD) 제거 시 급락&lt;/b&gt;, &lt;b&gt;분리된 static teacher도 성능 하락&lt;/b&gt;(reference learning 중요). &lt;br /&gt;&lt;b&gt;CoT 마지막 step 포함 시 성능 악화&lt;/b&gt;(answer-copy shortcut). projection 제거는 소폭 하락.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;해석가능성&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;continuous thought를 vocab에 투영(probing)하면 &lt;b&gt;중간 계산 결과&lt;/b&gt;가 관찰되고, attention이 operand 토큰을 잡는 사례 제시. 다만 token-level probing 한계 존재.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;한계/향후&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;implicit CoT는 본질적으로 &lt;b&gt;해석성 trade-off&lt;/b&gt;. &lt;br /&gt;distill token(&amp;lsquo;:&amp;rsquo;) 선택/프롬프트 영향, 긴 reasoning에서 &lt;b&gt;credit assignment/최적화 난이도&lt;/b&gt; 가능. &lt;br /&gt;대규모 스케일링은 제한적.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2508.03440&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2508.03440&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1771520941544&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;LLMs are Single-threaded Reasoners: Demystifying the Working Mechanism of Soft Thinking&quot; data-og-description=&quot;Human cognition naturally engages with abstract and fluid concepts, whereas existing reasoning models often rely on generating discrete tokens, potentially constraining their expressive capabilities. Recent advancements aim to address this limitation by en&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2508.03440&quot; data-og-url=&quot;https://arxiv.org/abs/2508.03440v4&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bKnFgc/dJMb8TB59MS/EyQh1wzaeQPeKgFDyJBLr1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/36aWu/dJMb8WMl8nz/1oyohGFJf44pfjzVIlTmzk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2508.03440&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2508.03440&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bKnFgc/dJMb8TB59MS/EyQh1wzaeQPeKgFDyJBLr1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/36aWu/dJMb8WMl8nz/1oyohGFJf44pfjzVIlTmzk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;LLMs are Single-threaded Reasoners: Demystifying the Working Mechanism of Soft Thinking&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Human cognition naturally engages with abstract and fluid concepts, whereas existing reasoning models often rely on generating discrete tokens, potentially constraining their expressive capabilities. Recent advancements aim to address this limitation by en&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ICLR 2026 포스터에 붙은 논문이네요&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;요즘 soft thinking은 토큰 하나 대신 여러 토큰을 통해 다음 스텝에 더 많은 정보를 넣어준다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;BUT 실제로는 성능이 잘 나오지 않음 == 소프트 입력이 병렬 탐색을 실젣로 유도하지 못함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1373&quot; data-origin-height=&quot;513&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/di04uI/dJMcagdrEtc/3ZYYK4TaK8JOzeXovIjOaK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/di04uI/dJMcagdrEtc/3ZYYK4TaK8JOzeXovIjOaK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/di04uI/dJMcagdrEtc/3ZYYK4TaK8JOzeXovIjOaK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fdi04uI%2FdJMcagdrEtc%2F3ZYYK4TaK8JOzeXovIjOaK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1373&quot; height=&quot;513&quot; data-origin-width=&quot;1373&quot; data-origin-height=&quot;513&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;soft 토큰에 여러 후보가 섞여 있어도 다음 스텝은 항상 top-1 토큰 성분에 의해 지배되어 나머지 성분은 무시됨&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1702&quot; data-origin-height=&quot;607&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/UrFnk/dJMcagLhj6u/VlsuBGhkQbEOCGdaAr2fI0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/UrFnk/dJMcagLhj6u/VlsuBGhkQbEOCGdaAr2fI0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/UrFnk/dJMcagLhj6u/VlsuBGhkQbEOCGdaAr2fI0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FUrFnk%2FdJMcagLhj6u%2FVlsuBGhkQbEOCGdaAr2fI0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1702&quot; height=&quot;607&quot; data-origin-width=&quot;1702&quot; data-origin-height=&quot;607&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;바닐라와 거의 유사한 것을 볼 수 있음&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1193&quot; data-origin-height=&quot;542&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bDCyOF/dJMcag5zRRT/1kMtJNDukjs3mkJKb8ylM0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bDCyOF/dJMcag5zRRT/1kMtJNDukjs3mkJKb8ylM0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bDCyOF/dJMcag5zRRT/1kMtJNDukjs3mkJKb8ylM0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbDCyOF%2FdJMcag5zRRT%2F1kMtJNDukjs3mkJKb8ylM0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1193&quot; height=&quot;542&quot; data-origin-width=&quot;1193&quot; data-origin-height=&quot;542&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1top token과 2top token, soft input을 비교해봤을 때 soft의 예측 분포는 top-1과 거의 비슷함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;두 토큰을 섞어서 넣어봐도 top -1 경로에 수렴함을 볼 수 있음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순 sampling보다 soft thinking이 greedy trace에 가까움&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;489&quot; data-origin-height=&quot;493&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dddqRu/dJMcahcj258/2kexHlKIpB4T1odavCoLG1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dddqRu/dJMcahcj258/2kexHlKIpB4T1odavCoLG1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dddqRu/dJMcahcj258/2kexHlKIpB4T1odavCoLG1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdddqRu%2FdJMcahcj258%2F2kexHlKIpB4T1odavCoLG1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;489&quot; height=&quot;493&quot; data-origin-width=&quot;489&quot; data-origin-height=&quot;493&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;sampling을 통해서 확률을 조정함 =&amp;gt; 바닐라 대비에서 개선됨&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;연구 질문&lt;/td&gt;
&lt;td&gt;Soft Thinking(= 확률분포/연속 표현을 &amp;ldquo;soft token&amp;rdquo;으로 다음 스텝 입력에 넣는 latent/continuous CoT)이 &lt;b&gt;병렬적 추론 경로 탐색&lt;/b&gt;을 실제로 수행하는가? &lt;br /&gt;그리고 왜 training-free vanilla Soft Thinking이 기대만큼 성능이 안 나오는가?&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;배경/가정&lt;/td&gt;
&lt;td&gt;Soft token은 단일 토큰 선택 대신 &lt;b&gt;어휘분포 전체&lt;/b&gt;를 다음 입력으로 전달해 정보량을 늘리고, 이론적으로는 &lt;b&gt;다중 추론 경로를 잠재적으로 유지&lt;/b&gt;할 수 있다는 기대가 있었다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;핵심 발견&lt;/td&gt;
&lt;td&gt;LLM은 Soft Thinking에서도 &lt;b&gt;single-threaded reasoner&lt;/b&gt;처럼 동작: &lt;br /&gt;soft input이 여러 후보를 포함해도 다음 스텝 예측은 &lt;b&gt;top-1 토큰 성분에 의해 거의 지배&lt;/b&gt;되고, 비-top1 경로는 빠르게 약화/종료된다(&amp;ldquo;가지치기&amp;rdquo;).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;원인 개념화&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Greedy Pitfall&lt;/b&gt;: &lt;br /&gt;top-1 성분 지배 &amp;rarr; 다음 스텝도 top-1을 강화하는 &lt;b&gt;양의 피드백 루프&lt;/b&gt;가 생겨 탐색이 억제되고, 결과적으로 vanilla Soft Thinking은 &lt;b&gt;greedy decoding과 유사한 궤적&lt;/b&gt;으로 수렴한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;분석/증거&lt;/td&gt;
&lt;td&gt;(1) Soft 입력 vs top-1 입력의 다음 분포가 &lt;b&gt;JS divergence&amp;asymp;0&lt;/b&gt;, 반면 top-2 입력과는 크게 다름(soft가 사실상 top-1처럼 작동). &lt;br /&gt;(2) Logit Lens로 레이어 진행 시 &lt;b&gt;top-1 경로 점유율이 1.0으로 수렴&lt;/b&gt;(forward가 pruning처럼 작동). &lt;br /&gt;(3) soft trace(top-1 연결)와 greedy trace의 &lt;b&gt;ROUGE-L 유사도&amp;uarr;&lt;/b&gt;로 greedy화 확인.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;베이스라인 결과&lt;/td&gt;
&lt;td&gt;8개 벤치마크(수학/지식/코드)에서 &lt;b&gt;vanilla Soft Thinking은 Token CoT(sampling)보다 대체로 낮고&lt;/b&gt;, 평균적으로 greedy와 비슷한 수준에 머무는 경향(Table 1).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;제안 방법&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Stochastic Soft Thinking&lt;/b&gt;: &lt;br /&gt;soft token을 그대로 쓰지 말고, 원 분포를 기반으로 &lt;b&gt;제어된 확률성&lt;/b&gt;을 주입해 greedy pitfall을 깨는 &amp;ldquo;stochastic soft token&amp;rdquo;을 생성. &lt;br /&gt;요구 조건: Validness(분포), Randomness(탐색), Softness(원-핫 붕괴 방지).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;구현(2가지)&lt;/td&gt;
&lt;td&gt;(1) &lt;b&gt;Dirichlet sampling&lt;/b&gt;: Dir(&amp;gamma;&amp;middot;p)에서 샘플(&amp;gamma;로 농도 조절).&amp;nbsp;&lt;br /&gt;(2) &lt;b&gt;Gumbel-Softmax&lt;/b&gt;: gumbel noise + temperature &amp;tau;로 soft 샘플링(연속적 argmax 근사).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;성능 결과&lt;/td&gt;
&lt;td&gt;두 방법 모두 vanilla 대비 개선. &lt;br /&gt;특히 &lt;b&gt;Gumbel-Softmax는 Token CoT(sampling)까지도 넘어서는&lt;/b&gt; 개선을 3개 LLM&amp;times;8벤치에서 비교적 일관되게 보임(Table 2).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;왜 Gumbel이 유리한가&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Randomness&amp;ndash;Softness trade-off&lt;/b&gt;에서 Gumbel은 &amp;tau;로 softness를 조절하면서도 충분한 randomness(JS divergence)를 유지하기 쉬운 반면, Dirichlet은 &amp;gamma;에 따라 한쪽을 얻으면 다른 쪽이 깨지는 경향(Fig.5).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;추가 의의&lt;/td&gt;
&lt;td&gt;Gumbel-Softmax 샘플은 &lt;b&gt;잘 정의된 PDF/정책비&lt;/b&gt;를 제공해, Latent/Soft Thinking에 &lt;b&gt;policy-gradient RL(PPO/GRPO류) 연결&lt;/b&gt;을 더 정합적으로 만들 수 있다고 논의(&amp;ldquo;foundation for RL training&amp;rdquo;). &lt;br /&gt;또한 Pass@k에서 soft rollouts가 더 강한 탐색 잠재력을 보임(Fig.6).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;한 줄 결론&lt;/td&gt;
&lt;td&gt;&amp;ldquo;Soft token을 넣는다고 LLM이 자동으로 병렬 추론을 하지는 않는다(단일 스레드로 수렴). &lt;br /&gt;따라서 Soft Thinking의 잠재력을 쓰려면 &lt;b&gt;stochasticity를 설계적으로 주입&lt;/b&gt;해야 하며, 그 실용적 해법으로 &lt;b&gt;Gumbel-Softmax 기반 Stochastic Soft Thinking&lt;/b&gt;이 가장 효과적이다.&amp;rdquo;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1206</guid>
      <comments>https://yoonschallenge.tistory.com/1206#entry1206comment</comments>
      <pubDate>Fri, 20 Feb 2026 02:45:44 +0900</pubDate>
    </item>
    <item>
      <title>Latent Reasoning, Soft Thinking 논문 정리 1</title>
      <link>https://yoonschallenge.tistory.com/1205</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2412.06769&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2412.06769&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1771480430248&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Training Large Language Models to Reason in a Continuous Latent Space&quot; data-og-description=&quot;Large language models (LLMs) are typically constrained to reason in the language space, where they express the reasoning process through a chain-of-thought (CoT) to solve complex problems. However, the language space may not always be optimal for reasoning&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2412.06769&quot; data-og-url=&quot;https://arxiv.org/abs/2412.06769v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/uYTSf/dJMb9eTMaVV/TwYU965Yqx6v8zl2OqqGOK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/byZpNc/dJMb8U8P9FG/aAlSxTZ72Fmtuw9fom6LZ0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2412.06769&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2412.06769&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/uYTSf/dJMb9eTMaVV/TwYU965Yqx6v8zl2OqqGOK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/byZpNc/dJMb8U8P9FG/aAlSxTZ72Fmtuw9fom6LZ0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Training Large Language Models to Reason in a Continuous Latent Space&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Large language models (LLMs) are typically constrained to reason in the language space, where they express the reasoning process through a chain-of-thought (CoT) to solve complex problems. However, the language space may not always be optimal for reasoning&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;COLM 2025 에 붙었습니다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;803&quot; data-origin-height=&quot;329&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bXoHd7/dJMcagkaVpt/GpJkZ5z3B4qwbkM7OoZJb1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bXoHd7/dJMcagkaVpt/GpJkZ5z3B4qwbkM7OoZJb1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bXoHd7/dJMcagkaVpt/GpJkZ5z3B4qwbkM7OoZJb1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbXoHd7%2FdJMcagkaVpt%2FGpJkZ5z3B4qwbkM7OoZJb1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;803&quot; height=&quot;329&quot; data-origin-width=&quot;803&quot; data-origin-height=&quot;329&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 LLM의 추론은 언어 공간에서 진행되어서 자연어 토큰으로 생성하게 된다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러나 추론에 불필요한 토큰이 너무 많이 들어가고, 대부분 자연스러움과 유창성을 위한 것으로 실제 정보량은 적다.&lt;br /&gt;또한 핵심 토큰을 가지는 것이 아니라 모든 토큰 예측에 동일한 리소스를 할당하고, 그리디한 경로를 진행하기에 틀리면 되돌아가기 어렵고, 환각에 빠지기 쉬움&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 추론을 자연어 토큰으로 뱉지 말고 마지막 hidden state를 그대로 입력하여 연속 공간에서 진행하도록 함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;bot = Latent mode 시작&lt;br /&gt;eot = Latent mode 끝&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;745&quot; data-origin-height=&quot;392&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bW3FP1/dJMb996rhNf/aRg1Nsj4HAJbjwD7AR3TaK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bW3FP1/dJMb996rhNf/aRg1Nsj4HAJbjwD7AR3TaK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bW3FP1/dJMb996rhNf/aRg1Nsj4HAJbjwD7AR3TaK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbW3FP1%2FdJMb996rhNf%2FaRg1Nsj4HAJbjwD7AR3TaK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;745&quot; height=&quot;392&quot; data-origin-width=&quot;745&quot; data-origin-height=&quot;392&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기선 loss를 걸지 않고 진행하는 방식으로 continous thought가 정답 토큰, 뒷 토큰 예측을 더 잘하도록 도와주게 학습됩니다.&amp;nbsp;&lt;br /&gt;=&amp;gt; 이 부분은 Soft thinking의 학습 방법이 좀 더 나은 것 같네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 정답으로 넘어가는 부분도 고정 길이를 사용해서 진행합니다.&amp;nbsp;&lt;br /&gt;binary classifier 를 학습해도 된다고 하지만... 이 부분은 음 학습 방법 상 어쩔 수 없는 것 같네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;애초에 bot의 마지막 hidden state를 한번 더 넣고, eot를 넣는거라 언제 끝낼지 신호 자체가 없으니...&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;924&quot; data-origin-height=&quot;423&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/kH8jr/dJMcaiChmap/DWNPfiLKW16erwKkeDrj1k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/kH8jr/dJMcaiChmap/DWNPfiLKW16erwKkeDrj1k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/kH8jr/dJMcaiChmap/DWNPfiLKW16erwKkeDrj1k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FkH8jr%2FdJMcaiChmap%2FDWNPfiLKW16erwKkeDrj1k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;924&quot; height=&quot;423&quot; data-origin-width=&quot;924&quot; data-origin-height=&quot;423&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최대 reasoning step을 6으로 두고 실험을 진행했다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;817&quot; data-origin-height=&quot;831&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bsMx56/dJMcachNjou/G7LxYKYbfDL7opV7tqz5Mk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bsMx56/dJMcachNjou/G7LxYKYbfDL7opV7tqz5Mk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bsMx56/dJMcachNjou/G7LxYKYbfDL7opV7tqz5Mk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbsMx56%2FdJMcachNjou%2FG7LxYKYbfDL7opV7tqz5Mk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;817&quot; height=&quot;831&quot; data-origin-width=&quot;817&quot; data-origin-height=&quot;831&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CoT처럼 top-1 경로로 진행하는 것이 아닌 첫 thought에서 후보를 다양하게 두고, 두번째 tought에서 수렴하는 듯한 모습을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이를 통해 그리디가 아닌 BFS와 유사하다고 보여짐&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1239&quot; data-origin-height=&quot;465&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cjCLqJ/dJMcaihZGXd/JpruhNw1ZdwdgTLlVxi0XK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cjCLqJ/dJMcaihZGXd/JpruhNw1ZdwdgTLlVxi0XK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cjCLqJ/dJMcaihZGXd/JpruhNw1ZdwdgTLlVxi0XK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcjCLqJ%2FdJMcaihZGXd%2FJpruhNw1ZdwdgTLlVxi0XK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1239&quot; height=&quot;465&quot; data-origin-width=&quot;1239&quot; data-origin-height=&quot;465&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Pause Token은 더미 토큰을 통해 토큰 수를 늘려 생각을 대신한 논문이다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;iCoT가 생각보다 너무 잘하는 경향이 있네요....&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;563&quot; data-origin-height=&quot;611&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cGV8AI/dJMcafex7rO/tCiPFP2gXapWdDkmCUrLak/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cGV8AI/dJMcafex7rO/tCiPFP2gXapWdDkmCUrLak/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cGV8AI/dJMcafex7rO/tCiPFP2gXapWdDkmCUrLak/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcGV8AI%2FdJMcafex7rO%2FtCiPFP2gXapWdDkmCUrLak%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;563&quot; height=&quot;611&quot; data-origin-width=&quot;563&quot; data-origin-height=&quot;611&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;분석 목적으로 thinking hidden state를 LM head를 달아 해석해 봤더니 아무 의미 없는 벡터가 아니라 중간 변수들을 뽑아내는 것을 볼 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;문제의식&lt;/td&gt;
&lt;td&gt;기존 CoT 추론은 &lt;b&gt;언어 토큰 공간&lt;/b&gt;에 묶여 불필요한 토큰(유창성 유지 등)이 많고, 고난도 계획/탐색이 필요한 지점에서도 토큰별 compute를 균등하게 써서 비효율적이며, &lt;b&gt;그리디하게 한 경로에 조기 커밋&lt;/b&gt;해 탐색형 문제에서 취약하다는 한계를 지적.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;핵심 아이디어&lt;/td&gt;
&lt;td&gt;&lt;b&gt;Chain of Continuous Thought(Coconut)&lt;/b&gt;: &lt;br /&gt;추론을 &amp;ldquo;언어 토큰 생성&amp;rdquo;으로 하지 않고, &lt;b&gt;마지막 레이어 hidden state를 다음 입력 임베딩으로 재주입&lt;/b&gt;해 &lt;b&gt;연속(latent) 공간에서 thought step&lt;/b&gt;을 진행한 뒤, 필요할 때만 언어로 디코딩해 답을 생성.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;동작 방식&lt;/td&gt;
&lt;td&gt;&amp;lt;bot&amp;gt;~&amp;lt;eot&amp;gt; 구간을 &lt;b&gt;latent mode&lt;/b&gt;로 정의. latent mode에서는 토큰을 샘플링하지 않고 &lt;b&gt;직전 step의 last hidden state를 다음 step 입력으로 사용&lt;/b&gt;(언어 분포는 본질적 목표가 아님). &lt;br /&gt;&amp;lt;eot&amp;gt; 이후는 일반 언어 생성 모드로 전환.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;학습 방법(커리큘럼)&lt;/td&gt;
&lt;td&gt;CoT를 교사로 쓰는 &lt;b&gt;multi-stage curriculum&lt;/b&gt;: &lt;br /&gt;stage k에서 CoT의 앞쪽 k개 reasoning step을 &lt;b&gt;k&amp;times;c개의 continuous thoughts로 치환&lt;/b&gt;하고, 질문/latent 구간 loss는 마스킹한 채 &lt;b&gt;뒤 토큰(남은 reasoning/answer)&lt;/b&gt;의 CE loss로 학습. (latent는 직접 loss를 안 걸어도 후속 토큰 loss가 역전파되어 학습됨)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&amp;ldquo;탐색&amp;rdquo; 관찰/해석&lt;/td&gt;
&lt;td&gt;continuous thought가 &lt;b&gt;여러 후보 다음 스텝을 동시에 유지&lt;/b&gt;하는 표현이 될 수 있어, CoT의 단일 경로 그리디 커밋과 달리 &lt;b&gt;BFS-like(넓게 탐색&amp;rarr;수렴)&lt;/b&gt; 패턴이 emergent하게 나타난다고 분석(특히 DAG 경로 탐색형 ProsQA).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;실험 설정/과제&lt;/td&gt;
&lt;td&gt;GSM8K(수학), ProntoQA(논리), ProsQA(탐색이 필요한 논리 DAG 경로 문제; &lt;br /&gt;논문 제안 데이터셋)로 평가. latent step 수는 기본적으로 &lt;b&gt;고정 길이로 지정(패딩)&lt;/b&gt;하는 설정을 주로 사용.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;주요 결과&lt;/td&gt;
&lt;td&gt;&lt;b&gt;ProsQA/ProntoQA에서&lt;/b&gt; CoT 대비 &lt;b&gt;정확도&amp;uarr; + 생성 토큰 수&amp;darr;&lt;/b&gt;(추론 효율&amp;uarr;). &lt;br /&gt;GSM8K에서는 CoT가 최고 정확도지만 Coconut은 No-CoT 대비 크게 개선하며 &lt;b&gt;토큰 대비 성능 트레이드오프&lt;/b&gt;를 주장.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;중요 어블레이션&lt;/td&gt;
&lt;td&gt;&lt;b&gt;커리큘럼 없이&lt;/b&gt;(Q&amp;rarr;A로 바로 latent reasoning 학습) 성능이 크게 저하 &lt;br /&gt;&amp;rarr; latent reasoning은 CoT 기반의 점진적 치환 학습이 핵심.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;한계/과제&lt;/td&gt;
&lt;td&gt;latent thought step 수만큼 &lt;b&gt;순차 forward pass가 추가(n+1 passes)&lt;/b&gt;되어 병렬화가 어렵고, &amp;lt;eot&amp;gt;(종료) 제어를 더 자연스럽게 만드는 방법(종료 classifier 등)과 더 큰 스케일/사전학습에서의 일반화가 향후 과제로 제시됨.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://neurips.cc/virtual/2025/loc/san-diego/poster/118535&quot;&gt;https://neurips.cc/virtual/2025/loc/san-diego/poster/118535&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1771480160851&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;NeurIPS Poster Hybrid Latent Reasoning via Reinforcement Learning&quot; data-og-description=&quot;Recent advances in large language models (LLMs) have introduced latent reasoning as a promising alternative to autoregressive reasoning. By performing internal computation with hidden states from previous steps, latent reasoning benefit from more informati&quot; data-og-host=&quot;neurips.cc&quot; data-og-source-url=&quot;https://neurips.cc/virtual/2025/loc/san-diego/poster/118535&quot; data-og-url=&quot;https://neurips.cc/virtual/2025/loc/san-diego/poster/118535&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://neurips.cc/virtual/2025/loc/san-diego/poster/118535&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://neurips.cc/virtual/2025/loc/san-diego/poster/118535&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;NeurIPS Poster Hybrid Latent Reasoning via Reinforcement Learning&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Recent advances in large language models (LLMs) have introduced latent reasoning as a promising alternative to autoregressive reasoning. By performing internal computation with hidden states from previous steps, latent reasoning benefit from more informati&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;neurips.cc&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;뉴립스에 붙은 논문입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 CoT는 토큰 기반 생성에 의존하지만 최근 latent reasoning은 이전 스텝의 hidden state를 재사용해 내부 연산을 수행하여 추론할 수 있음을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1634&quot; data-origin-height=&quot;684&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bC7G1k/dJMcahXHszz/1X2Ll3zFAkHiTptzqqx4l1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bC7G1k/dJMcahXHszz/1X2Ll3zFAkHiTptzqqx4l1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bC7G1k/dJMcahXHszz/1X2Ll3zFAkHiTptzqqx4l1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbC7G1k%2FdJMcahXHszz%2F1X2Ll3zFAkHiTptzqqx4l1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1634&quot; height=&quot;684&quot; data-origin-width=&quot;1634&quot; data-origin-height=&quot;684&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;BUT COCONUT, CODI와 같은 방법들은 CoT trajectory, 증류를 훈련에 사용하여 리소스가 많이 들고 복잡하며, LLM과의 비호환성이 있음&amp;nbsp;&lt;br /&gt;그리고 RL 적용이 어려움&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 사전 학습 LLM의 생성 성능을 유지하면서, CoT 없이도 RL로 잠재/ 연속 추론을 학습할 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1252&quot; data-origin-height=&quot;581&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/5TWAo/dJMcaduaOOQ/vx17KuvMdw0qjK64H8qXok/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/5TWAo/dJMcaduaOOQ/vx17KuvMdw0qjK64H8qXok/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/5TWAo/dJMcaduaOOQ/vx17KuvMdw0qjK64H8qXok/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F5TWAo%2FdJMcaduaOOQ%2Fvx17KuvMdw0qjK64H8qXok%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1252&quot; height=&quot;581&quot; data-origin-width=&quot;1252&quot; data-origin-height=&quot;581&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기선 생성된 것에 hidden state를 더해서 사용하네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순 가중합만을 사용해서 진행하면 모델이 붕괴할 수 있기에 처음에는 토큰 임베딩 위주로 진행하다가 점차 latent hidden state의 비중을 증가함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;C그리하여 RL을 통해 정답이면 1, 아니면 0을 통해 단순 정답 체점 기준으로 보상을 줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이를 통해 성능이 높아짐을 보여줌!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;829&quot; data-origin-height=&quot;584&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/lwHHv/dJMcaajYSEo/wjmZOOCllL9xvEpyXktuNK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/lwHHv/dJMcaajYSEo/wjmZOOCllL9xvEpyXktuNK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/lwHHv/dJMcaajYSEo/wjmZOOCllL9xvEpyXktuNK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FlwHHv%2FdJMcaajYSEo%2FwjmZOOCllL9xvEpyXktuNK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;829&quot; height=&quot;584&quot; data-origin-width=&quot;829&quot; data-origin-height=&quot;584&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순 hidden state만을 넣으면 리워드가 0에 수렴해버림 ( cold start 라도 해줬어야...)&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 483px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;논문 한줄 요약&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;&lt;b&gt;HRPO(Hybrid Reasoning Policy Optimization)&lt;/b&gt;로, &lt;b&gt;토큰(이산) 샘플링&lt;/b&gt;과 &lt;b&gt;latent(연속) 입력&lt;/b&gt;을 &lt;b&gt;게이팅으로 혼합&lt;/b&gt;해 &lt;b&gt;CoT 없이(outcome reward만으로) RL 학습&lt;/b&gt;을 가능하게 만든 &lt;b&gt;하이브리드 잠재 추론 프레임워크&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot;&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;해결하려는 문제&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;(1) 기존 latent reasoning은 &lt;b&gt;CoT/trajectory 의존&lt;/b&gt;이 커서 데이터&amp;middot;비용 부담이 큼 &lt;br /&gt;(2) hidden state를 그대로 입력으로 쓰면 &lt;b&gt;embedding manifold 불일치&lt;/b&gt;로 생성이 붕괴/반복/비문이 발생 &lt;br /&gt;(3) 순수 연속(latent-only)은 &lt;b&gt;확률성 감소&lt;/b&gt;로 RL 최적화가 어려움&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;핵심 아이디어&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;&lt;b&gt;&amp;ldquo;안정적 생성(토큰) + 내부추론 강화(latent)&amp;rdquo;를 동시에&lt;/b&gt;: &lt;br /&gt;추론 구간에서만 &lt;b&gt;token embedding(샘플)&lt;/b&gt; 과 &lt;b&gt;latent(분포 기반 가중합)&lt;/b&gt; 을 섞어 입력을 만들고, 이를 &lt;b&gt;정답 여부 보상&lt;/b&gt;으로 RL 최적화&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;방법 1: Latent 정렬(안정화)&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;다음 입력을 hidden 자체로 넣지 않고, 모델의 다음 토큰 분포로 &lt;b&gt;모든 토큰 임베딩의 가중합(interpolation)&lt;/b&gt; 형태로 만들어 &lt;b&gt;입력이 항상 embedding 공간에 존재&lt;/b&gt;하도록 강제 &lt;br /&gt;&amp;rarr; 분포 불일치로 인한 붕괴 완화&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;방법 2: Hybrid gating(확률성+성능)&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;&lt;b&gt;샘플링된 토큰 임베딩&lt;/b&gt;과 &lt;b&gt;interpolated latent 벡터&lt;/b&gt;를 &lt;b&gt;게이트 (a_t)&lt;/b&gt; 로 혼합. &lt;br /&gt;초기에는 토큰 비중&amp;uarr;(품질 보존), 학습되며 latent 비중&amp;uarr;(추론 강화). &lt;br /&gt;Hybrid가 &lt;b&gt;collapse를 막고 안정적으로 수렴&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;학습 신호 / 최적화&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;&lt;b&gt;CoT 없이&lt;/b&gt; final answer의 &lt;b&gt;outcome reward(정답=1/오답=0 등)&lt;/b&gt; 만 사용. &lt;br /&gt;입력당 여러 rollout을 생성해 &lt;b&gt;group 기반 advantage 표준화&lt;/b&gt; + &lt;b&gt;KL 정규화&lt;/b&gt;로 on-policy RL 업데이트&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;적용 방식&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;reasoning은 &lt;b&gt;구간(추론 구간)&lt;/b&gt; 에서만 hybrid 입력을 사용하고, 최종 답 출력은 &lt;b&gt;표준 AR decoding&lt;/b&gt;으로 수행 &lt;br /&gt;&amp;rarr; 해석가능성/품질 유지&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;주요 실험 결과(요지)&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;지식/멀티홉 QA와 STEM 추론에서 &lt;b&gt;SFT/PPO/GRPO 및 일부 RAG 대비 평균 성능 우수&lt;/b&gt;를 보고. &lt;br /&gt;특히 &lt;b&gt;1.5B~3B급 소형 모델에서 이득이 큼&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;핵심 분석(왜 되나)&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;&lt;b&gt;hidden 직접 입력&lt;/b&gt;은 생성 붕괴로 reward 0에 수렴하기 쉽고, &lt;b&gt;interpolation-only&lt;/b&gt;는 학습 중 collapse 위험. &lt;br /&gt;&lt;b&gt;hybrid gating&lt;/b&gt;이 확률성(샘플링)과 안정성(embedding 정렬)을 동시에 제공&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;논문이 말하고자 하는 바&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;&lt;b&gt;잠재/연속 추론은 CoT 감독 없이도 RL로 학습 가능&lt;/b&gt;하며, 이를 실용적으로 만들려면 &lt;b&gt;embedding 정렬(분포 기반 interpolation) + token/latent 혼합(gating)&lt;/b&gt; 이 핵심 설계라는 주장&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;한계/후속 과제(암시)&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;on-policy rollout 비용, 게이팅/temperature 등 하이퍼 민감성, latent 추론의 투명성 부족 &amp;rarr; 샘플 효율(오프폴리시/가속), 해석성, 일반화 검증 확장 필요&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://neurips.cc/virtual/2025/loc/san-diego/poster/119459&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://neurips.cc/virtual/2025/loc/san-diego/poster/119459&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1771497195932&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;NeurIPS Poster Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains&quot; data-og-description=&quot;Large Language Models (LLMs) achieve superior performance through Chain-of-Thought (CoT) reasoning, but these token-level reasoning chains are computationally expensive and inefficient. In this paper, we introduce Compressed Latent Reasoning (CoLaR), a nov&quot; data-og-host=&quot;neurips.cc&quot; data-og-source-url=&quot;https://neurips.cc/virtual/2025/loc/san-diego/poster/119459&quot; data-og-url=&quot;https://neurips.cc/virtual/2025/loc/san-diego/poster/119459&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://neurips.cc/virtual/2025/loc/san-diego/poster/119459&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://neurips.cc/virtual/2025/loc/san-diego/poster/119459&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;NeurIPS Poster Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Large Language Models (LLMs) achieve superior performance through Chain-of-Thought (CoT) reasoning, but these token-level reasoning chains are computationally expensive and inefficient. In this paper, we introduce Compressed Latent Reasoning (CoLaR), a nov&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;neurips.cc&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 것도 뉴립스 2025 포스터입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서도 CoT의 추론 리소스를 문제로 잡습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 기존 효율화 방식은 토큰화 방법에서 벗어나지 못 하고, latent 공간 추론은 고정 길이로만 추론하거나, 상황에 따라 바꾸기 애매하고, latent 생성이 결정적인 경우가 많다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; RL과 결합했을 때 탐색, 활용이 약함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1555&quot; data-origin-height=&quot;536&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/pDEJS/dJMcadHINMG/X4LAN6SUfoyNgK6nDG7gL1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/pDEJS/dJMcadHINMG/X4LAN6SUfoyNgK6nDG7gL1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/pDEJS/dJMcadHINMG/X4LAN6SUfoyNgK6nDG7gL1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FpDEJS%2FdJMcadHINMG%2FX4LAN6SUfoyNgK6nDG7gL1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1555&quot; height=&quot;536&quot; data-origin-width=&quot;1555&quot; data-origin-height=&quot;536&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CoLaR을 통해 여러 토큰을 하나의 latent로 압축하여 추론하고, 압축률을 조절하며 확률적 latent head + RL을 통해 정답을 유지하며 더 짧은 추론 경로를 찾아 효율을 올림&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1455&quot; data-origin-height=&quot;818&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bXQoYD/dJMb99STvZV/03Nxp9YAPPbYrn4KivMj30/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bXQoYD/dJMb99STvZV/03Nxp9YAPPbYrn4KivMj30/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bXQoYD/dJMb99STvZV/03Nxp9YAPPbYrn4KivMj30/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbXQoYD%2FdJMb99STvZV%2F03Nxp9YAPPbYrn4KivMj30%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1455&quot; height=&quot;818&quot; data-origin-width=&quot;1455&quot; data-origin-height=&quot;818&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;음.... 여기서 그렇게 좋아보이는 방법은 아니지만....&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순 mean-pooling은 분산이 줄어드는 등 분포가 왜곡될 수 있으니 임베딩을 &amp;radic;(1/c)로 스케일함&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;압축된 embedding은 c개의 토큰을 대표하니 multi-label에 가깝다&amp;nbsp;&lt;br /&gt;=&amp;gt; c개 중 1개를 랜덤 샘플링 해 라벨로 사용하여 c개에서 가능한 토큰들의 분포를 근사하게 만듬&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Latent head는 다음 compressed embedding의 분포를 예측함&amp;nbsp;&lt;br /&gt;inference 시 reparameterization을 통해 샘플링하여 latent를 생성 == 같은 문제에서도 다양한 latent 경로 생성 가능&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Loss는 NLL을 쓰지만 단순 데이터에서 under fit 경향이 있어 soft-MSE + entropy term으로 제안 함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;매 스탭마다 c를 랜덤 샘플링 하여 다양한 압축률을 학습하도록 만듦&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;RL에서는 더 짧고 정답을 맞추는 latent 경로를 탐색하도록 만듦&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;822&quot; data-origin-height=&quot;789&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c0iGQo/dJMcab4e3nW/7a45fekyKQ6cm2K5LxOgv0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c0iGQo/dJMcab4e3nW/7a45fekyKQ6cm2K5LxOgv0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c0iGQo/dJMcab4e3nW/7a45fekyKQ6cm2K5LxOgv0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc0iGQo%2FdJMcab4e3nW%2F7a45fekyKQ6cm2K5LxOgv0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;822&quot; height=&quot;789&quot; data-origin-width=&quot;822&quot; data-origin-height=&quot;789&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;정확도가 올라가며 latent head나 loss의 중요성을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;top-k 토큰을 통해 핵심 토큰이 latent 별로 회수되어 해석 가능함을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 639px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;문제의식&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;Chain-of-Thought(CoT)는 정확도를 높이지만 &lt;b&gt;중간 추론 토큰이 길어&lt;/b&gt; 추론 비용(토큰&amp;middot;시간&amp;middot;메모리)이 커짐. &lt;br /&gt;기존 latent 추론은 &lt;b&gt;고정 step&lt;/b&gt;/결정적 생성 위주라 &lt;b&gt;상황별 압축&amp;middot;탐색&lt;/b&gt;이 약함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;핵심 주장&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;&lt;b&gt;추론 체인을 &amp;ldquo;토큰&amp;rdquo;이 아니라 &amp;ldquo;latent(연속) 표현&amp;rdquo;으로 동적으로 압축&lt;/b&gt;하면, 정답률을 크게 해치지 않으면서 &lt;b&gt;추론 길이를 대폭 줄일 수 있고&lt;/b&gt;, 확률적 latent + RL로 &lt;b&gt;짧고 맞는 경로를 탐색/강화&lt;/b&gt;할 수 있다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 59px;&quot;&gt;
&lt;td style=&quot;height: 59px;&quot;&gt;방법 개요&lt;/td&gt;
&lt;td style=&quot;height: 59px;&quot;&gt;&lt;b&gt;CoLaR(Compressed Latent Reasoning)&lt;/b&gt;: &lt;br /&gt;reasoning chain의 여러 토큰 임베딩을 &lt;b&gt;압축 계수 c&lt;/b&gt;에 따라 묶어 &lt;b&gt;compressed embedding(latent)&lt;/b&gt;으로 만들고, &amp;ldquo;Let&amp;rsquo;s think c&amp;times; faster&amp;rdquo; 같은 프롬프트로 &lt;b&gt;압축률을 제어&lt;/b&gt;하며 추론.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;압축 연산&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;단순 mean pooling의 분포 왜곡을 줄이기 위해, c개 임베딩 합을 &lt;b&gt;&amp;radic;(1/c)&lt;/b&gt;로 스케일하는 형태의 &lt;b&gt;분포 보존 압축&lt;/b&gt;을 사용.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 118px;&quot;&gt;
&lt;td style=&quot;height: 118px;&quot;&gt;SFT 학습(1단계)&lt;/td&gt;
&lt;td style=&quot;height: 118px;&quot;&gt;(1) &lt;b&gt;Compressed reasoning token supervision(CE)&lt;/b&gt;: &lt;br /&gt;각 압축 그룹(c개 토큰)에서 &lt;b&gt;토큰 1개를 랜덤 샘플링&lt;/b&gt;해 라벨로 두어, &amp;ldquo;그룹 내 가능한 토큰 분포&amp;rdquo;를 근사하는 &lt;b&gt;dense supervision&lt;/b&gt;을 제공.&lt;br /&gt;&lt;br /&gt;(2) &lt;b&gt;Latent head 학습&lt;/b&gt;: &lt;br /&gt;다음 latent를 예측하도록 별도 head를 학습. 또한 학습 중 &lt;b&gt;c를 랜덤 샘플링&lt;/b&gt;해 다양한 압축률에 적응.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot;&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;Latent head&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;Latent head가 다음 latent의 &lt;b&gt;(&amp;mu;, &amp;sigma;)&lt;/b&gt;를 예측하고, reparameterization으로 샘플링하여 &lt;b&gt;확률적 latent 추론&lt;/b&gt;을 가능하게 함(탐색에 유리). &lt;br /&gt;Latent loss로 NLL 외에 &lt;b&gt;soft-MSE + entropy(&amp;sigma; 확대)&lt;/b&gt;를 비교/제안.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot;&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;RL 학습&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;&lt;b&gt;GRPO&lt;/b&gt;로 학습. &lt;br /&gt;보상은 정답(1)/오답(0)을 기본으로 하되, 보상을 토큰/latent 단위로 평균해 적용하여 &lt;b&gt;정답이면 더 짧게(압축 강화), 오답이면 성급한 단축을 억제(탐색 유도)&lt;/b&gt;하는 방식으로 &amp;ldquo;정확도&amp;ndash;길이&amp;rdquo;를 동시에 최적화.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;주요 실험 설정&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;주로 &lt;b&gt;수학 추론&lt;/b&gt;(GSM8K 계열, SVAMP, MultiArith, MATH 등)에서 CoT 및 기존 latent 추론(Coconut/CODI 계열)과 비교.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot;&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;대표 결과&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot;&gt;(1) 여러 grade-school 수학 벤치마크에서 기존 latent 대비 &lt;b&gt;정확도 우위&lt;/b&gt;를 보고. &lt;br /&gt;(2) CoT 대비 &lt;b&gt;추론 길이(토큰) 큰 폭 절감&lt;/b&gt;을 달성하면서 정확도 저하는 제한적. &lt;br /&gt;(3) MATH처럼 어려운 문제에서 &lt;b&gt;RL이 정확도&amp;uarr;와 길이&amp;darr;를 동시에 크게 개선&lt;/b&gt;하는 경향을 보고.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;분석/해석&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;latent를 임베딩 테이블과의 유사도로 역조회하면, 낮은 c에서는 핵심 연산 토큰이 더 잘 보존되고 높은 c에서는 덜 중요한 토큰이 생략되는 등 &lt;b&gt;&amp;ldquo;잠재 CoT&amp;rdquo;의 압축 특성&lt;/b&gt;을 정성적으로 제시.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;Ablation 결론&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;&lt;b&gt;dense supervision(압축 토큰 CE)&lt;/b&gt;, &lt;b&gt;분포 보존 압축(&amp;radic;(1/c) 스케일)&lt;/b&gt;, &lt;b&gt;확률적 latent head&lt;/b&gt;, &lt;b&gt;RL(길이-정확도 동시 최적화)&lt;/b&gt;가 성능/효율에 유의미하게 기여한다는 방향의 ablation을 제시.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot;&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;한계/향후&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot;&gt;학습 범위를 벗어난 큰 c 또는 &lt;b&gt;비정수 압축률&lt;/b&gt; 일반화가 어렵고, 수학 외 태스크 확장/보다 정교한 보상 설계/연속 압축 제어 등이 후속 과제로 제시됨.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1205</guid>
      <comments>https://yoonschallenge.tistory.com/1205#entry1205comment</comments>
      <pubDate>Thu, 19 Feb 2026 15:29:30 +0900</pubDate>
    </item>
    <item>
      <title>Multi-turn, Long-context Benchmark 논문 4</title>
      <link>https://yoonschallenge.tistory.com/1195</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.emnlp-main.811/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2024.emnlp-main.811/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768668659601&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;LLM Task Interference: An Initial Study on the Impact of Task-Switch in Conversational History&quot; data-og-description=&quot;Akash Gupta, Ivaxi Sheth, Vyas Raina, Mark Gales, Mario Fritz. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing. 2024.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2024.emnlp-main.811/&quot; data-og-url=&quot;https://aclanthology.org/2024.emnlp-main.811/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bssFVO/dJMb8862CMK/CUBooe9Y4yAjYkHvEQ3FCK/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.emnlp-main.811/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2024.emnlp-main.811/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bssFVO/dJMb8862CMK/CUBooe9Y4yAjYkHvEQ3FCK/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;LLM Task Interference: An Initial Study on the Impact of Task-Switch in Conversational History&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Akash Gupta, Ivaxi Sheth, Vyas Raina, Mark Gales, Mario Fritz. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing. 2024.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.05167&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2502.05167&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768668666054&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;NoLiMa: Long-Context Evaluation Beyond Literal Matching&quot; data-og-description=&quot;Recent large language models (LLMs) support long contexts ranging from 128K to 1M tokens. A popular method for evaluating these capabilities is the needle-in-a-haystack (NIAH) test, which involves retrieving a &amp;quot;needle&amp;quot; (relevant information) from a &amp;quot;haysta&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2502.05167&quot; data-og-url=&quot;https://arxiv.org/abs/2502.05167v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/BOU4X/dJMb9aKyLpw/rmnU3yK2QemiPsakdBhXEK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bDuHDY/dJMb9kTWEOE/gJCrx07qz89IKatREZGhck/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.05167&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2502.05167&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/BOU4X/dJMb9aKyLpw/rmnU3yK2QemiPsakdBhXEK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bDuHDY/dJMb9kTWEOE/gJCrx07qz89IKatREZGhck/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;NoLiMa: Long-Context Evaluation Beyond Literal Matching&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Recent large language models (LLMs) support long contexts ranging from 128K to 1M tokens. A popular method for evaluating these capabilities is the needle-in-a-haystack (NIAH) test, which involves retrieving a &quot;needle&quot; (relevant information) from a &quot;haysta&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2501.17399&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2501.17399&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768668671070&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMs&quot; data-og-description=&quot;We present MultiChallenge, a pioneering benchmark evaluating large language models (LLMs) on conducting multi-turn conversations with human users, a crucial yet underexamined capability for their applications. MultiChallenge identifies four categories of c&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2501.17399&quot; data-og-url=&quot;https://arxiv.org/abs/2501.17399v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/gC2FV/dJMb9fry7NT/aDrKVxg8hdSA5BtVOCv2Xk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/dPQyNa/dJMb9jgqRpK/lMwgv99k5Nzl3lhACD0cU0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2501.17399&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2501.17399&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/gC2FV/dJMb9fry7NT/aDrKVxg8hdSA5BtVOCv2Xk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/dPQyNa/dJMb9jgqRpK/lMwgv99k5Nzl3lhACD0cU0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMs&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We present MultiChallenge, a pioneering benchmark evaluating large language models (LLMs) on conducting multi-turn conversations with human users, a crucial yet underexamined capability for their applications. MultiChallenge identifies four categories of c&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2505.17123&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2505.17123&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768668676060&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation&quot; data-og-description=&quot;Recent advances in Large Language Models (LLMs) have shown promising results in complex reasoning tasks. However, current evaluations predominantly focus on single-turn reasoning scenarios, leaving interactive tasks largely unexplored. We attribute it to t&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2505.17123&quot; data-og-url=&quot;https://arxiv.org/abs/2505.17123v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/wYO2k/dJMb9jgqRpM/R84eIZPbgZaZCip5K8xa9K/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/lRZCg/dJMb9fry7NU/3DjztdkDKrhAV6oSUVFtXk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2505.17123&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2505.17123&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/wYO2k/dJMb9jgqRpM/R84eIZPbgZaZCip5K8xa9K/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/lRZCg/dJMb9fry7NU/3DjztdkDKrhAV6oSUVFtXk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Recent advances in Large Language Models (LLMs) have shown promising results in complex reasoning tasks. However, current evaluations predominantly focus on single-turn reasoning scenarios, leaving interactive tasks largely unexplored. We attribute it to t&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2403.06447&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2403.06447&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768668682873&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;CoRAL: Collaborative Retrieval-Augmented Large Language Models Improve Long-tail Recommendation&quot; data-og-description=&quot;The long-tail recommendation is a challenging task for traditional recommender systems, due to data sparsity and data imbalance issues. The recent development of large language models (LLMs) has shown their abilities in complex reasoning, which can help to&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2403.06447&quot; data-og-url=&quot;https://arxiv.org/abs/2403.06447v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/fRqtY/dJMb8PGpPnK/1gWFB69Ya0RkeYaJnKcogk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/czVHaB/dJMb8VNoZSI/ZQUZOnXNwWp2YbbdXTD7a1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2403.06447&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2403.06447&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/fRqtY/dJMb8PGpPnK/1gWFB69Ya0RkeYaJnKcogk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/czVHaB/dJMb8VNoZSI/ZQUZOnXNwWp2YbbdXTD7a1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;CoRAL: Collaborative Retrieval-Augmented Large Language Models Improve Long-tail Recommendation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;The long-tail recommendation is a challenging task for traditional recommender systems, due to data sparsity and data imbalance issues. The recent development of large language models (LLMs) has shown their abilities in complex reasoning, which can help to&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1195</guid>
      <comments>https://yoonschallenge.tistory.com/1195#entry1195comment</comments>
      <pubDate>Wed, 4 Feb 2026 02:51:56 +0900</pubDate>
    </item>
    <item>
      <title>Privacy AI 관련 조사 13</title>
      <link>https://yoonschallenge.tistory.com/1204</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://ieeexplore.ieee.org/document/10681073&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://ieeexplore.ieee.org/document/10681073&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1770025226760&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;KDPII: A New Korean Dialogic Dataset for the Deidentification of Personally Identifiable Information&quot; data-og-description=&quot;The rapid growth of social media in the era of big data and artificial intelligence has raised significant safety concerns related to the communication of sensitive personal information. In modern society, awareness of the importance of preserving privacy &quot; data-og-host=&quot;ieeexplore.ieee.org&quot; data-og-source-url=&quot;https://ieeexplore.ieee.org/document/10681073&quot; data-og-url=&quot;https://ieeexplore.ieee.org/document/10681073&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bIqrLl/dJMb9frAAv4/7H1LJbDCXnUdtEhjjG0Lr0/img.jpg?width=660&amp;amp;height=295&amp;amp;face=0_0_660_295,https://scrap.kakaocdn.net/dn/wWdxL/dJMb8Z3mnI2/oIy6QoS0hCrab9KnHpPFMk/img.jpg?width=660&amp;amp;height=295&amp;amp;face=0_0_660_295&quot;&gt;&lt;a href=&quot;https://ieeexplore.ieee.org/document/10681073&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://ieeexplore.ieee.org/document/10681073&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bIqrLl/dJMb9frAAv4/7H1LJbDCXnUdtEhjjG0Lr0/img.jpg?width=660&amp;amp;height=295&amp;amp;face=0_0_660_295,https://scrap.kakaocdn.net/dn/wWdxL/dJMb8Z3mnI2/oIy6QoS0hCrab9KnHpPFMk/img.jpg?width=660&amp;amp;height=295&amp;amp;face=0_0_660_295');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;KDPII: A New Korean Dialogic Dataset for the Deidentification of Personally Identifiable Information&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;The rapid growth of social media in the era of big data and artificial intelligence has raised significant safety concerns related to the communication of sensitive personal information. In modern society, awareness of the importance of preserving privacy&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;ieeexplore.ieee.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;한국어 환경에서의 개인정보 비식별화 연구가 체계적으로 뒤쳐져 있다!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 연구와 데이터셋은 한국어의 언어적 특성(교착어, 맥락 의존성, 사회 문화적 표현)을 충분히 반영하지 못하며 실제 서비스 환경과 가까운 대화 맥락에서 PII(개인정보) 식별은 거의 다뤄지지 않음&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1. 한국어 특성을 반영한 PII 분류 체계 정립&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2. 실제 대화 기반의 대규모 한국어 PII 데이터 셋 구축&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;3. 한국어 언어모델의 PII 식별 능력을 체계적으로 진단&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;330&quot; data-origin-height=&quot;768&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bFk5T0/dJMcafrU7lg/Ygs5NQWueWkrIvLKqkgLM0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bFk5T0/dJMcafrU7lg/Ygs5NQWueWkrIvLKqkgLM0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bFk5T0/dJMcafrU7lg/Ygs5NQWueWkrIvLKqkgLM0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbFk5T0%2FdJMcafrU7lg%2FYgs5NQWueWkrIvLKqkgLM0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;330&quot; height=&quot;768&quot; data-origin-width=&quot;330&quot; data-origin-height=&quot;768&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 NER 태그를 그대로 쓰지 않고 한국 개인 정보 보호법 + TTA 개체명 체계를 재해석하여 8개의 1차 카테고리, 33개의 2차 세부 PII 태그를 정의함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;403&quot; data-origin-height=&quot;722&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c4yjEw/dJMcah4lS5A/XkMTwFIG0YwALbfK9QOSE0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c4yjEw/dJMcah4lS5A/XkMTwFIG0YwALbfK9QOSE0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c4yjEw/dJMcah4lS5A/XkMTwFIG0YwALbfK9QOSE0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc4yjEw%2FdJMcah4lS5A%2FXkMTwFIG0YwALbfK9QOSE0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;403&quot; height=&quot;722&quot; data-origin-width=&quot;403&quot; data-origin-height=&quot;722&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;397&quot; data-origin-height=&quot;509&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/u8ghB/dJMcaaD9NQP/YXOqjKMrKtfADIhTiDfMh0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/u8ghB/dJMcaaD9NQP/YXOqjKMrKtfADIhTiDfMh0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/u8ghB/dJMcaaD9NQP/YXOqjKMrKtfADIhTiDfMh0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fu8ghB%2FdJMcaaD9NQP%2FYXOqjKMrKtfADIhTiDfMh0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;397&quot; height=&quot;509&quot; data-origin-width=&quot;397&quot; data-origin-height=&quot;509&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;832&quot; data-origin-height=&quot;768&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cCHHQh/dJMcafMfn3j/X1F3WnUym8KcLTqjVoraK0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cCHHQh/dJMcafMfn3j/X1F3WnUym8KcLTqjVoraK0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cCHHQh/dJMcafMfn3j/X1F3WnUym8KcLTqjVoraK0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcCHHQh%2FdJMcafMfn3j%2FX1F3WnUym8KcLTqjVoraK0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;832&quot; height=&quot;768&quot; data-origin-width=&quot;832&quot; data-origin-height=&quot;768&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;한국어 대화형 PII 데이터 셋을 제작&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;4581개 대화 세트로 약 5만개의 문장이 존재하고, 3만 2천개의 PII 어노테이션, 2인 대화의 3 ~ 6턴으로 이루어져 실제 상담/메신저 환경을 반영하였다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;구조화된 주민번호나 전화번호 같은 PII는 매우 잘 처리하지만 비구조적, 맥락, 의존 PII 성능은 급감함 (이름, 별명, 직장, 장소 등)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모델 크기와 성능의 scaling law는 유지됨&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://zenodo.org/records/16759166&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://zenodo.org/records/16759166&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1770026608036&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;KDPII DATASET REVISED&quot; data-og-description=&quot;KDPII: A New Korean Dialogic Dataset for the Deidentification of Personally Identifiable Information The rapid growth of social media in the era of big data and artificial intelligence has raised significant safety concerns related to the communication of &quot; data-og-host=&quot;zenodo.org&quot; data-og-source-url=&quot;https://zenodo.org/records/16759166&quot; data-og-url=&quot;https://zenodo.org/records/16759166&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://zenodo.org/records/16759166&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://zenodo.org/records/16759166&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;KDPII DATASET REVISED&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;KDPII: A New Korean Dialogic Dataset for the Deidentification of Personally Identifiable Information The rapid growth of social media in the era of big data and artificial intelligence has raised significant safety concerns related to the communication of&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;zenodo.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;데이터는 여기 있습니다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;2002&quot; data-start=&quot;209&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;353&quot; data-start=&quot;231&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;239&quot; data-start=&quot;231&quot;&gt;연구 배경&lt;/td&gt;
&lt;td data-end=&quot;353&quot; data-start=&quot;239&quot; data-col-size=&quot;lg&quot;&gt;대규모 언어모델의 확산으로 개인정보(PII) 유출 위험이 증가했으나, 한국어는 언어적&amp;middot;문화적 특성으로 인해 기존 영어 중심 PII 분류&amp;middot;데이터&amp;middot;평가 체계를 그대로 적용하기 어렵다는 한계가 존재한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;456&quot; data-start=&quot;354&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;361&quot; data-start=&quot;354&quot;&gt;문제의식&lt;/td&gt;
&lt;td data-end=&quot;456&quot; data-start=&quot;361&quot; data-col-size=&quot;lg&quot;&gt;기존 한국어 데이터셋은 NER 중심이거나 구조적 PII 위주로 구성되어 있어, 실제 대화 환경에서 등장하는 맥락 의존적&amp;middot;한국어 특화 PII를 충분히 다루지 못한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;597&quot; data-start=&quot;457&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;465&quot; data-start=&quot;457&quot;&gt;연구 목적&lt;/td&gt;
&lt;td data-end=&quot;597&quot; data-start=&quot;465&quot; data-col-size=&quot;lg&quot;&gt;한국어 대화 환경에서 개인정보 비식별화를 정밀하게 수행하기 위해, 한국어 특성을 반영한 PII 분류 체계를 정의하고 이를 기반으로 한 대화형 데이터셋을 구축하며, 한국어 LMs와 LLMs의 PII 처리 한계를 체계적으로 분석한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;767&quot; data-start=&quot;598&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;606&quot; data-start=&quot;598&quot;&gt;핵심 기여&lt;/td&gt;
&lt;td data-end=&quot;767&quot; data-start=&quot;606&quot; data-col-size=&quot;lg&quot;&gt;(1) 한국어 언어&amp;middot;문화 특성을 반영한 33개 세부 PII 태그를 포함한 최초의 한국어 PII 분류 체계 제안, &lt;br /&gt;(2) 실제 대화 맥락을 반영한 대규모 한국어 대화형 PII 데이터셋(KDPII) 구축, &lt;br /&gt;(3) 한국어 LMs와 LLMs를 아우르는 종합적인 PII 식별 성능 평가 수행&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;906&quot; data-start=&quot;768&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;780&quot; data-start=&quot;768&quot;&gt;PII 분류 체계&lt;/td&gt;
&lt;td data-end=&quot;906&quot; data-start=&quot;780&quot; data-col-size=&quot;lg&quot;&gt;개인정보를 8개 1차 범주(개인&amp;middot;위치&amp;middot;식별번호&amp;middot;일반식별&amp;middot;직업&amp;middot;학력&amp;middot;온라인&amp;middot;군 관련 정보)로 나누고, 총 33개 세부 PII 태그로 세분화하여 한국어 특유의 표현(군부대, 직위, 동아리, 별명 등)을 명시적으로 포함한다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1016&quot; data-start=&quot;907&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;916&quot; data-start=&quot;907&quot;&gt;데이터 구성&lt;/td&gt;
&lt;td data-end=&quot;1016&quot; data-start=&quot;916&quot; data-col-size=&quot;lg&quot;&gt;4,581개 2인 대화 세트, 약 50,011문장으로 구성되며, 실제 메신저&amp;middot;상담 상황을 모사한 3&amp;ndash;6턴 대화 구조를 갖는다. 총 31,954개의 PII가 어노테이션되었다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1113&quot; data-start=&quot;1017&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1028&quot; data-start=&quot;1017&quot;&gt;어노테이션 품질&lt;/td&gt;
&lt;td data-end=&quot;1113&quot; data-start=&quot;1028&quot; data-col-size=&quot;lg&quot;&gt;언어학 및 NLP 전공자 10명이 참여한 이중 검증 절차를 거쳤으며, 최종 인터어노테이터 합의도(IAA)는 92.5%로 높은 신뢰성을 확보하였다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1233&quot; data-start=&quot;1114&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1125&quot; data-start=&quot;1114&quot;&gt;LM 평가 방법&lt;/td&gt;
&lt;td data-end=&quot;1233&quot; data-start=&quot;1125&quot; data-col-size=&quot;lg&quot;&gt;Transformer 기반 한국어 언어모델 14종에 대해 BIO 태깅 기반 시퀀스 라벨링 방식으로 fine-tuning을 수행하고, F1 score를 통해 PII 식별 성능을 평가하였다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1382&quot; data-start=&quot;1234&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1246&quot; data-start=&quot;1234&quot;&gt;LLM 평가 방법&lt;/td&gt;
&lt;td data-end=&quot;1382&quot; data-start=&quot;1246&quot; data-col-size=&quot;lg&quot;&gt;ChatGPT, Gemini, Mistral, Clova, KULLM, KOLLAMA2 등 6개 LLM을 대상으로 PII 중심 프롬프트를 설계하여 질의응답 실험을 수행하고, 문법성&amp;middot;사실성&amp;middot;논리성 기준으로 전문가 수작업 평가를 진행하였다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1518&quot; data-start=&quot;1383&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1399&quot; data-start=&quot;1383&quot;&gt;주요 실험 결과&lt;/td&gt;
&lt;td data-end=&quot;1518&quot; data-start=&quot;1399&quot; data-col-size=&quot;lg&quot;&gt;구조화된 PII(전화번호, 주민번호 등)는 높은 정확도로 식별되었으나, 이름&amp;middot;별명&amp;middot;직장&amp;middot;동아리&amp;middot;직위&amp;middot;군부대 등 비구조적&amp;middot;맥락 의존 PII는 전반적으로 낮은 성능을 보였다. 평균 F1은 약 0.83 수준이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1661&quot; data-start=&quot;1519&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1536&quot; data-start=&quot;1519&quot;&gt;주요 실험 결과&lt;/td&gt;
&lt;td data-end=&quot;1661&quot; data-start=&quot;1536&quot; data-col-size=&quot;lg&quot;&gt;대부분의 LLM은 한국어 문법성은 우수하나, PII 범주 판단의 사실성&amp;middot;논리성이 낮았으며, 특히 한국어 특화 PII에서 오류가 빈번했다. 한국어 대규모 학습을 거친 Clova가 상대적으로 가장 안정적인 성능을 보였다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1784&quot; data-start=&quot;1662&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1670&quot; data-start=&quot;1662&quot;&gt;핵심 분석&lt;/td&gt;
&lt;td data-end=&quot;1784&quot; data-start=&quot;1670&quot; data-col-size=&quot;lg&quot;&gt;개인정보 식별 성능의 주요 병목은 보편적(universal) PII가 아니라, 언어&amp;middot;문화 맥락에 강하게 의존하는 한국어 특화(language-specific) PII에 있음을 실증적으로 확인하였다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1887&quot; data-start=&quot;1785&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1790&quot; data-start=&quot;1785&quot;&gt;결론&lt;/td&gt;
&lt;td data-end=&quot;1887&quot; data-start=&quot;1790&quot; data-col-size=&quot;lg&quot;&gt;한국어 PII 비식별화는 단순 NER 문제가 아니며, 언어적 감각과 문화적 지식을 요구하는 문제로, 향후 한국어 특화 데이터 확장과 모델 학습 전략 개선이 필수적이다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2002&quot; data-start=&quot;1888&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1898&quot; data-start=&quot;1888&quot;&gt;활용 및 확장&lt;/td&gt;
&lt;td data-end=&quot;2002&quot; data-start=&quot;1898&quot; data-col-size=&quot;lg&quot;&gt;KDPII는 한국어 프라이버시 보호 LLM 연구, 의료&amp;middot;법률&amp;middot;상담 도메인 평가, 언어별 PII 비교 연구 및 프라이버시 강화 학습 기법 검증을 위한 표준 벤치마크로 활용 가능하다.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://www.sciencedirect.com/org/science/article/pii/S1546221825009907&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://www.sciencedirect.com/org/science/article/pii/S1546221825009907&lt;/a&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1137&quot; data-origin-height=&quot;631&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dF15bA/dJMcacaUSCE/bEr77Ln9OfkKfPK08uWAKK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dF15bA/dJMcacaUSCE/bEr77Ln9OfkKfPK08uWAKK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dF15bA/dJMcacaUSCE/bEr77Ln9OfkKfPK08uWAKK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdF15bA%2FdJMcacaUSCE%2FbEr77Ln9OfkKfPK08uWAKK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1137&quot; height=&quot;631&quot; data-origin-width=&quot;1137&quot; data-origin-height=&quot;631&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1085&quot; data-origin-height=&quot;378&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/tEV5E/dJMcagqPoaQ/7KKpKTYOYLHHWBrMzk6B30/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/tEV5E/dJMcagqPoaQ/7KKpKTYOYLHHWBrMzk6B30/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/tEV5E/dJMcagqPoaQ/7KKpKTYOYLHHWBrMzk6B30/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FtEV5E%2FdJMcagqPoaQ%2F7KKpKTYOYLHHWBrMzk6B30%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1085&quot; height=&quot;378&quot; data-origin-width=&quot;1085&quot; data-origin-height=&quot;378&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1574&quot; data-start=&quot;195&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;400&quot; data-start=&quot;311&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;319&quot; data-start=&quot;311&quot;&gt;연구 목적&lt;/td&gt;
&lt;td data-end=&quot;400&quot; data-start=&quot;319&quot; data-col-size=&quot;md&quot;&gt;한국어 텍스트 데이터에서 &lt;b&gt;언어적 특성만으로도 개인 재식별이 가능한지&lt;/b&gt;를 실증적으로 분석하고, 기존 비식별&amp;middot;가명처리 기준의 한계를 규명&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;499&quot; data-start=&quot;401&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;409&quot; data-start=&quot;401&quot;&gt;연구 배경&lt;/td&gt;
&lt;td data-end=&quot;499&quot; data-start=&quot;409&quot; data-col-size=&quot;md&quot;&gt;PII(이름&amp;middot;전화번호 등) 제거 후에도 &lt;b&gt;작성 습관&amp;middot;형태소&amp;middot;높임말 등 언어적 특징&lt;/b&gt;으로 개인 식별 가능성 존재, 국내 LLM 학습 확산으로 위험성 증가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;592&quot; data-start=&quot;500&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;510&quot; data-start=&quot;500&quot;&gt;핵심 문제의식&lt;/td&gt;
&lt;td data-end=&quot;592&quot; data-start=&quot;510&quot; data-col-size=&quot;md&quot;&gt;현재 비식별화는 &lt;b&gt;토큰 단위 PII 제거에 치중&lt;/b&gt;되어 있으며, **언어적 준식별자(quasi-identifier)**에 대한 고려가 부족&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;659&quot; data-start=&quot;593&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;600&quot; data-start=&quot;593&quot;&gt;데이터셋&lt;/td&gt;
&lt;td data-end=&quot;659&quot; data-start=&quot;600&quot; data-col-size=&quot;md&quot;&gt;X(구 Twitter) 한국어 텍스트, &lt;b&gt;50명 저자 &amp;times; 1,000문장 (총 50,000문장)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;710&quot; data-start=&quot;660&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;669&quot; data-start=&quot;660&quot;&gt;전처리 요소&lt;/td&gt;
&lt;td data-end=&quot;710&quot; data-start=&quot;669&quot; data-col-size=&quot;md&quot;&gt;형태소 분석, 불용어 제거, 텍스트 수치화(Tokenization)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;778&quot; data-start=&quot;711&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;724&quot; data-start=&quot;711&quot;&gt;형태소 분석기 비교&lt;/td&gt;
&lt;td data-end=&quot;778&quot; data-start=&quot;724&quot; data-col-size=&quot;md&quot;&gt;OKT, Kkma, Komoran, Hannanum &amp;rarr; &lt;b&gt;OKT가 가장 안정적&amp;middot;고성능&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;870&quot; data-start=&quot;779&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;791&quot; data-start=&quot;779&quot;&gt;불용어 처리 비교&lt;/td&gt;
&lt;td data-end=&quot;870&quot; data-start=&quot;791&quot; data-col-size=&quot;md&quot;&gt;일반 제거, 빈도 기반, TF-IDF, Word2Vec, GloVe, 미적용 &amp;rarr; &lt;b&gt;저자 수 증가 시 빈도 기반 제거가 가장 안정적&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;939&quot; data-start=&quot;871&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;883&quot; data-start=&quot;871&quot;&gt;텍스트 표현 방식&lt;/td&gt;
&lt;td data-end=&quot;939&quot; data-start=&quot;883&quot; data-col-size=&quot;md&quot;&gt;Tokenizer(단어 순서 유지) vs BoW &amp;rarr; &lt;b&gt;Tokenizer가 압도적으로 우수&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1006&quot; data-start=&quot;940&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;948&quot; data-start=&quot;940&quot;&gt;분류 모델&lt;/td&gt;
&lt;td data-end=&quot;1006&quot; data-start=&quot;948&quot; data-col-size=&quot;md&quot;&gt;LSTM, Random Forest, XGBoost, SVM, Logistic Regression&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1070&quot; data-start=&quot;1007&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1018&quot; data-start=&quot;1007&quot;&gt;최적 기본 모델&lt;/td&gt;
&lt;td data-end=&quot;1070&quot; data-start=&quot;1018&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;LSTM + OKT + Tokenizer + 불용어 제거 + 하이퍼파라미터 튜닝&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1126&quot; data-start=&quot;1071&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1081&quot; data-start=&quot;1071&quot;&gt;BERT 비교&lt;/td&gt;
&lt;td data-end=&quot;1126&quot; data-start=&quot;1081&quot; data-col-size=&quot;md&quot;&gt;KLUE-BERT와 정확도 유사, &lt;b&gt;학습 시간은 LSTM이 훨씬 짧음&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1169&quot; data-start=&quot;1127&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1140&quot; data-start=&quot;1127&quot;&gt;분석한 한국어 속성&lt;/td&gt;
&lt;td data-end=&quot;1169&quot; data-start=&quot;1140&quot; data-col-size=&quot;md&quot;&gt;형태소, 결속어, 높임말, 음절 수, 음소 수&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1219&quot; data-start=&quot;1170&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1182&quot; data-start=&quot;1170&quot;&gt;가장 중요한 속성&lt;/td&gt;
&lt;td data-end=&quot;1219&quot; data-start=&quot;1182&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;형태소 기반 어휘 빈도 (가장 높은 F1-score)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1263&quot; data-start=&quot;1220&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1234&quot; data-start=&quot;1220&quot;&gt;최대 저자 식별 성능&lt;/td&gt;
&lt;td data-end=&quot;1263&quot; data-start=&quot;1234&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;정확도 90.51% (2명 저자 기준)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1323&quot; data-start=&quot;1264&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1276&quot; data-start=&quot;1264&quot;&gt;재식별 위험 분석&lt;/td&gt;
&lt;td data-end=&quot;1323&quot; data-start=&quot;1276&quot; data-col-size=&quot;md&quot;&gt;형태소 기반 고빈도 단어 제거 전 &lt;b&gt;27.31% &amp;rarr; 제거 후 19.53%&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1378&quot; data-start=&quot;1324&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1335&quot; data-start=&quot;1324&quot;&gt;핵심 실험 결론&lt;/td&gt;
&lt;td data-end=&quot;1378&quot; data-start=&quot;1335&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;한국어에서는 형태소&amp;middot;어휘 사용 습관이 강력한 재식별 단서&lt;/b&gt;로 작용&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1429&quot; data-start=&quot;1379&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1387&quot; data-start=&quot;1379&quot;&gt;주요 기여&lt;/td&gt;
&lt;td data-end=&quot;1429&quot; data-start=&quot;1387&quot; data-col-size=&quot;md&quot;&gt;한국어 텍스트에서 &lt;b&gt;언어적 특성을 재식별 위험 요소로 정량 입증&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1483&quot; data-start=&quot;1430&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1442&quot; data-start=&quot;1430&quot;&gt;정책&amp;middot;실무 시사점&lt;/td&gt;
&lt;td data-end=&quot;1483&quot; data-start=&quot;1442&quot; data-col-size=&quot;md&quot;&gt;비식별 처리 시 &lt;b&gt;언어 습관&amp;middot;형태소 분포까지 고려한 기준 필요&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1528&quot; data-start=&quot;1484&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1489&quot; data-start=&quot;1484&quot;&gt;한계&lt;/td&gt;
&lt;td data-end=&quot;1528&quot; data-start=&quot;1489&quot; data-col-size=&quot;md&quot;&gt;저자 수 증가 시 정확도 감소, 대규모 적용 시 계산 비용 증가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1574&quot; data-start=&quot;1529&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1537&quot; data-start=&quot;1529&quot;&gt;향후 연구&lt;/td&gt;
&lt;td data-end=&quot;1574&quot; data-start=&quot;1537&quot; data-col-size=&quot;md&quot;&gt;효율적인 재식별 저감 기법, 대규모&amp;middot;실시간 텍스트 적용 방안&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2506.15266&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2506.15266&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1770048874956&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Thunder-DeID: Accurate and Efficient De-identification Framework for Korean Court Judgments&quot; data-og-description=&quot;To ensure a balance between open access to justice and personal data protection, the South Korean judiciary mandates the de-identification of court judgments before they can be publicly disclosed. However, the current de-identification process is inadequat&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2506.15266&quot; data-og-url=&quot;https://arxiv.org/abs/2506.15266v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/mi3zW/dJMb8PGrjJ2/8uAtg4KrUbFYlafvkTSgmK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cb34Cb/dJMb8WeuKet/X9W0vw0eKDyHjVmKtPgA51/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2506.15266&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2506.15266&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/mi3zW/dJMb8PGrjJ2/8uAtg4KrUbFYlafvkTSgmK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cb34Cb/dJMb8WeuKet/X9W0vw0eKDyHjVmKtPgA51/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Thunder-DeID: Accurate and Efficient De-identification Framework for Korean Court Judgments&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;To ensure a balance between open access to justice and personal data protection, the South Korean judiciary mandates the de-identification of court judgments before they can be publicly disclosed. However, the current de-identification process is inadequat&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2025 emnlp findings에 붙은 논문입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;한국 법원 판결문은 공개 원칙과 개인 정보 보호를 동시에 만족해야 하므로 공개 전 비식별화가 원칙이다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러나 기존 시스템은 수작업에 의존하고, 자동화는 8 ~ 15% 수준에 불과함. LLM 기반 접근은 문장 구조와 사실을 변형하여 법적 정밀성 훼손 및 보안 정책 위반 가능성이 존재함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 법적 요구사항을 충족하면서도 대규모 판결문에 적용 가능한 고정밀 자동 비식별화 프레임워크가 부재함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰 단위 NER 기반 DNN 파이프라인을 통해 정확성, 일관성, 확장성을 동시에 만족하는 판결문 비식별화 프레임워크를 제안함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순 NER 문제가 아니라 법적 맥락을 반영한 PII 정의 + 후처리까지 포함한 시스템 문제 =&amp;gt; LLM 기반 재작성이 아닌 토큰 단위 분류가 본질적으로 더 안전하고 적합하며, 한국어의 형태론적 특성을 반영한 전용 토크나이저 없이는 고정밀 비식별화가 불가능함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1399&quot; data-origin-height=&quot;485&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bRZoud/dJMcac9K5aF/kzykfXxxIXB4Cv2bEKaOGk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bRZoud/dJMcac9K5aF/kzykfXxxIXB4Cv2bEKaOGk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bRZoud/dJMcac9K5aF/kzykfXxxIXB4Cv2bEKaOGk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbRZoud%2FdJMcac9K5aF%2FkzykfXxxIXB4Cv2bEKaOGk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1399&quot; height=&quot;485&quot; data-origin-width=&quot;1399&quot; data-origin-height=&quot;485&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존에 비식별화 된 데이터에 PII 범주로 재라벨링 진행하여 데이터 셋 구축&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;한국어 특화 토크나이저인 Mecab-ko(형태소 분석) + BPE를 통해 조사 어미 분리로 비식별화 이후에도 문법과 가독성을 유지&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;동일 판결문에 대해 에폭마다 다른 엔티티를 치환하여 표면형 다양성을 증가하고, 저빈도 라벨은 LLM 보조 생성 + 수작업 검증으로 보완 함&amp;nbsp;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;576&quot; data-origin-height=&quot;729&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/TRSWY/dJMcaiWsjNs/wJK8MSov9e6mMTCsfLdR40/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/TRSWY/dJMcaiWsjNs/wJK8MSov9e6mMTCsfLdR40/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/TRSWY/dJMcaiWsjNs/wJK8MSov9e6mMTCsfLdR40/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FTRSWY%2FdJMcaiWsjNs%2FwJK8MSov9e6mMTCsfLdR40%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;576&quot; height=&quot;729&quot; data-origin-width=&quot;576&quot; data-origin-height=&quot;729&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 법 규정을 기술적으로 재해석하여 장소, 조직, 숫자, 사건 맥락 정보까지 포함하여 재식별 위험 중심 설계를 진행함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1059&quot; data-origin-height=&quot;536&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/csrUOo/dJMcaioEUOI/s5PqgfhKZr7bb5uJRjrmsK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/csrUOo/dJMcaioEUOI/s5PqgfhKZr7bb5uJRjrmsK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/csrUOo/dJMcaioEUOI/s5PqgfhKZr7bb5uJRjrmsK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcsrUOo%2FdJMcaioEUOI%2Fs5PqgfhKZr7bb5uJRjrmsK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1059&quot; height=&quot;536&quot; data-origin-width=&quot;1059&quot; data-origin-height=&quot;536&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://github.com/mcrl/SNU_Thunder-DeID&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://github.com/mcrl/SNU_Thunder-DeID&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1770050049145&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - mcrl/SNU_Thunder-DeID&quot; data-og-description=&quot;Contribute to mcrl/SNU_Thunder-DeID development by creating an account on GitHub.&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/mcrl/SNU_Thunder-DeID&quot; data-og-url=&quot;https://github.com/mcrl/SNU_Thunder-DeID&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://github.com/mcrl/SNU_Thunder-DeID&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/mcrl/SNU_Thunder-DeID&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - mcrl/SNU_Thunder-DeID&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Contribute to mcrl/SNU_Thunder-DeID development by creating an account on GitHub.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;데이터도 여기에&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 577px;&quot; border=&quot;1&quot; data-end=&quot;1627&quot; data-start=&quot;184&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;303&quot; data-start=&quot;206&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;214&quot; data-start=&quot;206&quot;&gt;연구 배경&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;303&quot; data-start=&quot;214&quot; data-col-size=&quot;md&quot;&gt;한국 법원 판결문은 공개 전 개인정보 비식별화가 법적으로 의무이나, &lt;br /&gt;기존 수작업 중심 절차는 확장성이 없고 자동화 도구의 정확도는 8&amp;ndash;15%로 매우 낮음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;407&quot; data-start=&quot;304&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;313&quot; data-start=&quot;304&quot;&gt;문제의 핵심&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;407&quot; data-start=&quot;313&quot; data-col-size=&quot;md&quot;&gt;(1) 대규모 판결문 처리 불가, &lt;br /&gt;(2) 법률상 개인정보(PII) 정의가 기술적으로 모호, &lt;br /&gt;(3) LLM 기반 비식별화는 문장&amp;middot;사실 왜곡 및 보안 정책 위반 위험&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;466&quot; data-start=&quot;408&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;416&quot; data-start=&quot;408&quot;&gt;연구 목표&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;466&quot; data-start=&quot;416&quot; data-col-size=&quot;md&quot;&gt;한국 법&amp;middot;실무에 정합적인 &lt;b&gt;고정밀&amp;middot;대규모 자동 판결문 비식별화 프레임워크&lt;/b&gt; 구축&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;547&quot; data-start=&quot;467&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;477&quot; data-start=&quot;467&quot;&gt;핵심 아이디어&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;547&quot; data-start=&quot;477&quot; data-col-size=&quot;md&quot;&gt;프롬프트 기반 LLM 재작성 대신 &lt;b&gt;토큰 단위 NER 기반 DNN 비식별화&lt;/b&gt;를 사용하여 문맥&amp;middot;사실 왜곡을 원천 차단&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;633&quot; data-start=&quot;548&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;555&quot; data-start=&quot;548&quot;&gt;데이터셋&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;633&quot; data-start=&quot;555&quot; data-col-size=&quot;md&quot;&gt;민사&amp;middot;형사&amp;middot;행정 판결문 &lt;b&gt;6,700건&lt;/b&gt;, 총 &lt;b&gt;48,306개 엔티티&lt;/b&gt; 수작업 주석 (한국 최초 판결문 비식별화 전용 데이터셋)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;719&quot; data-start=&quot;634&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;646&quot; data-start=&quot;634&quot;&gt;데이터 제약 대응&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;719&quot; data-start=&quot;646&quot; data-col-size=&quot;md&quot;&gt;원문 판결문 접근 불가 &lt;br /&gt;&amp;rarr; 이미 비식별화된 판결문에서 placeholder를 재주석하고 실제 엔티티 치환 리스트를 별도 구축&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;815&quot; data-start=&quot;720&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;732&quot; data-start=&quot;720&quot;&gt;PII 분류 체계&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;815&quot; data-start=&quot;732&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;3단계 계층 구조&lt;/b&gt;: Direct / Quasi Identifier &amp;rarr; 16개 상위 범주 &amp;rarr; 80개 세부 범주, 총 &lt;b&gt;729개 라벨&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;890&quot; data-start=&quot;816&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;828&quot; data-start=&quot;816&quot;&gt;PII 범위 특징&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;890&quot; data-start=&quot;828&quot; data-col-size=&quot;md&quot;&gt;이름&amp;middot;번호뿐 아니라 &lt;b&gt;사건 관련 장소, 조직, 숫자, 맥락 정보&lt;/b&gt;까지 포함 (재식별 위험 중심 설계)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;958&quot; data-start=&quot;891&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;899&quot; data-start=&quot;891&quot;&gt;토크나이저&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;958&quot; data-start=&quot;899&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;Mecab-ko(형태소 분석) + BPE&lt;/b&gt; 결합 &lt;br /&gt;&amp;rarr; 조사/어미 분리로 한국어 문법&amp;middot;가독성 유지&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1009&quot; data-start=&quot;959&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;971&quot; data-start=&quot;959&quot;&gt;학습 데이터 생성&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;1009&quot; data-start=&quot;971&quot; data-col-size=&quot;md&quot;&gt;라벨된 판결문에 대해 실제 엔티티를 치환하여 학습 데이터 생성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1093&quot; data-start=&quot;1010&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1019&quot; data-start=&quot;1010&quot;&gt;데이터 증강&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1093&quot; data-start=&quot;1019&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;Per-Epoch Entity Replacement&lt;/b&gt;: &lt;br /&gt;에폭마다 다른 엔티티 치환 &amp;rarr; 데이터 다양성 및 일반화 성능 향상&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1150&quot; data-start=&quot;1094&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1099&quot; data-start=&quot;1094&quot;&gt;모델&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1150&quot; data-start=&quot;1099&quot; data-col-size=&quot;md&quot;&gt;DeBERTa-v3 기반 Thunder-DeID (370M / 800M / 1.5B)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1200&quot; data-start=&quot;1151&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1159&quot; data-start=&quot;1151&quot;&gt;비교 모델&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1200&quot; data-start=&quot;1159&quot; data-col-size=&quot;md&quot;&gt;Polyglot-Ko (1.3B), EXAONE-3.5 (2.4B)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1268&quot; data-start=&quot;1201&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1209&quot; data-start=&quot;1201&quot;&gt;평가 지표&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1268&quot; data-start=&quot;1209&quot; data-col-size=&quot;md&quot;&gt;Binary Token-level F1, Token-level Micro F1 (729-class)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1337&quot; data-start=&quot;1269&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1277&quot; data-start=&quot;1269&quot;&gt;핵심 성능&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1337&quot; data-start=&quot;1277&quot; data-col-size=&quot;md&quot;&gt;최대 &lt;b&gt;Binary F1 &amp;asymp; 0.98&lt;/b&gt;, &lt;b&gt;Token-level Micro F1 &amp;asymp; 0.91&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1404&quot; data-start=&quot;1338&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1346&quot; data-start=&quot;1338&quot;&gt;주요 결과&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1404&quot; data-start=&quot;1346&quot; data-col-size=&quot;md&quot;&gt;모든 설정에서 기존 한국어 법률 모델 대비 성능 우수, 한국 판결문 비식별화 &lt;b&gt;SOTA 달성&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1458&quot; data-start=&quot;1405&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1414&quot; data-start=&quot;1405&quot;&gt;정성적 장점&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1458&quot; data-start=&quot;1414&quot; data-col-size=&quot;md&quot;&gt;문장 구조&amp;middot;법적 사실 왜곡 없음, 법원 실무 규칙과 정합적인 후처리 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1504&quot; data-start=&quot;1459&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1464&quot; data-start=&quot;1459&quot;&gt;한계&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1504&quot; data-start=&quot;1464&quot; data-col-size=&quot;md&quot;&gt;원문 판결문 기반 실환경 평가 불가, 일부 저빈도 라벨 성능 한계&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1573&quot; data-start=&quot;1505&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1513&quot; data-start=&quot;1505&quot;&gt;연구 의의&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1573&quot; data-start=&quot;1513&quot; data-col-size=&quot;md&quot;&gt;모델이 아닌 &lt;b&gt;데이터&amp;middot;PII 정의&amp;middot;토크나이저&amp;middot;증강&amp;middot;시스템 전체를 포괄한 비식별화 프레임워크 제시&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1627&quot; data-start=&quot;1574&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1583&quot; data-start=&quot;1574&quot;&gt;확장 시사점&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1627&quot; data-start=&quot;1583&quot; data-col-size=&quot;md&quot;&gt;한국 외 타 국가 판결문 비식별화, 의료&amp;middot;공공 문서 비식별화로 확장 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1204</guid>
      <comments>https://yoonschallenge.tistory.com/1204#entry1204comment</comments>
      <pubDate>Tue, 3 Feb 2026 01:32:06 +0900</pubDate>
    </item>
    <item>
      <title>Privacy AI 관련 조사 12</title>
      <link>https://yoonschallenge.tistory.com/1203</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2505.12540&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2505.12540&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1770012205650&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Harnessing the Universal Geometry of Embeddings&quot; data-og-description=&quot;We introduce the first method for translating text embeddings from one vector space to another without any paired data, encoders, or predefined sets of matches. Our unsupervised approach translates any embedding to and from a universal latent representatio&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2505.12540&quot; data-og-url=&quot;https://arxiv.org/abs/2505.12540v4&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/TYYdG/dJMb9bvXpaw/MxhLUBxpIC4FHHyh7p3K9k/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bmgkfb/dJMb9g46efj/zi6FNbwunvEuGPJKZ8nuY0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2505.12540&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2505.12540&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/TYYdG/dJMb9bvXpaw/MxhLUBxpIC4FHHyh7p3K9k/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bmgkfb/dJMb9g46efj/zi6FNbwunvEuGPJKZ8nuY0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Harnessing the Universal Geometry of Embeddings&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We introduce the first method for translating text embeddings from one vector space to another without any paired data, encoders, or predefined sets of matches. Our unsupervised approach translates any embedding to and from a universal latent representatio&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;텍스트 임베딩은 검색, 분류, 클러스터링 등 다양한 곳에 쓰이지만 다른 임베딩 모델은 같은 텍스트라도 완전히 다른 벡터 공간에 매핑하여 모델간 임베딩 비교가 불가하고, 특정 임베딩만 유출되었을 때 그 의미를 해석하기 어려움&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;Strong Platonic Representation Hypothesis - 텍스트 임베딩 모델들은 서로 다른 구조와 데이터로 학습되었더라도 공통된 의미 공간(latent space)를 공유하여 짝지어진 데이터 없이도 학습 가능하다!&amp;nbsp;&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1343&quot; data-origin-height=&quot;514&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/GUmiW/dJMcai3cuZo/kHk86FKf3qk9vnfN8k6Gak/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/GUmiW/dJMcai3cuZo/kHk86FKf3qk9vnfN8k6Gak/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/GUmiW/dJMcai3cuZo/kHk86FKf3qk9vnfN8k6Gak/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FGUmiW%2FdJMcai3cuZo%2FkHk86FKf3qk9vnfN8k6Gak%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1343&quot; height=&quot;514&quot; data-origin-width=&quot;1343&quot; data-origin-height=&quot;514&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존에는 다른 모델이면 왼쪽 그림처럼 유사도가 높지 않아야 하는데 이 논문에서는 그 문제를 해결해서 의미별로 잘 뭉쳐있는 것을 볼 수 있음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1363&quot; data-origin-height=&quot;623&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dfrCC2/dJMcadOkY52/Ox4lkyCm7O6dWFm8uw8C6k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dfrCC2/dJMcadOkY52/Ox4lkyCm7O6dWFm8uw8C6k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dfrCC2/dJMcadOkY52/Ox4lkyCm7O6dWFm8uw8C6k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdfrCC2%2FdJMcadOkY52%2FOx4lkyCm7O6dWFm8uw8C6k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1363&quot; height=&quot;623&quot; data-origin-width=&quot;1363&quot; data-origin-height=&quot;623&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;원본 텍스트는 없고, 임베딩 만든 모델 M1에 접근할 수 없으며 임베딩 벡터가 유출되어 그 것만 존재할 때 M1에서 생성된 임베딩이 M2 임베딩 공간으로 번역하여 이런 임베딩이 기하학적 구조를 유지하고, 의미 정보를 보존하여 작성&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1323&quot; data-origin-height=&quot;573&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bWp6zh/dJMcadOkY6d/4fR07YeO3zcvWp25Aih9Q1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bWp6zh/dJMcadOkY6d/4fR07YeO3zcvWp25Aih9Q1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bWp6zh/dJMcadOkY6d/4fR07YeO3zcvWp25Aih9Q1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbWp6zh%2FdJMcadOkY6d%2F4fR07YeO3zcvWp25Aih9Q1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1323&quot; height=&quot;573&quot; data-origin-width=&quot;1323&quot; data-origin-height=&quot;573&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;어떤 것이 활용가능한지 볼 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;번역된 임베딩으로부터 트위터 주제, 의료 질병 코드를 복구할 수 있고, 텍스트 근사도 가능함을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1740&quot; data-start=&quot;201&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;403&quot; data-start=&quot;287&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;294&quot; data-start=&quot;287&quot;&gt;문제의식&lt;/td&gt;
&lt;td data-end=&quot;403&quot; data-start=&quot;294&quot; data-col-size=&quot;lg&quot;&gt;서로 다른 텍스트 임베딩 모델은 동일 텍스트라도 완전히 다른 벡터 공간을 형성하여 비교&amp;middot;변환이 불가능하다고 여겨져 왔음. &lt;br /&gt;임베딩만 유출될 경우 의미 정보가 안전한지에 대한 근본적 의문 제기&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;551&quot; data-start=&quot;404&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;412&quot; data-start=&quot;404&quot;&gt;핵심 가설&lt;/td&gt;
&lt;td data-end=&quot;551&quot; data-start=&quot;412&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Strong Platonic Representation Hypothesis&lt;/b&gt;: &lt;br /&gt;서로 다른 구조&amp;middot;데이터로 학습된 텍스트 임베딩 모델들은 공통의 보편적(latent) 의미 기하 구조를 공유하며, 이는 &lt;b&gt;짝지어진 데이터 없이도 학습 가능&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;652&quot; data-start=&quot;552&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;560&quot; data-start=&quot;552&quot;&gt;연구 목표&lt;/td&gt;
&lt;td data-end=&quot;652&quot; data-start=&quot;560&quot; data-col-size=&quot;lg&quot;&gt;(1) 비지도 환경에서 임베딩 공간 간 번역 가능성 검증 &lt;br /&gt;(2) 번역된 임베딩이 의미 정보를 얼마나 보존하는지 평가&lt;br /&gt;(3) 임베딩 기반 정보 유출 위험 정량화&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;729&quot; data-start=&quot;653&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;661&quot; data-start=&quot;653&quot;&gt;제안 방법&lt;/td&gt;
&lt;td data-end=&quot;729&quot; data-start=&quot;661&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;vec2vec&lt;/b&gt;: 입력 어댑터&amp;ndash;공유 latent 변환기&amp;ndash;출력 어댑터 구조를 갖는 비지도 임베딩 번역 프레임워크&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;864&quot; data-start=&quot;730&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;738&quot; data-start=&quot;730&quot;&gt;학습 방식&lt;/td&gt;
&lt;td data-end=&quot;864&quot; data-start=&quot;738&quot; data-col-size=&quot;lg&quot;&gt;완전 비지도 학습 (paired text/embedding 없음), &lt;br /&gt;adversarial loss + cycle consistency + reconstruction + vector space preservation 결합&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;940&quot; data-start=&quot;865&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;873&quot; data-start=&quot;865&quot;&gt;입력 가정&lt;/td&gt;
&lt;td data-end=&quot;940&quot; data-start=&quot;873&quot; data-col-size=&quot;lg&quot;&gt;원본 텍스트 및 원래 임베딩 모델(M1) 접근 불가, &lt;br /&gt;임베딩 벡터만 존재 / 다른 임베딩 모델(M2)은 사용 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1017&quot; data-start=&quot;941&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;949&quot; data-start=&quot;941&quot;&gt;실험 모델&lt;/td&gt;
&lt;td data-end=&quot;1017&quot; data-start=&quot;949&quot; data-col-size=&quot;lg&quot;&gt;GTR(T5), GTE&amp;middot;E5&amp;middot;Stella(BERT), Granite(RoBERTa), Qwen, CLIP(멀티모달)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1109&quot; data-start=&quot;1018&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1025&quot; data-start=&quot;1018&quot;&gt;데이터셋&lt;/td&gt;
&lt;td data-end=&quot;1109&quot; data-start=&quot;1025&quot; data-col-size=&quot;lg&quot;&gt;학습: Natural Questions / &lt;br /&gt;평가: NQ, TweetTopic, MIMIC-III(의료), Enron Emails, MS COCO&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1215&quot; data-start=&quot;1110&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1121&quot; data-start=&quot;1110&quot;&gt;핵심 성능 결과&lt;/td&gt;
&lt;td data-end=&quot;1215&quot; data-start=&quot;1121&quot; data-col-size=&quot;lg&quot;&gt;모델&amp;middot;백본이 다른 임베딩 간 번역에서 &lt;b&gt;cosine similarity 최대 ~0.9&lt;/b&gt;, Top-1 매칭 정확도 최대 100%, OOD 데이터에서도 성능 유지&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1294&quot; data-start=&quot;1216&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1227&quot; data-start=&quot;1216&quot;&gt;의미 보존 평가&lt;/td&gt;
&lt;td data-end=&quot;1294&quot; data-start=&quot;1227&quot; data-col-size=&quot;lg&quot;&gt;번역된 임베딩으로 트윗 주제&amp;middot;의료 질병 코드 등 &lt;b&gt;zero-shot attribute inference 가능&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1374&quot; data-start=&quot;1295&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1306&quot; data-start=&quot;1295&quot;&gt;정보 유출 결과&lt;/td&gt;
&lt;td data-end=&quot;1374&quot; data-start=&quot;1306&quot; data-col-size=&quot;lg&quot;&gt;번역 + zero-shot inversion을 통해 이메일&amp;middot;트윗의 &lt;b&gt;60~80%에서 의미 있는 정보 유출&lt;/b&gt; 확인&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1447&quot; data-start=&quot;1375&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1383&quot; data-start=&quot;1375&quot;&gt;비교 기준&lt;/td&gt;
&lt;td data-end=&quot;1447&quot; data-start=&quot;1383&quot; data-col-size=&quot;lg&quot;&gt;Na&amp;iuml;ve(항등) 변환, Oracle-aided Optimal Transport 대비 전반적으로 우수한 성능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1549&quot; data-start=&quot;1448&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1456&quot; data-start=&quot;1448&quot;&gt;주요 기여&lt;/td&gt;
&lt;td data-end=&quot;1549&quot; data-start=&quot;1456&quot; data-col-size=&quot;lg&quot;&gt;(1) 최초의 &lt;b&gt;비지도 임베딩 공간 번역&lt;/b&gt; 방법 제시 &lt;br /&gt;(2) 텍스트 임베딩의 보편적 기하 구조 실증 (3) 임베딩 프라이버시 위험에 대한 강력한 실험적 증거&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1601&quot; data-start=&quot;1550&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1555&quot; data-start=&quot;1550&quot;&gt;한계&lt;/td&gt;
&lt;td data-end=&quot;1601&quot; data-start=&quot;1555&quot; data-col-size=&quot;lg&quot;&gt;GAN 기반 학습의 불안정성, 대규모 학습 비용, 완전한 텍스트 복원은 아님&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1670&quot; data-start=&quot;1602&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1611&quot; data-start=&quot;1602&quot;&gt;핵심 메시지&lt;/td&gt;
&lt;td data-end=&quot;1670&quot; data-start=&quot;1611&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;임베딩은 안전한 표현이 아니며, 모델 간 번역을 통해 원문 의미가 상당 부분 복원될 수 있다&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1740&quot; data-start=&quot;1671&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1680&quot; data-start=&quot;1671&quot;&gt;연구적 함의&lt;/td&gt;
&lt;td data-end=&quot;1740&quot; data-start=&quot;1680&quot; data-col-size=&quot;lg&quot;&gt;임베딩 기반 프라이버시 보호 기법, RAG/벡터 DB 보안, 멀티모달 임베딩 정렬 연구에 직접적 영향&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2507.18518&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2507.18518&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1770014169443&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Transform Before You Query: A Privacy-Preserving Approach for Vector Retrieval with Embedding Space Alignment&quot; data-og-description=&quot;Vector Database (VDB) can efficiently index and search high-dimensional vector embeddings from unstructured data, crucially enabling fast semantic similarity search essential for modern AI applications like generative AI and recommendation systems. Since c&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2507.18518&quot; data-og-url=&quot;https://arxiv.org/abs/2507.18518v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/dhq83W/dJMb9kl7VRU/UvVBPzTVIxxwknA9iPv2e1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cB8lMB/dJMb9jOh5Lf/lOuYbQtbtaqEF07aRNy0AK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2507.18518&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2507.18518&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/dhq83W/dJMb9kl7VRU/UvVBPzTVIxxwknA9iPv2e1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cB8lMB/dJMb9jOh5Lf/lOuYbQtbtaqEF07aRNy0AK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Transform Before You Query: A Privacy-Preserving Approach for Vector Retrieval with Embedding Space Alignment&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Vector Database (VDB) can efficiently index and search high-dimensional vector embeddings from unstructured data, crucially enabling fast semantic similarity search essential for modern AI applications like generative AI and recommendation systems. Since c&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;현행 벡터 DB 기반 RAG, 추천 시스템에서 질의 텍스트 자체가 서버에 노출되는 구조적 프라이버시 취약성을 지적한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;임베딩 모델이 블랙박스 API 형태로 사용자가 원문 질의 텍스트를 그대로 전송해야 하므로 의료, 금융, 법률과 같은 민감 도메인에서 치명적인 정보 유출 위험을 내포함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1577&quot; data-origin-height=&quot;723&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/uQYKq/dJMcacoqDji/EX0GTcKdkkDYNUZyOkJAi0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/uQYKq/dJMcacoqDji/EX0GTcKdkkDYNUZyOkJAi0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/uQYKq/dJMcacoqDji/EX0GTcKdkkDYNUZyOkJAi0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FuQYKq%2FdJMcacoqDji%2FEX0GTcKdkkDYNUZyOkJAi0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1577&quot; height=&quot;723&quot; data-origin-width=&quot;1577&quot; data-origin-height=&quot;723&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;암호화는 연산 비용이 너무 크고, 익명화는 핵심 의미가 제거되어 검색 성능이 붕괴되고, DP는 무작위 노이즈로 인해 의미 구조가 깨져 검색 정확도가 급락&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 임베딩 공간 간에는 구조적 alignment가 존재하여 서로 다른 임베딩 모델이라도 의미 공간의 상대적 기하 구조는 유사하며 이를 활용하면 서버 모델을 직접 쓰지 않아도 서버 임베딩 공간에서 유사한 위치를 갖는 벡터를 생성할 수 있다!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1038&quot; data-origin-height=&quot;686&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/FH59p/dJMcabQAkY1/pW1ik5bG3CEc6DAYtfuhGk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/FH59p/dJMcabQAkY1/pW1ik5bG3CEc6DAYtfuhGk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/FH59p/dJMcabQAkY1/pW1ik5bG3CEc6DAYtfuhGk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FFH59p%2FdJMcabQAkY1%2FpW1ik5bG3CEc6DAYtfuhGk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1038&quot; height=&quot;686&quot; data-origin-width=&quot;1038&quot; data-origin-height=&quot;686&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;STEER - 질의 텍스트를 보내지 말고 서버 임베딩을 근사해서 보내자!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;민감하지 않은 공용 텍스트 집합을 준비하여 서버 임베딩 모델 값과 사용자의 오픈소스 임베딩 모델 값을 통해 매핑 함수를 학습하고 선형 정렬, 비선형 정렬 하여 검색을 진행할 수 있음&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1247&quot; data-origin-height=&quot;567&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c4hzow/dJMcahDfx0a/OcHFq5wG9U6yn3vrkdscJ0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c4hzow/dJMcahDfx0a/OcHFq5wG9U6yn3vrkdscJ0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c4hzow/dJMcahDfx0a/OcHFq5wG9U6yn3vrkdscJ0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc4hzow%2FdJMcahDfx0a%2FOcHFq5wG9U6yn3vrkdscJ0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1247&quot; height=&quot;567&quot; data-origin-width=&quot;1247&quot; data-origin-height=&quot;567&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;DP처럼 무작위 노이즈를 넣지 않고, 의미 구조를 보존하는 구조적 변환으로 편차를 생성하여 EIA를 실패하게 만든다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;p data-pm-slice=&quot;0 0 []&quot; data-ke-size=&quot;size16&quot;&gt;근데 이 방법은 결국 '&lt;b&gt;Universal zero-shot embedding inversion&lt;/b&gt;' 논문과 같은 방법으로 뚤리는거 아니야???&lt;/p&gt;
&lt;div data-ke-type=&quot;moreLess&quot; data-text-more=&quot;더보기&quot; data-text-less=&quot;닫기&quot;&gt;&lt;a class=&quot;btn-toggle-moreless&quot;&gt;더보기&lt;/a&gt;
&lt;div class=&quot;moreless-content&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;짚은 포인트가 &lt;b&gt;정확하다&lt;/b&gt;.&lt;br /&gt;결론부터 말하면 &lt;b&gt;&amp;ldquo;이론적으로는 뚫릴 가능성이 있다&amp;rdquo;&lt;/b&gt;가 맞고, 다만 &lt;b&gt;STEER가 그대로 무력화되는 것은 아니다&lt;/b&gt;. 아래에서 &lt;b&gt;왜 같은 공격 프레임으로 접근은 가능하지만, 동일한 수준의 성공을 기대하기는 어려운지&lt;/b&gt;를 구조적으로 정리하겠다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;1. Universal Zero-Shot Embedding Inversion이 보여준 핵심&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Universal zero-shot embedding inversion(이하 &lt;b&gt;U-ZEI&lt;/b&gt;)의 본질은 다음이다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;가정&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;공격자는 &lt;b&gt;임의의 embedding space&lt;/b&gt;에 접근 가능&lt;/li&gt;
&lt;li&gt;해당 space가 어떤 모델에서 나왔는지 몰라도 됨&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;핵심 주장&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;자연언어 임베딩 공간에는 &lt;b&gt;모델 불변적인(universal) 기하 구조&lt;/b&gt;가 존재&lt;/li&gt;
&lt;li&gt;충분히 강한 generative prior(LLM) + geometry alignment로&lt;br /&gt;&amp;rarr; &lt;b&gt;zero-shot text reconstruction 가능&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;중요한 점&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&amp;ldquo;이 embedding이 어떤 모델에서 나왔는가&amp;rdquo;는 더 이상 핵심이 아님&lt;/li&gt;
&lt;li&gt;&lt;b&gt;embedding space 자체가 언어 정보를 이미 과도하게 포함&lt;/b&gt;하고 있다는 공격&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 논문은 사실상&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;ldquo;embedding &amp;asymp; compressed text&amp;rdquo;&lt;br /&gt;라는 불편한 진실을 정면으로 보여준 작업이다.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;2. 그럼 STEER는 같은 방식으로 뚫리는가?&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;✔️ 공격 &lt;b&gt;시도 자체는 가능&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;STEER가 서버에 보내는 것은:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;원문 임베딩 ❌&lt;/li&gt;
&lt;li&gt;&lt;b&gt;정렬된 근사 임베딩 (approximate embedding)&lt;/b&gt; ⭕&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;U-ZEI의 관점에서는:&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;ldquo;모델이 뭐든 상관없고, embedding이면 공격 대상&amp;rdquo;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이므로 &lt;b&gt;공격 파이프라인을 적용하는 것 자체는 가능&lt;/b&gt;하다.&lt;br /&gt;이 점에서 네 질문은 100% 타당하다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;3. 하지만 &amp;ldquo;같이 뚫린다&amp;rdquo; &amp;ne; &amp;ldquo;동일한 위협 수준&amp;rdquo;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;STEER가 &lt;b&gt;완전히 같은 조건&lt;/b&gt;에 놓이지 않는 이유는 구조적으로 명확하다.&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;(1) 공격 대상 embedding의 정체가 다름&lt;/h3&gt;
구분일반 embeddingSTEER embedding
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;생성 방식&lt;/td&gt;
&lt;td&gt;단일 모델 f(x)&lt;/td&gt;
&lt;td&gt;&amp;phi;(g(x))&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;공간 소속&lt;/td&gt;
&lt;td&gt;특정 모델 space&lt;/td&gt;
&lt;td&gt;&lt;b&gt;어디에도 속하지 않는 합성 공간&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;공격자 prior&lt;/td&gt;
&lt;td&gt;풍부&lt;/td&gt;
&lt;td&gt;&lt;b&gt;불완전&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;U-ZEI가 강력한 이유는&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;ldquo;이 embedding은 &lt;b&gt;자연언어 embedding manifold 위에 있다&lt;/b&gt;&amp;rdquo;&lt;br /&gt;라는 가정을 깔고 가기 때문이다.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 STEER의 embedding은:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;로컬 모델 g&lt;/li&gt;
&lt;li&gt;서버 모델 f&lt;/li&gt;
&lt;li&gt;정렬 함수 &amp;phi;&lt;br /&gt;의 &lt;b&gt;합성 결과&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉, &lt;b&gt;어느 단일 embedding manifold에도 정확히 속하지 않는다.&lt;/b&gt;&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;(2) STEER의 변환은 &amp;ldquo;alignment&amp;rdquo;이지 &amp;ldquo;reconstruction&amp;rdquo;이 아님&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;STEER는 의도적으로:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;relative neighborhood만 맞추고&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;absolute semantic anchoring은 흐리게&lt;/b&gt; 만든다&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문에서도 명시적으로:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;cosine similarity 상한&lt;/li&gt;
&lt;li&gt;similarity penalty &amp;tau;&lt;br /&gt;를 둬서 &lt;b&gt;과도한 정렬(overfitting)을 금지&lt;/b&gt;한다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이는 사실상:&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;ldquo;retrieval은 되되, decoding은 어렵게&amp;rdquo;&lt;br /&gt;라는 &lt;b&gt;공격 비우호적 설계&lt;/b&gt;다.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;U-ZEI는 이 지점에서 성능이 급격히 나빠진다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;(3) 공격 성능은 &amp;ldquo;복원 가능성&amp;rdquo;이 아니라 &amp;ldquo;복원 정확도&amp;rdquo; 문제&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;STEER 논문에서도 스스로 인정한다:&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;완전한 정보이론적 안전은 아니다.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 실험적으로:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Rouge-L: &lt;b&gt;16~30%&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;BLEU: &lt;b&gt;1~4%&lt;/b&gt;&lt;br /&gt;수준에 머무른다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;U-ZEI 기준으로 보면:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&amp;ldquo;문장 비슷하게 맞춘다&amp;rdquo; ❌&lt;/li&gt;
&lt;li&gt;&amp;ldquo;키워드 몇 개 어렴풋이 찍는다&amp;rdquo; ⭕&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉,&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;semantic leakage는 존재&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;하지만 &lt;b&gt;실사용자 질의를 재식별할 수준은 아님&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이건 binary security 문제가 아니라 &lt;b&gt;risk attenuation 문제&lt;/b&gt;다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;4. 그래서 이 방법의 정확한 위치는?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;STEER는 다음 중 어디에 있느냐면:&lt;/p&gt;
범주해당 여부
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;정보이론적 프라이버시 (DP, HE)&lt;/td&gt;
&lt;td&gt;❌&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;완전 복원 불가능&lt;/td&gt;
&lt;td&gt;❌&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;실용적 복구 저항 (practical resistance)&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RAG/VDB 환경에서 즉시 적용&lt;/td&gt;
&lt;td&gt;✅&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉 STEER는:&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;ldquo;Universal inversion이 존재하는 세계에서,&lt;br /&gt;그래도 가장 현실적인 피해 감소 전략 중 하나&amp;rdquo;&lt;/b&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;라는 위치에 있다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;5. 네가 지금 연구하는 방향과 연결하면 (중요)&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;너가 이미 고민 중인:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;토큰 space 난독화&lt;/li&gt;
&lt;li&gt;출력 ID permutation&lt;/li&gt;
&lt;li&gt;embedding compression + noise&lt;/li&gt;
&lt;li&gt;PPFT 스타일 privacy budget 관리&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이런 것들은 전부 &lt;b&gt;U-ZEI 이후 세계관에 더 적합한 대응&lt;/b&gt;이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;솔직히 말하면:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;STEER 단독&lt;/b&gt; &amp;rarr; U-ZEI 시대에는 충분 조건 아님&lt;/li&gt;
&lt;li&gt;&lt;b&gt;STEER + token-space / output-space 보호&lt;/b&gt; &amp;rarr; 훨씬 설득력 있음&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이건 &lt;b&gt;STEER의 약점&lt;/b&gt;이라기보다,&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;ldquo;embedding 자체를 쓰는 모든 방법의 근본적 한계&amp;rdquo;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;6. 한 줄 결론&lt;/h2&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;맞다. Universal zero-shot embedding inversion의 공격 프레임으로 접근은 가능하다.&lt;br /&gt;하지만 STEER는 &amp;lsquo;같은 방식으로, 같은 수준으로&amp;rsquo; 뚫리지는 않는다.&lt;br /&gt;이는 완전 방어가 아니라, 실용적 공격 난이도를 의도적으로 높인 설계다.&lt;/b&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;원하면 다음으로:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;STEER + token permutation 결합 설계&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;U-ZEI 기준 threat model 재정의&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;&amp;ldquo;왜 우리는 DP가 아니라 복구저항을 택하는가&amp;rdquo; 논문용 문단&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;까지 바로 같이 짜줄 수 있다.&lt;/p&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div&gt;&lt;br /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;2020&quot; data-start=&quot;250&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;410&quot; data-start=&quot;272&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;291&quot; data-start=&quot;272&quot;&gt;&lt;b&gt;연구 배경 / 문제의식&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;410&quot; data-start=&quot;291&quot; data-col-size=&quot;lg&quot;&gt;상용 Vector DB는 프로프라이어터리 임베딩 모델을 블랙박스 API로 제공하여, &lt;br /&gt;검색 시 사용자 &lt;b&gt;질의 원문 텍스트가 서버에 노출&lt;/b&gt;됨. 의료&amp;middot;금융&amp;middot;법률 등 민감 도메인에서 심각한 프라이버시 위험 발생&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;546&quot; data-start=&quot;411&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;427&quot; data-start=&quot;411&quot;&gt;&lt;b&gt;기존 방법의 한계&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;546&quot; data-start=&quot;427&quot; data-col-size=&quot;lg&quot;&gt;(1) 암호화(FHE/MPC): 연산 비용 과다로 실용성 부족 &lt;br /&gt;(2) 익명화: 핵심 의미 제거로 검색 성능 급락 &lt;br /&gt;(3) Split Learning + DP: 무작위 노이즈로 의미 구조 파괴, 서버 수정 필요&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;648&quot; data-start=&quot;547&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;568&quot; data-start=&quot;547&quot;&gt;&lt;b&gt;핵심 관찰&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;648&quot; data-start=&quot;568&quot; data-col-size=&quot;lg&quot;&gt;서로 다른 임베딩 모델 간에도 &lt;b&gt;의미 공간의 기하 구조가 부분적으로 정렬(alignment)&lt;/b&gt;되어 있으며, 상대적 위치 관계가 보존됨&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;787&quot; data-start=&quot;649&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;661&quot; data-start=&quot;649&quot;&gt;&lt;b&gt;제안 방법&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;787&quot; data-start=&quot;661&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;STEER (Secure Transformed Embedding vEctor Retrieval)&lt;/b&gt;: &lt;br /&gt;로컬 임베딩 공간을 서버 임베딩 공간으로 정렬하는 변환 함수를 학습해 &lt;b&gt;서버 임베딩의 근사 벡터로 검색 수행&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;923&quot; data-start=&quot;788&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;801&quot; data-start=&quot;788&quot;&gt;&lt;b&gt;시스템 구조&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;923&quot; data-start=&quot;801&quot; data-col-size=&quot;lg&quot;&gt;(1) Setup Phase: 비민감 공용 텍스트로 로컬&amp;ndash;서버 임베딩 쌍 생성 후 공간 정렬 함수 학습 &lt;br /&gt;(2) Query Phase: 질의 텍스트 &amp;rarr; 로컬 임베딩 &amp;rarr; 변환 적용 &amp;rarr; 근사 임베딩만 서버 전송&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1025&quot; data-start=&quot;924&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;936&quot; data-start=&quot;924&quot;&gt;&lt;b&gt;정렬 방식&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1025&quot; data-start=&quot;936&quot; data-col-size=&quot;lg&quot;&gt;선형 정렬(Least Squares) 및 비선형 정렬(MLP). &lt;br /&gt;과도한 정렬로 인한 보안 위험을 방지하기 위해 &lt;b&gt;유사도 패널티 기반 정규화 항&lt;/b&gt; 도입&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1153&quot; data-start=&quot;1026&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1044&quot; data-start=&quot;1026&quot;&gt;&lt;b&gt;프라이버시 보호 원리&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1153&quot; data-start=&quot;1044&quot; data-col-size=&quot;lg&quot;&gt;서버는 원문 텍스트 및 로컬 모델&amp;middot;변환 함수에 접근 불가. &lt;br /&gt;근사 임베딩은 특정 모델의 실제 임베딩 공간에 속하지 않아 &lt;b&gt;Embedding Inversion Attack(EIA)&lt;/b&gt;에 강함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1207&quot; data-start=&quot;1154&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1169&quot; data-start=&quot;1154&quot;&gt;&lt;b&gt;서버 수정 여부&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1207&quot; data-start=&quot;1169&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;불필요&lt;/b&gt; (기존 VDB, 상용 API 그대로 사용 가능)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1308&quot; data-start=&quot;1208&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1222&quot; data-start=&quot;1208&quot;&gt;&lt;b&gt;평가 데이터셋&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1308&quot; data-start=&quot;1222&quot; data-col-size=&quot;lg&quot;&gt;BEIR benchmark: Natural Questions, Quora, ArguAna, SCIDOCS, SciFact (수천~수백만 문서 규모)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1391&quot; data-start=&quot;1309&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1321&quot; data-start=&quot;1309&quot;&gt;&lt;b&gt;성능 지표&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1391&quot; data-start=&quot;1321&quot; data-col-size=&quot;lg&quot;&gt;검색 성능: Recall@k / &lt;br /&gt;보안성: Rouge-L, BLEU, Cosine Similarity (복원 공격 평가)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1501&quot; data-start=&quot;1392&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1412&quot; data-start=&quot;1392&quot;&gt;&lt;b&gt;주요 실험 결과 &amp;ndash; 성능&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1501&quot; data-start=&quot;1412&quot; data-col-size=&quot;lg&quot;&gt;Recall@100 기준 성능 저하 &lt;b&gt;1~4% 이내&lt;/b&gt;. 동일 프라이버시 수준에서 Split+DP 대비 &lt;b&gt;Recall@20 최대 20~40% 향상&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1606&quot; data-start=&quot;1502&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1522&quot; data-start=&quot;1502&quot;&gt;&lt;b&gt;주요 실험 결과 &amp;ndash; 보안&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1606&quot; data-start=&quot;1522&quot; data-col-size=&quot;lg&quot;&gt;EIA 시 Rouge-L &lt;b&gt;16~30%&lt;/b&gt;, BLEU &lt;b&gt;0.8~4%&lt;/b&gt; 수준으로 복원 실패. 매핑 모델 용량 증가 시에도 공격 성공률 제한적&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1700&quot; data-start=&quot;1607&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1620&quot; data-start=&quot;1607&quot;&gt;&lt;b&gt;기술적 기여&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1700&quot; data-start=&quot;1620&quot; data-col-size=&quot;lg&quot;&gt;(1) 암호화&amp;middot;노이즈 중심 접근을 넘어 &lt;b&gt;임베딩 공간 정렬 기반 프라이버시 보호&lt;/b&gt; 제시 &lt;br /&gt;(2) 의미 보존형 구조적 변환의 우수성 실증&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1768&quot; data-start=&quot;1701&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1714&quot; data-start=&quot;1701&quot;&gt;&lt;b&gt;실용적 기여&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1768&quot; data-start=&quot;1714&quot; data-col-size=&quot;lg&quot;&gt;서버 수정 없이 즉시 적용 가능, 대규모 VDB&amp;middot;RAG&amp;middot;추천 시스템에 범용적으로 활용 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1846&quot; data-start=&quot;1769&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1784&quot; data-start=&quot;1769&quot;&gt;&lt;b&gt;적용 가능 영역&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1846&quot; data-start=&quot;1784&quot; data-col-size=&quot;lg&quot;&gt;Privacy-preserving RAG, 민감 도메인 검색, 추천 시스템, LLM 추론 파이프라인 전반&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1927&quot; data-start=&quot;1847&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1861&quot; data-start=&quot;1847&quot;&gt;&lt;b&gt;한계 및 논의&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1927&quot; data-start=&quot;1861&quot; data-col-size=&quot;lg&quot;&gt;완전한 이론적 프라이버시 보장(DP, 암호화)은 아님. 다만 실용 환경에서 &lt;b&gt;보안&amp;ndash;성능 균형 최적화&lt;/b&gt;에 초점&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2020&quot; data-start=&quot;1928&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1941&quot; data-start=&quot;1928&quot;&gt;&lt;b&gt;핵심 메시지&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2020&quot; data-start=&quot;1941&quot; data-col-size=&quot;lg&quot;&gt;질의 텍스트를 숨기기 위해 의미를 버리지 않고, 의미 공간을 정렬해 서버 임베딩을 근사함으로써 프라이버시와 검색 성능을 동시에 달성&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1203</guid>
      <comments>https://yoonschallenge.tistory.com/1203#entry1203comment</comments>
      <pubDate>Mon, 2 Feb 2026 16:41:01 +0900</pubDate>
    </item>
    <item>
      <title>Multi-turn, Long-context Benchmark 논문 3</title>
      <link>https://yoonschallenge.tistory.com/1194</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2504.04150&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2504.04150&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768668541847&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Reasoning on Multiple Needles In A Haystack&quot; data-og-description=&quot;The Needle In A Haystack (NIAH) task has been widely used to evaluate the long-context question-answering capabilities of Large Language Models (LLMs). However, its reliance on simple retrieval limits its effectiveness. To address this limitation, recent s&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2504.04150&quot; data-og-url=&quot;https://arxiv.org/abs/2504.04150v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bRZtZu/dJMb8SXrupM/TZJ55ees9N1hopZ0BJQkQ1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/3lAuQ/dJMb8WetflK/lJrur3kVkKIDMS7KAuqYlK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2504.04150&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2504.04150&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bRZtZu/dJMb8SXrupM/TZJ55ees9N1hopZ0BJQkQ1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/3lAuQ/dJMb8WetflK/lJrur3kVkKIDMS7KAuqYlK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Reasoning on Multiple Needles In A Haystack&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;The Needle In A Haystack (NIAH) task has been widely used to evaluate the long-context question-answering capabilities of Large Language Models (LLMs). However, its reliance on simple retrieval limits its effectiveness. To address this limitation, recent s&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.naacl-long.267/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2025.naacl-long.267/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768668562666&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Multilingual Needle in a Haystack: Investigating Long-Context Behavior of Multilingual Large Language Models&quot; data-og-description=&quot;Amey Hengle, Prasoon Bajpai, Soham Dan, Tanmoy Chakraborty. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers). 2025.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2025.naacl-long.267/&quot; data-og-url=&quot;https://aclanthology.org/2025.naacl-long.267/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/ekvlTY/dJMb88FYywk/Ssdk10NXI2klcpkMzaIfJ1/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.naacl-long.267/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2025.naacl-long.267/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/ekvlTY/dJMb88FYywk/Ssdk10NXI2klcpkMzaIfJ1/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Multilingual Needle in a Haystack: Investigating Long-Context Behavior of Multilingual Large Language Models&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Amey Hengle, Prasoon Bajpai, Soham Dan, Tanmoy Chakraborty. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers). 2025.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2503.00353&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2503.00353&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768668574386&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;U-NIAH: Unified RAG and LLM Evaluation for Long Context Needle-In-A-Haystack&quot; data-og-description=&quot;Recent advancements in Large Language Models (LLMs) have expanded their context windows to unprecedented lengths, sparking debates about the necessity of Retrieval-Augmented Generation (RAG). To address the fragmented evaluation paradigms and limited cases&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2503.00353&quot; data-og-url=&quot;https://arxiv.org/abs/2503.00353v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/lPSWP/dJMb8TB3bFl/tiX7PGNSDkW9fu1XLn1lJ0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/jwyUk/dJMb8Zvu4jH/2fI3qqO78vOKpJGE0tSNZ1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2503.00353&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2503.00353&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/lPSWP/dJMb8TB3bFl/tiX7PGNSDkW9fu1XLn1lJ0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/jwyUk/dJMb8Zvu4jH/2fI3qqO78vOKpJGE0tSNZ1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;U-NIAH: Unified RAG and LLM Evaluation for Long Context Needle-In-A-Haystack&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Recent advancements in Large Language Models (LLMs) have expanded their context windows to unprecedented lengths, sparking debates about the necessity of Retrieval-Augmented Generation (RAG). To address the fragmented evaluation paradigms and limited cases&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.emnlp-main.1497/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2025.emnlp-main.1497/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768668614922&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Sequential-NIAH: A Needle-In-A-Haystack Benchmark for Extracting Sequential Needles from Long Contexts&quot; data-og-description=&quot;Yifei Yu, Qian-Wen Zhang, Lingfeng Qiao, Di Yin, Fang Li, Jie Wang, Chen Zeng Xi, Suncong Zheng, Xiaolong Liang, Xing Sun. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing. 2025.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2025.emnlp-main.1497/&quot; data-og-url=&quot;https://aclanthology.org/2025.emnlp-main.1497/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/wl6lK/dJMb9fry7NQ/Ql6V80jPItkdXKKeWkhAZk/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.emnlp-main.1497/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2025.emnlp-main.1497/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/wl6lK/dJMb9fry7NQ/Ql6V80jPItkdXKKeWkhAZk/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Sequential-NIAH: A Needle-In-A-Haystack Benchmark for Extracting Sequential Needles from Long Contexts&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Yifei Yu, Qian-Wen Zhang, Lingfeng Qiao, Di Yin, Fang Li, Jie Wang, Chen Zeng Xi, Suncong Zheng, Xiaolong Liang, Xing Sun. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing. 2025.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1194</guid>
      <comments>https://yoonschallenge.tistory.com/1194#entry1194comment</comments>
      <pubDate>Sat, 31 Jan 2026 02:50:31 +0900</pubDate>
    </item>
    <item>
      <title>ALIENLM: ALIENIZATION OF LANGUAGE FORPRIVACY-PRESERVING API INTERACTION WITHLLMS</title>
      <link>https://yoonschallenge.tistory.com/1202</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://kimjaehee0725.github.io/publications/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://kimjaehee0725.github.io/publications/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1769526430146&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Publications&quot; data-og-description=&quot;Selected publications and manuscripts in natural language processing and trustworthy AI.&quot; data-og-host=&quot;kimjaehee0725.github.io&quot; data-og-source-url=&quot;https://kimjaehee0725.github.io/publications/&quot; data-og-url=&quot;https://kimjaehee0725.github.io/publications/&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://kimjaehee0725.github.io/publications/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://kimjaehee0725.github.io/publications/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Publications&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Selected publications and manuscripts in natural language processing and trustworthy AI.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;kimjaehee0725.github.io&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;리뷰 받는 중 인 것 같은데 여기서 찾았습니다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 Inference 방법론들은 API환경에서 제한적이거나 성능 감소가 매우 컸음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰 수준에서 치환을 통해 fine-tuning을 진행하고 이를 통해 성능 평가를 했을 때 80%의 성능을 유지함을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;의료, 금융, 교육과 같은 API 응용 환경에서 민감한 데이터를 보호할 수 있음&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1255&quot; data-origin-height=&quot;726&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b1BELC/dJMcafk68Fo/yisRJiLOeVmGvN0eEQfmu1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b1BELC/dJMcafk68Fo/yisRJiLOeVmGvN0eEQfmu1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b1BELC/dJMcafk68Fo/yisRJiLOeVmGvN0eEQfmu1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb1BELC%2FdJMcafk68Fo%2FyisRJiLOeVmGvN0eEQfmu1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1255&quot; height=&quot;726&quot; data-origin-width=&quot;1255&quot; data-origin-height=&quot;726&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰 암호화를 통해 사람이 읽을 수 없는 언어로 학습을 진행한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;API 사용이 가능하고, 인간은 읽을 수 없으며 LLM은 학습할 수 있도록 진행해야 한다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;687&quot; data-origin-height=&quot;93&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/r5zFO/dJMcadOivDA/kZIkIkcPlcTJXi8D6aYK3K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/r5zFO/dJMcadOivDA/kZIkIkcPlcTJXi8D6aYK3K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/r5zFO/dJMcadOivDA/kZIkIkcPlcTJXi8D6aYK3K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fr5zFO%2FdJMcadOivDA%2FkZIkIkcPlcTJXi8D6aYK3K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;687&quot; height=&quot;93&quot; data-origin-width=&quot;687&quot; data-origin-height=&quot;93&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰 문자열을 v라고 하고 그에 대응하는 ID를 i라고 할 때 치환해서 안되는 특수 토큰 집합(pad나 eos와 같은 토큰)을 제외하고 변환한다. 전단사 함수 &lt;span&gt;&lt;span&gt;f:I&amp;rarr;I를 도입하고 alien 어휘를 정의함&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;329&quot; data-origin-height=&quot;30&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/baLSVn/dJMcagEmm2l/1pdqwy4fOpNkOrSKhTIrxk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/baLSVn/dJMcagEmm2l/1pdqwy4fOpNkOrSKhTIrxk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/baLSVn/dJMcagEmm2l/1pdqwy4fOpNkOrSKhTIrxk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbaLSVn%2FdJMcagEmm2l%2F1pdqwy4fOpNkOrSKhTIrxk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;329&quot; height=&quot;30&quot; data-origin-width=&quot;329&quot; data-origin-height=&quot;30&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span&gt;&lt;span&gt;&amp;tau;(x;V)이를 통해서 텍스트 x를 토큰 ID로 매핑하고, ID를 텍스트로 돌리는 &lt;span&gt;&lt;span&gt;&amp;tau;^-1(i;V)가 존재&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;f를 통해 alien 어휘로 맞춰줌&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;이를 통해 토크나이저 위에 클라이언트 번역을 정의&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;751&quot; data-origin-height=&quot;49&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cyKd1j/dJMcadOivDS/yHy0QCRVaSyWjEtD3dPdJK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cyKd1j/dJMcadOivDS/yHy0QCRVaSyWjEtD3dPdJK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cyKd1j/dJMcadOivDS/yHy0QCRVaSyWjEtD3dPdJK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcyKd1j%2FdJMcadOivDS%2FyHy0QCRVaSyWjEtD3dPdJK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;751&quot; height=&quot;49&quot; data-origin-width=&quot;751&quot; data-origin-height=&quot;49&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span&gt;&lt;span&gt;&amp;rho;&amp;isin;[0, 1]&lt;/span&gt;&lt;/span&gt;는 암호화 비율을 제어함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;D_&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&amp;rho;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;​&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;&lt;span&gt;E_&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&amp;rho;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;​&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;x&lt;/span&gt;&lt;span&gt;))&lt;/span&gt;&lt;span&gt;=&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;x 이게 항상 성립함&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1195&quot; data-origin-height=&quot;95&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bAxaIh/dJMcabQxvuS/DkGRAjH9qg0OYmjWHrvPD0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bAxaIh/dJMcabQxvuS/DkGRAjH9qg0OYmjWHrvPD0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bAxaIh/dJMcabQxvuS/DkGRAjH9qg0OYmjWHrvPD0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbAxaIh%2FdJMcabQxvuS%2FDkGRAjH9qg0OYmjWHrvPD0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1195&quot; height=&quot;95&quot; data-origin-width=&quot;1195&quot; data-origin-height=&quot;95&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이제 &lt;span style=&quot;color: #333333; text-align: start;&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&amp;rho;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;​가 주어지면 암호화 비율에 따라 토큰이 뒤섞이게 됨&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #333333; text-align: start;&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&amp;rho;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;​가 증가할 수록 글을 알아볼 수 없게 되지만 성능 저하도 심해짐&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #333333; text-align: start;&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;사람에게는 읽기 어렵지만 모델에게는 학습 가능하게 하려면 embedding space에서의 거리가 중요하다.&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;492&quot; data-origin-height=&quot;89&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b0CnYo/dJMcabwe2J3/BVDVLwf3d3ndcvYnRgqW70/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b0CnYo/dJMcabwe2J3/BVDVLwf3d3ndcvYnRgqW70/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b0CnYo/dJMcabwe2J3/BVDVLwf3d3ndcvYnRgqW70/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb0CnYo%2FdJMcabwe2J3%2FBVDVLwf3d3ndcvYnRgqW70%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;492&quot; height=&quot;89&quot; data-origin-width=&quot;492&quot; data-origin-height=&quot;89&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #333333; text-align: start;&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;이렇게 거리를 정의한다.&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;796&quot; data-origin-height=&quot;183&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bRha74/dJMcagqL866/Sf9yHOk2va18A687xc29j1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bRha74/dJMcagqL866/Sf9yHOk2va18A687xc29j1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bRha74/dJMcagqL866/Sf9yHOk2va18A687xc29j1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbRha74%2FdJMcagqL866%2FSf9yHOk2va18A687xc29j1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;796&quot; height=&quot;183&quot; data-origin-width=&quot;796&quot; data-origin-height=&quot;183&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;활성 도메인에 대해 거리가 설정한 파라미터를 넘지 않도록 진행한다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;988&quot; data-origin-height=&quot;83&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cv7XSJ/dJMcah4jdJr/zhZwUtsLVwBiKXHNoFzuXk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cv7XSJ/dJMcah4jdJr/zhZwUtsLVwBiKXHNoFzuXk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cv7XSJ/dJMcah4jdJr/zhZwUtsLVwBiKXHNoFzuXk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcv7XSJ%2FdJMcah4jdJr%2FzhZwUtsLVwBiKXHNoFzuXk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;988&quot; height=&quot;83&quot; data-origin-width=&quot;988&quot; data-origin-height=&quot;83&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;유사도 제약을 &lt;span&gt;&lt;span&gt;&amp;lambda;&amp;ge;0로 완화하면 위와 같은 식을 얻고, &amp;mu;가 크면 llm 학습 가능성을, 작으면 인간 불투명성을 더 중시한다.&amp;nbsp;&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span&gt;&lt;span&gt;API 모델에서는 embedding에 접근할 수 없어 오픈 소스 llm 임베딩에서 근사하여 대체한다.&lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;483&quot; data-origin-height=&quot;61&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cFsNip/dJMcadgvKbr/xC0itLPpAbESCUJKQGQgCk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cFsNip/dJMcadgvKbr/xC0itLPpAbESCUJKQGQgCk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cFsNip/dJMcadgvKbr/xC0itLPpAbESCUJKQGQgCk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcFsNip%2FdJMcadgvKbr%2FxC0itLPpAbESCUJKQGQgCk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;483&quot; height=&quot;61&quot; data-origin-width=&quot;483&quot; data-origin-height=&quot;61&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;vocab이 다를 수 있으니 평균 임베딩을 사용함....&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;또한 10^5에서 전단사를 정확히 푸는 것은 비실현적으로 k-NN 기반 후보 축소를 사용하는 greedy search를 적용&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;821&quot; data-origin-height=&quot;59&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cobLh6/dJMcagYBuqO/HoYCQpMj8tJuKzr5WgrRz1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cobLh6/dJMcagYBuqO/HoYCQpMj8tJuKzr5WgrRz1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cobLh6/dJMcagYBuqO/HoYCQpMj8tJuKzr5WgrRz1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcobLh6%2FdJMcagYBuqO%2FHoYCQpMj8tJuKzr5WgrRz1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;821&quot; height=&quot;59&quot; data-origin-width=&quot;821&quot; data-origin-height=&quot;59&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 현실적인 e_P를 활용함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그 후 텍스트 예제만을 사용해 Encryption Adaptation Training인 EAT를 진행하여 얼라인 시킴&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;학습 함수는 동일함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;추론은 평문&amp;nbsp; x를 E를 통해 x'로 바꿔 API에 전송하고, 서버는 이를 출력하여 y'를 만들고, 클라이언트는 이를 받아서 다시 복호화 해 y를 만든다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이를 통해 민감 데이터가 학습 및 추론 과정에서 보호됨&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1 대 1 교환인 점이 조금 아쉬운데...&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;k-nn에 1대1 교환이면 embedding space에서 top - 100 정도로 잡고, 쫙 통계 내면 잡을 수 있지 않나 싶기도 하고...&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;학습은 이 데이터로 진행하였습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://huggingface.co/datasets/Magpie-Align/Magpie-Pro-300K-Filtered&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://huggingface.co/datasets/Magpie-Align/Magpie-Pro-300K-Filtered&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1769532553155&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Magpie-Align/Magpie-Pro-300K-Filtered &amp;middot; Datasets at Hugging Face&quot; data-og-description=&quot;We&amp;rsquo;re on a journey to advance and democratize artificial intelligence through open source and open science.&quot; data-og-host=&quot;huggingface.co&quot; data-og-source-url=&quot;https://huggingface.co/datasets/Magpie-Align/Magpie-Pro-300K-Filtered&quot; data-og-url=&quot;https://huggingface.co/datasets/Magpie-Align/Magpie-Pro-300K-Filtered&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/006HX/dJMb9lk1Ljk/nFAEspEpenNRCsRYeOfn8k/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648,https://scrap.kakaocdn.net/dn/N4XT5/dJMb9kTXyXM/lMWdIrOSA9aGQPg9RVh5Q0/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648,https://scrap.kakaocdn.net/dn/btvZVI/dJMb9b3MGcI/PRv99VJyYfkjeRC14KWilK/img.png?width=6650&amp;amp;height=1397&amp;amp;face=0_0_6650_1397&quot;&gt;&lt;a href=&quot;https://huggingface.co/datasets/Magpie-Align/Magpie-Pro-300K-Filtered&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://huggingface.co/datasets/Magpie-Align/Magpie-Pro-300K-Filtered&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/006HX/dJMb9lk1Ljk/nFAEspEpenNRCsRYeOfn8k/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648,https://scrap.kakaocdn.net/dn/N4XT5/dJMb9kTXyXM/lMWdIrOSA9aGQPg9RVh5Q0/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648,https://scrap.kakaocdn.net/dn/btvZVI/dJMb9b3MGcI/PRv99VJyYfkjeRC14KWilK/img.png?width=6650&amp;amp;height=1397&amp;amp;face=0_0_6650_1397');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Magpie-Align/Magpie-Pro-300K-Filtered &amp;middot; Datasets at Hugging Face&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We&amp;rsquo;re on a journey to advance and democratize artificial intelligence through open source and open science.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;huggingface.co&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://huggingface.co/datasets/Magpie-Align/Magpie-Reasoning-V1-150K&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://huggingface.co/datasets/Magpie-Align/Magpie-Reasoning-V1-150K&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1769532579193&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Magpie-Align/Magpie-Reasoning-V1-150K &amp;middot; Datasets at Hugging Face&quot; data-og-description=&quot;We&amp;rsquo;re on a journey to advance and democratize artificial intelligence through open source and open science.&quot; data-og-host=&quot;huggingface.co&quot; data-og-source-url=&quot;https://huggingface.co/datasets/Magpie-Align/Magpie-Reasoning-V1-150K&quot; data-og-url=&quot;https://huggingface.co/datasets/Magpie-Align/Magpie-Reasoning-V1-150K&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/GSpal/dJMb8Xj9Z2A/GpuVsgqSGrtKMpEhwocNa1/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648,https://scrap.kakaocdn.net/dn/bz2KQD/dJMb8U8OdwF/vaNE2ek8sXJ2CpNP3difrk/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648,https://scrap.kakaocdn.net/dn/ezIrE/dJMb8UHJL7q/uf95AnpyZR0sBNlx23K3oK/img.png?width=6650&amp;amp;height=1627&amp;amp;face=0_0_6650_1627&quot;&gt;&lt;a href=&quot;https://huggingface.co/datasets/Magpie-Align/Magpie-Reasoning-V1-150K&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://huggingface.co/datasets/Magpie-Align/Magpie-Reasoning-V1-150K&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/GSpal/dJMb8Xj9Z2A/GpuVsgqSGrtKMpEhwocNa1/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648,https://scrap.kakaocdn.net/dn/bz2KQD/dJMb8U8OdwF/vaNE2ek8sXJ2CpNP3difrk/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648,https://scrap.kakaocdn.net/dn/ezIrE/dJMb8UHJL7q/uf95AnpyZR0sBNlx23K3oK/img.png?width=6650&amp;amp;height=1627&amp;amp;face=0_0_6650_1627');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Magpie-Align/Magpie-Reasoning-V1-150K &amp;middot; Datasets at Hugging Face&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We&amp;rsquo;re on a journey to advance and democratize artificial intelligence through open source and open science.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;huggingface.co&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;baseline으로 기본 모델과, Substitution은 EAT 없이 추론만 진행한 것, SentinelLM은 임베딩을 수정하고 암호화된 데이터로 파인튜닝해 모델을 암호화된 입력에 적응시키는 법이다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1241&quot; data-origin-height=&quot;566&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/daSvKe/dJMcaaRECnM/N2A99FneFFMuTzOWosQcJk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/daSvKe/dJMcaaRECnM/N2A99FneFFMuTzOWosQcJk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/daSvKe/dJMcaaRECnM/N2A99FneFFMuTzOWosQcJk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdaSvKe%2FdJMcaaRECnM%2FN2A99FneFFMuTzOWosQcJk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1241&quot; height=&quot;566&quot; data-origin-width=&quot;1241&quot; data-origin-height=&quot;566&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;AlienLM의 성능이 높게 나타났다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;백본 전반에서 80%의 성능을 유지하는 반면 다른 방법은 성능이 많이 떨어짐&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1242&quot; data-origin-height=&quot;288&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/MacAM/dJMcajueqm8/prA6V1DauZzK4Z2xcDot2K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/MacAM/dJMcajueqm8/prA6V1DauZzK4Z2xcDot2K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/MacAM/dJMcajueqm8/prA6V1DauZzK4Z2xcDot2K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FMacAM%2FdJMcajueqm8%2FprA6V1DauZzK4Z2xcDot2K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1242&quot; height=&quot;288&quot; data-origin-width=&quot;1242&quot; data-origin-height=&quot;288&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;top-1만을 봐서 그런건지 0.11% 로 보호 성능이 뛰어납니다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;암호화 비율에 따라 딱 적절하게 확률을 보여주는 것을 볼 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;토큰 매핑 공격&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLM 서버 제공자나 내부 접근자가 공격자로 모델 가중치에 접근은 가능하지만 사용자 키(f)는 모르고 평문 - 암호문 쌍도 모른다&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 원래 무슨 토큰인지 확인하기&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순 토큰 하나를 고른뒤 embedding matrix에서, 출력 로짓 이전의 hiddenstate, context 상에서의 hiddenstate를 확인 함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 가장 가까운 top-1 토큰을 선택함 (이게 좀 아쉽네요 )&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;공격 빈도 분석&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;공격자는 외부 공격자로 alien 텍스트만 보고 맞춰야 한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;text를 통해 공개 코퍼스에서 통계를 수집하고 alien에서 가장 자주 나오는 토큰이 일반 코퍼스에서 가장 자주 나오는 토큰이라고 하여 치환 테이블을 만들려고 했으나 실패함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;고정적 빈도 분석으로 알파벳 다누이가 아닌 서브월드 단위이기 때문에...&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 도메인 불일치도 있기에 불가능함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;519&quot; data-origin-height=&quot;473&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/MZcci/dJMcadOivG6/5gjRQq5w9aYkmgWakVK8ek/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/MZcci/dJMcadOivG6/5gjRQq5w9aYkmgWakVK8ek/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/MZcci/dJMcadOivG6/5gjRQq5w9aYkmgWakVK8ek/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FMZcci%2FdJMcadOivG6%2F5gjRQq5w9aYkmgWakVK8ek%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;519&quot; height=&quot;473&quot; data-origin-width=&quot;519&quot; data-origin-height=&quot;473&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;암호화 비율이 증가할 수록 성능도 떨어지는 것을 볼 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1261&quot; data-origin-height=&quot;515&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/2w6wD/dJMcajnsRwT/0lZ2gzN1t2iwY2Ru1aGRIK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/2w6wD/dJMcajnsRwT/0lZ2gzN1t2iwY2Ru1aGRIK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/2w6wD/dJMcajnsRwT/0lZ2gzN1t2iwY2Ru1aGRIK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F2w6wD%2FdJMcajnsRwT%2F0lZ2gzN1t2iwY2Ru1aGRIK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1261&quot; height=&quot;515&quot; data-origin-width=&quot;1261&quot; data-origin-height=&quot;515&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;수학과 코딩에 맞춘 도메인 특화 EAT를 진행하였다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 300K 학습 데이터에 도메인 특화 데이터를 150k 추가하여 진행함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;코드나 수학 데이터가 없으면 박살나는 것을 볼 수 있음 - 수가 엄청 섞이는데 그에 대한 적응을 못하면 어쩔 수 없는 것일지도...&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1282&quot; data-origin-height=&quot;638&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bYkkOh/dJMcab34PPL/BT708KkNtuDte0Zl08ZaI1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bYkkOh/dJMcab34PPL/BT708KkNtuDte0Zl08ZaI1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bYkkOh/dJMcab34PPL/BT708KkNtuDte0Zl08ZaI1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbYkkOh%2FdJMcab34PPL%2FBT708KkNtuDte0Zl08ZaI1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1282&quot; height=&quot;638&quot; data-origin-width=&quot;1282&quot; data-origin-height=&quot;638&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;서로 다른 랜덤 시드를 통해 실험을 진행한 결과 성능이 적절히 유지되는 것을 볼 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;random으로 섞으면 성능은 엄청 떨어지는 것을 봐 embedding 공간에 대한 고려는 필요함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;851&quot; data-origin-height=&quot;797&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/9fvRp/dJMcah4jdLB/nTTUkFFoMAn6TQzpKus7jK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/9fvRp/dJMcah4jdLB/nTTUkFFoMAn6TQzpKus7jK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/9fvRp/dJMcah4jdLB/nTTUkFFoMAn6TQzpKus7jK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F9fvRp%2FdJMcah4jdLB%2FnTTUkFFoMAn6TQzpKus7jK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;851&quot; height=&quot;797&quot; data-origin-width=&quot;851&quot; data-origin-height=&quot;797&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;634&quot; data-origin-height=&quot;773&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c0vt1z/dJMb996gZim/eIsq0rFDoerjK554ZpwHck/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c0vt1z/dJMb996gZim/eIsq0rFDoerjK554ZpwHck/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c0vt1z/dJMb996gZim/eIsq0rFDoerjK554ZpwHck/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc0vt1z%2FdJMb996gZim%2FeIsq0rFDoerjK554ZpwHck%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;634&quot; height=&quot;773&quot; data-origin-width=&quot;634&quot; data-origin-height=&quot;773&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 567px;&quot; border=&quot;1&quot; data-end=&quot;2152&quot; data-start=&quot;180&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;444&quot; data-start=&quot;305&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;317&quot; data-start=&quot;305&quot;&gt;&lt;b&gt;문제 정의&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;444&quot; data-start=&quot;317&quot;&gt;상용 LLM의 &lt;b&gt;black-box API 환경&lt;/b&gt;에서 프롬프트&amp;middot;출력&amp;middot;fine-tuning 데이터가 서버에 &lt;b&gt;평문으로 노출&lt;/b&gt;됨. &lt;br /&gt;기존 HE/MPC/TEE는 white-box&amp;middot;고비용, DP/FL은 추론 단계 보호 불충분&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;588&quot; data-start=&quot;445&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;459&quot; data-start=&quot;445&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;588&quot; data-start=&quot;459&quot;&gt;&lt;b&gt;암호화를 언어 변환(language translation)&lt;/b&gt;으로 재해석. 토큰 수준 전단사 치환으로 사람이 읽을 수 없는 &lt;b&gt;Alien Language&lt;/b&gt;를 만들고, 모델을 그 언어에 &lt;b&gt;API-only로 적응 학습&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot; data-end=&quot;782&quot; data-start=&quot;589&quot;&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;603&quot; data-start=&quot;589&quot;&gt;&lt;b&gt;핵심 구성요소&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;782&quot; data-start=&quot;603&quot;&gt;(1) &lt;b&gt;Vocabulary-level bijection&lt;/b&gt; (token ID 전단사 치환) &lt;br /&gt;(2) &lt;b&gt;Client-side Translator&lt;/b&gt; (암&amp;middot;복호화) &lt;br /&gt;(3) &lt;b&gt;EAT (Encryption Adaptation Training)&lt;/b&gt;: 암호화된 텍스트만으로 API fine-tuning&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;922&quot; data-start=&quot;783&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;796&quot; data-start=&quot;783&quot;&gt;&lt;b&gt;수식적 정의&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;922&quot; data-start=&quot;796&quot;&gt;암호화 &lt;span&gt;&lt;span&gt;E_&amp;rho;(x)=&amp;tau;^{&amp;minus;1}(f_&amp;rho;(&amp;tau;(x)))&lt;/span&gt;&lt;/span&gt;, 복호화 &lt;span&gt;&lt;span&gt;D_&amp;rho;(E_&amp;rho;(x))=x&lt;/span&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&lt;span&gt;&amp;rho;\rho&lt;/span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;span&gt;&amp;rho;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;: 암호화 비율(privacy&amp;ndash;utility trade-off)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1084&quot; data-start=&quot;923&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;945&quot; data-start=&quot;923&quot;&gt;&lt;b&gt;Bijection 설계 원리&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;1084&quot; data-start=&quot;945&quot;&gt;목적함수로 &lt;b&gt;human opacity (edit distance &amp;uarr;)&lt;/b&gt; + &lt;b&gt;LLM learnability (embedding similarity &amp;uarr;)&lt;/b&gt; 동시 최적화. &lt;br /&gt;Black-box 제약으로 &lt;b&gt;proxy embedding&lt;/b&gt; 사용&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1172&quot; data-start=&quot;1085&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1096&quot; data-start=&quot;1085&quot;&gt;&lt;b&gt;알고리즘&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;1172&quot; data-start=&quot;1096&quot;&gt;대규모 vocab(&amp;asymp;10⁵) 대응을 위해 &lt;b&gt;k-NN 후보 축소 + greedy pairing&lt;/b&gt; 근사 해법 (실행시간 &amp;le;20분)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1268&quot; data-start=&quot;1173&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1185&quot; data-start=&quot;1173&quot;&gt;&lt;b&gt;위협 모델&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;1268&quot; data-start=&quot;1185&quot;&gt;Weight-private, black-box API. 서버&amp;middot;외부 공격자는 &lt;b&gt;alien text만 관측&lt;/b&gt;, 토큰 매핑&amp;middot;빈도 분석 시도 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1326&quot; data-start=&quot;1269&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1281&quot; data-start=&quot;1269&quot;&gt;&lt;b&gt;실험 모델&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;1326&quot; data-start=&quot;1281&quot;&gt;LLaMA-3 8B, Qwen-2.5 (7B/14B), Gemma-2 9B&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1415&quot; data-start=&quot;1327&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1338&quot; data-start=&quot;1327&quot;&gt;&lt;b&gt;벤치마크&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;1415&quot; data-start=&quot;1338&quot;&gt;MMLU, ARC-Easy/Challenge, HellaSwag, WinoGrande, TruthfulQA, GSM8K (총 7개)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1486&quot; data-start=&quot;1416&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1428&quot; data-start=&quot;1416&quot;&gt;&lt;b&gt;비교 방법&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;1486&quot; data-start=&quot;1428&quot;&gt;Substitution(치환만), SentinelLM 변형, &lt;b&gt;AlienLM (치환+EAT)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1560&quot; data-start=&quot;1487&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1502&quot; data-start=&quot;1487&quot;&gt;&lt;b&gt;주요 성능 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;1560&quot; data-start=&quot;1502&quot;&gt;&lt;b&gt;원래 성능의 81~87% 유지&lt;/b&gt;(평균). Substitution/기존 방법 대비 큰 폭 우수&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1620&quot; data-start=&quot;1561&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1573&quot; data-start=&quot;1561&quot;&gt;&lt;b&gt;보안 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;1620&quot; data-start=&quot;1573&quot;&gt;토큰 매핑 복구 공격 성공률 &lt;b&gt;&amp;lt;0.1%&lt;/b&gt;, 빈도 분석 &lt;b&gt;&amp;lt;0.01%&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot; data-end=&quot;1760&quot; data-start=&quot;1621&quot;&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1633&quot; data-start=&quot;1621&quot;&gt;&lt;b&gt;추가 실험&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;1760&quot; data-start=&quot;1633&quot;&gt;(1) &lt;b&gt;&amp;rho; 조절&lt;/b&gt;로 privacy&amp;ndash;utility 제어 &lt;br /&gt;(2) &lt;b&gt;Domain-specific EAT&lt;/b&gt;로 code/math 성능 향상 &lt;br /&gt;(3) &lt;b&gt;Seed 다양화&lt;/b&gt;로 키 분산(overlap &amp;lt;2%)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1828&quot; data-start=&quot;1761&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1775&quot; data-start=&quot;1761&quot;&gt;&lt;b&gt;핵심 인사이트&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;1828&quot; data-start=&quot;1775&quot;&gt;LLM의 &lt;b&gt;과제 수행 능력은 언어 표면과 분리 가능&lt;/b&gt;. 모델은 &amp;ldquo;외계어&amp;rdquo;도 학습 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1914&quot; data-start=&quot;1829&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1842&quot; data-start=&quot;1829&quot;&gt;&lt;b&gt;실용적 의의&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;1914&quot; data-start=&quot;1842&quot;&gt;❌ white-box 불필요 ❌ 특수 HW 불필요 ✅ 기존 상용 API 그대로 사용 가능한 &lt;b&gt;배포형 프라이버시 레이어&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1996&quot; data-start=&quot;1915&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1924&quot; data-start=&quot;1915&quot;&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;1996&quot; data-start=&quot;1924&quot;&gt;bijection 최적화는 근사적, 전역 &amp;rho; 사용. Span/content-level 암호화, 더 강한 이론 분석은 미해결&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;2092&quot; data-start=&quot;1997&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2009&quot; data-start=&quot;1997&quot;&gt;&lt;b&gt;향후 과제&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;2092&quot; data-start=&quot;2009&quot;&gt;adaptive adversary 하 learnability&amp;ndash;opacity 이론화, span-level &amp;rho; 스케줄링, DP/FL/TEE와 결합&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;2152&quot; data-start=&quot;2093&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2106&quot; data-start=&quot;2093&quot;&gt;&lt;b&gt;한 줄 요약&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;xl&quot; data-end=&quot;2152&quot; data-start=&quot;2106&quot;&gt;&lt;b&gt;&amp;ldquo;암호화를 언어로 만들어, API LLM이 스스로 배워 쓰게 한다.&amp;rdquo;&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1202</guid>
      <comments>https://yoonschallenge.tistory.com/1202#entry1202comment</comments>
      <pubDate>Wed, 28 Jan 2026 02:16:25 +0900</pubDate>
    </item>
    <item>
      <title>Privacy AI 관련 조사 11</title>
      <link>https://yoonschallenge.tistory.com/1201</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2505.18332&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2505.18332&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1769431240478&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;An Attack to Break Permutation-Based Private Third-Party Inference Schemes for LLMs&quot; data-og-description=&quot;Recent advances in Large Language Models (LLMs) have led to the widespread adoption of third-party inference services, raising critical privacy concerns. Existing methods of performing private third-party inference, such as Secure Multiparty Computation (S&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2505.18332&quot; data-og-url=&quot;https://arxiv.org/abs/2505.18332v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/Nms7L/dJMb86nR0bK/0dfdxkjk0kEgiZXKLX1OU1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/8NGPK/dJMb81GRCWO/aM2WpYJSXwvGJpae8hvV8K/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2505.18332&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2505.18332&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/Nms7L/dJMb86nR0bK/0dfdxkjk0kEgiZXKLX1OU1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/8NGPK/dJMb81GRCWO/aM2WpYJSXwvGJpae8hvV8K/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;An Attack to Break Permutation-Based Private Third-Party Inference Schemes for LLMs&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Recent advances in Large Language Models (LLMs) have led to the widespread adoption of third-party inference services, raising critical privacy concerns. Existing methods of performing private third-party inference, such as Secure Multiparty Computation (S&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;hidden state를 permutation해서 다른 서버에 제공해도 permutation 공간이 너무 커서 원문 복원이 실질적으로 불가능하다고 주장했지만 이 논문에서는 그 가정이 현실 llm에서는 성립하지 않음!&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1061&quot; data-origin-height=&quot;571&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bgWMvf/dJMcachBTFx/r6TqtubHtcamlUOYmx7YXk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bgWMvf/dJMcachBTFx/r6TqtubHtcamlUOYmx7YXk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bgWMvf/dJMcachBTFx/r6TqtubHtcamlUOYmx7YXk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbgWMvf%2FdJMcachBTFx%2Fr6TqtubHtcamlUOYmx7YXk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1061&quot; height=&quot;571&quot; data-origin-width=&quot;1061&quot; data-origin-height=&quot;571&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 594px;&quot; border=&quot;1&quot; data-end=&quot;1827&quot; data-start=&quot;245&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;354&quot; data-start=&quot;267&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;279&quot; data-start=&quot;267&quot;&gt;&lt;b&gt;연구 배경&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;354&quot; data-start=&quot;279&quot; data-col-size=&quot;lg&quot;&gt;대규모 LLM은 자체 추론이 어려워 제3자 추론 서비스에 의존하며, 이 과정에서 &lt;b&gt;사용자 입력 프라이버시 노출&lt;/b&gt; 문제가 발생&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;455&quot; data-start=&quot;355&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;367&quot; data-start=&quot;355&quot;&gt;&lt;b&gt;기존 접근&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;455&quot; data-start=&quot;367&quot; data-col-size=&quot;lg&quot;&gt;SMPC&amp;middot;암호기법은 계산 비용이 과도함 &amp;rarr; 최근 연구들은 &lt;b&gt;hidden state를 permutation하여 평문으로 제3자에 공개&lt;/b&gt;하는 방식 제안&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;553&quot; data-start=&quot;456&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;468&quot; data-start=&quot;456&quot;&gt;&lt;b&gt;기존 주장&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;553&quot; data-start=&quot;468&quot; data-col-size=&quot;lg&quot;&gt;permutation 공간이 매우 크므로 &lt;b&gt;원문 복원은 실질적으로 불가능&lt;/b&gt;하며 안전하다는 주장 (PermLLM, STIP, Centaur 등)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;654&quot; data-start=&quot;554&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;573&quot; data-start=&quot;554&quot;&gt;&lt;b&gt;논문의 핵심 문제 제기&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;654&quot; data-start=&quot;573&quot; data-col-size=&quot;lg&quot;&gt;이러한 &lt;b&gt;permutation 기반 프라이버시 주장은 LLM hidden state의 실제 구조를 고려하지 않은 잘못된 가정&lt;/b&gt;에 기반함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;731&quot; data-start=&quot;655&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;667&quot; data-start=&quot;655&quot;&gt;&lt;b&gt;공격 목표&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;731&quot; data-start=&quot;667&quot; data-col-size=&quot;lg&quot;&gt;permutation된 LLM hidden state로부터 &lt;b&gt;원래 사용자 프롬프트(토큰 시퀀스)를 복원&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot; data-end=&quot;884&quot; data-start=&quot;732&quot;&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;749&quot; data-start=&quot;732&quot;&gt;&lt;b&gt;핵심 공격 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot; data-end=&quot;884&quot; data-start=&quot;749&quot; data-col-size=&quot;lg&quot;&gt;(1) decoder-only LLM의 &lt;b&gt;단방향 attention 구조&lt;/b&gt;&lt;br /&gt;(2) hidden state의 &lt;b&gt;강한 비충돌성(non-collision)&lt;/b&gt;&lt;br /&gt;(3) &lt;b&gt;유한한 vocabulary&lt;/b&gt;를 이용한 순차적 토큰 복원&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;975&quot; data-start=&quot;885&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;910&quot; data-start=&quot;885&quot;&gt;&lt;b&gt;기본 공격&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;975&quot; data-start=&quot;910&quot; data-col-size=&quot;lg&quot;&gt;각 위치에서 모든 토큰을 대입해 hidden state를 비교 &amp;rarr; &lt;b&gt;선형 시간(O(V&amp;middot;N))&lt;/b&gt;에 완전 복원&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot; data-end=&quot;1121&quot; data-start=&quot;976&quot;&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1002&quot; data-start=&quot;976&quot;&gt;&lt;b&gt;확장 공격&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot; data-end=&quot;1121&quot; data-start=&quot;1002&quot; data-col-size=&quot;lg&quot;&gt;&amp;bull; Sequence permutation: 위치 추론 후 복원&lt;br /&gt;&amp;bull; Hidden-dim permutation: 정렬 기반 거리 비교&lt;br /&gt;&amp;bull; Factorized 2D permutation: 두 기법 결합&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1174&quot; data-start=&quot;1122&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1134&quot; data-start=&quot;1122&quot;&gt;&lt;b&gt;실험 모델&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1174&quot; data-start=&quot;1134&quot; data-col-size=&quot;lg&quot;&gt;Gemma-2-2B-IT, Llama-3.1-8B-Instruct&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1270&quot; data-start=&quot;1175&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1187&quot; data-start=&quot;1175&quot;&gt;&lt;b&gt;공격 성능&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;1270&quot; data-start=&quot;1187&quot; data-col-size=&quot;lg&quot;&gt;&amp;bull; Unpermuted: 거의 &lt;b&gt;100% 완전 복원&lt;/b&gt;&lt;br /&gt;&amp;bull; 모든 permutation 설정에서도 &lt;b&gt;약 97~99% 이상 완전 복원&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1339&quot; data-start=&quot;1271&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1286&quot; data-start=&quot;1271&quot;&gt;&lt;b&gt;주요 붕괴 대상&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1339&quot; data-start=&quot;1286&quot; data-col-size=&quot;lg&quot;&gt;PermLLM, STIP, Centaur의 &lt;b&gt;프라이버시 보장 가정이 실질적으로 무효&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1427&quot; data-start=&quot;1340&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1353&quot; data-start=&quot;1340&quot;&gt;&lt;b&gt;이론적 반박&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1427&quot; data-start=&quot;1353&quot; data-col-size=&quot;lg&quot;&gt;distance correlation 기반 보안 증명은 &lt;b&gt;복원 가능성(reconstructibility)&lt;/b&gt;을 보장하지 못함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1514&quot; data-start=&quot;1428&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1440&quot; data-start=&quot;1428&quot;&gt;&lt;b&gt;핵심 통찰&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;1514&quot; data-start=&quot;1440&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;통계적 비상관성 &amp;ne; 복원 불가능성&lt;/b&gt;&lt;br /&gt;LLM hidden state는 permutation 후에도 강한 식별성을 유지&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1577&quot; data-start=&quot;1515&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1527&quot; data-start=&quot;1515&quot;&gt;&lt;b&gt;방어 실험&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1577&quot; data-start=&quot;1527&quot; data-col-size=&quot;lg&quot;&gt;Gaussian noise, random prefix, quantization 실험&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1656&quot; data-start=&quot;1578&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1590&quot; data-start=&quot;1578&quot;&gt;&lt;b&gt;방어 결론&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1656&quot; data-start=&quot;1590&quot; data-col-size=&quot;lg&quot;&gt;permutation만으로는 불충분하며, &lt;b&gt;noise + permutation&lt;/b&gt; 조합만이 부분적 방어 가능성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1751&quot; data-start=&quot;1657&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1670&quot; data-start=&quot;1657&quot;&gt;&lt;b&gt;논문의 결론&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1751&quot; data-start=&quot;1670&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Permutation 기반 private inference는 근본적으로 취약&lt;/b&gt;하며, hidden state 평문 공개는 안전하지 않음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1827&quot; data-start=&quot;1752&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1765&quot; data-start=&quot;1752&quot;&gt;&lt;b&gt;연구적 의미&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1827&quot; data-start=&quot;1765&quot; data-col-size=&quot;lg&quot;&gt;향후 LLM 프라이버시 연구는 &lt;b&gt;&amp;ldquo;hidden state 노출 자체를 허용하지 않는 설계&amp;rdquo;&lt;/b&gt;가 필요함&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.findings-acl.1174/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2025.findings-acl.1174/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1769432366222&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Tr&quot; data-og-description=&quot;Toan Tran, Ruixuan Liu, Li Xiong. Findings of the Association for Computational Linguistics: ACL 2025. 2025.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2025.findings-acl.1174/&quot; data-og-url=&quot;https://aclanthology.org/2025.findings-acl.1174/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/lPIad/dJMb8WMj1XV/c7aFad75nVPy9FetkC8ZZK/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.findings-acl.1174/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2025.findings-acl.1174/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/lPIad/dJMb8WMj1XV/c7aFad75nVPy9FetkC8ZZK/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Tr&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Toan Tran, Ruixuan Liu, Li Xiong. Findings of the Association for Computational Linguistics: ACL 2025. 2025.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2025 acl findings에 붙었습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;MIA는 샘플 전체가 아니라 일부 토큰에 의해 누적되어 발생&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1044&quot; data-origin-height=&quot;641&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/qRM8e/dJMcahXxQwN/jpyBHOJbI7ziLUnhoCHzV0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/qRM8e/dJMcahXxQwN/jpyBHOJbI7ziLUnhoCHzV0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/qRM8e/dJMcahXxQwN/jpyBHOJbI7ziLUnhoCHzV0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FqRM8e%2FdJMcahXxQwN%2FjpyBHOJbI7ziLUnhoCHzV0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1044&quot; height=&quot;641&quot; data-origin-width=&quot;1044&quot; data-origin-height=&quot;641&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰마다 아직 잘 못 배우는 토큰과 이미 과도하게 외운 토큰이 존재하며 Loss가 비정상적으로 낮은 토큰이 MIA에 가장 큰 기여를 함 =&amp;gt; 모든 토큰을 동일하게 학습하는 것은 privacy 관점에서 비최적&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1051&quot; data-origin-height=&quot;664&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/mkS9w/dJMcagRRvdU/xkVycGlxDoAILtZQ5b6cR0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/mkS9w/dJMcagRRvdU/xkVycGlxDoAILtZQ5b6cR0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/mkS9w/dJMcagRRvdU/xkVycGlxDoAILtZQ5b6cR0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FmkS9w%2FdJMcagRRvdU%2FxkVycGlxDoAILtZQ5b6cR0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1051&quot; height=&quot;664&quot; data-origin-width=&quot;1051&quot; data-origin-height=&quot;664&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;어려운 토큰은 더 배우고, 이미 외운 토큰은 안 배우게 만드는 이중목적 학습 프레임워크!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;아직 못 맞추는 토큰은 높은 가중치를, 잘 맞추는 토큰은 낮은 가중치를 주게 학습하고, 나중에는 언러닝을 통해 오히려 너무 잘 학습된 토큰은 낮춰버려 utility랑 privacy를 챙김&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;2272&quot; data-start=&quot;286&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;469&quot; data-start=&quot;308&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;320&quot; data-start=&quot;308&quot;&gt;&lt;b&gt;연구 배경&lt;/b&gt;&lt;/td&gt;
&lt;td data-col-size=&quot;xl&quot; data-end=&quot;469&quot; data-start=&quot;320&quot;&gt;LLM은 학습 데이터의 memorization으로 인해 &lt;b&gt;Membership Inference Attack (MIA)&lt;/b&gt; 에 취약함. &lt;br /&gt;기존 방어 기법은 분류 모델 중심이거나 DP 기반으로, &lt;b&gt;순차적 토큰 구조를 갖는 LLM에 비효율적&lt;/b&gt;이며 성능 손실이 큼&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;577&quot; data-start=&quot;470&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;482&quot; data-start=&quot;470&quot;&gt;&lt;b&gt;문제 정의&lt;/b&gt;&lt;/td&gt;
&lt;td data-col-size=&quot;xl&quot; data-end=&quot;577&quot; data-start=&quot;482&quot;&gt;LLM에서 &lt;b&gt;모든 토큰이 동일하게 privacy risk에 기여하지 않음&lt;/b&gt;에도 불구하고, 기존 학습은 토큰을 균등 취급 &amp;rarr; 불필요한 memorization 발생&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;686&quot; data-start=&quot;578&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;600&quot; data-start=&quot;578&quot;&gt;&lt;b&gt;핵심 관찰&amp;nbsp;&lt;/b&gt;&lt;/td&gt;
&lt;td data-col-size=&quot;xl&quot; data-end=&quot;686&quot; data-start=&quot;600&quot;&gt;MIA 위험은 &lt;b&gt;소수의 &amp;ldquo;과도하게 외운 토큰&amp;rdquo;에서 집중적으로 발생&lt;/b&gt;하며, 샘플-level이 아닌 &lt;b&gt;token-level 누적 효과&lt;/b&gt;로 나타남&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;814&quot; data-start=&quot;687&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;701&quot; data-start=&quot;687&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td data-col-size=&quot;xl&quot; data-end=&quot;814&quot; data-start=&quot;701&quot;&gt;토큰을 &lt;b&gt;Hard tokens (아직 못 배운 토큰)&lt;/b&gt; 과 &lt;b&gt;Memorized tokens (이미 외운 토큰)&lt;/b&gt; 으로 구분하여, 학습 중 &lt;b&gt;선택적 학습 + 선택적 언러닝&lt;/b&gt;을 동시에 수행&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;910&quot; data-start=&quot;815&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;827&quot; data-start=&quot;815&quot;&gt;&lt;b&gt;제안 방법&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;910&quot; data-start=&quot;827&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;DuoLearn&lt;/b&gt;: reference model을 활용한 &lt;b&gt;동적 토큰 선택 + dual-purpose loss&lt;/b&gt; 기반 학습 프레임워크&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1273&quot; data-start=&quot;1078&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1092&quot; data-start=&quot;1078&quot;&gt;&lt;b&gt;Loss 설계&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1273&quot; data-start=&quot;1092&quot; data-col-size=&quot;xl&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;L_{&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;d&lt;/span&gt;&lt;span&gt;u&lt;/span&gt;&lt;span&gt;a&lt;/span&gt;&lt;span&gt;l}&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;​&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;=&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;L_{&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;CE}&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;​&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;&lt;span&gt;T_&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;h&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;​&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;span&gt;&amp;minus;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&amp;alpha;&lt;/span&gt;&lt;span&gt;&lt;span&gt;L_{&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;CE}&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;​&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;&lt;span&gt;T_&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;m&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;​&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/span&gt; &lt;br /&gt;&amp;bull; Hard tokens: gradient descent (learning)&lt;br /&gt;&amp;bull; Memorized tokens: gradient ascent (unlearning)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1376&quot; data-start=&quot;1274&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1286&quot; data-start=&quot;1274&quot;&gt;&lt;b&gt;학습 특징&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1376&quot; data-start=&quot;1286&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; 단일 backward pass에서 학습&amp;middot;언러닝 동시 수행&lt;br /&gt;&amp;bull; DP noise 없음&lt;br /&gt;&amp;bull; reference model 1회 forward만 추가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1500&quot; data-start=&quot;1377&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1389&quot; data-start=&quot;1377&quot;&gt;&lt;b&gt;실험 설정&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1500&quot; data-start=&quot;1389&quot; data-col-size=&quot;xl&quot;&gt;모델: GPT-2 (124M), Pythia (1.4B), LLaMA-2 (7B)&lt;br /&gt;데이터: Wikipedia, CC-News&lt;br /&gt;공격: Loss, Ref-Loss, Min-K, Zlib&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1624&quot; data-start=&quot;1501&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1518&quot; data-start=&quot;1501&quot;&gt;&lt;b&gt;Privacy 성능&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1624&quot; data-start=&quot;1518&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; MIA AUC &amp;asymp; 0.5 (random guess 수준)&lt;br /&gt;&amp;bull; DPSGD와 동급 혹은 더 강한 방어&lt;br /&gt;&amp;bull; Privacy backdoor (Precurious) 공격에도 강인&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1729&quot; data-start=&quot;1625&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1642&quot; data-start=&quot;1625&quot;&gt;&lt;b&gt;Utility 성능&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1729&quot; data-start=&quot;1642&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; DPSGD 대비 &lt;b&gt;Perplexity 손실 현저히 작음&lt;/b&gt;&lt;br /&gt;&amp;bull; 경우에 따라 일반 fine-tuning 대비 &lt;b&gt;PPL 개선 (&amp;asymp;10%)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1857&quot; data-start=&quot;1730&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1742&quot; data-start=&quot;1730&quot;&gt;&lt;b&gt;비교 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1857&quot; data-start=&quot;1742&quot; data-col-size=&quot;xl&quot;&gt;Goldfish: memorization 일부 완화하나 MIA 방어 실패&lt;br /&gt;DPSGD: 강력하나 성능 저하 큼&lt;br /&gt;&lt;b&gt;DuoLearn: privacy&amp;ndash;utility Pareto optimal&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1941&quot; data-start=&quot;1858&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1870&quot; data-start=&quot;1858&quot;&gt;&lt;b&gt;추가 분석&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1941&quot; data-start=&quot;1870&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; Token selection은 동적으로 변화&lt;br /&gt;&amp;bull; 초기엔 학습 토큰 &amp;rarr; 후반엔 언러닝 토큰으로 전환되는 경우 다수&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2014&quot; data-start=&quot;1942&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1954&quot; data-start=&quot;1942&quot;&gt;&lt;b&gt;확장 실험&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2014&quot; data-start=&quot;1954&quot; data-col-size=&quot;xl&quot;&gt;1.5B 규모 pretraining에서도 MIA AUC 0.9 &amp;rarr; 0.55로 감소, 성능 손실 제한적&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2078&quot; data-start=&quot;2015&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2025&quot; data-start=&quot;2015&quot;&gt;&lt;b&gt;한계점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2078&quot; data-start=&quot;2025&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; reference model 필요&lt;br /&gt;&amp;bull; 대규모 pretraining은 제한적 실험&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2200&quot; data-start=&quot;2079&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2091&quot; data-start=&quot;2079&quot;&gt;&lt;b&gt;논문 기여&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2200&quot; data-start=&quot;2091&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; 최초의 &lt;b&gt;token-level MIA 방어 프레임워크&lt;/b&gt;&lt;br /&gt;&amp;bull; 학습 단계에서 &lt;b&gt;의도적 unlearning을 loss로 통합&lt;/b&gt;&lt;br /&gt;&amp;bull; DP 없이 실용적 privacy 보호 달성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2272&quot; data-start=&quot;2201&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2214&quot; data-start=&quot;2201&quot;&gt;&lt;b&gt;핵심 메시지&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2272&quot; data-start=&quot;2214&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;&amp;ldquo;LLM 프라이버시는 무엇을 더 배울지가 아니라, 무엇을 의도적으로 잊게 할지의 문제다.&amp;rdquo;&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://icml.cc/virtual/2025/poster/45395&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://icml.cc/virtual/2025/poster/45395&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1769445988182&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;ICML Poster EncryptedLLM: Privacy-Preserving Large Language Model Inference via GPU-Accelerated Fully Homomorphic Encryption&quot; data-og-description=&quot;As large language models (LLMs) become more powerful, the computation required to run these models is increasingly outsourced to a third-party cloud. While this saves clients' computation, it risks leaking the clients' LLM queries to the cloud provider. Fu&quot; data-og-host=&quot;icml.cc&quot; data-og-source-url=&quot;https://icml.cc/virtual/2025/poster/45395&quot; data-og-url=&quot;https://icml.cc/virtual/2025/poster/45395&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://icml.cc/virtual/2025/poster/45395&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://icml.cc/virtual/2025/poster/45395&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;ICML Poster EncryptedLLM: Privacy-Preserving Large Language Model Inference via GPU-Accelerated Fully Homomorphic Encryption&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;As large language models (LLMs) become more powerful, the computation required to run these models is increasingly outsourced to a third-party cloud. While this saves clients' computation, it risks leaking the clients' LLM queries to the cloud provider. Fu&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;icml.cc&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서도 프롬프트의 노출을 가장 크게 생각합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;의료 금융 법률 등 고민감 도메인은 이 구조 자체가 실질적으로 사용 불가능하고, HE는 계산 비용이 너무 커서 실용성이 없음&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 HE에서 진짜 느린 부분은 어디냐!&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1219&quot; data-origin-height=&quot;650&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/BxXkP/dJMcabCZ2N3/1hPxRtxrkQeitG736HsdqK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/BxXkP/dJMcabCZ2N3/1hPxRtxrkQeitG736HsdqK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/BxXkP/dJMcabCZ2N3/1hPxRtxrkQeitG736HsdqK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FBxXkP%2FdJMcabCZ2N3%2F1hPxRtxrkQeitG736HsdqK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1219&quot; height=&quot;650&quot; data-origin-width=&quot;1219&quot; data-origin-height=&quot;650&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Linear layer는 생각보다 싸지만 GeLU, Softmax, LayerNorm과 같은 부분이 병목이 큼&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 비선형 연산을 저차 다항식으로 근사하여 GPU상에서 완전히 처리함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1220&quot; data-origin-height=&quot;405&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/NEg9C/dJMcahwteOk/DOygAQxCGNeMMtvGrtS3HK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/NEg9C/dJMcahwteOk/DOygAQxCGNeMMtvGrtS3HK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/NEg9C/dJMcahwteOk/DOygAQxCGNeMMtvGrtS3HK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FNEg9C%2FdJMcahwteOk%2FDOygAQxCGNeMMtvGrtS3HK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1220&quot; height=&quot;405&quot; data-origin-width=&quot;1220&quot; data-origin-height=&quot;405&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;성능이 유지되는 것을 볼 수 있음 =&amp;gt; 근사에 강건함을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;연산 시간도 수분으로 줄어든다.&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 605px;&quot; border=&quot;1&quot; data-end=&quot;2061&quot; data-start=&quot;228&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;463&quot; data-start=&quot;381&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;393&quot; data-start=&quot;381&quot;&gt;&lt;b&gt;문제 정의&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;463&quot; data-start=&quot;393&quot; data-col-size=&quot;lg&quot;&gt;클라우드 기반 LLM 추론 시 사용자 입력 프롬프트가 서버에 노출됨 &amp;rarr; 의료&amp;middot;금융&amp;middot;법률 등 고민감 도메인에서 사용 불가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;552&quot; data-start=&quot;464&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;476&quot; data-start=&quot;464&quot;&gt;&lt;b&gt;핵심 질문&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;552&quot; data-start=&quot;476&quot; data-col-size=&quot;lg&quot;&gt;Fully Homomorphic Encryption(FHE)을 사용해 &lt;b&gt;LLM 추론을 실용적인 시간 안에 수행할 수 있는가?&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;633&quot; data-start=&quot;553&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;565&quot; data-start=&quot;553&quot;&gt;&lt;b&gt;기본 접근&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;633&quot; data-start=&quot;565&quot; data-col-size=&quot;lg&quot;&gt;입력을 FHE로 암호화한 상태에서 서버가 LLM forward pass 수행, 결과는 암호화된 채로 사용자에게 반환&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;744&quot; data-start=&quot;634&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;649&quot; data-start=&quot;634&quot;&gt;&lt;b&gt;주요 병목 분석&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;744&quot; data-start=&quot;649&quot; data-col-size=&quot;lg&quot;&gt;Linear layer는 상대적으로 저렴 / &lt;b&gt;GeLU, Softmax, LayerNorm 같은 비선형 함수 + Bootstrapping이 전체 비용의 대부분&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot; data-end=&quot;857&quot; data-start=&quot;745&quot;&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;759&quot; data-start=&quot;745&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot; data-end=&quot;857&quot; data-start=&quot;759&quot; data-col-size=&quot;lg&quot;&gt;(1) 비선형 연산을 저차 다항식으로 근사&lt;br /&gt;(2) CKKS FHE를 &lt;b&gt;GPU에서 가속&lt;/b&gt;&lt;br /&gt;(3) Softmax의 max 연산을 lookup table로 제거&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;906&quot; data-start=&quot;858&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;870&quot; data-start=&quot;858&quot;&gt;&lt;b&gt;암호 기법&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;906&quot; data-start=&quot;870&quot; data-col-size=&quot;lg&quot;&gt;CKKS (approximate FHE, 실수 연산 지원)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1007&quot; data-start=&quot;907&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;920&quot; data-start=&quot;907&quot;&gt;&lt;b&gt;시스템 구현&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1007&quot; data-start=&quot;920&quot; data-col-size=&quot;lg&quot;&gt;OpenFHE를 확장한 &lt;b&gt;GPU-Accelerated CKKS FHE&lt;/b&gt; 구현 (A100 80GB), bootstrapping 전체 GPU 상 처리&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1062&quot; data-start=&quot;1008&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1020&quot; data-start=&quot;1008&quot;&gt;&lt;b&gt;모델 대상&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1062&quot; data-start=&quot;1020&quot; data-col-size=&quot;lg&quot;&gt;GPT-2 (Small 중심, Medium/Large는 정확도 검증)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1159&quot; data-start=&quot;1063&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1078&quot; data-start=&quot;1063&quot;&gt;&lt;b&gt;모델 수정 방식&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1159&quot; data-start=&quot;1078&quot; data-col-size=&quot;lg&quot;&gt;HuggingFace GPT-2를 포크하여 GeLU, LayerNorm, Softmax, Argmax를 FHE-friendly 근사로 치환&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 59px;&quot; data-end=&quot;1303&quot; data-start=&quot;1160&quot;&gt;
&lt;td style=&quot;height: 59px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1180&quot; data-start=&quot;1160&quot;&gt;&lt;b&gt;Activation 근사&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 59px;&quot; data-end=&quot;1303&quot; data-start=&quot;1180&quot; data-col-size=&quot;lg&quot;&gt;GeLU: 구간별 다항식&lt;br /&gt;LayerNorm: Newton iteration 기반 inverse sqrt&lt;br /&gt;Softmax: Taylor exp + Goldschmidt division + max lookup&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1377&quot; data-start=&quot;1304&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1317&quot; data-start=&quot;1304&quot;&gt;&lt;b&gt;정확도 평가&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1377&quot; data-start=&quot;1317&quot; data-col-size=&quot;lg&quot;&gt;HellaSwag, ARC, PIQA, Social IQA, MNLI, SST-2, ANLI, WiC&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1446&quot; data-start=&quot;1378&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1391&quot; data-start=&quot;1378&quot;&gt;&lt;b&gt;정확도 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1446&quot; data-start=&quot;1391&quot; data-col-size=&quot;lg&quot;&gt;Baseline 대비 &lt;b&gt;경미한 성능 저하 또는 거의 동일&lt;/b&gt; &amp;rarr; LLM의 근사 강건성 확인&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1527&quot; data-start=&quot;1447&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1459&quot; data-start=&quot;1447&quot;&gt;&lt;b&gt;성능 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1527&quot; data-start=&quot;1459&quot; data-col-size=&quot;lg&quot;&gt;GPT-2 Small forward pass 기준 &lt;b&gt;CPU 대비 약 200&amp;times; 속도 향상&lt;/b&gt; (수 시간 &amp;rarr; 수 분)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1590&quot; data-start=&quot;1528&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1551&quot; data-start=&quot;1528&quot;&gt;&lt;b&gt;Bootstrapping 성능&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;1590&quot; data-start=&quot;1551&quot; data-col-size=&quot;lg&quot;&gt;Output level 기준 &lt;b&gt;180~220&amp;times; GPU 가속&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1658&quot; data-start=&quot;1591&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1610&quot; data-start=&quot;1591&quot;&gt;&lt;b&gt;Batching 최적화&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1658&quot; data-start=&quot;1610&quot; data-col-size=&quot;lg&quot;&gt;CKKS slot 활용 극대화를 통해 Softmax/LayerNorm 추가 가속&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1733&quot; data-start=&quot;1659&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1671&quot; data-start=&quot;1659&quot;&gt;&lt;b&gt;위협 모델&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1733&quot; data-start=&quot;1671&quot; data-col-size=&quot;lg&quot;&gt;서버는 honest-but-curious 또는 악의적 가능, 입력&amp;middot;중간값&amp;middot;출력 모두 서버에 노출되지 않음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1790&quot; data-start=&quot;1734&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1744&quot; data-start=&quot;1734&quot;&gt;&lt;b&gt;한계점&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1790&quot; data-start=&quot;1744&quot; data-col-size=&quot;lg&quot;&gt;실시간 챗봇은 아직 비현실적, 고정밀 요구 모델(CV 등)은 비용 급증 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1867&quot; data-start=&quot;1791&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1808&quot; data-start=&quot;1791&quot;&gt;&lt;b&gt;실용 가능 시나리오&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1867&quot; data-start=&quot;1808&quot; data-col-size=&quot;lg&quot;&gt;문서 요약, 내부 보고서 분석, &lt;b&gt;private fine-tuning&lt;/b&gt;, 비실시간 LLM 서비스&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot; data-end=&quot;1990&quot; data-start=&quot;1868&quot;&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1883&quot; data-start=&quot;1868&quot;&gt;&lt;b&gt;핵심 기여 요약&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot; data-end=&quot;1990&quot; data-start=&quot;1883&quot; data-col-size=&quot;lg&quot;&gt;▶ 최초의 공개 GPU-accelerated CKKS 구현&lt;br /&gt;▶ FHE 기반 LLM 추론을 실용 영역으로 이동&lt;br /&gt;▶ privacy-preserving LLM의 현실적 가능성 입증&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;2061&quot; data-start=&quot;1991&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2005&quot; data-start=&quot;1991&quot;&gt;&lt;b&gt;논문의 메시지&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;2061&quot; data-start=&quot;2005&quot; data-col-size=&quot;lg&quot;&gt;&amp;ldquo;FHE 기반 LLM은 불가능한 실험이 아니라, &lt;b&gt;용도 제한 하에서 실용적인 기술&lt;/b&gt;이다.&amp;rdquo;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2411.05034&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2411.05034&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1769447243587&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Eguard: Defending LLM Embeddings Against Inversion Attacks via Text Mutual Information Optimization&quot; data-og-description=&quot;Embeddings have become a cornerstone in the functionality of large language models (LLMs) due to their ability to transform text data into rich, dense numerical representations that capture semantic and syntactic properties. These embedding vector database&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2411.05034&quot; data-og-url=&quot;https://arxiv.org/abs/2411.05034v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/cqEzwA/dJMb8U8N7to/80ELigMMkwOScNuxDBXEuk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/HKd4h/dJMb8WMj2BJ/FYrZSjlusm4gcKmBDvcKKk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2411.05034&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2411.05034&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/cqEzwA/dJMb8U8N7to/80ELigMMkwOScNuxDBXEuk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/HKd4h/dJMb8WMj2BJ/FYrZSjlusm4gcKmBDvcKKk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Eguard: Defending LLM Embeddings Against Inversion Attacks via Text Mutual Information Optimization&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Embeddings have become a cornerstone in the functionality of large language models (LLMs) due to their ability to transform text data into rich, dense numerical representations that capture semantic and syntactic properties. These embedding vector database&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;AAAI 2026에 붙었다네요 ㄷㄷ&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;텍스트 임베딩은 사실상 원문에 준하는 정보를 가지고 있음!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다양한 연구들에서 Embedding Inversion attack이 매우 높은 성공률로 원문을 복원함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;RAG, Vector DB, 장기 메모리 등에서 임베딩이 외부로 노출되는 구조로 프라이버시 리스크가 있음&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 방법들은 embedding을 벡터로만 보고 텍스트, 임베딩, 복원이라는 정보 흐름 전체를 통제하진 못 함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;579&quot; data-origin-height=&quot;555&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/pY0Hw/dJMcaajNCK8/etHgCexEyamAUK62wd9cH0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/pY0Hw/dJMcaajNCK8/etHgCexEyamAUK62wd9cH0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/pY0Hw/dJMcaajNCK8/etHgCexEyamAUK62wd9cH0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FpY0Hw%2FdJMcaajNCK8%2FetHgCexEyamAUK62wd9cH0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;579&quot; height=&quot;555&quot; data-origin-width=&quot;579&quot; data-origin-height=&quot;555&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;embedding과 공격자 사이에 projection network를 삽입해 semantic space를 새로운 functional space로 사상함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1431&quot; data-origin-height=&quot;432&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cld0Ng/dJMcad1Qp8d/BypINcgdRg3YcNVsOsa6Zk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cld0Ng/dJMcad1Qp8d/BypINcgdRg3YcNVsOsa6Zk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cld0Ng/dJMcad1Qp8d/BypINcgdRg3YcNVsOsa6Zk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcld0Ng%2FdJMcad1Qp8d%2FBypINcgdRg3YcNVsOsa6Zk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1431&quot; height=&quot;432&quot; data-origin-width=&quot;1431&quot; data-origin-height=&quot;432&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;원문 x와 보호된 embedding 사이의 통계적 의존성을 제거하는 것을 목표로 Global Mutual Information을 최소화&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그리고 의미 구분을 위해 핵심 키워드를 추출하여 그 것은 구분할 수 있도록 학습&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1827&quot; data-start=&quot;191&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;480&quot; data-start=&quot;329&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;351&quot; data-start=&quot;329&quot;&gt;&lt;b&gt;연구 문제&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;480&quot; data-start=&quot;351&quot; data-col-size=&quot;lg&quot;&gt;텍스트 임베딩이 embedding inversion attack에 취약하여, embedding만으로도 원문 텍스트가 고확률로 복원됨.&lt;br /&gt;기존 noise&amp;middot;DP&amp;middot;adversarial 기반 방어는 프라이버시&amp;ndash;성능 트레이드오프가 심각&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;594&quot; data-start=&quot;481&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;507&quot; data-start=&quot;481&quot;&gt;&lt;b&gt;핵심 관점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;594&quot; data-start=&quot;507&quot; data-col-size=&quot;lg&quot;&gt;Inversion 공격은 &amp;ldquo;복원 모델의 강함&amp;rdquo; 문제가 아니라, &lt;b&gt;원문과 embedding 사이의 정보량(Mutual Information)&lt;/b&gt; 문제&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;654&quot; data-start=&quot;595&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;608&quot; data-start=&quot;595&quot;&gt;&lt;b&gt;공격 모델링&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;654&quot; data-start=&quot;608&quot; data-col-size=&quot;lg&quot;&gt;텍스트 &amp;rarr; 임베딩 &amp;rarr; 복원 텍스트를 &lt;b&gt;Markov Chain&lt;/b&gt;으로 정식화&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;756&quot; data-start=&quot;655&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;669&quot; data-start=&quot;655&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td data-col-size=&quot;lg&quot; data-end=&quot;756&quot; data-start=&quot;669&quot;&gt;Embedding 뒤에 &lt;b&gt;Projection Network&lt;/b&gt;를 추가해, 공격자가 관측하는 embedding과 원문 사이의 &lt;b&gt;정보 흐름을 차단&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;850&quot; data-start=&quot;757&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;769&quot; data-start=&quot;757&quot;&gt;&lt;b&gt;전체 구조&lt;/b&gt;&lt;/td&gt;
&lt;td data-col-size=&quot;lg&quot; data-end=&quot;850&quot; data-start=&quot;769&quot;&gt;x (text) &amp;rarr; e (original embedding) &amp;rarr; &amp;ecirc; (secured embedding) &amp;rarr; downstream task&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;965&quot; data-start=&quot;851&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;875&quot; data-start=&quot;851&quot;&gt;&lt;b&gt;방법론 1 (Global MI)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;965&quot; data-start=&quot;875&quot; data-col-size=&quot;lg&quot;&gt;Autoencoder latent z와 보호된 embedding &amp;ecirc; 사이의 &lt;b&gt;Global Mutual Information 최소화&lt;/b&gt; &amp;rarr; 원문 정보 제거&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1054&quot; data-start=&quot;966&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;989&quot; data-start=&quot;966&quot;&gt;&lt;b&gt;방법론 2 (Local MI)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1054&quot; data-start=&quot;989&quot; data-col-size=&quot;lg&quot;&gt;Keyword&amp;ndash;Antonym 기반 &lt;b&gt;Contrastive Learning&lt;/b&gt;으로 &lt;b&gt;의미 구분 능력 유지&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1122&quot; data-start=&quot;1055&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1070&quot; data-start=&quot;1055&quot;&gt;&lt;b&gt;학습 목표 함수&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1122&quot; data-start=&quot;1070&quot; data-col-size=&quot;lg&quot;&gt;Task Loss + &amp;alpha;&amp;middot;Global MI Loss + &amp;beta;&amp;middot;Local MI Loss&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1207&quot; data-start=&quot;1123&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1136&quot; data-start=&quot;1123&quot;&gt;&lt;b&gt;이론적 근거&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1207&quot; data-start=&quot;1136&quot; data-col-size=&quot;lg&quot;&gt;Data Processing Inequality 기반 Lemma 제시 &amp;rarr; MI 감소 시 inversion 복원 불가 보장&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1282&quot; data-start=&quot;1208&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1233&quot; data-start=&quot;1208&quot;&gt;&lt;b&gt;Projection Network&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1282&quot; data-start=&quot;1233&quot; data-col-size=&quot;lg&quot;&gt;24-layer RoBERTa Transformer (MLP, 얕은 모델은 실패)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1353&quot; data-start=&quot;1283&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1305&quot; data-start=&quot;1283&quot;&gt;&lt;b&gt;방어 성능 (Privacy)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1353&quot; data-start=&quot;1305&quot; data-col-size=&quot;lg&quot;&gt;Token inversion 성공률 &lt;b&gt;&amp;asymp; 4&amp;ndash;5%&lt;/b&gt;, 95% 이상 복원 차단&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1432&quot; data-start=&quot;1354&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1376&quot; data-start=&quot;1354&quot;&gt;&lt;b&gt;성능 유지 (Utility)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1432&quot; data-start=&quot;1376&quot; data-col-size=&quot;lg&quot;&gt;SST, NLI, QR, Summarization에서 &lt;b&gt;원본 대비 98% 이상 성능 유지&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1492&quot; data-start=&quot;1433&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1445&quot; data-start=&quot;1433&quot;&gt;&lt;b&gt;비교 우위&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1492&quot; data-start=&quot;1445&quot; data-col-size=&quot;lg&quot;&gt;DP&amp;middot;FGSM&amp;middot;FreeLB 대비 &lt;b&gt;방어 성능 &amp;uarr; + 다운스트림 성능 유지&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1568&quot; data-start=&quot;1493&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1506&quot; data-start=&quot;1493&quot;&gt;&lt;b&gt;강건성 평가&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1568&quot; data-start=&quot;1506&quot; data-col-size=&quot;lg&quot;&gt;다른 decoder(GPT-2 &amp;rarr; LLaMA, Gemma), 노이즈&amp;middot;양자화&amp;middot;PCA 환경에서도 일관된 방어&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1649&quot; data-start=&quot;1569&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1595&quot; data-start=&quot;1569&quot;&gt;&lt;b&gt;OpenAI Embedding 실험&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1649&quot; data-start=&quot;1595&quot; data-col-size=&quot;lg&quot;&gt;text-embedding-3, ada-002에서도 inversion 성공률 3~5% 수준&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1724&quot; data-start=&quot;1650&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1660&quot; data-start=&quot;1650&quot;&gt;&lt;b&gt;한계점&lt;/b&gt;&lt;/td&gt;
&lt;td data-col-size=&quot;lg&quot; data-end=&quot;1724&quot; data-start=&quot;1660&quot;&gt;Projection network 학습 비용 증가, embedding model 간 전이 시 성능 일부 저하&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1827&quot; data-start=&quot;1725&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1745&quot; data-start=&quot;1725&quot;&gt;&lt;b&gt;결론 (Takeaway)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1827&quot; data-start=&quot;1745&quot; data-col-size=&quot;lg&quot;&gt;Embedding 보호의 본질은 &lt;b&gt;노이즈 추가가 아니라 정보량 통제&lt;/b&gt;이며, Eguard는 MI 기반으로 프라이버시&amp;ndash;유틸리티를 동시에 달성&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1201</guid>
      <comments>https://yoonschallenge.tistory.com/1201#entry1201comment</comments>
      <pubDate>Tue, 27 Jan 2026 02:30:50 +0900</pubDate>
    </item>
    <item>
      <title>Privacy AI 관련 조사 10</title>
      <link>https://yoonschallenge.tistory.com/1200</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://www.sciencedirect.com/science/article/pii/S0004370225000128&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://www.sciencedirect.com/science/article/pii/S0004370225000128&lt;/a&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLM을 블랙박스 API로 호출하는 환경에서 사용자 프롬프트에 포함된 민감정보가 서버에게 노출될 수 있음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이를 줄이기 위해 프롬프트를 랜덤화 하여 보호하는 접근들이 있지만 유용성이 줄어든다!&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;990&quot; data-origin-height=&quot;687&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b3LjgO/dJMcacBVr7L/WqyIc7h1T1qTHKorwxTriK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b3LjgO/dJMcacBVr7L/WqyIc7h1T1qTHKorwxTriK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b3LjgO/dJMcacBVr7L/WqyIc7h1T1qTHKorwxTriK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb3LjgO%2FdJMcacBVr7L%2FWqyIc7h1T1qTHKorwxTriK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;990&quot; height=&quot;687&quot; data-origin-width=&quot;990&quot; data-origin-height=&quot;687&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;프라이버시가 유출되는 것을 볼 수 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;프롬프트를 보호하면서도 프라이버시 노출도와 유틸리티 손실을 동시에 0으로 만들 수 있는가?&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 저자는 이론적으로 불가능한 방향이며 정략적 하한 형태로 제시&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1468&quot; data-origin-height=&quot;579&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bLog3p/dJMcaioAw4F/u8AOQ0yIW7E8Cx4DJ1pai0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bLog3p/dJMcaioAw4F/u8AOQ0yIW7E8Cx4DJ1pai0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bLog3p/dJMcaioAw4F/u8AOQ0yIW7E8Cx4DJ1pai0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbLog3p%2FdJMcaioAw4F%2Fu8AOQ0yIW7E8Cx4DJ1pai0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1468&quot; height=&quot;579&quot; data-origin-width=&quot;1468&quot; data-origin-height=&quot;579&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;client가 원 프롬프트를 만들면 보호 화 방법에 따라 서버에 보냄&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그럼 응답을 보내줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;서버는 보호된 프롬프트를 원문으로 복구하기 위해 공격을 시도함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1290&quot; data-origin-height=&quot;329&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/wx47Q/dJMcah4iK00/A7AgfVwQNVT1KDReALEXhk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/wx47Q/dJMcah4iK00/A7AgfVwQNVT1KDReALEXhk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/wx47Q/dJMcah4iK00/A7AgfVwQNVT1KDReALEXhk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fwx47Q%2FdJMcah4iK00%2FA7AgfVwQNVT1KDReALEXhk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1290&quot; height=&quot;329&quot; data-origin-width=&quot;1290&quot; data-origin-height=&quot;329&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;랜덤화 보호 메커니즘은 토큰 단위 임베딩을 근접 토큰 치환으로 모델링하여 랜덤하게 더해준 벡터값 근처의 토큰 후보를 정한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;서버가 보호된 입력을 보고 복원해도 그 성능이 랜덤 추측 수전에 가까워지면 입실론은 0에 가까워짐&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;3078&quot; data-start=&quot;0&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;210&quot; data-start=&quot;47&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;60&quot; data-start=&quot;47&quot;&gt;한줄 결론&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;183&quot; data-start=&quot;60&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;랜덤화(randomization) 기반 프라이버시 보호 LLM 추론에서는, 프라이버시 누출(&amp;epsilon;ₚ)과 유틸리티 손실(&amp;epsilon;ᵤ)을 동시에 무시할 수준으로 만들 수 없고, 두 값의 가중합이 문제-의존 상수로 하한&lt;/b&gt;된다.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;355&quot; data-start=&quot;211&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;219&quot; data-start=&quot;211&quot;&gt;문제 정의&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;339&quot; data-start=&quot;219&quot; data-col-size=&quot;lg&quot;&gt;블랙박스 LLM(API) 사용 시 프롬프트에 포함된 개인/기업 민감정보가 서버(모델 제공자)에게 노출될 수 있음. &lt;br /&gt;이를 막기 위해 프롬프트를 랜덤화해 의존성을 줄이지만, 그 대가로 성능(유틸리티) 저하가 발생.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;495&quot; data-start=&quot;356&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;365&quot; data-start=&quot;356&quot;&gt;시스템/역할&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;480&quot; data-start=&quot;365&quot; data-col-size=&quot;lg&quot;&gt;클라이언트가 원 프롬프트 d를 보호 메커니즘  으로 변환해 보호 프롬프트 d̃를 서버로 전송, 서버 LLM이 응답 r̃ 생성. &lt;br /&gt;서버는 관찰한 입력(보호된 프롬프트/임베딩)으로 원문 복원을 시도 가능.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;662&quot; data-start=&quot;496&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;504&quot; data-start=&quot;496&quot;&gt;위협 모델&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;654&quot; data-start=&quot;504&quot; data-col-size=&quot;lg&quot;&gt;공격자는 &lt;b&gt;LLM 서버&lt;/b&gt;. 목적: 원 프롬프트 토큰/단어를 최대한 복원. &lt;br /&gt;능력: &lt;b&gt;semi-honest&lt;/b&gt;(정상 추론은 수행하되, 관찰 정보로 프라이버시 추론). &lt;br /&gt;지식: 클라이언트가 랜덤화 보호를 적용함을 인지하고 가용 정보(호스팅 LLM 등)로 공격 수행.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;854&quot; data-start=&quot;663&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;679&quot; data-start=&quot;663&quot;&gt;대표 공격&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;835&quot; data-start=&quot;679&quot; data-col-size=&quot;lg&quot;&gt;(1) &lt;b&gt;Input inference attack&lt;/b&gt;: BERT 마스킹 기반 토큰 복원 &lt;br /&gt;(2) &lt;b&gt;Embedding inversion&lt;/b&gt;: 최근접 이웃으로 원 토큰 추정 &lt;br /&gt;(3) &lt;b&gt;LLM-assisted recovery&lt;/b&gt;: 원격 LLM 자체에 복원 지시를 내려 복원 시도&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;994&quot; data-start=&quot;855&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;872&quot; data-start=&quot;855&quot;&gt;보호 메커니즘( ) 핵심&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;978&quot; data-start=&quot;872&quot; data-col-size=&quot;lg&quot;&gt;블랙박스 API 환경에서는 암호/SMPC 기반 보호가 부적합하므로, 문헌에서 대표적으로 쓰이는 &lt;b&gt;임베딩 랜덤화(노이즈 주입) + 의미적으로 유사한 토큰 치환&lt;/b&gt;을 분석 대상으로 채택.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1133&quot; data-start=&quot;995&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1011&quot; data-start=&quot;995&quot;&gt;랜덤화 절차(토큰 단위)&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;1116&quot; data-start=&quot;1011&quot; data-col-size=&quot;lg&quot;&gt;토큰 d(m) &amp;rarr; 임베딩 w(m)=E(d(m)) &amp;rarr; 노이즈 &amp;delta;로 w̃(m)=w(m)+&amp;delta; &amp;rarr; w̃(m) 근접 후보(인접 리스트)에서 토큰 d̃(m) 선택 &amp;rarr; 모든 토큰 반복해 d̃ 구성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1345&quot; data-start=&quot;1134&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1152&quot; data-start=&quot;1134&quot;&gt;프라이버시 누출 정의(&amp;epsilon;ₚ)&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;1309&quot; data-start=&quot;1152&quot; data-col-size=&quot;lg&quot;&gt;보호 임베딩 분포 P̃와 &amp;ldquo;입력과 독립인 임베딩 분포&amp;rdquo; P̆에 대해, &lt;b&gt;&amp;epsilon;ₚ = R(P̃) &amp;minus; R(P̆)&lt;/b&gt;. &lt;br /&gt;여기서 R(&amp;middot;)은 공격이 복원한 토큰들이 원 토큰과 얼마나 가까운지(반복 공격 포함)를 측정하는 &amp;ldquo;복원 정도&amp;rdquo;의 기댓값. &lt;br /&gt;P̆는 &lt;b&gt;랜덤 추측 베이스라인&lt;/b&gt; 역할.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1499&quot; data-start=&quot;1346&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1363&quot; data-start=&quot;1346&quot;&gt;유틸리티 손실 정의(&amp;epsilon;ᵤ)&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;1482&quot; data-start=&quot;1363&quot; data-col-size=&quot;lg&quot;&gt;원 분포 P 대비 보호 분포 P̃에서의 기대 유틸리티 감소로 &lt;b&gt;&amp;epsilon;ᵤ = U(P) &amp;minus; U(P̃)&lt;/b&gt;. &lt;br /&gt;U(P)=E_{s~P0}E_{w~P}U(w,s)로 테스트 데이터 분포(P0)에 대한 기대 성능을 정의.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1600&quot; data-start=&quot;1500&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1510&quot; data-start=&quot;1500&quot;&gt;목표(최적화)&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;1584&quot; data-start=&quot;1510&quot; data-col-size=&quot;lg&quot;&gt;클라이언트 목표: &lt;b&gt;프라이버시 예산(누출 제약 &amp;xi;) 하에서 유틸리티 손실 최소화&lt;/b&gt;. &lt;br /&gt;즉, min &amp;epsilon;ᵤ s.t. &amp;epsilon;ₚ &amp;le; &amp;xi;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1752&quot; data-start=&quot;1601&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1616&quot; data-start=&quot;1601&quot;&gt;이론 도구(TV 거리)&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;1720&quot; data-start=&quot;1616&quot; data-col-size=&quot;lg&quot;&gt;분포 간 &lt;b&gt;Total Variation(TV) 거리&lt;/b&gt;를 통해 (i) 프라이버시 누출(&amp;epsilon;ₚ)과 (ii) 유틸리티 손실(&amp;epsilon;ᵤ)을 각각 하한으로 연결하고, 이를 결합해 NFL을 도출.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1951&quot; data-start=&quot;1753&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1774&quot; data-start=&quot;1753&quot;&gt;핵심 정리(Theorem 4.4)&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;1924&quot; data-start=&quot;1774&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;(C₂/C₁)&amp;middot;&amp;epsilon;ₚ + &amp;epsilon;ᵤ &amp;ge; C₂&amp;middot;TV(P ∥ P̆)&lt;/b&gt;. &lt;br /&gt;우변 TV(P∥P̆)는 &amp;ldquo;원 임베딩 분포&amp;rdquo;와 &amp;ldquo;입력과 독립인 분포&amp;rdquo; 사이 거리로, 보호 메커니즘과 무관한 문제-의존 상수로 취급.&lt;br /&gt;&amp;rArr; &amp;epsilon;ₚ, &amp;epsilon;ᵤ를 동시에 극소로 만들 수 없음(트레이드오프 필연).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2035&quot; data-start=&quot;1952&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1960&quot; data-start=&quot;1952&quot;&gt;실험 목적&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;2026&quot; data-start=&quot;1960&quot; data-col-size=&quot;lg&quot;&gt;제안한 정의(&amp;epsilon;ₚ, &amp;epsilon;ᵤ)로 &lt;b&gt;실제 랜덤화 기반 기법에서 프라이버시&amp;ndash;유틸리티 트레이드오프가 관측되는지&lt;/b&gt; 검증.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2184&quot; data-start=&quot;2036&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2046&quot; data-start=&quot;2036&quot;&gt;검증 알고리즘&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;2176&quot; data-start=&quot;2046&quot; data-col-size=&quot;lg&quot;&gt;InferDPT를 기반으로 검증: &lt;br /&gt;(1) &lt;b&gt;Perturbation module&lt;/b&gt;(DP 기반 노이즈+인접 리스트로 입력 교란) &lt;br /&gt;(2) &lt;b&gt;Extraction module&lt;/b&gt;(로컬 LLM이 원문+원격 LLM 출력으로 최종 산출)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2363&quot; data-start=&quot;2185&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2193&quot; data-start=&quot;2185&quot;&gt;실험 설정&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;2355&quot; data-start=&quot;2193&quot; data-col-size=&quot;lg&quot;&gt;데이터: &lt;br /&gt;CNN/DailyMail, 입력 50 tokens로 프롬프트 구성 &lt;br /&gt;&amp;rarr; 원격 LLM이 100 tokens 생성. &lt;br /&gt;모델: 원격 GPT-3.5-turbo, 로컬 Vicuna-7b-4bit(temperature 0.5, max_tokens 150). &lt;br /&gt;프라이버시 수준 24단계로 분할.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2552&quot; data-start=&quot;2364&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2382&quot; data-start=&quot;2364&quot;&gt;&amp;epsilon;ₚ(프라이버시) 측정 구현&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;2508&quot; data-start=&quot;2382&quot; data-col-size=&quot;lg&quot;&gt;Def.3.1의 토큰 단위 정합을 블랙박스 응답에 직접 적용하기 어려워, &lt;b&gt;원문 vs 복원문 간 cosine similarity&lt;/b&gt;로 복원 정도를 근사. &lt;br /&gt;랜덤 추측(R(P̆))은 어휘에서 랜덤 토큰을 뽑아 구성해 비교.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2734&quot; data-start=&quot;2553&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2570&quot; data-start=&quot;2553&quot;&gt;&amp;epsilon;ᵤ(유틸리티) 측정 지표&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;2700&quot; data-start=&quot;2570&quot; data-col-size=&quot;lg&quot;&gt;BERTScore, BLEU, Keyword Coverage, Semantic Similarity, Diversity, Coherence, ROUGE-1/2/L 등 오픈엔드 생성 지표로 U(P), U(P̃) 산출 후 &amp;epsilon;ᵤ 계산.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2865&quot; data-start=&quot;2735&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2743&quot; data-start=&quot;2735&quot;&gt;결과 요약&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;2845&quot; data-start=&quot;2743&quot; data-col-size=&quot;lg&quot;&gt;프라이버시 예산/노이즈 강도에 따라 &lt;b&gt;&amp;epsilon;ₚ와 &amp;epsilon;ᵤ가 반대 방향으로 변화&lt;/b&gt;하는 트레이드오프 곡선을 관찰(Fig.4~5). 24개 설정점에서 &amp;ldquo;누출&amp;uarr; &amp;harr; 손실&amp;darr;&amp;rdquo; 관계를 시각화.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;3078&quot; data-start=&quot;2866&quot;&gt;
&lt;td style=&quot;width: 12.093%;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2882&quot; data-start=&quot;2866&quot;&gt;한계/주의점(논문 언급)&lt;/td&gt;
&lt;td style=&quot;width: 87.7907%;&quot; data-end=&quot;3048&quot; data-start=&quot;2882&quot; data-col-size=&quot;lg&quot;&gt;(1) 복원 측정에서 &amp;ldquo;전용 iterative recovery 알고리즘&amp;rdquo; 대신 &lt;b&gt;원격 LLM에 복원 지시&lt;/b&gt;를 주는 방식 사용 &amp;rarr; 더 강한 복원 알고리즘이면 누출 측정이 달라질 수 있음을 언급. (2) InferDPT 자체도 로컬 LLM/프롬프트 설계 및 하드웨어 자원 요구 등 제약 존재.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.privatenlp-1.4/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2024.privatenlp-1.4/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1769422858251&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Protecting Privacy in Classifiers by Token Manipulation&quot; data-og-description=&quot;Re&amp;rsquo;em Harel, Yair Elboher, Yuval Pinter. Proceedings of the Fifth Workshop on Privacy in Natural Language Processing. 2024.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2024.privatenlp-1.4/&quot; data-og-url=&quot;https://aclanthology.org/2024.privatenlp-1.4/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/JIDaV/dJMb9jgrEp4/4C5fNnEpU0OvvDmznILerk/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.privatenlp-1.4/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2024.privatenlp-1.4/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/JIDaV/dJMb9jgrEp4/4C5fNnEpU0OvvDmznILerk/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Protecting Privacy in Classifiers by Token Manipulation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Re&amp;rsquo;em Harel, Yair Elboher, Yuval Pinter. Proceedings of the Fifth Workshop on Privacy in Natural Language Processing. 2024.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;프라이버시 워크숍에 나온 논문입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLM API 서비스는 입력 텍스트 자체가 프라이버시 위험이 됨&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 프라이버시 보호 기법들은 대부분 embedding 단계에서 노이즈를 추가하여 서버 모델 파라미터 접근을 가정하고, 사용자 단말에 연산 및 메모리 부담을 주고, embedding inversion attack에 취약하다&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;591&quot; data-origin-height=&quot;494&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/UPGNm/dJMcagRRrDD/a3Holnowy70skKqBl26GPK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/UPGNm/dJMcagRRrDD/a3Holnowy70skKqBl26GPK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/UPGNm/dJMcagRRrDD/a3Holnowy70skKqBl26GPK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FUPGNm%2FdJMcagRRrDD%2Fa3Holnowy70skKqBl26GPK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;591&quot; height=&quot;494&quot; data-origin-width=&quot;591&quot; data-origin-height=&quot;494&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이렇게 진행되면 연산 과정도 많아서 힘들다!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 연구는 B 수준에서 진행한다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1214&quot; data-origin-height=&quot;602&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/2nr83/dJMcafZHkU7/lk8cRDfe9x7TfdZbcRmwsk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/2nr83/dJMcafZHkU7/lk8cRDfe9x7TfdZbcRmwsk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/2nr83/dJMcafZHkU7/lk8cRDfe9x7TfdZbcRmwsk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F2nr83%2FdJMcafZHkU7%2Flk8cRDfe9x7TfdZbcRmwsk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1214&quot; height=&quot;602&quot; data-origin-width=&quot;1214&quot; data-origin-height=&quot;602&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순 토큰 매핑은 공격자에게 조금 귀찮을 뿐 복원 가능함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;주변 토큰을 가중합하여 가장 가까운 새로운 토큰을 고르며, 원래 토큰은 나오지 않도록 강제함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순 노이즈 방식은 성능 유지할 수 있겠지만 nearest-neighbor 공격에 극도로 취약하지만 위 방식은 성능 소폭 감소에 복원 난이도가 급격히 증가함&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1513&quot; data-start=&quot;159&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;328&quot; data-start=&quot;253&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;265&quot; data-start=&quot;253&quot;&gt;&lt;b&gt;문제 정의&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;328&quot; data-start=&quot;265&quot; data-col-size=&quot;md&quot;&gt;LLM을 원격 서비스로 사용할 때 입력 텍스트가 서버&amp;middot;중간자에게 그대로 노출되어 프라이버시 침해 위험 발생&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;453&quot; data-start=&quot;329&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;344&quot; data-start=&quot;329&quot;&gt;&lt;b&gt;기존 접근 한계&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;453&quot; data-start=&quot;344&quot; data-col-size=&quot;md&quot;&gt;(1) embedding/encoder 단계 노이즈 방식은 서버 파라미터 접근 가정 필요&lt;br /&gt;(2) 사용자 단말 계산 비용 큼&lt;br /&gt;(3) embedding inversion 공격에 취약&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;560&quot; data-start=&quot;454&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;468&quot; data-start=&quot;454&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;560&quot; data-start=&quot;468&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;모델 내부를 건드리지 않고, 토큰 시퀀스 자체를 조작(token-level privatization)&lt;/b&gt; 하여 원문 복원을 어렵게 만들면서 분류 성능 유지&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;634&quot; data-start=&quot;561&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;579&quot; data-start=&quot;561&quot;&gt;&lt;b&gt;프라이버시 적용 지점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;634&quot; data-start=&quot;579&quot; data-col-size=&quot;md&quot;&gt;Token Privatization (Tokenizer 이후, Embedding 이전 단계)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;745&quot; data-start=&quot;635&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;678&quot; data-start=&quot;635&quot;&gt;&lt;b&gt;방법 1: Lossy Token Mapping (Baseline)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;745&quot; data-start=&quot;678&quot; data-col-size=&quot;md&quot;&gt;vocabulary를 2~3개 토큰 묶음으로 나누어 many-to-one 치환 (랜덤 / 고빈도 / 저빈도 기준)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;821&quot; data-start=&quot;746&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;764&quot; data-start=&quot;746&quot;&gt;&lt;b&gt;Baseline 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;821&quot; data-start=&quot;764&quot; data-col-size=&quot;md&quot;&gt;구현은 단순하나 분류 성능 저하 발생, &lt;b&gt;LLM 기반 확률적 복원 공격에 쉽게 역추적 가능&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;922&quot; data-start=&quot;822&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;850&quot; data-start=&quot;822&quot;&gt;&lt;b&gt;방법 2: STENCIL&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;922&quot; data-start=&quot;850&quot; data-col-size=&quot;md&quot;&gt;주변 문맥(window) 토큰 임베딩을 가중합해 quasi-embedding 생성 후, 가장 가까운 다른 토큰으로 치환&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1002&quot; data-start=&quot;923&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;943&quot; data-start=&quot;923&quot;&gt;&lt;b&gt;STENCIL 핵심 특징&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1002&quot; data-start=&quot;943&quot; data-col-size=&quot;md&quot;&gt;(1) 문맥 정보 유지&lt;br /&gt;(2) 원 토큰 직접 노출 차단&lt;br /&gt;(3) 모델 파라미터 접근 불필요&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1070&quot; data-start=&quot;1003&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1021&quot; data-start=&quot;1003&quot;&gt;&lt;b&gt;STENCILp 변형&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1070&quot; data-start=&quot;1021&quot; data-col-size=&quot;md&quot;&gt;중심 토큰 가중치 제거 &amp;rarr; 성능 일부 감소 대신 &lt;b&gt;토큰 복원 공격 완전 차단&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1135&quot; data-start=&quot;1071&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1085&quot; data-start=&quot;1071&quot;&gt;&lt;b&gt;실험 데이터셋&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1135&quot; data-start=&quot;1085&quot; data-col-size=&quot;md&quot;&gt;SST-2, IMDb (분류), QNLI (encoder&amp;ndash;decoder 기반 분류)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1217&quot; data-start=&quot;1136&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1148&quot; data-start=&quot;1136&quot;&gt;&lt;b&gt;성능 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1217&quot; data-start=&quot;1148&quot; data-col-size=&quot;md&quot;&gt;STENCIL은 noise-based embedding perturbation 대비 &lt;b&gt;성능&amp;ndash;프라이버시 균형 우수&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1312&quot; data-start=&quot;1218&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1233&quot; data-start=&quot;1218&quot;&gt;&lt;b&gt;복원 공격 평가&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1312&quot; data-start=&quot;1233&quot; data-col-size=&quot;md&quot;&gt;Baseline 및 Noise 방식은 nearest-neighbor / LLM 공격에 취약&lt;br /&gt;STENCIL은 복원 성공률 크게 감소&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1380&quot; data-start=&quot;1313&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1325&quot; data-start=&quot;1313&quot;&gt;&lt;b&gt;핵심 결론&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1380&quot; data-start=&quot;1325&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;단순 토큰 치환은 불충분하며, 문맥 인지적 토큰 조작이 현실적인 프라이버시 보호 해법&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1425&quot; data-start=&quot;1381&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1390&quot; data-start=&quot;1381&quot;&gt;&lt;b&gt;의의&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1425&quot; data-start=&quot;1390&quot; data-col-size=&quot;md&quot;&gt;입력 텍스트 보호를 토큰 수준에서 달성 가능한 방향 제시&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1513&quot; data-start=&quot;1426&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1443&quot; data-start=&quot;1426&quot;&gt;&lt;b&gt;한계 및 향후 과제&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1513&quot; data-start=&quot;1443&quot; data-col-size=&quot;md&quot;&gt;(1) 문장 길이 정보는 그대로 노출&lt;br /&gt;(2) 분류 태스크&amp;middot;영어 한정 실험&lt;br /&gt;(3) 생성 모델&amp;middot;다국어 확장 필요&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2510.05699&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2510.05699&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1769430192615&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Membership Inference Attacks on Tokenizers of Large Language Models&quot; data-og-description=&quot;Membership inference attacks (MIAs) are widely used to assess the privacy risks associated with machine learning models. However, when these attacks are applied to pre-trained large language models (LLMs), they encounter significant challenges, including m&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2510.05699&quot; data-og-url=&quot;https://arxiv.org/abs/2510.05699v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bLZzh2/dJMb86nRZ62/DO1bkIMCFkoHMUebEqGkfk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bgwP3n/dJMb87NQNjy/RgHzoZgtXPAV9crUXkNsOk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2510.05699&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2510.05699&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bLZzh2/dJMb86nRZ62/DO1bkIMCFkoHMUebEqGkfk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bgwP3n/dJMb87NQNjy/RgHzoZgtXPAV9crUXkNsOk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Membership Inference Attacks on Tokenizers of Large Language Models&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Membership inference attacks (MIAs) are widely used to assess the privacy risks associated with machine learning models. However, when these attacks are applied to pre-trained large language models (LLMs), they encounter significant challenges, including m&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 MIA는 LLM의 출력을 공격으로 사용하지만 실제 상용 llm을 scratch부터 재학습하기 어렵고, 평가 모델과 실 모델의 크기 불일치, 학습 데이터의 차이가 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLM말고 더 단순하고 재현 가능한 구성요소를 공격 벡터로 삼을 수 없나?&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1242&quot; data-origin-height=&quot;521&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bjlT63/dJMcagj1gCp/oU3UUc3jfouRFi1bkmGMp0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bjlT63/dJMcagj1gCp/oU3UUc3jfouRFi1bkmGMp0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bjlT63/dJMcagj1gCp/oU3UUc3jfouRFi1bkmGMp0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbjlT63%2FdJMcagj1gCp%2FoU3UUc3jfouRFi1bkmGMp0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1242&quot; height=&quot;521&quot; data-origin-width=&quot;1242&quot; data-origin-height=&quot;521&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;데이터도, 학습도 다 다르다!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토크나이저를 공격 벡터로 써서 진행해보자&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토크나이저는 LLM 사전학습 데이터와 동일한 데이터 분포로 학습되고, BPE 기반은 학습 과정이 단순하고 재현 가능 함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;619&quot; data-origin-height=&quot;624&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/V566u/dJMcacon1Ui/4utPNfqbZda8KXS4RSKNSk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/V566u/dJMcacon1Ui/4utPNfqbZda8KXS4RSKNSk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/V566u/dJMcacon1Ui/4utPNfqbZda8KXS4RSKNSk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FV566u%2FdJMcacon1Ui%2F4utPNfqbZda8KXS4RSKNSk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;619&quot; height=&quot;624&quot; data-origin-width=&quot;619&quot; data-origin-height=&quot;624&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;노크나이저는 특정 데이터셋에만 등장하는 희귀한 토큰이 vocab에 직접 포함되기에 이 토큰들의 존재 여부와, merge 순서, 빈도 특성이 특정 데이터 셋이 해당되었는지를 파악할 수 있게 해줌&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1173&quot; data-origin-height=&quot;608&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/B4TYU/dJMcag5ozLm/K36IM5zHmngVSL9Eau3sck/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/B4TYU/dJMcag5ozLm/K36IM5zHmngVSL9Eau3sck/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/B4TYU/dJMcag5ozLm/K36IM5zHmngVSL9Eau3sck/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FB4TYU%2FdJMcag5ozLm%2FK36IM5zHmngVSL9Eau3sck%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1173&quot; height=&quot;608&quot; data-origin-width=&quot;1173&quot; data-origin-height=&quot;608&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;특정 데이터 셋 포함, 미포함시 vocabulary차이를 비교해서 특이 토큰 집합을 멤버쉽 시그널로 확인할 수 있음&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1479&quot; data-start=&quot;230&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;365&quot; data-start=&quot;252&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;264&quot; data-start=&quot;252&quot;&gt;&lt;b&gt;연구 배경&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;365&quot; data-start=&quot;264&quot; data-col-size=&quot;md&quot;&gt;기존 LLM 대상 Membership Inference Attack(MIA)은 모델 재학습 불가, 모델 크기 불일치, 데이터 접근 제약으로 &lt;b&gt;현실적&amp;middot;정량적 평가가 어려움&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;441&quot; data-start=&quot;366&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;380&quot; data-start=&quot;366&quot;&gt;&lt;b&gt;핵심 문제의식&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;441&quot; data-start=&quot;380&quot; data-col-size=&quot;md&quot;&gt;LLM 본체가 아닌, 더 단순하고 재현 가능한 구성요소에서도 학습 데이터 멤버십 누출이 발생하는가?&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;537&quot; data-start=&quot;442&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;456&quot; data-start=&quot;442&quot;&gt;&lt;b&gt;주요 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;537&quot; data-start=&quot;456&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;Tokenizer를 새로운 MIA 공격 대상&lt;/b&gt;으로 설정. &lt;br /&gt;Tokenizer는 LLM과 동일한 데이터 분포로 학습되며, 공개&amp;middot;재현 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;597&quot; data-start=&quot;538&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;550&quot; data-start=&quot;538&quot;&gt;&lt;b&gt;공격 대상&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;597&quot; data-start=&quot;550&quot; data-col-size=&quot;md&quot;&gt;BPE 기반 Tokenizer의 &lt;b&gt;Vocabulary 및 merge 구조&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;705&quot; data-start=&quot;598&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;610&quot; data-start=&quot;598&quot;&gt;&lt;b&gt;핵심 관찰&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;705&quot; data-start=&quot;610&quot; data-col-size=&quot;md&quot;&gt;Tokenizer는 특정 데이터셋에만 등장하는 &lt;b&gt;distinctive token&lt;/b&gt;을 vocabulary에 직접 보존 &amp;rarr; 학습 데이터의 fingerprint 역할&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;824&quot; data-start=&quot;706&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;720&quot; data-start=&quot;706&quot;&gt;&lt;b&gt;제안 공격 1&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;824&quot; data-start=&quot;720&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;Vocabulary Overlap MIA&lt;/b&gt;: target dataset 포함/미포함 shadow tokenizer 간 vocabulary 겹침 정도로 membership 추론&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;927&quot; data-start=&quot;825&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;839&quot; data-start=&quot;825&quot;&gt;&lt;b&gt;제안 공격 2&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;927&quot; data-start=&quot;839&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;Frequency Estimation MIA (RTF-SI)&lt;/b&gt;: token merge 순서 &amp;harr; 빈도 분포(power-law)를 이용한 효율적 추론&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1009&quot; data-start=&quot;928&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;940&quot; data-start=&quot;928&quot;&gt;&lt;b&gt;공격 성능&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1009&quot; data-start=&quot;940&quot; data-col-size=&quot;md&quot;&gt;Vocabulary 200k 기준 AUC &amp;asymp; &lt;b&gt;0.74~0.77&lt;/b&gt;, 대규모 데이터셋에서는 &lt;b&gt;AUC 0.88+&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1084&quot; data-start=&quot;1010&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1025&quot; data-start=&quot;1010&quot;&gt;&lt;b&gt;핵심 실험 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1084&quot; data-start=&quot;1025&quot; data-col-size=&quot;md&quot;&gt;(1) Vocabulary가 클수록 MIA 성능 &amp;uarr; (2) 데이터셋 규모가 클수록 공격 성공률 &amp;uarr;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1161&quot; data-start=&quot;1085&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1098&quot; data-start=&quot;1085&quot;&gt;&lt;b&gt;중요한 발견&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1161&quot; data-start=&quot;1098&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;Tokenizer 품질(압축 효율) 향상 = 프라이버시 위험 증가&lt;/b&gt;라는 새로운 trade-off 규명&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1252&quot; data-start=&quot;1162&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1177&quot; data-start=&quot;1162&quot;&gt;&lt;b&gt;방어 기법 실험&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1252&quot; data-start=&quot;1177&quot; data-col-size=&quot;md&quot;&gt;Min-count filtering, DP-BPE 적용 &amp;rarr; MIA 성능 감소 가능하나 &lt;b&gt;Tokenizer 효율 손실 불가피&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1340&quot; data-start=&quot;1253&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1265&quot; data-start=&quot;1253&quot;&gt;&lt;b&gt;핵심 결론&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1340&quot; data-start=&quot;1265&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;프라이버시 누출은 LLM 이전 단계(Tokenizer)에서 이미 발생&lt;/b&gt;하며, Tokenizer는 중립적 전처리 도구가 아님&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1408&quot; data-start=&quot;1341&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1354&quot; data-start=&quot;1341&quot;&gt;&lt;b&gt;연구적 의의&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1408&quot; data-start=&quot;1354&quot; data-col-size=&quot;md&quot;&gt;LLM 프라이버시 위협 모델을 &lt;b&gt;Tokenizer 수준까지 확장&lt;/b&gt;한 최초의 체계적 분석&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1479&quot; data-start=&quot;1409&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1423&quot; data-start=&quot;1409&quot;&gt;&lt;b&gt;실무적 시사점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1479&quot; data-start=&quot;1423&quot; data-col-size=&quot;md&quot;&gt;Tokenizer 공개 자체가 데이터 소유권&amp;middot;프라이버시 분쟁의 직접적 공격 벡터가 될 수 있음&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1200</guid>
      <comments>https://yoonschallenge.tistory.com/1200#entry1200comment</comments>
      <pubDate>Mon, 26 Jan 2026 21:33:41 +0900</pubDate>
    </item>
    <item>
      <title>Privacy AI 관련 조사 9</title>
      <link>https://yoonschallenge.tistory.com/1199</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.naacl-long.614/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2025.naacl-long.614/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768882927026&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;EmojiPrompt: Generative Prompt Obfuscation for Privacy-Preserving Communication with Cloud-based LLMs&quot; data-og-description=&quot;Sam Lin, Wenyue Hua, Zhenting Wang, Mingyu Jin, Lizhou Fan, Yongfeng Zhang. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers). 202&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2025.naacl-long.614/&quot; data-og-url=&quot;https://aclanthology.org/2025.naacl-long.614/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/c2lM3X/dJMb8TB3o7H/9LLVDsefdIjti5kLTqhF5K/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.naacl-long.614/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2025.naacl-long.614/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/c2lM3X/dJMb8TB3o7H/9LLVDsefdIjti5kLTqhF5K/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;EmojiPrompt: Generative Prompt Obfuscation for Privacy-Preserving Communication with Cloud-based LLMs&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Sam Lin, Wenyue Hua, Zhenting Wang, Mingyu Jin, Lizhou Fan, Yongfeng Zhang. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers). 202&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;naacl 2025에 붙었네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;클라우드 기반 LLM 사용 시 프롬프트 자체가 심각하게 프라이버시 위협이다!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 암호화나 DP 기반 방법은 모델 파라미터 접근이 필요하고, 로컬 LLM이나 고비용 연산이 요구되며 실제 클라우드 LLM API 환경에 적용이 어렵다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 클라우드 LLM을 그대로 쓰면서도 프롬프트 내용만 안전하게 숨길 수 있는 방법이 필요함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;==&amp;gt; 자연어 프롬프트를 의미는 유지하되 사람이 읽을 수 없는 비자연어(이모지, 기호, 연산자)로 LLM이 변환하도록 하자&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1119&quot; data-origin-height=&quot;681&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Cp36J/dJMcab3125t/eYj87FUjE9UhGaTMqJ1pL1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Cp36J/dJMcab3125t/eYj87FUjE9UhGaTMqJ1pL1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Cp36J/dJMcab3125t/eYj87FUjE9UhGaTMqJ1pL1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FCp36J%2FdJMcab3125t%2FeYj87FUjE9UhGaTMqJ1pL1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1119&quot; height=&quot;681&quot; data-origin-width=&quot;1119&quot; data-origin-height=&quot;681&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;난독화&amp;nbsp;&lt;br /&gt;LLMO (obfuscation LLM) -&amp;gt; 사용자 입력 x를 이모지, 기호, 축약 토큰, 연산자 등으로 변환해 x' = LLMO(o, x)&lt;br /&gt;LLMI (Inference LLM) -&amp;gt; 난독화된 입력 x'만 보고 추천, 분류, QA, 요약 등 inference 진행&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모델 가중치 없이, 로컬 모델 없이, 암호화 연산 없이 텍스트 변환 만으로 프라이버시 보호를 완성해냄&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;813&quot; data-origin-height=&quot;782&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/W75hW/dJMcafFnfra/pnsbnMZTrkvzvGlkVgLqm0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/W75hW/dJMcafFnfra/pnsbnMZTrkvzvGlkVgLqm0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/W75hW/dJMcafFnfra/pnsbnMZTrkvzvGlkVgLqm0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FW75hW%2FdJMcafFnfra%2FpnsbnMZTrkvzvGlkVgLqm0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;813&quot; height=&quot;782&quot; data-origin-width=&quot;813&quot; data-origin-height=&quot;782&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;영화 리뷰에 대해 어떻게 EmojiPrompt가 프라이버시를 보호하면서도 추론 성능을 유지하는지 단계적으로 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Original Text는 자연어 영화 리뷰 전체가 그대로 존재하며 영화 취향, 평가 관점, 추천 영화, 개인적 선호가 그대로 존재하여 클라우드 LLM에 전달되면 완전 노출됨&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;obfuscated Text는 리뷰 전체를 그대로 바꾸지 않고 의미 단위를 이모지 + 기호 + 축약 토큰으로 변환하여 자연어 문장 구조는 붕괴되어 사람 기준 가독성은 0으로 만들지만 의미는 보존하였음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Obfuscated Prompt로 프롬프트가 만들어지고, 테스크를 지시하게 된다. 그 후 Inference를 통해 positive라는 결과가 나온다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Obfuscation Explanation - 이모지에 대한 설명으로 LLM에 제공되지는 않고 해석 가능성을 위해만 존재&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;공격자가 obfuscated Text만 보고 원문 복원을 시도해도 매우 그럴듯한 다른 리뷰가 생성되고, 원문과 표면적, 구조적, 의미적 불일치가 일어나 의미는 남지만 원문은 복원되지 않음을 의미&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1355&quot; data-origin-height=&quot;524&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bD9Fip/dJMcahiTgyo/xwmangvFWGoppTKppuZqF0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bD9Fip/dJMcahiTgyo/xwmangvFWGoppTKppuZqF0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bD9Fip/dJMcahiTgyo/xwmangvFWGoppTKppuZqF0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbD9Fip%2FdJMcahiTgyo%2FxwmangvFWGoppTKppuZqF0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1355&quot; height=&quot;524&quot; data-origin-width=&quot;1355&quot; data-origin-height=&quot;524&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;반복적으로 등장하는 구조화 엔티티를 통해 한 번 난독화하면 계속 재사용 함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;브랜드도 날려버림. 기능적 의미만 보호함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1445&quot; data-origin-height=&quot;458&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b0c93q/dJMcacBSQfH/ytJScBOBvlTUeYRH7y99Q1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b0c93q/dJMcacBSQfH/ytJScBOBvlTUeYRH7y99Q1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b0c93q/dJMcacBSQfH/ytJScBOBvlTUeYRH7y99Q1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb0c93q%2FdJMcacBSQfH%2FytJScBOBvlTUeYRH7y99Q1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1445&quot; height=&quot;458&quot; data-origin-width=&quot;1445&quot; data-origin-height=&quot;458&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;난독화 이후 성능이 유지되거나 오히려 오르는 경우도 존재함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 Split-N-Denoise, InferDPT, TokEmbPriv 대비 동등하거나 우수한 성능을 보이고, 복원 공격에 더 강함&amp;nbsp;&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1834&quot; data-start=&quot;204&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;379&quot; data-start=&quot;226&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;248&quot; data-start=&quot;226&quot;&gt;&lt;b&gt;문제 정의&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;379&quot; data-start=&quot;248&quot; data-col-size=&quot;lg&quot;&gt;클라우드 기반 LLM 사용 시, &lt;b&gt;프롬프트 원문이 서버&amp;middot;외부 공격(jailbreak, 로그 유출)에 그대로 노출&lt;/b&gt;되어 사용자 프라이버시가 침해됨. 기존 HE/DP/MPC는 &lt;b&gt;모델 접근&amp;middot;로컬 연산 요구&lt;/b&gt;로 실사용이 어려움.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;514&quot; data-start=&quot;380&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;405&quot; data-start=&quot;380&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;514&quot; data-start=&quot;405&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;자연어 프롬프트를 의미는 유지하되 사람이 읽기 어려운 비자연 언어(이모지&amp;middot;기호&amp;middot;연산자)&lt;/b&gt;로 LLM이 직접 변환하도록 하는 &lt;b&gt;Generative Prompt Obfuscation&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;648&quot; data-start=&quot;515&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;539&quot; data-start=&quot;515&quot;&gt;&lt;b&gt;전체 구조&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;648&quot; data-start=&quot;539&quot; data-col-size=&quot;lg&quot;&gt;2-LLM 구조: &lt;b&gt;LLMO&lt;/b&gt;(Obfuscation LLM)가 입력&lt;span&gt;&lt;span&gt;x&lt;/span&gt;&lt;/span&gt; &amp;rarr; 난독화 &lt;span&gt;&lt;span&gt;x&amp;prime;&lt;/span&gt;&lt;/span&gt;&amp;nbsp;생성, &lt;b&gt;LLMI&lt;/b&gt;(Inference LLM)는 &lt;span&gt;&lt;span&gt;x&amp;prime;&lt;/span&gt;&lt;/span&gt;만 보고 추론 수행.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;764&quot; data-start=&quot;649&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;663&quot; data-start=&quot;649&quot;&gt;&lt;b&gt;핵심 설계 ①&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;764&quot; data-start=&quot;663&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Atomic-level Obfuscation&lt;/b&gt;: 프라이버시 노출을 막기 위해 입력을 &lt;b&gt;의미 최소 단위로 분해 후 개별 난독화&lt;/b&gt;. LLMO조차 전체 원문을 보지 못함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;859&quot; data-start=&quot;765&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;792&quot; data-start=&quot;765&quot;&gt;&lt;b&gt;Reusable Obfuscation&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;859&quot; data-start=&quot;792&quot; data-col-size=&quot;lg&quot;&gt;상품명&amp;middot;테이블 feature 등 &lt;b&gt;반복 엔티티&lt;/b&gt;를 한 번 난독화 후 재사용 (추천&amp;middot;의료&amp;middot;금융 데이터에 적합).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;943&quot; data-start=&quot;860&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;891&quot; data-start=&quot;860&quot;&gt;&lt;b&gt;Non-Reusable Obfuscation&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;943&quot; data-start=&quot;891&quot; data-col-size=&quot;lg&quot;&gt;리뷰&amp;middot;이메일 등 &lt;b&gt;자유 텍스트&lt;/b&gt;를 clause 단위로 분해&amp;middot;셔플&amp;middot;난독화 후 재조합.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1050&quot; data-start=&quot;944&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;963&quot; data-start=&quot;944&quot;&gt;&lt;b&gt;핵심 설계 ②&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1050&quot; data-start=&quot;963&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Semantic Alignment Constraint&lt;/b&gt;: 인접 텍스트의 난독화 결과도 의미 유사도(BERTScore 비율) 유지 &lt;br /&gt;&amp;rarr; 성능 보존.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1156&quot; data-start=&quot;1051&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1070&quot; data-start=&quot;1051&quot;&gt;&lt;b&gt;핵심 설계 ③&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1156&quot; data-start=&quot;1070&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;LDP Post-sampling&lt;/b&gt;: 하나의 입력에 대해 &lt;b&gt;여러 난독화 후보를 생성 후 확률적으로 샘플링&lt;/b&gt; &lt;br /&gt;&amp;rarr; 분포&amp;middot;통계 기반 역추론 방지.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1254&quot; data-start=&quot;1157&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1172&quot; data-start=&quot;1157&quot;&gt;&lt;b&gt;프라이버시 관점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1254&quot; data-start=&quot;1172&quot; data-col-size=&quot;lg&quot;&gt;개인 식별자&amp;middot;문장 구조&amp;middot;브랜드&amp;middot;고유명사는 제거/붕괴, &lt;b&gt;추론에 필요한 통계적&amp;middot;의미적 정보만 보존&lt;/b&gt; (비식별화가 아니라 &lt;b&gt;비연결화&lt;/b&gt;).&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1352&quot; data-start=&quot;1255&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1267&quot; data-start=&quot;1255&quot;&gt;&lt;b&gt;실험 설정&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1352&quot; data-start=&quot;1267&quot; data-col-size=&quot;lg&quot;&gt;8개 도메인(추천, 감정분석, 스팸, 의료, 금융, 독해, 요약 등), GPT-4 / Gemini / LLaMA 등 &lt;b&gt;API-only 환경&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1450&quot; data-start=&quot;1353&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1365&quot; data-start=&quot;1353&quot;&gt;&lt;b&gt;주요 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1450&quot; data-start=&quot;1365&quot; data-col-size=&quot;lg&quot;&gt;난독화 후에도 &lt;b&gt;성능 유지 또는 일부 향상&lt;/b&gt;, 기존 프롬프트 프라이버시 기법(SnD, InferDPT, TEP) 대비 &lt;b&gt;동등 이상 성능&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1547&quot; data-start=&quot;1451&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1466&quot; data-start=&quot;1451&quot;&gt;&lt;b&gt;복원 공격 평가&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1547&quot; data-start=&quot;1466&quot; data-col-size=&quot;lg&quot;&gt;LLM&amp;middot;인간 공격 모두에서 &lt;b&gt;원문 복원 실패&lt;/b&gt;. 의미는 남지만 원문과의 &lt;b&gt;semantic/lexical overlap 크게 감소&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1627&quot; data-start=&quot;1548&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1569&quot; data-start=&quot;1548&quot;&gt;&lt;b&gt;장점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1627&quot; data-start=&quot;1569&quot; data-col-size=&quot;lg&quot;&gt;모델 가중치 접근 불필요, 로컬 연산 없음, 완전 클라우드 친화적, 다양한 LLM에 일반화 가능.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1729&quot; data-start=&quot;1628&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1651&quot; data-start=&quot;1628&quot;&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1729&quot; data-start=&quot;1651&quot; data-col-size=&quot;lg&quot;&gt;이모지/기호 어휘 제한, LLM hallucination 가능성, &lt;b&gt;attribute inference 위험은 완전 제거 불가&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1834&quot; data-start=&quot;1730&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1754&quot; data-start=&quot;1730&quot;&gt;&lt;b&gt;핵심 메시지&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1834&quot; data-start=&quot;1754&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;LLM은 자연어가 아니라 &amp;lsquo;의미 구조&amp;rsquo;를 이해한다&lt;/b&gt; &amp;rarr; 프라이버시는 암호화 이전, &lt;b&gt;언어 표현 레벨에서 실용적으로 보호 가능&lt;/b&gt;.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.emnlp-main.1165/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2025.emnlp-main.1165/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768889658194&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Exploring the Hidden Capacity of LLMs for One-Step Text Generation&quot; data-og-description=&quot;Gleb Mezentsev, Ivan Oseledets. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing. 2025.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2025.emnlp-main.1165/&quot; data-og-url=&quot;https://aclanthology.org/2025.emnlp-main.1165/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/vQdxb/dJMb8Zvviwr/k0Z32oyKLdf3d9fK3qkDn1/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.emnlp-main.1165/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2025.emnlp-main.1165/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/vQdxb/dJMb8Zvviwr/k0Z32oyKLdf3d9fK3qkDn1/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Exploring the Hidden Capacity of LLMs for One-Step Text Generation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Gleb Mezentsev, Ivan Oseledets. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing. 2025.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 LLM의 Autoregressive decoding 구조로 인해 추론 지연, 병렬화 한계, long-context의 문제가 있었음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 병렬/다중 토큰 생성 연구는 추가 모델, 대규모 파인튜닝, 아키텍처 재설계가 요구됨&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 이미 Autoregressive로 학습된 frozen LLM이 추가 학습 없이도 한 번의 forward pass로 여러 토큰을 정확히 생성할 수 있는가!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;==&amp;gt; Frozen LLM에 단 2개의 학습 가능한 입력 임베딩만 주어도 수백기의 토큰을 한 번의 forward pass로 정확히 복원할 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;781&quot; data-origin-height=&quot;647&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/buL5Yt/dJMcaiWmwxs/QPYk8hdQXNYVZHYuBtIJ40/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/buL5Yt/dJMcaiWmwxs/QPYk8hdQXNYVZHYuBtIJ40/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/buL5Yt/dJMcaiWmwxs/QPYk8hdQXNYVZHYuBtIJ40/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbuL5Yt%2FdJMcaiWmwxs%2FQPYk8hdQXNYVZHYuBtIJ40%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;781&quot; height=&quot;647&quot; data-origin-width=&quot;781&quot; data-origin-height=&quot;647&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;상당수의 토큰을 잘 생성하는 것을 볼 수 있고, 모델 크기가 커질 수록 더 많아지는 것도 볼 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;738&quot; data-origin-height=&quot;593&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cwmPBc/dJMcadtXRkL/1FEe7ZHNTzRQTNNtRVWODK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cwmPBc/dJMcadtXRkL/1FEe7ZHNTzRQTNNtRVWODK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cwmPBc/dJMcadtXRkL/1FEe7ZHNTzRQTNNtRVWODK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcwmPBc%2FdJMcadtXRkL%2F1FEe7ZHNTzRQTNNtRVWODK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;738&quot; height=&quot;593&quot; data-origin-width=&quot;738&quot; data-origin-height=&quot;593&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2개의 Proto-token이라는 실제 vocab 토큰이 아닌 학습 가능한 입력 embedding 역할을 하는 토큰을 넣어 여러 토큰 정보를 압축하고, LLM 내부 연산을 통해 병렬적으로 토큰 시퀸스를 복원한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLM은 완전히 얼리고 임베딩만 학습 함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1052&quot; data-origin-height=&quot;741&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/JOff1/dJMcafZET5c/Od4HdMzOndlSM2LCJ0DkFk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/JOff1/dJMcafZET5c/Od4HdMzOndlSM2LCJ0DkFk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/JOff1/dJMcafZET5c/Od4HdMzOndlSM2LCJ0DkFk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FJOff1%2FdJMcafZET5c%2FOd4HdMzOndlSM2LCJ0DkFk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1052&quot; height=&quot;741&quot; data-origin-width=&quot;1052&quot; data-origin-height=&quot;741&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;데이터는&lt;br /&gt;Random - Random token sequences. 비자연 텍스트&lt;br /&gt;Fanfics - AO3 Fanfiction. Unseen 자연어&lt;br /&gt;PG-19 - Seen 자연어&lt;br /&gt;PG-19(gen) - 모델이 생성한 텍스트&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Llama 8b 를 통해 최대 700토큰을 1forward pass로 복원&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 563px;&quot; border=&quot;1&quot; data-end=&quot;1677&quot; data-start=&quot;214&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;391&quot; data-start=&quot;315&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;322&quot; data-start=&quot;315&quot;&gt;문제의식&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;391&quot; data-start=&quot;322&quot; data-col-size=&quot;md&quot;&gt;Autoregressive decoding은 토큰 단위 생성으로 인해 &lt;b&gt;추론 속도&amp;middot;병렬성에 근본적 한계&lt;/b&gt;가 존재함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;482&quot; data-start=&quot;392&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;400&quot; data-start=&quot;392&quot;&gt;핵심 질문&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;482&quot; data-start=&quot;400&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;Frozen LLM이 iterative decoding 없이 한 번의 forward pass로 여러 토큰을 정확히 생성할 수 있는가?&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;575&quot; data-start=&quot;483&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;493&quot; data-start=&quot;483&quot;&gt;핵심 아이디어&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;575&quot; data-start=&quot;493&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;2개의 학습 가능한 입력 임베딩(proto-tokens)&lt;/b&gt; 만으로 frozen LLM이 &lt;b&gt;수백 토큰을 one-pass로 복원 가능&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot; data-end=&quot;673&quot; data-start=&quot;576&quot;&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;584&quot; data-start=&quot;576&quot;&gt;입력 표현&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot; data-end=&quot;673&quot; data-start=&quot;584&quot; data-col-size=&quot;md&quot;&gt;Z = [e, m, m, &amp;hellip;, m] (총 N개) &lt;br /&gt;&amp;bull; e: 텍스트별 정보 임베딩 &lt;br /&gt;&amp;bull; m: 구조적 역할, 여러 텍스트 간 공유 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;758&quot; data-start=&quot;674&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;682&quot; data-start=&quot;674&quot;&gt;학습 방식&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;758&quot; data-start=&quot;682&quot; data-col-size=&quot;md&quot;&gt;LLM 파라미터는 &lt;b&gt;완전 고정(frozen)&lt;/b&gt; &lt;br /&gt;proto-token 임베딩만 cross-entropy loss로 최적화&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;837&quot; data-start=&quot;759&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;770&quot; data-start=&quot;759&quot;&gt;필수 설계 요소&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;837&quot; data-start=&quot;770&quot; data-col-size=&quot;md&quot;&gt;&amp;bull; &lt;b&gt;proto-token은 최소 2개 필요&lt;/b&gt; (1개는 실패) &lt;br /&gt;&amp;bull; &lt;b&gt;토큰 배치 순서가 성능을 결정&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;901&quot; data-start=&quot;838&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;846&quot; data-start=&quot;838&quot;&gt;사용 모델&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;901&quot; data-start=&quot;846&quot; data-col-size=&quot;md&quot;&gt;Pythia (160M / 410M / 1.4B), LLaMA-3 (1B / 3B / 8B)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;975&quot; data-start=&quot;902&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;908&quot; data-start=&quot;902&quot;&gt;데이터&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;975&quot; data-start=&quot;908&quot; data-col-size=&quot;md&quot;&gt;Random token, AO3 Fanfiction (unseen), PG-19 (seen), PG-19(gen)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1058&quot; data-start=&quot;976&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;984&quot; data-start=&quot;976&quot;&gt;성능 결과&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;1058&quot; data-start=&quot;984&quot; data-col-size=&quot;md&quot;&gt;&amp;bull; LLaMA-3.1-8B: &lt;b&gt;최대 ~700 토큰 정확 복원&lt;/b&gt; &lt;br /&gt;&amp;bull; Pythia 계열은 모델 크기 증가 &amp;ne; 성능 증가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1118&quot; data-start=&quot;1059&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1068&quot; data-start=&quot;1059&quot;&gt;정보량 분석&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1118&quot; data-start=&quot;1068&quot; data-col-size=&quot;md&quot;&gt;One-pass 생성은 autoregressive 대비 &lt;b&gt;정보 밀도 &amp;asymp; 1/2&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1186&quot; data-start=&quot;1119&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1124&quot; data-start=&quot;1119&quot;&gt;속도&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1186&quot; data-start=&quot;1124&quot; data-col-size=&quot;md&quot;&gt;Autoregressive 대비 &lt;b&gt;최대 279&amp;times; 높은 reconstruction throughput&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1250&quot; data-start=&quot;1187&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1204&quot; data-start=&quot;1187&quot;&gt;Proto-token 해석&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1250&quot; data-start=&quot;1204&quot; data-col-size=&quot;md&quot;&gt;토큰 ID 저장이 아니라 &lt;b&gt;언어 모델의 구조적 패턴을 활용한 압축 표현&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1350&quot; data-start=&quot;1251&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1262&quot; data-start=&quot;1251&quot;&gt;표현 공간 특성&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;1350&quot; data-start=&quot;1262&quot; data-col-size=&quot;md&quot;&gt;&amp;bull; 동일 텍스트 proto-token은 &lt;b&gt;local &amp;amp; connected&lt;/b&gt; &lt;br /&gt;&amp;bull; 선형 보간은 실패, &lt;b&gt;Bezier curve로 연결 가능&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1425&quot; data-start=&quot;1351&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1360&quot; data-start=&quot;1351&quot;&gt;이론적 의미&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1425&quot; data-start=&quot;1360&quot; data-col-size=&quot;md&quot;&gt;LLM 내부에 &lt;b&gt;잠재적 병렬 생성 능력(hidden multi-token capacity)&lt;/b&gt; 존재함을 입증&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1477&quot; data-start=&quot;1426&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1435&quot; data-start=&quot;1426&quot;&gt;실용성 평가&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1477&quot; data-start=&quot;1435&quot; data-col-size=&quot;md&quot;&gt;현재는 &lt;b&gt;existence proof&lt;/b&gt; 단계 (직접 최적화 필요)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot; data-end=&quot;1553&quot; data-start=&quot;1478&quot;&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1483&quot; data-start=&quot;1478&quot;&gt;한계&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot; data-end=&quot;1553&quot; data-start=&quot;1483&quot; data-col-size=&quot;md&quot;&gt;&amp;bull; Encoder 부재 &amp;rarr; 실사용 불가 &lt;br /&gt;&amp;bull; 아키텍처 의존성 &lt;br /&gt;&amp;bull; capacity upper bound 아님&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 59px;&quot; data-end=&quot;1677&quot; data-start=&quot;1554&quot;&gt;
&lt;td style=&quot;height: 59px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1562&quot; data-start=&quot;1554&quot;&gt;향후 연구&lt;/td&gt;
&lt;td style=&quot;height: 59px;&quot; data-end=&quot;1677&quot; data-start=&quot;1562&quot; data-col-size=&quot;md&quot;&gt;&amp;bull; Text &amp;rarr; proto-token &lt;b&gt;Encoder 학습&lt;/b&gt; &lt;br /&gt;&amp;bull; Non-autoregressive / chunk-wise generation &lt;br /&gt;&amp;bull; RAG&amp;middot;압축&amp;middot;고속 추론으로 확장 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1199</guid>
      <comments>https://yoonschallenge.tistory.com/1199#entry1199comment</comments>
      <pubDate>Tue, 20 Jan 2026 15:27:33 +0900</pubDate>
    </item>
    <item>
      <title>Privacy AI 관련 조사 8</title>
      <link>https://yoonschallenge.tistory.com/1198</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2410.09457&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2410.09457&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768834552607&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Power-Softmax: Towards Secure LLM Inference over Encrypted Data&quot; data-og-description=&quot;Modern cryptographic methods for implementing privacy-preserving LLMs such as Homomorphic Encryption (HE) require the LLMs to have a polynomial form. Forming such a representation is challenging because Transformers include non-polynomial components, such &quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2410.09457&quot; data-og-url=&quot;https://arxiv.org/abs/2410.09457v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/fGfqW/dJMb9ee7NvE/WC8POM7VvUBtFNMrqdWgT0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/ksxjI/dJMb8XRZnjX/khXUKBTHaK45TAW7KQsGi1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2410.09457&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2410.09457&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/fGfqW/dJMb9ee7NvE/WC8POM7VvUBtFNMrqdWgT0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/ksxjI/dJMb8XRZnjX/khXUKBTHaK45TAW7KQsGi1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Power-Softmax: Towards Secure LLM Inference over Encrypted Data&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Modern cryptographic methods for implementing privacy-preserving LLMs such as Homomorphic Encryption (HE) require the LLMs to have a polynomial form. Forming such a representation is challenging because Transformers include non-polynomial components, such&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;HE 기반의 LLM Inference는 Polynomial이어야 함!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;But transformer의 핵심인 Softmax-attention은 지수, 나눗셈, max 연산 등 non-polynomial 연산에 강하게 의존함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;PTA -&amp;gt; 고차 다항식 필요 -&amp;gt; HE에서 Latency, noise 폭증&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Softmax 제거 -&amp;gt; 안정성, 스케일링 붕괴 -&amp;gt; LLM으로 확장 불가&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; Softmax를 근사하지 말고, HE에 적합한 새로운 Attention을 만들자&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1332&quot; data-origin-height=&quot;723&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bff1lb/dJMcab31QCz/aT3GBufw1HYZKDlRMSkoe1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bff1lb/dJMcab31QCz/aT3GBufw1HYZKDlRMSkoe1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bff1lb/dJMcab31QCz/aT3GBufw1HYZKDlRMSkoe1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbff1lb%2FdJMcab31QCz%2FaT3GBufw1HYZKDlRMSkoe1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1332&quot; height=&quot;723&quot; data-origin-width=&quot;1332&quot; data-origin-height=&quot;723&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;exp 대신에 거듭 제곱을 활용해서 완전한 다항식 구조로 바꾸고, 정규화, 상대적 중요도 강조등 attention의 본질적 성질은 유지하였다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Softmax의 확률적 의미가 아니라 상대적 가중치 증폭 + 정규화라는 기능적 본질만 취했습니다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1321&quot; data-origin-height=&quot;579&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ozs3Z/dJMcag5l6zN/x9l3KWgNc5EkddofSLwfSK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ozs3Z/dJMcag5l6zN/x9l3KWgNc5EkddofSLwfSK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ozs3Z/dJMcag5l6zN/x9l3KWgNc5EkddofSLwfSK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fozs3Z%2FdJMcag5l6zN%2Fx9l3KWgNc5EkddofSLwfSK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1321&quot; height=&quot;579&quot; data-origin-width=&quot;1321&quot; data-origin-height=&quot;579&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 polynomial transformer 대비 10배이상 스케일을 확장 함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;성능 측면에서 LLM 답게 동작하는 모습을 보여줌&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;992&quot; data-origin-height=&quot;806&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/d5ZkNn/dJMb99Zsqkp/o4811ZsxKuTSRZMjIC1Yf1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/d5ZkNn/dJMb99Zsqkp/o4811ZsxKuTSRZMjIC1Yf1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/d5ZkNn/dJMb99Zsqkp/o4811ZsxKuTSRZMjIC1Yf1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fd5ZkNn%2FdJMb99Zsqkp%2Fo4811ZsxKuTSRZMjIC1Yf1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;992&quot; height=&quot;806&quot; data-origin-width=&quot;992&quot; data-origin-height=&quot;806&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;2040&quot; data-start=&quot;267&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;508&quot; data-start=&quot;289&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;309&quot; data-start=&quot;289&quot;&gt;&lt;b&gt;연구 배경 / 문제 정의&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;508&quot; data-start=&quot;309&quot; data-col-size=&quot;xl&quot;&gt;Homomorphic Encryption(HE) 환경에서는 &lt;b&gt;모든 연산이 다항식(polynomial)&lt;/b&gt; 이어야 하나, Transformer의 핵심인 &lt;b&gt;Softmax-Attention은 지수&amp;middot;나눗셈&amp;middot;max 등 비다항 연산&lt;/b&gt;에 의존함. 기존 polynomial approximation 기반 접근은 &lt;b&gt;불안정하거나 대규모 LLM으로 확장 불가&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;665&quot; data-start=&quot;509&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;525&quot; data-start=&quot;509&quot;&gt;&lt;b&gt;기존 방법의 한계&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;665&quot; data-start=&quot;525&quot; data-col-size=&quot;xl&quot;&gt;(1) &lt;b&gt;Post-Training Approximation&lt;/b&gt;: 고차 다항식 필요 &amp;rarr; HE에서 latency&amp;middot;noise 급증&lt;br /&gt;(2) &lt;b&gt;Softmax 제거형 Attention&lt;/b&gt;: 학습 안정성&amp;middot;성능 붕괴 &amp;rarr; billion-scale 불가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;737&quot; data-start=&quot;666&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;680&quot; data-start=&quot;666&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;737&quot; data-start=&quot;680&quot; data-col-size=&quot;xl&quot;&gt;Softmax를 근사하지 않고, &lt;b&gt;HE에 적합한 새로운 Attention 연산 자체를 설계&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;905&quot; data-start=&quot;738&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;758&quot; data-start=&quot;738&quot;&gt;&lt;b&gt;제안 방법 (핵심 연산)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;905&quot; data-start=&quot;758&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;PowerSoftmax Attention&lt;/b&gt;: &lt;span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;Softmax&lt;/span&gt;&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;x&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt; &amp;rarr; &lt;span&gt;&lt;span&gt;x^p / (&amp;sum;x^p) &lt;/span&gt;&lt;/span&gt;(p는 짝수)&lt;br /&gt;&amp;bull; exp 제거 &amp;rarr; 완전한 다항식 구조&lt;br /&gt;&amp;bull; Attention의 정규화&amp;middot;가중치 증폭 성질 유지&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1038&quot; data-start=&quot;906&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;922&quot; data-start=&quot;906&quot;&gt;&lt;b&gt;학습 안정화 기법&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1038&quot; data-start=&quot;922&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;Stable PowerSoftmax&lt;/b&gt;: 입력을 ||x||&lt;span&gt;&lt;span&gt;&amp;infin;&lt;/span&gt;&lt;span aria-hidden=&quot;true&quot;&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;​&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;로 스케일링 &amp;rarr; overflow/underflow 방지 (Softmax의 log-sum-exp 역할을 다항식적으로 대체)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1127&quot; data-start=&quot;1039&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1058&quot; data-start=&quot;1039&quot;&gt;&lt;b&gt;HE 근사 용이화 기법&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1127&quot; data-start=&quot;1058&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;&amp;epsilon;-Lipschitz Division&lt;/b&gt;: 분모에 &amp;epsilon; 추가 &amp;rarr; division을 안정적으로 저차 다항식 근사 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1220&quot; data-start=&quot;1128&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1143&quot; data-start=&quot;1128&quot;&gt;&lt;b&gt;긴 시퀀스 대응&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1220&quot; data-start=&quot;1143&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;Length-Agnostic Attention&lt;/b&gt;: sum 대신 mean 기반 정규화 &amp;rarr; 시퀀스 길이 증가해도 근사 난이도 고정&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1368&quot; data-start=&quot;1221&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1236&quot; data-start=&quot;1221&quot;&gt;&lt;b&gt;전체 파이프라인&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1368&quot; data-start=&quot;1236&quot; data-col-size=&quot;xl&quot;&gt;(1) Attention 구조를 PowerSoftmax로 교체 후 학습&lt;br /&gt;(2) Range-Minimization Loss로 비다항 연산 입력 범위 축소&lt;br /&gt;(3) Division&amp;middot;LayerNorm&amp;middot;GELU를 다항식으로 치환&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1472&quot; data-start=&quot;1369&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1382&quot; data-start=&quot;1369&quot;&gt;&lt;b&gt;모델 스케일&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1472&quot; data-start=&quot;1382&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;32-layer, 1.4B 파라미터&lt;/b&gt; polynomial LLM &amp;mdash; 기존 polynomial transformer 대비 &lt;b&gt;10배 이상 규모 확장&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1588&quot; data-start=&quot;1473&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1485&quot; data-start=&quot;1473&quot;&gt;&lt;b&gt;성능 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1588&quot; data-start=&quot;1485&quot; data-col-size=&quot;xl&quot;&gt;Zero-shot / Few-shot 성능이 &lt;b&gt;동일 크기 일반 Transformer와 거의 동일&lt;/b&gt;&lt;br /&gt;ARC, LogiQA 등 &lt;b&gt;Reasoning 및 ICL 능력 유지&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1692&quot; data-start=&quot;1589&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1604&quot; data-start=&quot;1589&quot;&gt;&lt;b&gt;HE 추론 효율&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1692&quot; data-start=&quot;1604&quot; data-col-size=&quot;xl&quot;&gt;Attention 당 &lt;b&gt;단 1회의 division 근사&lt;/b&gt;만 필요 &amp;rarr; 기존 방법 대비 &lt;b&gt;HE latency 및 bootstrap 비용 대폭 감소&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1835&quot; data-start=&quot;1693&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1709&quot; data-start=&quot;1693&quot;&gt;&lt;b&gt;기술적 기여 요약&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1835&quot; data-start=&quot;1709&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; HE-friendly Attention의 새로운 설계 패러다임 제시&lt;br /&gt;&amp;bull; 최초의 &lt;b&gt;billion-scale polynomial LLM&lt;/b&gt; 실현&lt;br /&gt;&amp;bull; 실제 HE 환경에서의 latency breakdown 제공&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1962&quot; data-start=&quot;1836&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1853&quot; data-start=&quot;1836&quot;&gt;&lt;b&gt;논문의 핵심 메시지&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1962&quot; data-start=&quot;1853&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;프라이버시 보존 LLM의 병목은 &amp;lsquo;근사 기법&amp;rsquo;이 아니라 &amp;lsquo;아키텍처 설계&amp;rsquo;&lt;/b&gt;이며, Transformer의 본질은 Softmax 자체가 아니라 &lt;b&gt;정규화된 상대적 중요도 학습&lt;/b&gt;임을 증명&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2040&quot; data-start=&quot;1963&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1978&quot; data-start=&quot;1963&quot;&gt;&lt;b&gt;의미 / 임팩트&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2040&quot; data-start=&quot;1978&quot; data-col-size=&quot;xl&quot;&gt;HE 기반 Secure LLM을 &lt;b&gt;toy model &amp;rarr; 실사용 가능한 LLM 단계&lt;/b&gt;로 끌어올린 전환점&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2410.02486&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2410.02486&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768840165484&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Encryption-Friendly LLM Architecture&quot; data-og-description=&quot;Large language models (LLMs) offer personalized responses based on user interactions, but this use case raises serious privacy concerns. Homomorphic encryption (HE) is a cryptographic protocol supporting arithmetic computations in encrypted states and prov&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2410.02486&quot; data-og-url=&quot;https://arxiv.org/abs/2410.02486v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/Z8Ap0/dJMb8UHI0YU/yIK5gJmYToKTvJfJscRiMK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/H0YBn/dJMb8Zvve8i/tNRTjN06ERmuHpYhhvBzt1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2410.02486&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2410.02486&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/Z8Ap0/dJMb8UHI0YU/yIK5gJmYToKTvJfJscRiMK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/H0YBn/dJMb8Zvve8i/tNRTjN06ERmuHpYhhvBzt1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Encryption-Friendly LLM Architecture&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Large language models (LLMs) offer personalized responses based on user interactions, but this use case raises serious privacy concerns. Homomorphic encryption (HE) is a cryptographic protocol supporting arithmetic computations in encrypted states and prov&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ICLR 2025에 붙은 논문입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;사용자 데이터가 LLM 서버에 평문으로 노출 되는 것이 문제이나 GDPR/CCPA 등은 규제로 실사용 제약이 증가한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;HE는 이론적 해법이지만 연산 비용, 정확도, 부트스트래핑 문제가 치명적이다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 암호 친화적 Transformer 아키텍쳐를 통해 암호화된 상태에서 fine-tuning과 inference를 가능하게 한다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1409&quot; data-origin-height=&quot;657&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cxPIHa/dJMcahQIBXK/U5qH0DKklmd8JVPjKj6dpk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cxPIHa/dJMcahQIBXK/U5qH0DKklmd8JVPjKj6dpk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cxPIHa/dJMcahQIBXK/U5qH0DKklmd8JVPjKj6dpk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcxPIHa%2FdJMcahQIBXK%2FU5qH0DKklmd8JVPjKj6dpk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1409&quot; height=&quot;657&quot; data-origin-width=&quot;1409&quot; data-origin-height=&quot;657&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;LoRA를 통해 CCMM 폭발 문제를 해결&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Softmax를 제거해 Gaussian Kernel Attention을 통해 정규화를 제거하고, exp를 x&amp;lt;=0 구간에서만 근사하여 안정화를 진행&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Client는 입력 토큰 임베딩을 CKKS로 암호화&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LoRA 가중치 또한 사용자 데이터의 요약본으로 암호화 진행&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1000&quot; data-origin-height=&quot;619&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/kDVdZ/dJMcajua8nz/vVnPFDAMeVlod7I7oumAv1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/kDVdZ/dJMcajua8nz/vVnPFDAMeVlod7I7oumAv1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/kDVdZ/dJMcajua8nz/vVnPFDAMeVlod7I7oumAv1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FkDVdZ%2FdJMcajua8nz%2FvVnPFDAMeVlod7I7oumAv1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1000&quot; height=&quot;619&quot; data-origin-width=&quot;1000&quot; data-origin-height=&quot;619&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;파인튜닝은 6.94배 빨라지고, inference는 2.3배 빨라지며 fine-tuning 대비 정확도 감소는 제한적임&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;524&quot; data-origin-height=&quot;706&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cOknGH/dJMb99SG0Dn/rBV2f9eOD8X6LcKSfaBV00/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cOknGH/dJMb99SG0Dn/rBV2f9eOD8X6LcKSfaBV00/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cOknGH/dJMb99SG0Dn/rBV2f9eOD8X6LcKSfaBV00/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcOknGH%2FdJMb99SG0Dn%2FrBV2f9eOD8X6LcKSfaBV00%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;524&quot; height=&quot;706&quot; data-origin-width=&quot;524&quot; data-origin-height=&quot;706&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그림으로 이해하기 쉽게 해준 것이 하나 있길래..&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1712&quot; data-start=&quot;221&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;457&quot; data-start=&quot;313&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;326&quot; data-start=&quot;313&quot;&gt;문제의식&lt;/td&gt;
&lt;td data-end=&quot;457&quot; data-start=&quot;326&quot; data-col-size=&quot;lg&quot;&gt;개인화 LLM 서비스에서 &lt;b&gt;사용자 입력&amp;middot;파인튜닝 데이터가 서버에 평문 노출&lt;/b&gt; &lt;br /&gt;&amp;rarr; GDPR/CCPA 등 규제 충돌. 기존 HE 기반 연구는 &lt;b&gt;inference-only&lt;/b&gt;에 머물러 개인화 fine-tuning을 보호하지 못함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;527&quot; data-start=&quot;458&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;463&quot; data-start=&quot;458&quot;&gt;목표&lt;/td&gt;
&lt;td data-end=&quot;527&quot; data-start=&quot;463&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;사용자 데이터 기반 개인화 파인튜닝 + 추론 전체를 암호화 상태에서 수행&lt;/b&gt; 가능한 LLM 아키텍처 제안&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;634&quot; data-start=&quot;528&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;536&quot; data-start=&quot;528&quot;&gt;위협 모델&lt;/td&gt;
&lt;td data-end=&quot;634&quot; data-start=&quot;536&quot; data-col-size=&quot;lg&quot;&gt;Semi-honest server. 서버는 연산은 수행하지만 &lt;b&gt;사용자 데이터&amp;middot;개인화 정보는 의미적으로 해석 불가 (semantic security, CKKS 가정)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;729&quot; data-start=&quot;635&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;646&quot; data-start=&quot;635&quot;&gt;핵심 설계 철학&lt;/td&gt;
&lt;td data-end=&quot;729&quot; data-start=&quot;646&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;암호화는 &amp;ldquo;사용자 정보에만&amp;rdquo; 적용&lt;/b&gt;: &lt;br /&gt;사전학습 LLM 가중치는 서버 자산 &amp;rarr; 평문, 사용자 입력&amp;middot;LoRA 가중치는 사용자 정보 &amp;rarr; 암호문&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;816&quot; data-start=&quot;730&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;741&quot; data-start=&quot;730&quot;&gt;기술적 병목 ①&lt;/td&gt;
&lt;td data-end=&quot;816&quot; data-start=&quot;741&quot; data-col-size=&quot;lg&quot;&gt;HE 환경에서 &lt;b&gt;Ciphertext&amp;ndash;Ciphertext Matrix Multiplication (CCMM)&lt;/b&gt; 이 극도로 비쌈&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;901&quot; data-start=&quot;817&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;824&quot; data-start=&quot;817&quot;&gt;해결 ①&lt;/td&gt;
&lt;td data-end=&quot;901&quot; data-start=&quot;824&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;LoRA Fine-tuning&lt;/b&gt; 적용 &amp;rarr; 대규모 가중치 업데이트 제거, &lt;b&gt;소규모 CCMM + 대규모 PCMM&lt;/b&gt; 구조로 변환&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;982&quot; data-start=&quot;902&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;913&quot; data-start=&quot;902&quot;&gt;기술적 병목 ②&lt;/td&gt;
&lt;td data-end=&quot;982&quot; data-start=&quot;913&quot; data-col-size=&quot;lg&quot;&gt;Softmax (exp, div, max) 는 HE에서 &lt;b&gt;고차 다항 근사 + 잦은 Bootstrapping 필요&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1081&quot; data-start=&quot;983&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;990&quot; data-start=&quot;983&quot;&gt;해결 ②&lt;/td&gt;
&lt;td data-end=&quot;1081&quot; data-start=&quot;990&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Gaussian Kernel Attention (GK)&lt;/b&gt; 도입 &amp;rarr; Softmax 제거, x&amp;le;0 구간 exp 근사만 사용, division/max 불필요&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1139&quot; data-start=&quot;1082&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1090&quot; data-start=&quot;1082&quot;&gt;암호 기술&lt;/td&gt;
&lt;td data-end=&quot;1139&quot; data-start=&quot;1090&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;CKKS Homomorphic Encryption&lt;/b&gt; (HEaaN 라이브러리)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1245&quot; data-start=&quot;1140&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1149&quot; data-start=&quot;1140&quot;&gt;시스템 구조&lt;/td&gt;
&lt;td data-end=&quot;1245&quot; data-start=&quot;1149&quot; data-col-size=&quot;lg&quot;&gt;Client: 입력 임베딩 암호화 &lt;br /&gt;&amp;rarr; Server: 평문 사전학습 가중치 + 암호문 LoRA/입력으로 &lt;b&gt;암호화된 fine-tuning &amp;amp; inference 수행&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1307&quot; data-start=&quot;1246&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1254&quot; data-start=&quot;1246&quot;&gt;실험 모델&lt;/td&gt;
&lt;td data-end=&quot;1307&quot; data-start=&quot;1254&quot; data-col-size=&quot;lg&quot;&gt;2-layer BERT-style encoder (hidden 768, 12 heads)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1361&quot; data-start=&quot;1308&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1315&quot; data-start=&quot;1308&quot;&gt;벤치마크&lt;/td&gt;
&lt;td data-end=&quot;1361&quot; data-start=&quot;1315&quot; data-col-size=&quot;lg&quot;&gt;GLUE (CoLA, MRPC, RTE, STS-B, SST-2, QNLI)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1453&quot; data-start=&quot;1362&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1370&quot; data-start=&quot;1362&quot;&gt;속도 성능&lt;/td&gt;
&lt;td data-end=&quot;1453&quot; data-start=&quot;1370&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Fine-tuning 6.94&amp;times; 가속&lt;/b&gt;, &lt;b&gt;Inference 2.3&amp;times; 가속&lt;/b&gt; (Full fine-tuning + Softmax 대비)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1535&quot; data-start=&quot;1454&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1460&quot; data-start=&quot;1454&quot;&gt;정확도&lt;/td&gt;
&lt;td data-end=&quot;1535&quot; data-start=&quot;1460&quot; data-col-size=&quot;lg&quot;&gt;Plaintext Full fine-tuning 대비 &lt;b&gt;성능 저하 매우 제한적&lt;/b&gt;, HE 추론 결과 &amp;asymp; Plaintext 추론&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1591&quot; data-start=&quot;1536&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1544&quot; data-start=&quot;1536&quot;&gt;핵심 기여&lt;/td&gt;
&lt;td data-end=&quot;1591&quot; data-start=&quot;1544&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;암호화된 개인화 LLM 파이프라인을 실제로 구현한 최초 수준의 아키텍처&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1712&quot; data-start=&quot;1592&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1597&quot; data-start=&quot;1592&quot;&gt;의의&lt;/td&gt;
&lt;td data-end=&quot;1712&quot; data-start=&quot;1597&quot; data-col-size=&quot;lg&quot;&gt;HE 기반 LLM을 &lt;b&gt;&amp;ldquo;inference-only&amp;rdquo;에서 &amp;ldquo;personalization-capable&amp;rdquo; 단계로 확장&lt;/b&gt;, Privacy-preserving LLM-as-a-Service의 기준점 제시&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;초반 후반부 Layer에서 유출 가능성?&lt;/p&gt;
&lt;div data-ke-type=&quot;moreLess&quot; data-text-more=&quot;더보기&quot; data-text-less=&quot;닫기&quot;&gt;&lt;a class=&quot;btn-toggle-moreless&quot;&gt;더보기&lt;/a&gt;
&lt;div class=&quot;moreless-content&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;가능한 &lt;b&gt;&amp;ldquo;평문 추론&amp;rdquo;&lt;/b&gt; 상황이라면 말씀하신 것처럼 초반/후반 layer의 hidden state로 입력 토큰을 복원하는 류의 공격(embedding inversion, activation inversion 등)이 성립할 수 있습니다.&lt;br /&gt;하지만 &lt;b&gt;이 논문 설정(HE/CKKS)&lt;/b&gt; 에서는 그 전제가 깨집니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;핵심은 한 가지입니다.&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;서버는 &lt;b&gt;layer 출력(hidden state), logits, attention score&lt;/b&gt;를 &amp;ldquo;보긴&amp;rdquo; 하지만, 그 값이 전부 &lt;b&gt;암호문(ciphertext)&lt;/b&gt; 이라서 &lt;b&gt;의미를 해석(복호)할 수 없습니다.&lt;/b&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;왜 &amp;ldquo;원본 모델 가중치가 평문&amp;rdquo;이어도 토큰을 유추 못하나?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;HE 추론은 형태가 이렇게 됩니다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;클라이언트가 토큰을 &lt;b&gt;임베딩까지 만든 뒤(혹은 임베딩 결과를 얻은 뒤)&lt;/b&gt; 그 임베딩을 &lt;b&gt;CKKS로 암호화&lt;/b&gt;해서 서버에 보냄&lt;/li&gt;
&lt;li&gt;서버는 평문 가중치 (W)로 연산하지만, 입력이 암호문이므로&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;중간의 (h_1, h_2, ...)는 &lt;b&gt;항상 ct(&amp;middot;)&lt;/b&gt; 형태 (암호문)로만 존재&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;서버는 비밀키를 갖고 있지 않으니 &lt;b&gt;ct(h_t)를 보고 h_t를 읽을 수 없음&lt;/b&gt;&lt;br /&gt;&amp;rarr; 따라서 &amp;ldquo;초반 layer 표현을 보고 토큰을 복원&amp;rdquo; 같은 건 &lt;b&gt;관측 자체가 불가능&lt;/b&gt;합니다. (논문은 CKKS의 semantic security(IND-CPA) 가정 하에서 서버가 사용자 데이터를 해석할 수 없다고 둡니다.)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉, &lt;b&gt;가중치가 평문이라는 사실은 &amp;ldquo;계산을 가능하게&amp;rdquo; 할 뿐이고, &amp;ldquo;정보를 노출&amp;rdquo;시키지는 않습니다.&lt;/b&gt;&lt;br /&gt;정보 노출은 서버가 &lt;b&gt;중간값/입력값을 평문으로 관측할 때&lt;/b&gt; 발생하는데, 여기선 그 관측이 차단됩니다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;그럼 서버가 &amp;ldquo;무엇을 유추할 수 있는가?&amp;rdquo; (현실적인 누출면)&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 논문 위협모델/구현에서 남을 수 있는 누출은 보통 다음 계열입니다.&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;b&gt;메타데이터 누출&lt;/b&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;시퀀스 길이(고정 길이로 패딩하면 완화), 요청 횟수, 처리량 등&lt;/li&gt;
&lt;/ul&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;b&gt;사이드채널&lt;/b&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;(구현에 따라) 시간, 메모리, GPU 스케줄링 차이로 인한 미세 누출&lt;/li&gt;
&lt;li&gt;다만 HE는 보통 &amp;ldquo;암호문 값에 따라 분기&amp;rdquo;가 거의 불가능해서, 데이터 의존 분기는 제한적입니다. 그래도 시스템 레벨 사이드채널은 별도 이슈입니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;b&gt;악성 서버(semihonest가 아니라 malicious) 가정이면&lt;/b&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;서버가 프로토콜을 어기고 &amp;ldquo;출력에 신호를 심어서&amp;rdquo; 클라이언트의 후속 행동을 유도하는 류의 공격을 고민해야 합니다.&lt;/li&gt;
&lt;li&gt;하지만 이 논문은 &lt;b&gt;semi-honest&lt;/b&gt;라 그 범위를 벗어납니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&amp;ldquo;생성 토큰&amp;rdquo;은 더 까다로운 이유 (중요)&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 논문은 실험이 주로 &lt;b&gt;분류형(GLUE)&lt;/b&gt; 이고, 서버가 &lt;b&gt;샘플링(top-k, argmax, temperature)&lt;/b&gt; 같은 비다항/비교 연산을 해야 하는 &lt;b&gt;decoder-only 생성&lt;/b&gt;은 별도 난제가 됩니다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;만약 생성까지 HE로 끝까지 하려면:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;샘플링을 서버가 하려는 순간 비교/정렬이 필요 &amp;rarr; HE 단독으론 매우 어렵고 &lt;b&gt;MPC/인터랙티브&lt;/b&gt;가 섞이거나,&lt;/li&gt;
&lt;li&gt;또는 서버가 logits(또는 일부 정보)을 평문으로 보게 되는 설계가 섞이면 누출 위험이 커집니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;반대로, 매 스텝 logits를 &lt;b&gt;암호문으로 클라이언트에 보내고 클라이언트가 복호/샘플링&lt;/b&gt;하면 프라이버시는 강해지지만,
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;통신/지연이 늘고&lt;/li&gt;
&lt;li&gt;서버가 &amp;ldquo;몇 스텝 생성했는지(early stop 포함)&amp;rdquo; 같은 메타정보는 알 수 있습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;정리&lt;/h2&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;이 논문 설정에서는&lt;/b&gt; 서버가 초반/후반 layer로 입력 토큰을 유추하는 게 &lt;b&gt;원리적으로 어렵다&lt;/b&gt;&lt;br /&gt;(서버가 보는 건 전부 &lt;b&gt;암호문 hidden state&lt;/b&gt;라서 &amp;ldquo;유추에 필요한 관측값&amp;rdquo;이 없다)&lt;/li&gt;
&lt;li&gt;다만, 남는 이슈는 &lt;b&gt;(i) 메타데이터, (ii) 시스템 사이드채널, (iii) malicious 서버 모델, (iv) 생성(decoding) 단계의 샘플링&lt;/b&gt;입니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;원하시면, 당신이 관심 갖는 방향(&amp;ldquo;생성 텍스트를 서버/네트워크에 남기지 않기&amp;rdquo;)에 맞춰서&lt;br /&gt;&lt;b&gt;decoder-only 생성에서 안전하게 샘플링까지 처리하는 설계 옵션 3가지(HE-only / HE+MPC / HE+TEE)&lt;/b&gt; 를 장단점과 함께 바로 정리해드리겠습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;좋습니다. HE를 &amp;ldquo;암호문으로 본다&amp;rdquo;는 말을 &lt;b&gt;수학/암호 배경 없이&lt;/b&gt; 직관적으로 설명하겠습니다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;1) &amp;ldquo;암호로 본다&amp;rdquo; = 서버가 보는 값은 &lt;b&gt;의미 없는 숫자 덩어리&lt;/b&gt;라는 뜻&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;사용자가 보내는 건 &amp;ldquo;토큰 번호(예: 15243)&amp;rdquo; 자체가 아닙니다.&lt;br /&gt;HE(특히 CKKS)에서는 보통 &lt;b&gt;토큰을 먼저 임베딩 벡터로 바꾼 뒤&lt;/b&gt;, 그 &lt;b&gt;실수 벡터&lt;/b&gt;를 암호화해서 보냅니다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;평문 세계:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;토큰 &amp;rarr; 임베딩 벡터 (x \in \mathbb{R}^{768})&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;HE 세계:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;(x) 를 암호화해서 &lt;b&gt;ciphertext(암호문) = ct(x)&lt;/b&gt; 로 보냄&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;서버가 받는 건&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&amp;ldquo;15243&amp;rdquo; 같은 토큰 ID가 아니라,&lt;/li&gt;
&lt;li&gt;&lt;b&gt;ct(x)&lt;/b&gt; 라는 &amp;ldquo;자물쇠로 잠긴 상자&amp;rdquo;입니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;서버는 그 상자를 들고 있을 뿐,&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;상자 안에 뭐가 들어있는지(임베딩 값이 무엇인지) &lt;b&gt;열어볼 수 없습니다.&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;2) 그런데 서버가 계산은 어떻게 해? (핵심 직관)&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;HE는 특이하게도 &lt;b&gt;상자를 열지 않고도&lt;/b&gt; 상자끼리 계산을 할 수 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;비유로 아주 정확하게 말하면:&lt;/p&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;서버는 &amp;ldquo;잠긴 계산기&amp;rdquo;를 돌릴 수 있다.&lt;/b&gt;&lt;br /&gt;숫자는 잠겨있지만, 더하기/곱하기 버튼은 눌러서 결과도 잠긴 채로 얻는다.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;예시(정확한 개념):&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;사용자가 (x) 를 암호화해 ct(x)로 보냄&lt;/li&gt;
&lt;li&gt;서버가 ct(x)에다 평문 가중치 (W) 를 적용해 선형층을 계산:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;평문이면: (y = xW)&lt;/li&gt;
&lt;li&gt;HE면: 서버는 &lt;b&gt;ct(y) = Eval(ct(x), W)&lt;/b&gt; 를 계산&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;결과도 &lt;b&gt;ct(y)&lt;/b&gt; 라는 잠긴 상자 형태로 나옴&lt;/li&gt;
&lt;li&gt;이걸 클라이언트가 받아서 비밀키로 열면 (y) 를 얻음&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉 서버는&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&amp;ldquo;계산은 했는데&amp;rdquo;&lt;/li&gt;
&lt;li&gt;&amp;ldquo;결과가 뭔지는 모르는 상태&amp;rdquo;로만 존재합니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;3) &amp;ldquo;토큰 번호를 암호화해서 보내는 거 아니야?&amp;rdquo;에 대한 정리&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;엄밀히는 이렇게 합니다.&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;(A) 토큰 ID를 그대로 암호화하면 곤란&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰 ID는 정수 1개인데, LLM 연산은 거대한 실수 벡터 연산이죠.&lt;br /&gt;그래서 보통은:&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;(B) 클라이언트가 &lt;b&gt;임베딩(lookup)을 먼저 수행&lt;/b&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;토큰 ID &amp;rarr; 임베딩 벡터 (x) 를 만든 뒤&lt;/li&gt;
&lt;li&gt;(x) 를 암호화해서 서버로 보냄&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 서버는 &lt;b&gt;토큰 ID를 볼 기회 자체가 없고&lt;/b&gt;,&lt;br /&gt;임베딩 벡터도 &lt;b&gt;암호문이라 못 봅니다&lt;/b&gt;.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;(논문에서도 &amp;ldquo;token embedding layer는 암호화하지 않고 업데이트하지 않는다&amp;rdquo;는 식으로 구성합니다. 즉 embedding은 고정이며, 사용자 데이터 보호는 embedding 이후부터 HE로 감싸는 구조입니다.)&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;4) &amp;ldquo;해석 못한다&amp;rdquo;는 게 정확히 무슨 의미?&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;서버 입장에서 ciphertext(ct)는 이런 상태입니다:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;겉보기엔 &amp;ldquo;숫자&amp;rdquo;가 들어있긴 한데&lt;/li&gt;
&lt;li&gt;그 숫자들은 암호학적으로 섞여 있어서&lt;/li&gt;
&lt;li&gt;&lt;b&gt;비밀키 없이는 원래 값(임베딩/hidden state/logit)을 알아내는 게 거의 불가능&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 &amp;ldquo;거의 불가능&amp;rdquo;은&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&amp;ldquo;시간이 좀 걸리면 가능&amp;rdquo;이 아니라&lt;/li&gt;
&lt;li&gt;현재 컴퓨팅 자원으로는 &lt;b&gt;현실적으로 불가능&lt;/b&gt;(암호 가정 하에서)이라는 뜻입니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;5) 한 단계 더 쉬운 비유 (가장 직관적인 그림)&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;  자물쇠 상자 비유&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;평문 값 (x) = 상자 안의 내용물&lt;/li&gt;
&lt;li&gt;암호문 ct(x) = 잠긴 상자&lt;/li&gt;
&lt;li&gt;비밀키 = 상자 열쇠(클라이언트만 가짐)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;서버는:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;상자끼리 더하기/곱하기는 할 수 있음 (특수한 공구가 있음)&lt;/li&gt;
&lt;li&gt;하지만 상자를 열 수는 없음&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 서버는:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;입력이 뭔지 모른 채로&lt;/li&gt;
&lt;li&gt;모델 연산을 진행하고&lt;/li&gt;
&lt;li&gt;출력도 &amp;ldquo;잠긴 상자&amp;rdquo;로 돌려줌&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;클라이언트만:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;출력 상자를 열어서 결과를 읽음&lt;/li&gt;
&lt;/ul&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;6) 그래서 &amp;ldquo;원본 모델이 평문이면 유추 가능?&amp;rdquo;이 왜 아니냐&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;유추 공격이 되려면 서버가 &lt;b&gt;중간 표현을 평문으로 관측&lt;/b&gt;해야 합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그런데 HE에서는&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;중간 hidden state도 전부 &lt;b&gt;ct(hidden)&lt;/b&gt; 형태의 잠긴 상자라서&lt;/li&gt;
&lt;li&gt;서버는 &amp;ldquo;레이어 출력이 어떤 값인지&amp;rdquo;를 관측할 수 없습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;따라서&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;초반 layer hidden으로 입력 복원&lt;/li&gt;
&lt;li&gt;후반 layer hidden으로 생성 토큰 유추&lt;br /&gt;같은 공격이 &lt;b&gt;관측값이 없어서&lt;/b&gt; 성립하기 어렵습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;마지막으로, 정말 중요한 한 줄 요약&lt;/h2&gt;
&lt;blockquote data-ke-style=&quot;style1&quot;&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;HE에서 서버는 &lt;b&gt;데이터를 &amp;lsquo;보지&amp;rsquo; 못하고&lt;/b&gt;,&lt;br /&gt;대신 &lt;b&gt;보지 못하는 상태로 계산만&lt;/b&gt; 한다.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;원하시면 제가 이해 확인용으로 아주 간단한 장난감 예시를 들어서&lt;br /&gt;&amp;ldquo;암호문 상태로 덧셈/곱셈을 하면 결과도 암호문으로 나온다&amp;rdquo;를&lt;br /&gt;숫자 2~3개로 직관적으로 시뮬레이션(개념 예시)해드릴까요?&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;핵심 혼동이 &lt;b&gt;&amp;ldquo;ct(x)가 (1&amp;times;100)처럼 보이면, 그 숫자들로 x를 역추정할 수 있지 않나?&amp;rdquo;&lt;/b&gt; 인데, HE(특히 CKKS)에서 &lt;b&gt;ciphertext는 &amp;lsquo;x를 살짝 섞은 벡터&amp;rsquo;가 아닙니다.&lt;/b&gt; 개념적으로만 &amp;ldquo;x를 담고 있다&amp;rdquo;고 말할 뿐, **서버가 보는 ct(x) 자체는 암호학적으로 &amp;lsquo;거의 랜덤한 큰 수 덩어리&amp;rsquo;**라서 x를 복원하는 게 계산적으로 불가능하다고 보는 게 정확합니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;아래를 단계적으로 보면 감이 잡힙니다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;1) &amp;ldquo;차원(1&amp;times;100)&amp;rdquo;은 표현 방식일 뿐, 서버가 보는 데이터 구조가 x와 같지 않습니다&lt;/h2&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;평문에서는 (x \in \mathbb{R}^{100}) 같은 벡터가 &amp;ldquo;100개의 실수&amp;rdquo;죠.&lt;/li&gt;
&lt;li&gt;CKKS에서는 이 100개 실수를 &lt;b&gt;ciphertext의 슬롯(slot)&lt;/b&gt; 에 &amp;ldquo;포장(packing)&amp;rdquo;합니다.&lt;/li&gt;
&lt;li&gt;하지만 ciphertext 자체는 보통 &lt;b&gt;(큰 다항식 2개 이상)&lt;/b&gt; 같은 형태(매우 큰 정수 계수들)로 저장됩니다.&lt;br /&gt;즉, &lt;b&gt;ct(x)의 물리적 크기/구조는 x(1&amp;times;100)와 전혀 다릅니다.&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문 구현도 &amp;ldquo;ciphertext 하나에 2^15개 정도 값을 SIMD로 담는다&amp;rdquo;는 식의 packing을 쓰고(예: 128&amp;times;256을 한 ciphertext에 pack), HE 연산(Add/Mult/Rot) 위에서만 의미가 있습니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;정리:&lt;/b&gt; &amp;ldquo;ct(x)가 1&amp;times;100처럼 생겼다&amp;rdquo;는 건 보통 우리가 그렇게 해석해서 넣어둔 것이지, 서버가 보는 원시 데이터가 x와 동형인 벡터라는 뜻이 아닙니다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;2) 서버가 ct(x)로 x를 못 맞추는 1차 이유: &lt;b&gt;확률적(랜덤) 암호화&lt;/b&gt;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;HE 암호화는 일반적으로 &lt;b&gt;같은 x를 두 번 암호화해도 매번 다른 ct(x)&lt;/b&gt; 가 나옵니다(랜덤이 들어감).&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;만약 서버가 ct(x)를 보고 x를 유추할 수 있다면,
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;동일 x에 대해 여러 개 ciphertext를 봤을 때 &amp;ldquo;같은 x&amp;rdquo;임을 식별하거나&lt;/li&gt;
&lt;li&gt;딕셔너리 매칭 같은 게 가능해야 하는데,&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;확률적 암호화에서는 &lt;b&gt;ct만 보고 동일성/값을 판별하기가 어렵게&lt;/b&gt; 설계됩니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이게 바로 논문이 말하는 &amp;ldquo;서버는 CKKS의 semantic security(의미적 보안성)에 의존한다&amp;rdquo;는 문장의 직관적 의미입니다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;3) 서버가 ct(x)로 x를 못 맞추는 2차 이유: &lt;b&gt;비밀키가 없으면 &amp;lsquo;복호 방정식&amp;rsquo;이 성립하지 않음&lt;/b&gt;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CKKS/RLWE 계열 암호를 아주 단순화하면 ciphertext는 대충 이런 관계를 가집니다(직관용):&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;ct는 (a, b) 같은 형태이고&lt;/li&gt;
&lt;li&gt;(b \approx a\cdot s + \text{noise} + \text{encode}(x))&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 서버는&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;a, b는 보지만&lt;/li&gt;
&lt;li&gt;&lt;b&gt;비밀키 s를 모릅니다&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;noise도 섞여 있습니다&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉 서버 입장에서는&lt;br /&gt;&amp;ldquo;모르는 s와 noise가 섞인 거대한 식&amp;rdquo;만 주어진 상태라서, 그걸 풀어 x를 얻는 문제는 &lt;b&gt;RLWE 가정 하에서 계산적으로 매우 어렵다&lt;/b&gt;고 봅니다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;4) &amp;ldquo;그럼 서버가 모델 가중치 W(평문)를 아니까, Eval 결과로 역추정 가능?&amp;rdquo;에 대해&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;서버는 다음을 할 수 있습니다:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;입력: ct(x)&lt;/li&gt;
&lt;li&gt;계산: ct(y) = Eval(W, ct(x)) (여기서 W는 평문)&lt;/li&gt;
&lt;li&gt;출력: ct(y)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 여기서도 서버는 &lt;b&gt;ct(y)만&lt;/b&gt; 얻습니다. y(평문)를 못 보죠.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;만약 서버가 &lt;b&gt;ct(x)와 평문 W만으로 x를 알아낼 수 있다면&lt;/b&gt;,&lt;br /&gt;그건 &amp;ldquo;암호문을 보고 평문을 복원&amp;rdquo;하는 능력이 있다는 뜻이고, 곧 &lt;b&gt;CKKS 보안을 깨는 것&lt;/b&gt;과 동일합니다. 논문이 전제하는 위협 모델에서는 그게 불가능하다고 가정합니다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;5) 현실적으로 남는 &amp;ldquo;누출&amp;rdquo;은 무엇이냐? (중요한 현실 체크)&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;HE가 &amp;ldquo;ct로부터 x 복원&amp;rdquo;을 막아주는 건 맞지만, 시스템 차원에서 다음은 별개 이슈입니다.&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;메타데이터 누출&lt;/b&gt;: 길이, 요청 패턴, 타이밍 등&lt;/li&gt;
&lt;li&gt;&lt;b&gt;사이드채널&lt;/b&gt;: 구현/하드웨어/스케줄링 기반 누출&lt;/li&gt;
&lt;li&gt;&lt;b&gt;생성(decoding) 단계&lt;/b&gt;: 샘플링/argmax는 HE 단독으로 까다로워서 설계에 따라 정보 노출면이 달라질 수 있음&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 질문하신 **&amp;ldquo;ct(x) 자체로 x를 유추&amp;rdquo;**는, 올바른 파라미터/구현 + 비밀키 비공개 + semantic security 가정 하에서는 &lt;b&gt;실질적으로 어렵다&lt;/b&gt;가 핵심입니다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;한 문장로 결론&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;ct(x)는 x를 &amp;lsquo;같은 차원으로 가린 값&amp;rsquo;이 아니라, 비밀키 없이는 해석할 수 없는 암호학적 객체&lt;/b&gt;라서 서버가 ct(x)만으로 x를 유추하는 건(가정 하에서) 불가능에 가깝습니다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;원하시면, &amp;ldquo;토큰 ID를 직접 암호화하면 왜 위험/비효율인지&amp;rdquo;와 &amp;ldquo;왜 보통 임베딩 이후를 암호화하는지&amp;rdquo;를 **1분짜리 예시(아주 작은 벡터/연산)**로 더 직관적으로 보여드릴게요.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;큰 틀에서는 &lt;b&gt;맞습니다.&lt;/b&gt; 이 논문(HE/CKKS) 설정에서는 &lt;b&gt;서버가 끝까지 &amp;ldquo;암호문 상태로만&amp;rdquo; 연산&lt;/b&gt;하고, &lt;b&gt;평문으로 푸는(복호) 건 클라이언트(사용자)만&lt;/b&gt; 합니다.&lt;br /&gt;다만 &amp;ldquo;그게 끝이냐?&amp;rdquo;에 대해선 &lt;b&gt;태스크가 분류/회귀인지, 생성(decoding)인지&lt;/b&gt;에 따라 실무 흐름이 달라집니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;아래에 &lt;b&gt;가장 현실적인 형태&lt;/b&gt;로 정리해드릴게요.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;1) 분류/회귀(논문이 실험한 GLUE 같은 경우)면 거의 &amp;ldquo;그게 끝&amp;rdquo;에 가깝다&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;전체 파이프라인 (클라이언트/서버 역할)&lt;/h3&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;b&gt;클라이언트&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;텍스트 &amp;rarr; 토크나이즈&lt;/li&gt;
&lt;li&gt;토큰 ID &amp;rarr; &lt;b&gt;임베딩 벡터&lt;/b&gt;로 변환(embedding layer는 고정, 업데이트 안 함)&lt;/li&gt;
&lt;li&gt;임베딩(및 필요한 입력 텐서들)을 &lt;b&gt;CKKS로 암호화&lt;/b&gt; &amp;rarr; ct(input)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;서버&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;모델 본체(Transformer, FFN, attention 등) 가중치는 &lt;b&gt;평문&lt;/b&gt;으로 보유&lt;/li&gt;
&lt;li&gt;ct(input)을 받아서, HE 연산(PCMM/CCMM, 근사 다항식, BTS 등)으로 &lt;b&gt;복호 없이&lt;/b&gt; 계산&lt;/li&gt;
&lt;li&gt;결과도 평문 logits가 아니라 &lt;b&gt;ct(output)&lt;/b&gt; 로 생성해서 반환&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;클라이언트&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;ct(output) 복호 &amp;rarr; output(예: logits, 회귀값)&lt;/li&gt;
&lt;li&gt;로컬에서 argmax/스코어 계산 후 결과 확인&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;➡️ 분류/회귀는 &lt;b&gt;한 번 보내고 한 번 받으면 끝&lt;/b&gt;인 구조로 설계하기 쉽습니다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;2) &amp;ldquo;사용자 컴퓨터는 임베딩만 있으면 되냐?&amp;rdquo; &amp;rarr; 거의 맞지만, 실제로는 아래가 추가로 필요합니다&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;클라이언트에 필요한 것들&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;(필수) 임베딩 레이어(가중치) + 토크나이저&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;(필수) HE 키 생성/보관&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;secret key(복호키): 클라이언트만 보관&lt;/li&gt;
&lt;li&gt;public/evaluation keys(연산용 키들: rotation/relinearization/bootstrapping 관련): 서버에 제공(연산을 가능하게 해주는 키이지, 복호를 가능하게 해주진 않음)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;(실무상 필수) 입력 길이/패킹 규격&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;HE는 보통 고정 길이(패딩)와 패킹(slot) 규칙이 필요합니다(논문도 packing/블록 MM을 자세히 다룹니다).&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;클라이언트에 &amp;ldquo;GPU가 꼭 필요하냐?&amp;rdquo;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;보통 &lt;b&gt;복호/암호화는 CPU로도 가능&lt;/b&gt;한 경우가 많지만,&lt;/li&gt;
&lt;li&gt;설정(파라미터, 길이, 배치)과 라이브러리에 따라 비용이 커질 수 있습니다.&lt;/li&gt;
&lt;li&gt;논문은 서버 측이 GPU를 사용해 HE 연산을 가속하는 쪽에 초점입니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;3) 그런데 &amp;ldquo;생성(Decoder-only)까지&amp;rdquo; 가면, 그게 끝이 아니다 (중요)&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;당신이 처음에 관심 가진 &amp;ldquo;출력 토큰을 숨긴 채 전달&amp;rdquo;은 보통 &lt;b&gt;생성/디코딩&lt;/b&gt; 쪽 이슈인데, 이때는 문제가 생깁니다:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;생성은 &lt;b&gt;토큰을 하나 뽑고 &amp;rarr; 그 토큰을 다시 입력에 붙여서 &amp;rarr; 다음 토큰을 뽑는&lt;/b&gt; 반복입니다.&lt;/li&gt;
&lt;li&gt;서버가 복호를 못 하므로, 서버 혼자서는 &amp;ldquo;이번 스텝에서 어떤 토큰을 선택했는지&amp;rdquo;를 결정하기 어렵습니다(비교/argmax/샘플링은 HE에 불리).&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 생성에서는 보통 둘 중 하나로 갑니다:&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;b&gt;클라이언트-주도 디코딩&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;서버가 매 스텝 &lt;b&gt;ct(logits)&lt;/b&gt; 를 보내고&lt;/li&gt;
&lt;li&gt;클라이언트가 복호해서 토큰 선택 후 다시 암호화해 다음 스텝 입력으로 전송&lt;br /&gt;&amp;rarr; 프라이버시는 강하지만, 왕복 통신이 많아짐.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;HE + MPC/인터랙티브 프로토콜&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;서버/클라이언트가 일부 상호작용해서 안전하게 샘플링/argmax를 수행&lt;br /&gt;&amp;rarr; 통신/프로토콜 복잡도 증가.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;논문은 주로 &lt;b&gt;BERT-style encoder + 분류(GLUE)&lt;/b&gt; 중심이라, 생성 디코딩의 완전한 종단 솔루션이라기보다는 &amp;ldquo;암호화된 개인화/추론이 가능해진다&amp;rdquo;에 초점이 있습니다.&lt;/p&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;4) 한 문장 결론&lt;/h2&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;분류/회귀 같은 1-shot 추론이면:&lt;/b&gt; 지금 말한 흐름(클라 임베딩+암호화 &amp;rarr; 서버 암호문 연산 &amp;rarr; 클라 복호)으로 &lt;b&gt;거의 끝&lt;/b&gt;입니다.&lt;/li&gt;
&lt;li&gt;&lt;b&gt;생성(토큰 디코딩)까지 완전히 &amp;ldquo;텍스트를 서버에 남기지 않기&amp;rdquo;를 하려면:&lt;/b&gt; 디코딩 설계가 추가로 필요합니다(클라 디코딩 또는 HE+MPC).&lt;/li&gt;
&lt;/ul&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;원하시면, 당신이 원래 찾던 목적(&amp;ldquo;출력 텍스트가 서버/네트워크에 평문으로 남지 않게&amp;rdquo;)에 맞춰서&lt;br /&gt;&lt;b&gt;(A) 클라이언트 디코딩 방식 vs (B) HE+MPC 디코딩 방식&lt;/b&gt;을 비용/지연/보안면에서 비교 표로 바로 정리해드릴까요?&lt;/p&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2510.03662&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2510.03662&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768843757482&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Operationalizing Data Minimization for Privacy-Preserving LLM Prompting&quot; data-og-description=&quot;The rapid deployment of large language models (LLMs) in consumer applications has led to frequent exchanges of personal information. To obtain useful responses, users often share more than necessary, increasing privacy risks via memorization, context-based&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2510.03662&quot; data-og-url=&quot;https://arxiv.org/abs/2510.03662v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/4TbZL/dJMb8T9ThZd/0xBFWWQQP2mc6OFKMDxAH1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/ZTEAH/dJMb8U8NuBn/5BELdvH7VRX90yGZo2Zmy1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2510.03662&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2510.03662&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/4TbZL/dJMb8T9ThZd/0xBFWWQQP2mc6OFKMDxAH1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/ZTEAH/dJMb8U8NuBn/5BELdvH7VRX90yGZo2Zmy1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Operationalizing Data Minimization for Privacy-Preserving LLM Prompting&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;The rapid deployment of large language models (LLMs) in consumer applications has led to frequent exchanges of personal information. To obtain useful responses, users often share more than necessary, increasing privacy risks via memorization, context-based&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ICLR 2026에 제출했네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLM 사용 과정에서 발생하는 과잉 정보 제공 문제를 다룸&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;사용자가 더 나은 답변을 기대하며 불필요하게 많은 개인 정보를 프롬프트에 포함시키지만 실제로 그 정보가 없어도 동일한 수준의 답변 품질을 유지할 수 있는 경우가 많음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존에는 개인 정보 탐지 및 마스킹에 집중하고, 얼마나 줄여도 되는가를 정량적으로 정의 및 측정하지 못했음. 또한 LLM-as-a-Judge 기반 접근은 모델 능력에 따라 판단이 흔들림&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 데이터 최소화를 최적화 문제로 공식화&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;입력 프롬프트의 민감한 Span 마다 RETAIN &amp;lt; ABSTRACT &amp;lt; REDACT 라는 프라이버시 강도 순서를 갖는 행동 공간을 정의함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1809&quot; data-origin-height=&quot;719&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dK64NO/dJMcadOfML8/OCwsZno0qF2mBGewTahF1K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dK64NO/dJMcadOfML8/OCwsZno0qF2mBGewTahF1K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dK64NO/dJMcadOfML8/OCwsZno0qF2mBGewTahF1K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdK64NO%2FdJMcadOfML8%2FOCwsZno0qF2mBGewTahF1K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1809&quot; height=&quot;719&quot; data-origin-width=&quot;1809&quot; data-origin-height=&quot;719&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;우선순위 큐를 통해 가장 프라이버시 친화적 후보부터 탐색하여 LLM으로 응답을 생성하고, Utility predicate로 성능 유지 여부를 판별한 뒤 처음으로 유틸리티를 만족하는 지점이 데이터 최소화 oracle로 판별한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 오라클은 모델별, 테스크 별로 다르기에 정답이 되는 최소 프롬프트를 실험적으로 계산한다는 점이 핵심이다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1389&quot; data-origin-height=&quot;319&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/LBICB/dJMcadgrTcN/vb1B8cpwxulggzKhjSSAqK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/LBICB/dJMcadgrTcN/vb1B8cpwxulggzKhjSSAqK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/LBICB/dJMcadgrTcN/vb1B8cpwxulggzKhjSSAqK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FLBICB%2FdJMcadgrTcN%2Fvb1B8cpwxulggzKhjSSAqK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1389&quot; height=&quot;319&quot; data-origin-width=&quot;1389&quot; data-origin-height=&quot;319&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;716&quot; data-origin-height=&quot;757&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/wN1hk/dJMcaiWmjQ5/BHo49daJtP4YRQdKKVC7Vk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/wN1hk/dJMcaiWmjQ5/BHo49daJtP4YRQdKKVC7Vk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/wN1hk/dJMcaiWmjQ5/BHo49daJtP4YRQdKKVC7Vk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FwN1hk%2FdJMcaiWmjQ5%2FBHo49daJtP4YRQdKKVC7Vk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;716&quot; height=&quot;757&quot; data-origin-width=&quot;716&quot; data-origin-height=&quot;757&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모델이 커질수록 더 강하게 최소화 해도 버텼으며 최신 gpt 모델은 프롬프트 대부분을 REDACT 해도 성능을 유지했다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 모델 능력이 곧 데이터 최소화 여유도&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLM에게 예측하라고 했을 때 필요 없는 정보까지 남기는 경향이 매우 커서 모델이 스스로 무엇이 필요한지 모른다는 능력이 결함되었다.&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1798&quot; data-start=&quot;194&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;388&quot; data-start=&quot;216&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;238&quot; data-start=&quot;216&quot;&gt;&lt;b&gt;문제 정의&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;388&quot; data-start=&quot;238&quot; data-col-size=&quot;lg&quot;&gt;LLM 사용 시 사용자가 필요 이상으로 개인정보(PII)를 프롬프트에 포함하는 &lt;b&gt;oversharing&lt;/b&gt; 문제가 만연함. 기존 연구는 PII 탐지&amp;middot;마스킹에 집중했을 뿐, &lt;b&gt;유틸리티를 유지하면서 최소한으로 공개해야 할 정보&lt;/b&gt;를 정량적으로 정의&amp;middot;계산하지 못함.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;480&quot; data-start=&quot;389&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;421&quot; data-start=&quot;389&quot;&gt;&lt;b&gt;핵심 질문&amp;nbsp;&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;480&quot; data-start=&quot;421&quot; data-col-size=&quot;lg&quot;&gt;주어진 LLM과 태스크에서, 답변 품질을 유지하기 위해 실제로 필요한 최소한의 정보는 무엇인가?&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;576&quot; data-start=&quot;481&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;507&quot; data-start=&quot;481&quot;&gt;&lt;b&gt;핵심 개념&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;576&quot; data-start=&quot;507&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Data Minimization&lt;/b&gt;을 &amp;ldquo;유틸리티 제약 하에서 프라이버시 노출을 최소화하는 최적화 문제&amp;rdquo;로 공식화.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;670&quot; data-start=&quot;577&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;604&quot; data-start=&quot;577&quot;&gt;&lt;b&gt;행동 공간&amp;nbsp;&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;670&quot; data-start=&quot;604&quot; data-col-size=&quot;lg&quot;&gt;각 민감 span에 대해 { &lt;b&gt;RETAIN &amp;lt; ABSTRACT &amp;lt; REDACT&lt;/b&gt; } (프라이버시 강도 순서)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;829&quot; data-start=&quot;671&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;690&quot; data-start=&quot;671&quot;&gt;&lt;b&gt;방법론&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;829&quot; data-start=&quot;690&quot; data-col-size=&quot;lg&quot;&gt;Privacy 순서로 정렬된 &lt;b&gt;priority-queue 기반 tree search&lt;/b&gt;를 통해, 가장 프라이버시 친화적인 프롬프트부터 탐색 &amp;rarr; 최초로 유틸리티 조건을 만족하는 지점을 &lt;b&gt;data minimization oracle&lt;/b&gt;로 정의&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;923&quot; data-start=&quot;830&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;860&quot; data-start=&quot;830&quot;&gt;&lt;b&gt;유틸리티 판별&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;923&quot; data-start=&quot;860&quot; data-col-size=&quot;lg&quot;&gt;Open-ended task: 응답 품질 비교 / Closed-ended task: 정답 정확도 유지 여부&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1005&quot; data-start=&quot;924&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;938&quot; data-start=&quot;924&quot;&gt;&lt;b&gt;평가 데이터셋&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1005&quot; data-start=&quot;938&quot; data-col-size=&quot;lg&quot;&gt;Open-ended: ShareGPT, WildChat&lt;br /&gt;Closed-ended: MedQA, CaseHOLD&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1078&quot; data-start=&quot;1006&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1018&quot; data-start=&quot;1006&quot;&gt;&lt;b&gt;평가 모델&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1078&quot; data-start=&quot;1018&quot; data-col-size=&quot;lg&quot;&gt;GPT-5, GPT-4.1, Claude, Exaone, Mistral, Qwen 등 총 9개 LLM&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1206&quot; data-start=&quot;1079&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1096&quot; data-start=&quot;1079&quot;&gt;&lt;b&gt;주요 실험 결과 ①&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1206&quot; data-start=&quot;1096&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Frontier LLM일수록 더 강한 데이터 최소화 가능&lt;/b&gt;&lt;br /&gt;&amp;rarr; GPT-5: open-ended 기준 &lt;b&gt;85.7% REDACT&lt;/b&gt;, Qwen2.5-0.5B: 19.3% REDACT&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1289&quot; data-start=&quot;1207&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1224&quot; data-start=&quot;1207&quot;&gt;&lt;b&gt;주요 실험 결과 ②&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1289&quot; data-start=&quot;1224&quot; data-col-size=&quot;lg&quot;&gt;Closed-ended 태스크에서는 &lt;b&gt;거의 모든 PII 제거 가능&lt;/b&gt; (GPT-4.1: 98% REDACT)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1376&quot; data-start=&quot;1290&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1307&quot; data-start=&quot;1290&quot;&gt;&lt;b&gt;주요 실험 결과 ③&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1376&quot; data-start=&quot;1307&quot; data-col-size=&quot;lg&quot;&gt;LLM 단독 예측은 oracle 대비 &lt;b&gt;Overshare가 지배적&lt;/b&gt;이며, 특히 &lt;b&gt;ABSTRACT 편향&lt;/b&gt;이 강함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1477&quot; data-start=&quot;1377&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1410&quot; data-start=&quot;1377&quot;&gt;&lt;b&gt;공격자 검증&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1477&quot; data-start=&quot;1410&quot; data-col-size=&quot;lg&quot;&gt;별도 공격 LLM을 통한 span/type 복원 실험에서, 제안한 최소화 프롬프트는 &lt;b&gt;복원 가능성 대폭 감소&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1581&quot; data-start=&quot;1478&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1504&quot; data-start=&quot;1478&quot;&gt;&lt;b&gt;핵심 발견&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1581&quot; data-start=&quot;1504&quot; data-col-size=&quot;lg&quot;&gt;이는 단순한 프라이버시 실패가 아니라, &lt;b&gt;LLM이 &amp;ldquo;무엇이 필요한 정보인지&amp;rdquo;를 잘 인식하지 못하는 capability gap&lt;/b&gt;임&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1697&quot; data-start=&quot;1582&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1606&quot; data-start=&quot;1582&quot;&gt;&lt;b&gt;의의&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1697&quot; data-start=&quot;1606&quot; data-col-size=&quot;lg&quot;&gt;데이터 최소화를 프라이버시 규칙이 아닌 &lt;b&gt;모델&amp;middot;태스크 종속적 최적화 문제&lt;/b&gt;로 정식화. 입력 프라이버시 보호 + LLM 해석 관점의 새로운 연구 방향 제시&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1798&quot; data-start=&quot;1698&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1715&quot; data-start=&quot;1698&quot;&gt;&lt;b&gt;한계 및 향후 과제&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1798&quot; data-start=&quot;1715&quot; data-col-size=&quot;lg&quot;&gt;모델별 necessity 인식 차이의 원인 규명 필요, on-device predictor / client-side 최소화 모델로의 확장 필요&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://icml.cc/virtual/2025/poster/45418&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://icml.cc/virtual/2025/poster/45418&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768844893863&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;ICML Poster An Efficient Private GPT Never Autoregressively Decodes&quot; data-og-description=&quot;The wide deployment of the generative pre-trained transformer (GPT) has raised privacy concerns for both clients and servers. While cryptographic primitives can be employed for secure GPT inference to protect the privacy of both parties, they introduce con&quot; data-og-host=&quot;icml.cc&quot; data-og-source-url=&quot;https://icml.cc/virtual/2025/poster/45418&quot; data-og-url=&quot;https://icml.cc/virtual/2025/poster/45418&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://icml.cc/virtual/2025/poster/45418&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://icml.cc/virtual/2025/poster/45418&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;ICML Poster An Efficient Private GPT Never Autoregressively Decodes&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;The wide deployment of the generative pre-trained transformer (GPT) has raised privacy concerns for both clients and servers. While cryptographic primitives can be employed for secure GPT inference to protect the privacy of both parties, they introduce con&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;icml.cc&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ICML 2025 Poster 논문이네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;클라이언트 입력과 서버 모델을 동시에 보호하기 위해 HE, MPC 기반 2PC를 사용하지만 디코딩 단계에 매 토큰마다 수백 라운드 통신하고, 비선형 연산으로 인해 지연이 매우 크다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 연구들은 암호 프로토콜을 최적화 하고 Transformer 구조를 수정하여 1-step secure decoding 구조는 유지하였다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;660&quot; data-origin-height=&quot;592&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/buYZok/dJMcaaqwmXu/Bb5qcAlxkc2Yh8SJ0hzIt1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/buYZok/dJMcaaqwmXu/Bb5qcAlxkc2Yh8SJ0hzIt1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/buYZok/dJMcaaqwmXu/Bb5qcAlxkc2Yh8SJ0hzIt1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbuYZok%2FdJMcaaqwmXu%2FBb5qcAlxkc2Yh8SJ0hzIt1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;660&quot; height=&quot;592&quot; data-origin-width=&quot;660&quot; data-origin-height=&quot;592&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;figure 1 실험을 통해 secure decoding의 latency는 입력 토큰 길이에 거의 민감하지 않음을 보여주었다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;토큰 길이가 16배 증가해도 전체 layency는 1.1 ~ 1.5배 수준이었다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;한 토큰이든 여러 토큰이든 secure forward 비용은 거의 같다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;638&quot; data-origin-height=&quot;605&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b2jPUD/dJMcadHvZ9a/d4rXVSMyiIPLslLS4eQUXK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b2jPUD/dJMcadHvZ9a/d4rXVSMyiIPLslLS4eQUXK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b2jPUD/dJMcadHvZ9a/d4rXVSMyiIPLslLS4eQUXK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb2jPUD%2FdJMcadHvZ9a%2Fd4rXVSMyiIPLslLS4eQUXK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;638&quot; height=&quot;605&quot; data-origin-width=&quot;638&quot; data-origin-height=&quot;605&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;POST = Public decOding and Secure verificaTion&amp;nbsp;&lt;br /&gt;= Autoregressive decoding을 secure 하게 하지 말고, 공개 모델로 미리 여러 토큰을 만들고 private 모델은 한 번에 검증만 하자!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;ldquo;작은 모델을 큰 모델에 distill해서 aligned public model을 만들고, online 단계에서는 public model이 n개의 draft token을 평문으로 생성한다.&lt;br /&gt;그 후 prefix와 draft를 조건으로 한 n+1 step의 private model 분포를 한 번의 secure forward로 계산하고, secure speculative verification을 통해 앞에서부터 accept된 토큰까지만 채택한다.&lt;br /&gt;reject 이후는 private 분포에서 bonus token을 샘플링하고 다음 step으로 넘어간다.&amp;rdquo;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;근데 distill은 결국 큰 모델 만큼 성능이 나와야 하는 거니까.....&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1099&quot; data-origin-height=&quot;319&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dCYUU9/dJMcafSUTHv/AkZk7pNWyNVLIClsYOjoOK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dCYUU9/dJMcafSUTHv/AkZk7pNWyNVLIClsYOjoOK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dCYUU9/dJMcafSUTHv/AkZk7pNWyNVLIClsYOjoOK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdCYUU9%2FdJMcafSUTHv%2FAkZk7pNWyNVLIClsYOjoOK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1099&quot; height=&quot;319&quot; data-origin-width=&quot;1099&quot; data-origin-height=&quot;319&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;2116&quot; data-start=&quot;230&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;368&quot; data-start=&quot;252&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;264&quot; data-start=&quot;252&quot;&gt;&lt;b&gt;연구 문제&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;368&quot; data-start=&quot;264&quot; data-col-size=&quot;lg&quot;&gt;Secure GPT inference에서 &lt;b&gt;autoregressive decoding&lt;/b&gt;은 토큰당 1회 secure forward가 필요하여 HE/MPC 기반 추론이 극도로 느림&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;454&quot; data-start=&quot;369&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;381&quot; data-start=&quot;369&quot;&gt;&lt;b&gt;핵심 관찰&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;454&quot; data-start=&quot;381&quot; data-col-size=&quot;lg&quot;&gt;Secure decoding의 latency는 &lt;b&gt;입력 토큰 길이에 거의 무관&lt;/b&gt; (1 token &amp;asymp; 8~16 tokens)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;566&quot; data-start=&quot;455&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;469&quot; data-start=&quot;455&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;566&quot; data-start=&quot;469&quot; data-col-size=&quot;lg&quot;&gt;토큰 &lt;b&gt;생성(generate)&lt;/b&gt; 과 &lt;b&gt;검증(verify)&lt;/b&gt; 를 분리하여, 생성은 public model, 검증만 private model이 secure하게 수행&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;633&quot; data-start=&quot;567&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;579&quot; data-start=&quot;567&quot;&gt;&lt;b&gt;제안 방법&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;633&quot; data-start=&quot;579&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;POST (Public decOding and Secure verificaTion)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;784&quot; data-start=&quot;634&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;651&quot; data-start=&quot;634&quot;&gt;&lt;b&gt;Offline 단계&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;784&quot; data-start=&quot;651&quot; data-col-size=&quot;lg&quot;&gt;Public model을 private model의 output distribution(top-k)에 맞게 &lt;b&gt;knowledge distillation&lt;/b&gt;하여 &lt;b&gt;aligned public model&lt;/b&gt; 생성 (사용자 입력과 무관)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;868&quot; data-start=&quot;785&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;805&quot; data-start=&quot;785&quot;&gt;&lt;b&gt;Online 단계 &amp;ndash; 1&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;868&quot; data-start=&quot;805&quot; data-col-size=&quot;lg&quot;&gt;Client가 aligned public model로 &lt;b&gt;&amp;gamma;개의 draft tokens&lt;/b&gt;를 평문으로 생성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1018&quot; data-start=&quot;869&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;889&quot; data-start=&quot;869&quot;&gt;&lt;b&gt;Online 단계 &amp;ndash; 2&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1018&quot; data-start=&quot;889&quot; data-col-size=&quot;lg&quot;&gt;Client+Server가 &lt;b&gt;1회 secure forward&lt;/b&gt;로 private model의 분포를 &lt;b&gt;암호화 상태로 계산&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1170&quot; data-start=&quot;1019&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1039&quot; data-start=&quot;1019&quot;&gt;&lt;b&gt;Online 단계 &amp;ndash; 3&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1170&quot; data-start=&quot;1039&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Secure speculative verification&lt;/b&gt;: 각 draft token을 &lt;b&gt;secure reject/accept 판단&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1260&quot; data-start=&quot;1171&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1187&quot; data-start=&quot;1171&quot;&gt;&lt;b&gt;Reject 처리&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1260&quot; data-start=&quot;1187&quot; data-col-size=&quot;lg&quot;&gt;첫 reject 지점에서 private 분포에서 &lt;b&gt;bonus token 1개 재샘플&lt;/b&gt;, 이후 즉시 다음 step으로 이동&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1367&quot; data-start=&quot;1261&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1273&quot; data-start=&quot;1261&quot;&gt;&lt;b&gt;보안 핵심&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1367&quot; data-start=&quot;1273&quot; data-col-size=&quot;lg&quot;&gt;Server는 입력을 모르고, Client는 private model 내부 분포를 모름 &lt;br /&gt;&amp;rarr; &lt;b&gt;표준 secure inference와 동일한 privacy 보장&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1470&quot; data-start=&quot;1368&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1381&quot; data-start=&quot;1368&quot;&gt;&lt;b&gt;정확도 보장&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1470&quot; data-start=&quot;1381&quot; data-col-size=&quot;lg&quot;&gt;Speculative sampling 이론에 의해 &lt;b&gt;private model 단독 decoding과 동일한 output distribution 보장&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1578&quot; data-start=&quot;1471&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1484&quot; data-start=&quot;1471&quot;&gt;&lt;b&gt;암호 최적화&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1578&quot; data-start=&quot;1484&quot; data-col-size=&quot;lg&quot;&gt;Division 제거(곱셈 변환), vocab 전체 비교 제거(OT 기반 selection) &amp;rarr; secure sampling overhead &lt;b&gt;~10&amp;times; 감소&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1669&quot; data-start=&quot;1579&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1591&quot; data-start=&quot;1579&quot;&gt;&lt;b&gt;실험 모델&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1669&quot; data-start=&quot;1591&quot; data-col-size=&quot;lg&quot;&gt;Vicuna-7B / FLAN-T5-XL (private) + LLaMA-68M&amp;middot;160M / T5-small&amp;middot;base (public)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1757&quot; data-start=&quot;1670&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1682&quot; data-start=&quot;1670&quot;&gt;&lt;b&gt;실험 환경&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1757&quot; data-start=&quot;1682&quot; data-col-size=&quot;lg&quot;&gt;LAN(1Gbps, 10ms), WAN(400Mbps, 40ms), SecretFlow-SPU + BumbleBee/Nimbus&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1830&quot; data-start=&quot;1758&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1781&quot; data-start=&quot;1758&quot;&gt;&lt;b&gt;Acceptance Ratio&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1830&quot; data-start=&quot;1781&quot; data-col-size=&quot;lg&quot;&gt;Distillation 후 &lt;b&gt;52% ~ 85%&lt;/b&gt; (모델 계열이 같을수록 높음)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1897&quot; data-start=&quot;1831&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1843&quot; data-start=&quot;1831&quot;&gt;&lt;b&gt;성능 향상&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1897&quot; data-start=&quot;1843&quot; data-col-size=&quot;lg&quot;&gt;End-to-end secure decoding &lt;b&gt;2.1&amp;times; ~ 6.0&amp;times; speedup&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1964&quot; data-start=&quot;1898&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1917&quot; data-start=&quot;1898&quot;&gt;&lt;b&gt;기존 연구 대비 차별점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1964&quot; data-start=&quot;1917&quot; data-col-size=&quot;lg&quot;&gt;암호 프로토콜/모델 구조 변경 없이 &lt;b&gt;decoding 구조 자체를 재설계&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2029&quot; data-start=&quot;1965&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1975&quot; data-start=&quot;1965&quot;&gt;&lt;b&gt;확장성&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2029&quot; data-start=&quot;1975&quot; data-col-size=&quot;lg&quot;&gt;더 강한 public model, 서버 제공 aligned model일수록 성능 지속 향상&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2116&quot; data-start=&quot;2030&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2043&quot; data-start=&quot;2030&quot;&gt;&lt;b&gt;한 줄 결론&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2116&quot; data-start=&quot;2043&quot; data-col-size=&quot;lg&quot;&gt;Secure GPT의 병목은 암호가 아니라 autoregressive 구조였으며, POST는 이를 구조적으로 제거한 접근&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;별로....&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1198</guid>
      <comments>https://yoonschallenge.tistory.com/1198#entry1198comment</comments>
      <pubDate>Tue, 20 Jan 2026 03:25:06 +0900</pubDate>
    </item>
    <item>
      <title>Privacy AI 관련 조사 7</title>
      <link>https://yoonschallenge.tistory.com/1197</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;이제 Inference를 할 때 text 생성 부분에서 프라이버시를 지켜야 하기 때문에...&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2305.18396&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2305.18396&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768818755786&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;LLMs Can Understand Encrypted Prompt: Towards Privacy-Computing Friendly Transformers&quot; data-og-description=&quot;The community explored to build private inference frameworks for transformer-based large language models (LLMs) in a server-client setting, where the server holds the model parameters and the client inputs its private data (or prompt) for inference. Howeve&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2305.18396&quot; data-og-url=&quot;https://arxiv.org/abs/2305.18396v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/d62WZQ/dJMb9cBBW5K/okLHWRzWcDSESwkY7HpiG0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bkz86o/dJMb9eTJse2/qLYPNkDQvaZfVnBqGz7BGK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2305.18396&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2305.18396&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/d62WZQ/dJMb9cBBW5K/okLHWRzWcDSESwkY7HpiG0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bkz86o/dJMb9eTJse2/qLYPNkDQvaZfVnBqGz7BGK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;LLMs Can Understand Encrypted Prompt: Towards Privacy-Computing Friendly Transformers&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;The community explored to build private inference frameworks for transformer-based large language models (LLMs) in a server-client setting, where the server holds the model parameters and the client inputs its private data (or prompt) for inference. Howeve&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;prompt가 서버에 평문으로 노출됨!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;또한 서버의 모델 파라미터 또한 보호해야 한다&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Private Inference가 해결책이지만 Transformer 기반 LLM에서는 연산량과 통신량이 과도하고, GELU, Softmax, LayerNorm 같은 연산이 HE/MPC 환경에서 병목임&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; Transformer 구조를 그대로 두고는 실용적인 Private Inference가 불가능!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;프라이버시에 친화적이지 않은 연산자를 암호 연산에 유리한 연산자로 근사하여 대체하고, fine-tuning으로 성능 복구하자&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;GELU, Softmax, Layernorm을 변경&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;선형연산인 FC와 Attention MatMul을 Homomorphic Encryption(BFV, RLWE 기반) 으로 변경&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;비선형 연산인 GELU와 Softmax, LN은 MPC (Oblivious Transfer 기반)으로 변경하여 모든 중간 결과는 secret sharing 상태를 유지한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;GELU =&amp;gt; RELU&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;GELU는 tanh + 다중 곱셈으로 MPC 비용이 폭팔하여 RELU로 변경하고 fine-tuning 하면 정확도 손실 거의 없고, 연산량 및 통신량 감소&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Softmax =&amp;gt; ReLU 기반 정규화&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;exp, max, recip을 제거하고 ReLU로 Attention mask &amp;minus;&amp;infin; 문제도 처리. Q/K/V projection만 재학습하면 됨.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LayerNorm =&amp;gt; Centering + Affine&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;sqrt, division 제거하고 분산 정보를&amp;nbsp; &amp;gamma;, &amp;beta;가 흡수하도록 fine-tuning&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;뒤쪽 레이어부터 차근 차근 교체하여 성능유지를 진행&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Layer 2, 8, 12개 가진 모델들을 테스트하며 진행&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;통신량과 연산 시간을 모두 줄임!&lt;/p&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1686&quot; data-start=&quot;249&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;371&quot; data-start=&quot;271&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;283&quot; data-start=&quot;271&quot;&gt;&lt;b&gt;연구 목적&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;371&quot; data-start=&quot;283&quot; data-col-size=&quot;lg&quot;&gt;LLM 서버-클라이언트 환경에서 &lt;b&gt;입력 프롬프트와 모델 파라미터를 모두 보호&lt;/b&gt;하면서도 &lt;b&gt;실용적인 속도의 private inference&lt;/b&gt;를 달성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;468&quot; data-start=&quot;372&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;384&quot; data-start=&quot;372&quot;&gt;&lt;b&gt;문제 정의&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;468&quot; data-start=&quot;384&quot; data-col-size=&quot;lg&quot;&gt;Transformer 기반 LLM은 &lt;b&gt;GELU, Softmax, LayerNorm&lt;/b&gt; 때문에 HE/MPC 환경에서 &lt;b&gt;연산&amp;middot;통신 비용 폭증&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;548&quot; data-start=&quot;469&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;481&quot; data-start=&quot;469&quot;&gt;&lt;b&gt;핵심 관찰&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;548&quot; data-start=&quot;481&quot; data-col-size=&quot;lg&quot;&gt;Private inference 비용의 &lt;b&gt;70% 이상이 비선형 연산(GELU/Softmax/LN)&lt;/b&gt; 에서 발생&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;676&quot; data-start=&quot;549&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;567&quot; data-start=&quot;549&quot;&gt;&lt;b&gt;기본 암호 프레임워크&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;676&quot; data-start=&quot;567&quot; data-col-size=&quot;lg&quot;&gt;&amp;bull; &lt;b&gt;선형 연산&lt;/b&gt;: Homomorphic Encryption (&lt;b&gt;BFV, RLWE 기반&lt;/b&gt;) &lt;br /&gt;&amp;bull; &lt;b&gt;비선형 연산&lt;/b&gt;: MPC (&lt;b&gt;Oblivious Transfer 기반&lt;/b&gt;)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;747&quot; data-start=&quot;677&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;691&quot; data-start=&quot;677&quot;&gt;&lt;b&gt;주요 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;747&quot; data-start=&quot;691&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;암호 친화적이지 않은 연산자를 구조적으로 대체&lt;/b&gt;하고 fine-tuning으로 정확도 복구&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;863&quot; data-start=&quot;748&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;764&quot; data-start=&quot;748&quot;&gt;&lt;b&gt;연산자 대체 전략&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;863&quot; data-start=&quot;764&quot; data-col-size=&quot;lg&quot;&gt;&amp;bull; &lt;b&gt;GELU &amp;rarr; ReLU&lt;/b&gt; &lt;br /&gt;&amp;bull; &lt;b&gt;Softmax &amp;rarr; ReLU + 합 정규화&lt;/b&gt; &lt;br /&gt;&amp;bull; &lt;b&gt;LayerNorm &amp;rarr; (x&amp;minus;mean)&amp;middot;&amp;gamma;+&amp;beta; (분산 제거)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;972&quot; data-start=&quot;864&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;887&quot; data-start=&quot;864&quot;&gt;&lt;b&gt;Substitution 방법론&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;972&quot; data-start=&quot;887&quot; data-col-size=&quot;lg&quot;&gt;&amp;bull; &lt;b&gt;뒤 레이어부터 점진적 교체&lt;/b&gt; &lt;br /&gt;&amp;bull; 각 단계마다 &lt;b&gt;fine-tuning + 검증&lt;/b&gt; &lt;br /&gt;&amp;bull; 허용 정확도 하락 &amp;le; &lt;b&gt;2%&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1044&quot; data-start=&quot;973&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;989&quot; data-start=&quot;973&quot;&gt;&lt;b&gt;수치 안정화 기법&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1044&quot; data-start=&quot;989&quot; data-col-size=&quot;lg&quot;&gt;Fixed-point overflow 방지를 위해 &lt;b&gt;Bound-aware loss&lt;/b&gt; 추가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1113&quot; data-start=&quot;1045&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1057&quot; data-start=&quot;1045&quot;&gt;&lt;b&gt;실험 모델&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1113&quot; data-start=&quot;1057&quot; data-col-size=&quot;lg&quot;&gt;BERT-Tiny (2L), BERT-Medium (8L), RoBERTa-Base (12L)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1156&quot; data-start=&quot;1114&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1125&quot; data-start=&quot;1114&quot;&gt;&lt;b&gt;데이터셋&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1156&quot; data-start=&quot;1125&quot; data-col-size=&quot;lg&quot;&gt;GLUE: &lt;b&gt;MRPC, SST-2, QNLI&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1207&quot; data-start=&quot;1157&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1174&quot; data-start=&quot;1157&quot;&gt;&lt;b&gt;성능 결과 (속도)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1207&quot; data-start=&quot;1174&quot; data-col-size=&quot;lg&quot;&gt;기존 Iron 대비 &lt;b&gt;최대 5&amp;times; 추론 속도 향상&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1246&quot; data-start=&quot;1208&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1225&quot; data-start=&quot;1208&quot;&gt;&lt;b&gt;성능 결과 (통신)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1246&quot; data-start=&quot;1225&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;통신량 최대 80% 감소&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1290&quot; data-start=&quot;1247&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1260&quot; data-start=&quot;1247&quot;&gt;&lt;b&gt;정확도 변화&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1290&quot; data-start=&quot;1260&quot; data-col-size=&quot;lg&quot;&gt;대부분 task에서 &lt;b&gt;동등 또는 소폭 향상&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1372&quot; data-start=&quot;1291&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1304&quot; data-start=&quot;1291&quot;&gt;&lt;b&gt;중요한 발견&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1372&quot; data-start=&quot;1304&quot; data-col-size=&quot;lg&quot;&gt;ReLU 기반 Transformer가 &lt;b&gt;fine-tuning 환경에서는 GELU보다 성능이 더 좋은 경우 존재&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1426&quot; data-start=&quot;1373&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1385&quot; data-start=&quot;1373&quot;&gt;&lt;b&gt;보안 모델&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1426&quot; data-start=&quot;1385&quot; data-col-size=&quot;lg&quot;&gt;Semi-honest adversary, 입력&amp;middot;모델 프라이버시 보장&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1572&quot; data-start=&quot;1427&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1443&quot; data-start=&quot;1427&quot;&gt;&lt;b&gt;논문의 핵심 기여&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1572&quot; data-start=&quot;1443&quot; data-col-size=&quot;lg&quot;&gt;1) Transformer private inference 병목 정량화 &lt;br /&gt;2) &lt;b&gt;Privacy-Computing Friendly Transformer 설계 원칙 제시&lt;/b&gt; &lt;br /&gt;3) SOTA 수준의 속도&amp;middot;통신 효율&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1686&quot; data-start=&quot;1573&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1590&quot; data-start=&quot;1573&quot;&gt;&lt;b&gt;한계 및 향후 과제&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1686&quot; data-start=&quot;1590&quot; data-col-size=&quot;lg&quot;&gt;&amp;bull; 초기 LayerNorm 일부는 교체 어려움 &lt;br /&gt;&amp;bull; Decoder-only LLM 확장 필요 &lt;br /&gt;&amp;bull; Distillation / pruning 결합 가능성&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2508.09442&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2508.09442&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768821096207&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference&quot; data-og-description=&quot;The Key-Value (KV) cache, which stores intermediate attention computations (Key and Value pairs) to avoid redundant calculations, is a fundamental mechanism for accelerating Large Language Model (LLM) inference. However, this efficiency optimization introd&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2508.09442&quot; data-og-url=&quot;https://arxiv.org/abs/2508.09442v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/HoQiP/dJMb9c9rLV1/JIP0YuUg51gZk6XfPCgn01/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/b2eyqj/dJMb9iIAYdO/9IfNCWIjgRjFKiADNIz1c1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2508.09442&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2508.09442&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/HoQiP/dJMb9c9rLV1/JIP0YuUg51gZk6XfPCgn01/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/b2eyqj/dJMb9iIAYdO/9IfNCWIjgRjFKiADNIz1c1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;The Key-Value (KV) cache, which stores intermediate attention computations (Key and Value pairs) to avoid redundant calculations, is a fundamental mechanism for accelerating Large Language Model (LLM) inference. However, this efficiency optimization introd&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLM 추론 가속을 위해 사용되는 KV-Cache는 성능을 위한 설계지만 이로부터 prompt를 복구할 수 있는 프라이버시 취약점이 발생&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;642&quot; data-origin-height=&quot;613&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/EJ9Lv/dJMcajnptVU/vjAHoXibTI7K3nsTJDe231/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/EJ9Lv/dJMcajnptVU/vjAHoXibTI7K3nsTJDe231/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/EJ9Lv/dJMcajnptVU/vjAHoXibTI7K3nsTJDe231/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FEJ9Lv%2FdJMcajnptVU%2FvjAHoXibTI7K3nsTJDe231%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;642&quot; height=&quot;613&quot; data-origin-width=&quot;642&quot; data-origin-height=&quot;613&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;공격자는 LLM 추론 서비스 제공자 또는 내부자로 정하고, 공격자는 모델 가중치를 알며 prompt를 복원하려고 시도한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1494&quot; data-origin-height=&quot;348&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/VR0Fn/dJMcaiB2IKx/7d7chZiYowEQn9o1KJEcck/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/VR0Fn/dJMcaiB2IKx/7d7chZiYowEQn9o1KJEcck/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/VR0Fn/dJMcaiB2IKx/7d7chZiYowEQn9o1KJEcck/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FVR0Fn%2FdJMcaiB2IKx%2F7d7chZiYowEQn9o1KJEcck%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1494&quot; height=&quot;348&quot; data-origin-width=&quot;1494&quot; data-origin-height=&quot;348&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;&lt;br /&gt;k = x * Wk 이므로 W가 가역이면 x를 역 연산할 수 있다.&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;이를 통해 MHA와 첫 번째 레이어일 경우 복구하는 것을 볼 수 있었다.&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;prompt injection도 완벽한 복원은 아니지만 의미적 정보를 대량으로 유출하는 것을 볼 수 있었음&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;기존 암호화 방법(AES/HE)는 지연이 너무 심하고, DP에서 의미있는 &amp;epsilon;는 정확도가 붕괴하며 KV-Shield는 고정된 permutation으로 collision/CPA에 취약하고, RoPE가 비호환이다.&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;KC-Cloak를 통해 보안 극대화&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;860&quot; data-origin-height=&quot;687&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/canZVR/dJMcahC99Vf/YbKeQeMl1wedpnHbu4JXQ0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/canZVR/dJMcahC99Vf/YbKeQeMl1wedpnHbu4JXQ0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/canZVR/dJMcahC99Vf/YbKeQeMl1wedpnHbu4JXQ0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcanZVR%2FdJMcahC99Vf%2FYbKeQeMl1wedpnHbu4JXQ0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;860&quot; height=&quot;687&quot; data-origin-width=&quot;860&quot; data-origin-height=&quot;687&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;div&gt;&lt;br /&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 895px;&quot; border=&quot;1&quot; data-end=&quot;2622&quot; data-start=&quot;229&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;394&quot; data-start=&quot;251&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;263&quot; data-start=&quot;251&quot;&gt;&lt;b&gt;연구 배경&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;394&quot; data-start=&quot;263&quot; data-col-size=&quot;xl&quot;&gt;LLM 추론 가속을 위해 사용하는 &lt;b&gt;KV-cache&lt;/b&gt;가 실무 환경에서 평문으로 저장&amp;middot;전송됨. 이는 성능 최적화를 위한 설계 선택이지만, &lt;b&gt;사용자 입력(prompt)이 직접 유출될 수 있는 새로운 프라이버시 공격면&lt;/b&gt;을 형성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;507&quot; data-start=&quot;395&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;409&quot; data-start=&quot;395&quot;&gt;&lt;b&gt;핵심 문제의식&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;507&quot; data-start=&quot;409&quot; data-col-size=&quot;xl&quot;&gt;기존 프라이버시 연구는 출력(output)이나 embedding 중심 &lt;br /&gt;&amp;rarr; &lt;b&gt;KV-cache라는 중간 상태(intermediate state)의 위험성은 거의 미연구&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;613&quot; data-start=&quot;508&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;525&quot; data-start=&quot;508&quot;&gt;&lt;b&gt;연구 질문 (RQ)&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;613&quot; data-start=&quot;525&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;RQ1&lt;/b&gt;: KV-cache로부터 사용자 입력을 복원할 수 있는가? &lt;br /&gt;&lt;b&gt;RQ2&lt;/b&gt;: 정확도 저하 없이, 실무적으로 이를 방어할 수 있는가?&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;743&quot; data-start=&quot;614&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;626&quot; data-start=&quot;614&quot;&gt;&lt;b&gt;위협 모델&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;743&quot; data-start=&quot;626&quot; data-col-size=&quot;xl&quot;&gt;공격자는 &lt;b&gt;KV-cache + 모델 가중치(gray-box)&lt;/b&gt; 접근 가능 (CSP/내부자). GPU 레지스터 등 일시적 activation은 접근 불가. 목표는 &lt;b&gt;입력 텍스트의 정확&amp;middot;의미적 복원&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot; data-end=&quot;872&quot; data-start=&quot;744&quot;&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;773&quot; data-start=&quot;744&quot;&gt;&lt;b&gt;공격 1: Inversion Attack&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot; data-end=&quot;872&quot; data-start=&quot;773&quot; data-col-size=&quot;xl&quot;&gt;K,V = x&amp;middot;W &amp;rarr; W가 가역이면 x 역산. &lt;br /&gt;&amp;bull; &lt;b&gt;1st layer + MHA&lt;/b&gt;에서만 효과적 &lt;br /&gt;&amp;bull; GQA/MLA, deep layer에서는 거의 실패&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 84px;&quot; data-end=&quot;1110&quot; data-start=&quot;873&quot;&gt;
&lt;td style=&quot;height: 84px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;907&quot; data-start=&quot;873&quot;&gt;&lt;b&gt;공격 2: Collision Attack (핵심)&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 84px;&quot; data-end=&quot;1110&quot; data-start=&quot;907&quot; data-col-size=&quot;xl&quot;&gt;후보 토큰을 하나씩 넣어 &lt;b&gt;생성된 KV-cache와 leaked KV-cache 간 거리 최소화&lt;/b&gt;로 토큰 식별 &lt;br /&gt;&amp;bull; 모든 layer, 최신 LLM(GQA 포함)에 적용 &lt;br /&gt;&amp;bull; 확률 기반 pruning + batch outlier detection으로 &lt;b&gt;실용적 공격 속도 달성&lt;/b&gt; &lt;br /&gt;&amp;bull; CPA 활용 시 &lt;b&gt;거의 100% 입력 복원&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 84px;&quot; data-end=&quot;1316&quot; data-start=&quot;1111&quot;&gt;
&lt;td style=&quot;height: 84px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1140&quot; data-start=&quot;1111&quot;&gt;&lt;b&gt;공격 3: Injection Attack&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 84px;&quot; data-end=&quot;1316&quot; data-start=&quot;1140&quot; data-col-size=&quot;xl&quot;&gt;탈취한 KV-cache 뒤에 &amp;ldquo;Repeat the previous content&amp;rdquo; 같은 instruction을 주입 &lt;br /&gt;&amp;rarr; &lt;b&gt;LLM이 스스로 cache를 해석해 의미적 정보 유출&lt;/b&gt; &lt;br /&gt;&amp;bull; 단 1회 inference &lt;br /&gt;&amp;bull; verbatim은 아니지만 &lt;b&gt;의미 유출(BERTScore&amp;asymp;0.58)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1423&quot; data-start=&quot;1317&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1332&quot; data-start=&quot;1317&quot;&gt;&lt;b&gt;공격 실험 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;1423&quot; data-start=&quot;1332&quot; data-col-size=&quot;xl&quot;&gt;Plain KV-cache에서는 대부분의 모델에서 &lt;b&gt;높은 입력 복원율&lt;/b&gt; 확인 &lt;br /&gt;&amp;rarr; KV-cache 유출은 &lt;b&gt;이론이 아닌 실질적 위협&lt;/b&gt;임을 입증&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot; data-end=&quot;1583&quot; data-start=&quot;1424&quot;&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1440&quot; data-start=&quot;1424&quot;&gt;&lt;b&gt;기존 방어의 한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot; data-end=&quot;1583&quot; data-start=&quot;1440&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; &lt;b&gt;암호화(AES/HE)&lt;/b&gt;: KV-cache 크기 때문에 지연 과다 &lt;br /&gt;&amp;bull; &lt;b&gt;DP&lt;/b&gt;: 의미 있는 &amp;epsilon;에서 정확도 붕괴 &lt;br /&gt;&amp;bull; &lt;b&gt;KV-Shield&lt;/b&gt;: 고정 permutation &amp;rarr; Collision/CPA에 취약, RoPE 비호환&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;1716&quot; data-start=&quot;1584&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1606&quot; data-start=&quot;1584&quot;&gt;&lt;b&gt;제안 기법: KV-Cloak&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;1716&quot; data-start=&quot;1606&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;가역 선형 변환 + block-wise one-time permutation&lt;/b&gt;으로 KV-cache를 통계&amp;middot;의미적으로 무력화 &lt;br /&gt;&lt;span&gt;&lt;span&gt; K' = S &lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;P&lt;/span&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;span&gt;^&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;(K + A)M&lt;/span&gt;&lt;/span&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1808&quot; data-start=&quot;1717&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1732&quot; data-start=&quot;1717&quot;&gt;&lt;b&gt;기술적 핵심 1&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1808&quot; data-start=&quot;1732&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;One-time permutation&lt;/b&gt;으로 토큰 위치&amp;ndash;cache 대응 완전 붕괴 &amp;rarr; Collision Attack 원천 차단&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1907&quot; data-start=&quot;1809&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1824&quot; data-start=&quot;1809&quot;&gt;&lt;b&gt;기술적 핵심 2&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1907&quot; data-start=&quot;1824&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;Operator Fusion&lt;/b&gt;: 변환 행렬을 attention weight에 사전 결합 &amp;rarr; RoPE 호환, &lt;b&gt;정확도 수식적으로 동일&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;2019&quot; data-start=&quot;1908&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1921&quot; data-start=&quot;1908&quot;&gt;&lt;b&gt;보안성 평가&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;2019&quot; data-start=&quot;1921&quot; data-col-size=&quot;xl&quot;&gt;Inversion / Collision / Collision+ / Injection &lt;b&gt;모두 실패&lt;/b&gt; &lt;br /&gt;&amp;rarr; 복원 결과가 &lt;b&gt;랜덤 문자열과 통계적으로 구분 불가&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;2111&quot; data-start=&quot;2020&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2039&quot; data-start=&quot;2020&quot;&gt;&lt;b&gt;정확도(Utility)&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;2111&quot; data-start=&quot;2039&quot; data-col-size=&quot;xl&quot;&gt;MMLU, SQuAD 등에서 &lt;b&gt;Plaintext와 완전히 동일&lt;/b&gt; &lt;br /&gt;&amp;rarr; &lt;b&gt;Lossless defense&lt;/b&gt; 입증&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;2191&quot; data-start=&quot;2112&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2126&quot; data-start=&quot;2112&quot;&gt;&lt;b&gt;성능 오버헤드&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;2191&quot; data-start=&quot;2126&quot; data-col-size=&quot;xl&quot;&gt;KV-Cloak(fused): &lt;b&gt;~15 ms / GB&lt;/b&gt; &lt;br /&gt;&amp;rarr; prefill 대비 &lt;b&gt;&amp;lt; 0.5%&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;2258&quot; data-start=&quot;2192&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2207&quot; data-start=&quot;2192&quot;&gt;&lt;b&gt;아키텍처 호환성&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;2258&quot; data-start=&quot;2207&quot; data-col-size=&quot;xl&quot;&gt;vLLM, PagedAttention(block 16/32/64)와 &lt;b&gt;완전 호환&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot; data-end=&quot;2405&quot; data-start=&quot;2259&quot;&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2275&quot; data-start=&quot;2259&quot;&gt;&lt;b&gt;논문의 핵심 기여&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot; data-end=&quot;2405&quot; data-start=&quot;2275&quot; data-col-size=&quot;xl&quot;&gt;① KV-cache를 &lt;b&gt;LLM 프라이버시의 핵심 취약점&lt;/b&gt;으로 정식화 &lt;br /&gt;② &lt;b&gt;실질적 입력 복원 공격(Collision)&lt;/b&gt; 제시 &lt;br /&gt;③ &lt;b&gt;정확도 손실 없는 KV-cache 전용 방어(KV-Cloak)&lt;/b&gt; 제안&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot; data-end=&quot;2520&quot; data-start=&quot;2406&quot;&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2423&quot; data-start=&quot;2406&quot;&gt;&lt;b&gt;한계 및 향후 과제&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot; data-end=&quot;2520&quot; data-start=&quot;2423&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; Key 관리(TEE 의존) &lt;br /&gt;&amp;bull; Quantized KV-cache(INT8/4) 확장 &lt;br /&gt;&amp;bull; activation/MoE routing 보호로 확장 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;2622&quot; data-start=&quot;2521&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2534&quot; data-start=&quot;2521&quot;&gt;&lt;b&gt;한 줄 요약&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;2622&quot; data-start=&quot;2534&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;&amp;ldquo;KV-cache는 LLM 프라이버시의 새로운 핵심 공격면이며, KV-Cloak은 이를 거의 유일하게 lossless로 막는 실무적 해법이다.&amp;rdquo;&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://icml.cc/virtual/2025/poster/45330&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://icml.cc/virtual/2025/poster/45330&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768822732181&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;ICML Poster Hidden No More: Attacking and Defending Private Third-Party LLM Inference&quot; data-og-description=&quot;Large language models (LLMs) are often run by third-party services, raising serious concerns about user data privacy. This risk motivates the need for protocols which run LLMs on encrypted prompts instead of raw user data. While many such protocols are pro&quot; data-og-host=&quot;icml.cc&quot; data-og-source-url=&quot;https://icml.cc/virtual/2025/poster/45330&quot; data-og-url=&quot;https://icml.cc/virtual/2025/poster/45330&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://icml.cc/virtual/2025/poster/45330&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://icml.cc/virtual/2025/poster/45330&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;ICML Poster Hidden No More: Attacking and Defending Private Third-Party LLM Inference&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Large language models (LLMs) are often run by third-party services, raising serious concerns about user data privacy. This risk motivates the need for protocols which run LLMs on encrypted prompts instead of raw user data. While many such protocols are pro&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;icml.cc&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ICML에 붙은 논문입니다!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그냥 Prompt를 text로 넣는 것 부터 시작해서 prompt를 보호하기 위해 초반과 후반 layer는 user 단에 두고, 연산량이 큰 middle layer는 서버에 둬서 진행하는 방법이 나오고 있다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러나 이렇게 진행해도 prompt의 유출은 막을 수 없다!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Hidden state를 볼 수 있으면 이전 layer를 활용하여 구할 수 있기 때문이다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1603&quot; data-origin-height=&quot;731&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c3HcYy/dJMcac9EUvo/HW5HSNKisGJ0Y5kaUvO6nk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c3HcYy/dJMcac9EUvo/HW5HSNKisGJ0Y5kaUvO6nk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c3HcYy/dJMcac9EUvo/HW5HSNKisGJ0Y5kaUvO6nk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc3HcYy%2FdJMcac9EUvo%2FHW5HSNKisGJ0Y5kaUvO6nk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1603&quot; height=&quot;731&quot; data-origin-width=&quot;1603&quot; data-origin-height=&quot;731&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;autoregressive 구조와 공개된 모델 가중치를 이용해 hidden state와 가장 잘 맞는 토큰을 어휘 단위로 하나씩 역추적하여 선형 수준의 복잡도로 프롬프트를 복원할 수 있다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Cascade는 hidden state를 토큰 단위로 분할(sharding)하여 어느 단일 파티도 완전한 시퀀스 정보를 볼 수 없게 설계한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;암호학적 MPC보다 훨씬 낮은 통신, 연산비용이 들며 기존 hidden-state / logit reversal 공격을 모두 방어함&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1660&quot; data-start=&quot;206&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;352&quot; data-start=&quot;231&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;243&quot; data-start=&quot;231&quot;&gt;&lt;b&gt;연구 배경&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;352&quot; data-start=&quot;243&quot; data-col-size=&quot;lg&quot;&gt;대규모 LLM을 직접 실행하기 어려워 &lt;b&gt;서드파티 추론&lt;/b&gt;이 보편화됨. 프롬프트 대신 &lt;b&gt;hidden state / embedding&lt;/b&gt;만 서버에 보내면 안전하다는 기존 가정이 널리 사용됨&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;412&quot; data-start=&quot;353&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;367&quot; data-start=&quot;353&quot;&gt;&lt;b&gt;핵심 문제의식&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;412&quot; data-start=&quot;367&quot; data-col-size=&quot;lg&quot;&gt;&amp;ldquo;hidden state만 노출되어도 원본 프롬프트가 복원 가능한가?&amp;rdquo;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;527&quot; data-start=&quot;413&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;425&quot; data-start=&quot;413&quot;&gt;&lt;b&gt;위협 모델&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;527&quot; data-start=&quot;425&quot; data-col-size=&quot;lg&quot;&gt;Open-weights LLM, 공격자는 &lt;b&gt;모델 가중치 + 중간 hidden state(또는 permutation된 형태)&lt;/b&gt; 에 접근 가능한 semi-honest party&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;636&quot; data-start=&quot;528&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;540&quot; data-start=&quot;528&quot;&gt;&lt;b&gt;제안 공격&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;636&quot; data-start=&quot;540&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Vocab-Matching Attack&lt;/b&gt;: autoregressive 특성을 이용해 hidden state와 가장 잘 맞는 토큰을 &lt;b&gt;어휘 단위로 순차 복원&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;778&quot; data-start=&quot;696&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;708&quot; data-start=&quot;696&quot;&gt;&lt;b&gt;공격 성능&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;778&quot; data-start=&quot;708&quot; data-col-size=&quot;lg&quot;&gt;Gemma-2-2B-IT, Llama-3.1-8B-Instruct 등에서 &lt;b&gt;프롬프트 복원 정확도 &amp;asymp; 99~100%&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;917&quot; data-start=&quot;779&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;793&quot; data-start=&quot;779&quot;&gt;&lt;b&gt;무력화된 방어&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;917&quot; data-start=&quot;793&quot; data-col-size=&quot;lg&quot;&gt;Sequence permutation, Hidden-dim permutation, Factorized-2D permutation, Gaussian noise, Quantization &amp;rarr; &lt;b&gt;모두 실질적 방어 실패&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1001&quot; data-start=&quot;918&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;933&quot; data-start=&quot;918&quot;&gt;&lt;b&gt;핵심 실증 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1001&quot; data-start=&quot;933&quot; data-col-size=&quot;lg&quot;&gt;LLM hidden state는 &lt;b&gt;고차원에서도 매우 비충돌적(non-colliding)&lt;/b&gt; &amp;rarr; 사실상 원문과 동형&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1081&quot; data-start=&quot;1002&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1017&quot; data-start=&quot;1002&quot;&gt;&lt;b&gt;기존 방식 한계&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1081&quot; data-start=&quot;1017&quot; data-col-size=&quot;lg&quot;&gt;&amp;ldquo;Permutation 공간이 크다 = 안전하다&amp;rdquo;는 &lt;b&gt;통계적 직관이 실제 추론 구조에서는 성립하지 않음&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1164&quot; data-start=&quot;1082&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1094&quot; data-start=&quot;1082&quot;&gt;&lt;b&gt;제안 방어&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1164&quot; data-start=&quot;1094&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Cascade&lt;/b&gt;: token-dimension sharding 기반 &lt;b&gt;multi-party inference&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1241&quot; data-start=&quot;1165&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1187&quot; data-start=&quot;1165&quot;&gt;&lt;b&gt;Cascade 핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1241&quot; data-start=&quot;1187&quot; data-col-size=&quot;lg&quot;&gt;어떤 단일 파티도 &lt;b&gt;연속 토큰의 hidden state를 보지 못하게 구조적으로 차단&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1324&quot; data-start=&quot;1242&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1260&quot; data-start=&quot;1242&quot;&gt;&lt;b&gt;Cascade 보안성&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1324&quot; data-start=&quot;1260&quot; data-col-size=&quot;lg&quot;&gt;vocab-matching 공격 및 기존 hidden/logit reversal 공격 &lt;b&gt;모두 방어 가능&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1394&quot; data-start=&quot;1325&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1343&quot; data-start=&quot;1325&quot;&gt;&lt;b&gt;Cascade 효율성&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1394&quot; data-start=&quot;1343&quot; data-col-size=&quot;lg&quot;&gt;MPCFormer, Puma 대비 &lt;b&gt;최대 90~160&amp;times; 빠르고 통신량 대폭 감소&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1465&quot; data-start=&quot;1395&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1404&quot; data-start=&quot;1395&quot;&gt;&lt;b&gt;한계&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1465&quot; data-start=&quot;1404&quot; data-col-size=&quot;lg&quot;&gt;Layer-0 embedding은 본질적으로 토큰 복원 가능 &amp;rarr; &lt;b&gt;완전 보안은 SMPC 결합 필요&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1557&quot; data-start=&quot;1466&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1475&quot; data-start=&quot;1466&quot;&gt;&lt;b&gt;결론&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1557&quot; data-start=&quot;1475&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;hidden state는 plaintext와 다르지 않음&lt;/b&gt;. 구조적 분리 없이 representation만 숨기는 방식은 안전하지 않음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1660&quot; data-start=&quot;1558&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1571&quot; data-start=&quot;1558&quot;&gt;&lt;b&gt;연구적 의의&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1660&quot; data-start=&quot;1571&quot; data-col-size=&quot;lg&quot;&gt;private inference, embedding privacy, hidden-state obfuscation에 대한 &lt;b&gt;기본 가정 자체를 붕괴&lt;/b&gt;시킴&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2509.08383&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2509.08383&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768823648215&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Efficient Decoding Methods for Language Models on Encrypted Data&quot; data-og-description=&quot;Large language models (LLMs) power modern AI applications, but processing sensitive data on untrusted servers raises privacy concerns. Homomorphic encryption (HE) enables computation on encrypted data for secure inference. However, neural text generation r&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2509.08383&quot; data-og-url=&quot;https://arxiv.org/abs/2509.08383v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/cwcnRM/dJMb9gxfbEM/aY8pvBKbSOMsf0bOaz32V0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/eCwkC/dJMb9cBBXpy/6gISSWpetwTa8CckcuBzgk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2509.08383&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2509.08383&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/cwcnRM/dJMb9gxfbEM/aY8pvBKbSOMsf0bOaz32V0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/eCwkC/dJMb9cBBXpy/6gISSWpetwTa8CckcuBzgk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Efficient Decoding Methods for Language Models on Encrypted Data&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Large language models (LLMs) power modern AI applications, but processing sensitive data on untrusted servers raises privacy concerns. Homomorphic encryption (HE) enables computation on encrypted data for secure inference. However, neural text generation r&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;동형 암호(HE) 환경에서 LLM 텍스트 생성을 실질적으로 가능하게 하는 것을 목표로!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;HE는 덧셈이나 곱셈과 같은 다항 연산만 지원하지만 LLM Decoding의 핵심인 argmax나 top-p나 nucleus sampling은 비교, 정렬, 조건 분기 등 비다항 연산에 의존함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 기존 HE argmax는 vocab이 커질수록 지연 시간이 지속적으로 늘어나 LLM이 암호화된 상태에서 여러 토큰을 생성하는 것은 비현실적&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1190&quot; data-origin-height=&quot;618&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/qXLED/dJMcabQuqHZ/X0Z3zbC9o9HprH4c8L9Epk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/qXLED/dJMcabQuqHZ/X0Z3zbC9o9HprH4c8L9Epk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/qXLED/dJMcabQuqHZ/X0Z3zbC9o9HprH4c8L9Epk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FqXLED%2FdJMcabQuqHZ%2FX0Z3zbC9o9HprH4c8L9Epk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1190&quot; height=&quot;618&quot; data-origin-width=&quot;1190&quot; data-origin-height=&quot;618&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CutMax는 비교 연산을 제거하고, 반복적인 다항 연산으로 최대값만 살아남게 함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최대값과 차순위 값의 비율을 지수적으로 증폭시키면 비교 없이도 argmax가 됨!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1507&quot; data-origin-height=&quot;573&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/btYoBW/dJMcahpEG5m/cSkD6tTV9Xmg6tTdKTUqkK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/btYoBW/dJMcahpEG5m/cSkD6tTV9Xmg6tTdKTUqkK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/btYoBW/dJMcahpEG5m/cSkD6tTV9Xmg6tTdKTUqkK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbtYoBW%2FdJMcahpEG5m%2FcSkD6tTV9Xmg6tTdKTUqkK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1507&quot; height=&quot;573&quot; data-origin-width=&quot;1507&quot; data-origin-height=&quot;573&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;연산 속도는 40배 가까이 줄이면서 정확도는 기존 argmax와 동일하게 유지함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이를 통해서 확률적 decoding도 가능하게 만들었음&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1537&quot; data-start=&quot;207&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;416&quot; data-start=&quot;229&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;248&quot; data-start=&quot;229&quot;&gt;&lt;b&gt;연구 배경 / 문제의식&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;416&quot; data-start=&quot;248&quot; data-col-size=&quot;lg&quot;&gt;동형암호(HE) 환경에서는 덧셈&amp;middot;곱셈 같은 &lt;b&gt;다항 연산만 가능&lt;/b&gt;하여, LLM decoding의 핵심인 &lt;b&gt;argmax&amp;middot;sampling이 비현실적으로 느림&lt;/b&gt;. 기존 HE 기반 LLM 연구는 &lt;b&gt;추론(inference)&lt;/b&gt;은 가능했지만, &lt;b&gt;텍스트 생성(decoding)&lt;/b&gt; 은 사실상 불가능했음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;543&quot; data-start=&quot;417&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;429&quot; data-start=&quot;417&quot;&gt;&lt;b&gt;핵심 병목&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;543&quot; data-start=&quot;429&quot; data-col-size=&quot;lg&quot;&gt;기존 HE argmax는 SIGN 근사 기반 &lt;b&gt;비교 연산&lt;/b&gt;에 의존 &amp;rarr; 깊은 multiplicative depth, 잦은 bootstrap, vocabulary 증가 시 &lt;b&gt;수십~수백 초 지연&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;649&quot; data-start=&quot;544&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;558&quot; data-start=&quot;544&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;649&quot; data-start=&quot;558&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;비교를 완전히 제거&lt;/b&gt;하고, 평균&amp;middot;분산 정규화 + odd power 반복으로 &lt;b&gt;최댓값과 차순위 값의 gap을 지수적으로 증폭&lt;/b&gt;시켜 argmax를 구현&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;766&quot; data-start=&quot;650&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;673&quot; data-start=&quot;650&quot;&gt;&lt;b&gt;제안 방법 ① (CutMax)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;766&quot; data-start=&quot;673&quot; data-col-size=&quot;lg&quot;&gt;반복적 다항 연산만으로 argmax를 근사하는 &lt;b&gt;HE-friendly argmax 알고리즘&lt;/b&gt;. 소수 iteration(T&amp;le;3~4) 만에 one-hot에 수렴&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;907&quot; data-start=&quot;767&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;803&quot; data-start=&quot;767&quot;&gt;&lt;b&gt;제안 방법 ② (HE Nucleus Sampling)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;907&quot; data-start=&quot;803&quot; data-col-size=&quot;lg&quot;&gt;Gumbel/Beta noise + CutMax를 결합한 &lt;b&gt;세계 최초 HE-compatible top-p(nucleus) sampling&lt;/b&gt;. 단 1회 CutMax 호출로 샘플링&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;995&quot; data-start=&quot;908&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;921&quot; data-start=&quot;908&quot;&gt;&lt;b&gt;이론적 기여&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;995&quot; data-start=&quot;921&quot; data-col-size=&quot;lg&quot;&gt;CutMax가 &lt;b&gt;max/runner-up gap ratio를 iteration마다 지수적으로 증폭&lt;/b&gt;시킨다는 수렴 정리 증명&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1103&quot; data-start=&quot;996&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1014&quot; data-start=&quot;996&quot;&gt;&lt;b&gt;차별점 (기존 대비)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1103&quot; data-start=&quot;1014&quot; data-col-size=&quot;lg&quot;&gt;SIGN 기반 tournament/league 방식 제거 &amp;rarr; &lt;b&gt;깊이&amp;middot;연산량 대폭 감소&lt;/b&gt;, vocabulary 크기에 거의 무관한 iteration 수&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1312&quot; data-start=&quot;1199&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1216&quot; data-start=&quot;1199&quot;&gt;&lt;b&gt;추가적 중요 포인트&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1312&quot; data-start=&quot;1216&quot; data-col-size=&quot;lg&quot;&gt;CutMax와 sampling이 &lt;b&gt;plaintext에서도 완전 미분 가능&lt;/b&gt; &amp;rarr; STE 없이 &lt;b&gt;gradient-based sequence-level 학습&lt;/b&gt; 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1426&quot; data-start=&quot;1313&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1329&quot; data-start=&quot;1313&quot;&gt;&lt;b&gt;논문의 핵심 주장&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1426&quot; data-start=&quot;1329&quot; data-col-size=&quot;lg&quot;&gt;&amp;ldquo;LLM 텍스트 생성은 HE 환경에서도 &lt;b&gt;실용적으로 가능&lt;/b&gt;하며, decoding을 다항 연산으로 재설계하면 &lt;b&gt;프라이버시&amp;middot;효율&amp;middot;정확도&lt;/b&gt;를 동시에 달성할 수 있다&amp;rdquo;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1537&quot; data-start=&quot;1427&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1440&quot; data-start=&quot;1427&quot;&gt;&lt;b&gt;연구적 의미&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1537&quot; data-start=&quot;1440&quot; data-col-size=&quot;lg&quot;&gt;Privacy-preserving LLM을 inference &amp;rarr; generation 단계까지 확장, &lt;b&gt;secure generative AI의 결정적 병목 해결&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1197</guid>
      <comments>https://yoonschallenge.tistory.com/1197#entry1197comment</comments>
      <pubDate>Mon, 19 Jan 2026 21:00:02 +0900</pubDate>
    </item>
    <item>
      <title>Multi-turn, Long-context Benchmark 논문 2</title>
      <link>https://yoonschallenge.tistory.com/1193</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.tacl-1.9/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2024.tacl-1.9/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768659689572&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Lost in the Middle: How Language Models Use Long Contexts&quot; data-og-description=&quot;Nelson F. Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, Percy Liang. Transactions of the Association for Computational Linguistics, Volume 12. 2024.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2024.tacl-1.9/&quot; data-og-url=&quot;https://aclanthology.org/2024.tacl-1.9/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/b9Lr8I/dJMb8QefRzw/2nutA2q53irufkRxEPfhMk/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.tacl-1.9/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2024.tacl-1.9/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/b9Lr8I/dJMb8QefRzw/2nutA2q53irufkRxEPfhMk/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Lost in the Middle: How Language Models Use Long Contexts&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Nelson F. Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, Percy Liang. Transactions of the Association for Computational Linguistics, Volume 12. 2024.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;tacl 2024에 붙은 논문입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;장문의 컨텍스트를 입력으로 받는 LLM은 실제 컨텍스트 전체를 고르게 활용하냐?&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;-&amp;gt; LLM이 Long Context를 잘 활용하면 정답 정보의 위치가 성능에 영향을 주지 않아야 한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여러 문서 중 하나에만 정답이 존재하고, 정답 문서의 위치랑 문서 수를 조절해서 확인한다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;774&quot; data-origin-height=&quot;677&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dvNNBt/dJMcabJJYBp/x0i38Io62Pdc8hjkCvSB41/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dvNNBt/dJMcabJJYBp/x0i38Io62Pdc8hjkCvSB41/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dvNNBt/dJMcabJJYBp/x0i38Io62Pdc8hjkCvSB41/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdvNNBt%2FdJMcabJJYBp%2Fx0i38Io62Pdc8hjkCvSB41%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;774&quot; height=&quot;677&quot; data-origin-width=&quot;774&quot; data-origin-height=&quot;677&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;입력이 초반 또는 후반에 있을 때 최고 성능을 보여주고, 중간 위치에 존재하면 성능이 급락한다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;882&quot; data-origin-height=&quot;677&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/AvAvr/dJMcagjW6nv/ecw3oklEWYv4MEGKY1rO8K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/AvAvr/dJMcagjW6nv/ecw3oklEWYv4MEGKY1rO8K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/AvAvr/dJMcagjW6nv/ecw3oklEWYv4MEGKY1rO8K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FAvAvr%2FdJMcagjW6nv%2Fecw3oklEWYv4MEGKY1rO8K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;882&quot; height=&quot;677&quot; data-origin-width=&quot;882&quot; data-origin-height=&quot;677&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1550&quot; data-origin-height=&quot;456&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/xOIgO/dJMcahC9xWK/KOKDJJ4gkUFfd95e57AbuK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/xOIgO/dJMcahC9xWK/KOKDJJ4gkUFfd95e57AbuK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/xOIgO/dJMcahC9xWK/KOKDJJ4gkUFfd95e57AbuK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FxOIgO%2FdJMcahC9xWK%2FKOKDJJ4gkUFfd95e57AbuK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1550&quot; height=&quot;456&quot; data-origin-width=&quot;1550&quot; data-origin-height=&quot;456&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다들 성능이 나빠진다...&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;2159&quot; data-start=&quot;258&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;426&quot; data-start=&quot;280&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;302&quot; data-start=&quot;280&quot;&gt;&lt;b&gt;연구 문제&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;426&quot; data-start=&quot;302&quot; data-col-size=&quot;xl&quot;&gt;장문 컨텍스트(수천~수만 토큰)를 입력으로 받는 최신 LLM들이 &lt;b&gt;실제로 컨텍스트 전체를 고르게 활용하는가?&lt;/b&gt; 특히 &lt;b&gt;중간 위치 정보(middle context)&lt;/b&gt;를 제대로 사용하는지에 대한 실증적 분석 부족&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;515&quot; data-start=&quot;427&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;439&quot; data-start=&quot;427&quot;&gt;&lt;b&gt;핵심 가설&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;515&quot; data-start=&quot;439&quot; data-col-size=&quot;xl&quot;&gt;만약 LLM이 long context를 robust하게 활용한다면, &lt;b&gt;정답 정보의 위치가 성능에 거의 영향을 주지 않아야 함&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;776&quot; data-start=&quot;516&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;529&quot; data-start=&quot;516&quot;&gt;&lt;b&gt;주요 태스크&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;776&quot; data-start=&quot;529&quot; data-col-size=&quot;xl&quot;&gt;(1) &lt;b&gt;Multi-Document Question Answering (MD-QA)&lt;/b&gt;&lt;br /&gt;&amp;ndash; 여러 문서 중 하나에만 정답 존재&lt;br /&gt;&amp;ndash; 정답 문서의 &lt;b&gt;위치(앞/중간/뒤)&lt;/b&gt; 및 문서 수(k) 조절&lt;br /&gt;&lt;br /&gt;(2) &lt;b&gt;Key-Value Retrieval (Synthetic)&lt;/b&gt;&lt;br /&gt;&amp;ndash; UUID 기반 key-value 쌍에서 특정 key의 value 추출&lt;br /&gt;&amp;ndash; 의미 정보 제거 &amp;rarr; &lt;b&gt;순수 retrieval 능력&lt;/b&gt; 측정&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;900&quot; data-start=&quot;777&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;789&quot; data-start=&quot;777&quot;&gt;&lt;b&gt;평가 모델&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;900&quot; data-start=&quot;789&quot; data-col-size=&quot;xl&quot;&gt;GPT-3.5 / GPT-3.5-16K, Claude-1.3 / 100K, MPT-30B-Instruct, LongChat-13B-16K, Flan-T5 / Flan-UL2, GPT-4(부분)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1038&quot; data-start=&quot;901&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;930&quot; data-start=&quot;901&quot;&gt;&lt;b&gt;핵심 결과 ①&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1038&quot; data-start=&quot;930&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;U-shaped 성능 곡선&lt;/b&gt; 관찰&lt;br /&gt;&amp;rarr; 정답이 &lt;b&gt;입력 초반(Primacy)&lt;/b&gt; 또는 &lt;b&gt;후반(Recency)&lt;/b&gt;에 있을 때 성능 최고&lt;br /&gt;&amp;rarr; &lt;b&gt;중간에 위치하면 성능 급락&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1194&quot; data-start=&quot;1039&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1061&quot; data-start=&quot;1039&quot;&gt;&lt;b&gt;핵심 결과 ②&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1194&quot; data-start=&quot;1061&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; GPT-3.5는 중간 위치에서 &lt;b&gt;문서 제공 안 한 closed-book 성능보다 더 낮아짐&lt;/b&gt;&lt;br /&gt;&amp;bull; &lt;b&gt;Extended context 모델(16K, 100K)&lt;/b&gt;도 동일한 현상 &amp;rarr; 컨텍스트 길이 증가 &amp;ne; 활용 능력 향상&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1319&quot; data-start=&quot;1195&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1217&quot; data-start=&quot;1195&quot;&gt;&lt;b&gt;Key-Value 실험 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1319&quot; data-start=&quot;1217&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; 일부 모델(Claude)은 완벽에 가까움&lt;br /&gt;&amp;bull; 다수 모델은 &lt;b&gt;중간 key retrieval 실패&lt;/b&gt; &amp;rarr; reasoning 이전에 &lt;b&gt;단순 retrieval부터 취약&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1455&quot; data-start=&quot;1320&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1349&quot; data-start=&quot;1320&quot;&gt;&lt;b&gt;원인 분석 ①&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1455&quot; data-start=&quot;1349&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; &lt;b&gt;Encoder-Decoder (Flan-UL2)&lt;/b&gt;는 &lt;b&gt;훈련 시 본 길이 이내&lt;/b&gt;에서는 비교적 robust&lt;br /&gt;&amp;bull; 하지만 &lt;b&gt;훈련 길이 초과 시 다시 U-shape 발생&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1583&quot; data-start=&quot;1456&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1502&quot; data-start=&quot;1456&quot;&gt;&lt;b&gt;원인 분석 ②&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1583&quot; data-start=&quot;1502&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; Query를 앞+뒤에 배치하면 &lt;b&gt;Key-Value retrieval은 거의 해결&lt;/b&gt;&lt;br /&gt;&amp;bull; 그러나 &lt;b&gt;MD-QA에서는 효과 미미&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1711&quot; data-start=&quot;1584&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1619&quot; data-start=&quot;1584&quot;&gt;&lt;b&gt;원인 분석 ③&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1711&quot; data-start=&quot;1619&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; Base 모델도 U-shape 존재 &amp;rarr; &lt;b&gt;Instruction tuning이 주원인은 아님&lt;/b&gt;&lt;br /&gt;&amp;bull; 다만 &lt;b&gt;worst-case 성능은 소폭 완화&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1842&quot; data-start=&quot;1712&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1746&quot; data-start=&quot;1712&quot;&gt;&lt;b&gt;Case Study&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1842&quot; data-start=&quot;1746&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; Retriever recall은 계속 증가&lt;br /&gt;&amp;bull; &lt;b&gt;Reader 성능은 20 docs 부근에서 포화&lt;/b&gt;&lt;br /&gt;&amp;rarr; 더 많은 문서 = 비용&amp;uarr; / 성능&amp;uarr; 거의 없음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1935&quot; data-start=&quot;1843&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1855&quot; data-start=&quot;1843&quot;&gt;&lt;b&gt;핵심 결론&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1935&quot; data-start=&quot;1855&quot; data-col-size=&quot;xl&quot;&gt;현재 LLM은 &lt;b&gt;&amp;ldquo;long context를 받을 수 있을 뿐, 잘 쓰지는 못함&amp;rdquo;&lt;/b&gt;&lt;br /&gt;&amp;rarr; &lt;b&gt;중간 정보 활용 실패&lt;/b&gt;는 구조적 한계&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2022&quot; data-start=&quot;1936&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1954&quot; data-start=&quot;1936&quot;&gt;&lt;b&gt;저자 제안 평가 기준&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2022&quot; data-start=&quot;1954&quot; data-col-size=&quot;xl&quot;&gt;Long-context LLM 주장 시,&lt;br /&gt;&lt;b&gt;best vs worst 위치 성능 차이&lt;/b&gt;를 반드시 보고해야 함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2159&quot; data-start=&quot;2023&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2061&quot; data-start=&quot;2023&quot;&gt;&lt;b&gt;실질적 시사점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2159&quot; data-start=&quot;2061&quot; data-col-size=&quot;xl&quot;&gt;&amp;bull; RAG에서 &lt;b&gt;reranking / truncation 필수&lt;/b&gt;&lt;br /&gt;&amp;bull; 중요한 정보는 &lt;b&gt;앞이나 뒤로 밀어야 함&lt;/b&gt;&lt;br /&gt;&amp;bull; 단순히 &amp;ldquo;더 많이 넣기&amp;rdquo;는 역효과 가능&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2601.07226&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2601.07226&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768660636212&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Lost in the Noise: How Reasoning Models Fail with Contextual Distractors&quot; data-og-description=&quot;Recent advances in reasoning models and agentic AI systems have led to an increased reliance on diverse external information. However, this shift introduces input contexts that are inherently noisy, a reality that current sanitized benchmarks fail to captu&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2601.07226&quot; data-og-url=&quot;https://arxiv.org/abs/2601.07226v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/ykQ7L/dJMb83Scumn/ZWXP9ssiTVXomU9snDRKS1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bZDQQq/dJMb88FYyga/8dOQ2DVnWpH4laYBibHCuk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2601.07226&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2601.07226&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/ykQ7L/dJMb83Scumn/ZWXP9ssiTVXomU9snDRKS1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bZDQQq/dJMb88FYyga/8dOQ2DVnWpH4laYBibHCuk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Lost in the Noise: How Reasoning Models Fail with Contextual Distractors&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Recent advances in reasoning models and agentic AI systems have led to an increased reliance on diverse external information. However, this shift introduces input contexts that are inherently noisy, a reality that current sanitized benchmarks fail to captu&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;최신 reasoning LLM과 Agentic AI는 RAG, 툴사용, 멀티턴 상호작용에 강하게 의존하지만 현실 환경에서는 무작위 문서, 무관한 대화 이력, 유사하지만 틀린 정보가 필연적으로 존재한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 벤치마크는 Clean 입력만 평가하여 실제 환경에서의 취약성이 가려진다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; Reasoning 모델과 Agent는 노이즈가 포함된 컨텍스트에서 얼마나 쉽게 붕괴되는가&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;RAG, 추론, 정렬, 툴 사용을 어우르는 11개의 데이터 셋을 통해 Noisy Bench를 만들었음&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1240&quot; data-origin-height=&quot;736&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/beDxMY/dJMcaaRAjsm/hL8ePwFofuY3rvliKpViC1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/beDxMY/dJMcaaRAjsm/hL8ePwFofuY3rvliKpViC1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/beDxMY/dJMcaaRAjsm/hL8ePwFofuY3rvliKpViC1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbeDxMY%2FdJMcaaRAjsm%2FhL8ePwFofuY3rvliKpViC1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1240&quot; height=&quot;736&quot; data-origin-width=&quot;1240&quot; data-origin-height=&quot;736&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ND(No Distractor) - 기존 Clean 환경&lt;br /&gt;RD(Random Documents) - 무작위 문서 삽입&lt;br /&gt;RC(Random Chat History) - 무관한 대화 이력&lt;br /&gt;HN(Hard Negative) - 질문과 겉보기 유사하지만 오답인 문서&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1231&quot; data-origin-height=&quot;674&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/rA0fl/dJMcadHu9OL/I7a4jRq6X5sN68F8k4Rk8K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/rA0fl/dJMcadHu9OL/I7a4jRq6X5sN68F8k4Rk8K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/rA0fl/dJMcadHu9OL/I7a4jRq6X5sN68F8k4Rk8K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FrA0fl%2FdJMcadHu9OL%2FI7a4jRq6X5sN68F8k4Rk8K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1231&quot; height=&quot;674&quot; data-origin-width=&quot;1231&quot; data-origin-height=&quot;674&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모든 모델에서 성능 붕괴가 일어남&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;HN가 가장 치명적으로 일어남!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;악의 없는 랜덤 노이즈 만으로도 alignment 붕괴가 일어남&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;810&quot; data-origin-height=&quot;589&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/QBnr4/dJMcac9EeuI/90Mva30mw3FhXLZbUyIAJK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/QBnr4/dJMcac9EeuI/90Mva30mw3FhXLZbUyIAJK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/QBnr4/dJMcac9EeuI/90Mva30mw3FhXLZbUyIAJK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FQBnr4%2FdJMcac9EeuI%2F90Mva30mw3FhXLZbUyIAJK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;810&quot; height=&quot;589&quot; data-origin-width=&quot;810&quot; data-origin-height=&quot;589&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;노말한 상호아에선 agentic이 성능이 좋지만 조금의 노이즈만 들어가도 agentic이 성능 감소폭이 더 심하다&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1079&quot; data-origin-height=&quot;794&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cE35K8/dJMcahb5x1F/Ple2HjR2DM4SkVeUNpps9k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cE35K8/dJMcahb5x1F/Ple2HjR2DM4SkVeUNpps9k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cE35K8/dJMcahb5x1F/Ple2HjR2DM4SkVeUNpps9k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcE35K8%2FdJMcahb5x1F%2FPle2HjR2DM4SkVeUNpps9k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1079&quot; height=&quot;794&quot; data-origin-width=&quot;1079&quot; data-origin-height=&quot;794&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;RARE - 정답 여부가 아니라 유용한 정보에 근거한 추론을 보상! =&amp;gt; Accuracy 대폭 향상&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 839px;&quot; border=&quot;1&quot; data-end=&quot;2102&quot; data-start=&quot;212&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;503&quot; data-start=&quot;390&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;402&quot; data-start=&quot;390&quot;&gt;&lt;b&gt;연구 배경&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;503&quot; data-start=&quot;402&quot; data-col-size=&quot;md&quot;&gt;현실의 LLM&amp;middot;Agent 환경은 &lt;b&gt;무작위 문서, 무관한 대화 이력, 유사하지만 틀린 정보&lt;/b&gt; 등 노이즈가 필연적이나, 기존 벤치마크는 &lt;b&gt;clean context&lt;/b&gt;만 평가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;615&quot; data-start=&quot;504&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;516&quot; data-start=&quot;504&quot;&gt;&lt;b&gt;핵심 문제&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;615&quot; data-start=&quot;516&quot; data-col-size=&quot;md&quot;&gt;Reasoning LLM과 Agentic AI가 &lt;b&gt;contextual distractor&lt;/b&gt;에 얼마나 취약한지, 그리고 그 실패 양상이 무엇인지 체계적으로 분석되지 않음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 63px;&quot; data-end=&quot;713&quot; data-start=&quot;616&quot;&gt;
&lt;td style=&quot;height: 63px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;628&quot; data-start=&quot;616&quot;&gt;&lt;b&gt;연구 목표&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 63px;&quot; data-end=&quot;713&quot; data-start=&quot;628&quot; data-col-size=&quot;md&quot;&gt;(1) 노이즈 환경에서의 &lt;b&gt;실제 추론&amp;middot;정렬&amp;middot;RAG&amp;middot;툴 사용 능력&lt;/b&gt; 측정&lt;br /&gt;(2) 모델 실패의 원인 규명&lt;br /&gt;(3) 견고성 향상 방법 제안&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;827&quot; data-start=&quot;714&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;728&quot; data-start=&quot;714&quot;&gt;&lt;b&gt;제안 벤치마크&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;827&quot; data-start=&quot;728&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;NoisyBench&lt;/b&gt;: 11개 데이터셋, 4가지 환경&lt;br /&gt;ND(클린), RD(Random Docs), RC(Random Chat), HN(Hard Negative)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 72px;&quot; data-end=&quot;953&quot; data-start=&quot;828&quot;&gt;
&lt;td style=&quot;height: 72px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;841&quot; data-start=&quot;828&quot;&gt;&lt;b&gt;평가 태스크&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 72px;&quot; data-end=&quot;953&quot; data-start=&quot;841&quot; data-col-size=&quot;md&quot;&gt;RAG (SealQA, Musique 등)&lt;br /&gt;Reasoning (BBEH-Mini, GPQA, AIME25)&lt;br /&gt;Alignment (BBQ, SI)&lt;br /&gt;Tool-use (TauBench)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1052&quot; data-start=&quot;954&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;966&quot; data-start=&quot;954&quot;&gt;&lt;b&gt;대상 모델&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1052&quot; data-start=&quot;966&quot; data-col-size=&quot;md&quot;&gt;Gemini-2.5-Pro/Flash, DeepSeek-R1, GPT-OSS-120B, Qwen3 (4B/30B), Distilled LLaMA 등&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1127&quot; data-start=&quot;1053&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1067&quot; data-start=&quot;1053&quot;&gt;&lt;b&gt;주요 발견 ①&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;1127&quot; data-start=&quot;1067&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;최대 80% 성능 붕괴&lt;/b&gt; 발생&lt;br /&gt;&amp;rarr; Clean 성능이 높아도 Robustness 보장 안 됨&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1209&quot; data-start=&quot;1128&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1142&quot; data-start=&quot;1128&quot;&gt;&lt;b&gt;주요 발견 ②&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1209&quot; data-start=&quot;1142&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;악의 없는 랜덤 노이즈만으로도 emergent misalignment 발생&lt;/b&gt; (Alignment 성능 급락)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1292&quot; data-start=&quot;1210&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1224&quot; data-start=&quot;1210&quot;&gt;&lt;b&gt;주요 발견 ③&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;1292&quot; data-start=&quot;1224&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;Agentic workflow는 노이즈에서 오히려 더 취약&lt;/b&gt;&lt;br /&gt;&amp;rarr; Tool output 과신 + 오류 전파&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1373&quot; data-start=&quot;1293&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1305&quot; data-start=&quot;1293&quot;&gt;&lt;b&gt;행동 분석&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;1373&quot; data-start=&quot;1305&quot; data-col-size=&quot;md&quot;&gt;질문&amp;ndash;distractor &lt;b&gt;유사도 증가 시&lt;/b&gt;&lt;br /&gt;Accuracy &amp;darr;, Reasoning token &amp;uarr; (혼동)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1439&quot; data-start=&quot;1374&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1388&quot; data-start=&quot;1374&quot;&gt;&lt;b&gt;불확실성 분석&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;1439&quot; data-start=&quot;1388&quot; data-col-size=&quot;md&quot;&gt;Distractor 수 증가 &amp;rarr; &lt;b&gt;Entropy 증가&lt;/b&gt;, Confidence 감소&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;1507&quot; data-start=&quot;1440&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1459&quot; data-start=&quot;1440&quot;&gt;&lt;b&gt;Attention 분석&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;1507&quot; data-start=&quot;1459&quot; data-col-size=&quot;md&quot;&gt;오답일수록 &lt;b&gt;distractor token에 과도한 attention 집중&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1590&quot; data-start=&quot;1508&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1520&quot; data-start=&quot;1508&quot;&gt;&lt;b&gt;중요 현상&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1590&quot; data-start=&quot;1520&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;Inverse Scaling Law&lt;/b&gt;: 노이즈 환경에서는 test-time reasoning을 늘릴수록 성능 악화&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 59px;&quot; data-end=&quot;1703&quot; data-start=&quot;1591&quot;&gt;
&lt;td style=&quot;height: 59px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1606&quot; data-start=&quot;1591&quot;&gt;&lt;b&gt;기존 대응 한계&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 59px;&quot; data-end=&quot;1703&quot; data-start=&quot;1606&quot; data-col-size=&quot;md&quot;&gt;Prompting, Context engineering: 효과 미미&lt;br /&gt;SFT: catastrophic forgetting&lt;br /&gt;Outcome-only RL: 제한적&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;1794&quot; data-start=&quot;1704&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1716&quot; data-start=&quot;1704&quot;&gt;&lt;b&gt;제안 방법&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;1794&quot; data-start=&quot;1716&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;RARE (Rationale-Aware Reward)&lt;/b&gt;&lt;br /&gt;&amp;rarr; 정답 여부가 아닌, &lt;b&gt;유효 정보에 근거한 추론 과정&lt;/b&gt;을 보상&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1874&quot; data-start=&quot;1795&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1809&quot; data-start=&quot;1795&quot;&gt;&lt;b&gt;RARE 효과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;1874&quot; data-start=&quot;1809&quot; data-col-size=&quot;md&quot;&gt;Distracted CoT 감소, Noise filtering 능력 향상&lt;br /&gt;평균 성능 &lt;b&gt;+55% 개선&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1933&quot; data-start=&quot;1875&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1887&quot; data-start=&quot;1875&quot;&gt;&lt;b&gt;핵심 결론&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1933&quot; data-start=&quot;1887&quot; data-col-size=&quot;md&quot;&gt;현실적 노이즈 환경에서 LLM은 &lt;b&gt;더 많이 생각할수록 더 틀릴 수 있음&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;2003&quot; data-start=&quot;1934&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1948&quot; data-start=&quot;1934&quot;&gt;&lt;b&gt;연구적 시사점&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;2003&quot; data-start=&quot;1948&quot; data-col-size=&quot;md&quot;&gt;Robust reasoning = 토큰 수 증가 ❌&lt;br /&gt;&lt;b&gt;정보 선택&amp;middot;억제 능력&lt;/b&gt;이 핵심&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 55px;&quot; data-end=&quot;2102&quot; data-start=&quot;2004&quot;&gt;
&lt;td style=&quot;height: 55px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;2019&quot; data-start=&quot;2004&quot;&gt;&lt;b&gt;후속 연구 방향&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 55px;&quot; data-end=&quot;2102&quot; data-start=&quot;2019&quot; data-col-size=&quot;md&quot;&gt;Noise-aware reward modeling&lt;br /&gt;Attention suppression&lt;br /&gt;Tool 신뢰도 추정 기반 Agent 설계&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.findings-emnlp.1264/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2025.findings-emnlp.1264/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768664299799&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Context Length Alone Hurts LLM Performance Despite Perfect Retrieval&quot; data-og-description=&quot;Yufeng Du, Minyang Tian, Srikanth Ronanki, Subendhu Rongali, Sravan Babu Bodapati, Aram Galstyan, Azton Wells, Roy Schwartz, Eliu A Huerta, Hao Peng. Findings of the Association for Computational Linguistics: EMNLP 2025. 2025.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2025.findings-emnlp.1264/&quot; data-og-url=&quot;https://aclanthology.org/2025.findings-emnlp.1264/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/fhzxB/dJMb88eUgU1/MbEcuM5UN2zBmB90YpU5T1/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2025.findings-emnlp.1264/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2025.findings-emnlp.1264/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/fhzxB/dJMb88eUgU1/MbEcuM5UN2zBmB90YpU5T1/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Context Length Alone Hurts LLM Performance Despite Perfect Retrieval&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Yufeng Du, Minyang Tian, Srikanth Ronanki, Subendhu Rongali, Sravan Babu Bodapati, Aram Galstyan, Azton Wells, Roy Schwartz, Eliu A Huerta, Hao Peng. Findings of the Association for Computational Linguistics: EMNLP 2025. 2025.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;EMNLP 2024 findings 에 붙었네요&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 통념으론 Long-context LLM 성능 저하의 주 원인은 Retrieval failure이어서 정보를 제대로 찾지 못해서 성능이 떨어진다고 가정했다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그러나 Retrieval 이 완벽하다면 긴 컨텍스트에서도 short-context와 동일한 성능을 낼 수 있는가? 라는 의문을 가지게 되었음&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;583&quot; data-origin-height=&quot;604&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ea8UYp/dJMcagdbXd9/9K0GToZ23CeK1n9U4XhULK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ea8UYp/dJMcagdbXd9/9K0GToZ23CeK1n9U4XhULK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ea8UYp/dJMcagdbXd9/9K0GToZ23CeK1n9U4XhULK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fea8UYp%2FdJMcagdbXd9%2F9K0GToZ23CeK1n9U4XhULK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;583&quot; height=&quot;604&quot; data-origin-width=&quot;583&quot; data-origin-height=&quot;604&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;1014&quot; data-start=&quot;986&quot;&gt;Evidence: 문제 해결에 필요한 모든 정보&lt;/li&gt;
&lt;li data-end=&quot;1037&quot; data-start=&quot;1015&quot;&gt;Distraction: 길이만 늘리기 위한 토큰&lt;/li&gt;
&lt;li data-end=&quot;1066&quot; data-start=&quot;1038&quot;&gt;Question: 질의 및 출력 포맷&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;pre id=&quot;code_1768666707865&quot; class=&quot;python&quot; data-ke-language=&quot;python&quot; data-ke-type=&quot;codeblock&quot;&gt;&lt;code&gt;[Evidence] + [Distraction Tokens] + [Question]&lt;/code&gt;&lt;/pre&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Evidence는 맨 앞에 넣어 Lost-in-the-Middle 문제를 제거&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1216&quot; data-origin-height=&quot;507&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/oMcFZ/dJMcabJJZGj/alPbQugf8kakzhVnfm9oOk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/oMcFZ/dJMcabJJZGj/alPbQugf8kakzhVnfm9oOk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/oMcFZ/dJMcabJJZGj/alPbQugf8kakzhVnfm9oOk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FoMcFZ%2FdJMcabJJZGj%2FalPbQugf8kakzhVnfm9oOk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1216&quot; height=&quot;507&quot; data-origin-width=&quot;1216&quot; data-origin-height=&quot;507&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;whitespace는 distraction을 최소화한 것으로 성능 저하&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1250&quot; data-origin-height=&quot;514&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/buQ6h7/dJMcaiB1Zmp/dWidUdliSjVnmsOOM1tb2k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/buQ6h7/dJMcaiB1Zmp/dWidUdliSjVnmsOOM1tb2k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/buQ6h7/dJMcaiB1Zmp/dWidUdliSjVnmsOOM1tb2k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbuQ6h7%2FdJMcaiB1Zmp%2FdWidUdliSjVnmsOOM1tb2k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1250&quot; height=&quot;514&quot; data-origin-width=&quot;1250&quot; data-origin-height=&quot;514&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Retrieval 측정 방식은 Evidence와 Question을 토큰 단위로 100% 동일하게 복사 시 성공으로 Retrieval이 안 돼서 틀린 것이라는 반론을 차단&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Retrieval은 성능이 좋으나 Accuracy 성능은 급락하는 것을 보여줌&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 정보는 명확히 알고 있지만 사용하지 못하는 것을 알 수 있음&amp;nbsp;&lt;/p&gt;
&lt;div&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1256&quot; data-origin-height=&quot;584&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cpADKT/dJMcaaRAkSX/fzWf331XvWpYkKAdtvQCN1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cpADKT/dJMcaaRAkSX/fzWf331XvWpYkKAdtvQCN1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cpADKT/dJMcaaRAkSX/fzWf331XvWpYkKAdtvQCN1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcpADKT%2FdJMcaaRAkSX%2FfzWf331XvWpYkKAdtvQCN1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1256&quot; height=&quot;584&quot; data-origin-width=&quot;1256&quot; data-origin-height=&quot;584&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p data-ke-size=&quot;size16&quot;&gt;정보 위치를 바꿔도 그대로 못 함....&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; RTR로 LongContext에서 Evidence를 먼저 가져와서 question과 함께 새로운 짧은 prompt를 만든다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그 다음 Reasoning을 실행!&lt;/p&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;598&quot; data-origin-height=&quot;245&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cwetuz/dJMcai9Ru37/o0BJlyyPj3kovpIddXLSxk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cwetuz/dJMcai9Ru37/o0BJlyyPj3kovpIddXLSxk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cwetuz/dJMcai9Ru37/o0BJlyyPj3kovpIddXLSxk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcwetuz%2FdJMcai9Ru37%2Fo0BJlyyPj3kovpIddXLSxk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;598&quot; height=&quot;245&quot; data-origin-width=&quot;598&quot; data-origin-height=&quot;245&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;

&lt;p data-ke-size=&quot;size16&quot;&gt;학습 없이 적용 가능함&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 437px;&quot; border=&quot;1&quot; data-end=&quot;1502&quot; data-start=&quot;204&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;294&quot; data-start=&quot;226&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;234&quot; data-start=&quot;226&quot;&gt;연구 문제&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;294&quot; data-start=&quot;234&quot; data-col-size=&quot;md&quot;&gt;Long-context LLM 성능 저하의 원인이 정말 &lt;b&gt;retrieval failure&lt;/b&gt;뿐인가?&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;348&quot; data-start=&quot;295&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;303&quot; data-start=&quot;295&quot;&gt;핵심 질문&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;348&quot; data-start=&quot;303&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;Retrieval이 완벽해도&lt;/b&gt; 컨텍스트가 길어지면 성능이 유지되는가?&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;428&quot; data-start=&quot;349&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;357&quot; data-start=&quot;349&quot;&gt;핵심 주장&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;428&quot; data-start=&quot;357&quot; data-col-size=&quot;md&quot;&gt;❌ 아니다. &lt;b&gt;컨텍스트 길이 그 자체(context length alone)&lt;/b&gt;가 reasoning 성능을 직접 저해함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;519&quot; data-start=&quot;429&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;442&quot; data-start=&quot;429&quot;&gt;실험 핵심 아이디어&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;519&quot; data-start=&quot;442&quot; data-col-size=&quot;md&quot;&gt;Short-context 문제를 &lt;b&gt;[Evidence + Distraction + Question]&lt;/b&gt; 형태로 확장하여 길이만 증가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;601&quot; data-start=&quot;520&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;535&quot; data-start=&quot;520&quot;&gt;Retrieval 통제&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;601&quot; data-start=&quot;535&quot; data-col-size=&quot;md&quot;&gt;Evidence&amp;middot;Question을 &lt;b&gt;exact match로 recite&lt;/b&gt; &amp;rarr; 100% retrieval 확인&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;678&quot; data-start=&quot;602&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;611&quot; data-start=&quot;602&quot;&gt;사용 태스크&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;678&quot; data-start=&quot;611&quot; data-col-size=&quot;md&quot;&gt;VarSum (synthetic), GSM8K (math), MMLU (QA), HumanEval (coding)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;756&quot; data-start=&quot;679&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;687&quot; data-start=&quot;679&quot;&gt;사용 모델&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;756&quot; data-start=&quot;687&quot; data-col-size=&quot;md&quot;&gt;Llama-3.1-8B, Mistral-7B (open) / GPT-4o, Claude, Gemini (closed)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 59px;&quot; data-end=&quot;872&quot; data-start=&quot;757&quot;&gt;
&lt;td style=&quot;height: 59px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;768&quot; data-start=&quot;757&quot;&gt;주요 실험 조건&lt;/td&gt;
&lt;td style=&quot;height: 59px;&quot; data-end=&quot;872&quot; data-start=&quot;768&quot; data-col-size=&quot;md&quot;&gt;(1) Essay distraction&lt;br /&gt;(2) &lt;b&gt;Whitespace&lt;/b&gt; (최소 방해)&lt;br /&gt;(3) &lt;b&gt;Attention masking&lt;/b&gt; (distraction 완전 제거)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;931&quot; data-start=&quot;873&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;883&quot; data-start=&quot;873&quot;&gt;핵심 결과 ①&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;931&quot; data-start=&quot;883&quot; data-col-size=&quot;md&quot;&gt;Retrieval 성능은 유지되지만 &lt;b&gt;정답률은 최대 13.9%~85% 급락&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1003&quot; data-start=&quot;932&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;942&quot; data-start=&quot;932&quot;&gt;핵심 결과 ②&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1003&quot; data-start=&quot;942&quot; data-col-size=&quot;md&quot;&gt;Whitespace&amp;middot;Masking 상황에서도 성능 저하 발생 &amp;rarr; &lt;b&gt;distraction 원인 아님&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1081&quot; data-start=&quot;1004&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1014&quot; data-start=&quot;1004&quot;&gt;핵심 결과 ③&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1081&quot; data-start=&quot;1014&quot; data-col-size=&quot;md&quot;&gt;Evidence를 Question 바로 앞에 둬도 성능 저하 &amp;rarr; &lt;b&gt;distance/position 문제 아님&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1131&quot; data-start=&quot;1082&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1090&quot; data-start=&quot;1082&quot;&gt;핵심 결론&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1131&quot; data-start=&quot;1090&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;입력 길이 자체가 LLM 추론 능력을 약화시키는 독립적 요인&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1208&quot; data-start=&quot;1132&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1142&quot; data-start=&quot;1132&quot;&gt;제안한 해결책&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1208&quot; data-start=&quot;1142&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;Retrieve-then-Reason&lt;/b&gt;: evidence를 먼저 recite &amp;rarr; 짧은 prompt로 재질의&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;1273&quot; data-start=&quot;1209&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1218&quot; data-start=&quot;1209&quot;&gt;해결책 효과&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;1273&quot; data-start=&quot;1218&quot; data-col-size=&quot;md&quot;&gt;GSM8K: 최대 &lt;b&gt;+31%&lt;/b&gt;&lt;br /&gt;RULER (GPT-4o): 최대 &lt;b&gt;+4%&lt;/b&gt; 개선&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1355&quot; data-start=&quot;1274&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1284&quot; data-start=&quot;1274&quot;&gt;이론적 시사점&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1355&quot; data-start=&quot;1284&quot; data-col-size=&quot;md&quot;&gt;Long-context 성능 = Retrieval + Reasoning &lt;b&gt;+ Context-Length Effect&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1406&quot; data-start=&quot;1356&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1365&quot; data-start=&quot;1356&quot;&gt;실무적 의미&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1406&quot; data-start=&quot;1365&quot; data-col-size=&quot;md&quot;&gt;RAG, Long-CoT에서 &lt;b&gt;&amp;ldquo;많을수록 좋다&amp;rdquo;는 가정이 깨짐&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1448&quot; data-start=&quot;1407&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1412&quot; data-start=&quot;1407&quot;&gt;한계&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1448&quot; data-start=&quot;1412&quot; data-col-size=&quot;md&quot;&gt;모델/태스크 수 제한, 완벽한 retrieval 가정 필요&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1502&quot; data-start=&quot;1449&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1458&quot; data-start=&quot;1449&quot;&gt;한 줄 요약&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1502&quot; data-start=&quot;1458&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;LLM은 정보를 &amp;ldquo;알아도&amp;rdquo;, 컨텍스트가 길면 &amp;ldquo;사용하지 못한다&amp;rdquo;.&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2505.06120&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2505.06120&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768667565163&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;LLMs Get Lost In Multi-Turn Conversation&quot; data-og-description=&quot;Large Language Models (LLMs) are conversational interfaces. As such, LLMs have the potential to assist their users not only when they can fully specify the task at hand, but also to help them define, explore, and refine what they need through multi-turn co&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2505.06120&quot; data-og-url=&quot;https://arxiv.org/abs/2505.06120v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/c9lXX2/dJMb8PGpPlY/ZSGzfRli5yvUgx5VBrok60/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/e5cXV/dJMb84XSqkY/f6bQ7sTfZh5paYtfG2KKv0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2505.06120&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2505.06120&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/c9lXX2/dJMb8PGpPlY/ZSGzfRli5yvUgx5VBrok60/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/e5cXV/dJMb84XSqkY/f6bQ7sTfZh5paYtfG2KKv0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;LLMs Get Lost In Multi-Turn Conversation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Large Language Models (LLMs) are conversational interfaces. As such, LLMs have the potential to assist their users not only when they can fully specify the task at hand, but also to help them define, explore, and refine what they need through multi-turn co&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;마소 논문입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 llm 평가는 single-turn에 과도하게 집중되어 있고, 실제 사용자 대화는 multi-turn + underspecified 형태가 일반적임&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 Multi-turn Benchmark는 episodic 구조로 각 턴을 사실상 독립 평가 -&amp;gt; 현실과 괴리가 있다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;==&amp;gt; LLM 정보가 여러 턴에 걸쳐 점진적으로 주어지는 대화에서, 신뢰성 있게 문제를 해결할 수 있는가!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1244&quot; data-origin-height=&quot;652&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/IplRw/dJMb996cXAS/nGFiW5WQGUPdIBQbXjUc51/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/IplRw/dJMb996cXAS/nGFiW5WQGUPdIBQbXjUc51/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/IplRw/dJMb996cXAS/nGFiW5WQGUPdIBQbXjUc51/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FIplRw%2FdJMb996cXAS%2FnGFiW5WQGUPdIBQbXjUc51%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1244&quot; height=&quot;652&quot; data-origin-width=&quot;1244&quot; data-origin-height=&quot;652&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Aptitude는 15% 떨어지고, Unreliability는 +112%로 잘할 수 있는데 결과의 편차가 큰 것을 볼 수 있음&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 139px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&lt;b&gt;Underspecification&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;초기에 모든 요구사항이 주어지지 않고, 대화 중 점진적으로 드러나는 상황&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&lt;b&gt;Lost in Conversation&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;LLM이 초반에 잘못된 가정을 하고, 이후에도 이를 수정하지 못해 성능이 급락하는 현상&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&lt;b&gt;Aptitude (A)&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;best-case 성능 (90th percentile)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&lt;b&gt;Unreliability (U)&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;best&amp;ndash;worst 성능 격차 (90th &amp;minus; 10th percentile)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&lt;b&gt;Performance (P)&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;평균 성능&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1465&quot; data-origin-height=&quot;484&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dpynFE/dJMcai257H6/9VvEb87B0FxoYSXKz6Zdj1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dpynFE/dJMcai257H6/9VvEb87B0FxoYSXKz6Zdj1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dpynFE/dJMcai257H6/9VvEb87B0FxoYSXKz6Zdj1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdpynFE%2FdJMcai257H6%2F9VvEb87B0FxoYSXKz6Zdj1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1465&quot; height=&quot;484&quot; data-origin-width=&quot;1465&quot; data-origin-height=&quot;484&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 single-turn benchmark를 정보 조각 단위로 분해해서 턴당 1개의 shard만 공개하여 마지막 턴에 모든 정보가 주어지도록 설계되어있다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1307&quot; data-origin-height=&quot;417&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/nyvGQ/dJMcadAIwR4/u51YVo492Kf9WeQDyVFuZK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/nyvGQ/dJMcadAIwR4/u51YVo492Kf9WeQDyVFuZK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/nyvGQ/dJMcadAIwR4/u51YVo492Kf9WeQDyVFuZK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FnyvGQ%2FdJMcadAIwR4%2Fu51YVo492Kf9WeQDyVFuZK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1307&quot; height=&quot;417&quot; data-origin-width=&quot;1307&quot; data-origin-height=&quot;417&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;756&quot; data-origin-height=&quot;593&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/QsiX0/dJMcahpD1ss/AySyFQ03Ho61UYZZHWT7P0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/QsiX0/dJMcahpD1ss/AySyFQ03Ho61UYZZHWT7P0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/QsiX0/dJMcahpD1ss/AySyFQ03Ho61UYZZHWT7P0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FQsiX0%2FdJMcahpD1ss%2FAySyFQ03Ho61UYZZHWT7P0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;756&quot; height=&quot;593&quot; data-origin-width=&quot;756&quot; data-origin-height=&quot;593&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;설정&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;설명&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;FULL&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;모든 정보가 1턴에 제공 (single-turn baseline)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;SNOWBALL&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;multi-turn이지만 매 턴 모든 과거 정보를 누적 제공&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;SHARDED&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;진짜 multi-turn underspecified 대화 (핵심 실험)&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1343&quot; data-origin-height=&quot;779&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/LAFD6/dJMcag5lstL/VLGstucRXEmH0MyVfmhC81/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/LAFD6/dJMcag5lstL/VLGstucRXEmH0MyVfmhC81/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/LAFD6/dJMcag5lstL/VLGstucRXEmH0MyVfmhC81/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FLAFD6%2FdJMcag5lstL%2FVLGstucRXEmH0MyVfmhC81%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1343&quot; height=&quot;779&quot; data-origin-width=&quot;1343&quot; data-origin-height=&quot;779&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Translation task는 문장 단위로 분해가 가능한 episodic task로 sharded에서도 성능을 유지함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1303&quot; data-origin-height=&quot;803&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bdDaHP/dJMb99ZrHjF/XI2utUPK0wQwDBJiHPaFTk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bdDaHP/dJMb99ZrHjF/XI2utUPK0wQwDBJiHPaFTk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bdDaHP/dJMb99ZrHjF/XI2utUPK0wQwDBJiHPaFTk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbdDaHP%2FdJMb99ZrHjF%2FXI2utUPK0wQwDBJiHPaFTk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1303&quot; height=&quot;803&quot; data-origin-width=&quot;1303&quot; data-origin-height=&quot;803&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-end=&quot;1843&quot; data-start=&quot;1818&quot; data-ke-size=&quot;size16&quot;&gt;논문은 4가지 주요 원인을 실증적으로 분석함:&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-end=&quot;2221&quot; data-start=&quot;1845&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li data-end=&quot;1941&quot; data-start=&quot;1845&quot;&gt;&lt;b&gt;Premature Answer Attempt&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;1941&quot; data-start=&quot;1880&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;1907&quot; data-start=&quot;1880&quot;&gt;충분한 정보가 없는데도 초반에 완성 답변 생성&lt;/li&gt;
&lt;li data-end=&quot;1941&quot; data-start=&quot;1911&quot;&gt;늦게 답변을 시작할수록 성능 &amp;uarr; (2배 이상 차이)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;2032&quot; data-start=&quot;1943&quot;&gt;&lt;b&gt;Incorrect Assumptions&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;2032&quot; data-start=&quot;1975&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;2005&quot; data-start=&quot;1975&quot;&gt;underspecified 정보를 스스로 채워 넣음&lt;/li&gt;
&lt;li data-end=&quot;2032&quot; data-start=&quot;2009&quot;&gt;이후 사용자 요구와 충돌해도 수정 실패&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;2141&quot; data-start=&quot;2034&quot;&gt;&lt;b&gt;Over-reliance on Previous Answers&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;2141&quot; data-start=&quot;2078&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;2108&quot; data-start=&quot;2078&quot;&gt;이전의 잘못된 답변을 기준점(anchor)으로 삼음&lt;/li&gt;
&lt;li data-end=&quot;2141&quot; data-start=&quot;2112&quot;&gt;결과적으로 &lt;b&gt;bloated answer&lt;/b&gt; 생성&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li data-end=&quot;2221&quot; data-start=&quot;2143&quot;&gt;&lt;b&gt;Loss-in-Middle-Turns&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-end=&quot;2221&quot; data-start=&quot;2174&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li data-end=&quot;2194&quot; data-start=&quot;2174&quot;&gt;중간 턴에서 제공된 정보가 무시됨&lt;/li&gt;
&lt;li data-end=&quot;2221&quot; data-start=&quot;2198&quot;&gt;첫 턴/마지막 턴 정보에 과도하게 집중&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;2119&quot; data-start=&quot;203&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;421&quot; data-start=&quot;225&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;247&quot; data-start=&quot;225&quot;&gt;&lt;b&gt;연구 문제&amp;nbsp;&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;421&quot; data-start=&quot;247&quot; data-col-size=&quot;xl&quot;&gt;기존 LLM 평가는 single-turn&amp;middot;fully-specified 설정에 치우쳐 있으며, 실제 사용 환경인 &lt;b&gt;multi-turn&amp;middot;underspecified 대화&lt;/b&gt;에서의 성능과 신뢰성을 제대로 측정하지 못함. LLM이 대화 도중 잘못된 가정을 하면 이후 턴에서 회복하지 못하는 현상이 존재하는지 규명&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;532&quot; data-start=&quot;422&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;447&quot; data-start=&quot;422&quot;&gt;&lt;b&gt;핵심 가설&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;532&quot; data-start=&quot;447&quot; data-col-size=&quot;xl&quot;&gt;LLM의 multi-turn 성능 저하는 단순한 추론 능력(aptitude) 감소가 아니라, &lt;b&gt;신뢰성(reliability)의 붕괴&lt;/b&gt;에서 기인&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;675&quot; data-start=&quot;533&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;552&quot; data-start=&quot;533&quot;&gt;&lt;b&gt;방법론&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;675&quot; data-start=&quot;552&quot; data-col-size=&quot;xl&quot;&gt;기존 single-turn 벤치마크를 정보 단위로 분해하는 &lt;b&gt;Sharded Multi-Turn Simulation&lt;/b&gt; 제안. 한 턴당 하나의 정보 shard만 공개하여 실제 underspecified 대화를 모사&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;856&quot; data-start=&quot;676&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;699&quot; data-start=&quot;676&quot;&gt;&lt;b&gt;비교 설정&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;856&quot; data-start=&quot;699&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;FULL&lt;/b&gt;: 모든 정보 1턴 제공 (single-turn baseline)&lt;br /&gt;&lt;b&gt;CONCAT&lt;/b&gt;: multi-turn이지만 모든 과거 정보를 누적 제공&lt;br /&gt;&lt;b&gt;SHARDED&lt;/b&gt;: 턴마다 일부 정보만 공개되는 진짜 multi-turn underspecified 대화&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1026&quot; data-start=&quot;857&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;879&quot; data-start=&quot;857&quot;&gt;&lt;b&gt;평가 지표&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1026&quot; data-start=&quot;879&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;Performance (P)&lt;/b&gt;: 평균 성능&lt;br /&gt;&lt;b&gt;Aptitude (A)&lt;/b&gt;: 90th percentile (best-case 성능)&lt;br /&gt;&lt;b&gt;Unreliability (U)&lt;/b&gt;: 90&amp;ndash;10 percentile 차이 (best&amp;ndash;worst 성능 격차)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1214&quot; data-start=&quot;1027&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1047&quot; data-start=&quot;1027&quot;&gt;&lt;b&gt;실험 규모&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1214&quot; data-start=&quot;1047&quot; data-col-size=&quot;xl&quot;&gt;6개 생성 태스크(Code, Math, DB, Data-to-Text, Summary 등)&lt;br /&gt;15개 LLM (GPT-4.1, Gemini 2.5 Pro, Claude, LLaMA3 등)&lt;br /&gt;600 instructions &amp;times; 10 runs &amp;times; 3 설정 &amp;rarr; &lt;b&gt;200,000+ 시뮬레이션&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1383&quot; data-start=&quot;1215&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1242&quot; data-start=&quot;1215&quot;&gt;&lt;b&gt;핵심 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1383&quot; data-start=&quot;1242&quot; data-col-size=&quot;xl&quot;&gt;SHARDED 설정에서 모든 모델 성능 급락&lt;br /&gt;&amp;bull; 평균 성능: &lt;b&gt;~90% &amp;rarr; ~65% (&amp;minus;25~39%)&lt;/b&gt;&lt;br /&gt;&amp;bull; Aptitude: &lt;b&gt;약 &amp;minus;15% (소폭 감소)&lt;/b&gt;&lt;br /&gt;&amp;bull; Unreliability: &lt;b&gt;+112% (2배 이상 증가)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1497&quot; data-start=&quot;1384&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1410&quot; data-start=&quot;1384&quot;&gt;&lt;b&gt;핵심 발견&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1497&quot; data-start=&quot;1410&quot; data-col-size=&quot;xl&quot;&gt;multi-turn 성능 붕괴의 주원인은 &lt;b&gt;능력 부족이 아니라 신뢰성 붕괴&lt;/b&gt;. 좋은 모델도 multi-turn에서는 결과 변동성이 극단적으로 커짐&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1661&quot; data-start=&quot;1498&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1522&quot; data-start=&quot;1498&quot;&gt;&lt;b&gt;원인 분석&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1661&quot; data-start=&quot;1522&quot; data-col-size=&quot;xl&quot;&gt;(1) 정보가 부족한 상태에서 &lt;b&gt;조기 답변 생성&lt;/b&gt;&lt;br /&gt;(2) underspecified 정보를 &lt;b&gt;임의 가정&lt;/b&gt;&lt;br /&gt;(3) 이전 잘못된 답변에 과도하게 의존&lt;br /&gt;(4) &lt;b&gt;loss-in-middle-turns&lt;/b&gt;: 중간 턴 정보 무시&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1750&quot; data-start=&quot;1662&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1686&quot; data-start=&quot;1662&quot;&gt;&lt;b&gt;예외 사례&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1750&quot; data-start=&quot;1686&quot; data-col-size=&quot;xl&quot;&gt;Translation과 같은 &lt;b&gt;episodic&amp;middot;분해 가능한 태스크&lt;/b&gt;는 multi-turn에서도 성능 유지&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1836&quot; data-start=&quot;1751&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1767&quot; data-start=&quot;1751&quot;&gt;&lt;b&gt;기존 해결책 평가&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1836&quot; data-start=&quot;1767&quot; data-col-size=&quot;xl&quot;&gt;Reasoning 모델, temperature 감소, agent-style concat 모두 &lt;b&gt;근본적 해결 실패&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1912&quot; data-start=&quot;1837&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1851&quot; data-start=&quot;1837&quot;&gt;&lt;b&gt;사용자 시사점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1912&quot; data-start=&quot;1851&quot; data-col-size=&quot;xl&quot;&gt;대화가 꼬이면 &lt;b&gt;새 대화에서 재시작&lt;/b&gt;, 모든 요구사항을 &lt;b&gt;한 번에 정리(consolidate)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2033&quot; data-start=&quot;1913&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1930&quot; data-start=&quot;1913&quot;&gt;&lt;b&gt;연구/시스템 시사점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2033&quot; data-start=&quot;1930&quot; data-col-size=&quot;xl&quot;&gt;multi-turn 평가에는 &lt;b&gt;Reliability 중심 지표 필수&lt;/b&gt;. Agent framework는 우회책일 뿐, LLM 자체의 multi-turn 신뢰성 개선이 핵심 과제&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2119&quot; data-start=&quot;2034&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2047&quot; data-start=&quot;2034&quot;&gt;&lt;b&gt;한 줄 결론&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2119&quot; data-start=&quot;2047&quot; data-col-size=&quot;xl&quot;&gt;&lt;b&gt;LLM은 multi-turn 대화에서 &amp;ldquo;모르는 상태를 유지&amp;rdquo;하지 못하며, 한 번 잘못된 가정을 하면 회복하지 못한다&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1193</guid>
      <comments>https://yoonschallenge.tistory.com/1193#entry1193comment</comments>
      <pubDate>Sun, 18 Jan 2026 01:47:25 +0900</pubDate>
    </item>
    <item>
      <title>Multi-turn, Long-context Benchmark 논문 1</title>
      <link>https://yoonschallenge.tistory.com/1192</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2020.acl-main.130/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2020.acl-main.130/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768632251827&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;MuTual: A Dataset for Multi-Turn Dialogue Reasoning&quot; data-og-description=&quot;Leyang Cui, Yu Wu, Shujie Liu, Yue Zhang, Ming Zhou. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. 2020.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2020.acl-main.130/&quot; data-og-url=&quot;https://aclanthology.org/2020.acl-main.130/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/rFCk7/dJMb84XSokf/H685G1FeJz3dVQt6chLDRk/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2020.acl-main.130/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2020.acl-main.130/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/rFCk7/dJMb84XSokf/H685G1FeJz3dVQt6chLDRk/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;MuTual: A Dataset for Multi-Turn Dialogue Reasoning&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Leyang Cui, Yu Wu, Shujie Liu, Yue Zhang, Ming Zhou. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. 2020.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ACL 2020에 붙은 논문입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 목적 없는 대화 벤치마크들은 표면적으로만 언어 매칭이 보여서 다중 턴 대화에서 요구되는 추론 능력이 부족하다는 문제가 지속적으로 지적됨&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; MuTual 은 다중 턴 대화 맥락을 기반으로 논리적으로 가장 적절한 다음 발화를 고르는 추론 중심 벤치마크!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;941&quot; data-origin-height=&quot;585&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/lLUkL/dJMcaia0DXF/vfbTyQSDZNGnL71RdiHIuk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/lLUkL/dJMcaia0DXF/vfbTyQSDZNGnL71RdiHIuk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/lLUkL/dJMcaia0DXF/vfbTyQSDZNGnL71RdiHIuk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FlLUkL%2FdJMcaia0DXF%2FvfbTyQSDZNGnL71RdiHIuk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;941&quot; height=&quot;585&quot; data-origin-width=&quot;941&quot; data-origin-height=&quot;585&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다중 턴이 이어지고, 4개의 응답 후보가 있으며 맥락상 추론이 이루어져야 논리적으로 적절한 응답이 된다.&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1696&quot; data-origin-height=&quot;740&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/HBS5z/dJMcaiB1Q0j/w7zFPm07nYOWfHr1DPOXy1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/HBS5z/dJMcaiB1Q0j/w7zFPm07nYOWfHr1DPOXy1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/HBS5z/dJMcaiB1Q0j/w7zFPm07nYOWfHr1DPOXy1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FHBS5z%2FdJMcaiB1Q0j%2Fw7zFPm07nYOWfHr1DPOXy1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1696&quot; height=&quot;740&quot; data-origin-width=&quot;1696&quot; data-origin-height=&quot;740&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ASR(대화 내용) + OCR(정답 텍스트)을 통해 텍스트로 변환하고, 대화를 재구성하며 Hard Negative를 추가하고 품질 검수를 진행하여 오답도 맥락 없이는 그럴듯 한 말을 하며&amp;nbsp; 고품질 문제를 만들었음&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;총 인스턴스 수&lt;/td&gt;
&lt;td&gt;&lt;b&gt;8,860&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;평균 대화 턴 수&lt;/td&gt;
&lt;td&gt;4.73&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;평균 발화 길이&lt;/td&gt;
&lt;td&gt;19.57 단어&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;응답 후보 수&lt;/td&gt;
&lt;td&gt;4&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;어휘 크기&lt;/td&gt;
&lt;td&gt;11,343&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;원본 대화 수&lt;/td&gt;
&lt;td&gt;6,371&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1279&quot; data-origin-height=&quot;704&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bfg9gZ/dJMcaa47ce5/oQgjFe1zPwS4Xc7MDeh0A0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bfg9gZ/dJMcaa47ce5/oQgjFe1zPwS4Xc7MDeh0A0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bfg9gZ/dJMcaa47ce5/oQgjFe1zPwS4Xc7MDeh0A0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbfg9gZ%2FdJMcaa47ce5%2FoQgjFe1zPwS4Xc7MDeh0A0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1279&quot; height=&quot;704&quot; data-origin-width=&quot;1279&quot; data-origin-height=&quot;704&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;추론 유형은 6개로 단순 언어 이해가 아닌 챗봇에 필요한 추론 유형을 직접 반영&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1710&quot; data-start=&quot;181&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;387&quot; data-start=&quot;269&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;277&quot; data-start=&quot;269&quot;&gt;연구 문제&lt;/td&gt;
&lt;td data-end=&quot;387&quot; data-start=&quot;277&quot; data-col-size=&quot;lg&quot;&gt;기존 대화 벤치마크는 lexical/semantic matching만으로도 높은 성능 달성이 가능하여, &lt;b&gt;다중 턴 대화에서의 실제 추론 능력(reasoning)&lt;/b&gt; 을 제대로 평가하지 못함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;489&quot; data-start=&quot;388&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;396&quot; data-start=&quot;388&quot;&gt;연구 목표&lt;/td&gt;
&lt;td data-end=&quot;489&quot; data-start=&quot;396&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Multi-turn dialogue context를 기반으로 논리적으로 가장 적절한 다음 발화&lt;/b&gt;를 선택하도록 요구하는 &lt;b&gt;추론 중심 대화 벤치마크&lt;/b&gt; 구축&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;554&quot; data-start=&quot;490&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;499&quot; data-start=&quot;490&quot;&gt;태스크 정의&lt;/td&gt;
&lt;td data-end=&quot;554&quot; data-start=&quot;499&quot; data-col-size=&quot;lg&quot;&gt;Multi-Turn &lt;b&gt;Next Utterance Prediction&lt;/b&gt; (응답 선택 문제)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;590&quot; data-start=&quot;555&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;560&quot; data-start=&quot;555&quot;&gt;입력&lt;/td&gt;
&lt;td data-end=&quot;590&quot; data-start=&quot;560&quot; data-col-size=&quot;lg&quot;&gt;다중 턴 대화 맥락 (평균 4.73 turns)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;634&quot; data-start=&quot;591&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;596&quot; data-start=&quot;591&quot;&gt;출력&lt;/td&gt;
&lt;td data-end=&quot;634&quot; data-start=&quot;596&quot; data-col-size=&quot;lg&quot;&gt;4개의 응답 후보 중 &lt;b&gt;논리적으로 가장 적절한 1개 선택&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;683&quot; data-start=&quot;635&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;644&quot; data-start=&quot;635&quot;&gt;데이터 출처&lt;/td&gt;
&lt;td data-end=&quot;683&quot; data-start=&quot;644&quot; data-col-size=&quot;lg&quot;&gt;중국 고등학생 &lt;b&gt;영어 듣기 평가 시험&lt;/b&gt; (전문가 설계 문제)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;798&quot; data-start=&quot;684&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;696&quot; data-start=&quot;684&quot;&gt;데이터 생성 방식&lt;/td&gt;
&lt;td data-end=&quot;798&quot; data-start=&quot;696&quot; data-col-size=&quot;lg&quot;&gt;(1) ASR/OCR &amp;rarr; (2) 질문 제거 &amp;rarr; (3) 정답&amp;middot;오답을 다음 발화로 재작성 &amp;rarr; (4) 정답 기반 hard negative 추가 &amp;rarr; (5) 다중 annotator 검수&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;861&quot; data-start=&quot;799&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;808&quot; data-start=&quot;799&quot;&gt;데이터 규모&lt;/td&gt;
&lt;td data-end=&quot;861&quot; data-start=&quot;808&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;8,860&lt;/b&gt; instances (Train 80 / Dev 10 / Test 10)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;922&quot; data-start=&quot;862&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;873&quot; data-start=&quot;862&quot;&gt;응답 후보 특성&lt;/td&gt;
&lt;td data-end=&quot;922&quot; data-start=&quot;873&quot; data-col-size=&quot;lg&quot;&gt;모든 후보가 문법&amp;middot;의미적으로 자연스러우나 &lt;b&gt;맥락 추론 없이는 정답 판별 불가&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;985&quot; data-start=&quot;923&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;941&quot; data-start=&quot;923&quot;&gt;Lexical Bias 통제&lt;/td&gt;
&lt;td data-end=&quot;985&quot; data-start=&quot;941&quot; data-col-size=&quot;lg&quot;&gt;정답/오답 간 lexical overlap 거의 동일 &amp;rarr; 단순 매칭 불가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1107&quot; data-start=&quot;986&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;997&quot; data-start=&quot;986&quot;&gt;주요 추론 유형&lt;/td&gt;
&lt;td data-end=&quot;1107&quot; data-start=&quot;997&quot; data-col-size=&quot;lg&quot;&gt;Intention Prediction (31%), Multi-fact (24%), Situation (16%), Attitude (13%), Algebraic (7%), Others (9%)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1197&quot; data-start=&quot;1108&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1118&quot; data-start=&quot;1108&quot;&gt;확장 데이터셋&lt;/td&gt;
&lt;td data-end=&quot;1197&quot; data-start=&quot;1118&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;MuTual+&lt;/b&gt;: Safe Response(&amp;ldquo;I didn&amp;rsquo;t catch that&amp;rdquo;)를 후보에 포함하여 &lt;b&gt;실제 챗봇 환경&lt;/b&gt; 모사&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1223&quot; data-start=&quot;1198&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1206&quot; data-start=&quot;1198&quot;&gt;평가 지표&lt;/td&gt;
&lt;td data-end=&quot;1223&quot; data-start=&quot;1206&quot; data-col-size=&quot;lg&quot;&gt;R@1, R@2, MRR&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1312&quot; data-start=&quot;1224&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1232&quot; data-start=&quot;1224&quot;&gt;비교 모델&lt;/td&gt;
&lt;td data-end=&quot;1312&quot; data-start=&quot;1232&quot; data-col-size=&quot;lg&quot;&gt;TF-IDF, Dual-LSTM, SMN, DAM, BERT, RoBERTa, GPT-2, Multi-choice BERT/RoBERTa&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1359&quot; data-start=&quot;1313&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1324&quot; data-start=&quot;1313&quot;&gt;최고 모델 성능&lt;/td&gt;
&lt;td data-end=&quot;1359&quot; data-start=&quot;1324&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;RoBERTa: R@1 = 71.3% (Test)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1387&quot; data-start=&quot;1360&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1368&quot; data-start=&quot;1360&quot;&gt;인간 성능&lt;/td&gt;
&lt;td data-end=&quot;1387&quot; data-start=&quot;1368&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;R@1 = 93.8%&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1471&quot; data-start=&quot;1388&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1396&quot; data-start=&quot;1388&quot;&gt;핵심 결과&lt;/td&gt;
&lt;td data-end=&quot;1471&quot; data-start=&quot;1396&quot; data-col-size=&quot;lg&quot;&gt;최신 PLM조차 &lt;b&gt;인간 대비 20%p 이상 성능 격차&lt;/b&gt;, 특히 algebraic&amp;middot;situation reasoning에서 취약&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1542&quot; data-start=&quot;1472&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1480&quot; data-start=&quot;1472&quot;&gt;추가 분석&lt;/td&gt;
&lt;td data-end=&quot;1542&quot; data-start=&quot;1480&quot; data-col-size=&quot;lg&quot;&gt;Context ablation 시 성능 급락 &amp;rarr; &lt;b&gt;진정한 multi-turn reasoning 필요&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1609&quot; data-start=&quot;1543&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1548&quot; data-start=&quot;1543&quot;&gt;결론&lt;/td&gt;
&lt;td data-end=&quot;1609&quot; data-start=&quot;1548&quot; data-col-size=&quot;lg&quot;&gt;MuTual은 &lt;b&gt;기존 대화 벤치마크로는 드러나지 않던 추론 한계&lt;/b&gt;를 명확히 드러내는 고난도 데이터셋&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1710&quot; data-start=&quot;1610&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1619&quot; data-start=&quot;1610&quot;&gt;연구적 의의&lt;/td&gt;
&lt;td data-end=&quot;1710&quot; data-start=&quot;1619&quot; data-col-size=&quot;lg&quot;&gt;Dialogue reasoning, MAS, planner-based agent, tool-augmented LLM 평가에 적합한 &lt;b&gt;표준 벤치마크 후보&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://dl.acm.org/doi/10.5555/3666122.3668142&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://dl.acm.org/doi/10.5555/3666122.3668142&lt;/a&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 LLM 벤치마크는 객관식, 단답형 중심으로 Instruction following, multi-turn 대화, 유용성과 같은 인간 선호를 제대로 측정하지 못한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실제 사용자 선호와 벤치마크 점수 간 불일치가 반복적으로 관찰된다!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt;LLM을 평가자로 활용해서 인간 평가를 대체하자&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;==&amp;gt; 인간 선호 중심 벤치마크를 설계하고 LLM-as-a-Judge의 체계적 검증을 들어간다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;880&quot; data-origin-height=&quot;759&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dlFmjl/dJMcaia0EBV/NHl98aA9vClWWuw0JaZgiK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dlFmjl/dJMcaia0EBV/NHl98aA9vClWWuw0JaZgiK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dlFmjl/dJMcaia0EBV/NHl98aA9vClWWuw0JaZgiK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdlFmjl%2FdJMcaia0EBV%2FNHl98aA9vClWWuw0JaZgiK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;880&quot; height=&quot;759&quot; data-origin-width=&quot;880&quot; data-origin-height=&quot;759&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;멀티턴 대화 및 Instruction-following 능력을 평가하기 위해 1턴 답변 후 제약이 있는 2턴 지시를 제공하여 실제 사용자 시나리오를 반영한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Chetbot Arena를 통해 사용자들이 두 모델과 동시에 대화 후 선호를 투표함&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1440&quot; data-origin-height=&quot;782&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/HpOF9/dJMcaaRAcxz/4IqFCxt9EYssQBchqFLoC1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/HpOF9/dJMcaaRAcxz/4IqFCxt9EYssQBchqFLoC1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/HpOF9/dJMcaaRAcxz/4IqFCxt9EYssQBchqFLoC1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FHpOF9%2FdJMcaaRAcxz%2F4IqFCxt9EYssQBchqFLoC1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1440&quot; height=&quot;782&quot; data-origin-width=&quot;1440&quot; data-origin-height=&quot;782&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1850&quot; data-start=&quot;223&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;466&quot; data-start=&quot;316&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;341&quot; data-start=&quot;316&quot;&gt;&lt;b&gt;연구 문제&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;466&quot; data-start=&quot;341&quot; data-col-size=&quot;lg&quot;&gt;기존 LLM 벤치마크(MMLU, HELM 등)는 객관식&amp;middot;단답형 중심이라 실제 사용자 선호(human preference), multi-turn 대화, instruction-following 능력을 제대로 평가하지 못함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;553&quot; data-start=&quot;467&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;481&quot; data-start=&quot;467&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;553&quot; data-start=&quot;481&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;강력한 LLM(GPT-4 등)을 평가자(LLM-as-a-Judge)로 사용&lt;/b&gt;하여 인간 선호를 자동&amp;middot;확장 가능하게 근사&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;664&quot; data-start=&quot;554&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;570&quot; data-start=&quot;554&quot;&gt;&lt;b&gt;제안 벤치마크 1&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;664&quot; data-start=&quot;570&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;MT-Bench&lt;/b&gt;: 80개 multi-turn 질문(2턴), Writing&amp;middot;Reasoning&amp;middot;Math&amp;middot;Coding 등 8개 카테고리, 인간 전문가 평가 포함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;765&quot; data-start=&quot;665&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;681&quot; data-start=&quot;665&quot;&gt;&lt;b&gt;제안 벤치마크 2&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;765&quot; data-start=&quot;681&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Chatbot Arena&lt;/b&gt;: 실제 사용자들이 두 챗봇과 익명으로 대화 후 선호 투표 (약 30K votes, in-the-wild 데이터)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;900&quot; data-start=&quot;766&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;790&quot; data-start=&quot;766&quot;&gt;&lt;b&gt;LLM-as-a-Judge 방식&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;900&quot; data-start=&quot;790&quot; data-col-size=&quot;lg&quot;&gt;(1) Pairwise 비교 (A vs B) &lt;br /&gt;(2) Single-answer grading (1~10점) &lt;br /&gt;(3) Reference-guided grading (수학/추론용)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;975&quot; data-start=&quot;901&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;920&quot; data-start=&quot;901&quot;&gt;&lt;b&gt;LLM Judge 장점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;975&quot; data-start=&quot;920&quot; data-col-size=&quot;lg&quot;&gt;인간 평가 대비 &lt;b&gt;저비용&amp;middot;대규모 확장 가능&lt;/b&gt;, 평가 근거를 자연어로 제공 &amp;rarr; 설명 가능성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1095&quot; data-start=&quot;976&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;991&quot; data-start=&quot;976&quot;&gt;&lt;b&gt;주요 한계 분석&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1095&quot; data-start=&quot;991&quot; data-col-size=&quot;lg&quot;&gt;Position bias(앞 답변 선호), Verbosity bias(장문 선호), Self-enhancement bias(자기 모델 선호), Math/Reasoning 채점 오류&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1207&quot; data-start=&quot;1096&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1111&quot; data-start=&quot;1096&quot;&gt;&lt;b&gt;한계 완화 방법&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1207&quot; data-start=&quot;1111&quot; data-col-size=&quot;lg&quot;&gt;답변 순서 swap, few-shot judge, chain-of-thought judge, &lt;b&gt;reference-guided judge(수학 오류율 대폭 감소)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1294&quot; data-start=&quot;1208&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1223&quot; data-start=&quot;1208&quot;&gt;&lt;b&gt;핵심 실험 설정&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1294&quot; data-start=&quot;1223&quot; data-col-size=&quot;lg&quot;&gt;MT-Bench: 전문가 58명, 약 3K 투표 &lt;br /&gt;Chatbot Arena: 사용자 2,114명, 샘플 3K 투표&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1377&quot; data-start=&quot;1295&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1319&quot; data-start=&quot;1295&quot;&gt;&lt;b&gt;핵심 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1377&quot; data-start=&quot;1319&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;GPT-4 Judge &amp;harr; 인간 선호 일치도 &amp;ge; 80%&lt;/b&gt;, 인간-인간 일치도(&amp;asymp;81%)와 동등&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1425&quot; data-start=&quot;1378&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1390&quot; data-start=&quot;1378&quot;&gt;&lt;b&gt;추가 관찰&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1425&quot; data-start=&quot;1390&quot; data-col-size=&quot;lg&quot;&gt;모델 성능 차이가 클수록 GPT-4 &amp;harr; 인간 일치도 증가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1514&quot; data-start=&quot;1426&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1441&quot; data-start=&quot;1426&quot;&gt;&lt;b&gt;모델 평가 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1514&quot; data-start=&quot;1441&quot; data-col-size=&quot;lg&quot;&gt;GPT-4 &amp;gt; GPT-3.5 &amp;gt; Claude &amp;gt; Vicuna &amp;gt; Alpaca &amp;gt; LLaMA (인간 평가와 동일한 순위 경향)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1594&quot; data-start=&quot;1515&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1533&quot; data-start=&quot;1515&quot;&gt;&lt;b&gt;기존 벤치마크와 관계&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1594&quot; data-start=&quot;1533&quot; data-col-size=&quot;lg&quot;&gt;MMLU/TruthfulQA(능력 평가)와 MT-Bench/Arena(선호 평가)는 &lt;b&gt;상호 보완적&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1685&quot; data-start=&quot;1595&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1623&quot; data-start=&quot;1595&quot;&gt;&lt;b&gt;연구 기여&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1685&quot; data-start=&quot;1623&quot; data-col-size=&quot;lg&quot;&gt;(1) LLM-as-a-Judge의 최초 체계적 검증 &lt;br /&gt;(2) 인간 선호 기반 공개 벤치마크 제공&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1767&quot; data-start=&quot;1686&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1703&quot; data-start=&quot;1686&quot;&gt;&lt;b&gt;한계 및 향후 과제&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1767&quot; data-start=&quot;1703&quot; data-col-size=&quot;lg&quot;&gt;Safety/Harmlessness 미포함, 선호 요소 세분화 필요, open-source judge 고도화&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1850&quot; data-start=&quot;1768&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1777&quot; data-start=&quot;1768&quot;&gt;&lt;b&gt;결론&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1850&quot; data-start=&quot;1777&quot; data-col-size=&quot;lg&quot;&gt;LLM-as-a-Judge는 인간 선호 평가의 &lt;b&gt;실질적&amp;middot;확장 가능한 대안&lt;/b&gt;이며, 차세대 LLM 평가 패러다임의 핵심 도구&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&lt;a href=&quot;https://aclanthology.org/2024.emnlp-main.1124/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2024.emnlp-main.1124/&lt;/a&gt;&lt;/b&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768633188987&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models&quot; data-og-description=&quot;Wai-Chung Kwan, Xingshan Zeng, Yuxin Jiang, Yufei Wang, Liangyou Li, Lifeng Shang, Xin Jiang, Qun Liu, Kam-Fai Wong. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing. 2024.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2024.emnlp-main.1124/&quot; data-og-url=&quot;https://aclanthology.org/2024.emnlp-main.1124/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/0ek9D/dJMb8SpBy5x/XeW1j19P03ukWPpQv501Yk/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.emnlp-main.1124/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2024.emnlp-main.1124/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/0ek9D/dJMb8SpBy5x/XeW1j19P03ukWPpQv501Yk/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Wai-Chung Kwan, Xingshan Zeng, Yuxin Jiang, Yufei Wang, Liangyou Li, Lifeng Shang, Xin Jiang, Qun Liu, Kam-Fai Wong. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing. 2024.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이건 EMNLP 2024에 붙은 논문입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 LLM 벤치마크는 단일 턴이거나 매우 짧은 멀티턴 (2턴) 위주였음!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실제 사용 환경에서는 이전 발화 기억, 지시 누적, 오류 전파가 핵심이나 이를 정략적으로 평가하는 밴치마크는 부재하다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1497&quot; data-origin-height=&quot;582&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cVnBZL/dJMcadOeVwN/k08k42YBD5RHktSctVVOOk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cVnBZL/dJMcadOeVwN/k08k42YBD5RHktSctVVOOk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cVnBZL/dJMcadOeVwN/k08k42YBD5RHktSctVVOOk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcVnBZL%2FdJMcadOeVwN%2Fk08k42YBD5RHktSctVVOOk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1497&quot; height=&quot;582&quot; data-origin-width=&quot;1497&quot; data-origin-height=&quot;582&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;유형&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;의미&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;평가&amp;nbsp;능력&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Recollection&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;초반 지시&amp;middot;정보를 끝까지 기억&lt;/td&gt;
&lt;td&gt;장기 기억, 전역 지시 준수&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Expansion&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;동일 주제 내 다양한 작업 전개&lt;/td&gt;
&lt;td&gt;주제 유지 능력&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Refinement&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;지시가 점점 복잡해짐&lt;/td&gt;
&lt;td&gt;누적 제약 추적&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;Follow-up&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;이전 답변을 기반으로 질문&lt;/td&gt;
&lt;td&gt;응답 일관성&amp;middot;논리성&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 벤치마크 대비 대화 구조적 다양성을 명확히 모델링함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://huggingface.co/datasets/lmsys/lmsys-chat-1m&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://huggingface.co/datasets/lmsys/lmsys-chat-1m&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768633590816&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;lmsys/lmsys-chat-1m &amp;middot; Datasets at Hugging Face&quot; data-og-description=&quot;We&amp;rsquo;re on a journey to advance and democratize artificial intelligence through open source and open science.&quot; data-og-host=&quot;huggingface.co&quot; data-og-source-url=&quot;https://huggingface.co/datasets/lmsys/lmsys-chat-1m&quot; data-og-url=&quot;https://huggingface.co/datasets/lmsys/lmsys-chat-1m&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bcXUxt/dJMb87fZYyP/UUEHjKomMofX6Cb4UhZupk/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648,https://scrap.kakaocdn.net/dn/ek2b7j/dJMb8Xj832X/S1BYmKbey7pz0ZuRx5WByk/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648&quot;&gt;&lt;a href=&quot;https://huggingface.co/datasets/lmsys/lmsys-chat-1m&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://huggingface.co/datasets/lmsys/lmsys-chat-1m&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bcXUxt/dJMb87fZYyP/UUEHjKomMofX6Cb4UhZupk/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648,https://scrap.kakaocdn.net/dn/ek2b7j/dJMb8Xj832X/S1BYmKbey7pz0ZuRx5WByk/img.png?width=1200&amp;amp;height=648&amp;amp;face=0_0_1200_648');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;lmsys/lmsys-chat-1m &amp;middot; Datasets at Hugging Face&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We&amp;rsquo;re on a journey to advance and democratize artificial intelligence through open source and open science.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;huggingface.co&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LMSYS-Chat-1M을 분석하여 4가지 유형으로 정형화하였고, 평균 6.96턴의 대화로 평균 프롬프트 길이 760단어의 규모를 가지고 기존 데이터에 GPT-4 기반 신규 데이터로 벤치마크 제작&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Single-Turn 대응 셋으로 비교 가능하도록 제작&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1098&quot; data-origin-height=&quot;450&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/c1GVZg/dJMcaiB1Q9a/H4UZol0oK6CKxw2Y7lgrjK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/c1GVZg/dJMcaiB1Q9a/H4UZol0oK6CKxw2Y7lgrjK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/c1GVZg/dJMcaiB1Q9a/H4UZol0oK6CKxw2Y7lgrjK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fc1GVZg%2FdJMcaiB1Q9a%2FH4UZol0oK6CKxw2Y7lgrjK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1098&quot; height=&quot;450&quot; data-origin-width=&quot;1098&quot; data-origin-height=&quot;450&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;평가는 GPT-4 기반 LLM-as-a-Judge 방식으로 1 ~ 10 점 스코어링 진행&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;움 GPT-4를 평가하면서 GPT-4를 evaluation model로 쓴다는게... 훔&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1112&quot; data-origin-height=&quot;675&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Ykjom/dJMcah4eAov/4UwjPBPvpRA5FU67j2s2DK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Ykjom/dJMcah4eAov/4UwjPBPvpRA5FU67j2s2DK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Ykjom/dJMcah4eAov/4UwjPBPvpRA5FU67j2s2DK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FYkjom%2FdJMcah4eAov%2F4UwjPBPvpRA5FU67j2s2DK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1112&quot; height=&quot;675&quot; data-origin-width=&quot;1112&quot; data-origin-height=&quot;675&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;턴이 증가할 수록 스코어는 떨어지는 모습을 보여주며 Single-turn에서 강한 모델이 Multi-turn에서 강하다는 모습을 보여주진 않는다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실패 사례를 분석한 결과 이전 지시 미준수와 오류 전파가 가장 높았다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;현재 질의와 거리가 먼 턴을 삽입했을 때 성능이 급락하는 것도 보여줬다.&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;2276&quot; data-start=&quot;264&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;500&quot; data-start=&quot;382&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;404&quot; data-start=&quot;382&quot;&gt;&lt;b&gt;연구 목적&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;500&quot; data-start=&quot;404&quot; data-col-size=&quot;lg&quot;&gt;기존 LLM 벤치마크가 &lt;b&gt;single-turn 중심&lt;/b&gt;이라 실제 사용 환경의 &lt;b&gt;다중 턴 대화 능력(기억, 지시 누적, 오류 전파)&lt;/b&gt;을 평가하지 못하는 문제 해결&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;604&quot; data-start=&quot;501&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;522&quot; data-start=&quot;501&quot;&gt;&lt;b&gt;핵심 주장&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;604&quot; data-start=&quot;522&quot; data-col-size=&quot;lg&quot;&gt;Single-turn 성능이 뛰어난 모델도 &lt;b&gt;multi-turn 대화에서는 심각한 성능 저하&lt;/b&gt;를 보이며, 이는 모델의 근본 능력과 무관함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;797&quot; data-start=&quot;605&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;633&quot; data-start=&quot;605&quot;&gt;&lt;b&gt;핵심 기여&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;797&quot; data-start=&quot;633&quot; data-col-size=&quot;lg&quot;&gt;(1) 실제 대화 분석 기반 &lt;b&gt;4가지 multi-turn 유형 정의&lt;/b&gt;&lt;br /&gt;(2) &lt;b&gt;MT-Eval 벤치마크&lt;/b&gt; 제안 (1,170 turns)&lt;br /&gt;(3) Single vs Multi-turn &lt;b&gt;정량 비교 프레임워크&lt;/b&gt;&lt;br /&gt;(4) Multi-turn 성능 저하의 &lt;b&gt;원인 규명&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;958&quot; data-start=&quot;798&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;821&quot; data-start=&quot;798&quot;&gt;&lt;b&gt;Multi-Turn 유형 정의&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;958&quot; data-start=&quot;821&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Recollection&lt;/b&gt;: 초기 지시&amp;middot;정보 장기 기억&lt;br /&gt;&lt;b&gt;Expansion&lt;/b&gt;: 동일 주제 내 다양한 작업 수행&lt;br /&gt;&lt;b&gt;Refinement&lt;/b&gt;: 점진적&amp;middot;누적 지시 준수&lt;br /&gt;&lt;b&gt;Follow-up&lt;/b&gt;: 이전 답변 기반 질의 응답&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1038&quot; data-start=&quot;959&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;973&quot; data-start=&quot;959&quot;&gt;&lt;b&gt;데이터셋 규모&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1038&quot; data-start=&quot;973&quot; data-col-size=&quot;lg&quot;&gt;168 dialogues / &lt;b&gt;1,170 turns&lt;/b&gt;&lt;br /&gt;평균 6.96 turns per dialogue&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1124&quot; data-start=&quot;1039&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1055&quot; data-start=&quot;1039&quot;&gt;&lt;b&gt;데이터 구축 방식&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1124&quot; data-start=&quot;1055&quot; data-col-size=&quot;lg&quot;&gt;기존 데이터 확장 + &lt;b&gt;GPT-4로 신규 데이터 생성&lt;/b&gt; (데이터 누수 방지)&lt;br /&gt;모든 데이터 &lt;b&gt;수작업 검수&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1208&quot; data-start=&quot;1125&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1150&quot; data-start=&quot;1125&quot;&gt;&lt;b&gt;비교 설정&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1208&quot; data-start=&quot;1150&quot; data-col-size=&quot;lg&quot;&gt;동일 질의를 &lt;b&gt;Single-Turn / Multi-Turn&lt;/b&gt;으로 모두 평가하여 성능 격차 분석&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1344&quot; data-start=&quot;1209&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1224&quot; data-start=&quot;1209&quot;&gt;&lt;b&gt;평가 대상 모델&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1344&quot; data-start=&quot;1224&quot; data-col-size=&quot;lg&quot;&gt;GPT-4, GPT-3.5-Turbo, ChatGLM3-6B, Vicuna(7B/13B), LLaMA-2-chat(7B/13B), Qwen-chat(7B/14B), Mistral-7B, Mixtral-8x7B&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1418&quot; data-start=&quot;1345&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1357&quot; data-start=&quot;1345&quot;&gt;&lt;b&gt;평가 방법&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1418&quot; data-start=&quot;1357&quot; data-col-size=&quot;lg&quot;&gt;GPT-4 기반 &lt;b&gt;LLM-as-a-Judge (1~10점)&lt;/b&gt; + 일부 태스크는 규칙 기반 자동 평가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1539&quot; data-start=&quot;1419&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1444&quot; data-start=&quot;1419&quot;&gt;&lt;b&gt;주요 실험 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1539&quot; data-start=&quot;1444&quot; data-col-size=&quot;lg&quot;&gt;GPT-4가 모든 multi-turn 태스크에서 최고 성능&lt;br /&gt;일부 오픈소스(Mistral, Mixtral)는 &lt;b&gt;GPT-3.5 수준 이상&lt;/b&gt;의 특정 태스크 성능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1601&quot; data-start=&quot;1540&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1554&quot; data-start=&quot;1540&quot;&gt;&lt;b&gt;핵심 발견 ①&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1601&quot; data-start=&quot;1554&quot; data-col-size=&quot;lg&quot;&gt;대부분 모델에서 &lt;b&gt;Multi-Turn 성능 &amp;lt; Single-Turn 성능&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1674&quot; data-start=&quot;1602&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1621&quot; data-start=&quot;1602&quot;&gt;&lt;b&gt;핵심 발견 ②&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1674&quot; data-start=&quot;1621&quot; data-col-size=&quot;lg&quot;&gt;Single-Turn 성능이 높아도 &lt;b&gt;Multi-Turn 성능 저하 폭과 상관 없음&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1740&quot; data-start=&quot;1675&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1689&quot; data-start=&quot;1675&quot;&gt;&lt;b&gt;핵심 발견 ③&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1740&quot; data-start=&quot;1689&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Recollection, Refinement&lt;/b&gt; 태스크에서 성능 붕괴가 가장 심함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1820&quot; data-start=&quot;1741&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1759&quot; data-start=&quot;1741&quot;&gt;&lt;b&gt;성능 저하 원인 분석&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1820&quot; data-start=&quot;1759&quot; data-col-size=&quot;lg&quot;&gt;이전 지시 미준수 &lt;b&gt;49.5%&lt;/b&gt;&lt;br /&gt;오류 전파(Error Propagation) &lt;b&gt;48.0%&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1880&quot; data-start=&quot;1821&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1839&quot; data-start=&quot;1821&quot;&gt;&lt;b&gt;Distance 효과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1880&quot; data-start=&quot;1839&quot; data-col-size=&quot;lg&quot;&gt;관련 문서&amp;middot;지시와 현재 질의 간 &lt;b&gt;턴 거리 증가 &amp;rarr; 성능 급락&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1956&quot; data-start=&quot;1881&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1898&quot; data-start=&quot;1881&quot;&gt;&lt;b&gt;Ablation ①&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1956&quot; data-start=&quot;1898&quot; data-col-size=&quot;lg&quot;&gt;과거 응답을 &lt;b&gt;Gold response&lt;/b&gt;로 대체 시 성능 대폭 회복 &amp;rarr; 오류 전파가 핵심 원인&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2025&quot; data-start=&quot;1957&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1974&quot; data-start=&quot;1957&quot;&gt;&lt;b&gt;Ablation ②&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2025&quot; data-start=&quot;1974&quot; data-col-size=&quot;lg&quot;&gt;무관한 대화 삽입 시 (특히 중간 삽입) 성능 급락 &amp;rarr; context noise 취약&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2111&quot; data-start=&quot;2026&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2048&quot; data-start=&quot;2026&quot;&gt;&lt;b&gt;결론&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2111&quot; data-start=&quot;2048&quot; data-col-size=&quot;lg&quot;&gt;LLM의 진짜 약점은 추론 능력이 아니라 &lt;b&gt;장기 대화 유지 능력&lt;/b&gt;이며, multi-turn 평가는 필수&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2222&quot; data-start=&quot;2112&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2126&quot; data-start=&quot;2112&quot;&gt;&lt;b&gt;연구적 시사점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2222&quot; data-start=&quot;2126&quot; data-col-size=&quot;lg&quot;&gt;(1) Multi-turn 벤치마크 필요성 정당화&lt;br /&gt;(2) Memory, instruction tracking, error correction 연구의 중요성 부각&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2276&quot; data-start=&quot;2223&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2236&quot; data-start=&quot;2223&quot;&gt;&lt;b&gt;한 줄 요약&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2276&quot; data-start=&quot;2236&quot; data-col-size=&quot;lg&quot;&gt;&amp;ldquo;Single-turn로는 LLM을 제대로 평가할 수 없다.&amp;rdquo;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.acl-long.401/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2024.acl-long.401/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768634783151&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues&quot; data-og-description=&quot;Ge Bai, Jie Liu, Xingyuan Bu, Yancheng He, Jiaheng Liu, Zhanhui Zhou, Zhuoran Lin, Wenbo Su, Tiezheng Ge, Bo Zheng, Wanli Ouyang. Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2024.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2024.acl-long.401/&quot; data-og-url=&quot;https://aclanthology.org/2024.acl-long.401/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/80Zei/dJMb86nRaWi/h2HoSCa6ShRe5FSL6lZzDK/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.acl-long.401/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2024.acl-long.401/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/80Zei/dJMb86nRaWi/h2HoSCa6ShRe5FSL6lZzDK/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Ge Bai, Jie Liu, Xingyuan Bu, Yancheng He, Jiaheng Liu, Zhanhui Zhou, Zhuoran Lin, Wenbo Su, Tiezheng Ge, Bo Zheng, Wanli Ouyang. Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2024.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;2024 ACL에 붙은 논문입니다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 벤치마크는 단일 턴 중심이고 MT-Bench, MT-Bench++ 역시 2 ~ 3턴 수준의 제한적 멀티턴 평가다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;실제 인간-LLM 상호작용에서 중요한 문잭 누적이나 사용자 피드백 반영, 대화 주도성을 정밀하게 측정하지 못한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 세분화된 능력 단위로, 턴 단위 변화까지 고려하여 평가&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;교육 심리학 기반의 3단계 계층적 능력을 분해함&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 73px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;상위&amp;nbsp;능력&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;의미&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&lt;b&gt;Perceptivity&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;문맥을 정확히 인식&amp;middot;이해하는 능력&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&lt;b&gt;Adaptability&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;사용자 피드백&amp;middot;요구 변화에 적응하는 능력&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&lt;b&gt;Interactivity&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;대화를 주도&amp;middot;확장하는 능력&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1114&quot; data-origin-height=&quot;733&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cfIOih/dJMcagYxAOV/nunRifi7144O6ZXTQ05Vsk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cfIOih/dJMcagYxAOV/nunRifi7144O6ZXTQ05Vsk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cfIOih/dJMcagYxAOV/nunRifi7144O6ZXTQ05Vsk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcfIOih%2FdJMcagYxAOV%2FnunRifi7144O6ZXTQ05Vsk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1114&quot; height=&quot;733&quot; data-origin-width=&quot;1114&quot; data-origin-height=&quot;733&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 290px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 17px;&quot;&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;&lt;b&gt;상위 능력&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;&lt;b&gt;task&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;&lt;b&gt;약어&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;&lt;b&gt;핵심 평가 포인트&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Perceptivity&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Context Memory&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;CM&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;이전 턴 정보 기억&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Anaphora Resolution&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;AR&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;지시대상(이것, 그것) 해석&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Separate Input&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;SI&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;지시&amp;ndash;입력 분리 이해&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Topic Shift&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;TS&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;주제 전환 인식&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Content Confusion&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;CC&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;유사 질문 간 혼동 회피&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Adaptability&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Content Rephrasing&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;CR&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;의미 유지 재서술&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Format Rephrasing&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;FR&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;형식 변환&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Self-correction&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;SC&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;오류 인정&amp;middot;수정&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Self-affirmation&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;SA&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;옳은 답 유지&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Mathematical Reasoning&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;MR&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;수학적 추론 누적&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;General Reasoning&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;GR&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;일반 논리 추론&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Interactivity&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Instruction Clarification&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;IC&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;질문 명확화&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&amp;nbsp;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;Proactive Interaction&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;PI&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;대화 주도 질문&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단순 응답 품질이 아니라 대화 과정 중 능력 변화를 측정&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;데이터는 GPT-4 기반 테스크별 전용 프롬프트를 통해 대화를 생성함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Golden Context를 사용해서 모델이 자기 출력이 아닌 정답 히스토리를 기반으로 응답하여 순수 능력을 평가한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;각 턴을 GPT-4 Judge로 평가하여 최종 점수는 가장 낮은 턴 점수로 하여 실제 대화에서 한 번의 실패가 전체 대화 실패라는 것을 반영함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1523&quot; data-start=&quot;142&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;376&quot; data-start=&quot;278&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;285&quot; data-start=&quot;278&quot;&gt;문제의식&lt;/td&gt;
&lt;td data-end=&quot;376&quot; data-start=&quot;285&quot; data-col-size=&quot;md&quot;&gt;기존 LLM 벤치마크는 &lt;b&gt;단일 턴 또는 매우 제한적인 멀티턴&lt;/b&gt;만 평가 &amp;rarr; 실제 대화의 &lt;b&gt;문맥 누적, 피드백 반영, 대화 주도성&lt;/b&gt;을 정밀하게 측정 불가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;434&quot; data-start=&quot;377&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;385&quot; data-start=&quot;377&quot;&gt;핵심 목표&lt;/td&gt;
&lt;td data-end=&quot;434&quot; data-start=&quot;385&quot; data-col-size=&quot;md&quot;&gt;멀티턴 대화 능력을 &lt;b&gt;세분화된 능력 단위 + 턴 단위 변화&lt;/b&gt;까지 고려하여 평가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;465&quot; data-start=&quot;435&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;445&quot; data-start=&quot;435&quot;&gt;제안 벤치마크&lt;/td&gt;
&lt;td data-end=&quot;465&quot; data-start=&quot;445&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;MT-Bench-101&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;570&quot; data-start=&quot;466&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;474&quot; data-start=&quot;466&quot;&gt;능력 구조&lt;/td&gt;
&lt;td data-end=&quot;570&quot; data-start=&quot;474&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;3단계 계층 구조&lt;/b&gt;&lt;br /&gt;① Perceptivity (문맥 인식)&lt;br /&gt;② Adaptability (적응&amp;middot;반영)&lt;br /&gt;③ Interactivity (대화 주도)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;651&quot; data-start=&quot;571&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;580&quot; data-start=&quot;571&quot;&gt;세부 태스크&lt;/td&gt;
&lt;td data-end=&quot;651&quot; data-start=&quot;580&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;총 13개 태스크&lt;/b&gt;&lt;br /&gt;CM, AR, SI, TS, CC, CR, FR, SC, SA, MR, GR, IC, PI&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;706&quot; data-start=&quot;652&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;661&quot; data-start=&quot;652&quot;&gt;데이터 규모&lt;/td&gt;
&lt;td data-end=&quot;706&quot; data-start=&quot;661&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;1388개 멀티턴 대화 / 4208 turns / 30개 주제 영역&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;764&quot; data-start=&quot;707&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;716&quot; data-start=&quot;707&quot;&gt;데이터 생성&lt;/td&gt;
&lt;td data-end=&quot;764&quot; data-start=&quot;716&quot; data-col-size=&quot;md&quot;&gt;GPT-4 기반 생성 &amp;rarr; &lt;b&gt;5인 이상 인간 검수&lt;/b&gt;, 전원 합의 데이터만 채택&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;838&quot; data-start=&quot;765&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;773&quot; data-start=&quot;765&quot;&gt;평가 방식&lt;/td&gt;
&lt;td data-end=&quot;838&quot; data-start=&quot;773&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;Golden Context 사용&lt;/b&gt; (자기 출력 누적 오류 제거)&lt;br /&gt;GPT-4 Judge (1~10점)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;902&quot; data-start=&quot;839&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;847&quot; data-start=&quot;839&quot;&gt;점수 집계&lt;/td&gt;
&lt;td data-end=&quot;902&quot; data-start=&quot;847&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;최소 턴 점수(min score)&lt;/b&gt; = 대화 최종 점수 (한 번의 실패 = 전체 실패)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;958&quot; data-start=&quot;903&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;912&quot; data-start=&quot;903&quot;&gt;평가 신뢰도&lt;/td&gt;
&lt;td data-end=&quot;958&quot; data-start=&quot;912&quot; data-col-size=&quot;md&quot;&gt;GPT-4 &amp;harr; 인간 평가 &lt;b&gt;87% 일치&lt;/b&gt; (인간 간 일치도 80% 초과)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1032&quot; data-start=&quot;959&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;967&quot; data-start=&quot;959&quot;&gt;실험 모델&lt;/td&gt;
&lt;td data-end=&quot;1032&quot; data-start=&quot;967&quot; data-col-size=&quot;md&quot;&gt;GPT-4/3.5 + LLaMA2, Qwen, Yi, InternLM, Mistral 등 &lt;b&gt;21개 LLM&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1071&quot; data-start=&quot;1033&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1043&quot; data-start=&quot;1033&quot;&gt;주요 결과 ①&lt;/td&gt;
&lt;td data-end=&quot;1071&quot; data-start=&quot;1043&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;GPT-4가 모든 능력에서 최고 성능&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1136&quot; data-start=&quot;1072&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1082&quot; data-start=&quot;1072&quot;&gt;주요 결과 ②&lt;/td&gt;
&lt;td data-end=&quot;1136&quot; data-start=&quot;1082&quot; data-col-size=&quot;md&quot;&gt;모델 크기 &amp;uarr; &amp;rarr; 성능 &amp;uarr; (특히 &lt;b&gt;Interactivity, Questioning&lt;/b&gt;)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1194&quot; data-start=&quot;1137&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1147&quot; data-start=&quot;1137&quot;&gt;주요 결과 ③&lt;/td&gt;
&lt;td data-end=&quot;1194&quot; data-start=&quot;1147&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;Adaptability&amp;middot;Interactivity가 전체적으로 가장 취약&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1281&quot; data-start=&quot;1195&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1205&quot; data-start=&quot;1195&quot;&gt;턴 분석 결과&lt;/td&gt;
&lt;td data-end=&quot;1281&quot; data-start=&quot;1205&quot; data-col-size=&quot;md&quot;&gt;턴 증가 시 &lt;b&gt;Memory&amp;middot;Rephrasing 성능 하락&lt;/b&gt;, IC&amp;middot;PI는 Golden Context로 인한 &lt;b&gt;착시적 상승&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1343&quot; data-start=&quot;1282&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1297&quot; data-start=&quot;1282&quot;&gt;Alignment 분석&lt;/td&gt;
&lt;td data-end=&quot;1343&quot; data-start=&quot;1297&quot; data-col-size=&quot;md&quot;&gt;&lt;b&gt;RLHF / DPO 효과 매우 제한적&lt;/b&gt; &amp;rarr; 멀티턴 능력 개선 거의 없음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1408&quot; data-start=&quot;1344&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1354&quot; data-start=&quot;1344&quot;&gt;핵심 인사이트&lt;/td&gt;
&lt;td data-end=&quot;1408&quot; data-start=&quot;1354&quot; data-col-size=&quot;md&quot;&gt;&amp;ldquo;현재 LLM 정렬&amp;middot;Chat 설계는 &lt;b&gt;멀티턴 대화 능력을 본질적으로 개선하지 못한다&lt;/b&gt;&amp;rdquo;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1192</guid>
      <comments>https://yoonschallenge.tistory.com/1192#entry1192comment</comments>
      <pubDate>Sat, 17 Jan 2026 17:02:43 +0900</pubDate>
    </item>
    <item>
      <title>MAS 논문 - 2</title>
      <link>https://yoonschallenge.tistory.com/1190</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://proceedings.iclr.cc/paper_files/paper/2025/hash/bbc461518c59a2a8d64e70e2c38c4a0e-Abstract-Conference.html&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://proceedings.iclr.cc/paper_files/paper/2025/hash/bbc461518c59a2a8d64e70e2c38c4a0e-Abstract-Conference.html&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768495336614&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Cut the Crap: An Economical Communication Pipeline for LLM-based Multi-Agent Systems&quot; data-og-description=&quot;Requests for name changes in the electronic proceedings will be accepted with no questions asked. However name changes may cause bibliographic tracking issues. Authors are asked to consider this carefully and discuss it with their co-authors prior to reque&quot; data-og-host=&quot;proceedings.iclr.cc&quot; data-og-source-url=&quot;https://proceedings.iclr.cc/paper_files/paper/2025/hash/bbc461518c59a2a8d64e70e2c38c4a0e-Abstract-Conference.html&quot; data-og-url=&quot;https://proceedings.iclr.cc/paper_files/paper/2025/hash/bbc461518c59a2a8d64e70e2c38c4a0e-Abstract-Conference.html&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://proceedings.iclr.cc/paper_files/paper/2025/hash/bbc461518c59a2a8d64e70e2c38c4a0e-Abstract-Conference.html&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://proceedings.iclr.cc/paper_files/paper/2025/hash/bbc461518c59a2a8d64e70e2c38c4a0e-Abstract-Conference.html&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Cut the Crap: An Economical Communication Pipeline for LLM-based Multi-Agent Systems&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Requests for name changes in the electronic proceedings will be accepted with no questions asked. However name changes may cause bibliographic tracking issues. Authors are asked to consider this carefully and discuss it with their co-authors prior to reque&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;proceedings.iclr.cc&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 MAS 시스템은 단일 에이전트 대비 고난도 추론이나 코딩 문제에서 집단 지능을 보여줬지만 토큰 폭증이나 경제적 비효율, 배포 불가능성, 보안 취약성을 보였다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;에이전트간 메세지의 상당 부분은 실제 성능에 기여하지 않는 것을 통해 라운드간의 연결을 무작위로 제거했을 때 성능이 오르는 것을 발견 =&amp;gt; Communication Redundancy로 공식 정의&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;747&quot; data-origin-height=&quot;684&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/DRB2z/dJMcadHuoO1/GUnI2SkNV9iSPanZpcisPk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/DRB2z/dJMcadHuoO1/GUnI2SkNV9iSPanZpcisPk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/DRB2z/dJMcadHuoO1/GUnI2SkNV9iSPanZpcisPk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FDRB2z%2FdJMcadHuoO1%2FGUnI2SkNV9iSPanZpcisPk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;747&quot; height=&quot;684&quot; data-origin-width=&quot;747&quot; data-origin-height=&quot;684&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;여기서 보면 연결이 너무 많아 토큰 폭증으로 이어짐&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1626&quot; data-origin-height=&quot;572&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/czaZ0G/dJMcab30v64/wTVu59cYTJwFGxYjoK6Vk1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/czaZ0G/dJMcab30v64/wTVu59cYTJwFGxYjoK6Vk1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/czaZ0G/dJMcab30v64/wTVu59cYTJwFGxYjoK6Vk1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FczaZ0G%2FdJMcab30v64%2FwTVu59cYTJwFGxYjoK6Vk1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1626&quot; height=&quot;572&quot; data-origin-width=&quot;1626&quot; data-origin-height=&quot;572&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;프루닝을 진행했더니 성능이 오른다!!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;900&quot; data-origin-height=&quot;712&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/u2ZJw/dJMb99LSA2K/MPOu8JZAaT3AGjXdsgXjrK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/u2ZJw/dJMb99LSA2K/MPOu8JZAaT3AGjXdsgXjrK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/u2ZJw/dJMb99LSA2K/MPOu8JZAaT3AGjXdsgXjrK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fu2ZJw%2FdJMb99LSA2K%2FMPOu8JZAaT3AGjXdsgXjrK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;900&quot; height=&quot;712&quot; data-origin-width=&quot;900&quot; data-origin-height=&quot;712&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;DAG Sampling으로 cycle 발견시 edge인 메세지를 랜덤으로 제거한다.&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1344&quot; data-origin-height=&quot;494&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/brEK5p/dJMcabwaFBE/vJ4q7GuYCekLepYDiF1vUk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/brEK5p/dJMcabwaFBE/vJ4q7GuYCekLepYDiF1vUk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/brEK5p/dJMcabwaFBE/vJ4q7GuYCekLepYDiF1vUk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbrEK5p%2FdJMcabwaFBE%2FvJ4q7GuYCekLepYDiF1vUk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1344&quot; height=&quot;494&quot; data-origin-width=&quot;1344&quot; data-origin-height=&quot;494&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;비용을 줄이고, 성능을 유지하는 Agent 진행 가능&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 587px;&quot; border=&quot;1&quot; data-end=&quot;1755&quot; data-start=&quot;214&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;369&quot; data-start=&quot;236&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;258&quot; data-start=&quot;236&quot;&gt;&lt;b&gt;연구 문제&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;369&quot; data-start=&quot;258&quot; data-col-size=&quot;lg&quot;&gt;LLM 기반 Multi-Agent System(MAS)은 에이전트 간 &lt;b&gt;과도한 메시지 교환&lt;/b&gt;으로 인해 토큰 비용 폭증, 추론 노이즈 증가, 배포 비현실성, 악성 에이전트 취약성 문제를 가짐&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;490&quot; data-start=&quot;370&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;396&quot; data-start=&quot;370&quot;&gt;&lt;b&gt;핵심 관찰&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;490&quot; data-start=&quot;396&quot; data-col-size=&quot;lg&quot;&gt;에이전트 통신의 상당 부분은 &lt;b&gt;성능에 기여하지 않는 중복(redundancy)&lt;/b&gt;이며, 통신을 10~30% 제거해도 성능 저하 없이 오히려 향상되는 경우가 존재&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 39px;&quot; data-end=&quot;614&quot; data-start=&quot;491&quot;&gt;
&lt;td style=&quot;height: 39px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;516&quot; data-start=&quot;491&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 39px;&quot; data-end=&quot;614&quot; data-start=&quot;516&quot; data-col-size=&quot;lg&quot;&gt;MAS를 &lt;b&gt;Spatial&amp;ndash;Temporal Communication Graph&lt;/b&gt;로 모델링하고, 성능에 중요한 통신 edge만 &lt;b&gt;학습 기반으로 선택(pruning)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;717&quot; data-start=&quot;615&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;639&quot; data-start=&quot;615&quot;&gt;&lt;b&gt;그래프 정의&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;717&quot; data-start=&quot;639&quot; data-col-size=&quot;lg&quot;&gt;노드: 에이전트 / 엣지: Spatial(동일 round), Temporal(이전 round) &amp;rarr; MAS 전체를 시공간 그래프로 표현&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;794&quot; data-start=&quot;718&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;743&quot; data-start=&quot;718&quot;&gt;&lt;b&gt;문제 정식화&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;794&quot; data-start=&quot;743&quot; data-col-size=&quot;lg&quot;&gt;전체 성능을 유지(또는 향상)하면서 &lt;b&gt;그래프에서 최대한 많은 통신 edge 제거&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 42px;&quot; data-end=&quot;904&quot; data-start=&quot;795&quot;&gt;
&lt;td style=&quot;height: 42px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;816&quot; data-start=&quot;795&quot;&gt;&lt;b&gt;제안 방법&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 42px;&quot; data-end=&quot;904&quot; data-start=&quot;816&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;AgentPrune&lt;/b&gt;: 통신 그래프에 대해 differentiable mask를 학습하고, low-rank 제약을 통해 중요한 소수의 통신만 남김&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1128&quot; data-start=&quot;1043&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1055&quot; data-start=&quot;1043&quot;&gt;&lt;b&gt;학습 전략&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1128&quot; data-start=&quot;1055&quot; data-col-size=&quot;lg&quot;&gt;초기 K&amp;prime; round 동안 mask 학습 &amp;rarr; &lt;b&gt;One-shot pruning&lt;/b&gt;으로 Top-K edge만 남기고 이후 고정&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;1189&quot; data-start=&quot;1129&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1153&quot; data-start=&quot;1129&quot;&gt;&lt;b&gt;비교 대상&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;1189&quot; data-start=&quot;1153&quot; data-col-size=&quot;lg&quot;&gt;AutoGen, GPTSwarm 등 기존 MAS 프레임워크&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;1263&quot; data-start=&quot;1190&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1216&quot; data-start=&quot;1190&quot;&gt;&lt;b&gt;성능 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;1263&quot; data-start=&quot;1216&quot; data-col-size=&quot;lg&quot;&gt;MMLU, GSM8K 등에서 &lt;b&gt;기존 성능 유지 또는 최대 +2~3% 향상&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;1352&quot; data-start=&quot;1264&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1289&quot; data-start=&quot;1264&quot;&gt;&lt;b&gt;비용 절감&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;1352&quot; data-start=&quot;1289&quot; data-col-size=&quot;lg&quot;&gt;토큰 사용량 &lt;b&gt;28.1% ~ 72.8% 감소&lt;/b&gt;, GPT-4 기준 비용 &lt;b&gt;$43.7 &amp;rarr; $5.6&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;1439&quot; data-start=&quot;1353&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1379&quot; data-start=&quot;1353&quot;&gt;&lt;b&gt;보안/강건성&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;1439&quot; data-start=&quot;1379&quot; data-col-size=&quot;lg&quot;&gt;악성 에이전트 공격 시, 해당 agent와 연결된 edge가 제거되어 &lt;b&gt;성능 붕괴 방지 및 회복&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot; data-end=&quot;1519&quot; data-start=&quot;1440&quot;&gt;
&lt;td style=&quot;height: 21px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1458&quot; data-start=&quot;1440&quot;&gt;&lt;b&gt;Ablation 결과&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot; data-end=&quot;1519&quot; data-start=&quot;1458&quot; data-col-size=&quot;lg&quot;&gt;Random pruning, low-rank 제거 시 성능 붕괴 &amp;rarr; &lt;b&gt;학습 기반 구조 선택이 필수&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;1596&quot; data-start=&quot;1520&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1548&quot; data-start=&quot;1520&quot;&gt;&lt;b&gt;기술적 기여&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;1596&quot; data-start=&quot;1548&quot; data-col-size=&quot;lg&quot;&gt;MAS에서 &lt;b&gt;&amp;ldquo;통신 구조 자체를 학습 대상&amp;rdquo;&lt;/b&gt; 으로 다룬 최초의 체계적 접근&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;1671&quot; data-start=&quot;1597&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1620&quot; data-start=&quot;1597&quot;&gt;&lt;b&gt;연구적 의의&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;1671&quot; data-start=&quot;1620&quot; data-col-size=&quot;lg&quot;&gt;&amp;ldquo;더 많은 토큰 &amp;ne; 더 좋은 협업&amp;rdquo; &amp;rarr; &lt;b&gt;효율적 협업은 구조 설계 문제&lt;/b&gt;임을 입증&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 38px;&quot; data-end=&quot;1755&quot; data-start=&quot;1672&quot;&gt;
&lt;td style=&quot;height: 38px;&quot; data-col-size=&quot;sm&quot; data-end=&quot;1697&quot; data-start=&quot;1672&quot;&gt;&lt;b&gt;확장성&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 38px;&quot; data-end=&quot;1755&quot; data-start=&quot;1697&quot; data-col-size=&quot;lg&quot;&gt;기존 MAS에 &lt;b&gt;plug-and-play&lt;/b&gt;로 적용 가능, debate 없는 협업 구조에도 적합&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://iclr.cc/virtual/2025/32752&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://iclr.cc/virtual/2025/32752&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768496486644&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;ICLR  MAS-GPT: Training LLMs To Build LLM-Based Multi-Agent Systems&quot; data-og-description=&quot;LLM-based multi-agent systems (MAS) have shown significant potential in tackling diverse tasks. However, to design effective MAS, existing approaches heavily rely on manual configurations or multiple calls of advanced LLMs, resulting in inadaptability and &quot; data-og-host=&quot;iclr.cc&quot; data-og-source-url=&quot;https://iclr.cc/virtual/2025/32752&quot; data-og-url=&quot;https://iclr.cc/virtual/2025/32752&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://iclr.cc/virtual/2025/32752&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://iclr.cc/virtual/2025/32752&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;ICLR MAS-GPT: Training LLMs To Build LLM-Based Multi-Agent Systems&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;LLM-based multi-agent systems (MAS) have shown significant potential in tackling diverse tasks. However, to design effective MAS, existing approaches heavily rely on manual configurations or multiple calls of advanced LLMs, resulting in inadaptability and&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;iclr.cc&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://openreview.net/forum?id=3CiSpY3QdZ&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://openreview.net/forum?id=3CiSpY3QdZ&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768496507949&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;MAS-GPT: Training LLMs to Build LLM-based Multi-Agent Systems&quot; data-og-description=&quot;LLM-based multi-agent systems (MAS) have shown significant potential in tackling diverse tasks. However, to design effective MAS, existing approaches heavily rely on manual configurations or...&quot; data-og-host=&quot;openreview.net&quot; data-og-source-url=&quot;https://openreview.net/forum?id=3CiSpY3QdZ&quot; data-og-url=&quot;https://openreview.net/forum?id=3CiSpY3QdZ&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://openreview.net/forum?id=3CiSpY3QdZ&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://openreview.net/forum?id=3CiSpY3QdZ&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;MAS-GPT: Training LLMs to Build LLM-based Multi-Agent Systems&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;LLM-based multi-agent systems (MAS) have shown significant potential in tackling diverse tasks. However, to design effective MAS, existing approaches heavily rely on manual configurations or...&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;openreview.net&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 MAS System은 사람이 설계한 고정 구조를 사용하고 inference cost가 너무 높다!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1234&quot; data-origin-height=&quot;509&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ArbzR/dJMcacaMPDP/DrCcqu1M7ceNz3X6LpKz5k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ArbzR/dJMcacaMPDP/DrCcqu1M7ceNz3X6LpKz5k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ArbzR/dJMcacaMPDP/DrCcqu1M7ceNz3X6LpKz5k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FArbzR%2FdJMcacaMPDP%2FDrCcqu1M7ceNz3X6LpKz5k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1234&quot; height=&quot;509&quot; data-origin-width=&quot;1234&quot; data-origin-height=&quot;509&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;쿼리마다 적절한 MAS를 만들고 싶지만 사람 손이 많이 가거나 LLM 호출 비용이 너무큼!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;880&quot; data-origin-height=&quot;571&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cwi9Lx/dJMcah4dYqd/UdyktbNGyD9p7vkGo0kf7K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cwi9Lx/dJMcah4dYqd/UdyktbNGyD9p7vkGo0kf7K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cwi9Lx/dJMcah4dYqd/UdyktbNGyD9p7vkGo0kf7K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcwi9Lx%2FdJMcah4dYqd%2FUdyktbNGyD9p7vkGo0kf7K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;880&quot; height=&quot;571&quot; data-origin-width=&quot;880&quot; data-origin-height=&quot;571&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;LLM이 답을 생성하도록 하는 것이 아닌 에이전트 시스템을 생성하도록 LLM을 학습한다!&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1541&quot; data-origin-height=&quot;649&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Rwgf2/dJMb99SFvRe/k6PKLcDvDjNORlOsCkCF61/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Rwgf2/dJMb99SFvRe/k6PKLcDvDjNORlOsCkCF61/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Rwgf2/dJMb99SFvRe/k6PKLcDvDjNORlOsCkCF61/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FRwgf2%2FdJMb99SFvRe%2Fk6PKLcDvDjNORlOsCkCF61%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1541&quot; height=&quot;649&quot; data-origin-width=&quot;1541&quot; data-origin-height=&quot;649&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Query : 수학, 코드, QA 등 정답 검증 가능한 문제&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;MAS Pool : Debate, Self-Consistency, Self-Refine 등 기존 MAS 재구현으로 수작업 설계가 되어 있는 기존 MAS 구조다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;모든 Query와 MAS 쌍에 대해 실행 후 정답 여부를 판단하고, Query 하나 당 MAS 별 성능을 알 수 있게 된다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;같은 유형의 Query에 서로 다른 MAS가 붙으면 어떤 MAS가 맞는지 모르기에 유사 Query를 클러스터링해서 그룹 내 누적 성능이 가장 좋은 MAS 하나만 선택하여 같은 Query 유형 -&amp;gt; 같은 MAS를 사용하여 일반화 패턴을 학습할 수 있게 된다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;선택된 MAS가 Query와 정확하게 맞지 않을 수 있는데 Closed - LLM을 통해 Agent 역할을 query에 맞게 수정하고, 이 MAS가 필요한지 Reasoning 문단을 생성하여 구조적 정합성과 의미적 정합성을 확보한다.&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이렇게 데이터를 생성하여 MAS 생성이라는 새로운 task를 학습한다.&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;2247&quot; data-start=&quot;217&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;378&quot; data-start=&quot;239&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;254&quot; data-start=&quot;239&quot;&gt;&lt;b&gt;논문 핵심 문제&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;378&quot; data-start=&quot;254&quot; data-col-size=&quot;lg&quot;&gt;기존 LLM 기반 Multi-Agent System(MAS)은 (1) 사람이 수동으로 설계해야 하거나, (2) 쿼리마다 여러 번 LLM 호출이 필요하여 &lt;b&gt;적응성 부족 + 높은 추론 비용&lt;/b&gt;이라는 구조적 한계를 가짐&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;469&quot; data-start=&quot;379&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;393&quot; data-start=&quot;379&quot;&gt;&lt;b&gt;핵심 아이디어&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;469&quot; data-start=&quot;393&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;MAS 설계 자체를 언어 생성 문제로 재정의&lt;/b&gt;: 입력은 사용자 쿼리, 출력은 해당 쿼리를 처리하는 실행 가능한 MAS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;548&quot; data-start=&quot;470&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;482&quot; data-start=&quot;470&quot;&gt;&lt;b&gt;제안 모델&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;548&quot; data-start=&quot;482&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;MAS-GPT&lt;/b&gt;: 단 한 번의 LLM inference로 &lt;b&gt;쿼리-적응형 MAS 코드&lt;/b&gt;를 생성하는 LLM&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;665&quot; data-start=&quot;549&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;565&quot; data-start=&quot;549&quot;&gt;&lt;b&gt;MAS 표현 방식&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;665&quot; data-start=&quot;565&quot; data-col-size=&quot;lg&quot;&gt;모든 MAS를 &lt;b&gt;Python forward() 함수 형태의 코드&lt;/b&gt;로 통일 (Agent = prompt 변수, 추론 = call_llm, 상호작용 = 문자열 결합)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;742&quot; data-start=&quot;666&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;678&quot; data-start=&quot;666&quot;&gt;&lt;b&gt;학습 목표&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;742&quot; data-start=&quot;678&quot; data-col-size=&quot;lg&quot;&gt;&amp;ldquo;정답 생성&amp;rdquo;이 아닌 &lt;b&gt;&amp;ldquo;적절한 Multi-Agent 구조 + 역할 분담을 생성&amp;rdquo;&lt;/b&gt;하도록 LLM을 SFT&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;819&quot; data-start=&quot;743&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;763&quot; data-start=&quot;743&quot;&gt;&lt;b&gt;데이터 구축의 핵심 난제&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;819&quot; data-start=&quot;763&quot; data-col-size=&quot;lg&quot;&gt;LLM은 원래 MAS 설계 지식이 없으며, (Query, MAS) 대응 데이터가 존재하지 않음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;996&quot; data-start=&quot;820&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;839&quot; data-start=&quot;820&quot;&gt;&lt;b&gt;데이터 구축 파이프라인&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;996&quot; data-start=&quot;839&quot; data-col-size=&quot;lg&quot;&gt;① Query Pool &amp;amp; MAS Pool 구성 &amp;rarr; &lt;br /&gt;② Query-MAS 실행&amp;middot;정답 평가 &amp;rarr; &lt;br /&gt;③ &lt;b&gt;Inter-Consistency 기반 Pair Selection&lt;/b&gt; &amp;rarr; &lt;br /&gt;④ &lt;b&gt;Intra-Consistency 기반 Pair Refinement + Reasoning 생성&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1099&quot; data-start=&quot;997&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1021&quot; data-start=&quot;997&quot;&gt;&lt;b&gt;Inter-Consistency&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1099&quot; data-start=&quot;1021&quot; data-col-size=&quot;lg&quot;&gt;유사한 Query 묶음에 대해 &lt;b&gt;누적 성능이 가장 좋은 MAS 하나만 매핑&lt;/b&gt; &amp;rarr; 같은 유형의 문제는 같은 MAS를 학습하도록 유도&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1204&quot; data-start=&quot;1100&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1124&quot; data-start=&quot;1100&quot;&gt;&lt;b&gt;Intra-Consistency&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1204&quot; data-start=&quot;1124&quot; data-col-size=&quot;lg&quot;&gt;선택된 MAS를 Query에 맞게 &lt;b&gt;Agent 역할 수정&lt;/b&gt; + &amp;ldquo;왜 이 MAS가 필요한지&amp;rdquo;에 대한 &lt;b&gt;Reasoning 문단 생성&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1276&quot; data-start=&quot;1205&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1224&quot; data-start=&quot;1205&quot;&gt;&lt;b&gt;최종 학습 데이터 형태&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1276&quot; data-start=&quot;1224&quot; data-col-size=&quot;lg&quot;&gt;(System Prompt, Query, [Reasoning + MAS Code])&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1359&quot; data-start=&quot;1277&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1294&quot; data-start=&quot;1277&quot;&gt;&lt;b&gt;학습 방식 / 모델&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1359&quot; data-start=&quot;1294&quot; data-col-size=&quot;lg&quot;&gt;Supervised Fine-Tuning (SFT) / &lt;b&gt;Qwen2.5-Coder-32B-Instruct&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1424&quot; data-start=&quot;1360&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1373&quot; data-start=&quot;1360&quot;&gt;&lt;b&gt;데이터 규모&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1424&quot; data-start=&quot;1373&quot; data-col-size=&quot;lg&quot;&gt;약 &lt;b&gt;11.4K Query-MAS 쌍&lt;/b&gt;, 평균 MAS 길이 &amp;asymp; 785 tokens&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1541&quot; data-start=&quot;1425&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1437&quot; data-start=&quot;1425&quot;&gt;&lt;b&gt;비교 대상&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1541&quot; data-start=&quot;1437&quot; data-col-size=&quot;lg&quot;&gt;Single LLM, CoT, Self-Consistency, Debate, Self-Refine, AgentVerse, GPTSwarm, DyLAN 등 &lt;b&gt;10+ MAS 방법&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1628&quot; data-start=&quot;1542&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1556&quot; data-start=&quot;1542&quot;&gt;&lt;b&gt;평가 벤치마크&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1628&quot; data-start=&quot;1556&quot; data-col-size=&quot;lg&quot;&gt;MATH, GSM8K, GSM-Hard, HumanEval(+), MMLU, GPQA, SciBench, AIME-2024&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1695&quot; data-start=&quot;1629&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1644&quot; data-start=&quot;1629&quot;&gt;&lt;b&gt;주요 성능 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1695&quot; data-start=&quot;1644&quot; data-col-size=&quot;lg&quot;&gt;모든 벤치마크 평균에서 &lt;b&gt;MAS-GPT 1위&lt;/b&gt;, 2위 대비 약 &lt;b&gt;+3.9%p&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1759&quot; data-start=&quot;1696&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1720&quot; data-start=&quot;1696&quot;&gt;&lt;b&gt;Out-of-Domain 일반화&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1759&quot; data-start=&quot;1720&quot; data-col-size=&quot;lg&quot;&gt;학습에 포함되지 않은 GPQA, SciBench에서도 성능 유지&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1853&quot; data-start=&quot;1760&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1786&quot; data-start=&quot;1760&quot;&gt;&lt;b&gt;Reasoning LLM 결합 효과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1853&quot; data-start=&quot;1786&quot; data-col-size=&quot;lg&quot;&gt;o1-preview 기준 AIME-2024에서 &lt;b&gt;+13.3%&lt;/b&gt;, DeepSeek-R1 기준 &lt;b&gt;+10.0%&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1919&quot; data-start=&quot;1854&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1867&quot; data-start=&quot;1854&quot;&gt;&lt;b&gt;비용 효율성&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1919&quot; data-start=&quot;1867&quot; data-col-size=&quot;lg&quot;&gt;MAS 생성에 &lt;b&gt;LLM 1회 호출&lt;/b&gt;만 필요 (AFlow, DyLAN은 10회 이상)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2009&quot; data-start=&quot;1920&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1941&quot; data-start=&quot;1920&quot;&gt;&lt;b&gt;Ablation 핵심 결론&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2009&quot; data-start=&quot;1941&quot; data-col-size=&quot;lg&quot;&gt;Inter-Consistency, Intra-Consistency, Reasoning 모두 제거 시 성능 크게 하락&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2060&quot; data-start=&quot;2010&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2024&quot; data-start=&quot;2010&quot;&gt;&lt;b&gt;스케일링 특성&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2060&quot; data-start=&quot;2024&quot; data-col-size=&quot;lg&quot;&gt;데이터 &amp;uarr; &amp;rarr; 실행 실패 &amp;darr; / 모델 크기 &amp;uarr; &amp;rarr; 성능 &amp;uarr;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2161&quot; data-start=&quot;2061&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2076&quot; data-start=&quot;2061&quot;&gt;&lt;b&gt;핵심 기여 요약&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2161&quot; data-start=&quot;2076&quot; data-col-size=&quot;lg&quot;&gt;(1) MAS 생성을 학습 가능한 언어 과제로 정식화 (2) 실행 가능한 MAS 코드 생성 LLM 제안 (3) 데이터 일관성 중심 학습 전략 제시&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;2247&quot; data-start=&quot;2162&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;2175&quot; data-start=&quot;2162&quot;&gt;&lt;b&gt;한 줄 요약&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;2247&quot; data-start=&quot;2175&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;&amp;ldquo;MAS-GPT는 답을 생성하는 LLM이 아니라, 문제에 맞는 Multi-Agent 시스템을 설계하는 LLM이다.&amp;rdquo;&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2505.16997&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2505.16997&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768498077143&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;X-MAS: Towards Building Multi-Agent Systems with Heterogeneous LLMs&quot; data-og-description=&quot;LLM-based multi-agent systems (MAS) extend the capabilities of single LLMs by enabling cooperation among multiple specialized agents. However, most existing MAS frameworks rely on a single LLM to drive all agents, constraining the system's intelligence to &quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2505.16997&quot; data-og-url=&quot;https://arxiv.org/abs/2505.16997v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/gpaWl/dJMb8RjVpZB/tJNe2dSuc6kJQSXqt10FZK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/m2ukK/dJMb9bvVOOB/4p2reIf4pMonQ4Kyl0CqBk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2505.16997&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2505.16997&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/gpaWl/dJMb8RjVpZB/tJNe2dSuc6kJQSXqt10FZK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/m2ukK/dJMb9bvVOOB/4p2reIf4pMonQ4Kyl0CqBk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;X-MAS: Towards Building Multi-Agent Systems with Heterogeneous LLMs&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;LLM-based multi-agent systems (MAS) extend the capabilities of single LLMs by enabling cooperation among multiple specialized agents. However, most existing MAS frameworks rely on a single LLM to drive all agents, constraining the system's intelligence to&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 MAS는 단일 LLM기반으로 모델이 약한 부분에서 MAS를 구성하면 task 자체가 붕괴된다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;또한 에이전트 수는 늘었지만 지능의 다양성은 늘지 않았음&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;각 Agent를 서로 다른 LLM으로 구동하여 집단 지능을 단일 모델의 한계가 아니라 모델 집합의 상한으로 확장함&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1639&quot; data-origin-height=&quot;718&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bYbukt/dJMcai9QNXf/NCsrlJrz9pecQ498mfSY6K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bYbukt/dJMcai9QNXf/NCsrlJrz9pecQ498mfSY6K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bYbukt/dJMcai9QNXf/NCsrlJrz9pecQ498mfSY6K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbYbukt%2FdJMcai9QNXf%2FNCsrlJrz9pecQ498mfSY6K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1639&quot; height=&quot;718&quot; data-origin-width=&quot;1639&quot; data-origin-height=&quot;718&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단일 LLM은 크기에 따라 성능이 확정되는 것도 아니고, 특정 도메인에서 붕괴되는 현상도 종종 나와 프롬프트나 구조는 동일하게 가져가고, llm 종류만 바꿔서 진행 =&amp;gt; 성능 오름!&amp;nbsp;&lt;/p&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1805&quot; data-start=&quot;219&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;392&quot; data-start=&quot;241&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;263&quot; data-start=&quot;241&quot;&gt;&lt;b&gt;연구 문제&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;392&quot; data-start=&quot;263&quot; data-col-size=&quot;lg&quot;&gt;기존 LLM 기반 Multi-Agent System(MAS)은 모든 에이전트를 &lt;b&gt;단일 LLM(homogeneous)&lt;/b&gt; 로 구동 &amp;rarr; 모델의 한계&amp;middot;편향&amp;middot;환각이 전체 시스템에 전파되어 &lt;b&gt;집단 지능이 단일 모델 상한에 갇힘&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;517&quot; data-start=&quot;393&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;418&quot; data-start=&quot;393&quot;&gt;&lt;b&gt;핵심 가설&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;517&quot; data-start=&quot;418&quot; data-col-size=&quot;lg&quot;&gt;에이전트를 &lt;b&gt;이질적인 LLM(heterogeneous LLMs)&lt;/b&gt; 로 구동하면, MAS 성능은 단일 모델 한계를 넘어 &lt;b&gt;모델 집합의 집단 지능&lt;/b&gt;으로 확장될 수 있음&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;606&quot; data-start=&quot;518&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;542&quot; data-start=&quot;518&quot;&gt;&lt;b&gt;핵심 제안&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;606&quot; data-start=&quot;542&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;X-MAS&lt;/b&gt;: 역할별로 서로 다른 LLM을 사용하는 Heterogeneous LLM-driven MAS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;659&quot; data-start=&quot;607&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;632&quot; data-start=&quot;607&quot;&gt;&lt;b&gt;벤치마크&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;659&quot; data-start=&quot;632&quot; data-col-size=&quot;lg&quot;&gt;MAS 관점 최초의 체계적 LLM 벤치마크&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;845&quot; data-start=&quot;660&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;689&quot; data-start=&quot;660&quot;&gt;&lt;b&gt;평가 축&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;845&quot; data-start=&quot;689&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;5 Functions &amp;times; 5 Domains = 25 설정&lt;/b&gt;&lt;br /&gt;&amp;bull; Functions: QA, Revise, Aggregation, Planning, Evaluation&lt;br /&gt;&amp;bull; Domains: Math, Coding, Science, Medicine, Finance&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;925&quot; data-start=&quot;846&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;862&quot; data-start=&quot;846&quot;&gt;&lt;b&gt;평가 대상 LLM&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;925&quot; data-start=&quot;862&quot; data-col-size=&quot;lg&quot;&gt;총 &lt;b&gt;27개 LLM&lt;/b&gt; (Chatbot + Reasoner, Generalist + Specialist)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;963&quot; data-start=&quot;926&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;938&quot; data-start=&quot;926&quot;&gt;&lt;b&gt;실험 규모&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;963&quot; data-start=&quot;938&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;1.7M+ evaluations&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1013&quot; data-start=&quot;964&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;978&quot; data-start=&quot;964&quot;&gt;&lt;b&gt;핵심 관찰 1&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1013&quot; data-start=&quot;978&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;모든 상황에서 최고인 단일 LLM은 존재하지 않음&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1079&quot; data-start=&quot;1014&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1028&quot; data-start=&quot;1014&quot;&gt;&lt;b&gt;핵심 관찰 2&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1079&quot; data-start=&quot;1028&quot; data-col-size=&quot;lg&quot;&gt;동일 LLM이라도 &lt;b&gt;도메인&amp;middot;에이전트 역할(Function)에 따라 성능 편차 큼&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1131&quot; data-start=&quot;1080&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1094&quot; data-start=&quot;1080&quot;&gt;&lt;b&gt;핵심 관찰 3&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1131&quot; data-start=&quot;1094&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;소형&amp;middot;전문화 LLM이 대형 LLM을 이기는 경우 다수&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1232&quot; data-start=&quot;1132&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1159&quot; data-start=&quot;1132&quot;&gt;&lt;b&gt;설계 제안&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1232&quot; data-start=&quot;1159&quot; data-col-size=&quot;lg&quot;&gt;기존 MAS 구조&amp;middot;프롬프트&amp;middot;워크플로우는 그대로 유지하고, &lt;b&gt;에이전트별 LLM만 X-MAS-Bench 결과 기반으로 교체&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1295&quot; data-start=&quot;1233&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1249&quot; data-start=&quot;1233&quot;&gt;&lt;b&gt;적용 대상 MAS&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1295&quot; data-start=&quot;1249&quot; data-col-size=&quot;lg&quot;&gt;AgentVerse, LLM-Debate, DyLAN, X-MAS-Proto&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1362&quot; data-start=&quot;1296&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1318&quot; data-start=&quot;1296&quot;&gt;&lt;b&gt;Chatbot-only 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1362&quot; data-start=&quot;1318&quot; data-col-size=&quot;lg&quot;&gt;Homogeneous 대비 &lt;b&gt;최대 +8.4% (MATH)&lt;/b&gt; 성능 향상&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1465&quot; data-start=&quot;1363&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1391&quot; data-start=&quot;1363&quot;&gt;&lt;b&gt;Chatbot + Reasoner 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1465&quot; data-start=&quot;1391&quot; data-col-size=&quot;lg&quot;&gt;AIME-2024 기준:&lt;br /&gt;&amp;bull; AgentVerse: &lt;b&gt;20% &amp;rarr; 50%&lt;/b&gt;&lt;br /&gt;&amp;bull; DyLAN: &lt;b&gt;40% &amp;rarr; 63%&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1532&quot; data-start=&quot;1466&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1479&quot; data-start=&quot;1466&quot;&gt;&lt;b&gt;일반화 성능&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1532&quot; data-start=&quot;1479&quot; data-col-size=&quot;lg&quot;&gt;AIME-2025, MATH-MAS 등 &lt;b&gt;미사용 벤치마크에서도 +30~40%p 향상&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1594&quot; data-start=&quot;1533&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1551&quot; data-start=&quot;1533&quot;&gt;&lt;b&gt;Ablation 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1594&quot; data-start=&quot;1551&quot; data-col-size=&quot;lg&quot;&gt;후보 LLM 수 증가 &amp;rarr; 성능 &lt;b&gt;단조 증가&lt;/b&gt; (도메인 적합성 중요)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1676&quot; data-start=&quot;1595&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1620&quot; data-start=&quot;1595&quot;&gt;&lt;b&gt;핵심 결론 (Conclusion)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1676&quot; data-start=&quot;1620&quot; data-col-size=&quot;lg&quot;&gt;MAS 성능 향상의 핵심은 &lt;b&gt;구조나 Debate가 아니라, 역할별 LLM 다양성과 적합성&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1805&quot; data-start=&quot;1677&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1698&quot; data-start=&quot;1677&quot;&gt;&lt;b&gt;연구 의의 (Impact)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1805&quot; data-start=&quot;1698&quot; data-col-size=&quot;lg&quot;&gt;&amp;bull; Debate 없는 MAS 설계에 강력한 근거 제공&lt;br /&gt;&amp;bull; LLM Routing / Agent-LLM 매핑 학습 연구의 토대&lt;br /&gt;&amp;bull; 비용 효율적&amp;middot;확장 가능한 MAS 설계 방향 제시&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.naacl-long.15/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://aclanthology.org/2024.naacl-long.15/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1768500613211&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;Unleashing the Emergent Cognitive Synergy in Large Language Models: A Task-Solving Agent through Multi-Persona Self-Collaboratio&quot; data-og-description=&quot;Zhenhailong Wang, Shaoguang Mao, Wenshan Wu, Tao Ge, Furu Wei, Heng Ji. Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers). 2024.&quot; data-og-host=&quot;aclanthology.org&quot; data-og-source-url=&quot;https://aclanthology.org/2024.naacl-long.15/&quot; data-og-url=&quot;https://aclanthology.org/2024.naacl-long.15/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/ik1E5/dJMb82MwxBx/NmEcC7TRSmrHykgFiiepF0/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600&quot;&gt;&lt;a href=&quot;https://aclanthology.org/2024.naacl-long.15/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://aclanthology.org/2024.naacl-long.15/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/ik1E5/dJMb82MwxBx/NmEcC7TRSmrHykgFiiepF0/img.jpg?width=600&amp;amp;height=600&amp;amp;face=0_0_600_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Unleashing the Emergent Cognitive Synergy in Large Language Models: A Task-Solving Agent through Multi-Persona Self-Collaboratio&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Zhenhailong Wang, Shaoguang Mao, Wenshan Wu, Tao Ge, Furu Wei, Heng Ji. Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers). 2024.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;aclanthology.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;지식 집약적 task에서 사실 오류가 빈번하고 추론 집약적 task에선 깊은 사고가 부족하며, cot나 self-refine는 한계가 존재한다.&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;단일 LLM이 외부 에이전트나 추가 파인튜닝 없이도 사람처럼 '역할 분담 + 협업'을 수행할 수 있는가? 가 문제임&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;691&quot; data-origin-height=&quot;646&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/4S3CV/dJMcad1Mb8e/WzwlYrWOVTSjstKtv5L8KK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/4S3CV/dJMcad1Mb8e/WzwlYrWOVTSjstKtv5L8KK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/4S3CV/dJMcad1Mb8e/WzwlYrWOVTSjstKtv5L8KK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F4S3CV%2FdJMcad1Mb8e%2FWzwlYrWOVTSjstKtv5L8KK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;691&quot; height=&quot;646&quot; data-origin-width=&quot;691&quot; data-origin-height=&quot;646&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;SPP는 하나의 LLM이 여러 persona를 동적으로 생성해서 자기 자신과 다중 턴 협업을 진행하며 최종 해답에 도달하도록 유도하는 zero-shot prompting 기법임&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;=&amp;gt; 단일 LLm + Multi presona&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;① Persona Identification&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;입력 태스크를 보고 필요한 전문가/청중 역할을 자동 생성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;② Brainstorming&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;각 persona가 자신의 관점에서 지식&amp;middot;힌트 제공&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;③ Iterative Collaboration&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;AI Assistant(리더)가 초안 생성 &amp;rarr; 다른 persona들이 비판&amp;middot;피드백 &amp;rarr; 반복&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;④ Final Answer&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;모든 persona가 만족하는 시점에서 결과 출력&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;987&quot; data-origin-height=&quot;661&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bdLmkV/dJMcai25olg/Wjh8DhCVW0QRXyWRgmUpIk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bdLmkV/dJMcai25olg/Wjh8DhCVW0QRXyWRgmUpIk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bdLmkV/dJMcai25olg/Wjh8DhCVW0QRXyWRgmUpIk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbdLmkV%2FdJMcai25olg%2FWjh8DhCVW0QRXyWRgmUpIk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;987&quot; height=&quot;661&quot; data-origin-width=&quot;987&quot; data-origin-height=&quot;661&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;SPP = Presona 생성 + Brainstorming + iterative feedback이 포함된 확장 구조&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;584&quot; data-origin-height=&quot;624&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/sTsvC/dJMcadOepOZ/jnv0c0OKZnDbgyRoKoWTyK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/sTsvC/dJMcadOepOZ/jnv0c0OKZnDbgyRoKoWTyK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/sTsvC/dJMcadOepOZ/jnv0c0OKZnDbgyRoKoWTyK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FsTsvC%2FdJMcadOepOZ%2Fjnv0c0OKZnDbgyRoKoWTyK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;584&quot; height=&quot;624&quot; data-origin-width=&quot;584&quot; data-origin-height=&quot;624&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;div&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-end=&quot;1792&quot; data-start=&quot;266&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr data-end=&quot;402&quot; data-start=&quot;288&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;300&quot; data-start=&quot;288&quot;&gt;&lt;b&gt;연구 문제&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;402&quot; data-start=&quot;300&quot; data-col-size=&quot;lg&quot;&gt;단일 LLM이 외부 멀티에이전트&amp;middot;파인튜닝 없이도 인간처럼 &lt;b&gt;역할 분담 기반 협업(cognitive synergy)&lt;/b&gt;을 통해 지식 정확도와 추론 성능을 동시에 향상시킬 수 있는가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;496&quot; data-start=&quot;403&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;415&quot; data-start=&quot;403&quot;&gt;&lt;b&gt;기존 한계&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;496&quot; data-start=&quot;415&quot; data-col-size=&quot;lg&quot;&gt;CoT&amp;middot;Self-Refine는 추론은 개선하지만 사실 오류(hallucination) 감소에는 한계, 멀티에이전트 방식은 비용&amp;middot;복잡도 증가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;612&quot; data-start=&quot;497&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;509&quot; data-start=&quot;497&quot;&gt;&lt;b&gt;제안 방법&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;612&quot; data-start=&quot;509&quot; data-col-size=&quot;lg&quot;&gt;&lt;b&gt;Solo Performance Prompting (SPP)&lt;/b&gt;: 하나의 LLM이 입력 태스크에 따라 여러 persona를 &lt;b&gt;동적으로 생성&lt;/b&gt;하고, 다중 턴 자기 협업을 수행&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;752&quot; data-start=&quot;613&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;626&quot; data-start=&quot;613&quot;&gt;&lt;b&gt;SPP 절차&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;752&quot; data-start=&quot;626&quot; data-col-size=&quot;lg&quot;&gt;(1) Persona Identification &amp;rarr; (2) Persona별 Brainstorming &amp;rarr; (3) AI Assistant(리더) 초안 생성 &amp;rarr; (4) Persona 피드백&amp;middot;비판 &amp;rarr; (5) 반복 후 최종 답변&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;851&quot; data-start=&quot;753&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;766&quot; data-start=&quot;753&quot;&gt;&lt;b&gt;핵심 차별점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;851&quot; data-start=&quot;766&quot; data-col-size=&quot;lg&quot;&gt;단일 LLM, zero-shot, retrieval&amp;middot;fine-tuning 불필요, &lt;b&gt;dynamic fine-grained persona&lt;/b&gt; 사용&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;964&quot; data-start=&quot;852&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;865&quot; data-start=&quot;852&quot;&gt;&lt;b&gt;평가 태스크&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;964&quot; data-start=&quot;865&quot; data-col-size=&quot;lg&quot;&gt;Trivia Creative Writing (지식 집약), Codenames Collaborative (지식+추론+ToM), Logic Grid Puzzle (추론 집약)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1030&quot; data-start=&quot;965&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;977&quot; data-start=&quot;965&quot;&gt;&lt;b&gt;비교 기법&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1030&quot; data-start=&quot;977&quot; data-col-size=&quot;lg&quot;&gt;Standard Prompting, Chain-of-Thought, Self-Refine&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1155&quot; data-start=&quot;1031&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1054&quot; data-start=&quot;1031&quot;&gt;&lt;b&gt;주요 성능 결과 (GPT-4)&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1155&quot; data-start=&quot;1054&quot; data-col-size=&quot;lg&quot;&gt;모든 태스크에서 SPP 최고 성능: 특히 Trivia CW(N=10) &lt;b&gt;+10%p&lt;/b&gt;, Codenames &lt;b&gt;+~5%p&lt;/b&gt;, Logic Puzzle에서도 CoT 대비 경쟁력&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1207&quot; data-start=&quot;1156&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1170&quot; data-start=&quot;1156&quot;&gt;&lt;b&gt;핵심 관찰 ①&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1207&quot; data-start=&quot;1170&quot; data-col-size=&quot;lg&quot;&gt;CoT는 추론 태스크에는 유효하나 지식 정확도 개선에는 한계&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1259&quot; data-start=&quot;1208&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1222&quot; data-start=&quot;1208&quot;&gt;&lt;b&gt;핵심 관찰 ②&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1259&quot; data-start=&quot;1222&quot; data-col-size=&quot;lg&quot;&gt;SPP는 &lt;b&gt;사실 오류 감소 + 추론 유지&lt;/b&gt;를 동시에 달성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1361&quot; data-start=&quot;1260&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1278&quot; data-start=&quot;1260&quot;&gt;&lt;b&gt;Emergent 분석&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1361&quot; data-start=&quot;1278&quot; data-col-size=&quot;lg&quot;&gt;Cognitive synergy는 &lt;b&gt;GPT-4에서만 명확히 발현&lt;/b&gt;, GPT-3.5&amp;middot;LLaMA2에서는 실패(early termination)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1442&quot; data-start=&quot;1362&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1380&quot; data-start=&quot;1362&quot;&gt;&lt;b&gt;Ablation 결과&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1442&quot; data-start=&quot;1380&quot; data-col-size=&quot;lg&quot;&gt;Dynamic persona &amp;gt; Fixed persona, persona profile 추가는 효과 미미&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1533&quot; data-start=&quot;1443&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1457&quot; data-start=&quot;1443&quot;&gt;&lt;b&gt;이론적 시사점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1533&quot; data-start=&quot;1457&quot; data-col-size=&quot;lg&quot;&gt;Cognitive synergy는 단순 prompting 기법이 아니라 &lt;b&gt;모델 능력에 의존하는 emergent ability&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1615&quot; data-start=&quot;1534&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1544&quot; data-start=&quot;1534&quot;&gt;&lt;b&gt;한계점&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1615&quot; data-start=&quot;1544&quot; data-col-size=&quot;lg&quot;&gt;persona가 항상 정답 보장 ❌, 동일 demo prompt 사용의 비최적성, multi-turn으로 인한 계산 비용&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1682&quot; data-start=&quot;1616&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1628&quot; data-start=&quot;1616&quot;&gt;&lt;b&gt;향후 연구&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1682&quot; data-start=&quot;1628&quot; data-col-size=&quot;lg&quot;&gt;입력 조건별 demo 적응, SPP &amp;rarr; 실제 multi-agent cabinet 구조 확장&lt;/td&gt;
&lt;/tr&gt;
&lt;tr data-end=&quot;1792&quot; data-start=&quot;1683&quot;&gt;
&lt;td data-col-size=&quot;sm&quot; data-end=&quot;1698&quot; data-start=&quot;1683&quot;&gt;&lt;b&gt;연구 기여 요약&lt;/b&gt;&lt;/td&gt;
&lt;td data-end=&quot;1792&quot; data-start=&quot;1698&quot; data-col-size=&quot;lg&quot;&gt;GPT-4 수준 LLM에서 &lt;b&gt;zero-shot으로 지식&amp;middot;추론 동시 향상&lt;/b&gt;을 달성한 최초의 multi-persona self-collaboration 프레임워크&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>인공지능/논문 리뷰 or 진행</category>
      <author>이게될까</author>
      <guid isPermaLink="true">https://yoonschallenge.tistory.com/1190</guid>
      <comments>https://yoonschallenge.tistory.com/1190#entry1190comment</comments>
      <pubDate>Fri, 16 Jan 2026 03:16:37 +0900</pubDate>
    </item>
  </channel>
</rss>