AI 논문 리뷰

[AI 논문 리뷰] LLM에게 ‘그것만 잊고 나머지는 그대로 기억해’라고 할 수 있을까?

rubrub 2026. 9. 4. 02:52
LLM은 배운 걸 어떻게 잊을까? — ICML이 파고든 Machine Unlearning

LLM에게 이런 말을 할 수 있을까?

THE STRANGE REQUEST
“너 그거 배웠지?
이제 그것만 잊어.
나머지는 그대로 기억하고.”

사람에게도 어려운 주문이다.

그런데 LLM에게는 더 이상하다. 모델 안에는 harry_potter.txt라는 파일이 따로 들어 있는 게 아니다. 수십억 개 parameter가 수많은 데이터의 통계적 패턴을 함께 나눠 갖는다.

그럼 한 번 학습한 데이터를 어떻게 지울까?

MACHINE UNLEARNING
모델 전체를 처음부터 다시 학습하지 않고,
특정 training data의 영향만 선택적으로 제거하려는 연구.

이 주제는 privacy, copyright, safety 이슈와 맞물리면서 빠르게 커졌고, ICML에서도 2024년부터 2026년까지 계속 중요한 논문이 나오고 있다.

그런데 최신 연구까지 따라가다 보면 처음의 질문 자체가 틀렸을 수도 있다는 생각이 든다.

“모델이 잊었다”는 건 대체 무엇을 의미할까?

01. 먼저: LLM의 기억은 파일처럼 저장되지 않는다

데이터베이스라면 삭제는 쉽다.

DELETE FROM memory
WHERE id = 'sensitive_record_123';

LLM은 그렇지 않다.

Training은 특정 문장을 parameter 한 곳에 저장하는 과정이 아니라, gradient update를 통해 매우 많은 weight를 조금씩 움직이는 과정이다.

Text A ─┐
Text B ─┼→ billions of gradient updates → θ
Text C ─┤
... ─┘

더 골치 아픈 건 하나의 fact가 한 번만 등장하지 않는다는 점이다.

예를 들어 어떤 인물의 생년월일이 Wikipedia, 뉴스, 인터뷰, 블로그, 표 데이터에 반복해서 등장했다면 training sample 하나를 삭제한다고 해서 그 semantic knowledge 자체가 사라질 이유는 없다.

첫 번째 중요한 구분
데이터의 학습 영향(training influence)을 지우는 것과
그 데이터가 담고 있던 지식(knowledge)을 지우는 것은 같은 문제가 아니다.

02. 엄밀한 Machine Unlearning의 Gold Standard

가장 깔끔한 정의는 counterfactual을 생각하는 것이다.

전체 training dataset을 D, 지우고 싶은 데이터를 F(Forget Set)라고 하자.

Original model
θ = Train(D)

Gold-standard forgotten model
θ-F = Train(D \ F)

가장 이상적인 unlearning algorithm U는

U(θ, F) ≈ Train(D \ F)

가 되어야 한다.

즉 “모델이 질문했을 때 대답을 안 한다”가 아니라, 애초에 그 데이터를 학습하지 않았던 세계의 모델과 비슷해져야 한다.

문제는 LLM을 D\F로 처음부터 retrain하는 비용이 엄청나다는 것.

그래서 대부분 연구는 Approximate Unlearning을 한다.

03. “잊는다”는 말 안에 사실 서로 다른 세 문제가 섞여 있다

A · DATASET UNLEARNING
이 training sample의 영향을 제거해라
기준: 그 sample 없이 retrain한 모델과 얼마나 가까운가?
B · KNOWLEDGE REMOVAL
이 사실/개념을 모델이 더 이상 알지 못하게 해라
기준: paraphrase나 다른 질문 방식으로도 target knowledge가 나오지 않는가?
C · BEHAVIOR SUPPRESSION
알고 있어도 출력하지 마라
기준: 특정 요청에 refusal / suppression이 일어나는가?

이 셋은 비슷해 보이지만 전혀 다른 guarantee다.

그리고 2026년 ICML Position Paper “The Term Machine Unlearning Is Overused in LLMs”는 바로 이 점을 강하게 지적한다.

ICML 2026 POSITION
“Machine Unlearning”이라는 말은
dataset-defined deletion에 더 엄격하게 써야 한다.

Refusal, safety alignment, entity suppression, knowledge editing을 전부 “unlearning”이라고 부르면 서로 다른 목표를 같은 metric으로 평가하게 된다는 문제다.

04. 재미있는 역설: 완벽히 Unlearn해도 그 사실을 알고 있을 수 있다

이게 처음엔 이상하게 들린다.

그런데 exact unlearning의 기준을 다시 보자.

target = Train(D \ F)

D\F 안에 같은 지식을 담고 있는 다른 문서가 있다면?

Retrained model도 그 fact를 여전히 알 수 있다.

따라서:

“특정 데이터의 영향이 제거됐다”
≠
“그 데이터가 말하던 사실을 모델이 모른다”

그래서 LLM unlearning은 database deletion보다 훨씬 철학적인 문제가 된다.

05. 가장 단순한 아이디어: 배운 방향의 반대로 걸어가면 되지 않을까?

일반 training에서는 target sequence의 negative log-likelihood를 줄인다.

minimize   LNLL(F; θ)

그러면 반대로 loss를 키우면?

θ ← θ + η ∇θLNLL(F; θ)

이것이 가장 직관적인 Gradient Ascent(GA) unlearning이다.

모델이 그 문장을 잘 예측하도록 만든 gradient의 반대 방향으로 parameter를 움직여 target sequence likelihood를 떨어뜨린다.

문제는 너무 잘 지운다는 것이다.

06. 지우개로 한 글자 지우려다가 종이가 찢어진다 — Over-Forgetting

LLM의 parameter는 하나의 문장에만 쓰이지 않는다.

Forget set을 망가뜨리는 gradient가 retain data의 성능에도 필요한 방향일 수 있다.

θ gᵤ forget gradient gᵣ retain-sensitive direction conflict “Forget harder” can damage “Remember the rest.”

그래서 unlearning은 언제나 Forget Quality vs Retain Utility의 trade-off를 가진다.

07. ICML 2024: “모든 기억을 똑같이 지우면 안 된다”

To Each (Textual Sequence) Its Own이라는 제목부터 재밌다.

이 논문의 핵심 주장은 단순하다.

Forget Set의 평균 점수만 보면 안 된다.

예를 들어 100개 문장을 지웠다고 하자.

99 sequences → 거의 기억 안 함
1 sequence → 거의 그대로 외움

Average memorization → “Looks fine!”

Privacy 관점에서는 평균이 좋아도 딱 한 문장이 그대로 추출되면 실패다.

그래서 저자들은 각 sequence의 memorization score g(x)를 보고 target별로 unlearning 강도를 다르게 하는 Selective Gradient Ascent(SGA)를 제안한다.

08. Selective Gradient Ascent는 어떻게 동작할까?

허용 가능한 memorization threshold를 γ라고 하자.

Dγ = { x ∈ F | g(x) > γ }

처음에는 threshold를 넘는 너무 많이 외운 sample만 골라 GA를 수행한다.

Forget set F
↓ measure g(x)
Highly memorized samples only
↓ Gradient Ascent
Re-measure g(x)
↓
repeat

threshold를 넘는 sample이 없어지면 이후에는 top-k memorized samples를 계속 골라 미세 조정한다.

핵심은 “F 전체를 똑같이 때린다”가 아니라 아직 너무 많이 남아 있는 기억만 선택적으로 때린다는 것.

09. 또 다른 아이디어: “배운 벡터”를 parameter에서 빼버리자

Task Arithmetic는 parameter space를 벡터처럼 본다.

원 모델 θ를 Forget Set F로 fine-tuning한 모델을 θft라고 하자.

ΔF = θft − θ

이 ΔF를 “F를 더 학습했을 때 움직인 방향”이라고 보고, 반대로 빼버린다.

θu = θ − λ(θft − θ)

직관적으로는:

“이 지식을 더 배우면 → 방향 A로 움직이네?”
↓
“그럼 A의 반대로 움직이면 지워지지 않을까?”

논문은 이 아이디어를 SGA와 결합해 너무 강하게 memorized된 상태를 먼저 완화한 뒤 task-vector subtraction을 적용하는 방법도 탐구한다.

10. ICML 2024의 더 이상한 논문: Weight를 안 바꾸고도 Unlearn할 수 있다고?

In-Context Unlearning: Language Models as Few-Shot Unlearners는 아예 parameter를 수정하지 않는다.

target training instance를 inference context에 넣고 원래와 다른 label을 같이 보여준다.

Original training example:
x → label A

In-context unlearning prompt:
x → label B
similar x' → altered labels
...

Query → model behaves as if association changed

장점은 weight access가 필요 없다는 것.

그런데 2026년의 엄격한 terminology를 들이대면 재미있는 질문이 생긴다.

Weight가 그대로인데 이것을 정말 “unlearning”이라고 불러야 할까?
모델의 training influence를 제거한 것이 아니라, context-conditioned behavior를 바꾼 것에 더 가깝다는 해석도 가능하다.

이 논쟁 자체가 현재 LLM unlearning 연구의 혼란을 잘 보여준다.

11. ICML 2025 GRU — “지우는 방향에서, 망가뜨리는 성분만 빼자”

Gradient Rectified Unlearning(GRU)은 Forget/Retain trade-off를 아주 기하학적으로 푼다.

unlearning을 위한 gradient를 gu, retain utility를 해치는 방향을 알려주는 gradient를 gr라고 하자.

두 gradient가 conflict하면 gu를 그대로 따라가지 않는다.

ĝu = gu + max(−⟨gu,gr⟩,0) / ||gr||² · gr

식이 복잡해 보이지만 아이디어는 예쁘다.

지우는 건 그대로 지우되,
다른 기억을 망가뜨리는 방향 성분만 제거한다.

Gradient projection으로 original unlearning direction에서 가능한 적게 벗어나면서 retention loss를 악화시키지 않는 방향을 찾는다.

“망각”을 language model trick이 아니라 constrained optimization 문제로 본다는 점이 재미있다.

12. ICML 2025 Spotlight: 기억이 있는 “회로”를 찾아 수술할 수 있을까?

Mechanistic Unlearning은 접근 방식 자체가 조금 다르다.

기존 방법:

“이 답을 못 하게 gradient를 움직이자.”

Mechanistic Unlearning:

“모델 내부에서 이 fact를 recall하는 mechanism이 어디지?”

저자들은 factual recall 과정의 lookup-table mechanism에 해당하는 model components를 localize하고, 그 부분에만 edit/unlearning update를 적용한다.

Prompt Subject
“Michael Jordan”
↓
Subject Representation
↓
Factual Lookup Mechanism
↓
Attribute Representation
“basketball”

중요한 건 “어떤 neuron 하나에 fact가 저장돼 있다”는 주장이 아니다.

특정 factual recall을 수행하는 고수준 mechanism에 참여하는 components를 찾아 update를 국소화하자는 것이다.

논문에서는 이런 mechanistic localization이 단순 output-based localization보다 input/output format 변화와 relearning 공격에 더 robust했고, unintended side effect도 줄였다고 보고한다.

13. 여기서 중요한 질문: “말을 안 한다”와 “모른다”는 같은가?

BEHAVIORAL FORGETTING
질문해도 안 나온다
Output-level evaluation
LATENT FORGETTING
내부 representation에서도 사라진다
Mechanism / attack robustness

이 구분이 중요한 이유는 겉으로 refusal하는 모델이 내부적으로는 target을 아주 잘 알고 있을 수 있기 때문이다.

Prompt를 바꾸거나, output format을 바꾸거나, 조금 fine-tuning했더니 다시 대답한다면 “지웠다”는 말이 애매해진다.

14. Relearning Attack — 기억을 지웠는데, 조금만 힌트를 주면 되살아난다

최근 unlearning 연구에서 굉장히 중요한 공격이다.

Original Model
↓ unlearning
“I forgot.”
↓ tiny fine-tuning / related examples
“Oh, I remember.”

2025년 ICML의 Invariant LLM Unlearning(ILU) 연구는 심지어 unrelated downstream fine-tuning만 해도 forgotten knowledge가 다시 살아나는 현상을 문제로 삼는다.

그래서 Invariant Risk Minimization 관점의 regularization을 도입해 이후 어떤 fine-tuning이 오더라도 forgetting이 쉽게 깨지지 않도록 만든다.

이 논문이 던지는 질문은 꽤 본질적이다.

쉽게 되살아나는 기억을
정말 “지웠다”고 부를 수 있을까?

15. 더 무서운 결과: 지우려고 한 흔적이 오히려 비밀을 알려줄 수도 있다

ICML 2025 Textual Unlearning Gives a False Sense of Unlearning은 제목부터 공격적이다.

연구진은 U-LiRA+와 TULA라는 auditing/attack 방법을 통해 unlearned text가 여전히 높은 confidence로 detect될 수 있고, 경우에 따라 unlearning 과정 자체가 target membership이나 reconstruction 위험을 키울 수 있다고 보고한다.

THE PARADOX
“이 데이터는 지웠습니다.”
그런데 공격자는
모델이 무엇을 지우려 했는지를 역으로 추론한다.

Output quality만 보고 unlearning 성공을 선언하면 안 되는 이유다.

16. 그렇다면 “진짜 잊었는지” 어떻게 측정할까?

Machine Unlearning evaluation은 생각보다 훨씬 복잡하다.

Dimension 질문
Verbatim Forgetting 원문을 그대로 재생할 수 있나?
Knowledge Forgetting paraphrase해도 fact를 알고 있나?
Privacy Leakage membership inference로 target 흔적을 찾을 수 있나?
Retention 상관없는 능력은 그대로인가?
Robustness prompt 변경 / fine-tuning 후에도 안 살아나나?
Sequential Unlearning 삭제 요청이 계속 들어와도 모델이 버티나?

MUSE benchmark는 이런 문제를 verbatim, knowledge, privacy, utility, scalability, sustainability의 여섯 축으로 체계화했다.

핵심은:

“정답률이 떨어졌으니 잊었다”는
너무 약한 증거다.

17. 2026년엔 Decoding 방식까지 의심하기 시작했다

LLM benchmark는 종종 greedy decoding으로 평가한다.

가장 확률 높은 token만 계속 고르면 target knowledge가 출력되지 않을 수 있다.

그런데 실제 생성에서는 temperature를 주고 sample을 여러 번 뽑는다.

Greedy decode
→ target not leaked ✓

Sample 1 → safe
Sample 2 → safe
Sample 3 → safe
...
Sample k → forgotten knowledge appears ✗

ICML 2026 paper list에 포함된 Leak@k는 바로 이 문제를 겨냥한다.

“한 번 안 나왔다”가 아니라 k번 sample했을 때 한 번이라도 forgotten knowledge가 resurfacing할 확률을 평가한다.

Machine Unlearning이 얼마나 평가 민감한 문제인지 보여주는 예다.

18. ICML 2025의 재밌는 역설: 가장 쉽게 지우는 기억은 Weight에 넣지 않은 기억이다

Fast Exact Unlearning for In-Context Learning Data for LLMs는 관점을 완전히 뒤집는다.

Deep network weight에서 exact unlearning은 어렵다.

그럼 fine-tuning data를 애초에 weight에 굽지 않고 In-Context Learning용 external structure로 관리하면?

Base LLM weights
+
external ICL examples / clusters
↓
task adaptation

이 연구는 quantized k-means를 이용한 ICL adaptation에서 fine-tuning data의 exact removal을 매우 빠르게 수행할 수 있음을 보인다.

기억을 잘 지우는 최고의 방법은
애초에 지우기 어려운 곳에 저장하지 않는 것일 수도 있다.

19. ICML 2026: “잊되, 다시 알려주면 사용할 수 있어야 한다”

개인적으로 최신 논문 중 가장 생각할 거리가 많은 제목이다.

Forget to Know,
Remember to Use.

예를 들어 모델이 어떤 개인의 소득 정보를 unlearn했다고 하자.

모델 스스로 그 정보를 recall해서는 안 된다.

그런데 사용자가 prompt에 이렇게 명시한다면?

“A의 소득은 5천만 원이라고 가정하자. 이 조건에서 계산해줘.”

이제 모델은 그 정보를 기억에서 꺼낸 것이 아니다.

외부 context로 받은 정보를 reasoning에 사용하는 것이다.

그런데 기존 unlearning method들은 target knowledge를 너무 강하게 억누르다가 이 contextual reasoning 능력까지 망가뜨리는 경우가 있었다.

20. “모르지만 읽을 수는 있는 모델”을 만들자

이 논문이 추가한 개념이 Contextual Utility다.

Parametric Recall
“내 weight에서 꺼내 말한다”
↓ should forget

Contextual Use
“prompt에 주어진 정보를 읽고 사용한다”
↓ should preserve

저자들은 기존 unlearning objective에 간단한 KL-regularization 계열의 plug-in term을 추가한다.

Forgotten information이 context에 명시적으로 들어온 조건에서는 unlearned model의 output distribution이 original model의 정상적인 contextual reasoning behavior에서 너무 멀어지지 않도록 붙잡는 방식이다.

L ≈ Lunlearn + λ · KL( poriginal(· | supplied context) || punlearned(· | supplied context))
※ 논문의 아이디어를 직관적으로 단순화한 표현

결과적으로 이 논문은 forgetting을 단순한 “knowledge destruction”이 아니라 information source에 따라 선택적으로 행동하는 능력으로 재정의한다.

21. 생각보다 깊은 이야기: 지식 자체보다 “어디서 왔는가”가 중요하다

PARAMETRIC SOURCE
“내가 원래 알고 있던 것”
Unlearn target
CONTEXTUAL SOURCE
“지금 사용자가 알려준 것”
Still usable

같은 fact라도 model parameter에서 나온 것인지, 현재 context에서 나온 것인지에 따라 허용되는 behavior가 달라질 수 있다는 이야기다.

여기서 unlearning은 단순한 “기억 제거”보다 source-aware cognition 문제에 가까워진다.

22. 그리고 ICML 2026은 결국 이렇게 묻는다 — “그걸 정말 Unlearning이라고 부를 거야?”

최신 Position Paper의 문제의식이 여기서 다시 중요해진다.

목표 더 정확한 표현
Training sample influence 제거 Machine Unlearning
특정 fact 변경 Knowledge Editing
특정 output을 막음 Suppression / Alignment
내부 정보를 숨김 Obfuscation / Guardrail

이름은 사소해 보이지만, terminology가 흐려지면 guarantee도 흐려진다.

“Unlearning 성공률 95%”라고 해도 그게

원문을 못 외우는 건지,
fact를 모르는 건지,
그냥 대답을 거부하는 건지,
retrained model과 같은 건지

알 수 없다.

23. 결국 LLM Unlearning은 네 개의 축을 동시에 풀어야 한다

01 · FORGET
Target은 충분히 사라졌는가?
02 · RETAIN
상관없는 능력은 그대로인가?
03 · ROBUST
Prompt / Fine-tuning / Sampling으로 되살아나지 않는가?
04 · CONTEXTUAL
외부에서 다시 주어진 정보는 정상적으로 사용할 수 있는가?

하나만 잘한다고 “좋은 unlearning”이 아니다.

24. 왜 이렇게 어려울까? — LLM 기억의 세 가지 특성

① Distributed
하나의 fact가 하나의 parameter에 저장되지 않는다.
② Entangled
target knowledge에 쓰이는 representation이 다른 능력에도 공유된다.
③ Redundant
같은 knowledge가 여러 training sample과 inference path에서 재구성될 수 있다.

그래서 “이 파일 하나를 지우듯이 이 지식을 지우자”라는 intuition이 잘 맞지 않는다.

25. ICML 논문 흐름으로 보면 연구 질문이 이렇게 변했다

2024 Per-example forgetting SGA · Task Arithmetic In-context unlearning 2025 Robust / Localized forgetting GRU · Mechanistic Relearning · Privacy attacks 2026 What does “forget” mean? Contextual utility · Leak@k “Unlearning” terminology debate Make output disappear → Prove the memory is actually gone

26. 이 분야에서 가장 흥미로운 건 “삭제 알고리즘”보다 “삭제의 정의”다

처음 Machine Unlearning을 보면 기술적으로는 이런 문제처럼 느껴진다.

“어떤 loss를 써서 특정 데이터를 잊게 만들까?”

그런데 논문을 몇 년 따라가면 질문이 점점 바뀐다.

잊었다는 걸 어떻게 증명하지?
↓
왜 paraphrase하면 다시 나오지?
↓
왜 fine-tuning하면 기억이 살아나지?
↓
왜 sampling하면 leak되지?
↓
왜 context로 다시 알려줘도 못 쓰지?
↓
잠깐... 우리가 말하는 “forget”이 정확히 뭐지?
MY TAKE
Machine Unlearning의 가장 어려운 문제는
“어떻게 지울까?”보다
“무엇이 지워졌다고 인정할 것인가?”에 가깝다.

27. LLM에게는 Ctrl+Z가 없다

모델은 데이터베이스가 아니다.

학습된 사실은 parameter space에 얽혀 있고, 같은 지식은 여러 데이터에서 다시 만들어질 수 있고, 출력하지 않는 것과 내부적으로 모르는 것도 다르다.

그래서 현재의 LLM Unlearning은 “기억 하나를 깨끗하게 삭제하는 완성된 기술”이라기보다 망각의 의미를 하나씩 분해하고 있는 연구 분야에 더 가깝다.

Forget the data.
Preserve the model.
Resist relearning.
Use supplied context.
And prove you actually forgot.

이 마지막 줄이 지금 Machine Unlearning 연구가 풀고 있는 문제를 가장 잘 요약하는 것 같다.


Papers & References

01. Bărbulescu & Triantafillou — To Each (Textual Sequence) Its Own: Improving Memorized-Data Unlearning in Large Language Models, ICML 2024

02. Pawelczyk et al. — In-Context Unlearning: Language Models as Few-Shot Unlearners, ICML 2024

03. Wang et al. — GRU: Mitigating the Trade-off between Unlearning and Retention for LLMs, ICML 2025

04. Guo et al. — Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization, ICML 2025 Spotlight

05. Wang et al. — Invariance Makes LLM Unlearning Resilient Even to Unanticipated Downstream Fine-Tuning, ICML 2025

06. Du et al. — Textual Unlearning Gives a False Sense of Unlearning, ICML 2025

07. Muresanu et al. — Fast Exact Unlearning for In-Context Learning Data for LLMs, ICML 2025

08. Peng et al. — Forget to Know, Remember to Use: Context-Aware Unlearning for Large Language Models, ICML 2026

09. Yoon, Jun & No — Position: The Term “Machine Unlearning” Is Overused in LLMs, ICML 2026

10. Reisizadeh et al. — Leak@k: Unlearning Does Not Make LLMs Forget Under Probabilistic Decoding, ICML 2026 paper list

11. Shi et al. — MUSE: Machine Unlearning Six-Way Evaluation for Language Models

12. ICML 2026 — Accepted Papers / Downloads

※ “Machine Unlearning”의 정의 자체가 현재 활발히 논쟁 중입니다. 특히 2026년 ICML Position Paper는 dataset-defined deletion과 knowledge suppression/editing을 구분해야 한다고 주장합니다. 본 글에서는 이 논쟁을 반영해 각 연구가 실제로 무엇을 제거하려는지 구분하여 설명했습니다.
written by rubrub · AI / LLM / Machine Unlearning