서로 다른 LLM family 사이에서 probe, SAE, NLA 같은 activation tool을 공유할 수 있을까?

이 논문은 서로 다른 hidden dimension과 representation basis를 가진 LLM들을 하나의 공통 dense space에 연결하는 Universal Activation Bus를 제안합니다.

Univ_figure1.png

🧠 Great Findings!!

여러 소스 모델이 공유하는 Universal Activation Bus를 한 번 학습해 두면, 새로운 모델은 소규모 어댑터(adapter) 학습만으로도 해당 인터페이스에 쉽게 연결할 수 있습니다.


📌연구 배경: “새 모델이 나오면 activation tool을 다시 만들어야 할까”

Activation-based interpretability 연구에서는 모델의 hidden state을 기반으로 다양한 tool들을 구축한다.

Model A ──► Probe A / SAE A / Interpreter A
Model B ──► Probe B / SAE B / Interpreter B
Model C ──► Probe C / SAE C / Interpreter C
...

하지만 각 모델은 서로 다른 hidden dimension과 representation basis를 가진다.

이로 인해 새로운 모델이 도입될 때마다 해석 도구를 매번 개별적으로 새로 학습해야 하며, 이종 모델 계열 간에 해석 도구를 재사용하거나 표현을 직접 비교하기 어렵다는 한계가 존재한다.

RQ: 서로 다른 model들이 하나의 stable activation interface로 연결될 수 있을까?


💡 핵심 아이디어: Universal Activation Bus