LLM 에이전트의 행동에도 워터마크를 남길 수 있을까?

LLM은 이제 단순히 문장을 생성하는 모델을 넘어, 직접 계획을 세우고 도구를 호출하며 여러 단계의 작업을 수행하는 에이전트로 확장되고 있습니다. 사용자의 질문에 답하는 것을 넘어, 웹을 탐색하고, 코드를 실행하고, 파일을 수정하고, 외부 시스템과 상호작용하는 방식으로 말입니다.

이 변화는 새로운 질문을 던집니다.

<aside> 💡

어떤 에이전트가 이 행동 경로를 만들어냈는지, 나중에 확인할 수 있을까?

</aside>

에이전트의 가치는 최종 답변 하나에만 담겨 있지 않습니다. 어떤 도구를 언제 호출했는지, 어떤 순서로 정보를 탐색했는지, 중간 실패를 어떻게 수정했는지 같은 trajectory가 에이전트의 실제 역량을 보여줍니다. 그리고 이런 고품질 trajectory는 점점 더 중요한 자산이 되고 있습니다.

하지만 trajectory가 무단으로 수집되거나 재사용되었을 때, 그 출처를 검증하는 일은 쉽지 않습니다. 기존 텍스트 워터마크는 생성된 문장에는 신호를 남길 수 있지만, 에이전트의 핵심인 action-level decision을 직접 설명하기에는 한계가 있습니다.

SeqWM은 바로 이 문제에서 출발합니다. 텍스트가 아니라, 에이전트의 행동 흐름 자체에 워터마크를 남길 수 있을까?

행동 하나가 아니라, 행동의 흐름을 본다

기존의 행동 워터마킹 방식은 보통 각 step을 독립적인 단위로 바라봅니다. 하지만 에이전트의 행동은 본질적으로 순차적입니다. 검색을 했기 때문에 문서를 열고, 문서를 열었기 때문에 내용을 요약하고, 요약했기 때문에 다음 결정을 내립니다.

SeqWM의 핵심은 이 순차성을 watermark 신호를 담는 공간으로 활용한다는 점입니다.

SeqWM은 ‘지금이 몇 번째 step인가’를 기준으로 삼지 않습니다. 대신 최근 몇 개의 행동을 보고, 그 행동 history에 따라 다음 행동의 확률을 아주 조금 조정합니다. 즉, 워터마크는 개별 행동 하나에 노골적으로 찍히는 것이 아니라, 행동에서 다음 행동으로 넘어가는 transition pattern 안에 자연스럽게 녹아듭니다.

SeqWM은 최근 행동 history를 기반으로 guided subset을 만들고, 여러 channel에 걸쳐 행동 분포를 부드럽게 조정합니다. 검출 단계에서는 관측된 trajectory를 sliding window로 훑고, random-key calibration을 통해 true key의 score가 우연보다 유의미하게 높은지 확인합니다.

SeqWM은 최근 행동 history를 기반으로 guided subset을 만들고, 여러 channel에 걸쳐 행동 분포를 부드럽게 조정합니다. 검출 단계에서는 관측된 trajectory를 sliding window로 훑고, random-key calibration을 통해 true key의 score가 우연보다 유의미하게 높은지 확인합니다.

하나의 신호에 의존하지 않는다

SeqWM은 최근 행동 history를 기반으로 다음 행동에 watermark signal을 심습니다. 그런데 이 신호를 하나의 channel에만 맡기지는 않습니다. 같은 행동 history에 대해 여러 개의 독립적인 guided subset을 만들고, 각 후보 행동이 몇 개의 channel에서 선택되었는지를 바탕으로 행동 분포를 부드럽게 조정합니다.

쉽게 말해, 어떤 행동이 여러 channel에서 동시에 watermark-friendly한 선택으로 나타난다면 그 행동의 확률을 조금 더 높입니다. 반대로 어느 channel에서도 선택되지 않은 행동은 원래 분포에 더 가깝게 남습니다.

이 방식의 장점은 신호를 과도하게 강하게 만들지 않으면서도, 여러 transition에 걸쳐 더 안정적인 evidence를 축적할 수 있다는 점입니다. SeqWM은 하나의 큰 흔적을 남기기보다, 여러 channel에 나뉜 작은 흔적들을 행동 흐름 속에 분산시킵니다.

왜 위치에 덜 의존하는 것이 중요한가

실제 환경에서 agent trajectory는 항상 완벽하게 관측되지 않습니다. 로그 일부가 빠질 수도 있고, trajectory의 중간이 잘릴 수도 있으며, 공격자가 일부 행동을 삭제할 수도 있습니다.

만약 워터마크가 absolute step index에 의존한다면, 행동 하나가 삭제되는 순간 문제가 생깁니다. 10번째 행동이 사라지면 그 뒤의 모든 행동은 원래 위치보다 한 칸씩 밀립니다. detector는 이후 행동들을 잘못된 step의 key와 비교하게 되고, watermark signal은 급격히 약해집니다.

SeqWM은 이런 문제를 피하기 위해 sliding-window detection을 사용합니다. 관측된 행동 sequence를 작은 window 단위로 훑으면서, 각 window 다음의 행동이 watermark key와 얼마나 잘 맞는지 확인합니다.