- 구글 딥마인드 연구진이 단일 언어 모델이 별도 색인 없이 문서 순위를 매길 수 있다는 이론적 근거를 제시했다.
- 다만 실험은 소규모에 그쳐 국내 SEO 현업은 지금 운영을 바꿀 단계가 아니라 지표 기준선을 준비할 단계다.
구글 딥마인드 연구진의 논문이 SEO 업계에서 화제다. 하나의 언어 모델이 별도의 색인 없이도 수많은 문서의 순위를 매길 수 있다는 이론적 증명을 담았다. 다만 증명된 것은 이론상의 수용 능력이고, 실제 웹 검색에 적용됐다는 근거는 없다. 국내 인하우스 SEO와 콘텐츠 마케터가 지금 할 일은 순위 중심 보고 체계를 뒤엎는 것이 아니라, 확인된 사실과 추측을 구분해 읽는 것이다.
업계 평론가가 논문을 풀어 쓴 글
Search Engine Journal은 2026년 10월 8일 Duane Forrester의 글을 게재했다. Forrester는 자신의 뉴스레터 Duane Forrester Decodes에 10월 4일 같은 글을 먼저 올렸다. 이 글은 딥마인드 논문 자체가 아니라 논문을 읽은 업계 평론가의 해석이다. 논문의 작동 원리는 SEJ의 Roger Montti가 앞서 다뤘고, Forrester는 그 이후 업계에 어떤 변화가 올지에 초점을 맞췄다고 밝혔다.
Forrester는 글 도입부에서 자신이 AI 가시성 측정 플랫폼 CitationIQ의 창업자라고 먼저 공개했다. 측정 방식이 바뀐다는 주장에 이해관계가 있다는 뜻이다. 그는 이후 내용 전체를 근거 있는 추측이라고 규정했다. 독자도 이 글을 공식 발표나 검증된 사실이 아니라 해석으로 읽어야 한다.
2021년 제안에서 2026년 증명까지
Forrester가 짚은 연구 흐름은 세 단계다. 2021년 구글 연구진 네 명이 Rethinking Search 논문을 냈다. 검색 시스템이 참고 문서 목록을 건네는 대신 인용 가능한 문서 모음에서 직접 답해야 한다는 제안이었다. 이 논문에는 연구 제안일 뿐 제품 로드맵이 아니라는 단서가 붙어 있었고, Forrester는 그 단서가 지금도 유효하다고 짚었다.
2022년에는 거의 같은 연구진이 Differentiable Search Index를 발표했다. 트랜스포머 모델 하나가 질의를 곧바로 문서 식별자로 연결하고, 문서 모음 전체를 모델 파라미터 안에 담을 수 있다는 것을 보였다. 2026년 1월 논문은 여기에 이론을 더했다. 이중 인코더 방식은 가능한 모든 순위를 표현하려면 임베딩 차원이 문서 수에 비례해 커져야 하지만, 은닉 차원이 고정된 자기회귀 모델은 임의의 수를 순위화할 수 있다는 증명이다. 연구진은 목록 전체의 순서를 학습시키는 SToICaL이라는 학습 손실 함수도 제안했다. Forrester는 이 흐름을 제안, 시제품, 증명으로 요약했다.
실험 규모는 작았다
이 논문이 무엇을 보여주지 못했는지가 국내 실무자에게는 더 중요하다. Forrester에 따르면 연구진은 최첨단 모델이 아닌 Mistral-7B를 미세조정했다. 순위 매기기는 후보 문서 식별자를 프롬프트에 넣고 모델이 고르는 방식이어서, 열린 문서 모음에서 검색하는 것이 아니라 재순위화에 가깝다. 실험에 쓴 WordNet은 영어 명사를 상하위 개념 트리로 정리한 프린스턴 데이터베이스다. 쇼핑 평가는 310개 사례로 진행됐다. 한 설정에서는 목록 나머지 순서는 좋아졌지만 1순위 정확도는 오히려 나빠졌다.
Forrester도 이를 배포가 아닌 토대라고 표현했다. 그는 이 논문이 이론적 수용 능력을 증명하고 소규모 데이터셋 두 개에서 학습 방법을 시연했을 뿐, 누구도 웹 색인을 이것으로 대체하지 않았다고 분명히 썼다. 구글이 실제 검색 순위에 이 방식을 쓰고 있다는 공식 설명은 이번 자료에 없다.
문서가 코드가 되면 달라지는 것
이 구조에서 문서는 URL이 아니라 모델이 한 토큰씩 생성하는 짧은 식별자 코드, 즉 docID다. 쇼핑 실험에서는 상품 제목의 임베딩을 숫자 세 개로 압축해 식별자를 만들었다. 비슷한 상품은 앞자리 숫자를 공유한다. 모델은 빔 서치로 가장 확률 높은 식별자부터 차례로 생성한다. 조회가 아니라 생성이다.
Forrester는 여기서 세 가지 함의를 끌어냈다. 첫째, 이웃 문서와 의미상 구별되지 않는 페이지는 안정적인 식별자를 갖지 못한다. 거의 같은 상품 페이지 둘은 인접한 자리가 아니라 같은 주소를 두고 경쟁하게 된다. 둘째, 순위 함수가 곧 학습 데이터다. 클릭 로그, 평가자 판단, 참여 신호 등 무엇으로 등급 목록을 만들었든 그것이 알고리즘이 된다. 셋째, 신선도가 학습 문제가 된다. 구글의 후속 연구 DSI++는 새 문서를 계속 색인하면 이미 색인한 문서를 상당 부분 잊는 현상을 확인했다. Forrester는 실제 도입이 고전적 검색이 후보를 뽑고 생성형 순위 모델이 정렬하는 혼합형으로 시작될 가능성이 높다고 봤다.
빔 폭이 곧 가시성의 경계라는 주장
Forrester가 전략의 기준으로 삼겠다고 한 주장은 빔 폭에 관한 것이다. 빔 폭이 10이면 시스템이 계산하는 결과는 10개가 전부이고, 11번째는 나쁜 결과가 아니라 애초에 생성되지 않은 결과다. 이 경우 2페이지는 설계 선택이 아니라 존재하지 않는 것이 되고, 노출은 생성된 집합에 있느냐 없느냐의 이분법이 된다. 바깥에서는 순위가 낮은 것과 생성되지 않은 것을 구분할 수 없다는 것이 그의 지적이다.
그는 논문의 아이러니도 꼽았다. WordNet 실험에서 순위 인지 학습은 2위부터 5위까지의 재현율을 크게 끌어올렸다. 두 번째에서 다섯 번째 결과의 정렬이 좋아지는 시점에 화면에 보이는 결과는 줄어든다는 것이다. 이 역시 해석이며, 실제 구글 화면이 그렇게 바뀐다는 확인은 아니다.
광고 쪽 연결은 더 조심해서 읽어야 한다
Forrester는 비용 측면의 해석도 내놓았다. 이중 단계 파이프라인이 존재하는 이유는 교차 인코더(질의와 문서를 한 모델에 함께 넣어 관련도를 정밀하게 채점하는 방식)를 전체 문서 모음에 돌리기에는 너무 비싸기 때문인데, 자기회귀 순위화는 별도 최근접 이웃 색인을 없애고 문서를 개별 채점하지 않아 생성형 결과의 구조적 비용을 낮춘다는 논리다. 그는 알파벳 2분기 구글 검색 및 기타 매출이 632억 7천만 달러로 17% 늘었다는 수치를 함께 제시했지만, 광고 경매는 별개 시스템이며 이 논문은 광고 경매를 다루지 않는다고 못박았다.
그는 2025년 8월 자신이 제시한 의도 벡터 입찰 개념과 구글 마케팅 라이브 2026의 발표를 연결했다. 구글은 2026년 5월 20일 공식 블로그에서 AI 검색용 차세대 광고 형식이 개별 질의에 맞춰 즉시 조정되며, 질문과 최종 구매 사이의 간극을 줄인다고 밝혔다. 다만 구글 공식 문서에는 딥마인드 논문이나 자기회귀 순위화와의 연결이 언급돼 있지 않다. 두 발표를 잇는 것은 Forrester의 추론이다. 그는 광고주가 캠페인을 만들고 소재를 제공하는 구조는 여전하며 자신이 그린 종착점은 아직 오지 않았다고 스스로 인정했다.
국내 실무자는 어디까지 반영해야 하나
현재 SEO 운영에 반영할 단계인지, 연구 동향으로 지켜볼 단계인지를 고르라면 이번 논문은 후자에 가깝다. 논문의 이론적 증명은 확인됐지만, 실험은 7B 모델과 두 개의 소규모 데이터셋에 한정됐고, 제품 적용을 뒷받침하는 구글 공식 설명은 이번 자료에서 확인되지 않는다. 한국어 검색이나 국내 서비스에 해당한다는 근거도 없다.
다만 이 제안은 AI 가시성 측정 사업을 하는 사람의 권고라는 점을 감안해야 한다. 순위 보고 체계를 바꾸는 판단은 구글의 공식 문서와 제품 발표로 적용이 확인된 뒤에 내려도 늦지 않다.
<저작권자 © 마케팅 타임즈, 무단 전재 및 재배포, AI 학습 및 활용 금지>