● ISSUE 01 LAB 04 — 시리즈 닫음 · DATA PARTNER theXEO
의미 적합성을 더해도
인용 예측은
나아지지 않았다.
질문과 본문의 내용이 더 가까우면 AI가 인용할 가능성도 높을까. 검색순위에 의미 적합성 값을 더해 예측력이 나아지는지 검증했습니다. 인용 표본을 32건에서 156건으로 늘린 분석에서도, 9월에 검증 조건을 고쳐 다시 계산한 결과에서도 개선은 확인되지 않았습니다.
형식 다음에는
내용의 거리를 쟀다.
앞선 LAB 3호에서 검색 1위라도 AI 브리핑에 인용되지 않은 관측치가 많았습니다. 블로그 방문자·이웃·공감·댓글 같은 활동 지표를 더해도 예측력이 크게 달라지지는 않았습니다. 그렇다면 질문에 더 가까운 내용을 쓴 글은 인용 여부를 가를 수 있을지 확인했습니다.
질문과 본문을 각각 임베딩으로 바꾼 뒤 코사인 유사도를 구했습니다. 두 텍스트의 의미가 얼마나 가까운지를 수치로 나타내는 한 방법입니다. 글이 정확한지, 질문에 충분히 답하는지를 사람이 평가한 점수는 아닙니다.
6월의 작은 표본에서는 의미 적합성의 회귀계수가 +0.29였습니다. 하지만 검색순위만 쓴 AUC 0.725에 비해, 의미 적합성을 더한 값은 0.730으로 차이가 0.005에 그쳤습니다. 계수가 양수라는 사실만으로 예측력이 크게 나아졌다고 볼 수는 없었습니다.
인용 표본 32건을
156건으로 늘렸다.
로봇청소기 검색 자료를 보충해 인용된 네이버 블로그 표본을 늘렸습니다. 당시 보고된 의미 적합성 계수는 +0.29에서 +0.05로 줄었고, 검색순위만 쓴 모델의 AUC 0.734에 비해 의미 적합성을 더한 값은 0.732였습니다.
| 표본 | 검색순위만 AUC | 의미 적합성 추가 AUC | 의미 적합성 계수 |
|---|---|---|---|
| 인용 32건 | 0.725 | 0.730 | +0.29 |
| 인용 156건 | 0.734 | 0.732 | +0.05 |
AUC는 인용·비인용을 구분하는 능력, 회귀계수는 해당 모델에서 변수와 인용의 관계를 나타냅니다. 서로 같은 단위가 아닙니다. 인용 156건을 포함한 확대 표본의 당시 계수 부트스트랩 95% 구간은 −0.114~+0.271로 0을 포함했습니다. 이는 양의 관계를 뚜렷하게 확인하지 못했다는 뜻이며, 작은 표본의 결과가 우연이었다고 확정할 수는 없습니다.
9월에는 보존 CSV를 다시 읽고 AI 미측정 기록을 제외했습니다. 같은 질문의 URL이 학습과 검증에 섞이지 않도록 질문별 5개 묶음으로 나눴고, 표준화도 학습 묶음 안에서만 했습니다. 두 모델은 같은 717개 관측치, 133개 질문으로 비교했습니다. 그중 인용 관측치는 156개입니다.
| 모델 | AUC | 차이 |
|---|---|---|
| 검색순위만 | 0.747 | 기준 |
| 검색순위 + 의미 적합성 | 0.737 | −0.010 |
작은 표본 277개 관측치(인용 32개·질문 81개)를 같은 방법으로 재검증했을 때도 AUC는 0.742에서 0.716으로 낮아졌습니다. 두 표본 모두 이번 재검증에서 의미 적합성 추가의 이득은 없었습니다.
검증 조건을 바꾸니 AUC 값도 달라졌습니다. 특정 수치에 ‘천장’이 있다고 부를 근거는 없었습니다. 이번 표본과 모델에서는 의미 적합성을 보태도 검색순위만 쓴 모델보다 인용 여부를 더 잘 구분하지 못했습니다.
인용 결과도
회차마다 달랐다.
LAB 2호에서는 같은 질문을 반복했을 때 표시 출처가 일부 바뀌었습니다. 답변 생성, 검색 결과 변화, 측정 간격 등이 함께 작용했을 수 있습니다.
6월 후속 보고는 3회 중 2회 이상 인용된 글을 양성으로 남겼을 때 AUC가 약 0.04 높아졌다고 기록했습니다. 다회차 인용 표본은 26개뿐이었고, ‘3회 모두 인용’만 남긴 경우에는 파트너 계산과 당시 VLYVLY 재현값이 일치하지 않았습니다. 이번 9월 재검증은 그 안정성 모델까지 재실행한 것은 아닙니다.
반복 인용 집단에서 예측력이 달라졌다는 단서는 남지만, 이를 인용이 무작위로 결정된다는 증거로 쓰지는 않습니다. 아직 재지 않은 속성과 회차 변동의 기여를 이 분석으로 분리할 수는 없습니다.
속성을 따라 하기 전에
같은 질문으로 확인하자.
이 연재는 인용된 글에 보이는 형식을 세는 데서 출발했습니다. 엔진별 출처를 비교하고, 검색순위에 블로그 활동 지표와 의미 적합성을 차례로 더하면서 처음의 관찰만으로는 인용 공식을 만들 수 없다는 점을 확인했습니다.
반복 측정에서는 질문과 엔진을 고정하고, 검색 결과·AI 답변·인용 원문을 회차별로 남겨야 합니다. 새 변수를 찾았을 때는 같은 표본과 검증 조건에서 얼마나 더 설명하는지 확인해야 합니다. 한 번 인용된 글의 형식을 그대로 복제할 근거는 이번 조사에서 얻지 못했습니다.
같은 질문의
변화를 기록합니다.
사이트의 현재 구조와 콘텐츠를 진단하고 개선 방향을 정리합니다. 검색 순위나 AI 인용을 보장하지 않습니다.
AI Visibility Report 신청 ↗