VLYVLY / LAB · RESEARCH RECORD

AI 인용 조사 자료
6월 관측과 9월 재검증

기존 LAB 1~4의 근거를 다시 읽고, 보존된 CSV로 재계산할 수 있는 항목을 확인했습니다. 당시 보고서와 새 계산값은 아래에서 구분합니다.

원 관측: 2026년 6월 · 재검토: 2026년 9월 11일 · 수집 theXEO · 재집계·편집 VLYVLY

어떤 자료를 확인했나

확인 근거다시 확인할 수 있는 범위
LAB 1 ↗네이버 브리핑 인용 CSV, 당시 기사·전달 기록제습기 첫 회차 인용 305건, 네이버 블로그 217건, 블로그·카페·지식iN 246건(약 81%). 인용 행이 있는 질문은 43개.
LAB 2 ↗theXEO 엔진 비교 보고서와 전달 기록한국 출처 비중·엔진 중첩률은 당시 보고값. 전체 답변·분류 원장과 중첩 분모 산식이 없어 비율의 독립 재계산은 하지 못함.
LAB 3 ↗검색순위 CSV v2, 블로그 활동 CSV v3AI 미측정을 제외한 검색 1위 87건, 인용 23건·비인용 64건. 활동 지표 모델 재검증.
LAB 4 ↗의미 적합성 CSV v4·v5, 6월 검증 보고저장된 의미 적합성 값으로 모델 재검증. 당시 부트스트랩·안정성 분석은 전달·재현 기록을 대조했으며 이번에 재실행하지 않음.

LAB 1의 질문 50개는 당시 파트너가 밝힌 조사 계획입니다. 인용 CSV는 출처가 있는 행만 담아 나머지 7개 질문의 미인용·실패·브리핑 노출 여부를 구분할 수 없습니다. 기존 노출률 88%는 이 자료로 검증하지 못해 내렸습니다. 브랜드·검색량 표와 17건 대 13건의 본문 형식 비교는 당시 보고 기준으로 남겼으며, 해당 개별 측정표는 이번 자료에 없습니다.

미측정은 비인용에 넣지 않는다

검색순위 v2 CSV에는 1,550개 질의–URL 행이 있습니다. 이 가운데 measured_rounds=0인 69개 행은 AI 답변을 측정하지 않았습니다. 로봇청소기 54개 행과 에어컨 15개 행이 해당합니다. 결과 열이 0이어도 비인용으로 세지 않았습니다.

LAB 3 검색 1위 · 같은 CSV의 분모 재집계
기준전체인용비인용
기존 집계912368
미측정 4건 제외872364

64÷87은 73.56%로, 본문에서는 약 74%로 표시했습니다. ‘질의–URL’은 같은 질문과 같은 URL의 조합 한 건입니다. 같은 URL이 다른 질문에서 나타나면 다른 관측치가 됩니다. v2~v5 각각에서 같은 질의–URL 조합의 중복 행은 없었습니다.

미측정을 제외한 전체 1,481개 행에서 인용 쪽 평균 검색순위는 4.2073위, 비인용 쪽은 10.2102위였습니다. 본문은 이를 4.2위·10.2위로 반올림했습니다. 검색 1위만의 평균이 아닙니다.

확대 표본 v5는 로봇청소기의 AI 측정 732개 행을 보충해 질문 구성이 다릅니다. 그 표본의 검색 1위는 미측정 제외 후 141건이고, 비인용은 92건(약 65%)입니다. LAB 3의 74%를 확대 표본에도 적용하지 않았습니다.

같은 표본과 질문 분할로 AUC를 비교했다

AI 답변을 한 번 이상 측정했고, 비교할 변수 값이 모두 있는 네이버 블로그 행만 사용했습니다. 두 모델은 같은 행을 공유합니다. 질문을 5개 묶음으로 나눠 같은 질문의 URL이 학습용과 검증용 양쪽에 들어가지 않게 했습니다. 각 학습 묶음에서만 표준화를 학습한 뒤 로지스틱 회귀를 적용했습니다.

2026.09.11 재검증 · 5개 검증 묶음 AUC의 평균
추가 변수행 / 인용 / 질문순위만변수 추가
권위·활동276 / 32 / 810.7500.753
의미 적합성 · 작은 표본277 / 32 / 810.7420.716
의미 적합성 · 확대 표본717 / 156 / 1330.7470.737

AUC는 인용된 행에 비인용 행보다 높은 예측 점수를 부여하는 구분 능력입니다. 0.5는 무작위 순서 수준이며, 정답을 맞힌 비율인 정확도와는 다릅니다. 회귀계수도 AUC와 다른 지표라 같은 열에서 증감처럼 비교하지 않았습니다. scikit-learn ROC·AUC 설명 ↗

권위·활동 변수는 누적방문·이웃·공감·댓글·발행 경과일입니다. 인용 결과 자체에서 만든 author_cited_count는 넣지 않았습니다. 의미 적합성은 6월에 계산된 질문·본문 임베딩의 코사인 유사도입니다. 이번에는 본문을 새로 수집하거나 임베딩을 다시 만들지 않았습니다.

실행 환경은 scikit-learn 1.9.1, GroupKFold 5분할, StandardScaler와 LogisticRegression의 파이프라인이며 회귀 반복 한도는 2,000회입니다. 같은 URL이 서로 다른 질문에 나올 수 있어, 이 분할은 보지 못한 질문에 대한 평가입니다. 보지 못한 URL이나 도메인 전체에 대한 성능 검증은 아닙니다. 단일 분할의 차이를 통계적 유의성이나 속성의 인과 효과로 바꾸지 않았습니다.

6월 보고값과 이번 계산이 다른 이유

6월 예비 활동 모델은 AUC 0.73→0.71을 보고했습니다. 이번에는 미측정 행을 제외하고 질문별로 분할했으며, 표준화도 각 학습 묶음 안에서 수행했습니다. 따라서 9월의 0.750→0.753과 같은 검증값으로 읽을 수 없습니다.

6월 의미 적합성 보고의 작은 표본은 AUC 0.725→0.730, 확대 표본은 0.734→0.732였습니다. 의미 적합성 계수는 각각 +0.29, +0.05였습니다. 당시 질문별 검증 보고와 VLYVLY 재현 기록에서도 AUC가 조금씩 달랐습니다. 이런 값을 한데 묶어 ‘AI 인용의 천장 0.73’이라고 해석한 부분을 철회했습니다.

자료 무결성 확인값

원본 CSV와 재집계 코드는 편집 저장소에 보존했습니다. 이 페이지에는 집계와 방법만 공개합니다. 개인별 블로그 활동값과 수집 URL의 부가 매개변수는 재배포하지 않습니다.

v2-searchrank · SHA-256
a9aa269bf28014ba1dd75f803ec397f106d991b1fd8acb8e28149033e46580b9
v3-authority · SHA-256
15aefed3922b8fba108127d7fb57c7075e209def7d7f1737686ee044be241ca2
v4-relevance · SHA-256
f05c777a916ba9a10184e7ff00109a3c4efa593b7231a255fb36f674e5d8b0ef
v5-expanded · SHA-256
e2f3561d9a9d8474fee4cb3e80e9da73114a28e668977977d4b077e9a6b6b231

2026년 9월 11일 수정 기록

  • LAB 1: 검증할 수 없는 브리핑 노출률 88%를 내리고 보존 기록의 질문 수 43개를 표시했습니다.
  • LAB 2: 도입의 1~5%를 표와 같은 0~5%로 맞추고, 재계산하지 못한 보고값의 범위를 표시했습니다.
  • LAB 3: 미측정 4건을 제외해 검색 1위의 분모를 91→87, 비인용을 68→64로 고쳤습니다. 활동 모델 검증 조건도 바로잡았습니다.
  • LAB 4: ‘AI 인용의 천장’ 해석과 네 신호를 모두 합친 단일 모델 표현을 철회했습니다. 계수와 AUC를 나눠 표시하고 의미 적합성 모델을 재검증했습니다.

이전 공개 HTML, 전달 보고, 원본 CSV는 보존했습니다. 수정 날짜를 바꿔 새 기사처럼 발행하지 않았습니다.