노출도 척도 판 3

채점 방법

무엇을 재고 무엇을 깎는지 전부 적어 뒀어요. 로그인 없이 볼 수 있어요.

AI Visibility 는 세 가지를 곱해요. 더하지 않는 이유는 셋이 차례대로 이어지기 때문이에요. 봇이 못 들어오면 AI 가 우리 페이지를 못 읽어요. 못 읽으면 답변에 우리가 나올 수 없어요. 답변에 안 나오면 맞게 말했는지 따질 것도 없어요. 그래서 하나라도 0 이면 전체가 0 이 되고, 어디서 막혔는지가 점수만 봐도 보여요.

공식

1. 들어올 수 있는가

봇이 우리 사이트에 들어올 수 있나

0 ~ 1

2. 답변에 나오는가

질문마다 우리가 얼마나 나왔나

0 ~ 1

3. 맞게 나오는가

우리 사실과 어긋나게 말한 게 있나

0 ~ 1

셋을 곱한 값에 100 을 곱하면 AI Visibility 0~100 이에요.

첫 번째는 AI Readiness 의 「들어올 수 있는가」와 이름은 같지만 값이 달라요. 같은 봇 두드림 결과에서 다르게 뽑아요. 준비도는 실시간·검색·학습 세 갈래를 가중해 25점으로 내고, 여기서는 실시간·검색 두 갈래의 통과 비율만 써요. 이름을 같게 둔 것은 같은 관문을 말하기 때문이고, 값이 다른 것은 쓰임이 다르기 때문이에요.

더했다면 이렇게 나와요

이런 사이트라면더하기곱하기
AI 가 우리를 잘 인용하는데 하는 말이 전부 틀림
고객이 잘못된 값을 보고 전화해요
600
AI 가 우리 페이지를 한 번도 안 읽고 이름만 한 번 말함
페이지를 고쳐도 안 바뀌는 상태예요
287

더하기는 한쪽이 0 이어도 다른 쪽이 메워줘요. 그래서 노출이 안 되느니만 못한 상태에 60점이 붙어요. 곱하기는 그걸 0 으로 만들어요.

두 번째 층

답변에 나오는가

질문마다 한 번만 세어요. 전에는 인용·언급·발견을 따로따로 셌어요. 그러다 보니 답변 하나에 우리가 인용되면 세 군데가 한꺼번에 올랐어요. 잘한 일 하나를 세 번 센 셈이에요. 사실 이 셋은 별개가 아니라 같은 것의 정도 차이예요.

0단계 안 나옴 이름도 없고 근거도 없음

결혼식에서 뮤지컬 공연 해주는 업체 추천해줘

출처 0건 · 이름 안 나옴

1단계 이름만 나옴 답변 글에 우리 이름. 유사 업체명을 걷어낸 뒤

뮤지컬웨딩 어떤 곳인지 알려줘

출처 0건 · 이름은 나옴 · 우리 사실에 없는 말 8건

AI 가 "뮤지컬웨딩은 업체 이름이 아니라 결혼식 연출 방식"이라고 답했어요. 회사가 없는 것처럼 말한 셈이에요. 식순도 지어냈어요.

2단계 근거로 걸림 인용 메타데이터에 우리 호스트

뮤지컬웨딩의 공연 구성과 본식DVD 가격 알려줘

출처 3건 전부 우리 사이트 · 일치 30 · 불일치 1

질문마다 가장 높은 단계 하나만 매기고, 그 평균이 이 값이에요. 단계 1 을 보면 왜 곱해야 하는지 알 수 있어요. 이름은 나왔으니 여기서는 점수가 오르지만, 내용을 지어냈으니 다음 값에서 깎여요. 예전처럼 더하기만 했다면 「이름이 나왔으니 점수 +」 로 끝났을 거예요.

세 번째 층

맞게 나오는가

기준 사실과 대조해서 어긋난 것만 깎아요. 우리 목록에 없는 말로는 안 깎아요. 그러면 우리 수집이 부실할수록 고객 점수가 떨어져 인과가 거꾸로 서요.

어긋남
기준 사실이 16,900원인데 AI 가 29,000원이라고 말한 경우예요. 이것만 점수를 깎아요. 말하지 않은 항목은 분모에서 빼요.
우리 사실에 없음
우리 기준 사실 목록에 없는 말이에요. 틀렸다는 뜻이 아니에요. 받아둔 페이지를 뒤져 갈래를 나눠요.

페이지에 있다 고칠 사람은 우리

우리 수집이 놓쳤어요. 한생건에서 600mg x 30정 · 16,900원 이 그랬어요.

페이지에 없다 고칠 사람은 고객

자기 소개가 자기 사이트에 없어서 AI 가 남의 자료로 설명해요. 한생건은 사업자 주소가 그랬어요.

2026-08-21 까지는 이 칸을 지어냄이라 불렀어요. 채점기는 참·거짓을 본 적이 없는데 이름이 그렇게 말하고 있었고, 한생건 42건이 전부 고객 페이지에 있는 값이었어요.

무엇을 묻나

이름을 대고 묻는 것부터 안 대고 묻는 것까지 사다리예요. 뒤로 갈수록 어렵고 값어치가 커요.

이름을 대고
「뮤지컬웨딩 어떤 곳인지 알려줘」 · 우리를 이미 아는 사람
자세히
「공연 구성과 가격 알려줘」 · 알고 자세히 묻는 사람
이름 없이
「결혼식에서 뮤지컬 공연 해주는 업체 추천해줘」 · 아직 우리를 모르는 사람. 값어치가 제일 커요
고민만
「축가 대신 특별한 공연 하고 싶은데 뭐가 있어?」 · 점수에 안 넣어요

점수에 안 넣는 것과 그 이유

그 값을 어떻게 얻나

위 세 관문은 무엇을 재는지예요. 여기는 어떻게 재는지예요. 보낸 요청과 받은 응답을 원본 그대로 둬요.

보낸 것과 받은 것 원본으로 보기접기
  1. 검색을 켜고 AI 에게 묻는다

    검색을 끄면 모델이 학습 지식으로 답해요. 그건 우리가 페이지를 고쳐도 절대 안 바뀌므로 측정 대상이 아니에요.

    보낸 것

    POST https://api.anthropic.com/v1/messages
    
    {
      "model": "claude-sonnet-5",
      "max_tokens": 2048,
      "tools": [{
        "type": "web_search_20250305",
        "name": "web_search",
        "max_uses": 5
      }],
      "messages": [
        { "role": "user", "content": "뮤지컬웨딩 어떤 곳인지 알려줘." }
      ]
    }

    프롬프트에 우리 이름도 사이트도 안 넣어요. 고객이 실제로 던질 말 그대로여야 해요. 조건을 우리 사이트 문구에서 베끼면 답을 정해놓고 묻는 셈이에요.

  2. 응답을 세 갈래로 가른다

    여기가 이 측정에서 제일 중요한 자리예요.답변 본문에는 주소가 아예 없어요 — 요즘 모델은 각주 번호로 인용해요. 정규식으로 본문을 긁으면 체계적으로 놓치고, 그건 “인용 0건”이라는 가짜 발견이 돼요.

    받은 응답에서 꺼내는 곳

    server_tool_use.input.query     →  AI 가 넣은 검색어
    web_search_tool_result[].url    →  검색이 돌려준 주소
    text.citations[].url            →  답변이 각주로 단 주소

    실제 값 · 뮤지컬웨딩 「어떤 곳인지 알려줘」 1회차

    검색어 1건
      "뮤지컬웨딩"
    
    검색이 돌려준 주소 10건
      en.wikipedia.org/wiki/The_Last_Empress_(musical)
      en.wikipedia.org/wiki/Marriage_a_la_Carte
      kmong.com/gig/560048
      www.musicw.co.kr/about?bo_table=artist&wr_id=94
      vimeo.com/781785449
      instagram.com/musicalwedding/
      … 4건 더
    
    답변이 각주로 단 주소 3건
      www.musicw.co.kr/about?bo_table=artist&wr_id=94
      www.musicw.co.kr/
      kmong.com/gig/560048

    우리 몫 2 / 3 각주 기준. 검색 결과로 세면 1 / 10 이 돼요

    이 둘을 합치면 분모가 3배가 돼요. 실제로 그렇게 세던 시절이 있었고, 고치고 나니 같은 사이트의 「우리 출처 비율」이 15% → 35% 로 뛰었어요. 오른 게 아니라 세는 것이 달라진 것이에요 — 우리 것 절대수는 오히려 11건에서 8건으로 줄었어요. 그래서 판이 다르면 델타를 안 내요.

  3. 답변을 기준 사실과 대조한다

    채점도 AI 가 해요. 다만 상식으로 판단하지 말라고 못 박고, 항목 이름을 스키마 enum 으로 강제해요 — 프롬프트는 부탁이고 enum 은 강제예요. 이름이 회차마다 달라지면 같은 문제가 여러 개로 쪼개져서 “반복해서 틀린 것” 문턱을 아무것도 못 넘어요.

    보낸 것

    POST /v1/messages   (구조화 출력)
    
    system: 당신은 AI 답변을 기준 사실과 대조하는 채점자입니다.
            1. 기준 사실에 없는 것을 옳다고 하지 마십시오.
            2. cited 는 「각주로 단 주소」에 대상 사이트가 있을 때만 true 입니다.
            3. checks 는 기준 사실의 모든 항목에 대해 만드십시오.
    
    user:   ## 기준 사실 (원본에서 확인한 값)      60건
            ## 질문 / ## AI 답변
            ## 답변이 각주로 단 주소               3건
            ## 검색이 돌려준 주소 (각주는 안 달림)  10건
    
    output_format: JSON Schema · field 는 기준 사실 이름만 (enum)

    받은 것 · 60개 항목 중 둘

    {
      "field":   "요약",
      "claimed": "국내 최초로 뮤지컬을 결혼식에 접목시킨 회사로 알려진
                  브랜드, 현직 뮤지컬·연극·영화배우 등으로 구성된 프로집단",
      "actual":  "국내 최초로 뮤지컬을 결혼식에 접목시킨 회사, 뮤지컬웨딩.
                  현직 뮤지컬·연극·영화배우로 구성된 프로집단이 선사하는
                  세상에 하나뿐인 결혼식.",
      "verdict": "match"
    }
    
    "unsourced": [
      "각 분야별 스태프 역시 작사·작곡가, 연출가, 기획가 등으로 이루어져 있음",
      "신랑입장 'Prince Alli', 오프닝 축하공연 'Ring In The Season' 매칭"
    ]

    verdict 는 match · mismatch · missing 셋이에요. unsourced는 기준 사실에 없는 말 — 우리 페이지에 안 적힌 것을 AI 가 어디선가 가져온 것이에요.

    기준 사실이 어디서 오나 — 여기가 이 측정의 제일 약한 자리예요. 지금은 llms.txt 와 JSON-LD 두 곳에서만 뽑아요. 그런데 우리 근거로는 AI 가 둘 다 잘 안 읽어요— llms.txt 는 봇 방문 0건이고, JSON-LD 는 다섯 엔진에 물어본 실험에서 전부 못 읽었어요. 그래서 「사실 일치 76%」가 AI 가 틀린 것인지, AI 가 볼 수 있는 곳에 그 값이 없는 것인지 지금은 못 가려요. 본문 HTML 은 이미 받아두는데 아직 사실을 안 뽑아요.

    채점이 잘리면 「지적 없음」이 돼요. 기준 사실 46건에서 응답이 토큰 상한을 넘겨 잘린 적이 있는데, 39건이 틀렸는데 리포트에 0건으로 찍혔고 화면 어디에도 이상 신호가 없었어요. 지금은 잘리면 던져요— 못 잰 것을 지적 없음으로 바꾸지 않아요.

  4. 같은 질문을 세 번 던지고 중앙값을 쓴다

    위 1~3 을 질문 7개 × 3회 × 엔진 2개 반복해요. 한 번 재고는 아무 말도 안 해요.

    뮤지컬웨딩 · 클로드 · 우리 몫

    1회차   8 / 22
    2회차   8 / 23
    3회차   8 / 23     →  중앙값 35%

    원가 9,545원 답변보다 채점이 더 들어요

한 번 재고는 아무 말도 안 해요

같은 질문 세 번에 이렇게 나왔어요.

우리 출처 비율 7% · 41% · 8%

같은 사이트를 같은 날 잰 것이에요. 그래서 3번보다 적게 쟀으면 숫자를 아예 안 내요. 괄호에 작게 적는 것도 안 해요. 리포트에 숫자가 보이면 사람은 그걸 읽기 때문이에요. 오간 폭이 값보다 크면 흔들려서 아직 못 믿음이라고 따로 적어요. 앞의 숫자만 읽고 뒤의 ± 는 잘 안 보게 되니까요.

척도 판이 다르면 비교하지 않아요

지금은 판 3 이에요. 그 전에 잰 것은 판 0 이라 빼지 않아요.

판 0 은 네 가지에 가중치를 줘서 더했어요(0.35·인용 + 0.25·정확 + 0.20·발견 + 0.20·언급). 같은 자료로 다시 계산해 보니 클로드 57 → 54 · ChatGPT 61 → 21 이고 둘의 순위가 뒤집혔어요. GPT 가 앞섰던 것은 출처를 워낙 적게 달았기 때문이에요. 세 개를 달았는데 그게 다 우리 것이면 100% 가 돼요. 정작 우리를 근거로 든 질문은 일곱 중 하나뿐이었어요.

고객은 아무것도 안 했는데 숫자가 움직인 것이에요. 그 차이를 개선이나 악화로 적으면 리포트가 거짓말을 해요. 전문은 docs/aeo-geo-exposure-review.md.

판 3 (2026-09-01) 에서 채점에 「덜 말함」을 더했어요. 전에는 판정이 셋뿐이라 식순 7가지 중 5가지만 말함 을 담을 칸이 없었어요. 말한 것은 다 맞는데 「다르게 말함」으로 가고, 그러면 처방이 「값을 고쳐라」가 돼요. 값은 맞아요. 고칠 것은 개수를 먼저 밝히고 번호를 매기는 것이에요. AI 는 목록의 뒤쪽을 흘려요.

「덜 말함」은 점수를 깎지 않아요. 말한 것이 맞기 때문이에요. 대신 따로 세고 오답 목록에서 갈래를 나눠요. 그래도 전에 「다르게 말함」으로 가던 것이 이제 이쪽으로 오므로 사실 일치가 올라가요. 판 2 와 비교하지 마세요.

규칙의 정본은 코드예요. packages/llm/src/repeat.ts