AI 답변에 들어가는 콘텐츠는 어디서 결정될까
좋은 글을 쓰는 것만으로는 충분하지 않다. AI가 접근하고, 발견하고, 질문의 후보로 고르고, 근거를 답변에 옮기는 각 단계가 모두 통과되어야 한다.
먼저 순서를 봐야 한다
AI 검색 서비스의 내부 구조는 모두 같지 않고 세부 순위 신호도 공개되지 않았다. 다만 공개 문서와 연구를 합치면 실무에서 확인할 수 있는 경로는 다음처럼 정리할 수 있다.
질문 확장 → 접근 → 발견·색인 → 후보 회수 → 출처 선택 → 답변 반영 → 브랜드 언급·추천 → 방문·행동
앞 단계가 막히면 뒤 단계의 개선은 평가받지 못한다. 인용됐다고 답변에 깊게 반영됐다고 볼 수도 없고, 답변에 등장했다고 추천이나 방문이 일어났다고 볼 수도 없다. 그래서 각 단계를 별도 지표로 측정해야 한다.
1. 질문이 여러 검색으로 확장된다
Google은 AI Overviews와 AI Mode가 하나의 질문을 하위 주제와 여러 데이터 소스에 관한 검색으로 넓히는 query fan-out을 사용할 수 있다고 설명한다.
할 일: 문서 하나가 다루는 주제·대상·조건을 분명히 하고, 사용자가 실제로 묻는 하위 질문을 빠짐없이 다룬다.
작동 가능성: 질문과 문서의 의미가 가까우면 관련 검색에서 후보로 회수될 기회가 생긴다. 다만 질문형 제목, 키워드형 제목, 특정 목차 형식 중 무엇이 더 유리한지는 공개된 보편 법칙이 아니다.
2. 크롤러가 본문에 접근한다
Google은 AI 기능의 지원 링크가 되려면 페이지가 검색에 색인되고 스니펫 표시가 가능해야 한다고 명시한다. OpenAI는 ChatGPT 검색의 요약과 스니펫에 포함되려면 OAI-SearchBot을 막지 말라고 안내하고, Perplexity도 검색 결과 노출을 위해 PerplexityBot 허용을 권한다.
할 일: 검색용 크롤러를 robots.txt, 방화벽, CDN에서 막지 않고 중요한 내용을 정적 텍스트로 제공한다.
작동 가능성: 시스템이 본문을 가져와야 검색 후보와 근거로 사용할 수 있다. 크롤 허용은 필요 조건이지 인용을 높이는 가산점으로 확인된 것은 아니다.
3. 문서가 발견되고 색인된다
내부 링크와 사이트맵은 새 URL을 발견하는 경로다. Google은 콘텐츠를 내부 링크로 쉽게 찾을 수 있게 하라고 권하지만, 요구 조건을 모두 충족해도 크롤·색인·노출은 보장되지 않는다고 밝힌다.
할 일: 고립된 페이지를 만들지 않고, 내부 링크·정규 URL·사이트맵·색인 상태를 따로 확인한다.
작동 가능성: 검색 인덱스에 없는 문서는 검색 기반 답변의 후보가 될 수 없다. 다만 사이트맵 제출 자체를 순위나 인용 상승으로 해석하면 안 된다.
4. 질문에 맞는 출처로 선택된다
검색 시스템은 색인된 모든 문서를 답변에 넣지 않는다. 질의와의 관련성, 검색 품질, 최신성, 출처 특성 등을 바탕으로 일부 후보를 고른다. 정확한 가중치는 서비스마다 다르고 공개되지 않았다.
할 일: 질문의 범위와 직접 맞는 제목·서문·본문을 쓰고, 다른 곳을 요약한 글보다 직접 조사·경험·고유 데이터를 제공한다.
작동 가능성: Google은 검색 기반 생성 기능이 핵심 검색 순위·품질 시스템으로 관련 최신 페이지를 회수하며, 장기적으로 독창적이고 비범용적인 콘텐츠가 더 큰 영향을 줄 가능성이 높다고 설명한다. 이는 공식 권고이며, 개별 요소의 독립적인 인과 효과를 공개한 것은 아니다.
5. 답변에 쓸 근거가 선택된다
KDD 2024의 GEO 연구는 후보 출처가 이미 주어진 환경에서 통계, 출처 인용, 관련 직접 인용, 문장의 유창성이 생성 답변에서 출처가 차지하는 분량과 위치를 높일 수 있음을 보였다. 키워드 반복은 같은 실험에서 이점을 보이지 않았다.
할 일: 막연한 표현을 검증 가능한 수치로 바꾸고, 원출처를 연결하며, 누가 말했는지 분명한 인용을 사용한다. 수치·인용·출처를 한 번에 넣지 말고 각각의 효과를 구분한다.
작동 가능성: 수치·인용문·출처는 모델이 근거로 옮겨 쓸 수 있는 구체적인 단위를 제공한다. 그러나 이 연구의 주요 결과는 웹 전체에서 새 페이지를 발견하고 색인하는 과정까지 검증한 값이 아니다. 실제 서비스의 전체 경로에서 같은 효과가 재현되는지는 별도 실험이 필요하다.
6. 근거가 답변 문장으로 흡수된다
2026년의 Citation Selection to Absorption 연구는 출처 링크가 선택되는 것과 그 내용이 답변의 문장·근거·구조에 반영되는 것을 나눠 측정했다. 더 길고 구조가 분명하며 질문과 의미가 맞고 정의·수치·비교·절차처럼 추출 가능한 근거가 많은 페이지가 높은 답변 영향과 함께 나타났다.
할 일: 정의, 비교 기준, 절차, 수치의 분모와 조건을 독자가 구분할 수 있게 쓴다. 읽기 쉬운 문장과 명확한 소제목을 사용하되 형식만 흉내 내지 않는다.
작동 가능성: 답변 생성기가 필요한 근거 단위를 찾아 재구성하기 쉬워진다. 이 결과는 대규모 관찰에 기반한 연관이며, 짧은 문단이나 특정 HTML 구조가 원인이라고 확정하지 않는다.
FeatGEO 연구도 단어 몇 개를 바꾸는 방식보다 문서 수준의 의미·구조 특징을 함께 최적화하는 접근이 벤치마크에서 더 나았다고 보고했다. 이것 역시 모든 실제 서비스에서 통하는 처방으로 일반화하기 전 재현이 필요하다.
7. 브랜드 선택과 방문은 별도 결과다
출처 링크가 붙었다고 브랜드가 호의적으로 소개되거나 추천됐다고 볼 수 없다. 추천되더라도 사용자가 원문을 방문하거나 구매하는지는 다시 다른 결과다.
할 일: URL 인용, 내용 반영, 브랜드 언급, 추천 방향, 원문 클릭, 후속 행동을 분리해 기록한다.
작동 가능성: 단계별로 보면 콘텐츠 문제와 브랜드 인식 문제, 방문 동기 문제를 혼동하지 않고 다른 처방을 내릴 수 있다. 외부 매체의 브랜드 언급이 AI 답변에 영향을 준다는 관찰은 존재하지만, 인과 효과와 필요한 노출량은 아직 확정되지 않았다.
상대적으로 확인된 것
- 검색 기반 답변에서 크롤과 색인은 후보 진입의 선행 조건이다. 접근 허용만으로 인용이 보장되지는 않는다.
- Google AI 기능에 별도의 AI 전용 파일이나 특별한 스키마가 필수라는 근거는 없다. Google은 기존 검색 기본 원칙 외의 추가 기술 요구사항이 없다고 명시한다.
- 후보 출처가 주어진 실험 환경에서는 통계·출처 인용·관련 직접 인용·유창한 문장이 답변 내 가시성을 높였다.
- 같은 실험에서 키워드 반복은 안정적인 이점을 보이지 않았다.
- 인용 링크의 존재와 실제 답변 내용에 미친 영향은 서로 다른 지표다.
아직 밝혀지지 않은 것
- ChatGPT Search, Google AI Mode, AI Overviews, Perplexity가 출처를 고르는 정확한 신호와 가중치
- 한국어·국내 시장·신규 도메인에서도 기존 연구와 같은 효과가 나타나는지
- 질문형 제목, 상단 요약, FAQ, 표, 짧은 문단, 스키마가 각각 독립적으로 인용을 늘리는지
- 최신 날짜 자체와 실제 내용 갱신 중 어느 요소가 선택에 영향을 주는지
- 외부 브랜드 언급이 답변의 브랜드 선택에 미치는 인과 효과와 필요한 반복량
- 답변 노출과 인용이 실제 사이트 방문·문의·구매로 이어지는 조건
Lab에서 검증할 것
실행 순서는 유행하는 전술의 순서가 아니라 앞 단계의 실패가 뒤 단계를 막는 순서로 잡는다.
- 접근 관문: 검색 크롤러 허용과 차단. 크롤 가능 여부와 인용을 분리해 측정한다.
- 발견 관문: 내부 링크와 사이트맵 등 발견 경로. 첫 색인 시점과 실패 상태를 기록한다.
- 후보 회수: 질문과 의미가 맞는 제목·소제목·본문이 회수율에 미치는 영향. 질문형 제목 자체는 별도 변수로 둔다.
- 근거 선택: 수치, 출처 링크, 직접 인용, 최초 조사 데이터를 한 번에 하나씩 비교한다.
- 답변 흡수: 정의·비교·절차 중심 구조와 연속 서술을 비교하고, 유창성은 별도 실험으로 분리한다.
- 최신성: 실제 내용 갱신과 날짜 표기의 효과를 시간 민감형 질문에서 나눈다.
- 브랜드 결과: 자사 URL 인용, 외부 언급, 추천, 방문을 분리한 관찰 설계를 만든다.
현재 Lab의 수치 실험은 색인 관문을 확인하는 중이다. 비교 가능한 문서 쌍이 충분히 색인되기 전에는 인용률을 계산하지 않는다. 발견되지 않은 상태를 효과 없음으로 기록하지 않기 위해서다.
근거와 확인 한계
- AI features and your website · Google Search Central. Google AI 기능의 검색 인덱스·크롤·내부 링크·추가 요구사항 설명.
- Optimizing your website for generative AI features · Google Search Central. 검색 기반 생성, 고유하고 비범용적인 콘텐츠에 관한 공식 권고.
- Publishers and Developers FAQ · OpenAI. ChatGPT 검색용 크롤러와 요약·스니펫 포함 조건.
- Perplexity Crawlers · Perplexity. 검색용 크롤러와 사용자 요청용 접근 경로.
- GEO: Generative Engine Optimization · KDD 2024. 통계·출처 인용·직접 인용·유창성·키워드 반복의 비교 실험.
- Think Before Writing: Feature-Level Multi-Objective Optimization for Generative Engine Optimization · ACL 2026. 문서 수준 특징을 사용한 벤치마크 최적화 연구.
- From Citation Selection to Citation Absorption · 2026년 프리프린트. 출처 선택과 답변 반영을 분리한 관찰 측정.
공식 문서는 각 회사가 공개한 자사 시스템 설명이며 전체 순위 공식을 제공하지 않는다. 논문은 서로 다른 데이터·시점·엔진·평가 지표를 사용했다. 결과를 평균내지 않았고, Lab에서 같은 조건으로 재현되기 전에는 실행 처방으로 확정하지 않는다.