공개 작품 페이지 231개, 527개, 794개로는 왜 콘텐츠 해자를 가진 곳을 알 수 없을까
공개 작품 페이지 수가 콘텐츠 해자를 직접 입증할 수 없는 이유와 재검증 가능한 사이트맵 감사 기준을 설명합니다.

들어가며
스냅샷 날짜: 2026-09-22. 제목의 숫자는 이번 공개 사이트맵 및 사이트 내부 페이지 감사에서 나온 것으로, 당시 기준에 따라 기록한 관련 URL을 나타내며 활동 중인 작품, 창작자 또는 사용자 수를 뜻하지 않습니다.
231, 527, 794는 크기 순으로 나열할 수 있어 보이지만, 각 숫자에는 작품 첫 페이지, 에피소드, 캐릭터, 언어별 버전, 태그, 템플릿 페이지가 섞여 있을 수 있습니다. 집계 기준을 맞추기 전에는 숫자가 정밀할수록 오해를 더 설득력 있게 만듭니다.
첫 번째 단계: URL 유형 분류하기
각 페이지에 work, episode, character, collection, tag, template, other를 표시합니다. 같은 작품의 20개 에피소드를 독립 작품 20개로 세어서는 안 되며, 같은 페이지의 다섯 가지 언어 버전도 공급량에 중복 집계해서는 안 됩니다.
두 번째 단계: 실제로 감상하고 플레이할 수 있는지 검증하기
무작위 표본을 통해 페이지가 로드되는지, 실제 콘텐츠가 있는지, 시작 지점에서 결말까지 진행할 수 있는지, 미디어가 작동하지 않는지, 로그인이 필요한지, 모바일에서 이용할 수 있는지 확인합니다. 사이트맵에 존재한다고 해서 사용자가 경험을 끝까지 완료할 수 있다는 뜻은 아닙니다.
세 번째 단계: 공급 속도와 콘텐츠 품질 구분하기
새 URL은 게시 속도를 보여 줄 수 있지만, 품질은 완료율, 독립성, 업데이트, 재플레이, 사용자 피드백을 살펴봐야 합니다. 외부에서는 일부 신호만 관찰할 수 있으므로, 이를 명확히 “공개적으로 확인 가능한 카탈로그 규모”라고 표현해야 하며 “콘텐츠가 가장 풍부한 플랫폼”이라고 써서는 안 됩니다.
해자를 입증하는 데 더 가까운 다섯 가지 지표
- 활동 중인 창작자의 30/90일 유지율;
- 초안이 아닌 완성 작품의 비율;
- 작품 완료율과 재플레이율의 중앙값;
- 독자적인 소재, 구조, 에셋의 다양성;
- 창작자가 첫 작품에서 두 번째 작품으로 넘어가는 데 걸리는 시간과 성공률.
이러한 데이터는 대부분 공개되지 않으므로 경쟁 분석에서는 모르는 부분을 인정해야 합니다. 페이지 수에도 여전히 가치는 있습니다. 공개 배포 기반, SEO를 통한 발견 가능성, 공급 파이프라인을 보여 줄 수 있기 때문입니다. 다만 콘텐츠 소비 경험의 품질과 네트워크 효과를 단독으로 입증할 수는 없습니다.
재검증 가능한 감사표
플랫폼마다 사이트맵 주소, 수집 시각, 전체 URL 수, 분류 규칙, 중복 제거 방법, 유효하지 않은 페이지의 비율, 표본 범위를 보관합니다. 다음 업데이트에서는 추가, 삭제, 유형 변경을 보고하여 서로 다른 날짜와 기준으로 비교하지 않도록 합니다.
콘텐츠 해자는 “가장 많은 재고”가 아니라, 좋은 창작자가 꾸준히 게시하고 싶어 하고, 사용자가 끝까지 완료하고 다시 플레이하고 싶어 하며, 작품을 안정적으로 발견할 수 있는 상태입니다. 공개 URL은 이 연결 고리의 한 부분이지 전체가 아닙니다.
먼저 세 숫자를 비교할 수 있게 만들기
같은 날 수집했다고 해서 집계 기준이 자동으로 같아지는 것은 아닙니다. 어떤 사이트는 모든 에피소드를 사이트맵에 넣고, 다른 사이트는 시리즈 첫 페이지만 넣을 수 있습니다. 클라이언트 측에서 작품을 로드하기 때문에 사이트맵에 작품이 온전히 나타나지 않는 사이트도 있습니다. 감사 전에 “독립 작품 페이지”에 대한 실행 가능한 정의를 작성하고, 분류할 수 없는 URL은 별도로 보관해야 합니다. 깔끔하게 정리하려고 억지로 분류해서는 안 됩니다.
중복을 제거할 때는 정규 URL, 작품 ID, 제목과 창작자 조합을 사용하고, 다국어 버전, 리메이크, 미러 페이지를 표본으로 점검합니다. 자동 유사도 분석은 후보를 찾아낼 수 있을 뿐, 두 이야기가 같다고 단독으로 판단할 수는 없습니다. 마지막으로 원본 URL, 제외한 수, 독립 작품 후보, 수동 검토 비율을 함께 보고해야 독자가 숫자가 어떻게 만들어졌는지 볼 수 있습니다.
층화 표본 추출로 페이지 품질 점검하기
신작과 기존 작품, 소재, 창작자, 페이지 유형별로 표본을 추출하고 로딩, 미디어, 상호작용, 결말, 모바일 이용 가능 여부, 최근 업데이트를 기록합니다. 첫 페이지의 추천은 우수한 작품에 치우치기 쉬우며 무작위 표본은 전체 재고에 더 가깝습니다. 하지만 외부 접근만으로는 실제 완료율과 창작자 유지율을 입증할 수 없으므로, 이를 “실제 이용 가능 여부에 대한 표본 점검”이라고 명시해야 합니다.
스냅샷 사이의 추가와 삭제도 똑같이 중요합니다. 새 페이지가 많이 생겼다가 빠르게 유효하지 않게 된다면 게시 파이프라인과 지속적인 유지 관리가 맞물리지 않을 가능성을 보여 줍니다. 수량은 안정적이지만 작품이 계속 업데이트된다면 플랫폼이 시리즈 운영을 더 중시한다는 의미일 수 있습니다. 결론은 관찰된 변화를 설명해야 하며 공개되지 않은 사업상의 이유를 추론해서는 안 됩니다.
공개 기반에서 해자의 증거로 나아가기
URL 규모는 공개 배포와 검색 기반이 존재하는지 답하는 데 가장 적합합니다. 콘텐츠 해자를 논하려면 독립 작품의 완성도, 사용자의 콘텐츠 소비, 창작자의 후속 작품 제작, 플랫폼의 피드백 순환 구조도 필요합니다. 내부 팀은 공개 카탈로그를 완료율 중앙값, 재플레이, 30일 또는 90일 창작자 유지율과 연결할 수 있습니다. 이러한 데이터가 없는 외부 분석에서는 이를 검증이 필요한 변수로 명시해야 합니다.
글을 업데이트할 때는 이전 스냅샷과 계산 스크립트 버전을 보관하고, 새로운 기준으로 과거 숫자를 덮어쓰지 않습니다. 231, 527, 794는 날짜, 페이지 유형, 중복 제거 규칙, 유효하지 않은 페이지의 판정 규칙을 모두 추적할 수 있을 때만 연구 가치가 있습니다. 그렇지 않으면 정밀해 보이는 마케팅 숫자 세 개에 불과합니다.
보고서를 공개할 때는 감사표의 필드 설명을 첨부하고, 독자가 집계 숫자에서 익명화된 표본과 분류 규칙으로 돌아갈 수 있게 합니다. 원본 URL을 공개할 수 없다면 최소한 표본 추출, 중복 제거, 오차 범위를 공개하여 결론을 재검증할 수 있는 경로를 제공해야 합니다.


