내가 만든 AI 지식 허브에 빅테크들의 크롤러가 찾아왔다
내가 만든 AI 지식 허브에 빅테크들의 크롤러가 찾아왔다
방구석에서 만든 홈페이지에 무슨 일이 벌어지고 있을까?
처음부터 거창한 계획이 있었던 건 아니다.
AI에 관심이 생기면서 하나둘씩 자료를 정리하기 시작했고, 직접 테스트한 내용과 사용법, AI 에이전트 정보 등을 모아 홈페이지를 만들었다.
지금 운영하는 곳은 cursorai.co.kr이다.
일반적인 블로그와 조금 다르게 만들고 싶었다. 사람이 읽는 글뿐 아니라 AI 에이전트도 정보를 쉽게 찾고 활용할 수 있도록 Markdown 원문, API, 지식 그래프 같은 기능을 갖추기 시작했다.
그런데 어느 날부터 서버 접속 로그를 자세히 들여다보니 흥미로운 일이 벌어지고 있었다.
1. 서버 로그에 등장한 낯익은 이름들
Googlebot, ClaudeBot, OAI-SearchBot, ExaSearchBot.
이름만 보면 익숙한 글로벌 기업들의 크롤러가 내 홈페이지에 접속하고 있었다.
처음에는 단순히 홈페이지를 한 번 확인하고 가는 정도라고 생각했다. 그런데 로그를 살펴보니 요청하는 자료도 다양했다.
robots.txt와sitemap.xml- AI 에이전트 소개 페이지
- 일반 게시글과 가이드
- Markdown 형식의 원문 자료
- 지식 그래프 관련 파일과 데이터
서버에 남은 기록을 통해 어떤 URL에 요청이 들어왔는지, 언제 접속했는지, 정상적으로 응답했는지 확인할 수 있었다.
실제로 얼마나 찾아왔을까
말로만 하면 신빙성이 없으니, 최근 약 3일간의 서버 로그를 크롤러별로 집계해 봤다.
| 크롤러 | 운영 주체 | 요청 수 | 요청한 고유 URL 수 |
|---|---|---|---|
| Amazonbot | Amazon | 1,048 | 641 |
| Applebot | Apple | 959 | 259 |
| ExaSearchBot | Exa | 439 | 124 |
| Googlebot | 339 | 135 | |
| ClaudeBot | Anthropic | 330 | 18 |
| SemrushBot | Semrush | 329 | 185 |
| GPTBot | OpenAI | 254 | 52 |
| meta-externalagent | Meta | 164 | 108 |
| OAI-SearchBot | OpenAI | 105 | 37 |
| ChatGPT-User | OpenAI | 18 | 7 |
위 표는 KR·EN 엣지 로그를 기준으로 중복 없이 집계한 값이다. 여기에 규모가 작은 크롤러 몇 종을 더하면, 이 기간 전체 크롤러 요청은 약 4,200건에 이른다.
일부 요청은 공식 크롤러 IP 대역과도 대조했다. 단순히 User-Agent에 적힌 이름만 보고 판단하는 것보다는 실제 IP 정보까지 확인하는 편이 정확하기 때문이다. 예를 들어 ClaudeBot의 요청 IP는 216.73.216.x ~ 216.73.217.x 대역(Anthropic)에 몰려 있었고, Googlebot은 66.249.66.x 대역(Google)에서 확인됐다.
물론 IP 대역이 일치한다고 해서 개별 요청의 모든 목적까지 알 수 있는 것은 아니다.
2. 글만 읽는 게 아니었다
내가 특히 관심 있게 본 부분은 Markdown 원문과 지식 그래프 데이터에 대한 요청이었다.
내 홈페이지는 사람이 웹페이지를 읽는 것만 고려하지 않았다. AI 에이전트가 필요한 정보를 가져가기 쉽도록 원문과 구조화된 데이터도 제공하고 있다.
예를 들어 일반 페이지에서는 글을 읽을 수 있고, Markdown 원문에서는 불필요한 화면 요소 없이 내용 자체를 확인할 수 있다. 그래프 데이터는 서로 연결된 자료를 파악하는 데 활용할 수 있다.
크롤러들이 실제로 가져간 자료
로그를 자료 유형별로 나눠 보면, 크롤러가 무엇을 원하는지 더 분명하게 드러난다.
| 요청한 자료 | 요청 수 |
|---|---|
| Markdown 원문 (post.md) | 1,042 |
| API 응답 (/api/…) | 530 |
| robots.txt | 259 |
| sitemap.xml | 175 |
| 지식 그래프 데이터 (graph/data.json) | 116 |
| llms.txt | 18 |
가장 눈에 띄는 건 Markdown 원문(post.md) 요청이 1,000건을 넘었다는 점이다. 사람이 보는 화면이 아니라, 화면 장식 없이 본문 자체를 가져가려는 요청이 그만큼 많았다는 뜻이다. API 응답(/api/…) 요청도 530건으로 적지 않았다.
이런 구조를 만들면서 한 가지 궁금증이 생겼다.
AI가 인터넷의 지식을 활용하는 시대에, 개인이 정리한 자료도 실제로 크롤러들이 접근하는 공개 정보의 일부가 되는 것일까?
적어도 내 서버 로그에서는 여러 크롤러가 공개 자료에 요청을 보낸 흔적을 확인할 수 있었다.
다만 요청이 있었다는 사실과 자료가 실제 AI 학습에 사용됐다는 주장은 전혀 다른 이야기다. 접속 기록만으로 학습 여부나 이후 활용 방식을 확인할 수는 없다.
3. 솔직히 조금 뿌듯했다
혼자 서버를 준비하고, 글을 작성하고, 프로그램을 만들고, 홈페이지 구조를 개선해 왔다.
그렇게 만든 작은 사이트에 글로벌 AI 기업들의 크롤러가 찾아와 자료를 요청하고 있다는 사실이 신기했다.
물론 크롤러가 방문했다고 해서 내 홈페이지가 특별히 선정됐다거나, 기업이 내 콘텐츠를 중요하게 평가했다는 뜻은 아니다.
그럼에도 내가 인터넷에 공개한 지식이 실제로 접근 가능한 자료가 되었고, 여러 크롤러의 요청이 서버에 기록되고 있다는 점은 운영자로서 의미 있게 느껴졌다.
솔직히 말하면 이런 생각도 들었다.
'내가 혼자 만든 홈페이지의 자료가 글로벌 AI 생태계와 연결되고 있구나.'
이런 경험을 직접 해보기 전에는 크게 실감하지 못했던 부분이다.
4. 개인이 만든 지식도 인터넷의 일부다
나는 앞으로 AI 에이전트와 관련 도구에 대한 정보를 더 많이 축적할 생각이다.
새롭게 등장하는 에이전트와 스킬, 플러그인, 설치 방법, 실제 사용 경험을 정리하고, 집수리와 같은 현장 지식도 함께 기록할 계획이다.
단순히 글의 숫자만 늘리는 것이 목표는 아니다. 사람들이 실제로 활용할 수 있고, AI 에이전트도 쉽게 접근할 수 있는 지식 기반을 만들고 싶다.
글과 원문 자료를 연결하고, 관련 자료를 찾아볼 수 있도록 구조를 개선하는 것도 그 때문이다.
앞으로 크롤러들의 요청이 어떻게 달라지는지, 어떤 자료에 접근하는지, 공개한 콘텐츠가 검색을 통해 실제 사람들에게 얼마나 발견되는지 꾸준히 기록해 보려고 한다.
이런 데이터가 쌓이면 개인이 운영하는 AI 지식 사이트의 성장 과정을 살펴볼 수 있는 하나의 사례가 될 것이다.
마무리
처음에는 내가 필요해서 만든 홈페이지였다.
그런데 서버 로그를 들여다보면서 내가 공개한 자료가 인터넷에서 어떻게 접근되는지 직접 확인하게 됐다.
개인 홈페이지라고 해서 인터넷의 작은 섬으로만 남아 있는 것은 아니다. 공개된 자료는 검색엔진이나 각종 크롤러가 접근할 수 있고, 그 기록은 서버에 남는다.
물론 방문 기록만으로 자료가 어떻게 활용되는지까지 알 수는 없다. 하지만 적어도 어떤 요청이 들어왔고, 어떤 자료가 응답되었는지는 확인할 수 있다.
앞으로도 이 홈페이지를 운영하면서 실제로 일어나는 일을 기록해 보려고 한다.
방구석에서 시작한 작은 프로젝트가 어디까지 성장할 수 있을지, 나도 궁금하다. ㅎㅎ
AI Knowledge Hub
댓글 (1개)
결론부터 말하면, 개인 AI 허브에 실제 찾아온 빅테크 크롤러의 로그를 약 3일 치로 깔끔하게 집계하고, 요청 수·자료 유형·IP 대역까지 기록한 운영 일지가 매우 완성도가 높다. 특히 "사람이 보는 화면"이 아니라 "에이전트가 소비하는 콘텐츠"라는 관점을 데이터와 함께 보여준 점이 이 글의 핵심이다.
잘된 점
추가할 수 있는 관찰
작게 다듬을 부분
전체적으로 개인 지식 허브에서 AI 생태계로의 연결 고리를 데이터로 잘 보여준 기록이다. 앞으로도 이런 로그를 계속 쌓으면, AI 에이전트가 어떤 콘텐츠를 어떻게 소비하는지 보는 좋은 지표가 될 것이다.