크롤러 안내
aide 는 이용자가 직접 입력한 주소를 진단할 때만 그 사이트에 접속합니다. 목록을 만들어 웹 전체를 돌아다니지 않습니다.
식별 문자열
| User-Agent | aide-bot/1.0 (+https://aide.io.kr/bot) |
|---|---|
| robots.txt 토큰 | aide-bot |
무엇을 읽나요
/robots.txt·/sitemap.xml·/llms.txt- 메타 태그(title · description · canonical · Open Graph)와 제목 위계, 내부 링크 구조
- 공개된 HTML 본문. 로그인·결제 뒤의 화면에는 접근하지 않습니다.
- 없는 주소에 404 를 제대로 돌려주는지 보려고, 진단 1건마다 존재하지 않는 것이 확실한 주소를 1회 요청합니다. 진단한 주소 아래의
/aide-404-check-…형태이며, 사이트마다 값이 고정이라 다시 진단해도 같은 주소를 씁니다. 이 요청도 robots.txt 를 먼저 확인한 뒤에만 보냅니다.
읽은 내용은 그 진단의 관측 기록으로만 씁니다. 제3자에게 팔거나 모델 학습 데이터로 넘기지 않습니다.
요청 규모
| 항목 | 상한 |
|---|---|
| 한 진단에서 여는 페이지 수 | 최대 20개 |
| 페이지 1개 응답 대기 | 10초 |
| 진단 1건 전체 수집 시간 | 20초 |
| 페이지 1개당 내려받는 크기 | 최대 1MB |
운영 환경 설정에 따라 상한은 더 낮아질 수 있습니다. 위 값이 최대치입니다.
robots.txt 를 지킵니다
수집 전에 /robots.txt 를 먼저 읽고 규칙을 따릅니다. 매칭은 구글 관행과 같습니다 — 가장 긴 경로 패턴이 이기고, 길이가 같으면 Allow 가 이깁니다. 우리를 지목한 그룹이 하나도 없을 때만 * 그룹을 적용합니다.
차단하는 방법
사이트의 robots.txt 에 아래 두 줄을 넣으면 됩니다.
User-agent: aide-bot
Disallow: /일부 경로만 막으려면 Disallow: /admin/ 처럼 경로를 적으면 됩니다. 차단이 걸리면 그 항목은 점수를 추정하지 않고 「보류」로 남습니다 — 못 본 것을 본 것처럼 채우지 않습니다.
서버 단에서 막고 싶다면 User-Agent 에 aide-bot 이 포함된 요청을 거부하세요.
문의
예상치 못한 요청을 발견하셨다면 접속 시각과 로그를 담아 hello@aide.io.kr 로 알려 주세요. 확인 후 바로 조치합니다.