구글 SEO
robots.txt
robots.txt 다른 표기: 로봇 텍스트, 로봇스
robots.txt는 검색엔진 크롤러에게 수집해도 되는 영역과 피해야 할 영역을 알려주는 텍스트 파일입니다. 사이트 최상위에 두면 크롤러가 접속 전에 먼저 읽습니다.
- robots.txt를 쓰는 방법과 파일을 두는 자리
- Disallow로 막아도 검색결과에 남을 수 있는 이유
- 지금 내 사이트의 robots.txt를 확인하는 방법
robots.txt는 어디에서 쓰이나요?
크롤러가 사이트에 들어오기 전 가장 먼저 읽는 파일입니다. 수집하지 않아도 되는 영역을 알려줄 때 씁니다.
- 관리자 페이지처럼 검색에 나올 필요가 없는 경로를 뺄 때
- 사이트 내부 검색 결과가 잔뜩 수집되는 것을 줄일 때
- 사이트맵 위치를 크롤러에 알려줄 때
robots.txt는 어떻게 작성하나요?
텍스트 파일 한 장에 대상 크롤러와 경로 규칙을 줄 단위로 적습니다.
User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Sitemap: https://example.com/sitemap.xml
지킬 규칙은 네 가지입니다.
- 파일 이름은 robots.txt 로 고정이고, 자리는 도메인 최상위입니다
- 하위 도메인은 각자 자기 파일을 따로 둡니다
- 구글은 파일 앞부분 500KB까지만 읽습니다
- 규칙을 고쳐도 크롤러가 파일을 다시 읽을 때 반영됩니다
robots.txt가 왜 중요한가요?
한 줄이 사이트 전체를 막을 수 있습니다. Disallow: / 한 줄이면 모든 경로가 차단됩니다.
반대로 이 파일은 페이지를 검색결과에서 숨기는 수단이 아닙니다. 다른 사이트에서 링크된 주소는 막아도 색인될 수 있습니다(구글 검색 센터).
robots.txt라는 규칙은 왜 생겼나요?
크롤러가 서버에 주는 부담을 사이트 쪽에서 조절할 방법이 필요했기 때문입니다. 강제할 수 있는 규칙이 아니라 크롤러가 자율로 따르는 합의입니다.
내 상황에 적용하려면?
주소창에 도메인 뒤 /robots.txt 를 붙이면 지금 파일이 그대로 보입니다.
- 도메인 최상위 주소에서 파일이 열리는지 확인했습니다
- Disallow 경로에 오타나 불필요한 슬래시가 없는지 봤습니다
- 검색에서 빼고 싶은 페이지는 noindex로 따로 처리했습니다
- 사이트맵 주소 한 줄을 넣어 뒀습니다
robots.txt에 대한 흔한 오해는 무엇인가요?
| 오해 | 실제 |
|---|---|
| Disallow로 막으면 검색결과에서 사라집니다 | 링크된 주소는 막아도 색인될 수 있어 noindex나 비밀번호가 필요합니다 |
| 모든 크롤러가 규칙을 반드시 지킵니다 | 강제력이 없어 악성 수집기는 무시할 수 있습니다 |
| robots.txt로 막으면 서버 부담이 늘 줄어듭니다 | 이미 색인된 주소는 계속 노출될 수 있어 원인부터 확인해야 합니다 |
이 파일이 조절하는 단계는 크롤링, 규칙을 따르는 프로그램은 구글봇 항목에서 다룹니다.
자주 묻는 질문
robots.txt로 페이지를 완전히 숨길 수 있나요?
숨길 수 없습니다. 링크된 주소는 막아도 색인될 수 있어 noindex 태그나 비밀번호 보호를 함께 써야 합니다.
파일은 어디에 둬야 하나요?
도메인 최상위입니다. example.com/robots.txt 주소로 열려야 정상입니다.
사이트맵 주소를 꼭 넣어야 하나요?
필수는 아닙니다. 넣어 두면 크롤러가 구조를 더 빨리 파악합니다.
참고 자료
이 페이지가 도움이 되었나요?
10초면 됩니다 · 남겨주신 의견은 다음 개정에 반영됩니다