Блог · SEO

Що таке robot.txt?

Коли працює над технічним SEO, перше, що перевірити і оптимізувати – файл robots.txt. Цей текстовий файл є невід'ємною частиною практично будь-якого сайту і, як ви можете здогадатися від його імені, він призначений для роботи. По-перше, для…

~4 хв читання SEO

Що таке robot.txt?

Коли працює над технічним SEO, перше, що перевірити і оптимізувати – файл robots.txt. Цей текстовий файл є невід’ємною частиною практично будь-якого сайту і, як ви можете здогадатися від його імені, він призначений для роботи. По-перше, для пошукових систем боти.


Де знаходиться файл robots.txt?

Відкрийте файл robots.txt, щоб дізнатися легко. Щоб зробити це, потрібно ввести домен сайту в адресному рядку браузера і через slash ім’я файлу. Відповідь: “mysite.ua/robots.txt” Це означає, що цей файл повинен бути розташований в кореневому каталозі сайту, який є загальноприйнятим стандартом.

Цей файл не може бути фізично присутнім на сервері. Популярні CMS часто генерують наліт динамічно, що дуже зручно. Тому, якщо ви не знайдете файл в кореневому каталозі сайту, це нічого не говорить. Найголовніше, щоб відкрити його за посиланням.

Чому потрібно robots.txt?

Файл robots.txt відомий як стандарт винятку роботи. Коли пошуковий двигун відвідує веб-сайт, він фактично є першим файлом, який буде виглядати в інструкції. Тут власник сайту може вказати, які сторінки або навіть всі розділи проекту повинні бути зняті і які не повинні. Таким чином, це одна з можливостей управління пошуковими системами, яка цікава сама по собі.
На першому погляді може здатися дивним, що є необхідність заборонити роботів з індексуванням щось на сайті. Після того, як одна з цілей просування SEO полягає в тому, щоб забезпечити протилежність – забезпечити ефективне зведення і індексування сайту. Але це не так просто. Прохідне сканування сторінок дозволяє в чотирьох випадках.

Що таке robot.txt? SEO-Studio 1121 1

У районі району. Видання записів

На будь-якому веб-сайті розміщено декілька сторінок. І не всі вони містять цінний зміст – деякі сторінки завжди чисто технічні і не представляють інтерес до відвідувачів. Скоріше, якщо технічні сторінки роблять його в індекс і з яких причин почати з’являтися в пошуку, це може бути вимкнено.

Ця сторінка може бути зареєстрованою і реєстраційною сторінкою або подякою для вашої покупки. Якщо такі сторінки брали участь у результатах пошуку. Це один з цілей robots.txt файл. Тут Ви можете перерахувати всі технічні сторінки, на які не бажано доступ до пошукової системи.

2. Покращити індексацію сайту, використовуючи оптимальне використання ліміту

Друга можливість пов’язана з індексуванням лімітів. У зв’язку з тим, що пошукові системи повинні обробляти величезну кількість інформації, є необхідність збереження обчислювальних ресурсів. І для оптимізації процесу вводяться обмеження в алгоритми. Деякі пошукові системи мають більше цих обмежень, інші мають менше, але вони роблять. 

Основна сутність індексних лімітів полягає в тому, що пошуковий бот переглядає обмежену кількість сторінок одночасно. Якщо сайт великий, то він не може потрапити до певного змісту. Не кажучи вже про своєчасні оновлення та реіндукування.
Файл robots.txt допомагає боротися з лімітами. Якщо Ви заборонені роботи індексувати все зайве, весь ліміт буде витрачений з максимальною користю. В результаті поліпшиться дроблення і індексація сайту. Дуже важливо.

3. Проібіт індексування дублікатів вмісту

Приблизний контент на сайті практично завжди є помилкою. Можливо, помилка була виконана в дизайні архітектури сайту, або є значним недоліком в структурі URL. Іноді дублікування вмісту з’являється в результаті інших недоліків. 
Виняток лише при необхідності дублювання вмісту. Наприклад, сайт є масштабним випробуванням версій сторінок з однаковим змістом, але різним дизайном і іншим чином не вдалося зробити. У будь-якому випадку, ви повинні явно вказувати на пошуковий двигун наявність дублікатів і заборонити їх індексацію.

Що таке robot.txt? SEO-Studio robot txt guide seo1

Незважаючи на те, що ця ситуація повинна бути адресована принципово і радикально, іноді вона не боляче додавати дублікати контенту до винятків для пошукових систем. Все залежить від ситуації, зокрема, де, як і на якому етапі дублікати з’являються на сайті. Якщо Ви можете створити короткі інструкції для пошукових систем в robots.txt, то це необхідно зробити.

При цьому, на сервері, на який ви можете звернути увагу:

Більше пошукових ставок, ніж ви думаєте. Більш того, крім десятків різних пошукових систем, існують різні системи з різним призначенням. Крім того, деякі боти можуть просто збирати інформацію про продаж у великих корпораціях.

Цікаво, багато з цих ботів також слідувати інструкціям, написаним у файлі robots.txt. Таким чином, на сервері можна заборонити ці боти від сканування сайту, і це може означати виділення деяких ресурсів на сервері.
До речі, іноді варто «розаблювати» і боти деяких пошукових систем, які не в пріоритеті, не дають трафіку і не розглядаються як перспективні.

Чи варто це зробити або не залежить від ситуації. Системи аналітики дозволяють перевірити статистику відвідувань сайту за допомогою ботів. І якщо ви дізнаєтесь, що сайт постійно бомбардував боти, які вам не потрібно, ви можете спробувати нейтралізувати їх за допомогою robots.txt.

Як працює robots.txt

Зміст файлу суворо стандартизовано, і помилка може призвести до суттєвих проблем. На щастя, інструкції мають простий і зрозумілий синтаксис у ключі: формат значення. Наприклад, robots.txt може написати наступне:

Користувач-агент: *
Витрата: /

Ось два інструкції. Кожна інструкція починається з нової лінії. У першому рядку ключ «Користувач-агент» означає назву бота, до якого необхідно застосувати інструкції. Українська Русский English У цьому випадку є символ зірочки, який символізує всі роботи без винятку.

У другому рядку ключ «Disallow» не означає сканування. Слайс символізує всі каталоги сайту. Відповідно, він говорить, що всі боти без винятку заборонені відкрити і індексувати все на сайті.

Що пам’ятати

В інструкції в файлі robots.txt сьогодні є більше рекомендацій для пошукових систем. Це не строгі інструкції, які необхідно дотримуватися. Тому ви не повинні покладатися тільки на robots.txt. Ви можете використовувати, і практично всі пошукові системи, один спосіб або інший, враховуючи інструкції в цьому файлі. Але в той же час, якщо виникають проблеми з індексуванням, варто знайти більш серйозний підхід до вирішення проблеми.