Чи бачать ChatGPT і Perplexity ваш сайт: перевірка на пʼять хвилин
3 хв читанняAI-пошукSEOШІ
Google індексує вас роками, а AI-асистенти відповідають за конкурентів - бо їхнього краулера ви заблокували, самі того не помітивши.
Google індексує сайт роками, і власники звикли, що з видимістю для пошукача все гаразд. Але коли клієнт питає в ChatGPT про вашу послугу, а той відповідає назвою конкурента, - причина рідко в контенті. Найчастіше причина в тому, що бота, який мав прочитати вашу сторінку, заблоковано в robots.txt, і про це ніхто не знав.
Хто саме приходить, і як його звати
- GPTBot - краулер OpenAI, тексти, з яких ChatGPT формує відповіді.
- PerplexityBot - Perplexity, відповідає з посиланнями на джерела й приводить реальні переходи.
- ClaudeBot і anthropic-ai - Anthropic, два різні user-agent для однієї компанії.
- Google-Extended - окремий агент саме для Gemini й AI Overviews. Звичайний Googlebot індексує вас так само, як завжди, навіть коли цей заблокований - тому проблему не видно в Search Console.
Найдорожча помилка: заблокувати бота, самому того не бажаючи
Робиться це не навмисно. Плагін безпеки за замовчуванням блокує «невідомих ботів» як функцію захисту. Стара інструкція з інтернету радить закрити все, крім Googlebot, «щоб не крали контент». robots.txt, написаний три роки тому, просто не знав, що GPTBot узагалі існуватиме.
User-agent: *
Allow: /
User-agent: GPTBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: anthropic-ai
Allow: /
User-agent: Google-Extended
Allow: /
Sitemap: https://example.com/sitemap.xmlllms.txt - нова домовленість, а не стандарт
Короткий файл у корені сайту, що пояснює моделі простими словами, чим ви займаєтеся й де головні сторінки, - щоб асистент цитував правильну сторінку, а не вгадував за навігацією й футером. Це ще не стандарт, як robots.txt, а домовленість, яку частина великих гравців уже підтримує. Поки що це перевага саме тих, хто зробив це першим.
На нашому сайті /llms.txt - не статичний файл, а маршрут, який будується з того самого списку статей, що й блог і карта сайту. Це означає, що файл не може застаріти сам по собі: він оновлюється тим, що виходить нова стаття, а не тим, що хтось про нього згадав.
Розмітка вирішує, чи процитують саме вас
Дозволити бота - половина справи. Друга половина - дати йому щось однозначне для цитування замість здогадок.
- Schema.org Organization - назва, адреса, контакти в машиночитному вигляді. Без цього AI переказує сторінку своїми словами і помиляється в деталях.
- FAQPage - питання й відповідь уже розділені за вас, найпряміший шлях у готову відповідь ChatGPT чи Google AI Overviews.
- Дати публікації - AI-пошук сильно віддає перевагу свіжому; без datePublished сторінка виглядає невідомо коли написаною і програє новішій.
- Автор - один із сигналів довіри, за яким модель обирає, кого цитувати. Анонімний текст цитують останнім.
- Списки й підзаголовки - модель витягує відповіді шматками по кілька речень. Суцільний текст без структури розбирається погано.
Пастка для сайтів на React чи Vue: контент, якого ще немає
Коли сторінку збирає JavaScript у браузері, HTML, який фактично віддає сервер, - майже порожній. Google зазвичай дочекається виконання скриптів і побачить готову сторінку. ChatGPT, Perplexity й більшість AI-краулерів скрипти не виконують - вони бачать ту саму порожню розмітку, яку віддав сервер, і все.
Виправлення - серверний рендеринг або пререндер для сторінок, які мають цитуватися. Це саме та причина, з якої контент цього сайту не збирається клієнтським JavaScript.
Жодного з цих пунктів не видно, дивлячись на сайт у браузері, - усе відбувається в текстовому файлі, який ніхто не відкриває, і в розмітці, яку ніхто не бачить. Саме тому це один із найдешевших способів отримати перевагу: не через новий контент, а через те, щоб уже написаний контент нарешті дійшов до того, хто питає.
